文章摘要
过去两年大模型虽带来人机协作新想象,但当下很多能力依赖人为框架,能力上限受限。研究提出“启发学习”,并集成到推理侧形成Isaac框架。其闭环含四步骤,有Prompt注入和网络层注入两种注入路径。经四基准评测,接入Isaac后大模型在多任务上有显著增益,表明推理侧复用经验可提升性能,启发学习有望推动大模型自我进化。

过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。

人类先定流程、写工具脚本、建知识库;参数继续变大,工具链继续变厚。各类框架、调用工具轮番上场,把临时判断固化成可调用的工作流。这套做法有效,也撑起了眼下的繁荣。

问题在于,能力上限往往卡在脚手架上。换场景就要重写流程,换工具就要重排提示和权限。系统看起来更能干,知识却越来越多地挂在流程外面。另一条路更接近人类怎么学:复盘成败,把结构相近的问题连起来,把一次有效推理留到下次还能用。

现在主流方案多停在接口与检索,很少把 “经验怎么复用” 写进推理本身。外挂和算力人人都能堆,更难的是,让模型在新问题上自己调用旧经验。我们把这条路线命名为 “启发学习(Inspirational Learning)”,并把它集成到推理侧,取名 Isaac(源自牛顿的名字,寓意 “站在巨人肩膀上”)。

人类智慧如何进化:从旧经验里 “启发” 出新知识

近现代科学史里,重大突破很少从零开始。例如,库仑受牛顿万有引力思维模式启发,提出库仑定律;霍兰德把达尔文自然选择的逻辑迁移到计算机领域,遗传算法随之出现。最常见的路径,是把已知结构搬到新领域:类比、迁移、再重组。

启发学习:认知的进化飞轮

启发学习的闭环包含四个核心步骤:类比检索、逻辑重组、内生注入与经验沉淀。面对新领域、新问题,检索聚焦的不是字面相似的文本,而是经验库里其它领域解答过的类似问题的思路;注入阶段把这些思路整理后合并进当前输入;沉淀阶段再把新题的思维链抽象成可复用条目,写回经验库。

Isaac框架不修改基座模型的权重,也不需要重新训练,只在推理时注入跨领域经验。模型还是原来的模型,但解题时旁边多了一批 “结构相近的旧题” 来做指导、做参考。

技术底座:Prompt 注入与网络层注入

要把启发学习跑起来,需要解决经验如何输入模型的问题,我们设计了两种注入路径:

第一种是Prompt 注入(DIN-Retrieval,简称DIN):保持基座参数完全冻结,将检索到的跨领域示范样本写入上下文,让模型在给定示范的前提下完成推理。当源域有标注数据、目标域无标注时,先对隐状态做 token 均值,再按源、目标联合分布算神经元级 z-score;两侧激活极性一致、且超过阈值的维度,称为域不变神经元(必要时只保留幅度最大的前 K 维)。只用这些维度构造向量,在子空间里用余弦相似度找源域示范,并用 MMR 去掉太像的重复样本。示范与目标查询拼成提示后送进冻结基座。这样一来,跨域检索不再只靠文本嵌入是否相近,而是看域更稳的子空间里结构是否对齐。

第二种是网络层注入(思维链引导的域适配,CoDA):仅把示范塞进提示,有时不够:源域和目标域差得大,共享推理模式仍难复用。做法是把冻结大模型按层拆开,前面抽特征、后面生成,中间插适配器,残差调制隐状态(增强态 = 原隐状态 + 适配器输出)。源域用 “问题 + 思维链” 得到教师隐状态;源域与目标域的原输入经适配器后得到学生增强态。训练两项损失一起优化:均方误差让源域增强态靠近教师态,MMD 对齐源、目标增强态分布。推理时基座仍冻结,只对目标输入过适配器,也不需要目标域思维链标注。和纯检索式上下文学习相比,这一步把迁移做到了中间表征上。

两种方案可以独立使用,也可以先检索再适配,具体可以根据是否能训练中间模块、是否能读取隐状态来选择。Isaac将它们集成在推理侧,依靠Prompt注入和(或)网络层注入复用旧经验。

评测基准:编程、推理、科学问答与科研编码

我们选用了四个公开热门基准,全方位评价启发学习的解题能力,特别是解难题的能力:

  • HumanEval:测试函数级代码生成能力,按函数签名与说明补全 Python,用单元测试判对错。
  • StrategyQA:测试隐式多跳推理能力,题目为是非题但不给出推理步骤,模型需自行补全逻辑链条。
  • ScienceQA:测试科学问答能力,题目来自中小学科学课,多为带配图的选择题。
  • SciCode:测试科研编程能力,题目拆自真实科研流程,需将领域知识写成可运行的代码。

我们选取各任务的典型示例方便对照:

HumanEval示例:实现 intersection (interval1, interval2):判断两闭区间交集长度是否为素数,返回 “YES” / “NO”。例如 intersection ((-1, 1), (0, 4)) 应返回 “NO”。

StrategyQA示例:Does citrus grow well in places with 24-hour days in the summer?(答案:no),模型需自行推导极昼地区的气候与光照是否适合柑橘生长。

ScienceQA示例:Which better describes the Daintree rain forest ecosystem? 为配图选择题,正确答案为“全年温暖、生物多样”,需结合图像与选项判断。

SciCode示例:实现共轭梯度法 cg (A, b, x, tol),求解对称正定线性系统 Ax = b,输出需通过数值测试。

实验效果:标准基准上的增益

我们对比了主流大模型的零样本接口与接入 Isaac 后的表现:HumanEval 上,Claude 达到 100.0%(公开榜首约 95.1%);StrategyQA 上,Qwen3-8B 达到 82.3%,接近公开最优水平;ScienceQA 上,Doubao 达到 98.0%(公开榜首约 91.3%);SciCode 等科研编程任务上,多家模型也有稳定正向增益。

按模型看,增益并不均匀。同一套接入方式下,较弱模型的绝对提升往往更大:StrategyQA 上 Grok-4.5 提高 13.5 个百分点,ScienceQA 上 Gemma-4-31B 提高 12.7 个百分点,HumanEval 上 14B 级模型提高 8.5 个百分点;更强的模型仍可能继续抬高上限。

以上实验数据说明,大模型提质不见得只靠预训练或后训练侧的参数扩容。在推理侧复用跨域经验,也能大幅提高任务性能,是一条与堆参数、堆算力并行的路线,也是一条可单独检验的路线。

从会补证据,到会复盘、会举一反三

启发学习想解决的,不是再给模型多接一个工具,而是让它在新题上复用旧经验。现有多个基准上,这条路带来了跨模型、跨任务的大幅增益,我们相信,该方法可以在更广泛的任务上普适和泛化。

外挂和算力还会继续加,与此同时,更值得做的是把复盘和举一反三做成稳定能力,将大模型的认知从外化迁移到内生,让模型激活自身的学习能力,实现真正的自我进化,这也是我们认为启发学习能为整个 AI 行业做出的贡献。

以上内容不代表本平台立场,仅供读者参考