自适应循环机制优化Gemma3:语言降23%+数学推理超96%

不用额外训练、不调整模型权重,就能让大模型获得性能提升?研究团队提出的Recirculation技术,通过改变Transformer内部的信息传播路径,解锁了新的性能空间。
标准的Transformer采用前馈式的结构,token的状态会沿着网络深度逐层更新。但很多时候,关键的语义消歧和状态更新要到较深的网络层才会稳定完成,而前馈结构让浅层计算无法重新读取这些后期形成的信息,后续的token也就很难持续利用深层已经更新完毕的状态。比如在包含“fishing pole”的上下文里,模型在深层可以正确将“bank”理解为“河岸”,但当后续提到“ATM”时,又可能重新被“bank”与金融机构的关联所干扰,出现语义混淆。
此前有相关研究尝试过将已经完成消歧的深层表示重新注入浅层,这类上下文化错误随之减少约60%,这也证明了回流深层状态对提升语义理解能力的有效性。
除了前馈结构的限制之外,另一种延长计算过程的方式是思维链(CoT),它可以把中间结果显式写入token序列,从而增加额外的串行计算步骤,但这种方式更适合复杂推理场景。而Recirculation关注的则是内部状态本身如何在后续token的处理中持续更新,不需要额外修改token序列。
针对这个长期存在的结构限制,研究团队提出了Recirculation机制,核心思路是在推理阶段为模型打通一条深浅层之间的信息回路,让已经在深层形成的状态可以重新回流到浅层,参与后续的计算。这套方案完全不需要修改已经训练好的模型权重,基础版本就能直接作用于现成的大模型。
基础的Recirculation流程并不复杂:当模型处理当前token时,会从选定的深层源层读取激活结果,再和浅层目标层的原有状态进行混合。其中参数α控制深层状态的回流强度,β则控制目标层原有状态的保留比例,研究团队默认采用凸组合的方式,即β=1-α。同时,由于不同网络层的残差流尺度存在差异,直接相加可能会导致某一侧的信息占据主导,因此源层的激活需要先对齐到目标层的L2范数后再进行融合。
在Gemma3模型上,不同规模的版本找到了各自的最优源层到目标层的组合:1B版本为11→4,4B版本为18→9,12B版本为35→16。这种设计和常见的Looping层循环不同,Looping主要是在网络深度方向重复执行若干层,而Recirculation同时跨越了网络深度和token时间维度,让同一网络层可以持续承载更新后的状态。如果不断重复回流步骤,整个系统还会逐渐呈现出循环神经网络的特征。不过当前的主体实验只采用了一次回流操作。
研究团队在Gemma3的1B、4B、12B三个版本上测试了10个数据集,Recirculation在其中9个数据集上都实现了跨规模的稳定性能提升。以12B版本为例,PG19数据集的困惑度下降了35.40%,BookSum下降32.91%,GovReport下降30.74%,仅Lambada数据集没有出现明显改善。
除了Gemma3之外,团队还测试了Qwen3 1.7B、Pythia 1B、Ministral3 3B和Phi2 2.7B等多个模型家族,都观察到了有效的源层-目标层回流组合。其中Gemma3的性能提升大约在5%左右,其他模型在没有针对各自架构重新优化归一化和回流强度的情况下,提升幅度低于0.5%。
研究团队还追踪了单次回流操作对后续token的影响,发现性能收益会随着token间距的增加逐渐衰减,但即使相隔256个token,依然可以检测到明显的提升。不同词性的token受益程度也存在明显差异:副词、形容词和动词的提升较为显著,而数词、限定词和代词的提升相对有限。
在指令遵循任务中,Gemma3 4B的准确率从82.3%提升到了87.3%,12B版本则从93.0%提升到98.4%。不过在标准的单token任务中,整体仅实现了小幅改善,部分上下文化测试的设置也没有获得明显收益。从工程实现的角度来看,自回归生成阶段可以并行执行两套Transformer计算,额外的生成延迟几乎可以忽略;但Prefill阶段需要按token顺序更新回流状态,在长上下文场景下会明显拖慢处理速度。
基础的Recirculation采用固定的α和β参数,对所有token和隐藏维度使用统一的控制策略,但实际上不同的token和不同的状态需要融合深层信息的程度并不相同。因此研究团队进一步训练了一个小型MLP模块,根据当前token在源层和目标层的表示,动态生成逐维的回流系数。
在这套方案中,Gemma3的主体权重始终保持冻结状态,仅训练控制回流方式的小型模块。实验对比了固定系数、可学习标量、token条件标量、固定向量、token条件向量以及全量微调等多种方案,结果显示逐维控制的效果优于标量控制,而根据当前token动态生成系数的方案,又比固定参数的效果更好。
最终的Adaptive Recirculation在9个语言建模数据集上实现了平均23.0%的困惑度降幅,而基础的Recirculation版本平均降幅为8.5%,即便是对Gemma3 1B进行全量微调,其降幅也仅为21.6%,自适应回流方案的表现甚至超过了全量微调。
在数学推理任务GSM8K上,Adaptive Recirculation同样实现了性能提升:Gemma3 4B的pass@1从基础模型的29.3%提升至35.5%,相对提升约21%;pass@128则从94.9%提升至96.0%。不过研究团队也提到,Adaptive Recirculation的效果依赖用于训练MLP控制器的数据分布,在不同任务数据上训练可能会导致收益出现变化。
Recirculation技术的价值并不只是降低语言模型的困惑度,更重要的是在已经被广泛应用的Transformer结构中,重新探索了信息流动的方式。它目前还不是可以直接替代全量微调的通用方案,但证明了一个重要的可能性:在冻结模型权重的前提下,仅通过改变内部的状态传播方式,同样可以释放出大模型的新性能空间。
相关论文:Recirculation

