大模型循环计算:突破Transformer深度局限的新路径

大模型的推理效率一直是行业关注的重点,围绕如何让模型根据任务难度灵活分配计算资源,研究者探索出了两条不同的路径。
标准Transformer的网络深度固定,每次生成Token只能走一遍固定层数的网络,面对复杂任务时计算量不足。为了弥补这个缺陷,研究者提出让模型通过生成更多Token来增加计算轮次:先生成一个中间结果,再带着完整上下文进入下一轮计算,输出的长度越长,模型调用网络的次数越多,也就有更多时间拆解问题、验证答案。这种方式让固定深度的Transformer可以灵活适配不同难度的任务,简单问题快速生成,复杂问题则通过多轮计算加深推理过程,但这种模式也有天生的局限:模型的内部隐状态是高维连续的,必须通过生成可输出的Token来串联每一轮计算,哪怕有些中间步骤不需要对外展示,模型也必须先生成内容才能继续推进,这就催生了另一种更直接的思路。
隐空间的循环探索
循环模型的核心思路很简单,既然单次前向传播的计算深度不足,那就让模型回到指定的网络层再次执行计算,每一轮循环都会更新隐状态,全程复用同一组网络参数。这类模型比如Universal Transformer、Deep Equilibrium Model以及近年的循环Transformer,都在尝试让模型自主决定循环的轮次,根据任务难度调整计算深度。
早期的循环模型研究曾带来希望,2025年的一项研究将循环深度模型扩展到35亿参数,用8000亿Token进行训练,测试时增加循环轮次,部分推理任务的表现持续提升,最多可以达到相当于500亿参数模型单次前向传播的计算量。相关研究论文链接:https://arxiv.org/abs/2502.05171
但很快研究者发现,循环轮次并非越多越好,2025年发布的Ouro循环语言模型,早期尝试8轮循环训练时出现了明显的损失尖峰和梯度振荡,随后将训练阶段的循环深度降到4轮,即便在测试阶段将循环次数增加到8轮,额外的计算也没有带来更好的推理效果。比如1.4B参数的Ouro-Thinking在AIME 2024的成绩从第一轮的0分逐步上升到第四轮的65分,第八轮反而掉到了38.67分,多出来的循环轮次反而干扰了正确的推理结果。
当前的核心挑战
目前循环模型的发展还面临三道核心难关。第一,理论层面,共享同一组参数、循环更新隐状态的模式,是否足以表达复杂的计算过程;第二,模型能否真正学会这种循环计算的逻辑;第三,训练完成后,模型在推理阶段能否稳定地持续循环计算而不出现偏差。
目前第一点已经有不少乐观的研究结果,更多的挑战集中在后两点。反复循环会带来误差累积的问题,即使隐状态看起来保持稳定,实际的推理结果也可能出现偏差。2026年的Parcae研究就发现,基础的循环语言模型容易出现残差爆炸和损失突然上升的问题,通过重新设计循环过程中的稳定机制,模型的验证集困惑度最多降低了6.3%,在扩展到13亿参数时,在固定参数量和数据量的情况下超过了传统Transformer的基线。相关研究论文链接:https://arxiv.org/abs/2604.12946
经过多年的打磨,标准Transformer已经形成了一套成熟的训练方案,包括残差连接、归一化、初始化方法、学习率策略和优化器等,开发者可以快速上手并获得稳定的效果。而大规模循环语言模型的训练配方还远未成熟,如何搭配架构、优化器、损失函数和中间监督,还需要更多的探索和优化,才能让这种更直接的推理模式真正发挥潜力。
更多行业分析可参考:https://blog.tilderesearch.com/blog/one-layer-deeper

