文章摘要
GPT-6 Astra被曝出采用未公开的循环深度核心技术,有研究者对该循环Transformer技术做深度解析,梳理了该技术从2018年至今的发展脉络,拆解其原理:通过复用Transformer模块提升等效模型深度、节省参数,明确其核心价值是增强推理能力,优势需在大模型体现,还梳理了该技术引发的Astra推理可监控性下降争议的不同观点。

在GPT-6 Astra正式发布的前两天,有行业报道披露,某知名AI研发团队为这款模型引入了一项未公开的核心技术:循环深度(recurrent depth)。有行业研究者在模型发布后撰写了一篇深度解析文章,完整拆解了这项技术的原理、实际成本与发展脉络,不仅讲透了循环Transformer的核心逻辑,还梳理了相关研究的完整谱系。

循环Transformer的核心原理

简单来说,循环深度技术的核心是让同一组Transformer模块重复执行多次,而非通过堆叠更多的模块来提升模型深度。比如某开源模型Nanbeige4.2-3B,仅包含22个Transformer模块,通过让输入数据循环通过这22个模块两次,整体等效于44层的Transformer模型,但权重参数仅保留22组,大幅节省了存储成本。第23次模块调用会复用第1个模块的权重,第24次复用第2个模块的权重,以此类推。

这项技术的成本账需要仔细核算:参数总量确实节省了约一半,以Nanbeige4.2-3B为例,嵌入层和输出层占了总参数的约25%,剩余的75%参数中,循环复用直接减少了一半的权重开销。不过另外两部分成本并没有减少:前向传播和反向传播的计算量与标准44层模型基本相当,KV缓存的占用空间也没有明显变化——因为两次循环中同一模块的中间状态并不相同,尝试跨循环共享KV缓存会导致性能明显下降,因此最终版本只能使用独立缓存。

如果只是先训练标准44层模型再通过循环压缩,效果反而不如直接从零开始训练循环架构。从成本收益来看,循环次数设置为2次时性价比最高,超过3次后收益会逐渐递减,同时训练过程也会变得不稳定。因此循环深度并非“免费加深”,更像是用一半的权重预算,换取了完整深度的计算能力。

灵活可调的循环机制

循环次数并非固定值,而是可以根据需求调整的灵活参数,这一技术思路的起源比很多人想象的更早。2018年提出的Universal Transformer就设计了自适应停止机制,通过一个小型可训练函数为每个token输出停止概率,当累积概率超过阈值时就停止循环,让不同的token经历不同次数的计算,本质上是按token分配算力。

某科技厂商推出的Ouro-Thinking 2.6B模型将这一思路推向极致,使用48个模块循环4次,等效192次模块调用,并搭配学习得到的出口门控。不过该研究者也指出了一个细节:该模型的开源实现实际上是先完成全部4次循环再选择出口,循环次数并未真正实现动态调整。

2025年提出的Mixture-of-Recursions(MoR)则进一步将循环决策交给了路由模块:通过一个小型学习路由器根据每个token的隐状态和上下文,决定该token需要经过几次循环模块。目前主要有两种路由方式:一种是每一步选择需要继续循环的token,另一种是在初始阶段为每个token分配1到3次的循环路径。

MoR的实验还给出了一个重要结论:在参数规模较小的模型(比如135M)上,标准Transformer的表现反而更好,如果仅关注小模型可能会得出循环技术无用的错误结论;只有当模型规模足够大时,循环架构才能追平甚至超越标准模型,尤其是在训练预算有限的情况下,这也说明循环架构的优势需要在大规模模型上才能体现。

循环带来的真正价值:推理而非存储

很多人最初认为循环技术只是为了节省参数,但后续的研究证明它带来了更核心的价值:增强模型的推理能力。2025年6月的一项研究将模型的记忆能力和推理能力分开测试:在固定参数总量的情况下,循环技术几乎不会提升模型存储和检索知识的能力,知识容量仅与独立参数数量相关;但在推理任务中,复用模块可以在不增加任何参数的前提下,提升多步数学问题的解决能力。这一对比清晰地说明:循环技术本质上是一种计算增强机制,而非存储增强机制,它带来的是思考所需的算力提升,而非知识存储容量的增加。

2026年9月的SMELT研究则在54B非嵌入参数的规模上验证了循环技术的价值:该研究使用MoE架构,让一半的模块重复执行两次,然后通过三个调整来平衡整体算力:缩小隐藏维度抵消额外的计算量、增加专家数量以保持总参数规模不变、调整注意力头配置以保证KV缓存大小与标准模型相当。通过拟合缩放曲线后发现,要达到相同的验证损失,循环架构所需的训练算力比标准架构少6.8%到18%,也就是说,在同等算力预算下,使用循环架构可以获得更好的模型效果。

此外,Geiping等人提出的“潜在推理”模型也值得关注:该模型参数规模为3.5B,使用800B token进行训练,将4个共享模块夹在2个初始模块和2个最终模块之间,每一轮循环都会将初始模块的输出与上一轮的隐状态拼接,经过线性投影后送入共享模块。推理时可以设置固定的循环次数(如8、32、64次),也可以通过相邻两轮输出分布的KL散度低于阈值来实现自适应停止。不同任务的收益存在差异:常识类任务如HellaSwag在8次循环后就达到性能饱和,而GSM8K和HumanEval这类多步推理任务则能从更多的循环次数中获得明显提升。

关于隐藏思维链的争议

回到最初关于Astra的技术爆料,有一个争议点:循环深度让模型的推理过程更难被监控。首先来看Astra本身,它仍然属于推理模型,训练范式没有根本性变化,依旧采用RLVR结合中间推理痕迹的训练方式。根据相关披露,模型本体在约10万块Grace Blackwell GPU上完成训练,相关团队还采购了数万台Mac mini和Mac Studio,不过这些设备仅用于强化学习的交互环境:通过任务提示、截图、模型预测鼠标键盘动作、执行任务、再截图反馈的循环流程,用成功信号来训练模型,这也是Astra在计算机使用能力上实现跃升的关键。

争议的核心在于token用量:Astra在达到相同准确率的情况下,比前代模型GPT-5.6 Sol使用了明显更少的token。有解读认为这意味着推理过程被隐藏在架构中,模型的可监控性有所下降。但该研究者持有不同看法:更短的token用量更可能说明模型的错误更少、需要回溯的次数更少,就像准备充分的学生在考试时使用的草稿纸更少。反例也能佐证这一点:性能稍弱的Luna模型在接近的准确率下,比Sol多使用了约80%的token。

GPT-6 Astra, Looped Transformers, and Hidden Reasoning
以上内容不代表本平台立场,仅供读者参考