文章摘要
近期全量上线的GPT-6 Astra,被业内推测核心采用循环深度架构创新,本文梳理了该技术的发展脉络:其思想源头可追溯至Universal Transformer,后经定名落地、免训练优化等阶段,已有研究验证该技术可规模化,同等计算预算下性能优于普通Transformer,业内推测OpenAI已破解循环次数瓶颈。

近期,GPT-6 Astra正式全量上线,行业媒体披露其核心技术很可能是名为循环深度(recurrent depth)的架构创新。有行业研究者梳理了该技术方向的多篇关键论文,为我们拆解这一背后的技术脉络。

循环Transformer的核心逻辑

传统Transformer在单次前向传播中,每一层的参数仅会被调用一次;而循环Transformer则会重复使用同一组参数多次,这类循环机制都属于循环深度的技术范畴。具体可以分为四类循环模式:

  1. 整模型循环:将整个模型的输出隐状态重新作为输入回传,是最经典的循环范式;
  2. 层块循环:仅循环模型中间某一段连续的网络层;
  3. 逐层循环:每一层先独立循环多次再向下传递,相关实验证明这种模式的扩展性更佳;
  4. 潜变量条件化:以特定的潜在输出作为后续循环的触发条件。

循环深度技术最核心的特点是:循环结构是固定且预先配置的,每个token获得的计算量完全一致,这和“按需计算”的自适应机制形成了鲜明区别。

技术起源:Universal Transformer

Universal Transformer(UT)是循环Transformer技术的思想源头,它可以看作是Transformer的推广版本,将Transformer的并行性、全局感受野,与RNN的循环归纳偏置结合在了一起——同一组参数会在时间步(也就是深度方向)上反复应用。

UT还引入了自适应计算时间(ACT)机制,允许每个输入位置进行不同步数的“思考”。在当年的bAbI问答、LAMBADA语言建模、WMT14英德翻译等任务上,UT都取得了领先或极具竞争力的成绩。可以说,UT是第一个系统性将“同一层参数反复应用”作为核心机制的Transformer变体,如今所有循环深度相关的研究,思想源头都可以追溯到这里。

定名之作:首次落地的循环深度技术

如果说UT是思想源头,2025年2月发布的一篇论文则首次正式命名了“recurrent depth”概念,并将该技术带到了现代规模的落地场景,行业媒体报道中提到的Astra使用的技术,名字正出自这篇工作。

核心设计思路

主流的推理模型大多依靠生成更多token来扩展测试时的计算量,思维链越长,计算量也就越大。而这篇论文走出了完全不同的路径:通过迭代一个循环块,在测试时将网络“展开”到任意深度,让模型在潜在空间中完成隐式推理。

这种思路带来了多个独特优势:不需要专门的思维链训练数据,可以在较小的上下文窗口下工作,还能捕捉那些难以用自然语言表达的思维类型。

训练与效果

该模型采用了三段式架构:前置模块 → 共享循环块 → 输出模块,同时加入了输入注入和残差连接来保证训练稳定性。在训练过程中,会随机采样循环次数,让模型对任意循环深度都具备鲁棒性,本次实验使用了35亿参数、8000亿token的预训练规模,在学术资源场景下属于相当大的投入。

实验结果显示,随着测试时循环次数增加,模型性能持续提升,最高可达到约500亿参数模型的等效计算水平,而实际物化参数仅为35亿。和同训练配置、同数据的非循环基线模型相比,差距尤为明显:在相同的0.8万亿token训练量下,循环模型在r=32时,ARC-E任务拿到69.91分(基线仅46.42分)、HellaSwag任务65.21分(基线37.34分)、GSM8K CoT任务从几乎为0提升到34.80/42.08分。

潜在空间的可视化发现

该论文最具“科幻感”的贡献,是对潜在空间动力学的可视化分析。研究者发现模型在循环过程中展现出了可识别的、类似“思考”的几何结构,为理解循环深度的内部工作机制提供了直观依据。

免训练优化:直接给现有模型加循环外壳

此前的循环技术都需要从头开始训练循环结构,而后续的研究提出了一个更实用的问题:已经训练好的开源模型,能不能直接在推理时添加循环机制来获得性能提升?答案是肯定的,但需要采用正确的方式。

关键的数学视角

如果直接将Transformer层块原样循环,通常会导致性能下降。研究团队从数学视角找到了突破口:预归一化的Transformer块可以看作是某个常微分方程上的前向欧拉步,因此“循环”不应是简单的重复,而应该是将一个大步拆分为多个阻尼小步,也就是采用龙格-库塔风格的精细化近似。

全模型验证效果

研究团队在7个不同的模型家族上进行了开箱即用的验证,无需逐模型调参,包括稠密模型、稀疏MoE模型、MLA+MoE模型等。实验结果显示,性能提升覆盖面相当广泛:比如Qwen3-4B-Instruct的MMLU-Pro指标从0.5714提升到0.5979,提升了2.64个百分点;GPQA-Main任务提升了2.01个百分点;Llama-3.2系列、Qwen1.5-MoE、Moonlight-16B-A3B、DeepSeek-V2-Lite等模型也普遍获得了0.7~2.3个百分点的性能提升。

该研究还总结出了一套实用的“配方”:循环窗口n=4是性能最优的选择,当n≥6时会出现明显的性能下滑。这项工作让循环深度技术不再是大厂的专属,任何开发者都可以在现有开源模型上免费获得性能提升。

反直觉发现:循环两次就足够了

如果说此前的论文都在强调循环的好处,后续的LoopCoder-v2论文则贡献了该领域最重要的反直觉结论:循环次数并非越多越好,两次循环就能达到性能最优,三次及以上的循环反而会导致性能回退,这也是科普内容中“looping more than two times actually led to regressions”的出处。

工程优化:并行循环Transformer

传统的顺序循环存在一个致命缺点:延迟和KV缓存会随着循环次数线性增长。研究团队提出的并行循环Transformer(PLT),通过跨循环位置偏移和共享KV的门控滑窗注意力机制,让延迟和KV内存占用近似为常数,从而可以自由调整循环次数进行实验。

实验结果与机制分析

研究团队使用相同的训练配方,从头训练了不同循环次数的70亿参数PLT代码模型家族,使用了18万亿token的预训练数据加上对齐的指令微调,实验结果极具戏剧性。

诊断分析给出了清晰的机制解释:这种“强烈的非单调循环次数效应”是整个领域必须面对的约束。值得玩味的是,如果GPT-6 Astra真的使用了循环深度技术,OpenAI大概率已经找到了绕过“两次循环就饱和”这个瓶颈的办法,否则无法解释Astra展现出的断崖式领先,而这可能正是OpenAI不愿在发布页中公开的核心细节。

规模化验证:打破循环架构的质疑

循环架构一直面临一个关键质疑:如果投入N倍的预训练计算量,直接扩大参数量到N倍,通常比将模型循环N次更加划算。如果这个质疑成立,循环深度技术就永远只能是学术玩具。而Loopie系列论文的任务就是打破这个魔咒。

更好的循环粒度:逐层循环

研究团队系统对比了不同循环粒度的扩展性,发现逐层循环比整模型循环的扩展性更好,这也是科普推文中引用的核心结论。

Loopie系列模型的验证结果

Loopie团队发布了两个MoE模型:200亿总参/20亿激活参数,以及60亿总参/6亿激活参数。大量消融实验,包括与标准的300亿参数/30亿激活参数模型的对照,都证明在相同的计算预算下,循环模型显著超越了普通Transformer基线。

搭配团队提出的新型后训练方法SPT(Supervised Pre-training),Loopie模型发展出了更强的推理能力。和同量级的MoE推理模型相比,Loopie的优势尤为明显。该论文明确传递出一个信号:循环深度技术已经跨过了“学术玩具”到“可规模化训练范式”的临界点,而该论文在7月发布,GPT-6 Astra则在9月发布,时间点尤为微妙。

参考资料

1. Universal Transformers https://arxiv.org/abs/1807.03819
2. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach https://arxiv.org/abs/2502.05171
3. Training-Free Looped Transformers https://arxiv.org/abs/2605.23872
4. LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling https://arxiv.org/abs/2606.18023
5. Loop the Loopies! https://arxiv.org/abs/2607.16051
6. OpenAI. GPT-6 Astra https://openai.com/index/gpt-6-astra/
7. 行业媒体报道. Secret Technique Behind OpenAI’s Astra Model Sparks Security Concerns. 2026-09-02.
8. 相关技术推文 https://x.com/kimmonismus/status/2095045887131087357
9. 研究者梳理推文 https://x.com/nrehiew_/status/2095115984873062675
以上内容不代表本平台立场,仅供读者参考