文章摘要
GPT-6 Astra发布后,可复用参数、以计算深度换参数规模的循环Transformer技术引发AI行业热议,该技术为大模型扩展提供新路径,但存在计算冗余痛点。阿里研究团队早前发表MeSH、SpiralFormer两篇论文,分别优化循环信息管理与计算粒度,破解了该冗余困局,相关成果已获顶会认可。

随着GPT-6 Astra正式发布,循环深度(recurrent depth)技术迅速成为AI行业的焦点话题。据行业消息,这款模型采用了一项核心技术:让同一组Transformer层反复运行,在不额外增加参数规模的前提下,实现更深层次的计算。这意味着大模型无需盲目堆叠参数,就能通过复用现有算力实现能力提升,看似一举两得的方案很快引发了广泛讨论。

不过这项技术很快也引来了争议:由于循环过程发生在隐藏状态(hidden state)中,中间步骤未必会生成人类可读的思维链,这让模型的可解释性和可监测性面临挑战。相关质疑很快引发了AI安全领域的集体讨论,甚至迫使OpenAI首席科学家Jakub Pachocki亲自出面回应,他还透露正在准备详细的技术说明来解答外界疑问。

在等待官方详细说明的同时,我们不妨先回到循环Transformer技术本身:增加循环次数,真的能让模型性能同步提升吗?

事实上,学术界早在多年前就对循环架构进行过探索,但很多实践都遇到了现实瓶颈:在同等算力条件下,通过参数共享节省资源的循环模型,往往性能不如传统Transformer。而制约其表现的核心问题,正是「计算冗余」。

值得注意的是,来自国内的研究团队早在11个月前就针对这个问题展开了深入研究,先后推出了两篇针对性论文:一篇名为MeSH,聚焦循环内部的信息管理,解决「循环空转」的行业痛点;另一篇SpiralFormer,则专注于优化循环间的计算粒度,让每一轮算力都能精准发挥作用。

循环架构之所以受到关注,核心在于它为大模型提供了新的变强路径:传统的模型扩展(Scaling)依赖堆叠参数,比如24层的模型需要24套独立参数;而循环架构只需要8层参数,通过重复运行3次,就能实现相当于24层深度的计算效果。虽然最终性能仍需实验验证,但这种方式确实大幅减少了需要存储的参数规模,用计算深度换取参数规模的思路,打开了全新的想象空间。

其实在GPT-6 Astra之前,Claude Mythos就已经让循环架构进入了大众视野。当时最引人注目的是其在图搜索任务中的表现:在GraphWalks BFS的256K至1M上下文测试中,Mythos Preview的准确率达到80.0%,而GPT-5.4仅为21.4%,自家的Opus 4.6也只有38.7%,前者的得分接近GPT-5.4的四倍。

这项测试要求模型基于复杂关系网络从起点出发逐层查找关联节点,需要持续处理多步信息并保留中间结果,而这恰恰是循环架构擅长的领域——在hidden state中完成多轮连续信息处理。因此当Mythos的成绩公布后,外界很快将其表现与循环架构联系起来,尽管官方并未明确说明是否采用了该技术,但相关猜测一直不断。从Mythos到Astra,行业期待的核心始终一致:无需让模型持续变大,就能通过内部多轮计算提升能力,这也让循环架构成为下一代高效大模型的热门候选路线之一。

不过这里有一个关键疑问:增加循环次数,和真正获得有效的性能提升,并不是一回事。我们可以通过一个简单的模型运行过程来理解:横轴代表信息经过模型模块的流程,中间的三个蓝色柱体对应三次核心循环,纵轴则表示计算前后hidden state的相对变化幅度。可以看到,第一次核心循环的更新幅度很大,但后续两次的变化幅度迅速缩小。需要注意的是,柱体变矮并不代表算力消耗减少,矩阵运算和注意力机制依然会正常运行,这就是计算冗余的尴尬之处:循环次数增加了,但后续计算带来的性能增量却越来越小。

来自国内高校及企业的联合研究团队,正是从这个痛点切入展开了深入研究。他们首先分析了循环空转的原因,再针对性地提出解决方案,让后续的循环也能真正发挥作用。

团队首先推出的MeSH论文已于2026年被ICLR接收,其首版在2025年10月公开,也就是11个月前就已经开始了对循环Transformer的优化。在Pythia-1.4B级别的实验中,基础循环结构通过权重共享减少了约33%的非嵌入参数,但加入MeSH后,零样本下游任务的平均准确率反而从传统Transformer的49.50%提升到50.56%,领先1.06个百分点。更难得的是,MeSH新增的路由器参数仅占传统Transformer非嵌入参数的约0.005%,相较于基础循环模型,额外的计算开销仅约0.014%,真正实现了低成本高效优化。

那么MeSH是如何做到的?研究团队深入模型内部,分析了每一轮循环的运行情况,发现了三个典型的「低效循环」特征:首先,后续循环的状态更新幅度越来越小,第一次核心循环承担了绝大多数的参数更新,后续循环几乎没有带来明显变化;其次,相邻循环的隐藏状态相似度越来越高,同一组网络反复运行,输出的结果却相差无几;最后,经过多轮循环后,模型的表示逐渐被压缩到低维空间,原本可以多维度表达的信息被浓缩到少数几个方向,表达能力越来越单一。综合来看,循环架构的低效问题一目了然:第一次循环全力运行,后续循环几乎只是陪跑。

为什么会出现这种情况?论文给出了两个核心诊断:一是「计算无分化」,同一组网络被反复使用,且缺乏明确的轮次标识,很难在不同循环阶段形成分工,容易重复使用相同的计算逻辑;二是「信息过载」,单一的hidden state需要同时保存原始输入、前几轮的计算结果以及当前处理的信息,长期记忆和临时加工的内容挤在一起,导致任何一方都无法得到充分处理。归根结底,循环架构的核心问题在于没有建立合理的「信息交接机制」。

传统的循环模型中,上一轮计算完成后会直接将完整的hidden state传递给下一轮,再由同一组网络继续处理。后续虽然有研究者尝试通过重新加入初始状态来避免模型遗忘原始输入,但无论运行到第几轮、处理哪个token,信息的搭配规则都是固定的。MeSH的核心思路是为模型增加一个可动态存取的「记忆柜」:这个名为Memory Buffer的结构由多个记忆槽组成,用于保存原始输入和循环过程中积累的信息,避免所有内容都挤在当前的hidden state中。同时,MeSH为这个记忆柜配备了两个「管理员」:

  • 一个是Write Router,负责决定当前轮次的新结果应该按照怎样的权重分配到各个记忆槽。
  • 另一个是Read Router,负责在下一轮循环开始前,按不同权重读取各个槽位的信息,重新组合成新的hidden state。

熟悉近期AI研究动态的读者可能会发现,这种思路和Hyper-Connections、mHC等研究有相似之处:Hyper-Connections将原本单路传递的残差信息扩展为多路,通过可学习的映射组合出计算层的输入,并将结果分配回多路状态;mHC则进一步约束这些连接,提升深层传播的稳定性。而MeSH则将这种信息调配的思路应用到循环之间,同时解决了前面提到的两个问题:Memory Buffer将历史信息分流,让hidden state可以专注处理当前轮次的任务;动态读写路由器则为每一轮循环搭配不同的信息组合,让共享的网络层逐步形成分工,减少重复劳动。经过优化后,之前提到的三个低效循环特征都得到了明显改善。

不过,在MeSH优化了循环间的信息分配后,还有一个问题没有解决:每一轮循环依然需要在完整的token序列上进行计算。这就好比想要了解一座城市的整体布局,却还是需要沿着每条街道逐一走访。虽然信息的分配已经实现了分工,但计算的尺度依然固定,这就引出了第二篇论文SpiralFormer。

SpiralFormer的核心思路是让每一轮循环的序列长度(seq_len)变得可调,这项研究已于2026年被EMNLP接收。研究团队受到Coconut等隐式思考研究的启发,意识到模型的中间「思考」过程未必需要始终维持完整的显式token序列,而是可以先将其压缩为更紧凑的表示,在潜空间中完成后续计算。

在Pythia-1.4B级别的实验中,SpiralFormer-L的参数量与传统Transformer基本一致,但计算量从14.08T FLOPs降至13.13T FLOPs,5-shot下游任务的平均准确率则从51.93%提升到了54.37%,实现了更低的计算量和更好的性能。

具体来说,SpiralFormer的核心思路是不让模型在每一轮循环中都使用相同的分辨率处理信息:它会先将相邻的token压缩为更短的序列,再按照从粗到细的顺序完成循环。论文中采用的典型方案是,先从原序列长度的1/8开始,随后依次扩展到1/4、1/2,最后回到完整的序列长度。我们可以用看地图来打比方:第一轮先观察城市全貌,理清不同区域之间的关系,随后逐步放大视角,看到街区和道路,最后聚焦到具体的位置。回到模型本身,SpiralFormer会在每一轮循环开始前对序列进行「缩放」:将相邻的token划分为一组,通过可学习的权重聚合成更粗的表示。压缩后的序列长度更短,注意力机制需要计算的token数量也更少,自然降低了计算量。完成当前轮次的计算后,再将结果还原到原始的token位置,交给下一轮循环继续处理。需要注意的是,为了避免在生成文本时泄露未来的信息,SpiralFormer还对写回结果进行了右移处理,确保模型不会提前看到后续内容。

那么这套「先全局后细节」的处理逻辑,真的是模型自主学会的吗?研究团队通过两项探测实验验证了这一点:首先观察注意力的分布范围,结果显示在早期的低分辨率循环中,注意力会更广泛地分布,同时关注更大范围的信息;而到了后期的高分辨率循环,注意力会集中到少数关键位置。其次,直接检查注意力对附近token的关注程度,随着分辨率的提升,落在局部范围内的注意力占比越来越高,这说明模型在后续循环中确实更倾向于处理局部关系。

循环初期建立global pattern,随着循环推进,再逐渐转向local pattern

相比之下,始终处理完整token序列的普通LoopedFormer,虽然也会出现类似的变化,但趋势更弱且不够稳定。这说明从全局到局部的分工并不会随着循环自动出现,多分辨率的设计才是关键驱动因素。

研究团队还在保持参数量和训练计算预算不变的前提下,调整循环层所占的比例,结果得到了一条U形曲线:随着循环比例的提升,模型表现先逐步变好,在30%到40%左右达到最佳,继续增加循环比例后,过度的参数共享反而会拖累整体性能。这也为SpiralFormer打开了新的扩展维度:除了调整循环次数,还可以优化每一轮循环的序列压缩尺度。

回过头来看,MeSH和SpiralFormer这两篇论文,恰好补上了循环Transformer技术最缺失的环节:分工。MeSH解决了每一轮循环「处理什么信息」的问题,SpiralFormer则解决了「以怎样的粒度处理」的问题。两者结合后,让循环架构向成为下一代高效大模型的方向迈出了坚实的一步。

过去,大模型的扩展主要依赖参数、数据和训练算力三大支柱;随着推理模型的兴起,又出现了通过生成更长思维链、用更多token换取更好效果的思路。而循环架构则提供了另一种全新的选择:计算可以在hidden state中持续进行,同一组参数被反复使用,模型规模保持不变,但内部计算可以逐层加深。当然,这并不意味着可以免费获得算力——循环架构节省的是参数存储成本,而非计算本身,但只要能让每一轮额外的循环都产生实际的价值,用更少的参数支撑更强的模型性能就成为了可能。MeSH和SpiralFormer的意义,正是将这种可能性逐步落地。

目前,围绕GPT-6 Astra和Claude Mythos,行业仍在热议循环架构是否被采用、是否会成为下一代大模型的主流路线。而国内的研究团队已经将问题拆解到循环内部:从分析低效的根源,到优化结构设计,再到通过实验验证效果,这条技术路线上的核心卡点已经被逐一破解。MeSH和SpiralFormer分别被ICLR 2026和EMNLP 2026接收,顶会的认可也为这项研究增添了更多含金量。

事实上,这项技术的探索并非从现在才开始:早在2018年的Universal Transformer中,研究者就已经尝试复用共享层;近年来,Looped Transformer、recurrent depth和latent reasoning等研究也陆续出现,背后的核心思路始终一致:让大模型在不盲目堆叠参数的前提下,通过多轮内部计算提升能力。而GPT-6 Astra的出现,更是将这条原本偏向学术的路线推到了行业聚光灯下。

至于下一代高效大模型是否会从这条路线上诞生,现在下定论还为时过早,不妨让我们拭目以待。

相关论文链接:
MeSH:https://arxiv.org/abs/2510.07739
SpiralFormer: https://arxiv.org/abs/2602.11698

以上内容不代表本平台立场,仅供读者参考