3人国产团队刷新大模型训练速度 84秒压至76秒

最近在一个全球开源协作平台上,我看到了一段堪称技术竞速爽文的真实故事。
故事的起点是一个大模型训练任务,最初完成训练需要45分钟。随后全球的技术爱好者们围绕这个任务展开了持续优化:更换模型架构、调整优化器、编写专门的GPU内核代码,前后累计刷新了80多次榜单记录,最终将训练耗时压缩到了84秒上下。
到2026年4月左右,这个赛道似乎已经进入了瓶颈阶段,几乎所有能调整的细节都已经被优化过了。为了哪怕提升0.1秒的训练速度,不少开发者甚至愿意专门编写数百行的内核代码来抠细节,照理来说这个榜单已经很难再有新的突破了。
官方的记录榜单从2025年10月开始统计,到2026年4月的时候,已经有半年多没有出现新的突破了。但转折点恰恰就在这里,真正的好戏才刚刚上演。
仅仅一个多月后,一个仅有三名成员的小型团队,就接连两次刷新了这项纪录:先是将训练时间从84秒压缩到81秒,随后又进一步降到了76秒。这支团队没有更换训练数据集,没有降低模型最终的训练效果,也没有偷偷增加显卡数量,完全依靠技术优化就拿下了当时的训练速度纪录。
这样的突破无疑让人眼前一亮,更令人意外的是,该提交者的公开账号当时仅有3名关注者。该项目仓库的维护者、多项榜单纪录的贡献者Larry Dial最初评价称“这项技术非常先进,我需要确保自己完全理解其中的细节”,在最终合并代码时他又补充道:
"This is an awesome PR and easily the most advanced in quite a while." 这是一个很棒的提交,也是很长一段时间以来最先进的优化方案之一。
"论文作者们非常令人印象深刻,等大家跟上这些思路后,它们很可能会被用于更大规模的训练。"
接下来,我先为大家介绍一下这个名为NanoGPT Speedrun的开源竞速项目。
这个项目是一个面向全球开发者的开源训练竞速平台,开发者们可以在固定的硬件和数据集条件下比拼大模型的训练速度。项目的竞赛规则非常明确:所有参赛者必须使用固定的8张H100显卡,将一个GPT-2 Small规模的语言模型训练到统一的标准,即在FineWeb验证集上的损失值不高于3.28,最终比拼的是完整的训练耗时。谁能将训练耗时进一步压缩,谁就能刷新Track 1赛道的纪录。
参赛者可以自由调整模型架构、优化器和训练策略,甚至可以编写专属的GPU内核代码,但不允许更换基础训练数据集,也不能降低模型最终的训练效果。这就像是大模型训练领域的F1赛事:统一的赛道和基础燃料,比拼的完全是团队的技术实力和优化能力。
虽然这项活动看起来像是跑分测试,但想要取得突破绝非易事。例如,后来被某AI公司用于大规模模型训练的Muon优化器,最早就是在这个项目中得到验证并大幅刷新了纪录,随后该团队将其扩展为MuonClip,用于训练万亿参数的大模型。同样,当某团队提出Engram条件记忆机制后,该榜单上也很快出现了受其启发的Bigram Hash Embedding优化方案。
这个项目更像是大模型训练领域的拉力赛、竞技场和实验室结合体:许多后续投入大规模应用的技术,都会先在这里接受固定硬件、真实训练时长和公开代码的严格检验。
来自国内的技术团队
这场技术竞速的主角,是来自国内彩云科技的基础模型算法团队,此前在行业内并不算特别知名。2026年4月,该团队完成了第81次官方纪录提交,对应的优化方案是#81 MUDD Skip Connections,将训练时间从84.36秒压缩到81.78秒,耗时缩短了约3.1%。仅仅这一次优化,就直接减少了2.58秒的训练时间。
仅仅一个多月后,该团队再次提交了第85次纪录优化,对应的方案是#85 MUDD Gates + DC MHA,再次砍掉约2.9秒的训练时间,将纪录从79.2秒推进到76.3秒,耗时缩短约3.7%。我仔细查阅了该团队提交的代码和相关论文,发现其中的技术细节值得和大家详细分享。
两次关键技术优化
首次优化:优化层间信息流动
该团队提交的第一项优化方案是MUDD Skip Connections,MUDD全称Multiway Dynamic Dense Connections,即多路动态稠密连接。我此前曾仔细研读过相关的学术论文,对这项技术有一定了解。
我们可以把Transformer模型想象成一栋办公楼,传统的Transformer残差连接就像是一条提前修好的固定楼梯:不管模型当前处理的是数学题、代码、对话还是带有反讽的文本,每一层的信息都只能沿着这条固定路线向后传递。但实际上,不同的Token(语言模型的基本处理单位)需要的信息并不相同:有的Token可能需要回溯前面几层的词法信息,有的则更依赖最近几层刚刚完成的推理结果。
传统的残差连接并没有能力主动判断:这一次应该保留哪一层的信息?哪一路的信息应该加强?哪一路应该被压低甚至抵消?而MUDD技术就像是给Transformer装上了一套动态电梯:模型可以根据当前的Token和内部状态,自主判断应该从哪些历史层取回信息,以及这些信息应该以多大的权重参与当前的计算。
完整的MUDD技术不止控制一条残差路径,而是分别为Q、K、V和Residual四类内部信号设计了动态连接,相当于给不同类型的信息分别安排了专属的路线,让不同Token和不同内部信号可以动态选择跨层的信息传递路径。
彩云团队在2025年的国际机器学习大会(ICML)上发表过详细的实验结果:只增加了约0.23%的参数量和0.4%的计算量,就能达到普通Transformer使用1.8至2.4倍训练算力时的效果。不过,当时我在阅读论文时并没有想到这项技术会在公开竞速平台上取得如此直接的效果——毕竟学术基准和公开的擂台赛还是有区别的,不仅要看训练步数,还要计算真实的端到端训练时间。比如,即使新加的模块能让模型减少几十步训练,但如果模块本身运行速度过慢,最终的总耗时反而会增加。
彩云团队的处理非常巧妙:他们没有直接将完整的MUDD技术搬用到这个项目中,而是拆出了其中最有价值的部分,做成了低开销的MUDD Skip Connections。这个版本会根据当前的隐藏状态生成动态权重,改善跨层的信息传递,同时尽可能减少额外的计算开销。最终,这项优化将训练时间从84.36秒砍到了81.78秒,一次减少2.58秒,提升约3.1%。
二次优化:优化层内协作机制
一个多月后,该团队再次提交了优化方案,这次针对的是多头注意力机制,优化方案为MMUDD Gates+Lightweight DC。我看到这个模型名字时觉得格外眼熟,回忆起来2024年我曾精读过相关的学术论文,那是一篇获得ICML Oral的优秀论文。
DC(来自DCHA)技术关注的是注意力头之间如何协作。传统的多头注意力机制会让多个Attention Head并行处理输入,各个Head基本独立计算注意力图,直到输出阶段才进行拼接。这种方式虽然并行效率高,但缺少随输入动态协作的机制,也容易产生注意力头冗余的问题。
彩云团队提出的DCMHA(Dynamically Composable Multi-Head Attention,可动态组合的多头注意力),通过Compose模块对注意力分数和权重进行跨Head的变换。简单来说,它不再让多个Head各自为战,而是根据当前输入动态决定哪些Head需要协同工作、哪些信息应该加强或重新组合。基于这套机制构建的DCFormer,达到了普通Transformer使用约1.7至2倍计算量时的效果。
在这个NanoGPT Speedrun项目中,彩云团队并没有直接搬入完整的DCMHA,而是设计了轻量版本的Lightweight DC。这个版本复用了原有Q/K的投影计算,额外计算一个112 Token的局部注意力窗口;经过Softmax处理后,再将多个Head的注意力图动态合成为一张共享图,并通过不同的Head Scale作用于各自的Value。这样既保留了跨Head动态组合的能力,又通过复用投影、缩短窗口和专用Kernel控制了额外的计算开销。
最终,Lightweight DC让训练步数下降约7%,将世界纪录从79.2秒推进到76.3秒,一次缩短约2.9秒。
与行业内其他技术的关联
说到这里,熟悉大模型架构的人可能会想到另外两项工作:某AI公司的Attention Residuals(也就是AttnRes)和字节Seed团队的Hyper-Connections(HC)。这两个工作和彩云团队的两项优化其实都在同一个研究大方向:Transformer层与层之间的信息,不一定非要按照固定方式传递。
先来讲讲某AI公司在2026年3月发布的AttnRes。它同样认为,传统的残差连接会让不同层的信息逐渐混在一起,导致越深的网络单层的贡献越来越容易被稀释。AttnRes的做法是让当前层对历史层进行打分,再经过Softmax处理,决定应该从哪些历史层取回信息。我理解,这相当于给Transformer的每一层增加了“往前翻资料”的能力:传统残差连接会把前面各层的信息一路累加,而AttnRes则会针对每个Token,动态判断当前最该参考哪几层的信息。为了适配大规模模型,Block AttnRes又把历史层整理成几个资料夹,只在块级信息中进行选择,从而降低显存和通信开销。
MUDD和AttnRes都会针对每个Token动态调用历史层信息,但MUDD不受Softmax归一化约束,可以直接生成正负连接系数,对信息进行放大、抑制或抵消。完整的MUDD还将这种动态路由扩展到Q、K、V和Residual四路,而不只作用于残差流。
再来说说字节Seed团队的HC技术。HC同样在改造残差连接:它把单一的隐藏状态扩展为多条可交互的信息流,让模型动态重组层与层之间的连接关系。在这个NanoGPT Speedrun项目中,Partitioned Hyperconnections曾将第73项纪录缩短了约0.66秒,而MUDD Skip Connections则在第81项纪录中缩短了2.58秒。需要说明的是,由于两次提交基于不同版本的训练代码,这组数字不能作为严格的对比。
行业启示与意义
很多人认识彩云科技,可能还是因为他们的天气服务产品。从早期的彩云小译、彩云小梦,到后来在模型架构方向持续投入的DCMHA、MUDD技术,我一直关注这家公司的研究动态,因为他们一直在攻坚一个非常重要的问题:在同样的计算预算下,能不能训练出更好的模型?
对于大型科技公司来说,几个百分点的训练效率提升,可能意味着大量GPU资源、电力成本和训练时间的节省。对于高校实验室和小型团队来说,这几个百分点的提升甚至可能决定一个实验能不能顺利完成。
多家行业团队采用的技术路线并不相同,但它们都在尝试回答同一个问题:在算力成本越来越高的今天,如何让每一次计算都产生更大的价值。也正因为如此,NanoGPT Speedrun这样的公开竞速项目才有了独特的意义。
当然,需要说明的是,本文中的测试对象仍然是GPT-2 Small规模的模型。这里取得的3%左右的效率提升,并不意味着放大到百亿、千亿参数规模后依然能够获得完全相同的收益。模型规模、硬件环境、训练策略以及并行方式,都可能影响最终的优化效果。但至少在固定硬件、固定数据、公开代码和真实训练时间的条件下,彩云团队证明了一件事:这些看似停留在论文里的架构优化,并不是实验室里的冰冷数字,而是真正能够改变训练过程的工程方法。
第81项纪录优化的是层间信息流动,让模型能够动态选择不同历史层的信息;第85项纪录进一步探索层内协作,让不同注意力头可以根据输入动态组合。简单来说,一个是在思考“不同层之间的信息如何更高效流动”,另一个是在探索“同一层内部的计算如何更聪明协作”。
而这两次突破背后,还有一个容易被忽略的现实。那句“Crazy 3 followers and doing stuff like this.”之所以引发广泛共鸣,是因为它揭示了行业里的一个普遍现象:市场的关注度往往优先聚焦于拥有巨大算力集群和宏大叙事的巨头企业;但真正推动技术进步的,也可能是一群规模不大的团队,在代码细节里不断寻找突破口。
技术演进史,从来不只是由声量书写。从DC到MUDD,再到NanoGPT Speedrun中连续刷新纪录,彩云团队给出的其实是一条清晰的技术路径:发现架构瓶颈、提出优化机制、开源验证效果,再让整个社区继续迭代。现在,彩云团队的两项纪录已经被后来者继续刷新,但竞速项目的意义,本来就不是让某一个名字永远停留在第一名,而是让一个有效的想法进入公共代码库,成为下一次突破的起点。
也许未来的大模型竞争,不只是“谁拥有更多GPU”,还会越来越取决于:谁能让每一次计算,都变得更加值得。
今天的技术解读内容比较丰富,我为大家整理了相关的技术链接,感兴趣的读者可以进一步查阅:
相关技术链接:
MUDD优化方案:https://github.com/KellerJordan/modded-nanogpt/pull/259
MUDD Gates+ Lightweight DCMHA优化方案:https://github.com/KellerJordan/modded-nanogpt/pull/315

