文章摘要
2026 年 3 月相关团队分享 Kimi K2.5 技术扩展方法论。演讲提出三大核心技术目标,包括推出 Muon 优化器、开发 Kimi Linear 架构、提出智能体蜂群训练范式。三者融合诞生 Kimi K2.5,还探索了注意力残差架构。Kimi K3 将于 7 月 27 日前开源,或引发行业新讨论。

Kimi K3的突破性表现,其实早在四个月前的一场技术演讲中就埋下了伏笔——2026年3月21日,相关团队负责人在行业技术大会上,分享了Kimi最新模型K2.5背后的技术扩展方法论。整场演讲全程聚焦技术细节,涵盖了优化器革新、长上下文架构升级、智能体训练范式创新,以及全新的底层架构预告。

从这场演讲中,可以清晰看到团队在大语言模型扩展上的三大核心技术目标:一是推出可替代经典Adam优化器的开源二阶优化器Muon,大幅提升训练效率;二是开发线性注意力架构Kimi Linear,优化长上下文处理能力;三是开源注意力残差架构,革新网络深度的训练逻辑。而仅仅四个月后,Kimi K3的正式发布,就印证了这套技术路线的可行性。

第一方向:提升Token利用效率

演讲者首先展示了机器学习领域经典的Scaling Law研究成果,来自Kaplan团队的论文:当训练Token数量、模型参数量与算力按比例提升时,模型的损失值会持续降低,这也是过去数年大模型行业发展的核心基础逻辑。但团队的核心目标并非单纯堆砌训练Token总量,而是提升Token的利用效率——让相同数量的Token能实现更低的损失值,这需要通过更优秀的架构设计与优化器来实现。

团队特别强调,Token效率并非只是单纯的算力节约问题,它直接决定了模型的智能上限。举例来说,假设手中有50万亿条高质量训练Token,通过新优化器将效率提升一倍,效果就相当于凭空获得了100万亿Token。当前行业正面临高质量数据瓶颈,当数据总量趋近于常数时,提升Token效率就意味着能挖掘出更强的智能能力,而非仅仅节省训练成本。

团队为此重点研发了Muon二阶优化器,其核心思路是将每次梯度更新转换为彼此正交的向量,这与传统Adam优化器的逻辑有显著差异。若实现得当,Muon可带来两倍的Token效率提升。团队也是首个证明Muon可扩展应用于大语言模型训练的团队,在相关论文中提出了两项关键技术:一是适配大模型训练的权重衰减策略,二是引入可调系数确保更新幅度与Adam保持可比,保证训练过程的稳定性。为了在高性能GPU集群上实现内存高效的训练,团队还开发了分布式Muon优化器实现,将优化器状态切分到不同的数据并行组中。在相同参数量与训练Token数的对照实验中,将AdamW替换为Muon优化器后,模型各项指标均实现了全面提升。

不过当将Muon扩展到万亿参数量规模时,团队遇到了训练不稳定的问题:注意力机制中的最大logit值会快速飙升至1000以上,而正常情况下该数值通常仅在50甚至更低,同时训练损失会先下降后突然爆炸,无法正常收敛。

团队提出的解决方案名为QK Clip:在正向传播过程中,为每个注意力头计算当前的最大logit值,据此生成缩放系数分别应用于Query和Key的投影,将二者的数值限制在可控范围内,从而避免数值爆炸。实际效果显著:应用该技术前后的训练损失曲线几乎完全重合,说明该技术不会拖累损失下降速度;而最大logit值会在初始上升至100左右后保持稳定,随后随训练步数自然回落,网络自动实现了数值控制且不影响收敛效果。团队将该技术应用于K2模型的训练,成功将参数量扩展至万亿级别,这也是机器学习历史上首次将Muon优化器应用于如此大规模的模型训练。

第二方向:拓展长上下文处理能力

第二个扩展方向的引子,是一张对比Transformer与LSTM的经典图表:左侧图表显示,在相同参数量与训练Token数的前提下,Transformer的训练损失更低,这也是Transformer成为当前主流大模型架构的核心原因;右侧图表则更具参考价值:横轴为上下文Token位置,Transformer的训练损失会随上下文长度增加持续下降,而LSTM的损失在达到一定Token数量后就会进入饱和状态,不再下降。这说明Transformer在捕捉长上下文信息上的能力远优于LSTM。

在智能体时代,长上下文能力的重要性愈发突出:当前任务复杂度不断提升,所需的上下文长度也越来越长,比如理解完整的代码仓库、执行长达数周的智能体轨迹来完成从零开发操作系统内核等任务,都是LSTM架构无法胜任的。团队的研发目标是打造一种既能高效扩展到更长上下文,又能在靠后的Token位置实现更低单Token损失的架构,这也是Kimi Linear架构的研发出发点。

Kimi Linear包含一种全新的线性注意力变体Kimi Delta Attention,其基于原始delta rule改进了循环记忆机制。同时团队采用线性注意力层与全注意力层按1:3的比例混合部署,兼顾长上下文能力与实现效率。

传统线性注意力的问题在于,其记忆是全局统一的,仅使用单个标量衰减因子,导致模型要么几乎遗忘所有历史信息,要么保留全部信息,无法在长上下文场景下有选择地丢弃不重要的内容。Kimi Delta Attention引入了细粒度衰减因子,将原本的标量衰减系数替换为对角矩阵,分别控制每个通道的衰减速度:部分通道衰减速度极慢,可在超长范围内保留信息;另一部分通道则快速遗忘旧信息,及时接收新内容,整体提升了模型的表达能力。

为适配现代GPU的并行计算架构,团队采用分块方式重构了计算逻辑。由于衰减项从标量变为矩阵,无法像传统线性注意力那样单独提取处理,团队重写了整套计算公式,引入矩阵求逆与累积衰减因子,在不牺牲效率的前提下实现了并行计算。更重要的是,此次重写在数学上与原始公式完全等价,属于精确改写,在提升效率的同时未带来任何性能损失。

从实际测试结果来看,在偏短上下文任务中,Kimi Linear的表现优于同类线性注意力架构;在长上下文任务中,Kimi Linear同样表现更优,且相比其他方案更节省算力。当上下文进一步扩展至百万甚至更长Token时,Kimi Linear的效率提升效果更加显著,它也是首个能在短上下文、长输入、长输出任务上全面超越全注意力架构的方案。

第三方向:智能体蜂群训练范式

团队提出的智能体蜂群训练范式,核心是设计一个编排者(主智能体)负责协调整体任务。该编排者可以生成一批子智能体并分配具体任务,同时收集子智能体返回的结果,通过反复迭代该流程,最终完成远超单个智能体能力范围的复杂任务。

演讲者用人类社会的组织模式做类比:创办一家公司需要不同的角色分工,需要类似管理者的角色将任务拆解并分配到不同岗位,最终推动整个组织朝着统一目标前进。放到智能体蜂群中,可能同时存在负责不同领域的子智能体,各自完成细分课题后,再由结果整合类的智能体汇总所有输出,形成完整的最终报告。

从任务复杂度与执行时间的维度来看,采用智能体蜂群范式后,执行时间相比单智能体大幅缩短,效率显著提升。这意味着可以将蜂群规模扩展至百甚至千个子智能体,在可接受的时间范围内完成复杂任务,从而实现真正的经济价值。团队认为这种扩展可以体现在多个方向:扩展输入维度,比如并行下载、阅读大量资料;扩展输出维度,比如并行撰写长文档;扩展执行动作,比如同时开展多任务数据分析;也可以扩展编排本身,即学会如何拆分子任务、如何整合最终结果。

在技术层面,团队为智能体蜂群系统设计了专属的奖励目标体系,相比传统单智能体强化学习,共考虑三项奖励机制:

第一项是实例化奖励,用于鼓励模型生成子智能体,避免退化为单智能体串行执行的情况,尤其是在训练早期需要重点鼓励并行执行,该奖励的权重会随训练推进逐渐衰减。

第二项是完成奖励,团队观察到部分子任务在创建后从未被完成,模型可能仅靠生成大量子智能体来刷取实例化奖励,而这些任务本身可能过于复杂或毫无意义。因此加入完成奖励,鼓励每个子任务保持较高的完成比例,确保生成的子任务具备实际价值,该奖励同样采用训练前期权重高、后期权重低的衰减策略。

第三项是标准的结果奖励,用于衡量整个任务是否最终完成。

三项奖励共同构成了智能体蜂群强化学习系统的优化目标。同时团队还搭建了配套的基础设施,支持并行执行、多奖励函数配置,并尽可能提升整个系统的输入输出效率。

三大方向融合:Kimi K2.5的落地实践

将Token效率提升、长上下文扩展、智能体蜂群训练这三个方向结合,就诞生了Kimi K2.5模型。

团队负责人表示,从K2.5身上观察到了诸多有趣的能力,比如视觉能力与编程能力融合后催生了全新的应用场景:例如输入一段视频,模型可以生成复现或风格迁移自该视频的网页,这些能力都源于预训练阶段稳定且成功的训练过程。

他还展示了K2.5基础模型的训练曲线,称这是自己见过的最平滑稳定的训练曲线之一。模型累计经历了超过15万亿Token的训练,在K2.5阶段又额外训练了15万亿Token,整个过程没有出现任何损失尖峰,尤其是引入Muon优化器后,训练稳定性大幅提升。这种平滑稳定的训练过程产出了性能强劲的基座模型,团队可以在此基础上继续微调,获得前文提到的各类新能力。整个训练过程在高性能GPU集群上完成,节点配备充足内存,GPU之间通过高速连接保障传输效率。

K2.5的另一项关键创新,是成为首个原生实现视觉与文本联合训练的开源模型。以往开源模型通常采用先纯文本训练、再叠加视觉能力的后期融合方案:例如先用大量Token训练文本模型,再用多模态数据进行后训练。而K2.5采用了早期融合方案,从训练初始阶段就将视觉Token与文本Token合并训练。初步实验显示,这种方式的效果优于后期融合方案,团队观察到的诸多新能力也正是源于这种训练方式。举例来说,若要让模型根据图像生成代码,必须将视觉与文本模态纳入同一分支训练才能实现,若两个分支独立训练则无法完成该任务,必须将两种模态对齐到同一共享表示空间中。

另一个重要发现是,视觉与文本模态可以实现互相增强。行业此前普遍认为,为文本模型添加视觉能力往往会拖累文本本身的表现,但团队发现,只要训练方式得当,两种模态反而可以互相促进。

具体来看,视觉训练可以提升文本表现:团队开展了一组对照实验,仅使用纯视觉任务开展强化学习,不涉及任何文本任务,但结果显示,即使是偏重推理的文本任务,模型表现也得到了提升。反过来,文本训练也可以提升视觉表现:如果文本基础足够扎实,训练过程中无需额外准备视觉方向的微调数据。团队采用的方法名为Zero Vision SFT,即视觉方向几乎不使用专门的微调数据,仅使用文本微调数据,再对文本与视觉开展联合强化学习。结果显示,在完全没有专门视觉数据的情况下,视觉类任务的表现依然能接近业内顶尖水平。这说明只要在预训练阶段将两种模态对齐到同一共享空间,足够强大的文本基座本身就能带动视觉能力同步提升。前文提到的强视觉设计与前端编程能力,正是源于这套视觉文本联合训练方案。

下一代架构探索:注意力残差新思路

演讲接近尾声时,团队负责人顺带介绍了前一天刚发布技术报告的全新架构——注意力残差架构,这是对下一代模型架构方向的一次预告。

该架构的研发思路很简单:团队此前在时间维度上使用的技术逻辑,能否迁移到网络深度维度进行复用。

这要从残差连接说起。团队负责人回忆起十年前的一场技术分享中首次接触到这个想法,称其是极具突破性的点子。在ResNet架构出现之前,没人能训练非常深的神经网络,一旦层数增加就会遇到梯度爆炸、梯度消失等训练稳定性问题;而ResNet提出后,理论上可以堆叠任意数量的网络层,无需再担心训练稳定性问题。

他引用了行业专家的演讲观点:残差连接本质上是LSTM的一种变体,只是将循环方向旋转了90度。可以这样理解:LSTM是循环网络的一种,处理过程是循环的,每一步都会将上一步的隐藏状态通过门控机制转换为当前状态;而残差连接在深度维度上做了同样的事,将上一层的输出通过特定函数处理后生成当前层的输出,只是具体计算形式不同。例如残差连接采用固定加法,将上一层的隐藏状态与当前层输出直接相加,本质上是将循环网络的逻辑迁移到了深度维度。

由此团队想到了一个新方向:既然深度维度可以套用LSTM的逻辑,那么能否用注意力机制替代原本类似LSTM的门控函数?毕竟注意力机制在Transformer时代已经证明了自身的强大能力。具体实现方式为:每一层的输出不再仅依赖上一层的隐藏状态,而是将所有历史层的隐藏状态纳入考虑,通过注意力操作聚合这些历史隐藏状态,计算出当前层的状态。团队将该思路称为“将注意力旋转90度”,可以看作是残差连接在该类比下的自然延伸。

为了控制通信与内存开销,团队还设计了更高效的变体——分块注意力残差。具体做法是将神经网络的所有层划分为若干个块,例如每块16层或4层,仅在每个块的输出上应用注意力残差,块内部继续沿用标准的残差连接。这种方式可以大幅降低开销,同时训练精度几乎不受影响。

从实际效果来看,该新架构在Scaling Law层面将Token效率提升了24%:原本50万亿高质量Token能达到的效果,现在相当于凭空多出了约60万亿Token。验证集损失也持续低于原有架构的曲线,说明该优化过程更加稳定。在编程、数学与推理密集型任务上提升最为显著,团队在多个权威基准测试上均观察到了明显的性能提升。

行业思考与未来展望

团队负责人认为,当前时代的研究思路与过去有显著不同。十年前的研究更侧重发表新想法,但很难开展严谨的实验验证,难以得出扎实的结论。而现在有了所谓的“扩展阶梯”,团队有足够的资源在不同规模上训练与验证模型,配合整套基准测试来衡量进展,因此更容易得出有把握的结论。这也是为何许多看似成熟的老技术,近期又涌现出新进展的原因之一。

他最后总结,团队会继续在Token效率、长上下文、智能体数量这三个维度上扩展模型,未来会看到不同架构与优化器同时在这三个维度上进行优化,也会不断发现新的扩展维度,智能体蜂群范式并非终点。

Kimi K3将于7月27日前开源,待各推理服务商推出K3的部署版本后,行业对相关技术的讨论或将迎来新的变化。

以上内容不代表本平台立场,仅供读者参考