文章摘要
Kimi K3大模型架构升级,其核心价值并非开源权重的亮眼数据。它瞄准大模型发展困境,在架构上从序列、深度、宽度维度优化,解决扩展难题;在长程智能体方面,采用新机制解决训练与环境保存问题。虽成本高,但能力强,优势在于形成完整系统,能持续完成复杂任务。

随着Kimi K3的开源权重发布,外界最先注意到的是三组亮眼数据:2.8万亿总参数量、1040亿激活参数,以及支持100万token的上下文窗口。但仔细研读其技术文档后会发现,这些数字只是技术优化的自然结果,而非这份作品的核心价值所在。

Kimi K3瞄准的是当前大模型发展中最棘手的现实困境:随着模型规模持续扩张、上下文窗口不断拉长,当智能体需要连续工作数小时时,传统Transformer架构与训练系统能否稳定支撑?上下文变长会导致KV缓存持续膨胀,网络加深会让早期信息不断被混合,专家数量增加会引发路由与负载失控,长轨迹的强化学习更会被少数慢任务拖慢整体进度,而这些问题显然不能只靠增加GPU数量来解决。

Kimi K3的技术主线,是将原本会随规模不断膨胀的计算与状态,改造为可压缩、可调度、可暂停恢复的结构。它并非简单将前代模型的参数放大近3倍,而是重新设计了大模型保存信息、调用算力以及完成长任务的完整流程。

架构重构:破解长序列、深网络与宽模型的扩展难题

Kimi K3的核心架构优化分为三个维度,分别解决Transformer在序列长度、网络深度和模型宽度上的扩展问题。

序列维度:压缩上下文缓存

针对传统注意力机制的KV缓存膨胀问题,Kimi K3引入了Kimi Delta Attention(KDA)机制。与传统方式完整保存每个token的Key和Value不同,KDA采用固定大小的递归状态来压缩历史信息,在处理更长序列时,缓存占用不会随上下文长度线性膨胀。

当然,压缩记忆必然会损失部分细节:全注意力机制可以直接回溯任意位置的原始信息,而KDA更像是一份持续更新的摘要,信息在反复写入时可能被覆盖。因此Kimi K3并没有完全采用KDA,而是在每个模块中安排3层KDA和1层Gated MLA,并在模型末尾保留全局注意力,让两者分工协作:KDA负责低成本更新长期状态,MLA定期重新检查完整上下文,在效率与信息容量之间取得平衡。

此外,Kimi K3还调整了KDA的衰减参数范围,避免部分衰减值过小导致累计计算超出BF16安全范围,迫使部分计算使用效率较低的特殊内核。通过为衰减设置下界,相关计算可以统一转换为张量核心擅长的稠密矩阵乘法,进一步适配硬件加速。

深度维度:保留多层中间特征

随着网络层数加深,传统残差连接会将每一层的输出叠加到同一个隐藏状态中,早期的词法信息、中层的结构特征会逐渐被混合,后续层难以单独提取特定阶段的特征。Kimi K3提出的Attention Residuals(AttnRes)结构,则允许当前层对前面不同深度的表示进行加权选择。

与传统残差连接只保留最终叠加结果不同,AttnRes会保留多个中间版本,后续网络可以根据需要重新调用,就像保留多份修改记录而非只存储最终文件。为了控制显存与通信成本,Kimi K3并没有保留全部93层的独立输出,而是按照约12层为一个Block进行聚合,再对不同Block的表示进行选择,在灵活性与资源占用之间取得折中。

AttnRes使用的查询主要是每层学习得到的伪查询,并非像标准注意力那样完全由当前token动态生成,比固定残差连接更灵活,但仍有一定的使用限制。尽管如此,AttnRes仍是Kimi K3中最容易被其他模型借鉴的设计:它不依赖超大参数规模,也不必搭配其他特殊架构,解决的是所有深层神经网络都会遇到的特征丢失问题。不过目前还无法断言它会成为新的标准结构,官方报告将整体效率提升归因于架构、数据与训练配方的共同作用,并未单独拆分AttnRes的贡献,其实际价值还需要更多外部验证。

宽度维度:优化MoE的通信与负载

Kimi K3每层拥有896个路由专家,每个token会选择其中16个进行激活。更大的专家池可以提升模型容量,但也会增加通信开销、显存读取压力、激活异常风险与负载不均衡问题。传统MoE会将完整的高维隐藏状态发送给选中的专家,激活的专家越多,数据传输量越大。

Kimi K3采用的LatentMoE架构,先将7168维的隐藏状态压缩至3584维,让路由专家在低维空间中完成计算,再将结果映射回原始维度。这种设计既可以增加专家总数和每个token激活的专家数量,又不会让通信量随隐藏维度同步增长。为了稳定连续降维、专家计算与升维过程中可能出现的异常激活,Kimi K3在专家聚合后加入了RMSNorm,并使用SiTU-GLU代替SwiGLU:SiTU-GLU相当于一个平滑的限幅装置,数值正常时保留SwiGLU的特性,数值过大时则会限制增长,降低低精度训练中的溢出风险。

解决了数值稳定性问题后,Kimi K3还针对MoE的负载均衡问题提出了Quantile Balancing机制。传统方法会根据专家当前的过载或空闲状态,以固定步长调整路由偏置,但当专家数量接近900时,步长过小会导致调整过慢,步长过大则可能引发过载与空闲之间的反复震荡。Quantile Balancing会根据整批路由分数的分位数,直接估算每个专家需要的偏置以接近目标负载,而非逐步尝试调整。此外,训练系统中的MoonEP还会为热门专家创建动态副本,让不同设备接收到相同数量的token,让算法层面的路由优化与硬件层面的执行优化相结合,解决极端稀疏MoE的现实瓶颈。

长程智能体:从单次生成到持续执行

架构优化决定了模型能容纳的信息与能力上限,但要让智能体连续工作数小时,真正的难点往往出在强化学习系统中。真实的智能体任务很少在几步内完成:编程智能体需要阅读代码、运行测试、修改文件、等待编译并排错;研究智能体可能需要搜索网页、下载资料、制作表格并反复核对结论,一条完整的任务轨迹可能包含数百甚至数千次工具调用。

传统的同步强化学习会等待同一批任务全部完成,只要其中有几个任务特别慢,整批GPU资源就会被拖住。Kimi K3采用了partial rollout机制:只要一部分轨迹完成,系统就会先使用这些数据更新模型,尚未完成的轨迹则暂停,之后再恢复执行。这种设计让长任务不再阻塞整批训练,但也带来了数据陈旧的问题:一条任务轨迹可能跨过数次模型更新,前半段与后半段不再来自完全相同的策略。为了解决这个问题,Kimi K3通过逐token正则限制每次策略的变化幅度,让训练能够容忍这种高度非策略的数据,接受长程智能体训练必然存在的异步与延迟,而非强行维持整齐的同步流程。

另一个复杂的问题是如何保存外部环境:仅保存聊天记录无法恢复智能体的完整工作现场,模型可能已经修改了文件、安装了软件、启动了进程或生成了大量中间结果,任务恢复时需要同时恢复文件系统与进程状态。Kimi K3的AgentENV使用Firecracker microVM,支持暂停、恢复、复制与快照,官方披露训练与评估期间一共创建了超过5100万个sandbox。真正重要的并非这个数量,而是sandbox可以在等待模型推理时暂停,避免持续占用CPU与内存,并在模型生成下一步动作后快速恢复,让数小时的智能体轨迹能够反复暂停与继续,让长程任务真正进入强化学习阶段,而非仅停留在产品演示中。

这种长程执行能力在Kernel优化任务中表现得尤为直观。以AttnRes Kernel优化为例,Kimi K3并非一次性生成代码就结束,而是在十几个小时内持续尝试、测试与修改,不断刷新当前最优结果,最终将相对FLA Triton基线的加速幅度提升至59.7%。这类任务考验的并非单次代码生成质量,而是模型能否在长期执行中保留进度,并根据每次运行结果持续调整方案。

在DSA Kernel优化任务中,Kimi K3在近24小时的持续实验中,通过不断编写代码、运行测试、分析性能瓶颈并调整方案,最终将相对FLA Triton基线的加速幅度提升至55.1%,仅次于Claude Fable 5的57.3%,同时高于GPT-5.6 Sol、Claude Opus 4.8与GPT-5.5。这体现的重点并非单次代码生成的质量,而是模型能否利用大量失败结果持续修正方向,将复杂工程任务逐步推向更高水平。

在MLA Kernel优化任务中,Kimi K3经过多轮编写、测试与调整后,将性能逐步提升至518 TFLOPS,高于Claude Fable 5的493 TFLOPS,以及Claude Opus 4.8、GPT-5.5与GPT-5.6 Sol。相比一次性生成代码,这种持续推进的能力更能体现长程智能体的价值:模型可以保留此前找到的有效方案,再通过后续实验不断抬高当前最优结果。

在KDA-GPGPU Kernel优化任务中,Kimi K3的优势更加明显:在超过20小时的持续实验中不断编写代码、测试性能并调整方案,最终将相对FLA Triton基线的加速幅度提升至73.6%,高于GPT-5.6 Sol的66.7%、Claude Opus 4.8的57.0%与Claude Fable 5的56.5%。这进一步证明,长程智能体的价值并非只是延长工作时间,而是能保留此前的有效结果,在多轮尝试中持续寻找更优的实现方案。

长程智能体仅保存状态还不够,还需要准确判断自身的执行效果,这也是Kimi K3原生多模态设计的重要价值。Kimi K3的视觉编码器MoonViT-V2采用从零开始训练的方式,并未使用预训练模型进行初始化。实验显示,使用预训练视觉编码器时,联合训练会出现更高、更频繁的梯度尖峰;而从零训练的MoonViT-V2不仅训练过程更稳定,最终视觉能力也接近预训练初始化方案。

这项设计的意义不止于让模型“具备看图能力”:Kimi K3的多模态数据包含大量代码与渲染结果的配对,例如网页、SVG、游戏、3D资产与CAD图形。模型可以先编写代码,运行后查看截图,再根据实际画面继续修改。视觉在这里并非独立功能,而是智能体的反馈通道——模型不再只能根据代码文本猜测结果是否正确,而是能够真正看到自己生成的界面、图形或视频,再发现偏差并继续修正,让Kimi K3的智能体训练形成了完整闭环:保存任务状态、持续执行工具、观察真实结果、根据反馈调整下一步动作。

性能表现与成本权衡

官方报告称Kimi K3相比前代模型获得了约2.5倍的整体scaling efficiency,这个数字表示在拟合的scaling law中,达到相同验证损失所需的计算量更少,或是在相同计算量下能够获得更低的损失。需要注意的是,这并不意味着Kimi K3的总训练成本只有前代的40%,也不代表模型推理速度提升了2.5倍。

事实上,Kimi K3的总参数从约1.04T增加到2.78T,激活参数从32.6B增加到104.2B,层数从61层增加到93层,无论是训练还是部署,它都是一个更重、更昂贵的模型。而且这2.5倍的效率提升来自多个技术模块与训练流程的共同作用,官方报告并未公开完整的逐项消融实验,也未披露全部训练细节,因此这个数字只能证明Kimi K3找到了一条更好的整体扩展曲线,无法用来证明某一个单独模块带来了2.5倍的提升。

尽管如此,更高的扩展效率最终确实转化为了强劲的模型能力:Kimi K3已经进入当前大模型的第一梯队,尤其擅长编程、搜索、专业工作流与长程工具调用。但它的优势通常建立在较高的推理投入之上——模型会执行更多步骤、使用更多输出token,并花费更长时间检查与修正结果,这与它的训练方向一致:Kimi K3追求的并非尽快给出一个答案,而是持续工作直到交付一个相对完整的结果。

这种模式在软件工程、数据分析与复杂研究场景中极具价值,但在简单问答场景中则可能显得缓慢、冗长且昂贵。官方评测混合使用了多种Agent测试套件,部分结果来自内部数据集,相关成绩更接近“模型加工具系统”的综合表现,而非完全控制变量后的裸模型对比。这并不削弱Kimi K3的成绩,只是说明进入智能体阶段后,模型能力已经很难与运行环境彻底分开——一个模型是否强大,不再只取决于参数与权重,还取决于它使用了什么工具、如何管理上下文、能够运行多少步,以及系统愿意投入多少时间与计算成本。

核心价值:从单一模型到完整系统

综合来看,Kimi K3最值得关注的并非某一个孤立的模型技巧,而是它将架构、训练与智能体基础设施连接成了一套完整系统。在架构层面,多项核心优化分别处理了不同维度的扩展问题,让模型在更大规模下依然能够稳定运行。在训练与部署层面,多项设计让持续数小时的真实任务能够真正进入强化学习流程,而非停留在演示阶段。

这才是Kimi K3相比单纯扩大参数规模更具价值的地方。当模型能够连续工作数小时时,真正决定其能力上限的,不再只是“下一句话生成得有多好”,而是它能否保存已经完成的工作、保留执行现场、看到实际结果、发现错误并继续将任务完成到底。

相关技术细节可查阅官方公开文档

以上内容不代表本平台立场,仅供读者参考