Kimi K3开源:技术报告详解百万上下文与长任务能力

近日,Kimi K3大模型正式开放完整权重,配套的技术报告也同步对外发布。这款模型拥有2.8万亿总参数、1040亿激活参数,分为96个Safetensors分片,整个模型仓库体积达到1.56TB。
不少人看到这样的参数规模第一反应会关注部署门槛,但对于大部分开发者而言,更值得先深入研读的是这份公开的技术报告——它并没有单纯强调模型的体量,而是重点解答了一个更具挑战性的问题:如何让智能体连续完成数千步任务,全程保持任务记忆不丢失,同时避免通过钻评分规则空子获得虚假高分。
2.8万亿的总参数只是基础的规模铺垫,如何让智能体在长周期任务中保持逻辑连贯、不偏离任务目标,才是这份技术报告的核心亮点。
百万级上下文的双记忆机制
Kimi K3支持1048576token的上下文窗口,这样的长度足以处理超大规模的输入内容。其上下文窗口的扩展过程分为两个阶段:预训练阶段从8K逐步提升至64K,在cooldown阶段再从256K进一步拉到1M token。
当上下文窗口大幅扩展后,一个新的问题随之而来:如何在不增加计算成本的前提下,高效调取历史上下文信息,而不必每次都从头遍历所有内容。
针对这个问题,Kimi K3的主干网络采用了“三层KDA加一层Gated MLA”的循环结构,最后再叠加一个全局注意力层,构建了双维度的上下文管理机制。
我们可以简单类比为:KDA就像是工作台上的便签本,维护一个固定大小的循环状态,用于实时更新当前任务最核心的信息,其计算成本不会随着历史上下文的长度无限膨胀;而MLA则更像档案室,不需要在每一层都启用,但会周期性地进行全局内容交互,让模型能够回溯查看完整的历史上下文。三层KDA负责处理当前任务的即时信息,一层MLA用于周期性复盘完整上下文,最后再通过全局注意力层做最终的一致性检查。
深层网络的信息回溯优化
Kimi K3的网络总层数达到93层,其中69层为KDA模块,剩余24层为Gated MLA模块。随着网络层数加深,信息不仅会在时间维度上逐渐淡化,还会在层与层的传递过程中出现损耗——早期层提取的关键特征,经过数十层的加工后可能已经面目全非。
为了解决这个问题,Kimi K3引入了Block Attention Residuals模块。
和传统的残差连接不同,Block AttnRes允许当前层直接调取更早深度块中提取的特征表示。Kimi K3将整体网络划分为8个十二层的模块,再加上一个不完整的末尾模块,让深层网络不必仅依赖前一层的传递结果,能够直接回溯更早的特征信息。
这一设计和上下文窗口的作用完全不同:上下文窗口决定了模型能够承载的历史信息量上限,而Block AttnRes则解决了深层网络中历史特征的高效调取问题。
混合专家模型的高效激活
Kimi K3属于混合专家模型,总共包含896个路由专家。在处理单个token时,模型仅会选择其中16个专家进行激活,再加上2个共享专家。这也解释了为何它同时拥有2.8万亿总参数和1040亿激活参数:就像一个大型团队,每次仅会调动部分成员参与具体任务。
为了进一步提升效率,Kimi K3对专家权重采用MXFP4量化、对激活值采用MXFP8量化,并配合了量化感知训练。技术报告中提到的约2.5倍scaling efficiency,是基于拟合的scaling-law曲线计算得出的。
需要注意的是,这里的“2.5倍scaling efficiency”并非指推理速度提升2.5倍,二者的概念并不相同。
同时,“每次仅激活1040亿参数”也不意味着部署时仅需要加载1040亿参数,完整的稀疏权重仍然需要全量存储和分发,这也是整个模型仓库体积达到1.56TB的原因。
多教师蒸馏的后训练体系
架构设计解决了信息流动的问题,而后训练环节则聚焦于如何让智能体具备完成实际任务的能力。
Kimi K3的后训练流程包含SFT、强化学习以及Multi-Teacher On-Policy Distillation三个阶段。研发团队将训练任务划分为三个核心领域:
- 通用任务场景
- 通用智能体场景
- 编码智能体场景
每个领域又按照推理强度分为low、high、max三个档位,最终形成了9个专项教师模型。研发团队通过多教师策略蒸馏,将这9个教师模型的能力整合到同一个基础模型中。
这个设计逻辑类似组建一支多维度的教练团队:有的教练负责基础能力打磨,有的专注工具使用训练,有的专攻代码能力培养,最终将所有教练的经验整合到同一个选手身上。
值得关注的还有训练环境的设计:研发团队构建了一套统一的白盒强化学习环境,会主动调整工具接口、提示词模板、上下文管理规则、技能库以及智能体测试框架。
这样设计的原因很务实:如果智能体仅在固定的工具和提示词组合下获得高分,很可能只是记住了特定的测试场景,而非真正掌握了解决问题的能力。
防范智能体的“骗分”行为
长周期任务有一个普遍的痛点:任务步骤越多,设计标准化的标准答案就越困难。
为此,Kimi K3采用了Autonomous Execution Tasks训练模式:系统仅提供任务目标、可用工具、预算限制和独立验证器,不会为模型提供现成的参考执行路径。智能体可以自主探索完成任务的路径,最终仅根据任务是否真正完成来进行评估。
但如果验证规则完全公开,智能体可能会学会刻意迎合评分规则来获得高分。为此,技术报告中加入了隐藏验证器和有限提交预算机制,有效防范奖励 hacking 行为。
这个逻辑和编写代码时仅运行自己编写的测试类似:测试全部通过不一定代表修复了真正的问题,也可能是出题者和答题者共享了同一个认知盲区。隐藏验证器的作用,就相当于引入了一双没有参与试题编写的独立评审眼睛。
长周期任务还需要稳定的执行环境。AgentENV采用了可恢复的Firecracker microVM沙箱,支持任务的暂停、恢复、分叉和快照功能。根据技术报告描述,该环境可以支撑跨越数个模拟日、数千次工具调用以及数百万上下文token的长程个人助理任务。
专项教师模型负责传递能力,动态调整的测试框架负责模拟多样化的任务场景,AET模式负责客观验收任务完成结果,AgentENV则保障任务不会在执行中途中断。至此,Kimi K3的智能体训练链路才算完整搭建完成。
需要特别说明的是,目前公开的仅为完整模型权重和技术报告,虽然报告中详细描述了AgentENV和强化学习环境,但相关训练基础设施并未随模型权重一同开源。
亮眼的评测成绩与评测条件
Kimi K3在编码、通用智能体以及视觉智能体任务上的评测结果都十分亮眼,各项指标均有公开的详细数据支撑。
但在进行横向对比时,需要注意两个核心评测条件:Kimi K3的评测采用了max reasoning effort模式,温度系数设置为1.0。同时,智能体任务的表现会受到工具支持、上下文管理方式以及测试框架的显著影响。
因此,公开的评测数据仅能说明Kimi K3在官方设定的评测条件下达到的性能水平,暂时不适合被简单概括为“全面超越某类模型”。
但这并不会削弱这份技术报告的价值,恰恰相反,完整的架构设计、后训练流程以及评测条件的同步公开,让行业能够清晰了解各项性能指标的由来。
总结与思考
Kimi K3的正式开源,最直接的意义是让全球开发者都能够获取完整的模型权重。
但对于大部分读者而言,这份技术报告中更具参考价值的是其背后的设计思路:长上下文能力并非仅仅扩大窗口尺寸,更需要配套高效的上下文记忆机制;智能体也并非仅仅具备工具调用能力,还需要稳定可恢复的执行环境、独立的验证机制以及能够防范作弊的任务场景。
这些设计思路并非仅适用于Kimi K3这一款模型。
未来在评估其他智能体模型时,我们可以多思考四个核心问题:它如何保存长周期任务的状态?如何跨层回溯历史特征信息?训练过程中如何动态调整工具和环境?最终由谁来验证任务是否真正完成?
这四个问题,远比单纯记住模型的参数量更有参考价值。


