Kimi K3 2.8万亿参数开源,综合性能超越多闭源模型

近日,Kimi K3大模型正式开源,该模型总参数量达2.8万亿,实际激活参数为1040亿,支持最长100万token的上下文窗口,同时内置原生视觉理解能力。根据公开的技术评估报告,Kimi K3的综合性能暂时落后于当前最顶尖的两款闭源模型Claude Fable 5与GPT-5.6 Sol,但已经全面超越Claude Opus 4.8、GPT-5.5以及GLM-5.2,是目前全球范围内首个公开的3万亿参数级别开源大模型。
你可以通过下方链接获取模型权重:官方模型下载地址
不过这份技术报告并未披露Kimi K3及其视觉编码器的训练token用量与算力投入细节。
完整技术报告可通过以下链接查看:技术报告详情
核心架构升级方向
Kimi K3的核心架构升级主要围绕三个核心方向展开:优化超长序列处理能力、提升深层网络对浅层信息的利用效率、优化混合专家网络的调用效率。
首先是注意力机制的革新。Kimi K3采用了名为Kimi Delta Attention(KDA)的线性注意力方案,每个模块内搭配3层KDA与1层传统全局注意力(Gated MLA),既可以高效处理超长序列,又不会丢失全局上下文信息。本次更新中,团队还将MLA层修改为无位置编码(NoPE)版本,位置信息完全通过KDA的门控衰减机制隐式传递,这可能是首个将线性注意力与NoPE结合的混合架构,此前同类模型的全局注意力层通常仍保留RoPE位置编码。团队同时优化了KDA的衰减机制,将原本可能出现数值溢出的设计替换为带有下界的版本,让计算可以完全适配张量核心加速,这也体现了硬件条件对算法设计的反向塑造。
其次是Attention Residuals机制的优化。该机制允许每一层网络在接收上一层输出的同时,有选择地回溯更早层的信息,而非像传统残差连接那样将所有历史信息压缩为单一状态向下传递。值得注意的是,这套跨层注意力机制本身也未使用位置编码,这也引出了一个尚未有定论的开放问题:对于这类跨层回看的注意力架构,位置编码的必要性究竟有多大。为了控制该机制的计算开销,研发团队将93层的网络划分为8个模块,仅在模块之间执行全量跨层注意力,大幅降低了计算与显存消耗。
第三是混合专家网络的稳定性优化。Kimi K3将专家数量从上一代K2的384个扩展至896个,每个token激活的专家数从8个提升至16个,模型稀疏度从K2的48倍提升至56倍。有行业分析指出,该模型仍有进一步提升稀疏度的空间,真正的性能瓶颈可能来自显存容量,而非模型本身的能力上限。随着专家数量的增加,两个核心问题随之浮现:一是数值容易出现爆炸式增长,二是专家负载难以保持均衡。为此,团队设计了全新的SiTU-GLU激活函数,将数值幅度限制在安全范围内;同时开发了名为Quantile Balancing(QB)的负载均衡算法,该算法延续了DeepSeek的设计思路,不再直接使用带偏置的分数进行加权,而是通过归一化处理实现权重分配,并且利用上一个批次的数据估算当前批次的专家阈值,保证训练过程的因果性。这套设计思路获得了行业内的不少好评,配套的直方图估计方法(用于在数百万token规模上快速估算分位数)也被认为是巧妙的工程解法,但也有观点认为,训练早期的估算结果可能存在较大噪声,需要额外的预热机制来优化。
视觉方面,Kimi K3的图像编码器MoonViT-V2完全从零开始通过next-token预测任务训练,并未像上一代模型那样借助对比学习进行初始化。研发团队发现,这种训练方式反而让模型更加稳定,梯度尖峰更少,且最终效果并未打折扣,这也意味着在大模型时代,对比预训练可能不再是必须的前置步骤。
训练效率显著提升
综合上述架构改动,再配合数据与训练方法的优化,Kimi K3相比上一代K2的整体训练效率提升了约2.5倍。同时,模型的训练上下文长度从K2的128K扩展至100万token,通过四阶段课程学习逐步扩展窗口大小,并且配合专门合成的超长文本训练数据,避免模型在长序列任务中退化为仅关注局部信息的模型。
后训练与微调流程
Kimi K3的后训练流程分为三个核心步骤:第一步是监督微调,以高质量的复杂智能体轨迹数据作为训练基础;第二步是强化学习,分别在通用任务、通用智能体、编程智能体三个大类上进行训练,每个类别再细分三档推理强度,最终训练出九个专业模型;第三步是多教师同策略蒸馏,将九个专家模型的能力整合进一个统一的最终模型。
在强化学习基础设施方面,Kimi K3延续了co-located(协同部署)的强化学习训练架构,这种方案可以将百万token级别的强化学习实验控制在数百张GPU的规模内,而在当前的参数规模下,业内很少有团队坚持使用这套方案。此外,报告中还提及了多种任务生成机制:包括基于知识图谱的题目自动生成系统,可从网络抓取真实资料自动出题;覆盖CUDA、Triton等多种编程方式的GPU内核优化题库;以及模拟真实办公软件的长周期助理任务环境,单次任务可能涉及上千次工具调用。
为了降低部署成本,Kimi K3从后训练阶段就采用MXFP4低精度格式训练专家权重,训练与推理使用同一套量化方案,避免了因量化方案不一致导致的性能下降问题。
训练与推理基础设施优化
要支撑2.8万亿参数的训练与百万token级别的强化学习,仅靠算法优化是不够的。研发团队为KDA开发了专门的融合内核FlashKDA,同时设计了跨设备的上下文并行方案,解决了传统超长序列切分方法中丢失状态依赖的问题。
针对混合专家网络训练中的负载不均衡问题,团队开发了名为MoonEP的专家并行方案,通过动态调度冗余专家,让每张GPU卡处理的token数量保持严格相等,彻底消除了负载不均衡带来的显存碎片与吞吐损失。与DeepSeek的DeepEP v2进行对比测试后发现,MoonEP的通信耗时几乎不受负载不均衡程度的影响,而DeepEP v2会随着不均衡程度加剧持续变慢,甚至在高不均衡场景下直接导致训练崩溃,MoonEP则始终保持稳定运行。目前,MoonEP除了支持英伟达GPU外,还在适配国内自研的AI芯片。
真武系列AI芯片是国内某科技企业旗下平头哥半导体自研的AI芯片系列,覆盖从AI模型训练到推理的全场景算力需求,是该企业数据中心的核心芯片产品线之一,目前已发布真武810E与真武M890型号。在推理阶段,团队设计了可同时管理两种缓存的前缀缓存系统,让百万token级别的对话前缀可以被复用,避免每次对话都需要重新计算上下文。值得一提的是,MoonEP已经正式开源。
开源视觉评测基准
除了模型本身,研发团队还同步发布了两项配套内容,其中一项是全新的视觉感知评测基准PerceptionBench,专门用于评估多模态模型最基础的原子级视觉感知能力。团队从42个现有基准中模型出错的案例出发,反推出10种最基础的感知能力,包括计数、深度感知、目标定位、细粒度识别、幻觉识别等,据此构建了3000道单一能力考察题目,这些题目仅需通过视觉观察即可答对,不需要额外的推理与背景知识。
测试结果显示,16个主流多模态模型的准确率均未超过60%,其中感知类幻觉是所有模型平均表现最差的一项,且不少总分相近的模型,实际感知能力存在较大差异。该评测基准已经正式开源,你可以通过基准详情页了解更多信息。
实际落地测试案例
技术报告中展示了多个实测案例:在GPU内核优化任务中,每个模型拥有24小时的独立完成时间,Kimi K3将一个注意力残差内核的延迟从283.6毫秒降至114.4毫秒,整体性能与Claude Fable 5持平;Kimi K3还独立开发了一款类似Triton的编译器MiniTriton,覆盖了从前端设计到底层代码生成的全流程;在更具挑战性的芯片设计测试中,团队让Kimi K3在48小时内自主完成了一个推理芯片原型的设计、优化与验证全流程,最终产出的设计方案每秒可实现8700token的解码吞吐,相关代码已经开源。
此外,Kimi K3还在科研论文复现(两小时完成一篇天体物理论文的完整数值流程,而普通研究者通常需要1至2周)、知识工作生成、视频剪辑等场景中展现了出色的性能。
开源许可与总结
Kimi K3的开源协议附带了部分商用限制条件:如果将该模型作为模型即服务业务且年收入超过2000万美元,需要单独与研发团队进行授权;如果产品的月活跃用户超过1亿或月收入超过2000万美元,则需要在产品界面上展示Kimi K3的字样。你可以通过许可协议详情查看完整条款。


