文章摘要
近期,Kimi研发团队推出新一代视觉 - 语言大模型Kimi K3,总参数量2.8万亿,7月27日前将发布模型权重。它采用多项创新技术,训练效率提升约2.5倍。在多评测中成绩优异,性能逼近顶尖专有模型,成本更低,有望推动AI行业进步及技术普惠。

近期,Kimi所属的研发团队推出了新一代视觉-语言大模型Kimi K3,这款模型不仅超越了上月刚发布的GLM-5.2及多款同类开放模型,在主流基准测试中的综合表现仅落后于当前最顶尖的两款专有模型GPT-5.6 Sol与Claude Fable 5。

● 产品核心信息

Kimi K3总参数量达到2.8万亿,研发团队已通过API接口开放了模型的使用权限,并宣布将在7月27日前正式发布模型权重,这将让Kimi K3成为目前公开可获取的参数量最大的开放权重大模型。

在交互能力方面,Kimi K3支持文本、图像与视频作为输入内容,单轮输入最长可达100万token;输出内容同样支持最长100万token的文本生成,生成速度稳定在每秒62个token左右。

从技术架构来看,Kimi K3采用了混合专家(MoE)Transformer结构,内置Kimi Delta Attention注意力层。这款模型总参数量达2.8万亿,每个输入token会激活896个专家中的16个,实际激活的参数量约为500亿。

Kimi K3支持可调式推理级别,当前仅开放最高级别推理模式,后续将推出低、高两级推理选项;同时内置工具调用、结构化输出与自动上下文缓存功能,能够适配更多复杂业务场景。

在第三方智能评测机构的综合榜单中,Kimi K3位列第三,是所有开放权重模型中的第一名;在开发者社区评测平台的Web开发专项排行榜中,Kimi K3也登顶榜首。

用户可以通过Kimi官网、Kimi移动端应用、Kimi Work办公应用以及Kimi Code CLI工具使用该模型。定价方面,输入token每百万收费3.00美元,缓存token每百万收费0.30美元,输出token每百万收费15.00美元。当前Kimi应用会员体系从免费版到每月199美元不等。不过目前仍有部分核心信息尚未公开,包括模型实际激活参数数量、训练所用的数据集与训练方法,以及即将发布的模型权重所采用的开源许可证类型。

● 核心技术创新

Kimi K3的性能突破离不开两项自研的架构改进技术:Kimi Delta Attention与Attention Residuals。其中,Kimi Delta Attention能够大幅降低长文本输入场景下注意力机制的内存占用与计算开销。而Attention Residuals则允许模型的每一层自主选择引用更早层的输出,而非像传统Transformer那样对所有前层输出进行等权叠加。

研发团队表示,这两项技术改进,搭配更优化的混合专家稀疏设计与全新的训练数据配方,让Kimi K3的训练效率相比前代模型提升了约2.5倍——这里的效率指的是在相同计算资源投入下,模型性能的提升幅度。团队透露,更多技术细节将在即将发布的官方技术报告中公开。

具体来看,Kimi K3在每四层注意力层中就有三层采用了Kimi Delta Attention。这项技术属于线性注意力机制:它不再让每个新token与之前所有token逐一进行注意力计算,而是通过维护一块固定大小的记忆模块,在读取输入内容的过程中持续更新记忆,并自主决定何时用新信息覆盖旧的记忆内容。早在2025年推出的实验模型Kimi Linear中,Kimi Delta Attention在处理100万token长度的输入时,最高可将内存占用降低75%,同时将输出速度提升最多6倍。

在残差连接方面,Kimi K3采用了Attention Residuals替代传统的标准残差连接。传统标准残差连接会将每一层的输出以相同权重累加到一个累计值中,随着网络层数增加,每一层单独的贡献会被不断稀释。而Attention Residuals则在网络的深度方向上应用注意力机制,让每一层能够有选择地引用前面各层的输出,就像标准注意力机制能够有选择地关注前面的输入token一样。

研发团队在今年早些时候的实验中开发了两种Attention Residuals的实现形式:一种是在所有之前层的输出之间进行全局注意力计算;另一种则是Kimi K3所采用的块级注意力残差,即将模型的各层划分为若干模块,再对这些模块的输出进行注意力计算。采用块级Attention Residuals的模型,在性能与采用标准残差连接的模型相当的前提下,训练计算量减少了20%。

● 实测性能表现

在独立第三方测试中,Kimi K3在智能通用能力、智能体任务以及编程开发能力方面均超越了所有同类开放权重模型,仅在少数顶尖专有模型面前稍显逊色。

在第三方智能评测机构的Intelligence Index综合榜单中,开启最高推理模式的Kimi K3获得57分,仅次于开启最高推理并启用fallback机制的Claude Fable 5(60分)与开启最高推理模式的GPT-5.6 Sol(59分)。与它最接近的开放权重模型是同期发布的GLM-5.2,其得分仅为51分。

在AutomationBench-AA商业自动化评测中,开启最高推理模式的Kimi K3以53%的准确率位居所有模型第一。在GDPval-AA v2金融医疗法律专项评测中,Kimi K3的1668 Elo评分仅落后于Claude Fable 5(1760 Elo)与GPT-5.6 Sol(1743 Elo)。

Kimi K3首次登场便登顶开发者社区评测平台的Code Arena WebDev排行榜。该榜单通过让开发者对同一前端Web开发任务中两个模型的输出进行优劣投票来生成排名,发布初期Kimi K3获得了1679 Elo的初始评分,在七个前端开发领域中的六个领域排名第一。

开启最高推理模式的Kimi K3完成Intelligence Index单项任务的成本约为0.95美元,这一成本接近GPT-5.6 Sol的1.04美元,比Claude Fable 5的2.75美元低不少,但略高于GLM-5.2的0.47美元。

● 行业竞争格局

过去一年间,开放权重大模型领域的竞争始终十分激烈,各款模型的性能排名不断更迭。而Kimi K3的发布,标志着开放模型距离当前行业最顶尖水平已经非常接近——上一次开放模型达到如此接近顶尖专有模型的表现,还要追溯到2024年Llama 3的发布。

此前,Kimi系列的K2推出了1万亿参数量的模型系列,随后K2.5与K2.6先后成为第三方智能评测机构榜单中的第一开放权重模型。市场竞争并未放缓:就在上月,国内某AI企业推出的GLM-5.2登顶开放模型榜单,且其推理成本仅为顶尖专有模型的四分之一。而在Kimi K3发布三天后,作为Kimi研发团队投资方的阿里巴巴推出了Qwen3.8-Max-Preview,这是一款2.4万亿参数量的大模型早期预览版,阿里官方表示该模型的表现仅次于Claude Fable 5,并承诺未来将开放其模型权重。

● Kimi K3的行业价值

Kimi K3的推出正在逐步削弱开发者选择顶尖专有模型的核心理由。它的性能仅比Claude Fable 5低3分,但单任务推理成本远低于后者。当模型权重正式开放后,开发者将能够对Kimi K3进行微调、蒸馏以及更深入的底层研究,完全自主掌握模型的使用政策——而不像专有模型那样受到平台的诸多限制,许多Claude Fable 5会拒绝响应的请求,在Kimi K3用户眼中将不再是障碍。

此外,这种性能与价格的激烈竞争,也会倒逼顶尖专有模型厂商推出性能更强、价格更亲民的产品,最终推动整个AI行业的整体进步。

● 行业观察

Kimi K3的效率提升,主要源于Kimi Delta Attention线性注意力机制、重新设计的残差连接以及更优化的稀疏模型设计等多项技术创新。其中两项技术创新已经以论文与开源代码的形式公开发表。当受到计算资源限制的实验室通过架构创新突破行业瓶颈,并将研究成果公开共享时,整个AI开发者社区都将从中受益,这也将进一步加速大模型技术的普惠化进程。

以上内容不代表本平台立场,仅供读者参考