文章摘要
全球首个开源3万亿参数级别的Kimi K3正式发布,它支持100万token超长上下文窗口,原生集成视觉理解能力。权威评测显示,其在前端代码专项竞技场排名第一,整体超越同级别竞品。该模型有多项自研创新技术,保障了在2.8万亿参数规模下稳定高效训练。目前Kimi K3已开放使用,默认Max模式,后续还将新增模式。

备受期待的Kimi系列大模型终于迎来了全新升级——全球首个开源3万亿参数级别的Kimi K3正式发布。这款模型不仅支持100万token的超长上下文窗口,还原生集成了视觉理解能力,完美契合了开放、前沿、强大的产品定位。

据Kimi官方透露,在过去12个月里,团队有9个月都在冲击开源模型的参数规模上限,而Kimi K3正是这一系列攻坚的最终成果。行业内普遍认可的大模型发展规律中,参数规模是性能的核心支撑之一,这款全新模型的实际能力自然备受关注。

性能表现亮眼

根据权威第三方评测平台的最新榜单,Kimi K3在前端代码专项竞技场中排名第一,整体表现远远超越了同级别竞品Claude Fable 5。在通用人工智能分析指数中,Kimi K3取得了57分的成绩,虽然略低于顶级闭源模型Fable 5的60分与GPT-5.6 Sol的59分,但已经远超行业内绝大多数大模型,在开源模型领域保持了绝对的领先地位。

从官方发布的演示内容来看,Kimi K3在前端开发、三维模型处理、视觉图像理解以及交互设计等领域展现出了极强的能力,这也印证了其在专项场景下的技术发力方向。

核心技术突破

2.8万亿的参数规模对模型架构与训练系统提出了极高要求,需要解决超长序列注意力成本过高、深层网络信息传递不畅、高稀疏度MoE模型路由均衡困难等多个核心难题。Kimi K3的技术底座包含多项自研创新:

首先是Kimi Delta Attention(KDA)与Attention Residuals(AttnRes)的组合架构:KDA解决了长序列下注意力机制的扩展效率问题,AttnRes则可以选择性检索不同网络深度的特征表示,而非统一累积所有层的信息,二者共同构成了模型的核心架构,支撑模型突破万亿参数规模上限。

模型采用的Stable LatentMoE架构将总参数规模扩展至2.8万亿,但单次计算仅从896个专家网络中激活16个,在控制单次推理成本的同时最大化了模型容量。为了解决高稀疏度MoE的路由与负载均衡问题,团队引入了Quantile Balancing算法,通过路由得分的分位数直接完成专家分配,减少了对启发式更新和敏感超参数的依赖。

在训练阶段,Kimi K3从监督微调环节就引入了量化感知训练方案,采用MXFP4权重与MXFP8激活格式,适配了更广泛的低精度硬件部署需求。此外,团队还提出了Per-Head Muon优化方法,将传统Muon优化器扩展为针对每个注意力头独立优化,实现了超大规模训练中的灵活学习过程。

同时,Sigmoid Tanh Unit(SiTU)与Gated MLA分别增强了模型的激活控制能力与注意力选择精度,多项技术共同保障了Kimi K3在2.8万亿参数规模下实现稳定、高效的训练。据官方数据,Kimi K3的整体规模扩展效率达到了上一代产品Kimi K2的2.5倍,为超大型开源模型的训练与部署提供了完整的技术解决方案。

实际体验与开放情况

尽管Kimi K3的整体性能仍略逊于顶级闭源模型,但在公开评测套件中已经达到了前沿水平,并且在实际使用的性价比上表现优秀。除了公开的基准测试结果外,Kimi K3(Max版本)在内部评估中也展现出持续的性能提升,这些优化来自对真实用户代理工作流程中反复出现的模式与挑战的针对性优化,反映出其在端到端知识工作场景下的全面能力提升。

Kimi在发布K3时引用了一句古语:“犯其至难而图其至远者,发之以勇,守之以专,达之以强”。其中“至难”对应了超长上下文、超深网络与超大规模专家并行等技术前沿的攻坚,“至远”则指向开放前沿智能的长期目标,而Kimi K3正是这一理念下的成果。

目前,Kimi K3已经正式开放使用,当前默认的思考强度为Max模式,后续更新还将新增low和high两种模式,感兴趣的用户可以直接前往体验这款开源领域的全新旗舰模型。

以上内容不代表本平台立场,仅供读者参考