文章摘要
2026年7月27日,月之暗面将Kimi K3完整模型权重上传至Hugging Face等平台,同步发布技术报告与三项基础设施技术。该模型是全球首个近3万亿参数开放权重模型,采用MoE架构,具多项技术创新。其性能出色,编程能力登顶全球第一。开源引发行业关注与资本市场震荡,冲击闭源模式,重新定义全球AI产业格局。

2026年7月27日,月之暗面(Moonshot AI)正式将Kimi K3的完整模型权重上传至Hugging Face平台,技术报告同步发布于GitHub。Kimi K3正式开源标志着全球首个2.8万亿参数级别的开放权重模型落地,模型采用混合专家(MoE)架构,总参数达2.8万亿、激活参数1040亿,支持100万Token上下文窗口并原生具备视觉理解能力。此次开源还同步发布了MoonEP、FlashKDA、AgentEnv三项关键基础设施技术及47页技术报告。

Kimi K3正式开源

一、Kimi K3正式开源:事件全景与核心参数

1.1 开源时间线与发布历程

Kimi K3于2026年7月16日在世界人工智能大会(WAIC)前夕首次以托管服务形式亮相。月之暗面在发布时承诺完整模型权重将于7月27日前公开。2026年7月27日深夜(北京时间),月之暗面兑现承诺,将Kimi K3的完整模型权重正式上传至Hugging Face和ModelScope平台,技术报告及全部源代码在GitHub公开。从首次宣布到权重正式落地,前后历时11天。

此次开源行动不仅兑现了月之暗面对开源社区的承诺,也恰好处于美国政府内部就是否限制中国开源模型展开激烈争论的关键时刻。权重落地的当日,华盛顿关于“是否封杀中国开源模型”的争论达到白热化。

1.2 核心参数规格

Kimi K3的核心技术参数如下:

  • 总参数规模:2.8万亿(2.8T),部分文献称为2.88万亿
  • 激活参数:每Token激活1040亿
  • 架构类型:混合专家(Mixture of Experts, MoE)
  • 专家配置:896个路由专家,每Token激活16个
  • 上下文窗口:100万Token
  • 多模态能力:原生视觉理解,视觉编码器MoonViT-V2
  • 注意力机制:Kimi Delta Attention(KDA)覆盖93层中的69层,另有24层门控隐注意力(Gated MLA)
  • 关键创新:Attention Residuals(注意力残差)、Stable LatentMoE
  • 效率提升:相较Kimi K2实现约2.5倍的扩展效率提升

1.3 全球首个3万亿参数级别开源模型

月之暗面将Kimi K3称为“全球首个3万亿参数级别的开放模型”。尽管官方标注的总参数为2.8万亿,但在行业讨论中常被归入“3万亿参数级别”。这一量级的开放权重模型在开源大模型发展史上尚属首次。

在过去12个月中的9个月里,Kimi系列模型都保持着开源模型规模的上限。Kimi K3的发布使这一上限从数千亿参数跃升至近3万亿级别。

二、技术架构深度解析

2.1 混合专家(MoE)架构与稀疏激活机制

Kimi K3采用MoE架构,总参数达到2.8万亿,但每次推理仅激活其中一小部分专家。模型配置了896个路由专家,每个Token仅激活16个专家。这种高稀疏度设计使得Kimi K3在拥有巨大参数容量的同时,保持了相对可控的计算成本。

MoE架构的核心优势在于“规模”与“可用性”的平衡。通过Stable LatentMoE框架,模型在极高稀疏度下仍能保持训练稳定性。结合训练方法和数据配方的优化,这些结构性改进让Kimi K3相比Kimi K2的整体扩展效率提升约2.5倍。

月之暗面表示,在算力资源有限的情况下,借助KDA、Attention Residuals以及MoonEP等技术,模型规模化效率提升约2.5倍。这意味着单位算力产出的智能相当于原先的2.5倍。

2.2 Kimi Delta Attention(KDA):混合线性注意力机制

Kimi Delta Attention(KDA)是Kimi K3最核心的架构创新之一。这是一种混合线性注意力机制,专门为超长序列设计。KDA覆盖了模型93层中的69层,另有24层采用门控隐注意力(Gated MLA)结构。

技术报告显示,KDA与Gated MLA以3:1的比例混合,通过块级注意力残差增强跨层信息流动。这种混合设计在保持线性注意力高效性的同时,兼顾了传统注意力机制的精度优势。

与KDA配套的FlashKDA高性能计算算子也在本次开源中同步发布。官方数据显示,FlashKDA在英伟达H20上的Prefill速度相比flash-linear-attention基线提升1.72至2.22倍。

2.3 Attention Residuals(注意力残差)

Attention Residuals是Kimi K3的另一项关键技术。该技术优化了多层网络间的信息传递,让2.8万亿超大参数模型在稳定训练的同时实现推理效率提升。

其核心机制是在模型不同深度之间选择性检索表征,而非均匀地累积所有层的信息。这种方法有效缓解了超大规模深度网络中常见的梯度消失和信息衰减问题。月之暗面团队表示,Attention Residuals的引入是模型能够稳定训练近3万亿参数规模的关键因素之一。

2.4 MoonViT-V2:从零训练的视觉编码器

Kimi K3原生支持视觉理解,其视觉编码器MoonViT-V2完全从零开始训练,仅依赖后续Token预测,可直接依据语言建模目标调整编码器的表征。

在整个训练过程中,MoonViT-V2保持稳定。值得指出的是,MoonViT-V2在视觉评估中的表现与SigLIP初始化的基线模型相当。这意味着Kimi K3的视觉能力并非依赖外部预训练视觉模型,而是完全融入统一的多模态训练框架中。

2.5 三项开源基础设施技术

除模型权重外,月之暗面还开源了支撑Kimi K3训练的三项关键基础设施技术:

MoonEP:一套面向大规模MoE模型的高性能专家并行通信库,让专家并行通信在不均衡情况下仍能实现极致效率。

FlashKDA:KDA对应的高性能计算算子,在英伟达H20上的Prefill速度相比基线提升1.72至2.22倍。该算子此前已部分开源,本次随K3正式发布完整版本。

AgentEnv:月之暗面与KVCache.ai合作开发的Agent沙箱系统,支持快速快照、恢复及Fork等能力,用于大规模Agent训练环境。

三项技术覆盖了高性能通信、算子加速和分布式强化学习环境的关键链路。此次开放模型权重、技术报告及训练基础设施,意味着月之暗面不再只开放模型本身,而是进一步向开发者和研究机构展示大模型训练及智能体后训练体系。

三、性能评测与基准表现

3.1 全球智能指数排名

在独立评测机构Artificial Analysis的智能指数中,Kimi K3综合得分57分,位列全球第三,仅次于Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol。这一排名使Kimi K3成为开源模型中智能水平最高的存在。

Artificial Analysis将Kimi K3的综合表现评定为与Claude Opus 4.8和GPT-5.5处于同一区间。在长程知识工作评测中,Kimi K3的Elo得分为1547,仅次于Claude Fable 5。

在第三方独立测评机构Vals AI的综合测试中,Kimi K3得分为74.7,位列第2,超越GPT-5.6,仅次于Claude Fable 5。

3.2 前端编程能力登顶全球第一

Kimi K3在编程能力方面的表现尤为突出。在Frontend Code Arena前端代码评测榜单中,Kimi K3以1679分超越Anthropic的Claude Fable 5(1631分)和GPT-5.6 Sol(1618分),登顶全球第一。

在Frontend Code Arena涵盖的7个前端细分领域中,Kimi K3拿下了品牌营销、参考图设计、数据分析、消费产品、模拟和内容创作工具6项第一。这是开源模型首次在权威编程榜单上全面超越所有闭源模型。

从Kimi K2.6在Frontend Code Arena排名第18到Kimi K3登顶第1,短短一个版本迭代实现了17位的排名跃升。

3.3 自动化与Agent能力

在AutomationBench-AA评测中,Kimi K3以53%的得分位居榜首。这一评测聚焦于模型的自动化操作和智能体任务执行能力。

Kimi K3在自动化操作和办公类实操任务测试中优势明显。在BrowseComp基准测试中,模型展现了出色的真实世界研究与浏览能力。

3.4 复杂任务处理能力

Kimi K3展示了令人瞩目的复杂任务处理能力。据官方披露,在一份覆盖推理芯片行业42年历史的研究项目中,Kimi K3经过120多轮递归自我改进。整个过程中,它完成了2800多次网页搜索与抓取、1100多次终端数据拉取,处理了87份季报和99份原始PDF,合计超过11000页资料。

在引力波分析案例中,模型调用20个以上并发子Agent处理391个事件。在测试中,Kimi K3能自主完成GPU内核优化、从零构建GPU编译器,甚至独立设计出一款为其自身架构服务的芯片。

四、开源许可证与使用条款

4.1 Kimi K3 License:MIT基础之上的分层设计

Kimi K3采用自定义的Kimi K3 License协议。协议主体部分与MIT协议无异,任何人可免费使用、复制、修改、分发、再许可与销售,可部署、微调、构建衍生模型。

月之暗面在官方材料中并未将Kimi K3 License描述为“开源许可证”,而是统一使用“开放权重”(open weight)这一表述。

4.2 附加商业条款

Kimi K3 License附加了两条关键商业条款:

第一,MaaS营收门槛条款。 若被许可方向第三方提供推理或微调访问、且第三方对输入、参数或训练数据有实质控制权,当该主体及其关联方在任意连续12个月内收入超过2000万美元,须与Moonshot另行签订协议。

第二,大规模用户产品条款。 任何商业产品或服务若月活跃用户超过1亿,或月收入超过2000万美元,须在其界面中显著标注“Kimi K3”。

上述条款不适用于纯内部使用,也不适用于通过月之暗面自有产品及其认证推理合作伙伴的访问。这一License设计被业界评价为“小开发者和研究者零门槛,大玩家该付钱付钱”。

4.3 开发者使用权限

根据Kimi K3许可证,任何人都可以下载并部署该模型,无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。开发者可以进行微调、二次开发和构建衍生模型。模型权重已在Hugging Face上线,技术报告及全部源代码已在GitHub公开。

五、开源生态与行业影响

5.1 全球开发者社区反响

Kimi K3开源后迅速引发全球AI行业的广泛关注。Hugging Face CEO发文欢迎Kimi K3的上线。北美AI基础设施创企OsmanticAI的创始人兼CEO将Kimi K3称为“本地版Fable 5”,并“强烈建议大家下载体验”。

开发者社区的反应热烈。有开发者在社交平台X上发帖称其“碾压谷歌”“将成为开源社区的又一个DeepSeek时刻”。美国著名科技记者罗伯特·斯考伯转帖并表示“我的信息流里全是Kimi K3的消息”。

特斯拉CEO埃隆·马斯克在相关评测下留言称“令人印象深刻”。

5.2 资本市场连锁反应

Kimi K3开源引发了全球资本市场的剧烈震荡。华尔街分析师估算,OpenAI与Anthropic的合计估值预期因此蒸发约3140亿美元。英伟达单日市值缩水1111亿美元。

在中国市场,月之暗面的国内竞争对手Z.ai港股盘中跌30%,MiniMax跌16%。月之暗面日收入增长至少6倍,估值从200亿美元向500亿美元攀升。彭博社评价称,Kimi K3“正在搅动全球科技市场”。

5.3 政策与地缘政治影响

Kimi K3的开源引发了美国政府层面的关注。白宫科技政策办公室主任公开指控其“蒸馏”Anthropic技术,财政部长放话制裁。

然而,英伟达、微软、Meta等25家美国公司联名上书,反对封杀开源模型。值得注意的是,OpenAI、Anthropic、Google三家均不在首批联名名单上。

BBC报道指出,Kimi K3的突破表明中国AI企业正在绕过美国的监管壁垒和硬件销售限制,独立推进技术发展。这一进展颠覆了西方长期以来认为中国开发者落后于美国同行的假设。

5.4 对闭源商业模式的冲击

Kimi K3开源对闭源AI商业模式构成了直接冲击。摩根士丹利评价称,Kimi K3证明中国大模型在模型规模、性能、定价三个层面对美国头部模型实现了“全方位追赶”。高盛则认为,中国AI开源模型的智能表现已达到全球大规模普及的关键节点。

OpenAI战略负责人公开抨击Kimi K3,认为开放权重模型会削弱前沿模型的商业回报,称其为“减速主义力量”。但与此同时,他也承认K3“性能优异,无法依靠蒸馏实现”。

月之暗面创始人杨植麟此前表示,希望通过比美国封闭系统更高的开放度与易用性来赢得用户。

六、横向对比:Kimi K3与其他主流开源模型

对比维度 Kimi K3 (Moonshot) DeepSeek-V3 Llama 3.1 405B (Meta) Qwen 2.5 72B (阿里) Inkling (Mira Murati)
总参数 2.8万亿 671B 405B 72B 9750亿
架构类型 MoE(896专家) MoE Dense Dense MoE
激活参数/Token 1040亿 ~37B 405B 72B 410亿
上下文窗口 100万Token 未公开 128K 128K 未公开
多模态能力 原生视觉(MoonViT-V2) 文本为主 文本为主 文本+视觉 文本为主
开源协议 Kimi K3 License(类MIT+营收条款) 自定义 Llama 3社区许可证 通义千问许可证 未公开
全球智能排名 第3位 未进前三 中游 中游 前列
Frontend Code Arena 1679分(第1) 未公开 未公开 未公开 未公开

数据来源说明:Kimi K3数据来自月之暗面官方技术报告及多家媒体报道;DeepSeek-V3数据来自Nature期刊评测框架及学术文献;Llama 3.1 405B数据来自行业评测;Qwen 2.5 72B数据来自行业评测;Inkling数据来自行业报道。各模型的具体评测条件可能有所不同,对比仅供参考。

从横向对比可以看出,Kimi K3在总参数规模、上下文窗口长度和前端编程能力三个维度上均显著领先于其他主流开源模型。其2.8万亿的总参数是DeepSeek-V3(671B)的4倍以上,是Llama 3.1 405B的近7倍。100万Token的上下文窗口也是当前开源模型中最长的配置之一。

七、技术报告核心内容披露

7.1 47页技术报告概览

与模型权重同步发布的技术报告共计47页。报告披露了模型训练与架构设计的多项技术细节。报告内容涵盖:

  • KDA与Gated MLA混合注意力结构
  • Stable LatentMoE专家路由机制
  • MoonViT-V2视觉编码器训练方案
  • 模型后训练和评测方法
  • 通用推理、通用Agent和编程Agent三大领域的训练与评估

7.2 训练方法论

Kimi K3在通用推理、通用Agent和编程Agent三大领域进行了大规模任务合成。训练配备了百万Token上下文的强化学习基础设施,并在近20个内部评测集上完成了完整评估。

月之暗面团队还在技术报告中披露了MoonClip二阶优化器等创新技术。据官方介绍,MoonClip能让20T训练数据跑出40T的效果,同等性能下训练成本和算力功耗直接减半。

7.3 后训练与评估体系

Kimi K3的后训练体系覆盖了从模型微调到部署的全流程。评估体系包含近20个内部评测集,涵盖通用推理能力、Agent任务执行能力和编程能力等多个维度。

八、应用场景与落地实践

8.1 长程编程与软件开发

Kimi K3面向长程编程场景设计。在极少人工监督的情况下,它可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。

Kimi K3也擅长结合软件工程与视觉推理的任务。它能够利用截图和视觉反馈,优化游戏开发、前端开发和CAD等场景。100万Token的上下文窗口使其可以一次性纳入大量组件文件、类型定义、设计规范和项目文档。

8.2 知识工作与深度研究

在知识工作方面,Kimi K3可处理海量资料,生成咨询级的行业研究报告和动态图形视频。它可仅凭一句话复刻完整游戏、整合二十余份研报生成图文并茂的深度分析报告。

Kimi K3在芯片设计、金融投研、法律文书、程序开发等专业场景已实现落地,多项金融评测成绩位居全球第二。

8.3 智能体(Agent)与自动化

Kimi K3基于AgentSwarm架构,系统可安排多个子Agent协同工作。在复杂任务中,多个Agent分别执行不同子任务,再由专门的校验Agent进行事实核查。

模型原生具备超长距离深度推理能力。在自动化操作测试中,Kimi K3展现了卓越的工具调用和多步骤任务执行能力。

九、总结与展望

Kimi K3正式开源是开源大模型发展史上的里程碑事件。它以2.8万亿总参数、100万Token上下文窗口和原生视觉理解能力,将开源模型的规模上限从数千亿参数推升至近3万亿级别。

在技术层面,Kimi K3通过KDA混合线性注意力、Attention Residuals和Stable LatentMoE等原创架构创新,实现了约2.5倍的扩展效率提升。这些创新并非简单的参数堆砌,而是对Attention等经典基础架构的迭代革新。

在性能层面,Kimi K3在Frontend Code Arena编程榜单上以1679分登顶全球第一,成为首个在该榜单超越所有闭源模型的开源模型。在Artificial Analysis智能指数中位列全球第三。

在生态层面,Kimi K3的开源协议采用分层设计,既保障了中小开发者和研究机构的零门槛使用,又对大规模型即服务(MaaS)商业应用设置了合理的营收门槛。月之暗面还同步开源了MoonEP、FlashKDA、AgentEnv三项基础设施技术。

在产业层面,Kimi K3开源引发了全球资本市场的剧烈反应和华盛顿政策层面的高度关注。它证明了中国AI团队在模型规模、性能和定价三个层面已具备与美国头部模型同台竞技的能力。

月之暗面表示,此次开放旨在推动开放权重模型生态的发展,希望通过开放模型、训练方法及底层基础设施,降低模型部署和开发门槛。随着Kimi K3的正式开源,全球AI产业竞争格局正在被重新定义。

常见问题(FAQ)

问:Kimi K3正式开源意味着什么?

Kimi K3正式开源意味着全球开发者可以免费下载、部署、微调这个2.8万亿参数的MoE模型。模型权重已在Hugging Face上线,技术报告和源代码已在GitHub公开。这是全球首个进入3万亿参数级别的开放权重模型。

问:Kimi K3的参数规模到底是多少?

Kimi K3总参数为2.8万亿(2.8T),每Token激活参数为1040亿。部分文献称为2.88万亿。行业通常将其归入“3万亿参数级别”。

问:Kimi K3使用什么架构?

Kimi K3采用混合专家(MoE)架构,配置896个路由专家,每个Token仅激活16个专家。同时采用KDA混合线性注意力机制和Attention Residuals技术。

问:Kimi K3的性能表现如何?

在Artificial Analysis智能指数中排名全球第三,仅次于Claude Fable 5和GPT-5.6 Sol。在Frontend Code Arena编程榜单以1679分登顶全球第一。

问:Kimi K3的开源协议有什么特殊之处?

Kimi K3采用自定义License,主体与MIT协议相同,但附加两条商业条款:年收入超2000万美元的MaaS服务提供商须与Moonshot另签协议;月活超1亿或月收入超2000万美元的产品须显著标注“Kimi K3”。

问:Kimi K3支持哪些能力?

Kimi K3支持100万Token超长上下文、原生视觉理解(多模态)、长程编程、知识工作、复杂推理和智能体(Agent)任务。

问:如何获取Kimi K3?

可通过Hugging Face(huggingface.co/moonshotai/Kimi-K3)、GitHub(github.com/MoonshotAI/Kimi-K3)和ModelScope平台下载模型权重、技术报告和源代码。

问:Kimi K3的训练成本高吗?

月之暗面表示,通过KDA、Attention Residuals和MoonEP等技术,Kimi K3实现了相较Kimi K2约2.5倍的扩展效率提升。MoonClip优化器能让20T训练数据跑出40T的效果,训练成本和算力功耗直接减半。

问:Kimi K3与其他开源模型相比有什么优势?

Kimi K3在总参数规模(2.8万亿)、上下文窗口(100万Token)和前端编程能力(Frontend Code Arena第1)三个维度上均显著领先于其他主流开源模型。

以上内容不代表本平台立场,仅供读者参考