Kimi K3:MoE 1.79%稀疏架构+4倍价格对标Claude

在近期的国际人工智能评测中,来自中国的开源模型Kimi迎来了突破性进展:从K2.6版本迭代到K3仅用两个半月,模型排名跃升17个名次,在原本属于国际闭源模型强项的前端开发领域实现了历史性超越,并在行业大会首日公布了这一亮眼成果。
尽管官方博客中仍坦诚整体性能仍落后于当前最强的两款闭源模型,但在最新的第三方权威Arena评测榜单中,K3以1679分登顶前端代码/Web开发分类,领先竞品Fable5 48分,超出GPT-5.6 Sol 61分。
不同于常规的单元测试验证,该评测采用真实前端开发任务,由用户对不同模型的生成结果进行投票对比,最终的评分维度涵盖代码功能完整性、交互体验流畅度、视觉效果美观度以及需求理解准确度,更贴合当前Vibe Coding时代用户对成品的主观选择标准。
在七个前端细分赛道中,K3拿下六项第一,覆盖品牌营销、参考图复刻、数据分析、消费产品、模拟应用、内容创作工具六大领域,仅游戏开发赛道排名第二。同时该模型的两两对战平均胜率达到76%,显著高于Fable5的63%与GPT-5.6 Sol的58%。
这一结果证明,Kimi能够更完整地融合视觉判断、产品理解、前端工程能力与多步执行逻辑,尤其适配网站生成、数据看板搭建、可视化研究以及互动内容创作等场景,用户反馈显示,用K3生成的网页在综合审美层面获得了更高的认可度。
这也反映出中国开源模型追赶国际顶尖闭源模型的速度超出了市场预期。此前Anthropic首席执行官曾预判,6到12个月内市场将出现与Fable5能力相当的开源模型,而K3的表现显然提前兑现了这一行业预判。
作为新一代旗舰模型,K3搭载2.8万亿总参数,支持原生视觉理解与100万Token上下文窗口,官方将其核心应用场景概括为长周期编程、知识工作与复杂推理三大方向,公开的能力评测也围绕这三个维度展开。
长周期编程能力
K3在Terminal Bench 2.1拿下88.3分,超过Fable5的84.6分;Program Bench得分77.8分,高于竞品的76.8分;SWE Marathon取得42分,同样领先Fable5的35分。不过在更侧重真实代码仓库修复的DeepSWE与FrontierSWE评测中,K3分别拿到67.5分与81.2分,仍略落后于Fable5的70分与86.6分。
Agent与知识工作能力
K3在BrowseComp评测中拿到91.2分,高于Fable5的88分;Automation Bench得分30.8分,位列榜单第一;SpreadsheetBench 2得分34.8分,同样小幅领先竞品。但在Job Bench、Toolathlon以及GDPval-AA v2等复杂职业任务场景中,K3仍存在一定差距。
视觉理解与文档处理能力
K3在OmniDocBench拿下91.1分,超过Fable5的89.8分;MMMU-Pro得分81.6分,略高于竞品的81.2分。不过在CharXiv、MathVision以及工具增强型视觉推理项目中,K3的表现仍普遍落后于Fable5。
综合来看,K3的核心优势集中在终端操作、长周期任务执行、浏览研究、自动化处理以及视觉化交付等领域;而短板则主要体现在高难度代码仓库修复、复杂工具协调以及部分深层视觉推理场景中。
K3支持图像与视频输入,可调用自定义工具、动态加载工具并输出严格格式的JSON内容,同时支持自动上下文缓存。目前模型始终开启思考模式,仅开放最高推理强度,未拿到提前测试账号的用户通常需要排队体验。值得注意的是,Kimi的多模态路线更侧重理解与推理能力,而非视频生成。团队相关负责人曾公开表示,现阶段不会跟进视频生成模型,将专注于提升模型的智能上限,他认为视频生成本身难以有效推动模型智能的提升,尽管该功能具备实用价值,但从理论与实际效果来看,对智能升级的帮助都较为有限。
K3的极致稀疏架构设计
K3的架构设计体现了团队的技术野心,从K2.6的1万亿参数到K3的2.8万亿参数,模型始终遵循Scaling Law,不断突破全球开源模型的规模上限。Switch Transformer早期的研究已经证明,稀疏激活技术可以将模型规模推向万亿参数级别,同时尽可能控制单次计算成本。不过更大的模型规模意味着更高的计算成本,因此核心并非单纯扩大模型体量,而是同步优化模型的容量、注意力机制与跨层信息流。
K3最激进的架构调整在于将MoE模型的稀疏激活率推至1.79%,即896个路由专家中每次仅调用16个。相较于单纯扩大规模的稠密模型,这种设计相当于构建了一个更庞大的“能力库”,可以根据Token内容动态选择少数专家进行处理。当前极致稀疏路线已是MoE架构的重要发展趋势,对比来看,DeepSeek-V3每层拥有256个路由专家,每个Token激活8个并搭配共享专家,路由专家激活率约为3.13%;此前GPT-4版本采用256个专家、每次激活7个,专家激活率约为2.73%。
K3将专家池扩大至896个但仅调用16个,激活比例仅1.79%,这意味着模型可以在相近的单Token计算预算下,容纳远超中等规模稠密模型的知识与技能,从而获得更高的能力上限。不过专家数量越多、调用比例越低,错误路由带来的损失也越大,这对模型架构的负载均衡、路由稳定性以及跨卡通信能力提出了更高要求,团队在技术文档中也明确了这一点。对应的模型部署难度也随之提升,对路由质量、专家分工以及芯片互联的要求更为苛刻,官方建议K3部署在至少64张加速卡组成的超节点上,以提供更大的高带宽通信域。
在架构细节上,Stable LatentMoE负责模型容量与专家路由,Quantile Balancing根据路由分数的分位数直接分配专家,试图减少传统负载均衡中对经验参数的依赖;KDA(Kimi Delta Attention)负责序列方向的信息流,通过混合线性注意力为长序列提供更低成本的信息处理基础;AttnRes则负责网络深度方向的信息流,允许当前层有选择地检索此前层的表示,帮助超大模型更高效地利用深层网络。整体而言,MoE稀疏度优化、KDA注意力机制、AttnRes结构以及训练与数据配方的共同改进,让K3相较于K2实现了约2.5倍的整体Scaling效率提升。K3的完整模型权重将于2026年7月27日前正式发布,更多关于架构、训练与评测的细节将随技术报告一同公布。
定价策略与商业化路径
性能层面的升级之外,K3的定价策略也出现了显著调整,放弃了国产模型一贯主打性价比的低价路线,转而向国际顶尖模型看齐。从K2.6到K3,普通输入价格上涨至原来的约3.16倍,输出价格上涨至3.75倍,同时上下文窗口从256K扩大到1M。此外K3始终开启思考模式,仅提供最高推理强度,而K2.6版本还允许用户关闭思考模式以控制延迟与Token消耗。
K3的定价完全对标Claude Sonnet 5,两者的标准价格均为每百万Token输入3美元、输出15美元。以Sonnet级别的定价获得Fable级别的性能,看似仍具备性价比,但Token单价看齐并不代表实际任务成本也能保持一致。根据第三方测试数据,K3在综合评测中生成了约1.3亿输出Token,约为同类模型中位数6300万的两倍;输出速度约为62 Token/s,低于约72 Token/s的同类中位水平。
这意味着即便与Sonnet 5保持相同的Token单价,K3为完成同一项任务需要更长的思考时间、生成更多的输出内容,实际任务成本与等待时间都可能更高。毕竟定价表仅能体现单个Token的成本,真正决定使用性价比的是单次任务消耗的Token总量与重试次数。
更让国内开发者关注的是K3与其他主流模型的价格差距,特别是缓存命中价格,Kimi K3的缓存价格接近部分竞品的一百倍。有网友按照输入、输出与缓存命中比例不变的情况测算,切换到Kimi K3后,同一工作负载的消费额可能出现数倍增长,这还仅是基于Token数量不变的静态估算。由于K3目前仅支持最高推理强度,思维链通常更长,即便缓存命中率较高,真实任务成本仍可能明显高于其他同类型产品。
这种成本结构也拉高了产品的使用门槛,根据当前产品规则,用户若要完整体验Kimi K3的百万Token上下文功能,需要购买指定价位的包月会员。结合团队当前的商业进程来看,此次提价的必要性更为清晰:公开数据显示,公司的年化经常性收入已突破一定规模,近期完成了大额融资,估值处于较高区间,目前正寻求进一步融资为潜在的上市计划做准备。在这一阶段,Kimi需要证明的已经不只是模型能否登顶评测榜单,更需要证明其技术能力能够转化为商业收入,而收入能否进一步转化为可持续的毛利空间。

