Kimi K3:中国开源模型跻身世界AI第一梯队

Kimi K3正式发布后,其公布的参数量让不少行业观察者感到意外,第一时间的反应确实超出了此前的预期。笔者很少使用夸张的表述来评价大模型,今年以来唯一一次破例,是吐槽GPT 5.6的审美设计,那种风格确实让人印象深刻。
此次最让人意外的是,K3的参数量达到了2.8T。按照行业普遍的规划,这类参数规模的开源模型,大多要到第四季度才能和大家见面,这也是不少国内团队下半年的核心研发目标。但Kimi团队在7月中旬就已经完成了模型训练,考虑到实际研发周期,甚至有可能早在6月就已经完成核心训练流程。
行业内对于头部模型的参数量一直有多种推测:有观点通过推理速度和定价推算,Opus系列模型的参数量约为2.5T,此前马斯克也曾提到过5T的参数规模,虽然具体数值尚未完全确认,但可以确定的是,主流顶级闭源模型的参数量基本在2T到5T之间,GPT 5.6 Sol的参数规模也处于这一区间。而Mythos和Fable系列则属于更高阶的参数级别,不少行业预估其参数量接近10T,即将发布的GPT 6大概率也会达到类似的规模。
这意味着K3的参数量已经达到了Opus系列的水准,国内开源模型终于追平了今年年初Opus 4.5/4.6的技术水平,行业整体和全球一线开源模型的技术差距,已经被缩短到了半年左右。
训练超大参数量的大模型绝非易事,除了需要巨额的资金投入,还需要充足的算力支撑以及大量的试错迭代。参数量每提升一倍,对应的训练成本和研发风险往往会提升三倍以上,一旦训练流程出现问题,数千万美元的投入可能就会付诸东流。也正因如此,K3的发布有着极为重要的行业意义。今年上半年,Opus系列模型曾是不少团队难以逾越的技术高峰,大家都在讨论如何赶超,但想要真正实现超越,2T以上的参数量几乎是硬性门槛,全球范围内能够完成该规模模型训练的团队屈指可数。
K3也是全球范围内首款有望实现全面对齐Opus,甚至在部分细分领域实现超越的开源模型。如果这一目标能够达成,那么国内大模型和全球一线梯队之间的代差,将从原本的两代压缩到一代。这也不难理解,为何Kimi团队后续的研发方向会直指Fable系列,完成一座高峰的攀登后,自然要向着更高的目标进发。
关于模型的官方评测指标,行业内普遍认为其参考价值有限,更多只能作为初步参考。在AA评测榜单中,Kimi K3排名第三,已经具备了和Fable 5、GPT 5.6 Sol这两款全球顶级模型同台竞技的实力。
不过模型的真实能力,还是需要在真实的复杂业务场景中经过一段时间的实测才能下定论,笔者也计划再体验几天再给出更全面的评价。除了编码和智能体相关的客观指标外,笔者还有三个核心关注点。
1. 独立思考能力
笔者一直很在意这一点,因为大模型本身就存在幻觉问题,很容易顺着用户的表述给出附和性的回答,反而会放大用户的认知偏差。比如此前笔者将一句带有争议性的表述输入某款海外闭源模型,得到的回应完全偏向了预设立场,用通俗的话来说就是过度迎合用户。而当同样的内容输入Kimi K3时,模型以独立的逻辑进行了判断,并且明确指出了表述中的盲区。在此之前,独立思考能力表现最出色的是Opus系列模型,就连GPT 5.6都带有一定的迎合倾向。
2. 文字驾驭能力
不少人认为编码是大模型的核心落地场景,但实际上程序员群体的AI渗透率已经很高,用户基数相对有限。智能体产品真正实现大规模普及,还是要依靠白领群体,而日常办公中存在大量的文字创作工作。此前的开源模型,在编码能力上已经有不少能够达到Opus的水准,但在文字创作领域,几乎没有能够接近顶级闭源模型的产品。文字创作本身难度极高,一方面缺乏明确的训练奖励信号,另一方面专门针对文字能力的训练投入回报率远不如编码,大多只能依靠模型参数量提升和语料规模扩张自然进化。
当下不少大模型的输出信息密度过高,读起来反而会让人感到疲惫,因此笔者选择让模型创作散文来测试其文风表现。笔者让K3和GPT 5.6 Sol围绕同一主题创作散文,并要求他们在完成第一版后,先反思并调整掉AI化的表达再输出第二版。从最终成品来看,K3的散文充满画面感,既不是流水账也不是生硬的议论文,用词也十分地道自然。而GPT 5.6的作品则呈现出不同的风格。更让人意外的是,在海外的英文写作专项评测中,Kimi K3的表现超过了Fable 5,成为首款在写作领域登顶的开源模型。
3. 产品设计与工程落地能力
在实际使用K3的过程中,能明显感受到模型具备自主规划长周期任务的能力,甚至会主动为自己增加任务难度。比如笔者让它基于1000条笔记开发一个笔记成长看板,当发现没有提供原始笔记数据时,它主动生成了1000条模拟笔记来完成测试流程,这种主动补全流程的态度让人印象深刻。在看板设计环节,它自主规划了超过5种不同的成长系统展示方案,这些都不是笔者提前设定的要求,而是模型主动拓展的功能。
在视觉风格设计上,只要给出参考方向,模型就能自主完成整套页面风格的设计,当素材不足时还会自动生成补充素材。从最终的演示效果来看,其审美水准相当出色,笔者仅提供了几个游戏名称作为参考,模型就自主总结出了“冒险手帐风”的整体风格。在海外的Arena前端盲测中,Kimi K3的表现甚至超过了Fable 5,成为表现最佳的前端开发模型,足见其审美调教的成果。
定价方面,Kimi K3的服务档位对齐了Sonnet,价格约为Opus的三分之二,整体定价较为公允。不过直接调用API的成本对于普通用户来说偏高,更建议大家通过Coding Plan套餐体验,结合国内算力资源的供需情况来看,该套餐大概率会很快出现限购情况,类似此前部分头部模型的发售策略。
总体而言,Kimi K3已经跻身全球大模型第一梯队,综合实力得到了全面提升,目前已经成为笔者日常使用的核心模型之一,非常值得在真实业务场景中进行深度体验和测试。

