文章摘要
近期,Kimi推出的K3模型登顶开源模型性能榜单。它搭载2.8万亿参数,基于混合线性注意力与注意力残差技术,支持多模态交互,有100万tokens超长上下文窗口。虽与顶级闭源模型有差距,但性能接近Opus 4.8。经团队测试,K3在多场景表现出色,价格有优势。K3代表国产开源大模型新高峰,期待其继续突破。

近期开源大模型领域迎来里程碑式更新,Kimi推出的K3模型正式登顶开源模型性能榜单,凭借扎实的技术积累和亮眼的实际表现,重新回到了行业聚光灯下。

此前就有行业消息传出Kimi将推出新一代开源模型,直到团建结束后同事告知K3正式发布,才确认这个消息属实。当晚回家后,海外主流社交平台上已经被K3的相关讨论刷屏,不少用户分享了自己的测试体验,其口碑表现远超此前的同类开源模型,堪称DeepSeek R1发布后,又一款获得广泛好评的大模型产品。

在关注新模型动态时,我通常会优先查看官方发布的详细技术博客,因为这类内容往往经过了核心研发、产品团队甚至公司负责人的多轮审核,能够最准确地传递模型的核心改进方向、解决的关键问题以及团队的研发重点。反观社交媒体上的讨论,虽然热度很高,但往往夹杂着主观情绪,有效信息的占比并不高,不如官方博客的内容严谨准确。

官方发布的技术博客通常采用倒金字塔结构,将最核心的信息放在最前面,从K3的发布博客中,我们可以提炼出几个关键亮点:

1. 搭载2.8万亿参数,是当前全球参数规模最大的开源大模型之一

2. 基于混合线性注意力机制与注意力残差技术,这两项都是Kimi团队此前公开过的核心技术成果,为K3的性能突破打下了坚实基础

3. 原生支持多模态交互能力

4. 拥有100万 tokens的超长上下文窗口

5. 针对长程编程、深度知识工作与复杂推理场景进行了专项优化

6. 官方也坦诚,目前K3仍与顶级闭源模型Claude Fable 5和GPT-5.6 Sol存在一定性能差距

看到这些核心信息后,第一感觉就是K3已经达到了当前开源模型的顶级水准。

2.8万亿的参数规模,意味着极高的研发门槛。当前全球能够完成如此大规模模型的训练与部署的团队寥寥无几,国内能够做到万亿级参数预训练的企业仅有两家,而参数规模超过2万亿的,仅有Kimi团队一家。

不少人会认为,模型参数规模只是一个数字,只要投入足够的算力就能轻松堆上去,但实际上当模型达到万亿级规模后,研发复杂度会呈指数级增长。从算力调度、数据清洗到训练稳定性控制,任何一个环节出现问题,都会导致训练失败或者性能不达标。能够完成2.8万亿参数模型的训练与部署,本身就证明了Kimi团队在大模型研发领域的深厚技术实力。

此次K3用到的混合线性注意力与注意力残差技术,其实都是Kimi团队此前公开过的科研成果,早在之前就已经发布了相关技术论文,显然是为新一代模型的研发提前做好了技术储备。

我们可以用日常阅读来类比传统注意力机制:在读一篇长文章时,每读到新内容都要回头翻阅前文,查找相关的上下文信息,这种方式虽然能保证细节的准确性,但随着文章长度增加,计算量和缓存压力会快速上升。而Kimi团队研发的混合线性注意力机制(KDA)则换了一种思路,更像是在阅读时同步维护一份实时更新的笔记:当新信息进入时,模型会自动筛选有用内容存入笔记,同时淡化过时的信息,后续处理新内容时无需每次都对全部历史信息进行全量计算。当然,只依赖笔记也可能遗漏细节,因此K3采用了混合架构,在部分网络层使用高效的KDA机制,另一部分层则保留传统的注意力机制,让模型既能高效处理超长上下文,又能保留对细节信息的精准理解能力。

再来说说注意力残差技术。大模型的信息传递是从底层到上层逐层进行的,传统的残差连接是在前一层的输出基础上叠加新的信息,当模型层数较少时,这种方式不会有太大问题,但当模型层数大幅增加后,底层提取的关键信息会被后续的大量计算逐渐冲淡,就像多人接力修改一篇长文,修改多轮后最初的核心思路很容易被淹没。注意力残差则为模型增加了一个“回溯”的选项:在处理到某一阶段时,模型不仅可以参考上一层的输出,还可以回溯查看不同训练阶段的中间结果,根据当前任务需求重新提取最有价值的信息。

简单来说,混合线性注意力解决的是超长上下文的处理效率问题,而注意力残差则解决了深层模型中关键信息的传递衰减问题,两者结合让K3能够在更长的上下文序列和更深的网络结构中保持信息的高效流动,这也是官方宣传的核心技术优势。

海外社交平台上有不少用户认为K3已经超越了Claude Fable 5,这种说法其实有些夸张,官方发布的博客也明确提到了与顶级闭源模型的性能差距,但可以确认的是,K3的性能已经接近Opus 4.8的水准。

接下来我将分享我们团队使用K3完成的几个真实生产场景测试,这些都是日常工作中会用到的实际案例:

比如我们为AI Maker Summit大会制作的电子门票,此前我们用过的同类模板都比较简陋,而这次用K3生成的门票拥有逼真的物理质感,表面带有细腻的颗粒和印刷纹理,成品出来后团队成员都赞不绝口,我们也希望能把这份用心传递给每一位参会者,就像乔布斯所说的,专注做好细节,用户自然能感受到其中的诚意。

我在Kimi Code工具中完成了这个门票的开发,还为它添加了手风琴式的折叠翻页效果,并且加入了一些个人收藏的照片作为装饰。

K3的推理和执行能力有了显著提升,最初开发时,卡片样式出现了重叠、交互逻辑混乱的问题,K3自动检测到了屏幕渲染效果的问题,重新计算了墙面宽度、卡片旋转轴和横向位移参数,快速修复了问题。能明显感觉到,Kimi K3在长程编程任务中变得更加智能,能够快速定位并解决复杂问题。

紧接着,我又用K3完成了大会官网的概览页面开发,其中的交互动画效果非常流畅自然。

除了前端开发场景,我还在中午用K3完成了大会购票交易系统的重构。此前我们使用的是第三方SaaS购票系统,这次我们将前后端全部迁移到了自研平台上。说实话,目前K3唯一的缺点就是推理速度稍慢,但整体表现已经远超我的预期,我甚至觉得它比Opus 4.8还要好用。

在重构交易系统的过程中,K3曾出现过一次报错,排查后发现是当时的算力资源不足,估计是当天有大量用户涌入体验K3导致的。我在社群里看到,不少用户都重新续费了Kimi的订阅服务,可见大家对这款模型的认可度很高。

海外用户通常会在Anthropic和OpenAI的产品之间做选择,而国内用户的选择则逐渐从GLM和Kimi之间徘徊,可见K3已经成为了国内开源模型市场的有力竞争者。

新的交易系统支持批量填写参会者信息,这个功能是K3自主优化实现的,效果超出了我的预期。我还接入了微信和支付宝的支付接口,配套的CMS后台也一并完成了开发。

系统开发完成后,我让K3对整个支付链路进行了全面的安全审计,整个审计过程耗时约15分钟,输出了一份详细的安全审计报告。我将这份报告交给GPT-5.6 Sol验证后,发现80%的结论都是准确的,可见K3的安全分析能力相当出色。

下面我将分享几个不带主观情绪的真实使用感受:

1. K3的性能优于GLM 5.2,在长程任务的推理深度上表现更出色,整体性能已经接近Opus 4.8的水准;

2. 价格方面,K3在国内市场并不算低价,但对比Opus 4.8仍有明显的价格优势,至少能便宜四分之三;

3. 我使用的是Kimi的Coding Plan订阅服务,整体体验比此前的2.x系列更加稳定耐用;

4. K3的自主项目推进意识很强,在之前的安全审计任务中,我特意叮嘱它不要修改代码,只做分析,它也很好地执行了指令;

5. 如果价格能够进一步下调,K3的竞争力会更上一层楼。

最后再分享一个细节,K3的发布博客开篇引用了苏轼《思治论》中的一句话:“犯其至难而图其至远者,发之以勇,守之以专,达之以强。”这句话的意思是,想要攻克最难的挑战、追求最远大的目标,出发时需要勇气开路,行进中需要专注坚守,最终抵达则需要坚韧不拔的毅力。

这句话也恰好印证了Kimi团队这几年的发展历程。大模型浪潮兴起之初,Kimi是国内最早入局的一批企业之一,创始人杨植麟也曾被视为国内新一代大模型创业者中最具技术天赋的代表人物。但后续的发展并非一帆风顺:字节跳动在应用端大举投入,豆包迅速崛起,Kimi也曾被卷入激烈的市场竞争之中。在DeepSeek R1发布后,行业普遍认为其他开源模型的空间有限,那段时间Kimi的声音也逐渐变小。之后Kimi收缩了应用端的投放,将重心重新放回模型研发,推出了K2系列,虽然K2发布时同样获得了不错的口碑,但行业迭代速度太快,很快又有新的模型刷新了性能上限。这一次,K3的推出让Kimi重新回到了行业视野的中心。

K3显然不会是Kimi的终点,按照当前大模型的迭代速度,再过几个月就会有新的模型刷新大家的认知,但至少在发布这一刻,K3确实让人眼前一亮,它代表了当前国产开源大模型的新高峰。海外社交平台上已经有不少讨论认为,开源模型与顶级闭源模型之间的性能差距正在被压缩到三个月以内,这个说法或许无法精确验证,但可以确认的是,K3已经稳稳站在了当前开源模型的性能顶端。

再回头看开篇引用的那句话,“发之以勇,守之以专,达之以强”,这正是Kimi团队这几年的真实写照。期待国产大模型能够继续突破,让我们不用再在使用海外闭源模型时感到不便。

以上内容不代表本平台立场,仅供读者参考