Ember-1:优化Kimi K3推理效率 减耗四成保性能

近期,针对大语言模型推理效率的优化成为行业关注的方向,一款基于现有基座的微调模型展现出了不错的平衡效果。据行业观察,有团队推出了Ember-1模型,该模型以Kimi系列的K3为基座进行针对性微调,核心目标是压缩推理过程中的无效思考环节,同时尽可能保留原模型的核心任务能力。根据官方发布的评测数据,Ember-1的token使用量减少约40%,在公开基准测试、客户生产编程场景以及内部的编码、智能体工作负载中都完成了验证。
目前该模型已经以研究预览版的形式上线相关服务平台,对于长期运行编程类智能体的团队而言,这一方案提供了兼顾原有能力与成本控制的新选择:可以继续使用基于K3衍生的模型能力处理任务,但大幅降低中间推理环节的资源消耗。
行业观察者Elvis Saravia对此给出了评价,他认为这一优化的核心价值不仅在于token用量的减少,更在于质量与成本之间的平衡仍有持续优化的空间。在他看来,当前不少前沿模型在落地场景中仍有未被充分挖掘的效率提升空间,而开放的模型基座为开发者提供了在现有基础上进一步优化的可能。
优化的核心动机
此次选择基于K3进行微调,最初源于用户的实际需求:既要保留K3在编程任务上的出色表现,又希望降低使用成本。团队最初尝试直接降低模型的推理投入力度,但测试发现这种方式会导致任务完成质量出现明显下滑,因此转向了针对性的额外训练流程。
本次微调的核心目标是保留模型的自我纠错能力:当测试失败时,模型能够自主检查之前的假设,并根据工具返回的新信息调整后续行动步骤。开发团队希望通过任务与环境反馈的训练,让这些有助于推进任务的思考环节得以保留,同时减少重复分析、无效循环这类无意义的推理消耗。本次训练使用了团队自有数据集,未涉及客户的私有数据,期间共开展了50余次训练实验与200余次效果评估。
推理成本的隐性累积
在实际使用场景中,团队观察到部分K3请求里,模型内部推理环节生成的token占总生成量的比例超过90%。用户最终看到的可能只是一份最终的代码补丁,但模型在此前已经生成了大量分析性内容。而大语言模型的token消耗按输出量计费,这部分用于思考的内容本身就构成了不小的成本。
对于编程类智能体来说,这类模型往往会被连续调用:读取文件、修改代码、运行测试,再根据报错结果决定下一步操作。如果工作流保留完整的推理历史,前几轮生成的思考内容会被重新作为输入传入模型,成为后续请求的一部分。官方的SII评测默认就采用了保留推理历史的设置,这种情况下,随着调用轮次增加,累计的输入token量会近似按轮次的平方增长。
举个简单的教学例子:假设每一轮都会新增一份等长的推理记录,那么后续三次请求分别需要携带1份、2份、3份历史记录,累计输入量就达到了6份。如果每份推理的长度都能缩短,那么不仅生成该推理的输出量会减少,后续重复携带的输入量也会同步降低,进一步压缩整体成本。
质量与成本的平衡验证
本次测试对比了K3的low、high、max三个推理档位以及Ember-1的表现,其中K3 max作为本次对比的基准档位。成本计算统一采用K3公开的API费率:每百万token,未缓存输入为3美元,缓存输入为0.30美元,输出为15美元。
首先看与K3 max的逐项对比结果,所有得分均以百分比形式呈现,最后一列展示的是Ember-1相较于K3 max的成本降幅:
|
基准 |
K3 max |
Ember-1 |
成本减少 |
|---|---|---|---|
|
Terminal Bench 2.1 |
80.9 |
82.0 |
51.9% |
|
SWE-bench Verified |
93.2 |
92.2 |
15.5% |
|
SWE-Interact |
21.3 |
20.0 |
32.5% |
|
DeepSWE 1.1 |
66.4 |
75.2 |
23.7% |
|
τ-2 Bench Airline |
64 |
66 |
5.9% |
在Terminal Bench 2.1的89个测试样本中,Ember-1的得分接近K3 max,但成本仅为后者的一半不到。在SWE-bench Verified的500个样本测试中,Ember-1的得分仅比K3 max低1个百分点,成本降幅达到15.5%。
如果将直接调低推理投入的K3 low档位作为对照,其在这两项测试中的得分分别为76.4%和80.4%,均明显低于Ember-1的表现。这一对比结果验证了团队的优化思路:通过针对性的额外训练减少token用量,可以保留更多接近K3 max档位的任务表现。
在DeepSWE 1.1测试中,Ember-1不仅实现了更高的得分,还进一步降低了成本;而在SWE-Interact测试中,得分略有下降,但成本降低约三分之一。官方并未公开这些分差的统计区间,整体来看,Ember-1的得分有升有降,成本节省幅度则根据不同任务场景有所变化。
官方发布的五项基准汇总图展示了各模型的表现与成本的平衡关系:在图表中,位置越靠上代表得分越高,越靠左则代表成本越低。Ember-1在汇总图中的位置比K3 max更靠左且更靠上,属于更优的帕累托前沿位置——也就是说,在当前的对比范围内,没有其他模型能够在不降低质量的前提下进一步压缩成本,或是在相同成本下获得更高的得分。当然,像Claude Opus 5和GPT-6 Astra这类模型的得分更高,但对应的使用成本也同步提升。
实际场景的落地效果
除了公开基准测试之外,团队还与两家客户在生产环境的编程流量中开展了A/B对比测试。根据团队披露的结果,两组测试中每项任务的token用量减少约35%,任务完成质量与原模型接近,多数下游指标保持稳定甚至有所改善,包括任务完成率、成功得分以及失败情况统计。其中一家客户已经将Ember-1投入生产环境使用,并计划扩大应用范围。
官方还公布了一组具体的测试明细:
|
模型 |
得分 |
步数 |
输出token |
|---|---|---|---|
|
Kimi K3 |
0.751 |
23.8 |
49.3K |
|
Ember-1 |
0.753 |
21.4 |
29.9K |
从数据来看,单轮输出的token从约4.93万下降到2.99万,减少幅度约39%;同时任务执行步数从23.8降至21.4,整体得分基本保持一致。
团队还将Ember-1接入内部日常的编程与智能体工作流,开发人员在使用过程中并未察觉到模型发生了切换,但token消耗已经出现了明显下降。团队将这种平滑的替换效果视为优化方案可行的积极信号。
整体来看,无论是直接调低推理投入的对比测试,还是客户实际使用中的表现,Ember-1都展示了现有基座模型的优化潜力:通过针对性微调,让模型能够以更短的推理流程完成同类任务,实现成本与质量的平衡。

