文章摘要
斯坦福实验表明,低成本模型多次执行任务并自行挑选最优结果,可提升性能。以DeepSeek V4 Flash为例,其通过LLM - as - a - Verifier机制,成绩从78.7%升至88.0%±0.6%,反超Fable 5且成本更低。这是“测试时能力扩展”典型案例,开源模型定制优势明显,最终要注重落地应用以释放AI价值。

当一个AI模型执行同一个任务多次,再自行挑选最稳妥的结果,能带来多大的性能提升?斯坦福的一项实验给出了亮眼的答案:一款低成本模型通过这套流程,不仅实现了性能翻倍,还反超了顶级对标模型,且整体成本依然更低。

单次尝试无法体现模型真实上限

Terminal-Bench 2.1是行业内常用的大模型评测指标,专门测试AI智能体在真实沙盒环境中完成终端任务的能力,整套评测包含89个测试任务,主流的Pass@1指标代表单次完整智能体尝试的成功率。

在实际使用中我们经常会发现一个普遍现象:同一个模型面对同一个问题,第一次尝试可能出错,第二次却能顺利解决;换一种思路可能失败,调整实现方式后反而成功。这是因为大模型的生成机制本身带有随机性,尤其是智能体执行终端任务时,可选路径繁多,任何一个微小的决策偏差都可能影响最终结果,只看单次尝试的成绩,很容易低估模型的真实潜力。

如果只看一次尝试,就会低估模型真实潜力。那怎么解决这个问题?答案是让模型多试几次。

但多试几次并不难,真正的问题在于:模型能否自主判断哪一次尝试的结果更好?为此这项实验设计了LLM-as-a-Verifier的验证机制,也就是让大模型本身扮演“阅卷者”的角色。

具体的实验流程是:针对同一个任务,先让DeepSeek V4 Flash生成5个候选解决方案;再让同一个模型对这5个方案进行评分排序;最终选出它认为最靠谱的方案提交,最后根据这个选中方案的任务完成情况来评估模型的整体性能。

性能实现跨越式提升

DeepSeek V4 Flash单次尝试的原始成绩为78.7%,这个成绩本身已经处于不错的水平,但还没有超过对标模型Fable 5的83.8%±1.2%

而加入了多次尝试和自我验证的流程后,DeepSeek V4 Flash的成绩直接飙升到88.0%±0.6%,反超了Fable 5近5个百分点。更值得关注的是,这套多次尝试加筛选的流程,整体使用成本依然比Fable 5低4到11倍。

这意味着,准确的结论并不是“DeepSeek V4 Flash裸模型比Fable 5更强”,而是:一款原本未能超过旗舰模型的低成本模型,通过多次尝试和自我验证,将智能体的任务完成能力提升到了超过Fable 5公开榜单成绩的水平。

这个过程就像学生考试:第一次解题可能发挥不稳定,但如果允许他列出多种解法,再自行检查对比、选出最稳妥的答案,最终的成绩往往会有明显提升。

这套方法的核心逻辑

这里我们可以引入一个概念:test-time scaling,也就是“测试时能力扩展”。

过去我们提升模型能力,大多依靠训练阶段的扩展:放大模型规模、增加训练数据、延长训练时间,让模型在部署前就具备更强的能力。过去几年大模型能力的快速提升,很大程度上都依赖这种模式。

而test-time scaling则是另一种完全不同的思路:在模型实际运行时,多花一些时间,生成多个候选方案,再通过自检和对比来选出最优结果。

对于智能体任务来说,这种测试时扩展的优势尤其明显。因为智能体的执行不是单次的回答,而是一个完整的流程:观察环境、制定计划、执行命令、读取错误信息、修正方案、再次验证。在这个过程中,每多一次尝试、多一次检查、多一层验证,都能显著提升最终的成功率。

这次DeepSeek V4 Flash的实验结果,本质上就是一个非常典型的test-time scaling案例。它并没有证明模型本体突然成为了全球最强模型,而是说明:当模型可以进行多次尝试,并且具备自我验证的能力时,系统级的整体性能会得到显著放大。

开源模型的定制优势

有人可能会问:这套验证机制这么好用,能不能给Fable 5也加上?当然可以,闭源模型同样可以通过多次运行再筛选最优结果。

但开源模型的优势在于,可以将这套玩法做得更深入。不仅可以在外部调用时多次运行模型,还可以直接控制整个推理过程,在关键节点进行分支、提前淘汰效果不佳的路径、复用已经计算过的结果,将算力集中在更有希望的方向上。

再加上DeepSeek V4 Flash本身的部署成本更低,同样的预算可以支持更多次的尝试,也能让每次尝试的细节更精细。简单来说,模型成本越低、推理过程越可控,test-time scaling的性价比就越高。

所以这个实验并不是“低成本裸跑模型反超顶级闭源模型”的爽文,而是传递了一个重要信号:一款低成本、可定制、易改造的开源模型,搭配更智能的运行时机制,就有机会将系统级的性能提升到顶级闭源模型之上。

这也正是开源技术最令人兴奋的地方:它打开了系统级创新的空间,开发者可以围绕模型搭建专属的运行流程,让模型在真实任务中不断释放潜力。

落地应用才是核心

最后需要强调的是,不管机制多么完善,最终还是需要人去实际应用。你不动手尝试,再强的AI能力也和你无关,无论是个人开发者还是企业,都是如此。

过去几年,很多企业想要进行AI原生转型,但最大的问题不是“不想做”,而是“不敢大规模做”:担心成本太高不划算、担心数据泄露不安全、担心模型无法适配生产环境。而现在这个拐点已经到来。

当然,AI变得便宜又好用,并不代表企业会自动用好AI。真正的挑战在于如何用它重塑整个组织的运作模式,让AI真正融入业务流程,释放最大价值。

以上内容不代表本平台立场,仅供读者参考