DeepSeek V4 Flash:test-time scaling让开源模型超越闭源

当一个AI模型执行同一个任务多次,再自行挑选最稳妥的结果,能带来多大的性能提升?斯坦福的一项实验给出了亮眼的答案:一款低成本模型通过这套流程,不仅实现了性能翻倍,还反超了顶级对标模型,且整体成本依然更低。
单次尝试无法体现模型真实上限
Terminal-Bench 2.1是行业内常用的大模型评测指标,专门测试AI智能体在真实沙盒环境中完成终端任务的能力,整套评测包含89个测试任务,主流的Pass@1指标代表单次完整智能体尝试的成功率。
在实际使用中我们经常会发现一个普遍现象:同一个模型面对同一个问题,第一次尝试可能出错,第二次却能顺利解决;换一种思路可能失败,调整实现方式后反而成功。这是因为大模型的生成机制本身带有随机性,尤其是智能体执行终端任务时,可选路径繁多,任何一个微小的决策偏差都可能影响最终结果,只看单次尝试的成绩,很容易低估模型的真实潜力。
如果只看一次尝试,就会低估模型真实潜力。那怎么解决这个问题?答案是让模型多试几次。
但多试几次并不难,真正的问题在于:模型能否自主判断哪一次尝试的结果更好?为此这项实验设计了LLM-as-a-Verifier的验证机制,也就是让大模型本身扮演“阅卷者”的角色。
具体的实验流程是:针对同一个任务,先让DeepSeek V4 Flash生成5个候选解决方案;再让同一个模型对这5个方案进行评分排序;最终选出它认为最靠谱的方案提交,最后根据这个选中方案的任务完成情况来评估模型的整体性能。
性能实现跨越式提升
DeepSeek V4 Flash单次尝试的原始成绩为78.7%,这个成绩本身已经处于不错的水平,但还没有超过对标模型Fable 5的83.8%±1.2%。
而加入了多次尝试和自我验证的流程后,DeepSeek V4 Flash的成绩直接飙升到88.0%±0.6%,反超了Fable 5近5个百分点。更值得关注的是,这套多次尝试加筛选的流程,整体使用成本依然比Fable 5低4到11倍。
这意味着,准确的结论并不是“DeepSeek V4 Flash裸模型比Fable 5更强”,而是:一款原本未能超过旗舰模型的低成本模型,通过多次尝试和自我验证,将智能体的任务完成能力提升到了超过Fable 5公开榜单成绩的水平。
这个过程就像学生考试:第一次解题可能发挥不稳定,但如果允许他列出多种解法,再自行检查对比、选出最稳妥的答案,最终的成绩往往会有明显提升。
这套方法的核心逻辑
这里我们可以引入一个概念:test-time scaling,也就是“测试时能力扩展”。
过去我们提升模型能力,大多依靠训练阶段的扩展:放大模型规模、增加训练数据、延长训练时间,让模型在部署前就具备更强的能力。过去几年大模型能力的快速提升,很大程度上都依赖这种模式。
而test-time scaling则是另一种完全不同的思路:在模型实际运行时,多花一些时间,生成多个候选方案,再通过自检和对比来选出最优结果。
对于智能体任务来说,这种测试时扩展的优势尤其明显。因为智能体的执行不是单次的回答,而是一个完整的流程:观察环境、制定计划、执行命令、读取错误信息、修正方案、再次验证。在这个过程中,每多一次尝试、多一次检查、多一层验证,都能显著提升最终的成功率。
这次DeepSeek V4 Flash的实验结果,本质上就是一个非常典型的test-time scaling案例。它并没有证明模型本体突然成为了全球最强模型,而是说明:当模型可以进行多次尝试,并且具备自我验证的能力时,系统级的整体性能会得到显著放大。
开源模型的定制优势
有人可能会问:这套验证机制这么好用,能不能给Fable 5也加上?当然可以,闭源模型同样可以通过多次运行再筛选最优结果。
但开源模型的优势在于,可以将这套玩法做得更深入。不仅可以在外部调用时多次运行模型,还可以直接控制整个推理过程,在关键节点进行分支、提前淘汰效果不佳的路径、复用已经计算过的结果,将算力集中在更有希望的方向上。
再加上DeepSeek V4 Flash本身的部署成本更低,同样的预算可以支持更多次的尝试,也能让每次尝试的细节更精细。简单来说,模型成本越低、推理过程越可控,test-time scaling的性价比就越高。
所以这个实验并不是“低成本裸跑模型反超顶级闭源模型”的爽文,而是传递了一个重要信号:一款低成本、可定制、易改造的开源模型,搭配更智能的运行时机制,就有机会将系统级的性能提升到顶级闭源模型之上。
这也正是开源技术最令人兴奋的地方:它打开了系统级创新的空间,开发者可以围绕模型搭建专属的运行流程,让模型在真实任务中不断释放潜力。
落地应用才是核心
最后需要强调的是,不管机制多么完善,最终还是需要人去实际应用。你不动手尝试,再强的AI能力也和你无关,无论是个人开发者还是企业,都是如此。
过去几年,很多企业想要进行AI原生转型,但最大的问题不是“不想做”,而是“不敢大规模做”:担心成本太高不划算、担心数据泄露不安全、担心模型无法适配生产环境。而现在这个拐点已经到来。
当然,AI变得便宜又好用,并不代表企业会自动用好AI。真正的挑战在于如何用它重塑整个组织的运作模式,让AI真正融入业务流程,释放最大价值。

