DeepSeek V4 Flash自验证:96.6%成功率+低成本优化

2026-08-19
将任务成功率拉至与主流模型相近水平,DeepSeek自验证单任务成本仅约0.11美元,不到同类方案的十分之一。
大模型在处理复杂任务时,通常会生成多条候选执行路径,但如何从这些结果中筛选出最可靠的方案,一直是提升系统整体表现的核心环节。近期的实验结果显示,通过自验证机制,DeepSeek V4 Flash模型将任务成功率提升到了与当前主流模型相当的水平,同时有效控制了计算成本。
在Terminal-Bench 2.1基准测试中,研究团队为每个任务生成5条候选执行轨迹,采用自验证方法筛选后,系统整体成功率达到88%,超过了Claude Fable 5的表现。整个验证流程没有接入更强的外部模型,生成候选和结果校验的环节都使用了DeepSeek V4 Flash本身。
单任务自验证的成本约0.11美元,而Fable5的单任务成本约1.3美元,前者仅为后者的十分之一不到。实验中发现,当采样次数足够多时,正确的解决方案往往已经出现在候选集合中,真正影响最终效果的,是能否准确识别并选出这些正确轨迹。
这套实验基于斯坦福、加州大学伯克利分校和NVIDIA Research团队此前提出的LLM-as-a-Verifier框架,该框架通过细粒度的验证和排序逻辑,从智能体的多次尝试结果中筛选更可靠的输出。
本次实验是该框架在8月14日发布的v0.2.0版本更新中的内容,新增了对DeepSeek V4 Flash的验证支持和Terminal-Bench 2.1基准测试。从框架的整体设计来看,LLM-as-a-Verifier不仅可以用于测试时的结果优化,验证信号还可以用于任务进度跟踪和强化学习训练。
实验中每个任务预先由DeepSeek V4 Flash生成5条mini-swe-agent执行轨迹,其中Best-of-3策略使用前3条候选,Best-of-5则使用全部5条候选。DeepSeek V4 Flash同时负责为这些候选轨迹打分,框架根据得分完成排序和选择,整个过程不需要额外训练专门的验证模型。
Best-of-3策略将成功率从79.4%提升到86.5%,Best-of-5策略则将成功率从78.7%直接提升到88.0%。在成本-性能对比场景中,这套方案的优势表现得更加直观。
本次实验中DeepSeek一侧使用的是DeepSeek V4 Flash Max,成本按照当时OpenRouter的定价计算,而GPT-5.6和Claude系列的基线数据沿用了GPT-5.6技术报告中的结果。需要说明的是,本次的成绩是系统级结果,DeepSeek方案加入了多次采样和LLM-as-a-Verifier框架,而Fable5方案使用的是Claude Code,因此不能直接视为两个基础模型在相同条件下的单次横向对比。
项目还公开了本次实验的候选执行轨迹,以及Best-of-3、Best-of-5对应的复现脚本。Best-of-5策略下的Oracle(理想选择上限)达到了96.6%,这说明对于大量任务来说,5条候选轨迹中至少已经包含了一条成功的路径,模型本身具备生成正确解的能力,但验证环节还未能完全将所有正确轨迹识别出来。原论文还汇总了Terminal-Bench V2排行榜中不同模型和智能体配置产生的执行轨迹,在理想选择器下,任务覆盖率最高达到了98.9%。
连续验证如何区分候选轨迹?
传统的LLM-as-a-Judge评估方式直接输出离散分数,对于两条质量不同的长执行轨迹,很可能同时得到4分或5分,离散评分无法进一步区分二者。原论文在Terminal-Bench V2上测试发现,单次离散评分的平局率达到26.7%。
而LLM-as-a-Verifier框架不仅读取最终的评分结果,还保留了各个评分token的概率分布,通过概率加权得到连续的验证分数。即使两个候选最终都输出了相同的离散分数,只要模型对不同评分档位的置信分布存在差异,仍然可以进一步拉开两者的差距。此外,该框架还使用了更细的评分粒度,通过重复评估降低单次判断的波动,同时将整体评价拆分为多个维度分别进行判断。
概率枢轴锦标赛的候选筛选流程
当候选轨迹数量较多时,框架使用Probabilistic Pivot Tournament(PPT,概率枢轴锦标赛)进行排序,将完整的两两比较复杂度从O(N²)降低到O(Nk),大幅提升了排序效率。
自验证的测试时扩展
本次更新还专门优化了验证阶段的前缀缓存,在Terminal-Bench 2.1上,缓存命中率从5.2%提升到了78.4%,未缓存输入的成本也随之大幅下降。测试时的预算可以有不同的分配方式,比如选择更强的模型、增加采样次数,或者将更多计算资源投入到候选验证和选择环节,这些都会改变整套系统的成本和性能权衡。
本次5次采样的实际结果距离96.6%的理想选择上限仍有明显差距,下一步最直接的提升空间,就在于如何更准确地从现有候选中选出正确结果。

