AICon深圳峰会+AI热点资讯:8.21-22大会启幕

当AI智能体的任务复杂度不断提升,如何高效准确地验证大模型输出的执行轨迹对错,一直是行业内昂贵且棘手的难题。近期,一个名为LLM-as-a-Verifier的开源框架在社区引发广泛关注,其核心思路是在不更换模型参数、不进行额外微调的前提下,仅通过推理阶段的优化就实现了性能跃升,迅速冲上了GitHub热榜前列。
该框架由Jacky Kwok牵头,联合斯坦福大学、加州大学伯克利分校与英伟达研究院的学者共同研发,最新的v0.2.0版本带来了更具说服力的实验验证结果。在Terminal-Bench 2.1这一极具挑战性的基准测试中,使用DeepSeek V4 Flash模型,仅需为每个任务生成5条候选执行轨迹,再通过模型自身作为验证器筛选最优解(Best-of-5策略),系统的任务成功率就从原生的79%提升到了88%,直接超越了闭源前沿模型Claude Fable 5。
更引人关注的是成本优势,该方案单任务成本约0.11美元,而对比的Claude Fable 5单任务成本约1.3美元,仅为后者的十分之一左右。有网友提出质疑,认为这样的成本差距可能仅来自单Token单价差异,毕竟自验证过程需要多次采样和检查,实际消耗的Token总量未必更低。团队核心成员Jacky回应称,公布的成本已经包含了生成多条候选轨迹与后续验证的全部开销,尽管整体Token消耗更多,但依托开源模型极低的单Token单价,最终的单任务总成本依然实现了碾压级的优势。
早在今年7月,研究团队就发布了论文《LLM-as-a-Verifier: A General-Purpose Verification Framework》,其核心突破在于提出了一种无需额外训练专门奖励模型或验证器,就能直接利用现有大模型对智能体的完整执行轨迹进行细粒度验证与排序的方法。目前该研究已经在代码开发、机器人控制、医疗诊断等多个领域完成了验证。本次更新的v0.2.0版本,主要新增了对DeepSeek V4 Flash的验证支持以及Terminal-Bench 2.1的自验证基准。
该框架的设计亮点不仅限于测试阶段的性能扩展,验证信号还可以用于进度跟踪与强化学习。过往针对复杂AI智能体的强化学习微调,最大的阻碍之一就是缺乏高质量的奖励信号,而该框架基于概率加权的连续验证分数,恰好可以提供平滑且高密度的奖励信号,解决了这一痛点。
在具体的终端控制任务中,系统首先由DeepSeek-V4-Flash生成5条mini-swe-agent执行轨迹,随后模型自身同时承担“裁判员”的角色,为这些候选轨迹打分,最终由LLM-as-a-Verifier框架完成细粒度排序并选出最优解。
实验数据展现了极为显著的性能跃迁:原生单次生成的任务成功率仅为78.7%;在Best-of-3策略下,系统成功率跃升至86.5%;当扩大到Best-of-5时,成功率进一步提升到88.0%。更为关键的是Oracle理想选择上限指标达到了96.6%,论文汇总不同智能体配置后的数据显示,理想选择器下的任务覆盖率最高甚至可达98.9%。
这意味着对于绝大多数复杂任务,只要为模型提供5次尝试机会,正确的解题轨迹其实早已包含在候选池中,大模型并不缺少生成正确答案的能力,过往限制系统表现的核心短板,恰恰是缺少一双能精准挑出正确答案的“眼睛”。
有观点提出,既然候选池中早已存在正确轨迹,为何行业沿用已久的LLM-as-a-Judge大模型裁判方案此前总是难以准确筛选?事实上,传统裁判机制的核心痛点在于离散评分的颗粒度过粗。传统评判方式通常要求大模型直接输出1到5分的整数分数,但在处理长逻辑代码或复杂系统操作时,两条仅存在细微质量差异的执行轨迹,往往会被模型同时判定为4分或5分。原论文实测显示,单次离散评分的平局率高达26.7%,当超过四分之一的候选方案陷入平局时,系统根本无法完成最优筛选。
后续实验进一步发现,提高评分粒度、增加重复验证次数、拆分评价标准,都能持续提升验证准确率。这意味着测试阶段的扩展不仅限于多生成候选轨迹,验证侧的计算能力提升本身也可以成为独立的扩展维度。
LLM-as-a-Verifier的破局之处在于,不再依赖模型输出的干瘪文本评分,而是深入捕获模型在输出评价时的底层对数概率分布。普通的LLM Judge通常仅读取模型最终输出的离散分数,而LLM-as-a-Verifier则进一步利用不同评分Token对应的概率分布,计算出连续的验证分数。因此即使两条轨迹最终都被判定为“4分”,只要模型对相邻评分档位的概率分布存在差异,仍然可以进一步拉开两者的评分差距。
在此基础上,团队还将验证计算沿三个方向进行扩展:增加评分粒度、对同一轨迹重复评估、将复杂评价拆分为多个标准分别判断。实验显示,随着这三个方向上的验证预算增加,验证准确率都能得到持续提升,这也是论文将验证定义为一条独立扩展轴的重要依据。
在落地过程中,随着候选数量增加,全量两两比较的计算复杂度会呈现O(N²)的爆炸式增长。团队因此提出了Probabilistic Pivot Tournament算法,避免对所有候选进行完整的两两比较,仅用更少的比较次数就能完成候选排序;同时在工程层面通过前缀缓存技术,进一步降低长智能体轨迹的重复输入成本。
过往对于测试阶段的扩展,行业更多关注多采样、多搜索,而LLM-as-a-Verifier补上了另一半拼图:在生成候选轨迹之后,验证本身也值得投入计算资源。对于开发者而言,模型选型不再仅仅看单Token价格,而是需要综合考量单位成功任务的总成本。使用廉价模型多生成几次候选轨迹,再通过验证器筛选,依然可能比直接调用昂贵的旗舰模型更加划算。
这一点对于开源模型尤其重要,过往高质量的验证往往依赖额外训练奖励模型、PRM,或者调用更强的模型作为裁判,而该团队的研究证明,现成的大模型本身就能承担相当一部分细粒度的验证工作,甚至可以同时作为生成者与验证者,这让验证器有机会进一步融入智能体的运行框架,成为运行时的基础能力。

