文章摘要
文章介绍了新基准HarnessEval - W,传统世界模型评测方式有短板,为此引入Harness打造新智能评测体系。它将人类评测流程自动化,有多种评测能力。HarnessEval - W以世界模型为试验田开源,有观测质量、状态转移正确性、世界持续性三个评测维度,其评测流程动态智能。未来还将从测试时、技能库、自回归三方向扩展。

基准测试从来不是单纯的能力打分工具,它更像是为技术发展划定方向的标尺。当我们探索物理世界递归自改进领域的世界模型时,传统的评测方式却始终存在明显短板:难以实现稳定可信的自动化判断,无法精准定位模型的错误根源,更无法清晰解释模型失效的原因。人类可以轻易识别生成内容中的异常,比如物体凭空消失、碰撞运动不合理等,但这些判断却很难被AI自动化实现。

为此,我们将大语言模型生态中的核心概念Harness引入评测领域,打造了一套全新的智能评测体系。Harness并非简单的代码封装,而是一套完整的智能工作流执行框架,它将人类的评测流程——问题分解、工具调用、推理验证——转化为可自动化执行的步骤。人类的评测本质上也是一套工作流:我们在评估生成的虚拟世界时,会不自觉地完成物体定位、时序追踪、动作合理性判断、物理规则核验等一系列复杂操作,而Harness将这一过程转化为智能体式基准测试,由全局智能体统筹,动态派生专业子智能体,从多个角度审视模型输出,像侦探一样交叉验证证据,最终形成严谨的判断。

这种全新的评测模式,将静态的问答规则升级为主动寻找证据的智能系统。其核心不是固定的流水线,而是一组可按需调用、组合和递归展开的评测能力,具体包括:

  • 规划评测路径:根据具体案例确定适配的评测方式
  • 拆解复杂问题:调度多个专业子智能体逐层分解任务
  • 识别动作意图:明确待执行动作及其预期的状态变化
  • 搜寻相关证据:定位与评测目标相关的视觉和逻辑线索
  • 调用专业工具:按需使用测量、推理等辅助工具
  • 形成完整结论:整合所有证据构建严谨的推理链条

我们以世界模型为试验田,正式开源了HarnessEval-W,邀请社区共同参与构建这一新型智能体基准测试工作流。我们将世界模型的核心能力拆解为三个核心评测维度,搭建了完整的评测体系。

根据行业通用定义,物理世界模型的核心是基于历史观测和用户动作预测未来世界状态,无论是双向视频扩散模型还是自回归视频模型,都可以纳入HarnessEval-W的评测范围。这套评测体系的核心逻辑在于验证三个问题:生成的世界是否被正确呈现?动作是否引发了符合预期的状态转移?这个世界能否在时间中保持持续一致?

1. 观测质量

该维度衡量模型输出的视觉观测是否可信,重点关注生成内容在感知层面的质量,包括视觉连续性、结构合理性与整体真实感。

2. 状态转移正确性

该维度关注模型能否在正确的时间以正确的方式响应用户动作,并让世界状态发生符合预期的变化。我们进一步将状态转移分为三类:探索式转移对应观察者在世界中的移动,比如调整相机位置和视角;意图式转移指用户主动修改实体、关系或事件,比如移动物体、触发特定动作;物理转移则聚焦于施加物理控制后,世界是否按照合理的物理规律演化,比如碰撞、推动、掉落等动力学过程。

3. 世界持续性

该维度关注随着世界不断演化,模型能否维持一个持续存在且内部一致的虚拟空间。我们重点验证三类典型场景:抗漂移能力,即长时间生成中世界的整体布局、风格和物体外观是否保持稳定,不会出现无意义的偏移;重访一致性,即观察者离开后返回时,物体和场景的状态是否与此前保持一致;画外演化,即动态过程离开视野后,是否仍按照时间和物理规律继续演化,而非被冻结或随意改变。世界持续性并不要求所有内容一成不变,而是要求稳定属性保持一致,动态状态沿着合理轨迹演化。

智能动态的评测流程

世界模型的评测高度依赖具体场景上下文,不同案例的环境、动作类型、时间结构和观测状态都存在差异,很难用固定的问题或静态指标覆盖所有情况。HarnessEval-W的核心是能够动态制定评测策略的智能体:针对每个案例,它先理解当前世界和评测目标,规划评测路径,调度不同专业能力的子智能体,结合收集到的证据逐步形成可验证的评分判断。整个评测过程会根据当前具体的世界场景调整,不会预设固定流程,而是让评测路径随案例动态生成。它不仅要回答“结果是否正确”,还要验证收集的证据是否足以支撑结论,为每个案例提供可解释、可复现且按需定制的评测过程。

技能选择与拆解

评测的第一步不是直接打分,而是确定该案例应该关注哪些问题。HarnessEval-W会先理解评测案例的上下文和目标,调用适配该场景的评测技能。比如在机器人操作场景中,动作是否正确执行、是否符合物理规律,比画面的“电影感”更为重要,系统不会机械套用统一的评测指标,而是选择与场景真正相关的评测能力。选定技能后,系统会将其拆解为更小、更明确、更易测量的子问题,交给合适的子智能体或工具。比如判断碰撞是否合理时,系统会追问目标物体的位置、接触时机、碰撞前后的速度变化等,通过目标追踪、时序验证、速度计算等工具获取证据,最终由主智能体汇总验证形成结论。如果问题仍然复杂,子智能体还可以继续调度新的子智能体,层层拆解直到任务足够明确。

从单一分数到可追溯的证据树

HarnessEval-W的最终目标不止于输出一个数字得分,而是构建一棵层级式的证据树,完整记录评测的内容、提供视觉证据的工具,以及支撑最终分数的完整逻辑链。有了这条可执行、可追溯、可验证的证据链,研究者不仅可以准确定位模型的错误来源,还能据此改进后续的模型设计和训练流程。

规模化的评测数据集构建

有效的基准测试需要覆盖足够复杂多样的环境,才能探索世界模型的能力边界。我们采用智能体流水线来构建评测案例,实现规模化扩展。整个流程从预定义的场景分类体系开始:首先采样世界的初始配置,确定环境、物体、空间结构、视觉风格和观察视角等属性,再为案例选定评测维度,尤其是状态转移和世界持续性指标。随后,图像生成智能体生成世界的初始帧,动作规划智能体理解画面内容并围绕评测维度设计具体动作,比如测试重访一致性时,会设计“离开区域再返回”的相机轨迹。最后引入独立的验证智能体进行质量控制,检查初始图像和动作设计是否协调,未通过验证的案例会自动重新生成,直到满足评测要求。通过这一闭环流程,基准测试可以持续扩展,同时保持必要的复杂性和可验证性。

让智能基准测试持续进化

世界在不断进化,评测体系也应当同步进化。评测从来不是一套静态的标准,随着世界模型进入更复杂的场景、展现更强的能力,评测体系也需要拓展边界。HarnessEval-W只是我们探索智能体基准测试新范式的起点,我们诚挚邀请社区的研究者和开发者共同参与,让这套体系在协作迭代中不断成长。

我们未来将重点关注三个方向:

  1. 测试时扩展:大语言模型推理时会生成复杂的推理轨迹并借助外部工具完成长时任务,评测系统也需要获得相应的扩展能力,允许在测试时投入更多计算资源,执行更深的搜索、多步验证和工具调用,确保评测能力始终跟上前沿生成模型的发展
  2. 技能库扩展:未来的世界模型将覆盖更广泛的应用场景,生成包含更复杂物理过程和细节的环境,因此评测系统需要不断扩展技能库,让智能体可以动态检索并组合专门技能,准确评估生成世界中的物理理解能力
  3. 自回归改进:我们希望基准测试本身具备自我改进能力,当评测遇到分布外场景时,系统不会仅给出低置信度分数,而是先评估自身的能力缺口,通过引入新技能、学习工具使用方式或自主探索构建新的评测能力,进一步扩展技能库,让评测能力随着任务复杂度提升而进化

我们希望HarnessEval-W开启的不只是一套世界模型的基准测试,而是以Harness重新定义基准测试的范式:让基准测试能够推理、能够验证,能够与被评测的模型一同进化,最终让基准测试成为技术的驱动者,让Harness成为认知的引擎,完成递归自改进的智能飞轮。

以上内容不代表本平台立场,仅供读者参考