文章摘要
TriWorldBench Challenge更新首周评测榜单,这是全球首个聚焦机器人三视角世界模型的专业评测平台,旨在推动行业从“生成”迈向“理解”。首周榜单前三名揭晓,数据显示竞争焦点已转变。该平台提出综合评测体系,不止排名,还能精准定位改进方向。其面向全球团队开放,官网及GitHub已开源。

由北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的TriWorldBench Challenge,近日更新了首周评测榜单。作为全球首个聚焦机器人三视角世界模型的专业评测平台,该榜单旨在搭建更全面的具身世界模型评估体系,推动行业从单一的视觉生成阶段,转向真正的世界理解方向。

TriWorldBench会从三视角一致性、任务执行能力、物理空间理解等多个维度综合评估模型表现,面向全球相关研究团队开放参与,目前已收录多组公开评测结果,后续还会持续更新榜单内容。

首周榜单的前三名分别为:来自CASIA-DRL的WoVR_Plus模型、同济大学空间智能团队的BetaBWM模型,以及Fysics AI的Fysiverse-Video模型。

榜单自发布以来,网页总访问量已破万,测评工具下载量超200次,单日访问量最高突破千人;短短一周内就有14支正式参赛队伍提交了评测结果。这一数据表明,当前三视角世界模型的竞争焦点,已经从单一视图的视觉保真度,转向多视角(头部视角、左腕视角、右腕视角)间的时空一致性与物理逻辑自洽性。

目前各参赛队伍的排名差异,主要源于模型在多视角几何对齐、任务执行准确性及物理动态理解等维度的表现,而非单帧图像的感知质量。TriWorldBench希望通过系统化的评估框架,对这些多维能力差距进行精确量化与可解释性分析,推动世界模型从“视觉生成”向“具身认知”范式演进。

传统评价体系的局限与新评测的必要性

该榜单聚焦机器人操作场景中的头部视角、左腕视角、右腕视角多视角视频生成与理解能力,希望建立更全面的世界模型评价标准。过去,视频生成模型的评价更多关注三个核心维度:画面是否清晰、内容是否符合描述、视频是否连续流畅。但对于具身世界模型而言,仅仅生成一段“看起来真实”的视频远远不够。

机器人需要面对的是一个动态、连续且遵循物理规律的真实世界。在实际的机器人系统中,一个任务通常由多个摄像头共同完成观察:头部摄像头负责提供整体环境信息,帮助机器人理解当前任务状态;腕部摄像头贴近操作区域,可以精准捕捉抓取、接触等细节动作。不同视角之间并非简单的信息重复,而是共同构成机器人对世界的完整认知。

因此,一个真正可靠的具身世界模型,不仅需要生成单个视角下合理的视频,还需要保证多个摄像头看到的是同一个世界。这也成为当前世界模型评测体系中亟待解决的核心新问题。

三视角综合评测体系的核心设计

针对多视角一致性这一核心挑战,TriWorldBench Challenge提出了一套面向机器人操作场景的综合评测体系,相比传统单视角视频评价方式,更关注模型是否具备真实世界理解能力。

多视角一致性:三个摄像头是否描述同一个世界?

TriWorldBench首先关注三路视角之间能否相互对应。模型生成的头部、左腕和右腕视频,不仅要各自合理,还需要保证活动机械臂和动作阶段相互对应、抓取接触及动作进度保持一致、目标物体的类别外观和状态不存在冲突。换句话说,三路视频不能只是分别“看起来合理”,还需要共同描述一次完整、连贯的机器人操作过程。

任务执行能力:机器人是否真的完成了任务?

对于机器人而言,视频生成不是最终目标,完成任务才是核心。TriWorldBench进一步评估模型对于机器人操作过程的理解能力,包括指令是否正确执行、机械臂运动是否符合预期、抓取移动释放等操作是否合理。其中,头部视角主要用于判断任务指令、机械臂轨迹和最终结果;腕部视角则进一步检查抓取是否稳定、是否发生滑移,以及夹爪与物体之间的局部交互是否正常。这意味着,画面看起来足够清晰流畅,并不代表机器人真正完成了任务。TriWorldBench希望让世界模型评价从“看起来像”进一步走向“真正可用”。

物理世界理解:模型是否真正理解三维空间?

机器人面对的是三维物理世界,因此世界模型不仅需要生成视觉内容,还需要理解物体之间的位置关系、动作变化过程、不同视角下的空间对应关系。TriWorldBench希望通过多视角评测,进一步探索世界模型对于真实环境的理解能力。

不止于排名:打造研发诊断工具

对一个榜单来说,排出名次只是第一步,更重要的是能够解释模型得分高低的原因,并将清晰的改进方向反馈给研究者。TriWorldBench没有将三路视频压缩为一个简单的平均分,而是建立了从同步数据、动作状态到多层结果的完整评测链路。

从数据到指标:全面评估模型能力

评测基准包含500个三视角同步episode,覆盖50个机器人操作任务。系统围绕三视角一致性、任务对齐、物理与3D一致性、运动质量、时序一致性和视觉质量六个维度,汇总19项评测信号,并以TWB-Score作为榜单总分。

多视角协同判断任务状态

三视角一致性被放在整个评测体系的核心位置。每个生成视角先与对应的真值相机进行对照,再通过head-wrist语义判断和联合三视角问答,检查机械臂状态、动作阶段、接触关系以及目标物体是否相互兼容。评测并不要求视角差异巨大的头部画面与腕部画面在像素上完全相同,而是判断它们能否共同解释同一次操作。

与此同时,指标会被分配到证据最可靠的相机:头部视角更适合判断任务指令、全局进度、机械臂轨迹和最终结果;腕部视角更适合观察接触、抓取稳定性、滑移和局部几何。这样既不会让腕部遮挡影响全局任务判断,也不会让清晰的头部画面掩盖夹爪附近的操作失败。

STATE标注:精准判断运动合理性

TriWorldBench从参考机器人轨迹中构建STATE标注,识别当前动作阶段、活动机械臂,以及每个视角预期处于运动还是静止状态。如果本该运动的腕部长时间冻结,或者不该动的相机出现多余运动,系统都会自动识别并扣分。这一设计让“稳定”不再等同于“全程不动”,运动丰富也不再天然代表模型理解了任务。

细粒度结果:精准定位改进方向

画质和美学分数不会脱离任务单独决定胜负。当头部轨迹错误,或三路视频在机器人和物体状态上发生冲突时,系统会对视觉质量进行任务约束后的修正,避免一段精致但错误的视频凭借“好看”获得不合理优势。在VLM语义评测中,评测协议还会先与人类专家的打分和排序进行对齐,再冻结规则用于正式测试。

榜单除了报告TWB-Score总分,还保留六大维度、单项指标、逐视角、head-wrist配对和联合三视角结果。研究团队因此不仅能看到排名,还能精准判断问题究竟出在任务执行、运动控制、画面画质,还是三个摄像头之间的世界状态没有对齐。这让TriWorldBench更像一套面向研发的“体检报告”:它不只回答谁更强,也帮助解释模型下一步应该从哪些方向进行优化。

全球团队开放参与,共探具身智能下一阶段

TriWorldBench Challenge面向全球相关研究团队开放报名,参与对象包括具身世界模型研究团队、具身智能团队、视频生成模型团队,以及多视角生成与理解方向团队。无论是专注视频生成能力,还是探索机器人交互与空间智能方向的模型,都可以通过统一的数据和评测体系参与挑战。

通过公开榜单,TriWorldBench希望为不同技术路线提供公平比较的平台,同时推动具身世界模型领域形成更加统一、科学的评价标准。未来的机器人,不仅需要看到世界,更需要理解世界、预测世界,并在真实环境中完成复杂任务。TriWorldBench Challenge希望推动行业共同回答一个关键问题:一个真正具备智能的世界模型,应该如何被评价?

首周榜单结果只是一个开始。随着更多前沿模型加入这场挑战,TriWorldBench正在成为观察具身世界模型技术进化的重要平台。未来,谁能让机器人更准确地理解空间、预测变化并完成复杂任务,将在持续更新的榜单中逐渐揭晓。

TriWorldBench Challenge已开放官方网站及GitHub开源仓库,欢迎全球研究者参与交流:
TriWorldBench官网网站:https://www.triworldbench.com/
GitHub开源:https://www.github.com/TriWorldBench/TriWorldBench

以上内容不代表本平台立场,仅供读者参考