世界模型写解题过程 CausalWM登顶机器人基准榜

世界模型也开始写「解题过程」
当我们把桌上的杯子从左侧推到右侧,这个动作看起来再自然不过。但拆解来看,所谓的“未来”并非凭空出现:手臂先完成移动,接触发生后杯子才开始滑动,运动又改变了物体的位置和空间关系,最终才形成下一刻我们看到的画面。
对于世界模型来说,核心挑战也正在于此。当下不少模型已经能够熟练地从当前画面直接生成未来画面,但运动、接触、空间变化这些关键过程都被封装在模型内部,我们无法判断它究竟真正理解了物理世界的运行逻辑,还是仅仅依靠训练数据的统计规律“猜”出了看似合理的结果。
近期,Aether AI正式发布了首款16B参数的因果世界模型CausalWM,它尝试将原本隐藏在模型内部的物理过程显式化,并引入了全新的技术范式——因果思维链(Causal Chain-of-Thought,简称Causal CoT)。
简单来说,CausalWM并不会直接从当前画面跳跃到未来画面,而是先推演物体的运动方式、三维几何关系的变化,再基于这些中间结果生成最终的未来画面。Aether AI希望通过这种方式回答一个更具深度的问题:世界模型能否不只预测“未来长什么样”,更能理解“未来是如何一步步发生的?”
目前这套方法已经获得了阶段性的实验验证。在最新更新的机器人世界模型基准TriWorldBench上,CausalWM登顶排行榜,取得Top-1的成绩。该榜单专门考察世界模型对机器人任务的预测能力,尤其关注头部相机、左腕相机、右腕相机的三视角一致性,总计包含六个评测维度、19项具体指标,仅靠“看起来合理”很难拿到高分,必须真正理解物理机制才能达标。
这个思路和团队此前发布的RSIAgent一脉相承:RSIAgent让智能体进入陌生软件,通过主动探索和反复验证梳理出操作与结果之间的关联,并将经验沉淀到记忆模块中,它无需更新模型参数,就推动Kimi-K3、GLM-5.3等开源模型在OSWorld 2.0、Agents’ Last Exam等基准上超过GPT-6 Astra等闭源模型。RSIAgent处理的是数字环境中的因果关系,而CausalWM则将这一问题推进到了机器人所在的物理世界。
相比“又一个榜单第一”,更值得探讨的是:CausalWM为什么要在世界模型中加入这条因果思维链,以及这条链究竟是如何运作的?
- 论文标题:CausalWM: Causal Chain-of-Thought Reasoning for Embodied World Model
- 代码仓库:https://github.com/AetherLabsAI/CausalWM
- 模型权重:https://huggingface.co/AetherLabs-AI/CausalWM
- 项目主页:https://aetherlabsai.github.io/CausalWM/
- 论文链接:https://openreview.net/pdf?id=3pf4d0EEqm
当前主流的世界模型多采用直接映射的路径:输入当前画面和动作指令,直接生成未来视频。这种方法在数据规模足够大时效果不错,比如模型看过大量“手推杯子”的视频,就能大概率猜出杯子接下来会移动。但这种方式将运动、接触和空间变化都压缩在模型内部,无法验证其对物理过程的理解程度。当场景变得复杂,比如机器人连续操作多个物体,预测时间拉长时,中间一次接触判断失误,后续的画面就会出现越来越大的偏差。
CausalWM的思路类似让只写答案的学生补上解题过程:它不会直接从当前画面跳到未来画面,而是在生成视频前,先显式预测其中的物理变化环节。团队选取了几类可以从视频中自动提取的物理变量:
- 光流(Optical Flow):描述画面中物体的移动方向和位移幅度
- 深度(Depth):描述物体与相机之间的距离
- 点云图(Pointmap):为画面中的像素补充三维空间位置,让模型获得更明确的三维几何关系
但真正让CausalWM脱颖而出的,并非使用了光流、深度或点云图——这些变量早已被广泛应用于视频预测和视觉理解,有时也作为辅助监督信号出现。CausalWM的核心创新在于,将这些变量组织成了一条有序的推理链。
还是以推杯子为例,模型不会直接回答“几帧后杯子会在哪里”,而是先思考“画面中什么物体正在运动,正往哪个方向移动”,这对应物理运动(Physical Motion)环节,可以通过光流来表达。接下来,模型继续推演:“这样的运动会让场景中的三维空间关系发生什么变化?”杯子的位置、机械臂与杯子的相对距离都会改变,整个场景的三维结构随之变化,这对应几何(Geometry)环节,可以通过深度、点云图等变量表达。完成这两步推演后,模型才会生成最终的未来画面:“在这样的运动与几何变化后,未来画面应该是什么样子?”
由此,一条典型的推理链就此形成:Observation → Physical Motion → Geometry → Future Observation
这里有一个至关重要的区别:传统方法即使预测光流、深度或点云图,也可能只是将它们作为训练阶段的辅助目标,模型完成这些“辅助题”后,未来视频的生成仍然可以走内部的其他路径。但CausalWM不同:模型预测出光流后,会将这一结果重新放入上下文,用于判断三维几何关系;随后得到的点云图也会进一步进入上下文,参与未来画面的生成。因此,每一步既是预测目标,也是下一步推理的条件。这也是团队将其称为因果思维链的原因:它利用现实世界本身存在的运动与几何变化,搭建出一条真正参与未来生成的推理轨迹。
为了避免模型在训练时“偷看答案”,CausalWM还加入了阶段有序注意力掩码(stage-ordered attention mask)。简单来说,就是为不同的推理阶段规定信息读取权限:前面的步骤只能查看已经发生的信息,无法提前读取后续的点云图或未来画面。否则,模型即使表面上完成了运动、几何等中间预测,实际上可能已经从“最终答案”中反推出前面的变量,这条因果链也就失去了实际意义。因此,无论是训练还是实际推理,模型都必须按照“Motion → Geometry → Future”的固定顺序推进。
3 万小时视频,分三步把因果链训出来
要让模型真正沿着这条因果链推演,仅靠架构设计是不够的。Aether AI为CausalWM构建了约3万小时的具身视频混合数据集,覆盖机器人操作、第一视角视频、多视角机器人数据以及其他物理交互场景。整个训练过程分为三个阶段:Pixel-level Pre-training → Causal CoT Mid-training → Multi-objective RL Post-training
第一阶段:先建立足够强的世界生成能力
CausalWM以LTX-2.3-22B为基座,在大规模视频上学习语言条件下的未来预测能力。当输入一段当前画面和任务描述时,模型首先需要生成连贯、可信的后续视频。没有这一基础,后续的物理推理便无从谈起。
现实中的视频数据存在一个痛点:大量视频没有对应的机器人动作标注,即使有标注,不同机器人的关节数量、控制方式和动作空间差异巨大,难以直接统一训练。为此,团队引入CD-LAM,从视频中提取统一的潜在动作表示,将画面中发生的变化压缩为一种潜在的动作表达,让模型在缺乏真实控制指令的情况下,仍能学习“什么动作带来了什么变化”。来自不同机器人的视频,也可以通过这套统一表示共同用于动作条件下的世界演化建模。此外,考虑到机器人通常同时配备头部、手腕等多个摄像头,团队在这一阶段还训练了多视角版本,让模型从不同位置观察同一次操作,并保持物体状态和机器人动作的一致性,这为后续参加TriWorldBench的三视角评测打下了基础。
第二阶段,模型开始正式学习 Causal CoT
第二阶段是模型正式学习因果思维链的环节。团队选取光流、深度和点云图作为中间物理变量,它们分别描述画面中的运动、物体与相机的距离,以及更明确的三维空间关系。这些信息都可以从原始视频中自动提取,无需逐条人工标注,因此更容易扩展到大规模数据集。
在训练过程中,模型按照预设的物理依赖关系逐步生成中间变量,典型顺序为:Flow → Pointmap → Future RGB。模型先预测物体的运动方式,再推演三维几何关系的变化,最后生成未来画面。前一步的预测结果会被重新放回上下文,用于指导下一步的推理。这样一来,光流和点云图既是需要预测的目标,也是后续推理直接使用的条件。为了防止模型在训练中提前看到后续信息,CausalWM同样使用了阶段有序注意力掩码,确保每个阶段只能读取当前步骤之前的信息,后续的点云图和未来视频不会向前泄露,保证训练和推理的顺序一致,让因果思维链真正参与到未来视频的生成中。
第三阶段:用最终结果反过来优化整条推理链
视频生成具有很强的开放性:同一个初始场景可能存在多个合理的未来,无法像分类任务一样依靠唯一标准答案进行训练。单纯使用监督学习,也很难同时兼顾物理一致性、时序质量和任务完成度。为此,CausalWM加入了多目标强化学习。针对同一个上下文,模型会采样多个未来结果,再从物理一致性、视觉质量和任务完成度等维度获取奖励,通过基于组的优化比较和优化这些候选结果。
这一阶段的优化范围还包括中间的因果思维链:模型会根据最终视频的质量,探索哪些推理路径更有效,能够产生合理未来的中间过程得到强化,容易导致运动和几何关系偏差的路径受到抑制。经过这一阶段,因果思维链不再是固定的监督链,而是变成可以探索和优化的物理推理过程。模型学习的不再只是未来画面的外观,还包括如何通过一组更合理的中间变化,最终到达目标未来。
当 Causal CoT 变成 In-context Learning 的控制接口
因果思维链还带来了一项额外的能力。在训练过程中,CausalWM不断接收光流、深度和点云图等视觉变量,并利用它们生成下一阶段的结果。久而久之,模型学会了一种更通用的操作逻辑:只要新的条件能够被表示为视觉信息,就有机会被放入上下文,参与未来画面的生成。
这为模型控制留下了入口。假设研究人员已经在仿真器中规划好了机械臂的关节运动轨迹,利用机器人的URDF结构信息和正向运动学,这串关节数据可以被渲染为画面中的动作轨迹,再编码为视觉标记后输入CausalWM。经过少量微调,模型便能识别这种原本不在因果思维链中的条件,并生成与指定轨迹一致的未来视频。人工绘制的物体路径、几何约束等视觉信号,也可以通过同一接口输入。
原本用于解释未来如何发生的中间变量,由此变成了可以调节的“控制旋钮”。这一点非常接近因果问题的核心:普通的预测只会问“按照已有画面,接下来大概率会出现什么?”,而加入轨迹相当于主动改变一个条件,再观察未来如何随之变化。模型开始处理“如果让机械臂这样运动,杯子会如何移动”这类带有干预意味的问题。当然,这距离严格意义上的反事实推理还有一定距离,但它已经让世界模型从被动观察未来,转向主动操纵条件、比较结果,迈出了关键的一步。
Causal CoT 真的有效吗?
Causal CoT真的能让世界模型更好地预测未来吗?Aether AI在多类具身世界模型基准上对CausalWM进行了评测,覆盖语言条件、动作条件、单视角和多视角预测,包括在线基准TriWorldBench和离线基准PAI-Bench等。测试结果显示,CausalWM在多个设置下都取得了领先的成绩。
其中,TriWorldBench提供了一个非常直观的观察窗口。与多数只评测单个外部视角的视频基准不同,它要求模型同时生成头部、左腕和右腕三个视角的画面,这非常贴近机器人真实工作时的观察方式:头部相机用于观察全局任务进展,腕部相机则关注局部接触和抓取操作。因此,三个画面不仅要各自“看起来真实”,还必须描述同一个物理世界:机器人何时运动、物体是否被正确抓取、不同视角中的状态能否对应一致。
在最新的排行榜中,CausalWM以66.04的TWB-Score位列第一,其中三视角一致性、任务对齐、运动质量、透视合理性和图像质量等多项指标都处于前列或领先位置。它并没有包揽所有单项第一,但最终总分领先,说明在这套评测体系下,CausalWM能够较好地同时处理多视角一致性、任务理解、物理交互和视频生成质量等多个维度的要求。
除了TriWorldBench,团队还在PAI-Bench等不同设置下进行了测试,并同样取得了排名第一的成绩。与侧重机器人多视角一致性的TriWorldBench不同,PAI-Bench拷问的是一个更底层的问题:模型预测的未来是否符合物理规律?该基准的所有案例都来自行车记录仪、工业相机等真实采集的画面,覆盖自动驾驶、机器人操作、工业场景、人类活动、物理常识等多个领域。评测时不仅会考量画面质量,还会引入「Domain Score」,让多模态大模型作为裁判,针对生成视频逐条追问物理细节。因此,模型无法仅靠“画面生成得像”来获取高分。
仅靠单个榜单的榜首难免存在偶然因素,但如果同一套方法在多种任务设置下都能取得不错的结果,至少能够提供一个方法层面的信号:相较于让模型直接从观察跳跃到未来,将中间的运动和几何环节显式建模,或许能够帮助世界模型更稳定地预测物理世界的变化。
Aether AI 的 CausalWM:从 “预测世界” 到 “理解世界”
过去几年,世界模型的发展主线非常清晰:更多的数据、更大的模型、更长的视频、更高的分辨率。这条缩放路线教会了模型回答一个问题——未来长什么样。但Aether AI更关注另一个问题:未来为什么会这样发生,以及什么真正决定了未来。
这也是Aether AI持续推进因果智能的核心出发点。对于当前的世界模型而言,多数方法都会将运动、几何和物理知识隐式压缩到隐表示中。模型或许能够生成看起来合理的未来画面,但却很难判断它是否真正识别了关键因果变量,还是依赖数据中的短期关联直接“猜”出结果。随着预测时间变长、物体交互变得复杂,这种隐式建模的局限性会愈发明显,误差会在未被直接观察到的环节层层累积。
CausalWM是Aether AI在因果世界模型方向上的首次尝试,它试图将原本隐藏在模型内部的物理变化显式化:将光流、深度、三维几何等变量组织成有序的因果思维链,让模型沿着Motion → Geometry → Future的因果链逐步推演,再生成最终的未来画面。换言之,模型不再只是学习“输入到结果”的相关性,而是开始显式建模哪些中间变化导致了哪些后续结果。
实验结果验证了这条路线的潜力:CausalWM登顶TriWorldBench,并在PAI-Bench的多项指标上超过了当前的最优模型,其中不乏参数规模更大的方法。相较于单纯继续扩大模型规模,Aether AI更希望验证另一条路径:通过建模因果变量、因果依赖关系和因果转换过程,提升世界模型对物理世界的理解能力。
更进一步,因果思维链还让“因果推理”和“控制”开始共享同一套接口。原本用于解释未来的中间变量,也可以反过来作为干预手段,通过上下文学习的形式注入模型。例如,将仿真器中规划的机械臂轨迹渲染为视觉信号后加入上下文,模型就可以生成与该干预一致的未来画面。这意味着,世界模型开始从单纯观察“世界会发生什么”,进一步转向建模“当我们改变某个变量、施加某个行动之后,世界将如何变化”。
当然,CausalWM仍然只是这条路线的起点,距离更完整的因果发现和反事实推理还有很长的路要走。但这也正是Aether AI希望持续推进的方向:从因果表示学习、因果推理到因果干预,逐步实现更完整的因果智能。注:图灵奖得主Judea Pearl将智能分为三层:关联、干预、反事实,按照Pearl的因果之梯划分,当前的主流模型大多停留在第一层“关联”,无法触及“干预”与“反事实”层面。
将视野放宽来看,CausalWM只是这条长期路线的一个阶段性成果。RSIAgent让智能体在数字环境中主动探索、验证操作与结果的关系,而CausalWM则将这一问题搬到了物理世界:一个处理软件中的因果关系,一个处理物理世界中的因果关系。这也是Aether AI“Towards Real-World Causal Intelligence”所指向的方向——让AI从预测相关性,进一步走向发现因果、理解因果、利用因果,并最终通过因果作用于真实世界。
该团队的下一份研究成果,值得期待!

