文章摘要
斯坦福大学等团队提出Masked Visual Actions技术,将机器人动作渲染为像素轨迹。该技术使模型能实现正向预测、逆向生成等多功能,有优秀跨本体泛化及零样本双向建模能力。虽提升了模型规划等表现,但受基础视频模型限制,仍有不足。

当机械臂需要完成将咖啡机旁的杯子移到桌面这类日常操作时,传统的模型驱动规划流程往往需要先生成多条候选动作,再交由世界模型进行预演,最终根据预演结果确定最优执行路径。

传统的视频世界模型通常会接收当前画面和关节角、末端位姿、夹爪状态等数值动作,生成执行动作后的未来视频。但这类模型存在一个明显的痛点:视觉模型要建立数值动作和画面动作之间的对应关系,需要额外的学习成本,而且这种学习高度依赖特定机器人产生的训练数据,一旦更换机器人,数据结构就会发生变化,适配成本极高。

既然视觉模型更熟悉像素化的画面信息,能不能直接将机器人动作以可视化的方式呈现给模型?

近期,由斯坦福大学、马里兰大学帕克分校以及哈佛大学的研究团队联合发布了一篇题为《Masked Visual Actions for Unified World Modeling》的论文,第一作者为Hadi Alzayer,李飞飞、吴佳俊、张吕敏等研究者参与了该项工作。

该团队提出了Masked Visual Actions技术,将机器人的候选动作渲染为像素级的运动轨迹,再让视频模型补全环境的响应变化。通过调整输入的实体类型,同一个模型可以实现两种完全不同的工作模式:

  • 给定机器人的运动轨迹,预测环境会发生的变化;
  • 给定目标物体的运动需求,生成机器人需要采取的对应行为。

该模型仅使用约15小时的机器人交互数据进行微调,就可以支持正向预测、逆向生成、跨机器人本体适配、策略评估和模型规划等多种功能。在RoboCasa任务中,借助该视频模型辅助规划,任务成功率提升了7至26个百分点;模型预测的策略表现与真实仿真结果的相关系数达到0.982;在CoffeeServeMug任务中,逆向动作提取管线的成功率达到90%。

将动作转为可视化轨迹,打通视觉与控制的桥梁

传统的视频世界模型直接预测未来图像或视频,常见的输入格式是“当前图像+数值动作序列”,最终输出未来视频。但数值动作虽然可以精确控制机器人,却和视频模型熟悉的像素信息存在天然的表示差异。从一串动作数据到最终的画面变化,中间需要经过多层转换:动作数据→机器人姿态→相机投影→画面运动→环境响应。Masked Visual Actions技术就提前完成了这层转换工作。

训练数据主要通过两种方式构造:一种是直接从真实视频中分割出机械臂的运动轨迹,这种方式可以保留真实的视觉信息;另一种是根据机器人状态、URDF模型和相机参数,实时渲染机器人的运动,这种方式可以方便在推理阶段自由输入新的动作轨迹。

视频模型接收初始画面和渲染好的机器人运动轨迹后,就可以补全物体与环境的变化。和仅提供末端执行器点或机器人骨架的方式相比,完整的掩码还包含了机器人的形状、占用空间、遮挡关系和潜在接触边界,模型可以直接“看到”完整的动作过程。

更优秀的跨机器人本体泛化能力

这种表示方式带来了更优秀的跨机器人本体泛化能力。在DROID的训练分布内,完整掩码、末端执行器位置和机器人骨架都可以较好地控制视频生成,三者的表现差距并不明显。但当测试对象换成训练中未见过的自定义夹爪,或是直接换成BEHAVIOR中的双臂机器人时,三者的表现差距迅速拉开。

末端点和骨架仅能提供稀疏的运动信息,模型容易将新机器人改写成训练时见过的形态,甚至凭空生成另一台机器人;直接接收原始动作状态的Ctrl-World模型,在双臂机器人场景下也容易生成静止或损坏的画面。而Masked Visual Actions可以直接给出新本体的完整轮廓与运动轨迹,能够稳定保留机器人的形态,并继续预测其与环境的交互。换句话说,无论不同机器人的关节数量、动作维度和控制方式有多大差异,在进入视频模型后都会被转换为统一的信息格式,这让跨机器人本体泛化成为可能。

零样本切换双向建模能力

在此之前,已经有类似的尝试证明了“将URDF机器人渲染为掩码并作为视频模型条件”的可行性,比如BridgeV2W就将机器人动作渲染为像素对齐的本体掩码,再注入预训练的视频模型,这种方式可以缩小动作坐标空间和视频像素空间的差距,同时支持不同的机器人本体。

但Masked Visual Actions将问题进一步抽象为:在一段交互视频中,可以提供任意一部分实体的运动参考,让模型补全其余的实体部分。用填空题来类比的话,BridgeV2W的任务基本固定为“已知机器人动作,补全环境部分”,而Masked Visual Actions则可以概括为“已知交互中的部分实体,补全剩余部分”。

这就让模型获得了逆向使用的能力:当我们希望物体按照特定方式运动时,模型可以反推机器人需要采取的动作。实际上,该论文中的模型主要使用机器人掩码进行正向训练,但在推理阶段却可以直接接收目标物体的轨迹,实现零样本的逆向建模。作者认为,这种能力来源于视觉条件和视频模型内部表征之间的对齐。

在更完整的机器人系统中,正向和逆向两种推理模式可以连续配合。当机器人接到“将杯子放到桌上”的任务时,先通过逆向推理生成可能的动作方案,再由正向模型预演这些方案的执行结果,系统选择最可靠的轨迹执行。完成一小段动作后,摄像头重新观察当前场景,再进入下一轮的规划流程。

高效的模型微调与能力覆盖

该研究团队基于Wan-Fun-Control 2.2 14B模型进行LoRA微调,训练数据来自DROID真实机器人视频和RoboCasa仿真环境,包含成功和失败的轨迹。其中失败样本非常关键,世界模型需要学会错误动作会带来的结果,否则可能会对每一条候选轨迹都生成看似成功的未来画面。

根据论文描述,模型微调使用了约15小时的机器人交互数据,附录显示训练数据约包含1000条DROID演示样本和4000条RoboCasa样本,模型使用8张H200显卡训练约10000步,耗时4天。这套系统依赖14B的基础模型和较强的硬件支持,整体部署成本并不低,但它的数据效率很高,不需要从头训练机器人世界模型,仅通过少量的机器人样本就可以激活视频模型已有的运动、接触和物体交互知识,覆盖了多种核心能力:

  • 预测机器人动作带来的环境变化;
  • 根据目标物体的运动需求生成机器人的行为;
  • 适配训练中未出现过的机器人本体;
  • 从生成的视频中提取可执行的行为等。

实验结果与表现

实验中,先由Diffusion Policy为同一场景采样多条候选动作,再由视频模型生成对应的未来视频,最后由Gemini 3.1 Pro从任务进度、物理真实性和接触情况等多个维度评价每一段视频,最终选择最优的动作执行。

模型规划能力提升

在关闭微波炉、打开抽屉、打开洗碗机、关闭冰箱等任务中,加入视频模型规划后,任务成功率提升了7至26个百分点,而且随着候选动作数量的增加,整体的表现也会进一步提升。这相当于为机器人增加了推理时的计算环节:原有的策略负责提出动作方案,视频模型负责预演未来的执行结果,视觉语言模型负责筛选最优方案,策略的参数保持不变,系统通过对比更多的未来可能性来提升决策质量。

策略评估准确性

研究团队将同一套机器人策略分别放入RoboCasa仿真环境和视频世界模型中执行,模型生成视频中的任务成功率和真实仿真结果的相关系数达到0.982。在真实机器人的实验中,生成视频所体现的任务进度和实际演示的结果也较为接近,但模型仍然存在明显的乐观倾向,常常会想象出比现实更多的任务进展。因此,该模型更适合作为策略开发早期的低成本筛查工具,距离替代仿真器和实机测试还有较大的差距。

逆向动作提取效果

在CoffeeServeMug任务中,系统输入杯子的目标运动轨迹后,视频模型生成机械臂完成操作的完整过程,再由逆动力学模型提取可执行的控制动作。完整的管线取得了90%的成功率,高于论文中对比的Diffusion Policy、ACT和SmolVLA模型。这里的90%成功率来自“视频模型+逆动力学模型”的组合,视频模型提供完整的行为过程,逆动力学模型负责将可视化的过程还原为可直接执行的控制数据。

总结与未来方向

Masked Visual Actions将机器人动作、环境响应和结果评价统一到了同一个视觉空间中,将正向预测和逆向生成整合为条件视频补全任务。该技术也清晰地展示了视频模型在机器人系统中的一种分工模式:策略模块提出动作方案,视频模型预演未来的执行结果,视觉语言模型负责筛选最优方案,底层控制器完成实际的动作执行。

不过现阶段,这套方法仍然受到基础视频模型能力的限制:模型学习的是交互之间的相关性,缺乏严格的因果和物理约束,仍然会出现无接触运动、物体瞬移和任务结果凭空完成等问题。视频生成的速度和成本也限制了实时闭环控制的实现,逆向流程还需要额外的逆动力学模型支持,最终的动作执行仍然依赖数值动作和底层控制器。

以上内容不代表本平台立场,仅供读者参考