李飞飞团队TrAct:视觉轨迹让机器人先预演再行动

机器人在执行复杂任务时,往往需要先对未来进行预判再采取行动,但传统的机器人控制方案中,动作指令作为世界模型的输入存在不少局限。近期,相关研究团队在机器人世界模型领域取得了新的进展,他们通过引入视觉轨迹作为中间接口,搭建起了策略生成与未来预测之间的桥梁。
这项工作针对现有方法的痛点进行了优化。传统的机器人世界模型通常将动作作为条件信号,但动作本身与具体机器人本体强绑定,不同机械臂完成相似操作可能需要完全不同的控制指令,而且很难直接通过动作描述图像空间中任务相关点的运动轨迹。
为了解决这个问题,团队提出了TrAct框架,将视觉轨迹引入控制与预测的环节。具体来说,策略模型会同时生成动作和对应的视觉轨迹,世界模型则基于这些轨迹来预演未来的场景变化。
TrAct主要由三个核心模块构成:VLAT模块基于当前观测和语言指令,同时生成多组动作与视觉轨迹,二者成对输出且轨迹并非由动作转换而来;TWM模块以Stable Video Diffusion为骨干网络,通过ControlNet将视觉轨迹编码为空间控制条件,生成未来的视频预测结果;VLAC模块则根据任务指令对生成的所有候选结果进行打分,最终选择得分最高的结果对应的动作执行。
视觉轨迹描述的是任务相关点随时间在图像空间中的二维运动,模型会跟踪夹爪上的7个关键点,同时在腕部视角加入5×5个均匀采样的场景点,为场景和相机运动提供参照。每个决策步骤中,仿真环境下会采样20组候选结果,真实物理平台则采样16组候选结果。
相较于传统的以动作为条件的世界模型,视觉轨迹能够直接描述任务相关点在图像空间中的运动,为未来预测提供更明确的空间约束。此前已有工作将二维点轨迹、光流用于策略表示,也有研究用视觉运动来条件化世界模型,但TrAct的独特之处在于,让这种中间表示进入了基于视觉未来的任务评估闭环。
实验数据显示,这种改进带来了显著的效果提升:在LIBERO-INTEGRAL测试集上,以π0.5为基线模型,TrAct将平均成功率从27%提升到了55%;在真实机械臂平台上,面对未见任务和背景变化时,成功率从49%提升到了76%,同时世界模型对未来的预测准确性也有明显提升。
研究团队还进行了对照实验,训练了动作条件的世界模型AWM进行对比。在真实场景和仿真环境、外部视角和腕部视角等多种设置下,基于视觉轨迹的TWM模型在五项视频预测指标上全部优于AWM。以仿真外部视角为例,PSNR指标从15.12提升到24.51,LPIPS从0.438降至0.106,FVD从129降至38。
在标准LIBERO数据集上,现有模型已经接近性能饱和,但团队构建了更具挑战的LIBERO-INTEGRAL测试集,加入了物体替换、位置变化、任务设定变更、相机视角变化以及机器人本体切换等多种分布偏移情况。
在跨本体测试,也就是从Franka机械臂切换到UR5机械臂的场景中,π0.5的成功率仅为17%,而TrAct达到了50%。在真实机器人实验中,团队在Franka平台上收集了400条演示数据,微调模型后测试5个未见任务,在训练背景和未见背景下,TrAct的平均成功率分别达到76%,远高于基线模型的49%和VLAT+AWM的66%。
在关柜门、绿块入碗、倒意面等任务中,TrAct在未见背景下的表现优势尤为明显,关柜门任务中TrAct的成功率达到70%,而VLAT+AWM仅为40%,整体差距达到20个百分点以上。研究团队认为,轨迹条件直接约束了图像空间中的运动,因此在背景变化下的表现更为稳健。
这种统一的视觉轨迹表示还能够兼容多种数据来源,比如DROID机器人数据和EgoDex人类第一视角视频都可以共享同一个轨迹预测目标。由于EgoDex中的人手运动和机器人可执行动作无法用同一套控制参数表示,因此仅用该数据集来监督视觉轨迹,而机器人数据则同时监督轨迹与动作。在扩大预训练数据规模后,TrAct+在5个最具挑战的UR5任务上,成功率从32%进一步提升到了38%。
TrAct并没有改变机器人最终执行的动作指令,而是优化了策略模型与世界模型之间的信息交互接口。视觉轨迹在这里扮演了通用语言的角色,一端连接机器人的控制需求,另一端连接世界模型对未来场景的预测,为机器人的自主决策和行动提供了更可靠的预判基础。

