IJCAI 2026两项机器人AI研究:ChronoFlow-Policy与LaMP

近期两项即将发表于国际顶会的具身智能研究,通过引入3D Flow作为物理中介,重构了动作学习的核心底座,在多阶段交互任务与跨机器人通用动作学习上取得了显著突破。在真实的玩具交换任务中,基线模型在第三阶段的完成率仅为13%,加入三维交互流的ChronoFlow-Policy将该指标提升至93%;在精密堆叠任务中,完整的LaMP模型成功率达75%,移除三维运动先验后仅为25%。
当前具身智能动作学习面临两大核心痛点:其一,长时多阶段任务中,相同的当前画面可能对应完全不同的任务进度,仅依赖单帧观测无法判断下一步动作;其二,不同机械臂的动作标签天然绑定本体结构,高层语义意图无法直接跨机器人复用,低层控制逻辑难以迁移。
此前的方法分别通过历史帧、未来图像、二维光流等方式尝试补足这些缺陷,但历史信息无法直接对应交互意图,生成未来图像需要额外重建冗余的纹理背景,二维运动缺少深度维度,静态三维几何也无法描述动态变化。
两项研究共同提出了一种统一的信息链路:从观测输入出发,通过3DFlow驱动的运动表征作为中间层,最终生成机器人专属的动作。3D Flow本质是一份三维“运动分镜”,不规定具体关节转动角度,而是描述夹爪、物体与场景点随时间的运动变化,分别为专用策略补足历史信息,为通用VLA模型搭建跨机器人的运动知识桥梁。
ChronoFlow-Policy:补全单帧观测的历史缺失
ChronoFlow-Policy针对专用视觉运动策略的痛点设计:在长时多阶段任务中,当前观测往往无法完整反映任务进度,过去的交互历史会直接决定下一步的正确动作。
该方法没有保存整段视频帧,而是仅追踪两类稀疏关键点:绑定工具中心点的夹爪点,以及通过目标分割和采样选出的任务相关物体点,再通过跟踪算法持续跟踪这些点。由此得到的是统一世界坐标系下的显式物体-夹爪轨迹,可以直接对应交互发生的位置与顺序。
模型以当前观测和历史轨迹为条件,通过扩散过程生成未来交互流。训练阶段通过部分去噪的交互流预测干净轨迹,实现轨迹重建与动作预测的联合优化;推理阶段则读取完整去噪后的未来交互流与扩散模型的隐状态,生成对应动作。
在仿真任务中,该方法平均成功率远超对比方法;在多阶段真机任务中,基线模型的阶段完成率持续下降,而该方法始终保持较高的完成率,在毛巾折叠等涉及可变形物体的任务中也有显著提升。
该方法的工程开销需要平衡:同步运行跟踪模块时帧率较低,改为异步跟踪后可满足真实系统的控制循环需求。
LaMP:跨机器人通用动作学习的运动先验
LaMP针对通用视觉语言动作模型的痛点设计:预训练语言视觉模型已能从图像和语言中理解任务语义,但精细操作还依赖深度、接触位置和连续三维变化,直接从模型特征回归动作会导致跨机器人运动信息无法充分利用。
该方法在语言视觉模型与动作专家之间加入运动专家模块:语言视觉模型负责理解场景和指令,运动专家预测任务相关的场景运动,动作专家再将运动表征映射为目标机器人的连续控制。
具体来说,该方法在当前图像上均匀采样多个锚点,预测每个点未来多个时刻的位移,形成三维运动监督张量。这种屏幕对齐的三维运动表示可以抵消相机自身运动的影响,部署时仅需读取基础的视觉、语言和机器人本体状态信息。
该方法分为两个训练阶段:第一阶段使用大量跨数据集的三元组数据预训练运动专家,这些数据来自不同机器人,转换到统一参考坐标系后无需共享关节定义;第二阶段冻结预训练模块,仅用目标机器人的动作示范完成最后一段适配,实现运动先验与本体控制的分工。
为了优化部署效率,该方法在生成时仅执行部分积分步骤,提取运动专家的中间隐状态送入动作端,无需等待完整的运动序列生成。同时通过门控融合方式整合运动信息与语言视觉特征,避免运动信息覆盖原有语义表示,大幅提升了精细操作任务的成功率。
在多个标准数据集和真实机器人实验中,该方法都取得了优异的表现,尤其是在长时任务和存在扰动的场景中,移除运动先验后性能下降明显,凸显了三维运动先验的核心作用。
真机配置下,该方法相比基础版本增加了少量资源占用,但可以满足实时控制的需求。
Flow as Interface:统一语义而非张量格式
两款方法面向不同规模的策略模型,在Flow的表征形式与动作分支耦合方式上各有侧重:前者侧重高效显式的交互运动建模,以交互对象为中心构建轨迹;后者侧重可扩展的稠密场景运动建模,通过跨数据集预训练学习通用运动先验。
两者共享的并非张量格式,而是一种接口语义:中间层提取已经发生或预测即将发生的任务相关运动,下游再利用这些信息生成特定机器人的控制动作。这种模块划分将感知、运动与动作模块的职责边界清晰划分:语言视觉模型回答“任务是什么”,运动模型回答“世界应该如何变化”,动作模型回答“这台机器人该怎么做”。
现有方案的局限性与未来方向
当前基于3D Flow的方法仍存在不足:3D Flow主要描述运动学,未涉及力觉、摩擦、顺应性和接触不确定性等物理特性,插拔、旋拧和柔性材料操作仍需要额外的力觉、触觉与闭环误差修正。
两种实现也各有脆弱点:依赖任务物体分割和单相机长期跟踪,遮挡、出画与漂移都会污染历史信息;离线监督会继承深度估计、遮挡和点跟踪误差,且不同数据源的采样时刻时间尺度差异仍需评估。
未来的具身智能系统不仅需要预测运动,还需要估计预测可信度、判断动力学可执行性,并持续比较实际变化与预期变化,进一步完善整个动作学习链路。

