Spotter反转机器人协作模式 提升操作效率与成功率

基于视觉语言模型(VLM)驱动的具身机器人Agent,已经成为开放场景下机器人操作的主流技术方向,但当前大多数这类系统都采用VLM主导的架构:由VLM完成整体规划,具身模型仅作为执行工具,这使得VLM处于整个执行流程的关键路径上,系统的整体延迟会随着任务长度增加而增长,而非随出错次数变化。
来自多所高校的研究团队推出了Spotter系统,彻底反转了传统架构的协作关系:让具身模型承担主要的执行工作,VLM则以并行的方式进行监督,仅在确认执行出现错误时才介入修复并完成反思环节。这套方案不需要对现有的具身模型进行训练或修改,却在仿真环境RoboCasa、RoboTwin 2.0以及真实机器人平台上都实现了稳定的性能提升。
在加入Spotter后,任务成功回合的平均耗时为0.7到0.8分钟,仅比具身模型单独执行多花费13到16秒;而与使用相同VLM的传统VLM-Led基线方案相比,成功回合的用时减少了约70%。
实际场景演示
真实机器人平台演示:使用Franka Research 3机械臂,判定模型采用GPT,在叠杯子任务中,机械臂的夹爪没有对准杯口。本地筛查模型首先发出风险警报,判定模型确认后,系统执行一次侧向微调,随后将控制权交还给具身模型,最终顺利完成任务。本次演示视频经过加速处理,右上角显示的是真实执行时间。
仿真环境演示:在RoboCasa平台中,全程使用本地Qwen模型。左侧的演示是具身模型单独执行,在抓取环节落空后没有察觉,最终任务失败;右侧的演示则加入了Spotter系统,系统识别到抓取落空的情况,将机械臂退回预抓取位置后重新尝试抓取,最终顺利完成任务。
传统架构的核心缺陷
在传统的VLM-Led架构中,具身模型作为“快系统”和VLM作为“慢系统”采用整体切换的方式协作:当VLM进行推理时,具身模型必须暂停等待;而当具身模型执行动作时,又缺乏有效的监督。同时,VLM需要提前设定每次调用具身模型的执行片段长度,这会带来难以调和的权衡矛盾:如果片段设置过短,大量时间会浪费在不必要的状态检查上;如果片段设置过长,执行中的错误可能在被发现之前就已经造成了无法挽回的后果。
研究团队在RoboCasa平台上的实测验证了这一问题。在任务成功的回合中,使用Qwen模型的VLM-Led基线方案耗时146到164秒,而具身模型单独执行仅需要23到34秒。这意味着,对于那些具身模型本可以独立完成的任务,VLM-Led架构引入的额外时间几乎全部来自不必要的等待和状态检查。
Spotter的设计动机
语言模型的推理能力,很大程度上得益于“发现错误—修正错误”的反思流程。研究团队首先验证了当前的具身模型是否具备类似的自我纠错能力。结果发现,具身模型仅从成功的示范案例中学习,从未见过执行失败后的状态分布;同时,它的决策仅依赖当前的观测数据,无法区分“正在恢复执行”和“重复相同的错误”。要完成这一区分,需要整段任务的历史数据和遥测等文本信息,而这正是VLM的优势所在。基于这一结论,Spotter确立了核心设计原则:由具身模型承担常规的执行工作,仅在确认执行出现错误时,才由VLM介入进行干预。
系统核心设计
任务目标设定
具身模型π根据语言指令、RGB图像以及机器人自身状态(包括末端执行器的位姿和夹爪开合状态)输出一段动作序列。任务会在成功条件满足时终止,否则在达到预设步数上限后结束。Spotter系统不会对具身模型π进行任何修改或训练,仅新增一个监督模块:该监督模块与具身模型接收相同的图像和机器人状态数据,但不会被提前告知任务是否已经成功。深度图仅用于执行器将修复目标从像素坐标转换到三维空间,VLM本身不会直接接触深度信息。Spotter的核心目标是,在相同的步数预算内提升具身模型π的任务成功率,同时让监督流程和执行流程可以重叠进行。
并行监督的整体架构
本次研究对比了三种机器人执行架构:(a) 仅使用具身模型独立执行;(b) 传统VLM-Led架构;(c) Spotter架构。Spotter系统由四个核心模块组成:
有界异步执行。具身模型会逐段执行动作,每完成一段动作序列,就将该段的图像和遥测数据提交给监督模块,随后立即继续执行后续动作。监督流程允许存在一定的滞后,但滞后量会被严格限制在一个上限范围内,确保判定结论不会基于过时的观测数据。除非确认出现错误或者达到滞后上限,具身模型不会暂停执行。
两级监督。第一级是本地部署的筛查模型,会对每一段执行动作进行快速的风险评估,设计目标是实现高召回率,因为漏报错误的代价远高于误报。只有当筛查模型连续发出报警信号时,才会调用第二级的判定模型(可以是GPT或Qwen等)。判定模型会结合完整的任务历史数据,给出继续执行、介入干预或者放弃任务的判定。这样就将高代价的VLM推理限定在少数可疑的执行片段中,而且在判定模型进行推理的同时,具身模型仍然可以继续执行动作。
基于动作原语的修复。当确认执行出现错误后,判定模型不会直接向具身模型下达指令,此前的研究表明这种方式效果不佳,而是直接通过动作原语生成修复计划,包括移动到图像中的目标点、相对平移、抬升臂部、转动腕部、开合夹爪、退回至历史姿态等。修复完成后,系统会将控制权交还给具身模型。
基于预期的反思。每次介入干预都会附带一个可观测的预期目标,例如“抬臂过程中夹爪的开度应保持在某一阈值以上”。在后续的监督窗口中,判定模型只能先观察执行情况,判断该预期是否成立:如果预期成立,则不得再进行重复的修复操作;如果预期不成立,则下一次介入必须采用不同类型的修复策略。研究团队观察到,如果缺少这一环节,判定模型往往会在完成一次修复后就不再关注后续情况,无法确认修复是否真正奏效。
实验验证结果
不同架构在仿真平台上的成功率对比:(a) RoboCasa平台;(b) RoboTwin 2.0 Hard难度模式
在相同的步数预算下,各架构的任务成功率(百分比):
主要观察结果如下:
-
增益主要来自抓放类任务。性能提升主要集中在抓放类任务中。当使用GPT作为判定模型时,抓放任务的成功率分别提升了10.3和9.0个百分点。这类任务中,抓取落空的情况最为常见,也最适合通过重新尝试来挽回失败的局面。
-
仅纠错即可获得大部分收益。在Cosmos Policy模型上,Spotter搭配GPT的成功率达到73.5%,与那些可以读取任务成功信号且步数预算更宽松的VLM-Led基线方案(73.3%)表现相当。
-
传统VLM-Led依赖特权信息。同样使用Qwen模型时,VLM-Led基线方案在可以获取任务成功信号的情况下,成功率分别为71.3%和69.1%;如果去除这个特权信息,成功率会降至65.2%和60.5%,甚至低于具身模型单独执行的效果。而Spotter系统在不使用任何特权信息的情况下,依然可以稳定提升任务成功率。
干预效果分析
判定模型的检测准确率与单次修复成功率
研究团队进一步统计了判定模型介入的准确性与有效性:
-
检测准确率。当Qwen同时作为筛查模型和判定模型时,在判定模型介入的回合中,约85%的情况属于具身模型单独执行时会失败的场景;如果使用GPT作为判定模型,这一比例会更高。
-
修复成功率。单次修复操作就能挽回约10%到20%的执行错误,这一数据高于具身模型在有oracle系统指出错误并给予三次重试机会时的7.5%到9.7%的挽回率。
真实机器人平台实验
在Franka Research 3真实机械臂平台上,研究团队测试了叠杯子、将方块放入杯中,以及由两个子任务组成的长程任务,每项任务各执行10次。在加入Spotter搭配GPT模型后,三项任务的平均成功率从53%(16/30)提升到了83%(25/30)。其中长程任务的性能提升最为显著,从30%提升到了70%:这是因为任务链条越长,单步执行错误导致整体任务失败的概率就越高,及时进行纠错的收益也就越大。
https://arxiv.org/abs/2609.36808
https://github.com/zqc3117/Spotter
https://zqc3117.github.io/Spotter
Long Li,long.li@griffithuni.edu.au

