PolicyTrim:扩展可靠动作+压缩冗余,机器人执行提速5倍

Vision-Language-Action(VLA)模型将视觉观测、自然语言指令和机器人动作整合到统一的策略模型中,让机器人可以根据人类的语言指令完成复杂操作任务。从OpenVLA、OpenVLA-OFT到π0.5、GR00T,这类模型已经成为具身智能领域的主流技术路线。
但当VLA模型真正部署到实体机器人上时,一个关键的效率瓶颈会显现:机器人完成任务的总耗时,并不只取决于单次推理的速度,还和策略需要执行的推理次数、真实物理动作的数量直接相关。
在同一任务的多次测试中,VLA模型的执行步数存在明显波动,说明其实存在更短、更直接的成功路径,但当前训练策略往往只能偶然找到这类路径。一方面,动作chunk的尾部可靠性不足:很多VLA策略会一次性输出多个动作组成的序列,但越靠后的动作越容易累积误差,系统不得不频繁重新规划;如果强行拉长单次执行的动作长度,反而会降低任务成功率,同时增加物理步数。另一方面,物理动作存在严重冗余:即使最终成功完成任务,轨迹中也往往包含大量纠错、回退和重复动作。
目前大部分优化方法都从计算侧入手,比如视觉Token剪枝、模型量化、KV缓存复用、知识蒸馏或推理引擎优化,这些方法可以降低单次推理延迟,但如果策略本身仍需大量冗余物理步骤,真实任务耗时依然难以有效缩短。而直接固定执行更长动作chunk也不可靠,实验显示,强行增加动作执行长度时,任务成功率可能下降,物理步数反而增加——低质量的尾部动作预测会将误差带入物理世界,导致机器人需要更多纠错动作。
那么,能否在不牺牲任务成功率的前提下,通过后训练让已有VLA策略自动学会“少走弯路”,用更少物理步骤完成任务?
一支来自国内高校的研究团队提出了PolicyTrim,这是一个面向“策略效率”的两阶段强化学习后训练框架。它无需改动现有VLA架构,也不需要重新收集专家数据,仅需在已预训练的策略基础上继续优化机器人的真实执行行为。
PolicyTrim的核心目标并非替代计算侧加速方案,而是补上此前被忽视的优化维度:减少完成任务所需的前向推理次数。它将策略效率拆解为两个可优化目标:先扩展可靠动作chunk长度,再压缩冗余物理步骤。
1. 可靠动作chunk扩展
当前很多VLA策略以动作chunk形式输出动作序列,但部署时往往仅敢执行前几步。PolicyTrim第一阶段采用动态执行窗口探索:将同一组样本分配不同接受比率,让模型在短、中、长三种窗口上并行探索可靠边界。成功完成任务且执行窗口更长的轨迹会获得更高奖励,鼓励模型让原本不可靠的chunk尾部动作变得更可靠。同时,窗口奖励仅在组内出现成功轨迹时激活,避免模型在失败时盲目追求更长chunk。
2. 冗余感知的步数压缩
当可靠执行窗口扩展后,第二阶段进一步减少总物理步数。PolicyTrim引入步数节省奖励:成功轨迹使用的步骤越少,奖励越高,直接将“更短、更直接的成功轨迹”写入优化目标。同时通过组锚定正则化抑制不可复现的投机捷径,避免模型仅追求短路径却损害成功率。两阶段按顺序优化,避免“拉长chunk”和“缩短步数”目标互相干扰,最终减少完成任务所需的前向推理次数。
实验效果
研究团队在LIBERO、ManiSkill、Meta-World及真实机器人任务上验证了PolicyTrim,覆盖π0.5、OpenVLA-OFT、GR00T等多种VLA架构。整体结果显示,PolicyTrim可在保持任务成功率稳定的同时,显著提升执行效率。
在LIBERO基准中,π0.5实现最高5.83倍端到端加速,同时成功率保持98%以上。跨基准测试显示,PolicyTrim在ManiSkill上最高达2.36倍加速,在Meta-World上达2.52倍加速。跨架构测试显示,完整两阶段优化的OpenVLA-OFT可达2.97倍加速;仅使用第二阶段的OpenVLA也能达到1.41倍加速。
轨迹对比:更直接的执行路径
在随机采样的LIBERO任务中,基线方案的轨迹往往存在大量冗余纠错动作,以及目标附近的犹豫和抖动;而PolicyTrim生成的轨迹更平滑直接,可将物理步数压缩至原来的一半左右,用更少步骤完成相同任务。
真实机器人部署验证
研究团队还在配备两台Intel RealSense D435i相机的Agilex Piper机械臂上验证了真实任务,包括FlipMug、HangMug、TapeBox三类任务,覆盖固定目标的标准设置和抓取中存在随机扰动的动态设置。PolicyTrim在两种设置下均维持或提升成功率,同时显著缩短真实执行时间,在标准设置下平均实现1.86倍端到端加速。实验结果表明,PolicyTrim不仅优化基准指标,在物理机器人上也能将任务完成时间缩短至基线的一半左右,且在动态干扰场景中保持鲁棒性。
PolicyTrim的核心优势
- 面向策略本身提效:减少冗余动作和不必要的重规划,而非仅降低单次推理延迟。
- 无需从头训练:作为后训练框架,可基于已有VLA模型优化,降低数据收集和训练成本。
- 兼顾速度与成功率:可靠窗口扩展避免盲目拉长chunk,稳定性约束避免短路径投机。
- 可与计算侧加速叠加:PolicyTrim优化前向推理次数,VLA-Cache等方法优化单次推理耗时,两条路径正交可产生复合加速。
PolicyTrim的核心观点在于:对于VLA机器人来说,部署效率不仅来自更快的模型推理,也来自更高效的策略行为。让机器人“少走弯路”,同样可以带来显著的性能提升。
项目主页:https://inceptionwang.github.io/PolicyTrim/
论文链接:https://arxiv.org/abs/2606.22540


