文章摘要
星尘智能针对机器人大模型异步部署后,传统在线强化学习存在奖励错配的“对错账”问题,推出SmoothRL异步在线强化学习框架。该框架拆分动作序列仅基于实际执行动作训练,真机测试显示其可大幅提升任务成功率,优化预训练策略适配真实场景。

在高速投掷物体的机器人任务中,哪怕几百毫秒的停顿都会让积累的速度流失,直接导致任务失败。而当前主流的机器人大模型,一次会生成一段动作序列,模型越大推理耗时越长,让机器人等待推理显然不可行。

因此真实部署中普遍采用异步推理的方式:机器人一边执行当前动作,模型后台同步计算下一段动作序列,也就是所谓的“手上做A,模型算B”。不过这种模式却给在线强化学习带来了新的难题。

传统在线强化学习遵循“模型生成动作-机器人执行-更新策略”的同步节奏,生成的动作和实际执行的完全对应。但异步模式下,新的动作序列生成时,机器人已经执行了上一段的一部分;还没等当前序列执行完,下一轮推理结果就会覆盖后半段。最终一段动作序列里,有些动作无法修改、有些真正执行、有些从未被执行。如果直接用整段序列训练,未执行或来不及修改的动作会被错误地赋予任务成功或失败的奖励,出现“对错账”的问题。

针对这一问题,业内团队推出了名为SmoothRL的异步执行在线强化学习框架,专门适配大模型异步部署后的在线学习场景,解决的核心问题是:在线强化学习到底应该基于哪些实际执行的动作来优化策略。

拆分动作序列,精准匹配真实执行轨迹

SmoothRL首先将生成的动作序列按执行状态拆分为三个区域:已提交区域,也就是上一轮推理确定的、无法修改的动作;执行区域,当前轮次生成、机器人实际会执行的动作;丢弃区域,模型生成但被后续推理覆盖、从未执行的动作。

该框架的核心逻辑是,只基于机器人真正执行的动作进行强化学习,仅让梯度穿过执行区域。同时,为了让训练和真实部署的节奏一致,SmoothRL在训练过程中就直接运行异步推理,让模型计算和机器人执行并行,回放缓冲区记录的也是真实时间下的轨迹,也就是团队提出的“在部署强化学习”原则——从训练初期就模拟机器人真实的执行动态,而非先在同步环境训练再切换到异步部署。

在具体实现中,团队以经过任务微调的基础策略作为基准,沿用相关框架的基本骨架,用轻量的TD3-style actor-critic结构在原始动作空间预测残差修正。以测试本体为例,动作执行频率为30Hz,推理请求每200ms触发一次,基础策略每次生成32帧动作序列,在固定延迟预算下,已提交和执行区域共占12帧,其中6帧为实际执行的动作,其余20帧会被后续序列覆盖。

真机测试验证:覆盖两类典型部署场景

团队在绳驱机器人本体上开展了三项真机测试,覆盖高速动态操作和高精度双臂操作两类互补的典型场景。

第一项测试是动态投掷任务,机器人需要从随机位置抓取物体并投入不同位置的目标箱,核心要求是在摆动过程中持续积累速度并在精准时刻释放,一旦在动作序列边界停顿就会丢失速度。在累计250个rollout episodes的评估节点,该任务的成功率从基础策略的39%提升至94%。

第二项测试是给笔戴帽,需要双臂将笔和笔帽精确对齐,允许的相对位姿误差仅约5mm。基础策略通常能接近目标,但无法适配笔帽位置的微小变化,最终成功率从8%提升至83%。

第三项测试是快递开箱,机器人需要用1mm宽的刀片插入2-3mm宽的箱盖接缝并切开胶带,基础策略存在稳定的左偏问题。值得注意的是,该任务的学习曲线并非单调上升:在150个rollout episodes时成功率从30%降至20%,随后回升至40%,最终达到90%,也证明了真实在线探索的过程并非一帆风顺。

除了成功率提升,机器人的错误模式也发生了明显变化。训练初期,三项任务都存在系统性偏差:投掷时无法根据目标距离调整释放速度,开箱时刀片持续左偏,给笔戴帽时对不同位置的笔帽动作过于相似。经过在线强化学习后,失败样本的偏差大幅缩小,开箱任务的失败样本中刀片相对接缝的偏差仅1-2mm,给笔戴帽的失败样本也集中在正确位置附近的小幅错位。这说明该在线学习并非从零教机器人完成任务,而是对已经具备基础能力的策略进行精细化修正,让其更适配真实场景。

同时,该框架还兼顾了动作平滑性。通过在策略中加入平滑性约束,在一次自主投掷rollout中,末端执行器的加速度均方根下降了52%,急动度(Jerk)下降了47%,机器人的动作更加平稳连续,减少了突然的加速、减速和方向变化。

从“会不会”到“准不准”的后训练闭环

过去几年,机器人基础模型主要解决“会不会做”的问题,通过更多数据和更强的模型拓展能力边界。但机器人进入真实环境后,更多的问题不是完全不会,而是精度不足、稳定性不够,或是无法适配细微的场景变化。SmoothRL关注的正是这一环节:让已经具备基础能力的预训练策略,在真实环境中根据执行结果持续修正自身。

当前版本的SmoothRL采用稀疏的任务成功/失败奖励,训练过程中操作人员可在必要时介入,介入动作属于raw action space中,并可直接用于后续的模型训练,因此还并非完全自主的进化模式,而是面向真实部署的高效在线后训练机制。该框架也存在明确的边界:每次chunk-level inference都需要在预设latency budget内完成,轻量residual policy的表达能力受限于冻结的基础策略,如果基础策略本身离目标行为差距过大,局部residual correction也无法弥补。

团队下一步计划探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略的端到端优化结合。

SmoothRL指向的核心命题是:预训练让机器人掌握基础动作能力,而真实世界的后训练则让这些能力变得更精准、更稳定、更可靠。这一思路也延续了业内对机器人智能的长期判断:动作不应作为视觉或语言模型的附属产物,而应成为机器人智能的核心模态。机器人最终不仅要理解世界,更要在物理世界中正确行动,因此相关基座模型始终关注动作背后的逻辑,从显式推理到预测动作带来的世界变化,都沿着这一方向发展。

在此思路下,业内也形成了从前端Agent、中间基座模型到RL后训练的完整布局:Agent负责交互、记忆和任务理解,基座模型构建开放场景下的通用操作能力,强化学习则通过真实执行的反馈持续修正策略,实现进化。同时,全栈系统的持续迭代也在推动具身人工智能的应用和规模化部署。

以上内容不代表本平台立场,仅供读者参考