文章摘要
扩散策略是机器人控制主流技术,但传统策略跨域适配性差。加州大学伯克利分校等联合提出DADP,打造统一智能框架实现跨环境稳定控制。它有两大核心改进,经多场景实验验证,在多数设置中表现良好,消融实验也证明其有效性。DADP将域表征升级为动作生成核心,有工程价值,但仍需解决动态域变化问题。

扩散策略已经成为机器人控制领域的主流技术路线之一,它将动作生成转化为逐步去噪的过程,从随机噪声中逐步还原出符合要求的可执行动作序列。

但真实的机器人运行环境绝非一成不变的固定场景:地面摩擦系数会随环境变化,机器人自身的身体参数、关节阻尼与质量也可能出现波动,甚至同一任务在不同动力学条件下,都需要完全不同的动作模式才能完成。

由加州大学伯克利分校、北京大学、卡内基梅隆大学、清华大学联合提出的DADP(Domain-Adaptive Diffusion Policy),并未针对每一种动力学环境单独训练专属策略,而是打造了一个统一的智能框架:它能够实时感知当前所处的环境域,并在动作生成过程中主动利用这些域信息,实现跨环境的稳定控制。

相关论文链接:https://arxiv.org/abs/2602.04037

实验数据显示,DADP在MuJoCo与Adroit两大机器人仿真平台的零样本跨域控制任务中表现突出,尤其是在分布外(OOD)场景下的优势尤为显著。

传统机器人策略的跨域适配困境

在强化学习与模仿学习的常规框架中,训练好的策略往往与特定的训练环境深度绑定。模型在训练阶段接触的是固定重力、特定摩擦系数、预设身体比例的数据集,一旦部署环境发生变化,此前学到的动作模式很可能直接失效。

过往的主流跨域适配思路大致分为两步:首先从机器人的交互历史中提取域表征,再将该表征输入策略网络,让模型知晓当前所处的动力学条件。但这两个步骤都存在明显缺陷:

其一,近期的交互历史中不仅包含摩擦系数、腿长、关节阻尼这类静态域信息,还混杂了当前速度、步态相位、瞬时运动趋势这类动态瞬时信息。如果表征学习仅以预测下一状态为目标,模型很容易将这些瞬时线索也编码到表征中,导致同一域内的表征出现漂移,反而降低了稳定性。

其二,即便成功学到了可靠的域表征,简单将其拼接在策略输入侧,也未必能让扩散模型真正利用该信息。标准的扩散策略从统一的纯高斯噪声分布开始去噪过程,不同动力学域的动作模态都需要从同一团噪声中还原,域信息仅作为额外提示,并未真正改写整个生成流程。

DADP的两大核心改进

DADP的第一个核心改进名为Lagged Context Dynamical Prediction。与传统方法直接使用紧邻当前时刻的历史数据预测下一状态不同,该方法引入了时间偏移量Δt,将上下文数据与当前预测点拉开距离。当Δt较小时,模型会依赖近期的瞬时信息辅助预测;随着Δt增大,时间局部线索的作用减弱,模型会更依赖整个域内保持稳定的静态因素。论文最终采用了极端干净的设置:Δt趋近于无穷大,即从同一域的其他交互轨迹中采样上下文数据,让模型专注于提取稳定的域特征。

DADP的第二个核心改进是域感知扩散注入(domain-aware diffusion injection)。标准扩散策略从纯高斯噪声出发开始去噪,而DADP则让去噪过程从带有域偏置的混合高斯分布启动。学到的域表征不再仅仅作为策略的附加输入,而是直接成为扩散先验分布的核心之一。这一改动带来的直接好处是,不同动力学域的机器人无需从完全相同的噪声分布中摸索动作模态,而是从更接近自身动作流形的位置开始生成。同时,DADP还将表征偏移纳入扩散目标函数,让模型在每一步去噪过程中同时学习噪声分布与域偏移信息。

多场景实验验证

本次研究的评测分为三类场景:Seen代表训练阶段已接触过的域,用于测试策略同时掌握多种训练动力学的能力;Unseen代表训练范围内的新参数组合,用于验证插值泛化能力;OOD(分布外)则采样自训练因子空间之外,用于检验模型真正的外推能力。

在MuJoCo仿真平台中,研究团队选用了Ant、HalfCheetah、Walker2d、Hopper四个经典环境,并引入摩擦、阻尼、腿长、躯干长度、质量等多项动力学变化参数。为了验证复杂接触与操控场景下的表现,团队还加入了Adroit套件中的Door与Relocate任务。所有评测均采用零样本设置:测试阶段不提供未见域的专家数据,策略仅能依赖在线交互历史生成上下文信息。

实验结果显示,DADP在多数MuJoCo设置中领先或接近最优水平,在OOD场景下的优势尤为突出。以Walker2d为例,DADP在Seen、Unseen、OOD三个档位的得分分别为3999、2834、2197,而Meta-DT基线的对应得分仅为1304、889、954,随着身体参数与接触条件的变化加剧,DADP的优势被进一步放大。在Ant和Hopper环境中,DADP同样保持稳定领先;在HalfCheetah环境中,Meta-DT在Unseen插值设置上表现略优,但DADP在Seen与OOD场景下表现更强。在Adroit操控任务中,DADP在Door任务的Seen设置中并非最高分,但在Unseen与Relocate任务中保持竞争力,证明该方法不仅适用于行走类机器人。

消融实验拆解核心价值

为了拆解DADP的有效性,研究团队开展了两组消融实验。第一组验证了Δt对表征质量的提升效果:随着上下文与当前时刻的距离拉大,线性探针准确率逐步上升,重建损失持续下降。以Walker2d为例,当Δt从1提升至无穷大时,线性探针准确率从27.9%提升至99.3%,重建损失从476.1降至3.2。

第二组验证了域表征的使用方式:仅将表征拼接在输入侧的效果并不稳定,仅将先验改为混合高斯分布也有一定帮助但不够充分。DADP的完整版本同时实现了两大改进:用域表征偏置扩散先验,并让模型预测包含表征偏移的复合目标,从而实现了最优表现。以Walker2d为例,端到端扩散基线的Seen/Unseen得分为3722/2852,使用Δt=1的表征作为条件策略的得分仅为2093/1617,而完整DADP的得分达到3991/3015;在HalfCheetah环境中,完整DADP的任务掌握率达到96%,明显高于端到端扩散的80%。

技术路线的核心价值与未来方向

DADP的价值不仅在于将扩散模型应用于机器人控制任务,更关键的是它将「域表征」从一个附加输入,升级为动作生成分布的核心组成部分。对于需要跨摩擦、跨质量、跨形态泛化的机器人策略而言,这种设计更贴合控制问题的本质:不同动力学环境下的最优动作分布本就存在差异。

研究团队还给出了两项极具工程价值的补充发现:其一,在非平稳摩擦变化的场景中,同一个Walker2d模型的checkpoint仍能保持较高的表现,说明在线上下文能够在一定程度上跟踪环境的动态变化;其二,当将DDIM采样压缩至一步时,标准扩散策略的性能几乎崩塌,而DADP仍保留了更多性能,这是因为其生成过程从一开始就站在更接近目标动作流形的位置。

当然,DADP并非完美的解决方案。论文明确指出,当前方法主要针对静态或分段稳定的动力学环境,未来仍需解决更具挑战性的问题:当域本身随时间持续变化时,如何在保留稳定域因素的同时,不丢失真正有用的时间变化信号。

结语

从「识别当前环境」到「改写动作生成过程」,DADP为跨域机器人控制指明了清晰的方向:跨域适配不应仅停留在给策略投喂额外标签的层面,而应让域信息深入策略生成动作的底层机制。对于机器人而言,真正的泛化能力并非在固定模拟器中取得高分,而是在更换地面、调整身体参数、改变动力学环境后,依然能够准确执行任务。DADP的核心野心正在于此:让扩散策略不仅能够生成动作,更能先读懂动作背后的物理世界规律。

以上内容不代表本平台立场,仅供读者参考