文章摘要
强化学习中高质量样本获取成本高且有风险,现有基于扩散模型的样本增强方法有局限。联合团队提出EMCES方法,其由三大模块构成。实验表明在离线和在线场景中,EMCES能提升算法表现。该方法优势在于合成可控、样本质量高、情景记忆高效。

强化学习在游戏智能体、具身智能、大语言模型等多个领域取得了显著进展,但在真实应用场景中,高质量样本的获取不仅成本高昂,还可能伴随多种安全风险,样本增强因此成为缓解该类问题的核心路径之一。

近年来,依托扩散模型强大的分布建模能力,研究者提出了基于扩散模型的样本增强方法(代表性工作如SynthER),通过合成高保真的训练数据实现样本扩充。但这类方法生成的样本虽然符合环境动态规律,却未必能最优地辅助智能体的策略学习。

针对这一局限,团队通过经典离线强化学习算法TD3+BC在Hopper环境的medium-expert样本集上开展了对比实验:该数据集由D4RL基准提供,包含约200万条真实采集的样本,而合成样本集由SynthER生成,规模从10万到500万条不等。实验结果显示,只有当合成样本规模远大于原始样本集时,才能实现策略性能的提升,这暴露了当前扩散模型样本增强方法缺乏有效可控机制的核心问题——无法优先合成对策略学习更有价值的高质量样本。

针对上述痛点,联合团队提出了高效样本合成方法EMCES,该工作已被国际机器学习顶会ICML 2026收录。EMCES将情景记忆机制引入可控扩散模型,通过情景记忆引导高质量样本的合成,进一步提升了下游强化学习算法的表现,是首个将情景记忆用于强化学习样本合成的可控扩散框架。

EMCES核心框架解析

EMCES的设计主要包含三大关键模块,分别实现可控合成、精准采样和高效存储的目标:

  • 基于情景记忆的可控扩散模型
  • 基于情景记忆时序差分误差的优先条件采样策略
  • 基于哈希表示的情景记忆机制

1. 基于情景记忆的可控扩散模型

可控样本合成的核心在于合理的条件设计。传统方法直接使用原始状态作为生成条件,往往会引入大量冗余信息,尤其在高维视觉场景中会显著降低模型训练效率。EMCES首先通过紧凑的状态表示函数对原始状态进行编码,减少无关信息的干扰。

同时,为了让生成条件包含更丰富的上下文信息,EMCES引入情景记忆机制来估计状态-动作价值函数,该函数可以融合动作、奖励、下一状态和潜在未来回报等关键信息,为扩散模型提供更具指导性的生成信号。与传统基于神经网络的价值估计不同,情景记忆具有非参数特性,无需额外训练即可实现稳定的价值估计,且与状态表示函数保持一致,保证了条件构造的一致性和计算效率。最终,EMCES的生成条件结合了编码后的状态表示和情景记忆估计的历史最优折扣回报,能够隐式刻画样本的关键信息和潜在价值,引导模型生成更符合策略学习需求的样本。

2. 优先条件采样策略

为了进一步提升合成样本的质量,EMCES提出了基于情景记忆时序差分误差(EMTD-误差)的采样策略。该指标可以衡量样本对策略改进的潜在价值,其大小表示基于下一状态得到的价值估计与当前状态的历史最优折扣回报之间的偏差,误差越大的样本对策略提升的帮助越强。

团队通过对所有样本的EMTD-误差应用Softmax算子计算采样概率,能够灵活控制优先采样的程度:参数越大,采样过程越倾向于生成具有较大EMTD-误差的样本;当参数为0时,该策略退化为均匀采样。这一设计既可以优先选择高价值样本加速策略学习,又能保持样本的多样性,避免过度采样导致的过拟合问题。

3. 基于哈希的情景记忆机制

良好的状态表示可以有效提升情景记忆的聚合质量,并降低其存储和时间开销。针对现有情景记忆状态表示方法多为数据无关、聚合效果有限的问题,EMCES设计了基于哈希的状态表示方法。该方法采用Learning-to-Hash思路,将高维原始状态编码为紧凑的二进制哈希码,能够更好地对齐状态空间的底层结构,减少无关状态之间的混淆。同时,通过将相似状态赋予相同的哈希编码,该方法可以帮助情景记忆机制隐式合并多条轨迹,进而构建更高质量的情景记忆。

实验表明,该方法相比传统状态表示,在不损失下游强化学习算法性能的前提下,将存储开销降低了约8000倍,时间开销降低了25.5倍,大幅提升了情景记忆机制的运行效率。

实验验证结果

为全面验证EMCES的有效性,团队分别在离线强化学习和在线强化学习两种场景下开展了实验。

在离线强化学习场景中,团队选用D4RL基准中的HalfCheetah、Walker2d、Hopper和Maze2D作为实验环境,使用TD3+BC、IQL和EDAC三种经典离线强化学习算法对合成样本的质量进行评估。实验结果显示,EMCES在多数任务中都能提升下游算法的表现,部分任务中甚至超过了使用原始样本集训练的效果。

在在线强化学习场景中,团队选用quadruped-walk、reacher-hard、cheetah-run、Walker2d、HalfCheetah和Hopper共6个环境,以SAC作为基准强化学习算法,并与SynthER和另一种专注于在线强化学习的样本增强方法PGR进行对比。实验结果表明,搭载EMCES的SAC算法能够持续提升样本效率,整体表现优于其他两种对比方法,证明了EMCES合成样本的高质量特性。

此外,团队还针对情景记忆中的状态表示方法开展了对比实验,结果显示EMCES在不同状态表示下均取得了优于SynthER的表现,验证了整体框架的有效性。同时,团队对比了不同方法的存储和时间成本,进一步证明了基于哈希的状态表示能够在不损失性能的前提下大幅降低开销。

全文小结

EMCES的核心优势主要体现在三个方面:

  • 合成过程强可控:通过将情景记忆机制引入可控扩散模型,利用情景记忆构造生成条件,引导模型合成与目标任务更相关的样本,大幅提升了样本增强的可控性;
  • 合成样本质量高:通过基于情景记忆时序差分误差的优先采样策略,优先选择对策略改进更有价值的样本区域进行合成,有效提升了生成样本的实用价值;
  • 情景记忆高效性:采用基于哈希的状态表示后,情景记忆机制能够在不损失下游强化学习算法表现的前提下,将存储开销降低约8000倍,时间开销降低25.5倍。

参考文献

[1] Lu, C., Ball, P. J., Teh, Y. W., and Parker-Holder, J. Synthetic experience replay. In NeurIPS, 2023b.

[2] Fujimoto, S. and Gu, S. S. A minimalist approach to offline reinforcement learning. In NeurIPS, 2021.

[3] Fu, J., Kumar, A., Nachum, O., Tucker, G., and Levine, S. D4RL: datasets for deep data-driven reinforcement learning. CoRR, abs/2004.07219, 2020.

[4] Kong, W. and Li, W.-J. Isotropic hashing. In NeurIPS, 2012.

[5] Ma, X. and Li, W.-J. State-based episodic memory for multi-agent reinforcement learning. Machine Learning, 112(12):5163–5190, 2023.

塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!

https://www.tahou.com/

AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

以上内容不代表本平台立场,仅供读者参考