文章摘要
具身智能与智能体强化学习中,世界模型是核心议题。研究可拆解为三个核心问题,其在智能体强化学习中的角色分三类。近期研究论文归纳为三条脉络:训练接口从预训练到联合优化;预测目标从状态一致性到行为一致性;信用分配有四类研究方向。该领域正从状态预测器转变为信用分配估计器,缺稳定转化机制。

在具身智能与智能体强化学习的研究中,世界模型始终是核心议题之一,但不同研究对其目标的理解存在差异。结合智能体强化学习中的信用分配问题与近期相关文献,我们可以将相关研究拆解为三个递进的核心问题:如何将世界模型的信号融入训练流程?世界模型应当保留哪些关键信息?在预测未来状态后,如何基于预测结果形成有效的信用分配?

在传统强化学习场景中,棋盘状态、机器人位姿等都是可观测的明确状态,动作空间也相对紧凑,此时的世界模型更像是一个可反复调用的模拟器,用于预测执行某一动作后环境的变化。而在智能体强化学习中,问题通常被建模为部分可观察马尔可夫决策过程,智能体的决策依据并非单一状态,而是包含用户指令、网页内容、历史记忆在内的完整交互历史;其采取的动作也可能是一段提示词、一次API调用,或是在多智能体场景中将子任务转交其他智能体。两个文本高度相似的页面可能代表完全不同的任务进度,两段措辞不同的输出也可能在决策层面等价。

基于这一差异,世界模型在智能体强化学习中的角色可以分为三类:

  • 预测:预判动作将带来的环境变化
  • 动作价值:预估执行某动作后未来累计收益的好坏
  • 优势/信用:将当前动作与同一历史下的替代动作对比,形成局部信用分配
其中只有第三类角色真正直接参与信用分配流程。

论文研究脉络总览

按照上述角色分类,近期相关的研究论文可以归纳为三条主要研究脉络:训练接口的演进、预测目标的优化,以及世界模型输出的最终用途。

训练接口:从预训练到联合优化

早期的研究如RWML采用两阶段训练模式:首先基于真实交互轨迹训练世界模型,让模型学习“动作如何影响环境”,再基于任务奖励训练下游策略网络。这种模式的优势在于训练数据获取直接,所有交互轨迹都可作为世界模型的训练样本,但也存在明显缺陷:世界模型学习的是旧策略下的状态-动作分布,当下游策略持续更新后,智能体将访问新的状态、产生新的动作,预先训练的世界模型会逐渐偏离当前策略的在线分布。

后续的PaW、ECHO、TAPO和COMAP等工作从不同角度解决了这一问题:PaW将世界模型与策略的训练阶段合并,利用在线交互轨迹同时生成策略训练与世界模型训练的监督信号,在损失层面对两个目标进行联合优化;ECHO则按token的角色分配梯度,针对不同类型的输出使用不同的监督信号,避免丢弃失败轨迹中的有效信息;TAPO在共享模型主干上交替进行策略优化与状态预测监督,减少两类训练的梯度竞争;COMAP更进一步,让世界模型主动预测候选动作的未来反馈,同时让策略评估预测的可靠性并修正动作,新的在线交互轨迹还会反向蒸馏优化世界模型。

Dark Room的研究则进一步区分了两种完全不同的信号通道:一种是将预测得分加入奖励信号的Reward Channel,另一种是将预测作为辅助损失的Auxiliary-loss Channel。前者可能导致智能体为了追求高预测准确率而陷入“停滞”,比如在测试环境中选择不会产生任何变化的动作以维持高预测精度,最终导致任务成功率下降;而后者则通过辅助更新改变模型的表征与动态知识,不会直接改写任务的优势估计。后续研究还发现,即使将正确的状态预测监督打乱,辅助损失通道仍能在部分场景中匹配甚至超过真实监督的效果,这说明辅助损失带来的性能提升可能不仅来自正确的世界知识,还包括正则化、参数更新频率变化等其他因素。

预测目标:从状态一致性到行为一致性

早期的世界模型训练以预测状态的文本或嵌入相似度为目标,即让模型输出的预测状态与真实状态在语义上尽可能接近。但随着研究深入,人们意识到更重要的并非重建所有细节,而是保留那些会改变后续决策的因果差异。在开放式文本动作空间中,完整的策略分布难以精确获取,因此更合理的目标是让预测状态能够诱导智能体产生与真实状态下一致的动作,也就是行为一致性。如果模型无法保持替代动作的选择逻辑,那么基于它计算的反事实Q值与优势估计都将失去可信度。

信用分配:让世界模型的预测真正影响训练

前两部分讨论了世界模型的训练方式与预测目标,而要让世界模型真正发挥作用,还需要最后一步:将预测结果转化为智能体训练的有效信号。如果仅仅是生成更多的模拟轨迹、增加一个状态预测损失,或是在推理时辅助搜索,虽然可能提升智能体的样本效率,但并未真正回答“这一步应当分配多少信用”这一核心问题。

目前相关的研究可以分为四类:

  1. PriorZero方向:该方向聚焦于语言先验与环境动态的错位,让大语言模型仅在搜索根节点提供动作先验,将深层的模拟轨迹交给隐式世界模型学习动作后果,再通过策略与价值头将未来轨迹压缩为Q值与价值估计。这种分工让语言知识缩小搜索范围,环境经验校正长期判断,但也存在风险:一旦价值估计失真,世界模型的偏差就会转化为信用分配的偏差,后续研究需要加入不确定性估计与行为一致性来校准信用分配。
  2. VLA方向:该方向通常将最终成功信号拆解为动作块、子任务或空间区域的信用分配,而非直接追求token级的归因。例如RISE利用模拟未来的进度提升构造优势估计,GigaBrain使用世界模型的价值进行多步时间差分学习,AtomVLA利用隐式子任务兼容性进行离线策略优化,AIM则将空间价值映射投影为密集奖励。
  3. 安全与时序信用分配:在导航与自动驾驶场景中,等待真实碰撞或任务失败后再给予奖励往往为时已晚,世界模型的价值在于将未来风险提前映射到当前动作。例如NavThinker将动作条件的未来特征融入状态,将预测的人类轨迹转换为社会奖励塑形,直接写入训练的逐步奖励;DreamerAD则在视频世界模型的隐式空间中训练密集奖励模型,输出多个未来时间步的安全与驾驶质量信号,用于策略梯度的相对优势估计。这类方法的风险在于预测误差会直接转化为错误的奖励信号。
  4. 多智能体信用分配:该方向主要解决“哪个智能体应当对最终结果负责”的问题,目前已有部分研究关注这一场景下的信用分配与世界模型结合的方案。

总结

综合所有相关研究可以发现,智能体强化学习领域的世界模型研究,正在从单纯的下一状态预测器,逐步转变为信用分配的估计器。早期工作专注于解决世界模型如何接入训练流程,中期研究追问预测结果应当保留哪些影响决策的信息,而近期的工作则致力于让世界模型的输出真正落地到价值估计、优势计算、逐步奖励与梯度路径中。

不同研究的核心差异并非“是否模拟未来”,而是世界模型的判断进入优化器的深度,以及它最终是否改变了智能体每一步的更新权重。当前这条研究路线最缺乏的并非更多的模拟轨迹,而是将模拟结果稳定转化为可信信用分配的机制:世界模型给出的价值是否与真实任务目标一致?对比动作时是否有可靠的基准?预测不确定时是否能降低其权重?模型保留的究竟是表面的文本相似性,还是能够改变动作排序的因果信息?如果无法解决这些问题,更多的模拟轨迹只会提升样本效率,而世界模型的偏差仍会进一步转化为信用分配的偏差,期待后续研究能给出更可靠的解决方案。

以上内容不代表本平台立场,仅供读者参考