BEACON:里程碑引导长程智能体训练新范式

如今,从网页购物、家居操作到科研实验,语言智能体需要完成的任务越来越复杂,一条完整的任务轨迹往往包含30步以上的连续决策。在使用强化学习训练这类智能体时,一个长期存在的痛点变得愈发突出:任务是一步一步完成的,但奖励信号却只在任务最终结束时才会给出。
以当前主流的GRPO方法为例,它采用轨迹级的稀疏终局奖励,整条轨迹共享同一个优势值。这种方式在短任务中尚且可行,但放到长程任务里就会暴露两个明显的缺陷:
- 信用误分配:如果前20步都正确执行,仅在第25步出现失误,整条轨迹都会被判定为失败,前面所有正确的动作也会连带受到惩罚。
- 样本利用率低:长程任务的成功轨迹本身就十分稀少,当一组采样的轨迹全部失败时,组内奖励的方差为零,优势函数直接归零,这批样本对训练完全没有贡献。
也就是说,模型最需要学习信号的阶段,恰恰是信号最匮乏的环节。针对这两个问题,有研究团队推出了里程碑引导的策略学习框架BEACON,为长程智能体的训练提供了全新的解决方案。
相关学术资源
论文标题:Milestone-Guided Policy Learning for Long-Horizon Language Agents
论文链接:https://arxiv.org/abs/2605.06078
代码链接:https://github.com/ZJU-REAL/BEACON
项目主页:https://zju-real.github.io/BEACON/
核心洞察:利用任务的天然结构优化信用分配
我们可以用一个简单的任务来理解这个问题:让智能体把加热后的苹果放进冰箱。如果智能体成功找到了苹果、拿起苹果并完成加热,却在最后放置的环节出错,在GRPO的逻辑里,这条轨迹和从头错到尾的轨迹没有任何区别,每一步都会被打上同样的负分。
但从任务本身来看,这个目标可以自然拆分为几个必经的子目标:找到苹果、加热苹果、放入冰箱。每完成一个子目标,智能体就离最终目标更近了一步。BEACON的核心思路就在于:既然任务存在这样的组合结构,那么信用分配也应该利用这个结构,已经达成的子目标理应获得正向的信用奖励,而不会被后续的失败全盘否定。
里程碑如何判定?
BEACON中的里程碑由环境自带的指示函数来判定,完全不需要训练额外的模型,不同环境的判定方式各有侧重:
- ALFWorld:里程碑对应任务过程中的关键步骤。以加热苹果的任务为例,拿到苹果、完成加热就是两个不可跳过的节点,环境通过物体状态谓词来判断这些步骤是否完成。
- WebShop:通过检查环境状态来判定购物进展,比如搜索结果是否出现符合目标的商品、商品属性是否选择正确、是否顺利到达下单确认页,每通过一个检查点就视为达成一个里程碑。
- ScienceWorld:环境自带子目标完成信号接口,子目标完成时会直接给出信号,直接读取即可。
训练时,框架会根据批次数据中的里程碑字段自动选择对应的处理方式,一套训练管线就能支持全部三个环境,不需要针对不同环境编写专属的训练分支代码。
框架核心:轨迹分段、奖励塑形与双尺度优势估计
BEACON的实现主要包含三个关键步骤:
1. 轨迹分段
使用前面定义的里程碑指示器,找出轨迹中每个子目标完成的时刻,在这些边界处将整条轨迹切分为若干独立的段。
2. 段内时间衰减奖励塑形
在每个已经完成的段内,动作会获得随时间衰减的正向奖励:离里程碑越近的动作获得的信用越高,越往前奖励逐步递减,覆盖整个段。这样一来,即便整条轨迹最终失败,已经达成的里程碑仍然可以转化为有效的学习信号,避免部分成功的轨迹被完全浪费。
3. 双尺度优势估计
轨迹级优势沿用GRPO的做法,负责把握全局的任务表现;段级优势则仅在到达同一里程碑的轨迹之间进行比较,用于评价局部动作的质量,避免后续段落的波动干扰前面动作的评估。最终的优势值由两者线性组合得到。
整个方法仅引入两个超参数,实现逻辑简洁直接。
实验效果:全面领先,任务越长优势越明显
在多个基准数据集和不同模型规模上,BEACON的表现全面超过了现有方法。其中在ALFWorld的长程任务上,模型的任务成功率从GRPO的53.5%提升到了92.9%,提升幅度接近一倍;有效样本利用率也从23.7%提升到了82.0%,样本利用效率得到了大幅改善。这项研究成果已经被人工智能顶级会议ICML 2026收录,相关代码也已经全部开源。
在样本效率方面,GRPO的训练过程中大量部分成功的轨迹因为最终失败而贡献零信号,而BEACON将这些走到一半的轨迹全部转化为有效梯度,零优势比例得到了显著下降。
另一个关键发现是,BEACON相对现有方法的领先幅度会随着任务长度的增加而单调扩大,在更长的任务中优势更加明显,这说明里程碑式的信用分配恰好命中了长程强化学习的核心痛点。
深入验证:效果来自策略优化而非模仿
一个自然的质疑是,BEACON的效果会不会来自变相模仿里程碑轨迹?为此作者设计了一组对照实验:直接使用优质轨迹进行行为克隆,最终的成功率远低于BEACON,这说明效果确实来自策略优化本身,而非简单的轨迹模仿。
此外,尽管BEACON的信用集中率在所有对比方法中最低,但性能表现最好,这说明保留渐进式的梯度信用,比激进地仅奖励里程碑动作更加有效。
从训练动态来看,BEACON的收敛速度更快,策略熵下降更平稳,说明一致的里程碑反馈带来了稳定的逐步精炼,而非突然的崩塌式收敛。
总结与展望
BEACON用一个简洁的思路解决了长程智能体训练的核心难题:任务存在天然的结构,信用分配就应该充分利用这个结构。它不需要训练额外的奖励模型,也不需要针对不同环境进行逐调试参,仅依赖环境本身可以验证的里程碑信号,就将仅看最终结果的稀疏奖励,转化为对每个阶段性进展都有反馈的学习信号。
随着具备自主能力的大语言模型走向更长的任务视野,比如多轮工具调用、跨应用工作流、长周期的科研助手,这种按里程碑分配信用的思路有望成为长程智能体强化学习的通用方案。目前团队已经将完整的训练代码开源,包含三个环境的一键复现脚本,欢迎感兴趣的研究者试用和交流。

