文章摘要
该研究聚焦AI自进化,提出让环境与智能体双向螺旋式提升的思路。为此构建了EnvHarness环境脚手架,通过开局、法则、串联三类组件微调环境;还引入环境搭建师EnvRigger,经观察、诊断、编写、验证四个步骤,实现环境与智能体双向进化。实验显示其效果显著,未来研究方向包括扩展组件库、拓展至非文本环境、探索语义化组合。

智能体(Agent)本质是持续与环境交互的主体:感知反馈、做出决策、影响环境。当前主流的自进化Agent范式,大多依赖智能体在静态环境中的单向探索来提升性能。那在这个交互闭环里,能不能让环境也跟着进化,和Agent互相博弈,实现双向的螺旋式提升?

现实中绝大多数环境都是底层写死的黑盒,想要对其进行动态调整几乎不可能,哪怕是修改底层配置都可能引发各种异常。不过我们在构建智能体时已经有过类似的经验:大语言模型本身也无法直接操作修改,于是我们提出了智能体脚手架来为其提供技能、记忆等支持,帮助应对复杂任务。那能不能借鉴这个思路,为环境也搭建对应的脚手架?

这项研究提出了EnvHarness(环境脚手架),可以在不触碰环境底层代码的前提下,实现对环境的灵活操控。和智能体脚手架拥有不同组件类似,环境脚手架也通过三类核心组件完成不同程度的环境微调:

  • 开局(Stage):在环境重置后,通过隐蔽执行预设动作,直接改变智能体进入环境时的初始状态和障碍。比如可以隐藏目标物品,逼迫智能体学习搜索技能;也可以提前完成部分早期目标,缩短任务流程,针对性地训练智能体的特定能力。
  • 法则(Contract):拥有接管环境底层逻辑的最高权限,可以拦截并重写智能体与环境的所有交互规则。包括限制可用动作空间、修改物理状态过渡逻辑,甚至过滤或篡改返回给智能体的观察视角,完全掌控交互流程。
  • 串联(Chain):通过特定的组合逻辑,将多个独立的静态环境首尾拼接,或是根据中间执行结果动态切换分支。这可以拉长原本短视的任务跨度,迫使智能体在更复杂的长线挑战中保持目标一致性,避免迷失方向。

为了让环境脚手架能够自动适配智能体的当前能力,研究引入了另一个智能体——环境搭建师(EnvRigger)。和自进化智能体通过浏览自身轨迹提升能力的思路类似,EnvRigger也通过分析目标智能体的交互轨迹,自动生成适配的环境脚手架。它的工作流程分为四个严密的闭环步骤:

第一步:观察(Observe):让目标智能体在当前环境中运行多轮任务,收集完整的交互轨迹数据,同时分析成功和失败的案例,精准摸清智能体的能力边界。

第二步:诊断(Diagnose):基于收集到的轨迹,分析智能体表现不佳或超常的深层原因:比如是否陷入死循环、是否无法理解长文本、是否在利用脆弱的作弊捷径。如果智能体表现过好,就需要封死它的投机捷径;如果频频失败,则需要设计更友好的引导路径,最终输出结构化的诊断报告。

第三步:编写(Write):根据诊断报告,生成一个或多个具体的EnvHarness组件。比如如果发现智能体总是利用某个漏洞通关,就会编写“法则”组件,在特定条件下拦截该动作,逼迫智能体探索真正的解法。

第四步:验证(Validate):将生成的脚手架应用到环境中,让智能体再次运行任务,基于全新的实战轨迹评判组件是否合格:新环境是否成功逼出智能体的新技能?关卡是否依然有解,没有被改成死局?如果未达到预期效果,就打回第三步反复修改,直到验证通过后,正式将脚手架应用到环境中。

通过这四个步骤,环境不再是一成不变的静态场景,而是会随着智能体的表现不断自我迭代、动态调整难度的顶级陪练,实现和智能体的双向进化。

这套双向协同进化的机制效果如何?研究团队在长线实验中重点测试了模型的缩放能力。实验结果显示,如果只是给智能体投喂更多的静态环境或普通生成环境,智能体的性能很快就会触及天花板,增长曲线被彻底焊死。但在EnvRigger的加持下,情况发生了显著变化:在极具挑战性的SWE-bench Verified基准测试中,随着定制环境数量的增加,EnvHarness实现了环境和智能体真正的螺旋式协同进化。

在迭代过程中,环境会逐渐提高难度:第一轮先专治智能体的基础调用错误;当智能体变强后,第二轮开始模拟资源枯竭场景,逼迫智能体学会处理超时和死锁问题;到第三轮则会封死普通的修改路径,迫使智能体深挖底层代码逻辑。在这种持续打磨下,智能体的任务成功率从最初的47.67%提升到了54.79%,足足上涨了7.12个百分点。更令人振奋的是,即使定制环境数量叠加到300个,性能增长曲线依然保持强劲的上升势头,没有任何停滞的迹象。这充分证明,针对智能体当前状态的精准定制环境,远比毫无目标的海量刷题更有效。

未来研究方向

  • 扩展组件库:在现有三类组件的基础上,开发能够引入随机性、部分可观测性、辅助反馈通道,以及支持多智能体共享环境交互的新型组件。
  • 拓展至非文本环境:将当前基于文本动作和观察的接口,延伸到视觉、GUI驱动或具身智能环境,探索非符号化状态下的环境封装抽象和状态验证机制。
  • 探索语义化组合:打破当前Chain组件单纯的顺序拼接模式,构建基于子任务语义关系的组合逻辑,支持具有真实依赖关系、动态分支和共享中间状态的长视距任务,并设计专属的复合验证器。

相关研究细节可通过学术渠道获取

以上内容不代表本平台立场,仅供读者参考