文章摘要
针对AI领域递归自我改进技术存在探索循环成本过高、难以形成闭环的痛点,谷歌提出全新Dream-RSI范式,将历史探索记录构建为可交互的免费回放模拟器,让AI智能体可在模拟中自我进化,无需大量真实交互训练。多项实验验证该方法可大幅降低算力消耗、提升任务性能,实现了低成本的递归自我改进闭环。

目前递归自我改进(RSI)技术在AI领域热度持续攀升,相关研究不断突破边界。近期有研究提出了全新的Dream-RSI范式,让智能体能够通过模拟的方式实现自我进化,无需反复进行真实的交互训练。

递归自我改进的核心痛点

递归自我改进,也就是Recursive Self-Improvement,一直是自主AI系统的核心发展方向之一。这类技术让智能体能够循环生成候选方案、评估结果、吸收反馈并持续迭代优化,此前的AlphaEvolve、FunSearch等系统已经在算法设计、数学发现等领域验证了这条路线的可行性。但最新的研究指出了一个长期被忽视的关键问题:当探索过程扩展到数千次提议-评估循环时,真正决定项目成败的并非底层模型的性能强弱,而是探索策略的改进循环成本过高,无法形成完整的闭环。

发现历史:免费的回放模拟器

研究团队用了一个非常直观的类比来解释这个思路:就像一个智能体在陌生环境中导航,第一次探索难免会绕路、遇到死胡同甚至需要回溯,但一旦绘制出完整的环境地图,后续的导航策略就不需要再重复人肉遍历整条路径,而是可以直接在地图上推演、比较不同的路线方案。这其实和基于模型的强化学习以及World Models的核心思想一脉相承——Dreamer系列模型就让智能体在学到的世界模型中“想象”轨迹来优化策略,无需反复和真实环境进行交互。

而Dream-RSI的核心观察在于:长程的科学发现过程天然具备同样的结构。一次完整的发现过程本身就是一棵结构化的探索树,完整记录了过往的所有探索决策以及对应的真实执行结果,包括代码、评估分数和诊断信息。将这棵探索树进行结构化组织后,它就可以成为一台免费的回放模拟器,也就是论文中提到的“worlds”:

  • 备选的探索策略可以在这棵已经记录的探索树上进行“重走”,可以选择不同的分支子集、调整探索顺序、采用不同的并行分组方式,甚至可以在任意位置暂停探索;
  • 由于所有节点的执行结果都已经预先存在,评估新的探索策略只需要直接读取记录的结果,完全不需要重新运行编码智能体和评估器;
  • 一次成本高昂的在线探索运行,就能够支撑成千上万次零执行成本的离策略评估。

Dream-RSI的三阶段递归循环

Dream-RSI的完整流程分为三个核心阶段,形成了闭环的递归改进循环:

  • 在线探索阶段:由当前的探索策略引导一轮真实的发现过程,在本轮探索中策略代码保持固定,最终生成一棵新的探索树并追加到历史探索记录中。
  • 构建回放模拟器阶段:历史中的每一棵探索树都可以成为一个独立的“回放世界”。在进行回放时,探索策略从根节点开始,每一步选择一个节点批次,系统会确定性地揭示该节点已记录的子节点——整个过程不需要重新运行任何代码,只需要翻阅预先记录的探索结果,每条分支只能按照记录中的父子顺序进行遍历,不会产生超出原有记录的结果。
  • 基于模拟的策略改进阶段:在离线阶段开发多个策略版本,每个版本都可以在所有历史探索树上进行回放评估。回放的打分函数需要平衡三个核心指标:最终找到的最优解的质量、探索过程中揭示的节点数量(对应真实执行时的调用次数),以及平均每轮决策中并行尝试的数量——奖励机制会优先鼓励将有用的尝试进行打包,而非采用串行的探索策略。

实验一:Lasso正则化路径求解器

本次实验的任务是为高维统计中的基础计算原语Lasso正则化路径发现高效实现方案,这类方案广泛应用于基因组学、金融等领域的模型选择任务。实验沿用了基准设置:使用17个覆盖不同维度、稀疏度、特征相关性的合成实例用于探索发现,另外准备了6个留出的下游数据集用于检验模型的泛化能力。

  • 相比基线方法,Dream-RSI的调用次数减少了约两个数量级,最高可达162倍,同时平均运行时间更低;
  • 相比固定探索策略,Dream-RSI不仅求解质量更好,还能节省1.7倍的算力,从第二轮探索开始两条轨迹就出现了明显的分叉;
  • 发现的求解器在全部6个留出数据集上都跑赢了现有方案,证明并非过拟合了初始的搜索分布。

实验二:三大经典数学优化问题

本次实验选择了三个风格迥异的数学发现任务:Sum–Difference组合优化问题、Circle Packing几何优化问题、Autocorrelation泛函优化不等式问题。

  • Sum–Difference任务:最终结果超过了基线和固定探索的结果,是所有对比方法中的最佳表现;
  • Circle Packing任务:最终结果追平了所有对比方法中的最强纪录;
  • Autocorrelation任务:结果保持了较强的竞争力,预算节省超过50倍。

实验三:GPU Kernel工程优化

本次实验的任务是自动发现高性能的GPU kernel实现,同时需要保证数值正确性,这要求模型同时推理算法结构、内存访问模式、并行化策略和硬件特性,和数学发现的测试场景有很大区别。实验取得了两种形式的胜利:

  • 相同性能下,更少的算力消耗:在多个常见任务上节省了1.7到2.43倍的生成次数;
  • 相同预算下,更高的性能表现:部分任务的性能提升可达1.44到2.09倍。

深入分析:两个核心发现

历史经验作为上下文不如作为可交互模拟器

一个很自然的替代思路是:将历史探索轨迹抽象成高层的“方向性洞察”,直接作为语义指导注入prompt中。研究团队将这个方案同时加入固定探索和Dream-RSI中进行对照实验,结果却有些反直觉:显式的方向性指导在两种范式下都一致地拖累了整体表现。论文给出的解释是,在长程探索过程中,对未来的搜索方向强加过强的语义归纳偏置,会过度约束搜索空间,抑制多样的探索尝试。因此,将历史探索记录当成可以交互推演的“世界”,比将其浓缩成几句“人生经验”要更加有用,这是一个颇具普适性的重要洞察。

探索策略的自适应进化

实验展示了学到的探索策略如何随着迭代轮次不断演化,呈现出清晰的自适应模式:在性能提升阶段,探索策略会主动收缩发现算力;当探索进展陷入平台期时,策略又会重新加大探索力度,随后很快迎来新一轮的性能增长。智能体学会了合理分配资源的策略,这正是元层自我改进想要达到的理想行为。

总结

Dream-RSI的核心贡献可以浓缩为一句话:将发现历史从静态的上下文信息升级为可交互的回放世界,从而让探索策略的递归自我改进第一次变得廉价且能够形成完整的闭环。

Dream-RSI: Recursive Self-Improvement through Evolving Worlds
https://arxiv.org/pdf/2609.14858v1
https://github.com/zhengkid/Dream-RSI
dream-rsi.com
以上内容不代表本平台立场,仅供读者参考