文章摘要
谷歌DeepMind联合多所高校发布递归自我改进研究成果Dream-RSI,相关代码已开源。该方法针对现有方法的缺陷,将长程任务探索策略封装为可自我迭代程序,基于历史探索数据离线优化,实测在算法工程等三类任务中搜索算力开销降低1到2个数量级,研究也明确了其适用边界。

近期,Google DeepMind联合多所高校发布了名为Dream-RSI: Recursive Self-Improvement through Evolving Worlds的递归自我改进研究成果,相关代码已开源至公开代码托管平台。不同于过往将递归自我改进的卡点放在底座模型解题能力上的思路,这项研究将重点转向长程任务中的探索策略,将其封装为可自我迭代的程序对象,实测结果显示,在算法工程、数学优化与GPU算子工程三类任务中,该方法将搜索算力开销降低了1到2个数量级。

01
现有RSI方法的缺陷

在正式介绍方案前,研究团队先梳理了现有探索方法的两大核心缺陷。

1. 静态预设策略,面对大搜索空间必然空转

以AlphaEvolve、CodeEvolve、SimpleTES为代表的第一代方案,探索策略全程由人工预设。研究团队在对照实验中给出了具体的策略基线:系统固定启动10个独立工作区并行探索,每个工作区固定执行11步连续精炼,分支之间互不相通,每轮迭代无论前期跑出什么结果,都机械重复这套固定配额。

在浅层任务中,这种预设逻辑可以跑通,但在需要数千次提议与评估的长程任务中,这种策略缺乏自适应能力。当某条分支的改进在第3步就进入平台期,系统依然会跑完预设的11步;同时由于无法吸收全局经验,后续新分支往往会重复之前已经验证无效的方向,造成大量算力空转。

2. 在线元策略优化:边探索边调规则,长程试错成本过高

另一类思路不仅让模型寻找解,还试图让模型在任务执行过程中在线学习并动态调整搜索规则,比如由系统实时决定何时发散探索、何时收敛深挖,以及为各个分支分配多少算力。但这种机制在实际落地中会面临双重成本限制。

一是反馈极度延迟且昂贵:评估一段生成的代码只需跑一次测试,几秒就能拿到反馈,但评估一套搜索规则是否有效,必须让模型在真实环境中跑完整条长任务调用链,直到整棵探索树完全展开才能看到最终收益。二是真实环境试错代价大:在线优化意味着每次调整规则都在消耗真实的线上算力与调用配额,一旦新策略尝试失败,整场任务的投入将直接沉没。

02
Dream-RSI核心逻辑:把历史数据做成物理模拟器

排除了上述两条失效路径后,研究团队给出了破局思路:过往的历史探索数据不应仅作为参考文本,其本身就是一座可以零成本重放的物理模拟器。

1. 三阶段递归自改进闭环

Dream-RSI的整体系统由三个紧密咬合的阶段循环驱动。

第一阶段是在线探索:系统部署当前版本的探索策略,指挥底层编码代理与评测沙箱进行真实交互,将所有探索尝试沉淀为一棵结构化的“发现树”。

第二阶段是世界演化:系统将最新探索出的节点、代码快照、报错信息、运行时长和客观得分无损并入历史模拟器资产池,环境世界随之不断扩张。

第三阶段是离线做梦:在完全脱离真实API和沙箱环境的前提下,系统让成千上万个候选探索策略在历史模拟器里高速重跑,综合评估策略的解质量与计算效率,筛选出最优策略代码,部署到下一轮真实探索中。

整个闭环有一个硬约束:底层大模型、评价函数、测试环境完全锁死不变,只更新探索策略代码本身,这是确保性能提升可归因的技术底线。

2. 核心机制:发现树直接充当回放模拟器

过往每一次探索尝试的代码快照、报错日志、运行时长和客观得分都被完整记录下来。当需要评估成千上万种不同的探索策略时,不需要向大模型发起新的推理请求,也不需要重新运行评测沙箱:候选策略只需要在这棵已有的历史树上遍历,需要查看哪个分支时,系统直接调出当年记录的真实结果,一次真实探索可以换来上万次零额外消耗的离线模拟。

3. 探索策略代码的四个决策维度

为了让探索策略变成一段可以被量化优化的程序,研究团队将搜索过程统一形式化为树上的遍历调度,探索策略在每个决策轮次只需要完成四件事。

第一,选节点:决定从当前发现树的哪些节点作为父节点,派生新的尝试。

第二,定并发:根据系统设置的最大Worker限制,决定当前时刻并行调度几个生成任务。

第三,设深度:在同一条分支上允许连续深入尝试几步,决定深挖还是广搜。

第四,下止损:什么时候选择空批次主动结题,避免无休止的边际消耗。

经过这样的设计,探索过程不再是未形式化的经验逻辑,而是一段输入输出明确的程序代码。

03
Agent自我改进中的避坑指南

论文附录给出的Prompt约束,是研究团队在实际工程中踩坑后的经验沉淀。如果不加控制,模型在自主探索时会出现几类典型的判断偏差。

1. 别把实现级报错判为算法方向失败

常见的一个问题是,代理在某条分支上遇到维度不匹配、显存超限或编译参数遗漏这类Bug时,会直接得出这条思路不可行的结论并放弃整条方向。研究团队的应对规则非常明确:必须对报错做严格分类,只有不可恢复的算法错误才能放弃分支,而维度错误、参数错误、显存溢出这类可修复失误,单次出现时不允许关停分支。

2. 引入分支的赦免与重开机制

早期的几次失败会让模型产生偏见,导致后续有潜力的分支被雪藏。研究团队规定,分支判定不能只看最新一次输出,必须参考整条分支的历史轨迹,只要后续尝试出现进展,系统必须具备撤销关闭的能力,抹掉早期的失败标记并重新激活分支。

3. 避免在收益走平的局部反复打转

代理容易在局部细枝末节上反复修补,即使提升曲线已经进入平台期,依然死守原有思路。解决办法是在调度批次中加入结构性异构候选,将探索多样性作为与单步收益同等重要的指标,打破这种死循环。

4. 动态调整探索强度

探索不能按照固定步长匀速推进,实测数据显示,最优策略在初期取得突破时,会自动将单轮尝试次数从110次压低到50次,主动节省算力;当进入平台期时,再重新调动高密度探索算力冲击瓶颈。

5. 警惕将历史塞进Prompt,先验引导反而压制多样性

很多开发者习惯将上一轮尝试的经验、教训或方向性建议写入下一次调用的Prompt中做语义引导,但研究团队的对照消融实验显示,在同等算力预算下,无论是固定探索基线还是Dream-RSI方案,加入显式方向引导的代理最终性能都落后于无引导的对照组。

原因在于长程自主探索依赖多线程并发的多样性,在Prompt中强加高维方向性先验会过早框死模型的解空间,切断潜在的最优探索分支,经验应当沉淀为环境历史供策略回放,而非变成提示词中的思维定势。

04
三大任务开销对比:算法工程、数学优化与算子生成

消除盲目试错后,Dream-RSI的收益直接体现在算力开销上。

1. 算法工程:Lasso正则化路径求解

以SimpleTES作为对照基线,原方案消耗了51200次生成。使用Gemini-3.1 Pro时,固定探索策略耗费550次Agent调用,下游运行耗时3587.1毫秒;而Dream-RSI仅用了317次调用,下游耗时压低到2931.0毫秒,算力开销比SimpleTES低了约两个数量级。最终产出的求解器自发结合了Cauchy-Schwarz KKT剪枝、强规则筛选与惰性Gram矩阵构造,性能超过了标准的sklearn和glmnet。

2. 数学优化:千代以内追平或超越前人

在三个数学任务上,Dream-RSI使用Gemini-3.1 Pro运行10轮:在Sum-Difference任务上取得1.145427的评分,刷新了包括SimpleTES在内的纪录;Circle Packing追平了学界公认的最强解2.635983;Autocorrelation在不到1000代之内追平了此前消耗51200代的SOTA模型,预算开销压缩了50倍以上。

3. GPU算子工程:更少代数达到工业级性能

在KernelBench测试中,达到同等性能目标时,VGG16上减少了2.43倍的代数开销,LayerNorm上减少了1.79倍;在恒定算力上限下,ConvDiv和ConvMax的算子性能分别提升了2.09倍与1.44倍。

05
Dream-RSI的适用边界

任何技术都有适用条件,这套方案目前有三个明确的前提边界。

第一,必须依赖客观、可自动评分的评测沙箱。系统能够形成闭环的前提是,代码能否运行、耗时多少、数学目标是否达成,都有确定性的评测器兜底。如果迁移到开放域创意生成或模糊业务分析等缺乏客观真值评分的场景,整套回放评估机制将无法成立。

第二,回放模拟器无法凭空产生未探索的真值。离线做梦只能对已经记录的历史分支进行重排、重访与剪枝,无法预测从未尝试过的未知路径,新知识的拓展依然需要周期性的在线探索。

第三,策略代码本身存在复杂度上限。当前演化的探索策略受限于模型编写控制流代码的能力,当探索图谱变得庞大时,策略代码本身的维护将构成新的工程挑战。

06
写在最后:从调优模型走向治理探索

当遇到Agent任务失败时,很多人的第一反应是底座大模型能力不足,进而陷入微调Prompt或等待下一代模型的循环中。而这项研究展现了一种全新的工程思路:底座模型完全可以保持不变,通过将模糊的探索行为规范为确定性的代码接口,将过往的试错历史盘活为离线模拟器,再通过清晰的工程规则避免代理的假性失败,同样可以在真实任务中实现一个数量级以上的效率跃迁。

对于正在搭建代码生成、科学计算或长流程Agent的开发者来说,管理好探索本身,往往比更换模型更加有效。

以上内容不代表本平台立场,仅供读者参考