文章摘要
文章围绕AI领域的RSI(递归自我改进)展开,介绍其核心逻辑、目标及阶段,指出多数研究处于人在环上阶段。阐述测试时和训练时RSI的演进路径,前者从提升单次回答质量到沉淀为智能体固有能力,后者从自生成监督信号到自生成改进策略。还强调验证器是核心约束,其自我改进使RSI闭环扩展,但保持评估机制与真实目标锚定仍是难题。

近期AI领域最受关注的概念之一当属RSI,全称递归自我改进(Recursive Self-Improvement)。其核心逻辑是让大语言模型或智能体不仅完成既定任务,还能利用自身生成的经验、数据、反馈甚至代码,通过迭代的方式不断优化自身能力。类似的相关概念还有很多,比如自进化、自博弈、自精炼、自奖励、自蒸馏等,这些概念虽有大量重叠,但在闭环程度和优化对象上存在明显差异。

RSI的核心目标是逐步将人类从改进循环中移出,这一过程大致可以分为三个清晰的阶段:

  • 人在环路阶段:智能体提出改进方案,但每一次修改都需要人工确认才能生效
  • 人在环上阶段:数据生成、奖励信号、验证器等环节均可自动完成,人类仅需负责整体结果监督和部署管控
  • 闭环阶段:系统能够自主完成改进的生成、验证和落地应用,完全无需人工审核介入

目前市面上绝大多数所谓的自进化相关研究,其实仍处于人在环上的阶段,真正实现完全闭环的RSI系统还远未落地。

从自我改进发生的阶段来看,现有的RSI方法大致可以分为两大类:

  • 测试时RSI:智能体在解决当前任务的过程中完成自我进化
  • 训练时RSI:智能体将自身产生的数据、奖励或反馈重新用于自身的训练流程

测试时RSI的演进路径

更准确地说,测试时RSI也可以称为部署时RSI,其自我改进直接发生在任务部署过程中,而非等待下一轮离线训练。不同方法的核心差异在于改进效果的留存时长:从仅作用于当前单次回答,到写入模型参数,再到长期沉淀为智能体的固有能力。

随着自动化程度的提升,人类在改进循环中的角色也在发生变化:早期需要人类直接参与评估和修订,而随着执行反馈、自动评判、记忆存储和技能进化等环节逐步自动化,人类正从每一步的参与者,转变为整个改进循环的监督者。目前多数相关研究正从人在环路向人在环上的阶段迈进。

1. 基于自评判与自精炼的对话机器人模式

这是最经典的测试时改进形式,核心流程为“生成→评判/验证→精炼”。这类方法通常保持模型权重冻结,仅针对当前查询反复检查并修改输出结果。其中验证信号是关键:单纯依赖模型自身的自评判往往稳定性不足,因此更有效的方案通常会引入执行反馈、检索工具、专用求解器或自动评判器,为精炼过程提供可靠的依据。

不过这类改进仅停留在当前的输出层面,当当前任务的交互会话结束后,这些经验通常会随之消失,因此更偏向于提升单次回答的质量,而非让模型长期积累通用能力。

2. 测试时训练模式

测试时训练相比自精炼更进一步,不再仅修改当前输出,而是直接更新模型的参数。这样一来,智能体在当前任务中获得的经验就能够被写入模型权重,而非在会话结束后直接丢弃。其核心流程从“经验→更优回答”转变为“经验→更新→更优模型→新经验”。

与自精炼相比,测试时训练让测试阶段产生的知识具备了更强的持久性,也让当前迭代获得的经验能够持续影响后续的推理过程。目前这类范式常与各类后训练算法结合,其中比较热门的方向包括测试时强化学习。

3. 智能体框架的自我进化

当进化的对象扩展到智能体层面时,自我改进的范围不再局限于输出结果和模型参数,而是延伸到整个智能体框架,包括提示词、工具调用、记忆存储、技能体系、工作流甚至智能体自身的代码。此时优化的目标不再仅仅是模型如何回答问题,而是智能体如何更高效地完成任务。

典型的方向包括让智能体从真实交互和失败轨迹中积累经验:比如计算机使用智能体可以从执行失败的案例中生成新的训练数据,经验图谱则可以长期保存分支、执行、失败、修复等过程;类似SkillMaster、SkillSmith、Socratic-SWE等工作则进一步让智能体能够自动生成、修改甚至组合自身的技能和工具。更激进的方案如Gödel Agent和达尔文哥德尔机,则直接将自我修改延伸到智能体的代码层面,让智能体自主搜索、修改并保留更优的自身实现。

这一方向的核心变化在于经验的积累:单次回答的精炼会随会话结束消失,单次测试时更新的效果可以保留一段时间,而新的记忆、技能、工具或工作流则可以跨任务持续存在,并成为下一轮进化的基础。从自精炼到测试时训练,再到智能体框架进化,测试时RSI的演进脉络非常清晰:改进的范围从当前输出逐步进入模型参数,最终沉淀为智能体的固有能力。随着持久性的不断增强,这类方法正从有限范围的精炼,逐步走向能够持续积累的自我修改,同时人类也逐步退出具体的改进步骤,但目前多数系统仍需要人类在外侧进行监督和部署管控,距离真正的闭环仍有明显差距。

训练时RSI的进阶路径

训练时RSI的核心是系统能够自主生成学习信号,并将这些信号重新送回训练循环,让改进通过参数更新在多轮迭代中持续积累。与测试时RSI相比,这类方法的变化会直接影响下一轮的模型版本,而人类的角色也从直接提供标注或奖励,逐步转变为设计训练规则和监督整个改进循环,更接近人在环上的阶段。

1. 零标注场景:自生成监督信号

在零标注场景中,任务问题仍由外部提供,但监督信号开始由模型自身生成。根据不同的后训练范式,大致可以分为三条主要路线:

  • 微调路线:模型自主生成推理轨迹,筛选高质量的交互轨迹作为下一轮微调的训练数据。经典的STaR方法仍需要依赖正确答案来筛选推理轨迹,而更先进的方案则可以仅从未标注的问题出发,通过自验证的方式构造训练数据。
  • 强化学习路线:对应当前热门的自奖励强化学习,核心是在没有现成可验证奖励的情况下,从模型自身获取奖励信号。一类方法利用置信度、似然度、熵、自确定性等内生信号,另一类则利用同一任务的多个输出结果,通过多数投票等群体级别的信息构造伪奖励。
  • 蒸馏路线:近期热门的方向包括在线策略自蒸馏,由学生模型自主生成交互轨迹,教师模型在学生实际访问的轨迹上提供细粒度的token级监督。OPSD方法去掉了独立的外部教师,让同一个模型同时扮演学生和教师的角色,但仍需要验证或真实的解决方案作为参考;进一步的U-OPSD则进一步移除了参考标注,通过多个自生成轨迹的多数共识来构造伪解决方案。

这三条路线虽然分别使用轨迹、奖励和token级分布作为监督信号,但本质上都是在做同一件事:将原本由人类提供的监督信号纳入模型自身的改进循环。

这类方法也面临两类主要风险:一是自我确认循环,生成器和验证器往往共享相似的能力和偏差,错误可能沿着“模型偏差→有偏评估→有偏学习信号→更强偏差”的路径不断被写入模型;二是训练崩溃,即使奖励信号本身完全正确,训练动态也未必稳定,在使用真实二元验证器的代码强化学习场景中,曾出现过典型的先升后降现象:性能先持续提升,随后在同一次训练中突然崩溃,即使使用KL散度、EWC等约束也无法完全阻止。

因此零标注场景减少了人类对监督信号的直接参与,但核心问题也从“如何获取监督信号”,转向“自生成的信号是否可靠”以及“改进能否在多轮迭代中稳定累积”,这更偏向于长期的稳定性工程问题。

2. 零数据场景:自生成任务与学习信号

零数据场景进一步将改进循环向前闭合:零标注场景仍需要外部提供任务问题,而零数据场景下,模型可以自主生成任务问题或学习课程,从“人类提供问题、模型自主学习”进一步升级为“连下一轮学习的内容也由模型自主决定”。

这类方法通常可以归类为自博弈模式,比如Absolute Zero和R-Zero都采用了“提议者/挑战者 ↔ 求解者”的协同进化模式:挑战者根据求解者当前的能力生成新的任务问题,求解者能力提升后,又会反过来影响下一轮值得生成的问题类型。而Agent0则将这种关系扩展到智能体任务,让课程生成智能体和工具使用执行智能体从零外部数据开始共同进化。

可以简单概括两类场景的差异:零标注是“人类提供问题 + 自生成学习信号”,而零数据则是“自生成问题 + 自生成学习信号”。前者逐步将“如何学习”的决策权交给模型,后者则进一步将“学习什么”的决策权也交给模型。训练过程不再只是消费固定的数据集,而是可以根据自身能力持续产生新的学习边界。

不过这类场景仍存在一个边界:虽然任务问题和学习信号可以动态变化,但整个改进流程通常仍是由人类预先设计的。多数投票、不确定性奖励、过滤规则等评估机制并不会随着求解者能力的提升而自动获得更强的验证能力。

零数据场景同样面临两类风险:一是多样性崩溃,提议者可能逐渐收敛到少数最容易满足奖励的问题类型,导致学习课程越来越窄;二是奖励锚定失败,如果奖励无法持续锚定真实的能力提升,提议者和求解者的协同进化可能会共同偏离真正有价值的学习边界。

因此零数据场景已经能够回答“下一轮学习什么”的问题,但“下一轮应该采用什么方式改进模型”通常仍由人类预先决定。

3. 延伸方向:自主研究模式

再进一步演进,自我改进开始从课程生成扩展到整个研究流程本身。此时系统优化的不再只是任务问题或学习课程,而是更完整的改进策略。自主研究智能体可以根据模型当前的表现分析失败原因、提出下一步的假设、选择数据或训练配方、运行实验,并根据评估结果持续调整后续的研究决策。

可以进一步概括三类场景的演进:

  • 零标注:自生成监督信号
  • 零数据:自生成学习课程
  • 自主研究:自生成改进策略

从这个角度来看,人类正从提供监督信号、提供任务问题,进一步退出部分研究决策环节。无论改进循环扩展到哪一层,最终都需要回答一个核心问题:验证本身是否足够可靠?

核心约束:验证器的关键作用

将测试时和训练时RSI放在一起观察,可以发现一个共同的约束:系统已经能够逐步自主生成回答、经验、学习信号,甚至任务问题或学习课程,但每一次进化最终都需要一个可靠的标准来判断这次更新是否真正带来了改进。因此验证环节很可能比生成环节更接近RSI的核心瓶颈,一个自我改进循环能否持续,很大程度上取决于其依赖的评估信号是否足够可靠。

不同任务的验证难度差异明显:数学、代码等形式化任务可以依赖证明检查器、单元测试或执行反馈,因此更容易形成稳定的自动化循环,但这类系统通常仍属于有限范围的自我改进,因为评估标准本身是预先固定的。当任务逐渐转向开放式智能体、创造性任务,甚至研究品味和研究方向设定时,验证环节会变得更加困难。此时系统不仅需要判断结果是否正确,还需要评估新颖性、实用性、重要性等难以形式化的属性。也就是说,越接近开放式RSI,定义“什么是更好的”就越困难。

因此近期开始出现一些直接针对验证器本身的自我改进方案:

  • 自训练验证器:将验证器本身作为训练对象,希望验证能力能够随着迭代持续提升
  • 自进化深度研究智能体:在智能体能力进化的同时,持续更新用于评估研究产出的标准或验证器
  • 元评估:不再仅评估输出结果,而是进一步评估评估器本身。比如红皇后哥德尔机,让智能体和评估器共同进化,使评估标准不再始终保持固定。

这与之前提到的R-Zero有所不同:R-Zero中评估信号会随着求解者的状态动态变化,但多数投票、不确定性奖励等验证机制本身仍是人为设定的;而这里真正进入进化循环的是验证器的能力,甚至评估标准本身。

按照之前的逻辑继续推演,RSI的闭环实际上在逐步扩展:从回答→经验→学习信号→问题/课程→验证器。前面的过程主要是在减少人类对“如何学习”和“学习什么”的直接参与,而当验证器也开始进化时,系统才真正触及更深的一层:连“什么才算改进”也不再完全由固定的外部标准决定。

但这并没有彻底解决问题:验证器可以由元验证器来评估,评估器也可以与智能体共同进化,但最终仍需要回答一个核心问题:这些不断变化的评估机制如何保持与真实目标的锚定?目前这一问题仍没有成熟的解决方案。如何让验证器持续进化,同时避免策略和验证器共同偏离目标,可能是实现完全闭环RSI中最关键也最困难的问题之一。

参考资料

相关研究可参考以下学术文献:

  • https://arxiv.org/pdf/2607.07663
  • https://lsl.zone/blog/2026/a-taxonomy-of-self-evolving-agents/
  • https://www.anthropic.com/institute/recursive-self-improvement
以上内容不代表本平台立场,仅供读者参考