深度学习/机器学习技术交流群邀您加入,附添加指南

在当前的大模型技术生态中,递归自改进(Recursive Self-Improvement,简称RSI)是热度极高的研究方向。这一技术的核心逻辑,是让大语言模型或是智能体不再局限于完成单次任务,而是能够依托运行过程中产生的经验、数据、反馈乃至代码,实现迭代式的自我优化升级。
行业内还有不少和RSI相近的概念,比如自进化(self-evolve)、自博弈(self-play)、自精炼(self-refine)、自奖励(self-reward)、自蒸馏(self-distill)等。这些技术虽然存在大量重叠,但不同方案的闭环程度以及优化的对象存在明显差异。
RSI的演进目标:逐步将人类移出改进循环
RSI的终极目标,是逐步将人类从改进循环中移出,这一过程大致可以分为三个阶段:
- 人在环路(Human-in-the-loop):智能体提出改进方向,但每一次修改都需要人类进行确认和审核;
- 人在环上(Human-on-the-loop):数据、奖励信号、验证器等核心环节已经实现自动化,人类仅需对整体结果进行监督,并把控模型的部署节奏;
- 闭环(Closed loop):系统能够自主完成改进的生成、验证和应用全流程,不再需要人工介入审核。
当前市面上绝大多数号称自进化的相关工作,其实都还处于Human-on-the-loop阶段,真正意义上的全闭环RSI技术尚未实现落地。
RSI技术的两大类别
按照自我改进发生的阶段不同,现有的RSI技术大致可以分为两大类别:测试阶段自改进(Test-Time RSI)和训练阶段自改进(Training-Time RSI)。
Test-Time RSI:部署阶段的自我优化
Test-Time RSI更严谨的定义应该是部署阶段自改进(Deployment-Time RSI),也就是自我优化直接发生在模型部署之后的运行过程中,而非等到下一轮离线训练。这类技术的核心差异点,在于改进效果的留存时长:从最初仅作用于单次查询的回答,到将优化写入模型参数,再到长期沉淀为智能体的固有能力。
与此同时,人类在改进循环中的角色也在发生转变。早期阶段人类会直接参与到批判和修正的环节中,随着执行反馈、评判标准、记忆模块和技能进化实现自动化,人类逐渐从每一步的参与者,退化为整个改进循环的监督者。这也意味着越来越多的RSI方案正在从Human-in-the-loop向Human-on-the-loop靠拢。
基础形式:自批判与自精炼
最基础的RSI应用形式是自批判与自精炼,其经典流程为:生成回答 → 批判验证 → 优化修正。在这类方案中,模型的权重保持冻结,仅针对当前的查询反复检查并修改输出结果。
这里的关键核心是验证信号:单纯依赖模型自身的自批判往往稳定性不足,因此更有效的方案通常会引入执行反馈、检索工具、求解器或是外部评判器,为精炼过程提供可靠的依据。不过这类改进仅停留在单次输出层面,当本次查询的会话结束后,积累的经验也会随之消失,因此这类方案更偏向于提升单次回答的质量,而非让模型实现长期的能力积累。
进阶形式:测试阶段训练(TTT)
测试阶段训练(Test-Time Training,简称TTT)则更进一步,不再仅仅修改单次输出,而是直接更新模型的参数。这样一来,模型在当前查询中获得的经验就有机会被写入权重中,而非使用后直接丢弃。
原本的“经验 → 更优回答”的流程,转变为“经验 → 更新模型 → 更优模型 → 新的经验”。相比自精炼方案,TTT让测试阶段产生的知识拥有了更强的持久性,也让当前迭代中获得的经验能够持续影响后续的推理过程。目前这类范式常与各类后训练算法结合,其中比较热门的方向是测试阶段强化学习(Test-Time RL,简称TTRL)。
智能体层面:框架进化
当技术演进到智能体(Agent)层面时,自我改进的对象不再局限于输出结果和模型参数,而是扩展到整个智能体框架:包括提示词、工具调用、记忆模块、技能栈、工作流,甚至智能体本身的代码。此时优化的目标不再仅仅是模型如何回答问题,而是智能体如何更高效地完成任务。
一个典型的方向是让智能体从真实交互和失败轨迹中积累经验:比如计算机使用智能体可以从失败案例中生成新的训练经验,经验图谱则可以将分支、执行、失败、修复等过程长期保存下来。像SkillMaster、SkillSmith、Socratic-SWE等工作,进一步让智能体能够自动生成、修改甚至组合自身的技能和工具。更激进的方案比如Gödel Agent和Darwin Gödel Machine,则直接将自修改拓展到智能体代码层面,让智能体能够搜索、修改并保留更优的自身实现。
这类方案的核心变化在于经验的积累:单次回答的精炼会随会话结束消失,测试阶段的参数更新可以留存一段时间,而新的记忆、技能、工具或工作流则可以跨任务持续存在,并成为下一轮进化的基础。从自精炼到TTT再到智能体框架进化,Test-Time RSI的发展脉络非常清晰:改进的范围从单次输出,逐渐进入模型参数,最终沉淀为智能体本身的固有能力。随着改进持久性的不断增强,这类方案也从有限的局部优化,逐渐走向能够持续积累的自我修改,同时人类也逐步退出具体的改进步骤。不过目前绝大多数系统仍然需要人类在外部进行监督和部署把关,距离真正的全闭环还有不小的距离。
Training-Time RSI:训练阶段的自我迭代
训练阶段自改进(Training-Time RSI)的核心逻辑,是系统能够自主产生学习信号,并将这些信号重新送回训练循环,让改进通过参数更新在多次迭代中持续积累。相比Test-Time RSI,这类改进会直接作用于下一轮的模型版本。与此同时,人类的角色也从直接提供标注或奖励,逐渐退化为设计训练规则和监督整个改进循环,更接近Human-on-the-loop的状态。
零标注场景:自主生成监督信号
第一个场景是零标注(zero-label):此时任务问题仍然由外部提供,但监督信号开始由模型自主产生。根据不同的后训练范式,这类方案大致可以分为三条路线:
- 微调(Fine-tuning):模型自主生成推理轨迹,再筛选高质量的样本作为下一轮微调的训练数据。经典的STaR方法仍然需要正确答案来筛选推理过程,而更前沿的方案则仅从未标注的问题出发,通过自验证来构造训练数据。
- 强化学习(RL):也就是当前热门的自奖励强化学习,核心是在没有现成可验证的奖励信号的情况下,从模型自身获取奖励。一类方法利用置信度、似然度、熵、自确定性等内生信号,另一类则利用同一问题的多次推演结果,通过多数投票等群体层面的信息来构造伪奖励。
- 蒸馏(Distillation):近期热门的在线策略自蒸馏方案,由模型自身生成推演样本,教师模型在学生模型实际访问到的轨迹上提供细粒度的token级监督。OPSD方案去掉了独立的外部教师,让同一个模型同时扮演学生和教师的角色,但仍然需要经过验证的真实解作为依据;进一步的U-OPSD方案则连参考标注都去掉,通过多个自生成的推演结果的多数共识来构造伪解。
这三条路线虽然分别使用轨迹、奖励和token级分布作为监督信号,但本质上都是在做同一件事:将原本由人类提供的监督信号,纳入模型自身的改进循环中。不过这类方案也面临两类主要风险:
- 自确认循环:生成器和验证器往往共享相似的能力和偏见,因此错误可能沿着“模型偏见 → 有偏评估 → 有偏学习信号 → 更强偏见”的路径被不断写回模型;
- 训练崩溃:即使奖励信号本身完全正确,训练动态也未必稳定,在带有真实二元验证器的代码强化学习场景中,仍然出现过典型的“先升后降”现象:性能先持续提升,随后在同一次训练中突然崩溃,即使使用KL、EWC等约束也无法完全阻止。
因此零标注方案减少了人类对监督的直接参与,但核心问题也从“如何获取监督信号”,转向“自生成的信号是否可靠”以及“这类改进能否在多轮迭代中稳定积累”,这更偏向于长期的稳定性工程问题。
零数据场景:自主生成学习任务
第二个场景是零数据(zero-data):这一方案将改进循环又向前推进了一步。零标注方案仍然需要外部提供任务问题,而零数据方案则让模型能够自主生成任务问题或学习课程,也就是从“人类出题、模型自主学习”,进一步升级为“连下一轮学习的内容也由模型自主决定”。
这类方案通常可以归类为自博弈:比如Absolute Zero和R-Zero都采用“提议者/挑战者 ↔ 求解者”的协同进化模式,挑战者根据求解者当前的能力生成新的问题,求解者能力提升后,又会反过来改变下一轮值得生成的问题类型。Agent0则将这种模式拓展到智能体任务中,让课程生成智能体和使用工具的执行智能体从零外部数据开始共同进化。
我们可以简单概括两类方案的差异:零标注是“人类提供问题 + 自生成学习信号”,而零数据则是“自生成问题 + 自生成学习信号”。前者逐渐将“如何学习”的决策权交给模型,后者则进一步将“学习什么”的决策权也交给模型。训练过程不再仅仅是消费固定的数据集,而是能够根据模型自身的能力持续产生新的学习边界。
不过这类方案仍然存在一个边界:虽然任务问题和学习信号可以动态变化,但整个改进流程通常仍然是由人类预先设计的。多数投票、不确定性奖励、过滤规则等评估机制,并不会随着求解者能力的提升而自动获得更强的验证能力。零数据方案同样面临两类风险:
- 多样性崩溃:提议者可能逐渐收敛到一小类最容易满足奖励要求的问题,导致学习课程越来越狭窄;
- 奖励锚定失效:如果奖励无法持续锚定真实的能力提升,提议者和求解者的协同进化可能会共同偏离真正有价值的学习边界。
因此零数据方案已经能够回答“下一轮学习什么”的问题,但“下一轮应该采用何种方式改进模型”,通常仍然是由人类预先决定的。
自动化研究:自主设计改进策略
第三个延伸方向是自动化研究:自我改进的范围从课程生成进一步扩展到整个研究流程本身。此时系统优化的不再仅仅是任务问题或学习课程,而是更完整的改进策略。研究智能体可以根据模型当前的表现分析失败原因,提出下一步的假设,选择数据或训练配方,运行实验,并根据评估结果持续调整后续的研究决策。
我们可以进一步梳理三类方案的演进:零标注是“自生成监督信号”,零数据是“自生成学习课程”,而自动化研究则是“自生成改进策略”。从这个角度来看,人类正在从提供监督信号、提供任务问题,进一步退出部分研究决策环节。
核心约束:验证机制的关键作用
无论改进循环拓展到哪一个层级,最终都需要回答一个核心问题:验证机制本身是否足够可靠?
将测试阶段和训练阶段的RSI放在一起观察,可以发现一个共同的约束条件:系统已经能够逐步自主生成回答、经验、学习信号,甚至任务问题或学习课程,但每一次进化最终都需要一个可靠的标准来判断,这次更新是否真正带来了性能提升。因此,验证机制很可能比生成机制更接近RSI的核心瓶颈。一个自改进循环能否持续运行,很大程度上取决于它所依赖的评估信号是否足够可靠。
不同任务的验证难度差异非常明显:数学、代码这类形式化任务可以依赖证明检查器、单元测试或执行反馈,因此更容易形成稳定的自动化循环,但这类系统通常仍然属于有限自改进,因为评估标准本身是预先固定的。当任务逐渐走向开放式智能体、创造性任务,甚至研究品味和研究方向设定时,验证过程会变得明显更加困难。此时系统不仅需要判断结果是否正确,还要评价新颖性、实用性、重要性等更难形式化的属性。也就是说,越接近开放式RSI,“什么才算更好的模型”本身就越难定义。
近期开始出现一些直接针对验证器本身的自改进方案:
- 自训练验证器:将验证器本身作为训练对象,希望验证能力能够随着迭代持续提升;
- 自进化深度研究智能体:在智能体能力进化的同时,持续更新用于评价研究产出的标准或验证器;
- 元评估:不再仅仅评估输出结果,而是进一步评估评估器本身。比如Red Queen Gödel Machine,让智能体和评估器共同进化,使评估标准不再始终保持固定。
这类方案和之前提到的R-Zero有所不同:R-Zero中评估信号会随着求解者的状态动态变化,但多数投票、不确定性奖励等验证机制本身仍然是人为设定的;而这里真正进入进化循环的,是验证器的能力,甚至评估标准本身。
沿着之前的逻辑继续梳理,RSI的闭环实际上在逐步拓展:从回答 → 经验 → 学习信号 → 任务问题/学习课程 → 验证器。前面的过程主要是在减少人类对“如何学习”和“学习什么”的直接参与,而当验证器也开始进化时,系统才真正触及更深的一层:连“什么才算改进”也不再完全由固定的外部标准决定。
不过这并没有彻底解决所有问题:验证器可以由元验证器来评估,评估器也可以和智能体共同进化,但最终仍然需要回答:这些不断变化的评估机制如何保持与真实目标的锚定?目前这一问题仍然没有成熟的解决方案。如何让验证器持续进化,同时避免模型策略和验证器共同偏离目标,可能是实现全闭环RSI中最关键、也最难解决的问题之一。
参考文献
[1] https://arxiv.org/pdf/2607.07663 [2] https://lsl.zone/blog/2026/a-taxonomy-of-self-evolving-agents/ [3] https://www.anthropic.com/institute/recursive-self-improvement

