文章摘要
近期,LSTM之父等联合署名的97页全景综述引发关注。综述聚焦自我进化Agent,给出其系统级抽象定义和Skill定义,提出统一分类体系,分基座模型和脚手架两条改进路径,详细阐述各路径的类型、方法、对应研究及存在的问题。

近期,由LSTM之父与生成式AI领域权威学者联合署名的一篇全景综述引发了行业关注,这篇长达97页的论文聚焦自我进化Agent方向,系统梳理了相关研究进展。

当前,Agent自我改进已经从早期的哲学构想落地为工程实践热点,Reflexion、Voyager、Darwin Gödel Machine等新研究成果层出不穷,但相关术语体系较为碎片化,比如self-correction、meta-prompting、self-play等概念,本质上都属于同一类改进机制。

核心定义:Agent = (θ, Σ),一个公式定江山

综述首先给出了现代Agent的系统级抽象定义:在任意时刻t,Agent可表示为A_t = (θ_t, Σ_t),其中Σ_t又可以拆分为(p_t, m_t, T_t, g_t)四个组件。具体来说:

  • θ:基座模型的神经参数,也就是Agent的认知核心;
  • Σ:操作脚手架,也就是业界常说的harness,论文特意使用scaffold来强调其可修改的结构特性。脚手架的四个子组件分别为:p即系统指令/提示词,m为记忆机制及其检索更新策略,T是工具集与调用接口,g则是控制逻辑,包括路由调度、安全约束等。

此外,综述还给出了一个对工程界极具价值的Skill定义:Skill是自诱导更新算子U的可复用序列化实例,Skill的本质是“更新行为”本身,其存储位置并不影响其核心属性。同时,综述还区分了对象级Skill与元级Skill,其中元级Skill正是自我改进的核心所在。

分类框架:两条进化路径,一个信号视角

基于上述Agent的形式化定义,综述提出了统一的分类体系,首先按照“改进对象”分为两大核心路径,再根据“学习信号来源”进一步细分:

路径 更新对象 特点 类比
基座模型改进 θ(参数空间) 慢、贵、稳定全局、难回滚、可跨任务摊销 System 1,长期巩固
脚手架改进 Σ(执行空间) 快、便宜、可逆、任务特定、无灾难性遗忘 System 2,快速试错

与此前的相关综述相比,这篇工作的独特之处在于采用了“信号视角+更新基板”的双轴正交分类方式,同时将基座模型微调与Agent脚手架改进纳入统一的形式化框架中,而非将二者作为孤立的话题进行讨论。

路径一:基座模型改进(θ)——让模型自己给自己产数据

第一条进化路径是基座模型改进,也就是针对θ参数空间进行更新,根据学习信号的形态,可以分为三类:

5.1 内在生成示范(S ≈ D):模型即数据工厂

第一类是内在生成示范,即模型从自身权重中生成训练数据,包括指令-回答对、推理轨迹、执行日志等。代表性的研究包括Self-Instruct(种子数据扩增)、Evol-Instruct(复杂度进化式数据生成)、LMSI(自洽性过滤机制)、Ladder(递归分解出课程式训练数据)以及TT-SI(测试时检测不确定性,针对盲区现场生成数据并通过LoRA进行即时微调,实现高效的极样本学习)。

这类方法的核心风险是模型坍缩与知识气泡:反复使用模型自身生成的数据进行训练,会放大模型的固有偏见,窄化解空间。缓解手段包括保留真实训练数据作为基础、引入外部验证器或定理证明器进行把关、构建多样性感知的数据池以及人工审计环节。

5.2 内在评估反馈(S ≈ e):模型当自己的裁判

第二类是内在评估反馈,即模型不再生成训练示例,而是生成判断信号,这类方法可以分为三个子类:

  • Rubric反馈:按照显式准则进行打分排序,代表性工作包括Constitutional AI、Meta-Rewarding(对裁判的判断本身再次进行评估)、Self-Evolved Reward Learning;
  • 一致性反馈:通过多次采样取共识、熵值或自我确信度作为奖励信号,比如TTRL(测试时通过多数投票作为奖励)、INTUITOR(以self-certainty作为内在奖励);
  • 纠正性反馈:即模型生成批评意见并给出修订稿,比如SELF、RISE、Reflect-Retry-Reward。

这类方法的致命软肋是评估器与策略的同源耦合问题,会导致模型奖励“表面合规”而非真实的性能提升;同时,一致性只是正确性的代理指标,当模型存在系统性错误时,重复采样只会放大原有错误。

5.3 外在探索经验(S ≈ τ):环境说了算

第三类是外在探索经验,即学习信号接地于Agent的行动后果,这类方法可以分为两种环境场景:

  • 真实任务环境:包括程序化验证器(比如单元测试,如Agent-RLVR)、学习型奖励模型(如WebRL、UI-Genie)以及自生成任务(如Absolute Zero,即Agent自行出题答题,通过执行验证来决定模型的迭代方向);
  • 模拟代理环境:也就是先学习环境动力学模型,再通过“脑内演练”进行迭代优化,比如WebEvolver(协同进化的网页世界模型)、WMPO(在像素级世界模型上进行想象rollout)。

在大语言模型时代,这类方法还存在一些特有的问题:比如语言版的reward hacking,即模型利用LLM裁判的措辞漏洞;能力退化,即窄化的奖励RL会侵蚀预训练阶段获得的通用能力;以及幻觉动力学,即生成式模拟器会生成看似合理的错误转移,导致策略学会利用模型的幻觉输出。

路径二:脚手架改进(Σ)——不动权重,照样进化

第二条进化路径是脚手架改进,也就是不对基座模型的参数进行修改,仅通过调整执行空间的组件来实现Agent的进化,这部分内容对工程实践者来说极具实用价值,按照干预深度可以分为四层:

6.1 Prompt:信号越来越“有营养”的四代范式

第一层是Prompt优化,也就是对系统指令进行精炼,按照信号的丰富程度可以分为四代范式:

  1. 标量反馈优化:仅通过分数反馈来进行搜索,代表性工作包括APE、OPRO、RLPrompt、InstructZero;
  2. 定性反馈精炼:通过文本批评来驱动定向修改,比如Self-Refine、Reflexion、ACE(Generator–Reflector–Curator模块化上下文工程框架);
  3. 种群进化:将Prompt作为基因进行选择、交叉、变异操作,比如EvoPrompt、Promptbreeder(甚至可以进化“变异指令”本身,实现自指式优化)、GEPA(反思引导的进化机制,据称性能可超过RL方法);
  4. 文本梯度:将批评意见形式化为“方向性更新向量”,比如APO、TextGrad(文本版的自动微分技术)、MetaTextGrad(优化优化器自身的Prompt)、SkillOpt。

这条主线的进化逻辑清晰:信号从最初的标量分数,逐步发展为文本批评、种群适应度,再到结构化的方向指导,优化过程越来越不依赖人工启发式,自动化程度不断提升。

6.2 Memory:从静态缓存到自治引擎

第二层是记忆机制优化,可以从三个维度进行拆解:

  • 记忆对象:分为显式记忆(加工后的轨迹、精选原文、整合的外部知识,具备可解释性和可审计性)和隐式记忆(latent embedding/KV增强,紧凑快速但难以调试);
  • 记忆结构:从最初的扁平结构(便宜但存在近因偏差),发展为层级结构(压缩长历史但结构脆弱),再到图结构(支持多跳归因的关联检索,但维护复杂度较高),最后到向量检索(语义召回效率高,但“相似≠有用”);
  • 记忆处理:也就是信号驱动的CRUD操作:Create为选择性蒸馏写入,Read为混合启发式与门控的检索策略,Update为定期复习衰减与迭代蒸馏,Delete为多级剪枝与分层驱逐,同时还包括Select(选择写入和读取的内容)与Maintain(记忆的保鲜与遗忘)两个维度的治理。

代表性的记忆系统包括Mem0、A-MEM、Zep(时序知识图谱)、G-Memory(层级图混合结构)、MemoryOS(类操作系统的分层驱逐机制)。

6.3 Tool:从“会用工具”到“工具治理元认知”

第三层是工具集优化,也就是从简单的“会用工具”进化到“工具治理的元认知”,可以分为三个方向:

  • 动态路由:包括检索与图路由(比如ToolNet、OrchDAG将工具依赖构建为有向图)、策略学习路由(比如Tool-Star、AGENTFLOW、ToolGen将检索-选择-调用流程整合为单一生成过程)、主动交互式路由(比如MCP-Zero主动发现工具、Tool-Planner进行局部API级修复);
  • 迭代精炼:也就是生成-执行-修订的闭环流程,比如Voyager奠定了该方向的基础,STELLA加入了专职的critic模块,SkillWeaver蒸馏可复用的Web工具,DRAFT专门用于修改工具文档(很多工具调用失败源于指令与工具语义的错位,而非代码本身的bug);
  • 自主创造:比如TOOLMAKER打通了“从论文抽逻辑→安装依赖→闭环调试→产出可调用接口”的全生命周期;Alita/Code2MCP通过MCP协议将代码库标准化为服务,避免工具数量爆炸导致路由策略失效。

6.4 Full Scaffolding:把整个代码库当作可修改基板

第四层是完整脚手架改进,也就是最深的干预层级:Agent将自身的全部操作逻辑和源码作为可改写的对象,形式化为Σ_{t+1} = I_{Σ_t}(Σ_t; S_t),需要注意的是,改进器I的下标为Σ_t本身,也就是说改进器与它所改进的系统会共同进化。在实践中,该流程通常落地为“生成补丁→验证器门控(包括单元测试、回归测试、安全检查)→通过后才提交更新”。

代表性的系统包括Darwin Gödel Machine(维护Agent档案库,开放式长出后代树)、Huxley-Gödel Machine(用clade级元生产力CMP近似哥德尔机的理想目标)、GödelAgent(通过monkey patching实现自修改)、Live-SWE-agent(首个运行时在线自我进化的SWE Agent)、AlphaEvolve/ShinkaEvolve(程序进化方向的研究)、STOP(Self-Taught Optimizer,递归调用自身进行改进)、Agent Symbolic Learning(将Agent视为“符号网络”,通过自然语言损失/梯度实现符号化反向传播)。

Self-Improvements in Modern Agentic Systems: A Survey
https://arxiv.org/abs/2607.13104
https://selfimproving-agent.github.io/
https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

以上内容不代表本平台立场,仅供读者参考