自我改进Agent:模型与脚手架双路径进化

近两年来,围绕AI自主进化的相关概念不断涌现,从自我反思、自我修正到智能体强化学习、技能学习等,各类提法层出不穷。但这些术语对应的变化层级与强度差异显著,长期以来行业缺乏一套统一的分析框架。
近日,来自吉林大学、KAUST、阿尔伯塔大学和瑞士人工智能实验室等机构的研究团队发布综述,从系统层面重新定义「自我改进」,并将模型训练、记忆演化、工具创建和Agent架构搜索放进同一张地图。配套项目目前已整理312篇相关工作。
该综述发布后迅速在海外AI社区引发关注,配套的GitHub仓库在发布一周内收获超200颗星标,相关推文在X平台也获得了约800个点赞,反映出自我改进智能体已成为全球AI研究者与开发者的关注焦点。
明确自我改进的边界
该综述将基础智能体表示为包含模型参数θ与运行脚手架Σ的系统,其中Σ涵盖提示词、记忆库、工具集以及路由、调度与安全约束等控制逻辑。真正的自我改进,需要系统基于自身执行轨迹、评价结果或验证反馈,持久修改θ或Σ,让后续任务从全新的起点启动。
临时的对话历史、单次反思仅属于运行时状态,并不构成真正的自我改进——比如单次任务中的「再思考一次」或许能提升当前答案,但不会留下跨任务的能力提升;而经过验证写入长期记忆的规则、被修复后持续复用的工具,即便没有更新模型权重,也能改变智能体未来的行为模式。
自我改进的理念并非伴随大模型才出现,从反馈控制、元学习到哥德尔机,相关思想已经延续了数十年。大模型带来的核心变化,在于自然语言成为了统一的修改介质:错误可以被整理为批评意见,经验可以被压缩为记忆条目,工具与工作流可以直接生成与重写,让自我修改从底层代码与权重搜索,转变为更易表达、更可追溯的工程化流程。
自我改进的两大路径
该综述将自我改进分为两大核心路径:
一是基础模型更新路径,即智能体自主生成训练样本、评价信号,或是从真实环境、世界模型中获取探索经验,再通过监督微调、偏好优化或强化学习将更新写入模型参数。这类更新的成本较高、速度较慢,且回滚难度大,但一旦生效,能力可以在多个任务间共享。
该综述将这类学习信号分为三类:自主生成的示例与推理轨迹、模型自身给出的评分或偏好反馈、来自代码执行、网页交互、游戏与机器人环境的真实或模拟经验,Self-Instruct、Constitutional AI、WebRL等工作都属于这类思路。不过这类路径也存在明确风险:模型可能将自身的错误再次训练进权重,导致偏差放大、模型坍塌或灾难性遗忘,或是学会钻奖励函数与世界模型的空子,因此参数更新必须配合数据过滤、外部验证、版本管理与回滚机制。
二是脚手架更新路径,即保持模型参数不变,通过改写提示词、整理与淘汰记忆库、选择修复或创建工具集,甚至重构规划器、路由器等整套智能体代码来实现改进。TextGrad、Mem0、Voyager、哥德尔智能体、达尔文哥德尔机等工作都属于这类方向。这类更新更轻量、更透明,也更容易验证与撤销,是当前工程实践中最活跃的方向。
该综述对「技能」的定义也颇具新意:技能并非提示词、记忆、工具之外的独立组件,而是一种可序列化、可复用的更新。一项技能可以被存储为工具与调用约定,也可以是一条工作流或记忆条目,甚至可以被固化进模型权重或控制逻辑——技能的核心是「被保留的能力单元」,而非存储形式。
据此,技能可以分为两类:对象级技能用于完成外部任务,比如反复调用「收集资源」的流程;元级技能则直接作用于智能体自身,比如重写提示词、整理记忆库、创建工具或触发参数更新。当元级技能还能改进「自我改进的方式」时,就触及了递归式自我改进的核心自指结构。
不过需要明确的是,当前多数所谓的递归式自我改进,仍属于受目标函数、测试集、沙箱与权限边界约束的「有限自我修改」,距离科幻中的无约束智能爆炸仍有不小距离,该综述的重点也并非失控风险,而是如何让这类更新可测量、可归因、可回滚。
两类路径并非互斥,更合理的系统会让脚手架承担快速、局部、可逆的探索,再将经过反复验证的有效经验蒸馏进模型参数,形成「快速适应—慢速固化」的双时间尺度循环。
六大典型应用场景
该综述系统梳理了自我改进智能体的六大典型应用场景:软件工程、网页导航与自动化、游戏与策略推理、科学发现、具身智能与机器人、通用计算机控制。这些场景的共同点是智能体能够从环境获取反馈,差异则在于反馈的可靠性、获取成本与失败撤销的难度。
软件工程拥有编译器、单元测试与持续集成工具,是反馈最密集、结果最易验证的试验场;网页智能体需要面对持续变化的页面、DOM与API,需要将成功与失败的轨迹沉淀为记忆、定位策略或可复用工具;游戏场景能够提供可重置的环境、清晰的规则与自我对战经验,但也可能让智能体过拟合固定对手或钻模拟器的漏洞;科学发现将循环扩展到假设、实验与证据管理,难点在于新颖性、可复现性与反馈延迟;具身智能需要跨越仿真与现实,处理仿真到现实的差距与物理安全问题;通用计算机控制则需要跨应用与操作系统形成可迁移的程序性经验。
在这些场景中,技能可以是代码修复流程、网页策略、游戏技能库、实验工作流、机器人动作程序或桌面操作脚本,核心都是将单次成功转化为可复用的持久更新。
动态系统的评测挑战
传统的AI基准仅测试静态模型的最终得分,但自我改进智能体的研究对象是一条更新轨迹。可信的评测实验至少需要回答几个核心问题:固定预算下每轮改进的幅度是多少?改进能否迁移到未见任务?旧问题是否会再次失效?消耗了多少工具调用与人工监督?安全风险是否会累积?
该综述区分了可执行指标与基于评判者的评测:前者适合代码与工具调用类任务,后者则覆盖开放式、长链条任务。如果同一个模型既提出改进又负责打分,智能体可能只会越来越擅长讨好「裁判」,因此生成者与评估者必须分离,需要通过独立评判者、隐藏测试集与可验证子集来校准结果。
评测还需要覆盖两个层面:机制级评测需要隔离提示词、记忆、工具或参数更新的贡献;领域级评测则需要检验智能体能否承受分布变化、执行成本与安全约束。评测的重点不仅是智能体能达到的性能上限,更是它以多大代价、沿怎样的轨迹到达该性能。
核心设计原则:快环探索与慢环固化
该综述提出的核心设计原则可以概括为「快环探索,慢环固化」:在反馈嘈杂、任务变化较快的场景中,优先修改提示词、记忆库、工具集与控制逻辑,因为这类修改透明、成本低且可回滚。只有当某一策略经过充分验证,证明能够跨任务迁移时,再将其蒸馏或微调进模型权重,成为稳定的长期能力。真正成熟的智能体系统不会在「修改模型」与「修改脚手架」之间二选一,而是让两条路径形成协同循环。
基于该原则,该综述提出了六个研究方向:测试时持续适应、主动探索与好奇心、参数蒸馏与模型—脚手架联合优化、资源受限的改进效率、多智能体协作式共同进化,以及面对环境变化的开放世界鲁棒性。
进化越深,安全边界越关键
当智能体能够修改记忆库、工具集乃至自身代码时,安全防护的对象本身也在发生变化。一次提示词注入攻击可能不再只是临时干扰,而是会被写入记忆或工具逻辑,成为持久漏洞。因此,评判模块应当被视为受治理的基础设施,提出更新与批准更新不应由同一闭环完全控制。每一次修改都需要经过功能、权限与安全检查,尤其是在全脚手架更新与递归式自我改进场景中,智能体应当被视为受保护环境中的「不可信程序」,所有更新都需要经过分层门控。
未来的AI进步未必只来自参数规模的扩张,更值得关注的是:智能体能否从失败中提取经验,将经验封装为可复用的技能,管理自身的记忆与工具,修改工作流程,并将验证过的能力稳妥地沉淀下来。当AI从「每次任务都重新开始」转向「每次任务都留下可验证的成长」时,才算真正跨过了从工具到学习型系统的门槛。所谓自我进化智能体的核心,也并非「进化」这个热词本身,而是每一次更新是否持久、有效,且始终处于可控边界之内。
结语
这篇综述真正提供的并非关于AI自我进化的宏大预言,而是一套判断进步是否真实发生的工程语言:经验是否被有效保存,能力是否能够被复用,收益能否跨任务迁移,更新是否经得起验证。
未来的智能体或许会越来越擅长修改自身,但比「会进化」更重要的,是它知道该修改什么、为什么修改,以及何时不应该修改。

