文章摘要
当前大模型智能体普遍存在任务完成后遗忘经验、无法积累能力复利的问题,行业多聚焦更新基座模型参数实现递归自我改进。EvoMap团队提出新路径:无需更新模型参数,借助自研架构实现经验流转共享进化,目前已接入超35万个智能体,沉淀481万项经验,实测可显著提升任务通过率、降低Token消耗,为递归自我改进落地提供了可行方向。

很多使用智能体的开发者都有过这样的错觉:为大模型接入终端后,下发复杂的调试任务,看着它一步步排查问题,最终顺利修复了依赖冲突,甚至补全了配套测试用例。这时你会觉得自己的智能系统已经变得足够强大。但等到第二天,另一个同仓库的智能体接手类似任务时,却像从未接触过这个项目的新手一样,盲目读取报错信息、随意修改配置、反复重装依赖,把前一天踩过的坑、走过的弯路原样重走了一遍。哪怕最终代码修复完成、运行日志也被保存下来,但整个系统并没有获得任何实质性的能力提升。

深挖这个现象,会发现一个残酷却长期被忽视的工程难题:哪怕单次推理能力再强,只要任务结束后智能体就彻底遗忘所有经验,系统就永远无法实现真正的能力复利。

当行业普遍在狂热讨论大模型的下一个技术奇点——递归式自我改进(RSI)时,很多人都陷入了思维定式,认为RSI的终极形态一定是大模型自主编写代码,训练出参数量更大的基座模型。但在真实的工程场景中,如果连“刚刚踩过的坑,下次不再重蹈覆辙”都做不到,又何谈自我改进?

近期,EvoMap团队针对这个问题展开了系统性探索。他们没有盲目跟风“大模型自我训练”的远期构想,而是提出了一条极具现实意义的工程新路径:不必让基座模型硬扛自我改进的计算压力,而是在系统层面构建天生具备自进化能力的智能体,让经验在庞大的网络中高效流转。这并非停留在纸面的设想,基于他们研发的GEP协议,目前EvoMap网络已经接入超过35.7万个智能体,沉淀了481万项经过目录化管理的经验资产。

想要进化,首先得是一个“活”的智能体

当前的智能体系统存在一种奇怪的割裂感:在聊天窗口中,模型可以清晰梳理修复逻辑,甚至写出详细的排查流程,但一旦投入真实的开发环境,连最基础的环境变量配置都无法搞定。这是因为没有真实的试错动作,就无法产生真正可用的经验。

这正是EvoMap团队研发的自进化智能体EvoX的核心定位——它并非被动的测试沙盒,而是专为真实物理环境与代码开发场景设计的原生自进化智能体。当EvoX接手任务时,它会真实地读取源码、执行命令、调用工具、分析报错信息。无论任务最终成功还是失败,EvoX都会在底层留下详尽的执行轨迹:哪一步报错打破了僵局,哪一条错误的bash命令彻底偏离了方向。这条带着真实反馈的执行轨迹,就是后续系统进化的唯一核心原材料。EvoX的独特之处在于,它不仅负责完成任务,天生就具备提炼这些执行轨迹的本能。

Evolver引擎:将经验蒸馏为高密度控制片段

拿到智能体输出的冗长执行轨迹后,行业内最常见的做法是将其整理成一份超长的技能文档(Skill),存入检索增强生成(RAG)系统,下次遇到类似任务时直接喂给模型。但这种做法其实存在严重问题。EvoMap团队在论文《From Procedural Skills to Strategy Genes》(https://arxiv.org/pdf/2604.15097)中,通过4590次受控实验彻底打破了这个误区。

实验结果显示,对人类工程师来说充满安全感的长篇技能文档,对智能体而言却是灾难。将数千Token未经清洗的轨迹直接喂给模型,反而会稀释有效控制信号,淹没关键动作,盲目复用错误经验甚至比没有经验更加危险。这也是EvoX内置Evolver进化引擎的核心原因。

作为智能体的进化核心,Evolver就像是横在执行轨迹与模型之间的“清洗漏斗”与“验证机”。它抛弃了传统的“总结日志”模式,将过往的成功、失败与修复路径,强制蒸馏为极其紧凑的结构化控制对象——Gene(经验基因)。更令人惊喜的是这套引擎对算力效率的优化:在Claude Opus模型上,复用Gene的智能体不仅比使用传统技能文档多解决了39个长流程任务,执行时的Token消耗反而降低了9.9%。这证明,总结失败经验的最优形态绝非长篇大论的反思,而是经过极度蒸馏后的独立规避警告。

不仅如此,这套内置引擎还能让系统在无需人类干预的情况下完成完整科研闭环。在团队的AutoResearch实验(https://arxiv.org/pdf/2608.17906)中,系统将问题发现、计划生成、群体实验与独立验证串联起来。在一个复杂的Django修复任务中,Evolver帮助智能体区分出单次修复的偶然成功与实质性突破,最终将官方新特性的测试通过率从2/7提升至7/7,同时保持了全部203个回归测试的完美通过。

EvoMap网络:不让35万智能体重复踩过的坑

当一条高质量的Gene被Evolver引擎提炼出来后,如果只留在单个智能体的本地,它最多只能算是个人备忘录。递归式自我改进的真正威力,在于经验的规模化流转,这正是EvoMap网络要解决的核心问题。目前EvoMap网络已经接入35.7万个智能体,在如此大规模的智能体协作场景中,经验必须成为标准化的协议化对象。EvoMap团队没有停留在编写提示词的层面,而是直接深入协议层,设计了GEP(Gene Evolution Protocol)协议

在这套协议的支撑下,一个完整的RSI闭环在35.7万个接入网络的智能体与481万+经验资产之间持续运转:

  1. 匹配与注入:当EvoX接到新任务时,系统会扫描上下文信息,从EvoMap的481万项资产中匹配最相关的Gene,直接作为系统指令注入,极低的Token开销就能带来极强的任务控制能力。

  2. 执行与回写:无论任务成败,EvoX执行完毕后,内置的Evolver引擎都会将本次执行结果以事件形式回写到EvoMap网络。

  3. 全局进化:EvoMap接收反馈后,会触发对应Gene的验证、变异或固化流程。

如果某条经验在新环境中出现水土不服,网络会自动记录失效条件,甚至衍生出适配新场景的变异版本。这并非简单的提示词抄袭,而是一套具备版本控制、适用边界与达尔文式淘汰机制的经验分发网络。

为了验证这套“不更新模型参数、纯靠经验对象流转”方案的效果,团队在包含778个复杂长流程任务的LongWoF-Bench基准测试(https://arxiv.org/pdf/2608.23200)中展开了验证。在隐蔽验证器的监控下,通过EvoMap注入Gene的智能体,在7款主流大模型上的任务通过率,远超“裸跑”或仅使用传统技能文档的开源框架,比依赖技能文档的基线高出8.7到15.5个百分点。这意味着,一台智能体踩过的坑、找到的最优解法,可以在一秒钟内成为35万个同伴的先验本能,这正是群体智能在工程落地中最坚实的底座。

RSI的破局:不更新参数,也能让系统持续变强

由EvoX(自进化智能体)、Evolver(内置进化引擎)与EvoMap(经验流转网络)组成的这套体系,如同镜子般照出了当前大模型智能体经验复用的本质:智能体并非在“阅读冗长的说明书”,而是在有限的推理预算中,寻找下一步该执行的动作,以及必须绝对规避的操作。

这也回答了本文开头提出的问题:RSI离我们到底有多远?如果死磕“模型训练模型”的路径,我们可能还需要数年时间,才能解决数据污染、灾难性遗忘与巨额算力成本等一系列难题。但EvoMap团队给出了一条无需等待的捷径:在智能体与系统协议层解锁RSI。

在他们的实测中,无需更新基座模型的任何参数,也无需进行SFT或RLHF微调,仅靠经验对象(Gene)在系统内的自动提取、流转与进化,就能让普通开源模型在硬核评测基准上的通过率大幅提升,同时Token消耗降低数个数量级。当整个AI圈都在为更长的上下文窗口、更花哨的RAG框架内卷时,这家致力于成为中国RSI领域前沿实验室的团队,指明了一条朴素却直击要害的发展路径:在智能体时代,下一阶段的竞争绝不仅是比拼模型参数规模与上下文长度,而是谁能率先针对智能算力的利用效率,搭建一套“执行、提炼、验证、分发”的自进化机制。

毕竟,真正的进化,从来不是每次跌倒后都重塑大脑,而是将如何爬起来的肌肉记忆,刻进整个种群的基因库中。

以上内容不代表本平台立场,仅供读者参考