EverMind自进化AI框架:四层递进体系实现持续学习

2026年的夏天,注定会成为自进化AI技术发展的关键节点。当海外一批聚焦前沿方向的新兴实验室依靠前瞻性理念拿下数亿美元融资时,来自中国的EverMind团队已经通过连续三篇重磅学术论文,交出了自进化AI领域第一份全栈式的技术解决方案。
这支由盛大集团孵化的团队,延续了当年盛大创新院的研究基因。2008年,陈天桥在集团内部创立的盛大创新院,在当时流量为王、变现至上的互联网行业中堪称异类——它不以产品落地和KPI为导向,纯粹聚焦前沿技术探索,这种企业内部的研究型组织模式,在当年的中国商业环境中极具开创性。十余年后,AI成为时代的技术底色,盛大集团将战略重心转向脑科学与人工智能领域,近三年来全面投入AI赛道,通过内部孵化机制在全球招揽顶尖AI人才,陆续组建了多支专注细分方向的研究团队,EverMind正是其中的核心力量之一。如果说盛大创新院开创了中国企业内研究型组织的先河,那么EverMind的出现,正是这种基因在AI时代的延续与升华。
这类专注下一代AI技术、以研究驱动为核心的新兴实验室,被行业统称为NeoLab。2026年,这股浪潮已经席卷全球AI领域:比如由前Salesforce首席科学家Richard Socher与前Meta FAIR科学家田渊栋联合创立的Recursive Superintelligence(RSI),在团队不足30人且尚无成型产品的情况下,拿下6.5亿美元融资,估值达到46.5亿美元,并与AWS签署了4.1亿美元的多年算力合作协议;DeepMind AlphaGo之父David Silver创立的Ineffable Intelligence以51亿美元估值进入赛道;Engram以6亿美元估值完成9800万美元A轮融资;Adaption Labs以10亿美元估值拿到5000万美元种子轮;Core Automation的估值目标更是直指40亿美元。这些团队的核心命题都指向同一个方向:如何让部署后的AI不再是一成不变的静态系统,而是能够通过自我迭代实现持续进化,这一方向在学术上被称为递归自我改进,产业界则称之为自进化AI。
但仔细审视这些高估值的海外NeoLab团队就会发现,他们大多仍停留在单点的理论探索阶段:RSI仅分享了先进理念与路线设计,未公布具体方案和成果;Engram专注参数化权重记忆,但缺乏脚手架层的灵活进化机制;Adaption Labs主攻推理时适应,却没有长期技能沉淀体系;Core Automation方向最为接近,但尚未公开相关论文与开源生态。
就在海外团队还在各自细分领域摸索时,EverMind已经悄然完成了一项极具分量的工作——连续发布三篇重量级论文,从技能层、脚手架层到模型权重层,系统性地给出了一套完整的自进化AI技术答案。
在深入这三篇论文的细节之前,还有一个值得关注的细节:今年四月,EverMind主办了一场名为“记忆起源”的黑客松活动,RSI的联合创始人田渊栋作为特邀嘉宾出席,在活动中分享了他对AI记忆技术的深度理解,彼时RSI的融资进展尚未对外披露。活动结束后,田渊栋与EverMind负责人邓亚峰共同接受了行业知名播客的采访,就AI行业发展走向与记忆相关技术的前景展开了深入对谈。在这次对话中,邓亚峰提出了核心判断:从长期记忆结合持续学习,走向自我进化是下一代AI的核心技术路线。
记忆是智能体积累经验的载体,自进化则是将经验转化为能力跃升的路径,没有高质量的记忆,自进化就是无源之水;没有自进化作为目标,记忆就只是一个不断膨胀的档案馆。EverMind从EverOS记忆操作系统到Raven自进化Agent框架,再到三篇自进化论文构建的完整技术栈,正是这一判断的系统性实践。田渊栋与邓亚峰的这次相遇,某种程度上也是一个隐喻:当海外顶尖的自进化研究者与中国最具研究深度的记忆AI团队相遇,他们发现彼此正从不同入口攀登同一座技术山峰。
在深入EverMind的技术细节之前,我们需要先理解,为什么“让AI自我进化”既是行业的必答题,也是一道极具挑战的难题。传统大语言模型在完成训练并部署后,能力会被冻结,无法随着使用场景的变化而持续增长,但人类智能的迷人之处恰恰在于,每一次交流、每一次思考都在悄然进化。下一代AI理应具备这样的能力:能够通过持续学习不断变得更聪明,而非停留在出厂时的状态。
随着大模型能力的不断跃升,越来越多的案例表明,“AI自主改进AI”已经从设想走向可行,在某些环节甚至开始超越人类专家。一旦AI能够稳定实现自我改进,势必带来一场生产力的跃迁。但要真正做到这一点并不容易,业界通常需要突破三道核心关卡:
第一关是脚手架的自我改进,一个智能体的实际表现不仅取决于模型本身,更取决于包裹在模型外围的脚手架——包括提示词、注入的知识、运行时控制逻辑等。让模型自主修改这些代码看似简单,但真正的难点在于如何避免过拟合:模型自我生成的反馈往往充满噪声,一个看似有效的修改,可能只是针对特定测试集的过拟合,更换场景后就会导致灾难性崩溃。
第二关是技能的规模化管理,当智能体将成功经验固化为可复用的技能文件后,技能数量会呈现爆炸式增长,如何管理这些碎片化、冗余、质量参差不齐的技能?又如何在数十万量级的技能库中,精准检索出当前任务真正需要的技能?这类工程问题长期被学术界忽视,却恰恰是产品能否落地的关键。
第三关是模型权重的训练信号分配,在最底层的模型训练阶段,同策略自我蒸馏(OPSD)是提升推理能力的有效手段,但传统OPSD在处理长序列推理时,会将相同的监督权重均匀分配给每一个生成步骤,完全忽略错误发生的时序上下文,就像长跑时无论在起跑还是终点前摔倒,教练的惩罚都一模一样,这种粗颗粒度的信号分配,严重拖累了模型的学习效率。
EverMind的三篇论文,正是分别瞄准这三道难关,各自给出了严谨的解法。
在实际部署中,模型权重往往是冻结的,修改智能体外围的Harness成为提升性能的最直接手段。EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》一文中,提出了一套全新的框架,能够让智能体自主诊断失败并重写自身的运行逻辑,同时从根本上解决了自我改进中的过拟合问题。
这套框架的核心创新在于将“提出变更”与“归因变更”彻底分离。在过往的研究中,模型往往既当运动员又当裁判,自己编写代码自己评估,极易产生幻觉式的性能提升。而在EverMind的方案中,语言模型只负责诊断失败原因并提出补丁,所有的采样、测量和显著性检验全部交由确定性的代码逻辑来控制,这一设计确保了每一个被系统认可的性能提升,在统计意义上都是绝对可靠的,而非测量误差或随机波动。
更具创新性的是其引入的装备基因库(Harness Gene Bank, HGB)机制,传统的自进化系统往往以“任务”为键存储改进,这极易导致系统仅学会解决特定的几道题目,更换场景后就会原形毕露。EverMind则将每一份高性能脚手架以“WHERE × WHY”作为语义坐标存档,即改动作用在哪个环节、又是为何被引入,并支持通过故障诊断进行“重新发明”,或跨单元进行“机制重组”,防止搜索过程陷入崩溃或原地打转。这种设计引入了强大的抗过拟合归纳偏置——系统学到的不是“如何解决这道题”,而是“如何修复这类病理”。
为了从大量候选后代脚手架中高效挑出真正有效的改进,团队还设计了分级装备筛选机制,用有效性、激活、配对显著性、增益四道顺序闸门层层过滤,兼顾了评估成本与结果的可信度。
实验结果证明了这一设计的有效性:团队默认以Qwen3.6-27B作为任务Agent、Claude Opus 4.8作为进化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七个多样化基准上评测,并与GEPA、DGM两种当前最先进的自进化方法对比。结果显示,在冻结任务Agent权重的情况下,HarnessBank在全部七个基准上取得了5.1%到15.4%的一致性能提升,同时所有增益均通过了配对显著性检验(z≥1.96),证明这些提升在统计意义上绝对可靠,而非测量误差或随机波动。
论文中还有一个极具启发性的发现:跨模型实验证实,这些性能提升来自模型特异性的自进化过程,而非存在某个放之四海而皆准的“万能脚手架”,获胜的补丁追踪的是模型的主导“病理”,而非模型的大小或家族。也就是说,当更换不同的基础模型时,主导病理会改变,对应的最优脚手架也会随之改变,但同样的病理-补丁匹配关系,会在不同的模型家族中重复出现。这意味着,EverMind构建的这套“诊断-归因”循环机制,是一种可以跨模型迁移的元能力,证明了AI for AI的技术可行性。
如果说Harness的自进化赋予了智能体重写逻辑的能力,那么“技能”则是智能体沉淀经验的具体载体。在EverMind的Raven框架中,内置了高达10万项开箱即用的技能,这并非简单的数量堆砌,其背后的工程与科学支撑,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》。
随着开源社区中技能文件的爆发式增长,这些资产呈现出严重的碎片化、冗余和质量不均的问题。EverMind团队构建了一个名为SkillCorpus的框架,首次在规模化层面上对开放技能生态进行了聚合、策展、匹配和评估。这个过程堪称一场浩大的数字淘金:团队从爬取的大约82.1万个原始技能中,通过多阶段多维度策略过滤,最终精选出96401个高质量技能。为了管理这些技能,他们建立了一个包含16个类别的分类法,并从实用性、鲁棒性和安全性三个维度进行了严格的质量控制。
仅仅有技能库还不够,关键在于检索。EverMind配合这个庞大的语料库,微调了一套专门的检索与选择技术栈,确保智能体在执行任务时能够精准匹配到相关的技能。SkillsBench、GDPVal和QwenClawBench三个基准测试中的端到端评估显示,自研的Raven Harness集成SkillCorpus后,智能体在所有基准上均获得了稳定的性能提升,其中在SkillsBench上的提升最大,达到了7.5个百分点。
通过深入的运营分析,团队还识别出了技能带来的增益边界:覆盖边界和Harness边界,这为未来如何进一步优化技能检索和应用指明了方向。这篇论文不仅是对Raven 10万技能库的技术解密,更是业界首个关于“经过策展和检索服务的社区技能库如何在真实Agent任务中发挥作用”的端到端系统性研究。
更进一步,技能并非一入库就固定不变,无论是人工编写的技能,还是AI自动生成的技能,EverOS都能依据任务执行的成败经验对其持续打磨,用得好的被强化、被复用,用得差的被修正、被淘汰。技能库因此不是一份静态清单,而是一个随任务不断自我进化、越用越强的资产,这也正是技能沉淀归属于任务层的原因所在。
自进化的最深层,是模型权重的自我迭代。EverMind的最新论文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》,展示了其在底层算法上的深厚功底。
传统的同策略自我蒸馏(OPSD)存在一个致命的时间盲区:它对所有局部散度分配相同的系数,完全忽略了错误发生的时间顺序和上下文。EverMind的研究团队通过对大量真实推理轨迹的分析,发现了一个关键现象:在一个推理序列中,局部散度值的大小与未来散度的演变之间,存在极弱的关联。这意味着,用同一个系数来处理所有时间步的散度,本质上是在用一把尺子量所有不同形状的错误,必然导致监督信号的严重失真。
为了解决这一问题,EverMind提出了DASH(Divergence-Adaptive Supervision Horizons)。DASH的核心思想是将每个局部蒸馏信号与序列级均值之间的差距,转化为一个自适应的传播门,然后利用这些门控制向后的多步聚合。当一个时间步的局部散度高于序列均值时,说明这里是一个高风险分叉点,DASH会打开一个更大的传播门,让这个时间步的监督信号向前传播更远;反之,传播门收窄,避免无关紧要的步骤干扰整体学习。
实验结果令人印象深刻:在AIME 2024、AIME 2025和HMMT 2025三个极具挑战性的数学推理基准上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三个模型规模上均取得了所有对比方法中的最高分。在Qwen3-1.7B上,DASH将三个基准的平均得分从vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,从65.00提升至66.40。更重要的是,DASH不需要引入任何额外的教师或学生前向传递开销,这意味着这种性能提升几乎是免费的。
在长期记忆领域已经贡献了数篇ACL、KDD等顶会高质量论文,并取得开源库1.8万star后,EverMind将自进化的完整路径概括为一个从任务层到元改进层的四层递进体系。上述三篇论文构成的技术栈,与EverMind内部的产品和研究框架之间,存在着精密的映射关系:
1、任务层:任务层是最直接的进化层次,进化在单次任务中即时发生。优化对象是单次任务的执行质量,既包括记忆的提取与回写,也包括技能的即时沉淀与复用;经验来源是Context、Trace与用户反馈,更新动作是即时回写,验证方式是结果与反馈。这一层的能力复利是“记得更牢、用得更顺、单次任务做得更好”,价值定位是沉淀任务级、可复用的记忆与技能资产,这正是EverOS与SkillCorpus所覆盖的核心场景。
2、脚手架层:脚手架层优化对象是Code与Policy,即智能体外围的运行逻辑与控制策略;经验来源是Eval与Reflection,更新动作是脚手架的版本迭代,验证方式是Agent Evals复盘。这一层的能力复利是“更会执行”,价值定位是可复用行为资产的持续积累,这正是Raven框架与Self-Evolving Harness论文所对应的工作。
3、模型层:模型层优化对象是模型本身,经验来源是高价值轨迹、偏好与失败样本,更新动作是LoRA与端侧模型的验证后灰度,验证方式是离线集加灰度测试。这一层的能力复利是“更准、更省”,价值定位是个性化的专属模型能力,DASH论文正是这一层的核心算法支撑。
4、元改进层:元改进层是整个框架最令人兴奋的顶层,优化对象是Evaluator、Data与Training Recipe本身,经验来源是多轮实验与Benchmark,更新动作是优化“提出—选择—验证”的整个循环,验证方式是版本门槛加评测体系。这一层的能力复利是“下一轮进化更快、更可靠”,价值定位是让改进能力本身也持续升级。
这个四层框架的深刻之处在于,它把自进化拆成了四个层层递进又彼此支撑的环节,并为每一层都配备了具体的技术路径与验证机制,它不是一张空洞的愿景图,而是一个有工程细节、有学术支撑的完整路线图。
其实在今年4月,团队就率先提出了针对Agent自进化的评测基准EvoAgentBench,当月在Hugging Face同类benchmark上下载量第一。这是一套用于衡量智能体从既往执行中提取并迁移能力效果的评测方法,为技能沉淀、脚手架迭代和模型优化提供统一、可比较的验证框架。结合三篇论文从技术、脚手架到模型权重的系统性探索,EverMind已将自进化能力建设由方法研究延伸至评测体系,形成更完整的技术闭环。
要理解EverMind这套完整技术栈的领先性,我们不妨将目光投向海外那些估值令人咋舌的NeoLab。Recursive Superintelligence(RSI)提出了宏大的“自动化AI研究闭环”理念,并拿到了6.5亿美元融资和AWS的4.1亿美元算力合作协议,其第一阶段目标是训练一个具备“5万名博士”能力的系统来自动化AI科学研究本身,但目前仍处于纯研发阶段,尚无成型的产品或框架落地,其公开结果仅限于在GPU内核算法优化基准上超越了人类两年的优化记录。
Engram以6亿美元估值完成了9800万美元A轮融资,其核心技术是基于稀疏记忆模块的参数化权重记忆,在降低推理成本和解决灾难性遗忘方面做出了出色工作,但其路径过于依赖底层权重的更新,缺乏在Agent脚手架和外部技能库层面的灵活进化机制,且需要白盒访问模型权重,这在实际部署中是一个重大限制。Adaption Labs估值10亿美元,主攻无梯度推理时适应,试图通过动态解码和适配器组合来消除微调和提示词工程,这在思路上与EverMind的Harness自进化有相似之处,但Adaption Labs缺乏如SkillCorpus这样庞大且经过策展的外部经验沉淀体系,也没有在底层训练算法上进行深度优化。Core Automation由前OpenAI研究副总裁Jerry Tworek创立,其旗舰项目Ceres专注于持续学习模型,目标是将训练数据需求降低100倍,这是与EverMind方向最为接近的项目,但Core Automation目前仍在早期研发阶段,缺乏EverMind这样完整的技术栈和开源生态。
相比之下,EverMind的独特之处在于其“三层并发”的战略纵深,它没有陷入「参数化记忆」与「非参数化记忆」的非此即彼的争论,而是通过EverOS、Raven和DASH构建了一个全栈生态。更重要的是,EverMind坚持开源优先,通过在GitHub上积累的超过1.2万颗Star,正在迅速建立起类似Android的底层开发者生态护城河。
再往前,EverMind团队相信:
下一代AI,必然是一个能记住用户偏好、越用越聪明的AI。
以长期记忆累积经验,以持续学习改进模型,真正走向AI的全栈自我进化,将是这一代AI最重要的技术路线。
这条路线一旦被打通,无论是数字世界里的Agent、物理世界中的具身机器人,还是整个AI for Science领域,都将被深刻改变。在互联网时代,盛大创新院曾是中国企业内研究文化的先行者,被后来的互联网及各领域巨头纷纷效仿;在AI时代,EverMind也正在成为中国NeoLab浪潮中最具研究深度的代表之一。
仅仅一年间,团队就在长期记忆与自进化领域产出9篇高质量论文,其中数篇被ACL、KDD等顶会录用。这意味着EverMind的自进化不只是一个工程化产品,更有扎实的底层技术与严谨的学术支撑:DASH让模型在训练时“看清自己错在哪里”,Self-Evolving Harness让Agent在运行时安全地重写自身逻辑,SkillCorpus让Agent的成功经验被规模化地沉淀与复用。三者合一,构成了一个从「感知错误」到「修改逻辑」再到「沉淀记忆」的完整自进化闭环。
但这条路,EverMind并不想独自走完,团队诚挚邀请各领域的伙伴与之同行,一起共同构建AI长期记忆的基础设施,把持续学习与自我进化推向科学、具身、金融、智能硬件等更广阔的场景。在定义「数字生命」下一个形态的道路上,中国的研究型团队,已经来了。至于更精彩的部分,才刚刚开始。
HarnessBank论文链接:https://arxiv.org/abs/2607.13683
SkillCorpus论文链接:https://arxiv.org/abs/2607.15557
DASH论文链接:https://arxiv.org/pdf/2608.06243v1

