文章摘要
Anthropic近期公开AI递归自我改进(RSI)的内部落地框架,同期发布梳理1250篇相关论文的RSI领域全景综述,指出该领域研究呈指数增长。Anthropic提出六级研发自动化量化标准,截至2026年8月,Claude主导完成26%的AI研发,该占比半年内从1%飙升至26%,整体自动化研发占比超90%,同时建成三万AI代理的双层监控体系,指出可靠评估体系是RSI发展的核心关键。

近期,AI领域的递归自我改进(RSI)赛道迎来了行业头部玩家的公开方法论分享,某AI公司发布长文详细拆解了内部RSI落地的核心框架,包括研发自动化指数的构建、AI主导研发的占比情况,以及针对数万个人工智能代理的监督体系。

要理解这份公开的RSI实践文档,不能不提同期发布的一篇重量级行业综述:该综述系统梳理了2024至2026年间的1250篇相关论文,是目前为止对递归自我改进领域最完整的一次全景测绘。最直观的观察是,这个领域的扩张速度本身就呈现指数级增长——仅2026年第二季度,相关学术平台收录的RSI相关论文就达到了501篇。

研发自动化的六级量化标准

该AI公司构建了「研发自动化指数」,采用了行业通用的六级自动化量表:

  • AL0至AL2:无AI/极少AI/AI辅助,核心研发工作仍由人类主导
  • AL3:AI协作模式,人类全程密切指导,遇到关键决策时AI会暂停等待人类介入
  • AL4:AI主导模式,AI可以从高层提示出发端到端完成研发任务,人类仅负责最终监督,比如审查报告、决定是否部署成果
  • AL5:完全自主模式,AI可以自行监控、修复并完成全流程研发,全程无需人类介入,目前尚未有研发子集达到这一等级

Claude主导的研发占比:半年内从1%跃升至26%

截至2026年8月的核心统计数据显示:没有任何研发团队实现了完全自主的AL5等级;Claude以AI主导模式(AL4)完成了26%的AI研发工作;而AI协作及以上的自动化研发占比已经超过了90%。

更值得关注的是这一数据的增长斜率:2026年3月,AI主导的研发占比仅为1%,4月升至3%,5月达到12%,7月跃升至22%,到8月已经达到26%——短短半年时间,该占比从几乎为零飙升至四分之一,整体研发自动化等级呈现向上迁移的趋势。

递归自我改进的核心分界:有界与开放式

这份行业综述还对「自我改进」的核心维度进行了详细拆解:一方面要看系统改进的对象,包括部署行为、训练权重、评估体系以及研发流程本身;另一方面要看验证的主体,从人类全程在环监督,到人类仅在环上做最终审核,再到完全闭环的自动化验证。

基于这两个维度,该领域可以被划分为两大核心类别:一是有界自我改进,这类改进针对固定的外部标准,具备可收敛的特性,已经成为当前的工业实践;二是开放式递归自我改进,也就是我们所说的RSI,这类改进甚至可以改写改进自身的标准,原则上存在无限发散的可能。

在1250篇被梳理的论文中,绝大多数研究都集中在「人类在环上」的验证模式中,也就是当前文献的主流方向。

根据改进对象的不同,1250篇论文可以分为四大技术类别,具体分布如下:

技术类别 改进方向 论文数量 2026年发表占比
部署时自我演化 输出、测试时权重、脚手架/技能 393 74%
训练时自我迭代 自奖励RL、自蒸馏、自博弈 340 69%
自我评估 裁判、过程奖励模型、验证器 318 82%
自动研究 AI科学家、演化式程序发现 139 76%

其中,自我评估是2026年新增最快的研究方向,这也印证了行业对AI自主验证能力的重视。

结合该AI公司的内部实践来看,他们的AL4模式属于典型的「人类在环上」的研发流程:改进信号由AI自动生成,最终由人类进行审计把关。该公司的内部统计也印证了这一现状:截至2026年5月,Claude已经撰写了该公司超过80%的合入代码,研发执行环节已经实现了高度自动化,但真正的瓶颈卡在「研究方向设定」——也就是选择什么问题值得投入研发,这部分人类的判断能力目前仍无法被自动化替代,这也解释了为何AL5等级的完全自主研发尚未实现。

三万个人工智能代理的监控体系

该AI公司的研发团队已经越来越依赖可以长时间半自主工作、并且能够互相委派任务的人工智能代理。目前单个代理出现失当行为的情况仍然罕见,但当代理规模达到百万甚至十亿级时,原本的罕见事件就会常态化。

为此,该公司定义了三个核心监控指标:覆盖率,也就是行为经过监控的比例;审查延迟,也就是从行为发生到完成复核的时间间隔;升级率,也就是被拦截或标记为异常的行为比例。

该公司的人工智能代理双层监控体系具体如下:

在线监控器 离线监控器
职责 实时检查并拦截危险动作,主要针对快速且不可逆的风险,比如拷贝模型权重导出系统 事后审查活动记录,针对缓慢可逆的风险,比如模型精度失准的迹象,对于最高危的情形会直接关停相关部署
覆盖率 100%的行为在执行前经过监控,通常审查延迟在数秒内 100%的行为在事后被完整收录
审查延迟 行动前自动完成审查,被拦截的行为会在一周内交由人工复核 每周标记约10万条活动记录,经过分类器初筛后,约50条记录会升级为人工审查
拦截/升级率 2026年8月,超过10亿次决策中仅有0.002%被拦截,大约每47000次决策中会出现1次异常 每1000份活动记录中,会被标记1到2份异常样本

截至2026年8月,该公司最常用的内部研发平台上,任意时刻都有约3万个人工智能代理在从事研发工作,所有代理的行为都受到这套双层监控体系的覆盖。

监督的核心:验证层级与裁判的质量天花板

为什么「裁判」的可靠性对于RSI体系如此关键?这份行业综述给出了清晰的理论框架:它将自我评估单列为与部署、训练、自动研究并列的第四大类研究方向,共有318篇相关论文,也是2026年新增最快的方向。其核心逻辑在于:每一条自我改进的环路,本质上都是「某个信号可以替代人类判断」的声明,而整个环路的性能天花板,就取决于这个替代信号的质量。

该综述将评估信号按照验证层级进行了排序,越往上的信号可靠性越强,但覆盖范围越窄;越往下的信号成本越低,但越容易被钻空子。从高到低的层级分别是:形式化验证器、执行反馈、学习型裁判、内在信号。而「人类研究判断」是目前AI尚无法攀爬的最高层级。

典型的成功案例比如FunSearch、AlphaEvolve,正是因为它们站在了验证层级的顶端,程序的执行结果可以被直接检验,具备明确的客观标准;而当前的「AI科学家」系统之所以产出的论文难以被审计,正是因为它们在用第三层的学习型裁判工具,去解决第四层的人类研究判断问题,也就是所谓的研究品味选择。

该AI公司的自动化评级体系中,Claude正是在扮演「学习型裁判」的角色,用自身来评估自身的研发成果,这也就是综述中提到的「自我确认循环」:当生成器与评估器共享权重时,高置信度的错误会被系统性地过度奖励,这种模式甚至不需要外部攻击者,就可以自发产生错误的奖励信号。该公司在方法附录中提到,模型与人类评级的一致率为59%,而人类彼此之间的评级一致率仅为35%,通过这样的校验设计来对冲自我确认循环的风险,这也相当于在向验证层级的上方攀爬。

整体来看,递归自我改进的赛道才刚刚起步,相关技术正在持续推动研发自动化的进程,而如何构建可靠的评估体系,将是决定未来AI自主研发能力的核心关键。

相关参考资料:Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops、https://arxiv.org/pdf/2607.07663

以上内容不代表本平台立场,仅供读者参考