文章摘要
近日发布两款面向深度搜索场景的AI Agent系统,采用AI4AI模式,让AI深度参与研发。系统在对应参数量区间表现突出,完成三类改造。研发中还解决了找到答案却未提交等问题,强调人机协作。未来将拓展应用场景,同时需警惕四类风险,目标是构建稳定制造更强AI Agent的系统。

近日,两款面向深度搜索场景的AI Agent系统正式发布,它们在多项权威评测中取得领先成绩。这套系统的独特之处在于,研发团队采用了AI4AI的模式——让AI不仅是最终的产品,更是参与研发的核心力量,从发现问题到提出改进方案都深度参与其中。

打破AI研发天花板:AI自主参与的深度搜索系统

本次发布的两款系统分别为小型和标准版,在对应的参数量区间表现突出:小型版本在参数量低于400亿的开放权重对比组中,七项指标位居第一;标准版则在参数量低于4000亿的组别中六项指标领先。不同于单次搜索即可完成的任务,深度搜索Agent需要围绕问题进行多轮网页检索、信息抽取、证据核验,一条任务轨迹可能长达数十甚至上百步,因此对系统的规划能力和工具调用效率要求极高。

什么是AI4AI?它和递归自我改进有何区别?

AI4AI的核心并非简单让AI帮忙写代码、跑实验,而是让AI真正进入研发闭环和决策环节。传统的编码Agent通常只负责执行预先定义好的任务,而AI4AI流程中,AI会读取评测结果、失败轨迹,分析问题可能出在数据、训练、工具还是上下文,提出有明确范围和验收条件的改进方案,并通过实验验证效果,最终将经验带入下一轮研发。

很多人会将AI4AI与AutoML混淆,但二者的优化对象完全不同:AutoML通常在任务、数据和模型框架基本确定的前提下,搜索架构、超参数或训练配置,解决的是局部优化问题;而AI4AI面向的是完整AI系统的研发,不仅可以调整模型权重,还能修改数据生成方式、训练策略、工具定义甚至评测体系,更重要的是它能自主判断“应该改动哪一层”,完成从问题归因到方案选择的全流程决策。

至于与递归式自我改进(RSI)的区别,AI4AI更像是一组方法和能力,让AI参与AI系统的研究、开发、评测和经验积累;而RSI是更强的递归状态——AI不仅能参与研发,还能自主设计和开发更强的后继系统,且新系统能显著提升下一轮的研发能力,形成跨代复利。当前的Aquila还属于有边界的系统级递归改进,人类仍然控制着目标、评测、权限和最终发布权,尚未完成完整的RSI闭环。

AI4AI如何主导深度搜索Agent的后训练?

深度搜索任务的失败原因往往复杂多样:可能是训练数据存在捷径,监督信号使用了模型未看到的证据,网页抽取丢失信息,或是上下文压缩删除了关键内容,甚至模型已经找到正确答案却未在最终提交时使用。AI4AI的作用就是将这些问题纳入统一的研发循环,从运行结果和失败轨迹中定位问题,形成可落地的改进方案,再通过隔离评测和人工审核决定是否纳入发布系统。

本次发布的系统主要完成了三类改造:

  • 图谱驱动的数据构造:摒弃普通问答数据,从连通的证据图中构建任务,网页和证据单元作为节点,引用、链接等关系作为可追溯的连接,同时验证证据在真实工具环境中的可达性,确保训练数据能让模型学会真正的搜索、消歧和证据核验,而非记忆数据集捷径。
  • 状态一致性SFT:深度搜索的运行轨迹可能长达上百步,模型在每个决策点看到的内容可能经过折叠或压缩。传统训练直接使用完整日志会要求模型根据未看到的信息做决策,因此系统为每个训练决策重建模型当时真正可见的状态,让监督信号忠实于模型实际接收的信息。
  • 运行框架改进:优化了网页处理、上下文渲染、状态保存和回放机制,保留完整审计日志和每个决策点的可见状态,能够准确判断证据是未被找到、未进入上下文还是模型未正确使用,为失败诊断和方案验证提供可靠依据。

团队还探索了答案条件的强化学习方案,通过比较模型在有无参考答案辅助时的策略分布差异,判断哪些步骤真正影响最终结果,但该方案尚未完成完整训练和门控评测,未纳入本次发布配置。

一个反直觉的失败案例:找到答案却未提交

研发过程中遇到一类反直觉的失败:Agent在中间步骤已经找到关键网页并抽取了正确事实,但最终答案中并未使用。这类问题仅看最终得分和普通的“未找到答案”并无区别,但展开轨迹后会发现原因各异:可能是证据在上下文压缩时被删除,或是工具响应折叠后未重新进入模型视野,或是模型在停止策略和答案提交环节出现偏差。

针对这类问题,AI优化Agent读取多组失败轨迹,沿着“证据何时进入上下文、何时消失、为何未被提交”的链路寻找模式,没有停留在“换更强模型”或“增加搜索次数”的常规思路,而是将问题重新定义为长程任务的状态管理,并提出两个创新方向:

  • 主动上下文压缩:不等上下文逼近上限才被动压缩,而是在任务状态清晰时主动整理已确认事实、关键来源、未决问题和下一步计划。
  • 独立研究记事本:将候选答案、证据链和关键中间结论存入独立可检索的工作区,需要时再读入主上下文。

这两个方案都通过了端到端测试和人工验收,成为当前系统的重要组成部分,其适用条件、资源开销和潜在副作用也被写入共享经验,供后续迭代使用。

人机协作:人类不该只做“盖章”

当AI能够参与提出方案和组织实验时,人类的角色反而更加关键,且是最难被自动化的部分:

  • 定界:定义任务目标、优先级、资源配额、权限范围、风险边界和验收标准。
  • 处理歧义:当证据矛盾、评测异常、疑似数据泄漏或需要调整任务定义时,AI需要将问题升级给人类判断。
  • 发布决策:即使候选改动提升了评测分数,也要判断其代表的是可迁移能力还是评测规则的投机。
  • 复盘沉淀:将失败原因、评审意见和新的边界要求转化为下一轮可复用的规范。

支撑这种分工的是带持久记忆的协作工作台,系统需要同时维护任务状态、权限、资源配额、工件版本和审计链,确保每一次贡献都可追溯。当大量Agent同时工作时,这种基础设施能避免出现大量零散的聊天记录和无法复用的实验数据,让团队能够高效并行探索同时保持证据纪律。

未来方向:从深度搜索到更广阔的场景

选择深度搜索作为AI4AI的首个落地场景,是因为它是绝佳的系统级试验场:既有动态网页环境,又有明确的答案与证据,既要求长程规划,又需要工具调用、来源核验和失败恢复,能够倒逼研发流程完成跨组件的问题归因。

接下来团队将把这套方法扩展到更多场景:首先是代码智能Agent,代码、测试错误、运行日志、Code Review和线上事故复盘都可以成为研发证据,系统可以据此调整提示、工具路由、测试策略或模型;其次是通用和专业Agent,通用Agent需要在多工具、跨领域任务中积累规划和失败恢复经验,专业Agent则需要学习本地文档、工作流约束和领域工具,同时将数据访问、隐私和人工门禁写入契约。

需要警惕的风险与最终目标

当前AI4AI研发需要警惕四类风险:一是指标投机,系统学会提升分数却未提升可迁移能力;二是记忆污染,错误结论被反复引用成为默认常识;三是验证失速,候选方案增长速度超过评测和人工审核能力;四是探索收敛,大量Agent共享模型和经验后重复相似假设。此外,长程轨迹、隔离评测、回放和完整审计的成本较高,AI4AI并非“自动化后成本归零”,而是需要重新分配研发资源到更多探索和更强验证中。

团队的最终目标并非让AI偶尔提出一个好点子,而是构建一套能稳定制造更强AI Agent的AI4AI系统:每一轮研发都留下可复用的知识,让下一轮的研究更快、更广、更可靠。当AI真正进入研发判断环节,Agent后训练的核心问题不再只是“SFT还是RL”,而是如何让AI和人类共同管理复杂系统的改进。

SOTA只是一次结果,能否持续制造更强的AI Agent,才是这场AI4AI竞赛真正漫长的部分。

以上内容不代表本平台立场,仅供读者参考