文章摘要
人工智能研发进入新阶段,AI4AI理念兴起。某前沿团队发布Aquila - mini和Aquila - pro两款模型,在Deep Search评测中成绩优异。其采用人机协同的闭环研发体系,AI可挖掘新优化方向,从多环节协同改进。Deep Search是首个验证场,未来有望拓展到更多场景。

当前人工智能领域的研发竞争正在进入新的阶段:不再仅比拼单一模型的性能上限,更开始探索如何让AI自身参与到下一代AI系统的研发全流程中。这一方向被称为AI4AI,更进一步的递归自我改进(RSI)理念,也正从理论探讨走向工程实践。前沿科技团队的目标已经从“训练出更强的模型”,拓展到“让模型参与算法发现、代码开发、实验迭代乃至完整系统构建”。

近期,某前沿AI研发团队正式发布了两款Deep Search专用Agent模型:350亿参数的Aquila-mini与3970亿参数的Aquila-pro,两款产品在多项Deep Search公开评测中刷新了当前最优成绩。相比传统研发中仅针对单点细节的优化,这两款模型背后是一套完整的AI4AI研发范式探索——让AI不再仅仅是被训练和改进的对象,而是成为驱动完整Agent系统研发闭环的核心力量。

这类研发思路已经在行业内落地:Google DeepMind的AlphaEvolve已被用于数据中心效率优化、芯片设计与AI训练流程改进;Anthropic在2026年5月披露,其代码库中超过80%的新合入代码由Claude生成;OpenAI在GPT-5.6的发布中,将研究调试、Kernel优化、训练循环改进等任务纳入RSI Index,用于衡量模型参与AI研发的能力;Kimi K3在研发后期,其早期版本也承担了团队大部分GPU Kernel优化工作。AI正在从“被研发的对象”,逐步转变为研发流程中的执行者、实验者与改进者。

不过,从“辅助研发”到“持续改进完整AI系统”仍存在不小的鸿沟。AI可以修改代码,但很难在数据、训练、工具、上下文、评测与基础设施彼此耦合的复杂环境中,持续找到有效的改进路径,更难以保证这些改进可以被验证、复现并沉淀为可复用的经验。该团队本次尝试验证的,是在目标、权限、资源与验收规则均由人类定义的前提下,AI能否持续参与完整Agent系统的研发与迭代。

仅用十余人的核心团队,该团队在两个月内借助千卡级等效算力,协同调度超过300个Agent工作单元,将任务构造、模型训练、运行时优化与评测验证整合进同一套研发系统,实现了AI驱动任务生成、实验执行与反馈迭代的完整闭环。相比算力规模与Agent数量,该团队真正要解决的核心问题,是如何将大规模计算资源、多Agent协作与全流程研发环节整合为可验证、可复现且能持续沉淀经验的研发能力。

  • 完整技术报告可通过公开渠道获取
  • 更多相关信息可查阅对应团队的公开研发资料

为何选择Deep Search作为验证场

Deep Search是检验AI4AI研发体系的绝佳高压试验场。一次完整的深度搜索需要经历问题拆解、网页检索、来源判断、跨页面比对、计算核验与最终作答等多个环节,任何一个步骤出现偏差都可能影响最终结果:网页可能失效、搜索结果可能跑偏、来源信息可能存在冲突,关键证据也可能在长流程中被折叠或淹没。即使最终答案碰巧正确,也不代表中间的推理过程可靠。

在Deep Search场景中,模型只是系统的一部分。任务构造逻辑、搜索与抓取工具的返回逻辑、Python环境的状态维护、上下文整理时机、答案生成与提交的路由规则、评测环境与研发流程的隔离策略,都会影响系统的运行轨迹。某一项改动在单个模块中看似有效,更换工具接口或上下文策略后可能立刻失效。

因此Deep Search同时承担了双重角色:既是检验Aquila系列模型最终能力的应用场景,也是对AI4AI系统设计能力的压力测试。真正完成一次深度搜索任务,并非仅返回十条链接,而是要走完“查—读—算—验”的完整长链路,确保找到的关键证据被正确写入最终答案。

本次评测成绩的核心看点

Aquila系列的完整评测数据集包含BrowseComp、BrowseComp-ZH、DeepSearchQA、GAIA、LiveBrowseComp、Humanity's Last Exam (HLE)与WideSearch共七项基准测试,本次展示的六项横向对比数据来自公开评测报告。

与同规模的其他系统相比,350亿参数的Aquila-mini在全部七项基准测试中均取得了最优结果:BrowseComp 78.8、BrowseComp-ZH 82.9、DeepSearchQA 89.5、GAIA 97.1、LiveBrowseComp 48.7、HLE 51.1以及WideSearch 80.8。其优势不仅覆盖单一题型,更延伸至中英文网页检索、时效信息获取、深度信息检索与宽域信息收集等多个场景。

3970亿参数的Aquila-pro在部分评测集上与Claude Opus、GPT等大型闭源模型仍存在一定差距,但仍在BrowseComp-ZH、LiveBrowseComp与WideSearch三项基准测试中取得了当前公开报告中的最高分数,在DeepSearchQA上的成绩也与1TB版本的Kimi-K2.6持平。

需要明确的是,当前的优异成绩并非仅来自模型本身,而是模型、数据、训练方法、工具调用策略、上下文管理、运行时优化、评测体系与基础设施共同组成的完整系统所带来的竞争力。

研发体系的核心逻辑:人机协同的闭环研发

这些优异成绩背后,是一套将大规模探索交给AI、同时将规则制定与最终判断保留给人类的研发系统。该团队将这套体系的运行原则概括为:“人定规则,AI找路;独立评测,全程留痕”。

人类首先定义研发目标、评测标准、资源预算与风险边界。在此基础上,调度Agent将复杂问题拆解为一系列可执行、可验证、可追踪的子任务,再交由不同的Agent工作单元分析失败轨迹、提出候选改进方案、修改代码或数据并运行实验。

实验完成后,候选改动不会直接进入下一轮研发或发布配置,而是先由独立评测器生成可核验的评测证据,再由门控机制按照预设标准决定接受、拒绝该改动,或升级至人类审查。整个流程中,每一次实验的方案、过程、结果与判断依据都会被完整记录。

这些记录会被写入共享记忆库:有效的改进会沉淀为后续任务可检索复用的经验,失败的尝试也不会被简单丢弃,其失败原因与适用边界同样会被保留,帮助系统减少重复探索,让每一轮实验都建立在过往经验之上。

这套机制将大规模搜索与实验执行交给AI,但并未将规则制定与最终决策权交给AI。Agent可以在明确授权的范围内自主推进任务,但不能修改评测标准、读取私有答案,也不能自行批准自身的方案。当系统出现证据冲突、疑似数据泄漏、高风险改动或权限越界时,系统会暂停自动推进,并将任务升级至人类审查。

因此,300余个Agent工作单元并非300个独立决策的“数字研究员”,而是由统一系统编排、各自承担特定任务的执行单元。人类负责确定方向、设定边界与做出关键判断,Agent则负责问题拆解、方案探索、实验执行、结果汇报与经验整理。通过这套分工,十余名研究人员无需逐一跟进每一次实验,就能将数百个Agent与千卡级算力组织为一轮轮可验证、可复现且能持续积累的系统性改进。

AI不仅执行实验,还能挖掘新的优化方向

这套系统的价值不仅在于替人类执行更多实验,更在于从大量失败轨迹中识别人类未曾预设的改进方向。我们可以通过一个具体案例了解这套机制的运行逻辑。

团队在复盘长程搜索任务时发现,部分Agent明明已经找到关键网页并留下了引用,但最终却没有将最重要的信息写入答案。问题并非总是“未检索到有效信息”,而是在作答阶段,Agent已经无法看到或正确使用此前找到的证据:信息可能被折叠进过长的上下文窗口,也可能被大量中间过程淹没。

基于运行轨迹、上下文变化与最终提交结果之间的关联分析,AI4AI系统提出了两个候选改进方向:第一,不等上下文接近上限才被动压缩,而是在状态仍然清晰时让模型主动整理上下文,保留已确认的证据、关键结论、未决问题与下一步计划;第二,为Agent增加持续维护的“研究记事本”,将候选答案、来源关系与中间结论写入独立工作区,再反复回看与交叉验证。

这两个改进方向并非人类团队预先拟定的工程清单,而是AI从海量实验轨迹中自主发现的优化路径。团队随后完成了候选方案的实现与独立评测,检查证据是否真正被保留、最终答案是否正确使用了这些信息,以及是否引入了额外的成本或副作用。最终,主动上下文整理及配套的可回放上下文策略被纳入当前系统,“研究记事本”则作为带状态的候选设计与过程经验继续保留。

这一案例证明的不仅是自动化提升了实验吞吐量,更重要的是AI开始拓展团队能够探索的解空间:它能从海量实验轨迹与失败模式中发现超出人类预设候选范围的新方案,再将这些方案送入同一套评测与验收流程。

从单点优化到全系统协同改进

主动上下文整理只是AI4AI优化循环的一个切入点。沿着失败轨迹继续追溯,问题往往并不局限于单个具体答案,而是会暴露在任务设计、训练过程、工具交互、运行时状态与强化学习策略等多个环节。该团队的AI4AI研发并非围绕单个检查点进行局部调参,而是在一组彼此耦合的系统设计维度中寻找可验证的改进。

任务构造:让题目考察搜索能力而非记忆能力
系统从可靠来源构建证据图,通过链接、引用、共享实体与时间关系连接网页,再生成问题、答案、支持路径与约束条件。只有满足“固定工具环境下可检索、答案唯一、来源链可靠、无明显查询捷径”的任务,才会被纳入训练或内部评测集合。

训练:只学习Agent当时真正看见的世界
一条成功的搜索轨迹可能同时包含网页超时、格式错误、无效重复尝试与后续恢复过程。系统因此保留完整审计日志与每一步的可见状态,训练时重建模型当时实际可获取的信息,仅监督有效推理、工具调用与最终作答。这套方法被称为状态对齐的监督微调(state-faithful SFT)。

运行时:将错误定位到具体环节
Aquila系列模型通过统一接口调用搜索、抓取与Python工具。系统通过只增不改的审计日志与逐步可见状态,让团队能够区分不同类型的问题:是证据从未被找到,还是证据已存在但未被正确呈现,或是Agent已获取证据却未能将其用于最终回答。

强化学习:从局部奖励走向长程决策
对于Deep Search这类长程任务,真正重要的并非模型能否完成单次搜索,而是能否在多轮环境交互中持续做出合理决策,并维护一条可靠的证据链。强化学习是团队探索这一能力的核心工具。在AI4AI流程中,团队先用低成本筛选快速识别有潜力的训练策略,再将完整的RL训练与端到端评估投入到证据更充分的方向上。当前的探索包括利用过程奖励改善长程任务中的信用分配,以及在上下文管理机制下通过复用共享前缀提升训练效率。这些机制帮助团队更高效地研究长程搜索能力,同时让每一轮实验结果都能反馈到下一轮系统优化中。

Deep Search并非研发终点

对于该研发团队而言,Deep Search只是AI4AI研发体系的第一个公开验证场。它兼具足够的复杂性与可观测性:一方面能够暴露数据构造、训练方法、工具使用、上下文管理与运行时决策之间的系统耦合问题;另一方面每一次探索都会留下可回放、可验证、可审计的完整轨迹。

基于AI4AI范式研发的Aquila系列模型想要证明的,并非复杂Agent的研发难度凭空消失,而是这种复杂性可以被重新组织:AI承担高吞吐的探索、执行与经验整理工作,人类则将注意力集中在目标设定、边界划分与关键判断上;算力的价值也不再仅用于生成更多实验,而是被组织为更多可验证、可拒绝、可积累的研发循环。

从更长远的视角来看,RSI(递归自我改进)讨论的是AI能否参与构建更强的AI系统,而Aquila系列展示了这一方向在当前阶段的可验证实现:AI可以驱动AI研发闭环,帮助探索新的改进路径,但仍必须在明确规则与独立验证机制下运行。它不能自行修改评测标准、访问受限信息,也不能批准自身进入发布流程。

Deep Search上取得的多项领先成绩,是这套AI4AI研发体系目前最直接的外部验证,也是该团队面向下一阶段探索提交的第一份公开答卷。未来,这套研发方法有望进一步扩展到代码生成Agent、通用多工具Agent,以及法律、医学、科研与企业工作流等更广泛的场景。尽管任务形式会发生变化,但底层的研发闭环将保持一致:提出候选方案、执行实验、独立验证结果、沉淀经验,并将经过验证的改进带入下一轮探索。

以上内容不代表本平台立场,仅供读者参考