文章摘要
深圳EvoMap团队将前沿的“AI优化AI(AI4AI)”概念落地,推出核心为“蜂群模式”协作框架的商用产品EvoX。该无中心调度模式解决了传统多智能体的信息交接损耗问题,测试性能远超其他协作模式,团队还推出开源项目AutoResearch,目前EvoX已开放体验,可优化各领域老旧运行系统。

两百万年前,远古人类敲下第一块石器作为工具,从此工具的进化史始终围绕着人类展开:从铁器到蒸汽机,从计算机到大语言模型,工具变得越来越聪明,但始终由人类主导设计与迭代。直到2026年,这个延续了两百万年的逻辑正在发生根本性的转变。

这一年,智能系统开始自主研究和优化自身,这个方向被称为AI4AI,全球前沿的研究者与资源都在向这个领域汇聚。而在深圳,一支年轻的团队已经将这个概念落地成了可商用的产品,他们的方案名为EvoX,背后的团队是EvoMap。

为什么AI优化AI的路径搁置了这么久

从实验室概念到落地产品,中间隔着一道容易被忽略的鸿沟。现实场景中,大量运行多年的旧系统从未被真正重新打磨过:外卖骑手调度、城市导航路权、简历自动筛选,这些早年由工程师反复调试的成果,想要进一步优化需要耗费大量试错成本,还需要领域专家和技术人员长期高强度配合,整体投入高到多数企业不愿承担。于是这些系统年复一年运行,逐渐堆积成难以维护的陈旧代码。

并非没人意识到这个问题,只是过去优化这些系统的成本,长期高于其能带来的收益。而AI4AI正是要改写这个成本结构:让AI自主研究、调整这些旧系统,大幅降低试错成本,加快迭代节奏。这不再是遥远的设想,而是当下就能推进的落地方向。如今剩下的核心问题是,该用怎样的组织方式,让AI能够稳定、可持续地完成这项工作。

蜂群模式:EvoMap给出的协作答案

EvoMap于2025年在深圳成立,团队规模不大但结构紧凑,成员背景互补,走小而精的路线。团队核心成员以95后和00后为主,创始人张昊阳11岁自学编程,14岁就成为国内最年轻的Unity认证开发者。2026年1月,他在候机时用手机完成的插件原型引发大量关注,仅用15天就敲定了数百万美元的天使轮融资。当多数团队还在反复论证方向可行性时,他们已经拿出了第一个可运行的解决方案。

这支团队没有选择打造更强的单体AI模型,而是将切入点放在了最底层的问题上:智能体(Agent)之间应该如何组织协作?EvoX的核心能力,正是被称为“蜂群模式”的协作框架。

常见的多智能体系统大多依赖中心节点统一调度,由中心下发指令,智能体按要求执行,本质上仍是流水线逻辑的延伸。而蜂群模式走了另一条路:没有中心调度节点,所有智能体以平级关系相互连接,根据任务信号自主选择协作对象,灵活组队完成任务。单个智能体的能力并不复杂,但群体层面能够涌现出远超个体的协作智能,用团队自己的话来说就是“一个Agent学会,百万Agent继承”。

这一模式并非停留在概念层面,而是有扎实的实验数据支撑。团队使用同一模型Claude Haiku 4.5,在563道逻辑、数学与物理题目上进行对比测试:单个智能体独立作答时正确率仅为26%;采用多智能体分工协作的Sub-Agent模式时,正确率提升至38%;而在EvoX的蜂群模式下,正确率跃升至70%以上,几乎是单个智能体正确率的三倍。唯一改变的变量,只是智能体之间的组织方式。

信息交接中的隐性损耗

这项测试还有一个反直觉的重要发现:Sub-Agent模式在中间解题过程中其实答对了373道题,但经过后续的汇总、整合与交付环节,最终能够正确输出的结果仅剩下217道,中间丢失了156道题,结果保留率约为55%。

这意味着损耗并没有发生在“解题”环节,而是集中出现在“信息交接”环节:智能体之间的上下文传递,吞掉了接近一半的正确结果。蜂群模式针对这一痛点做出了调整:让每个智能体保留独立的上下文,最终结果通过确定性程序完成汇合,彻底绕开了信息传递过程中的损耗。这个看似细微的工程细节,指向了AI系统的核心瓶颈:真正的限制往往不在于单个模型的能力上限,而在于多个智能体之间的组织、协作与信息传递效率。

把AI优化AI真正做成落地的事

更具说服力的落地成果是开源项目AutoResearch。这个项目围绕“AI自主寻找研究方向”打造,整个流程由蜂群协作完成:不同的智能体分别承担计划、实现、运行、审查四个环节,形成完整的科研闭环。

它针对的正是AI系统长期存在的两大核心问题:幻觉与信息失真。在工程测试中,AutoResearch处理SWE-bench Lite的Django修复任务时,官方新增功能测试从最初的2/7逐步推进至7/7,同时203个回归测试全部保持通过。这意味着单个模型难以独立跑通的科研闭环,在合理的协作机制下,可以由多个智能体共同完成,整个过程可追溯、可验证,且代码已完全开源,绝非停留在演示层面的概念。在这套系统中,失败的尝试不会被简单丢弃,而是作为下一轮优化的输入,进入新的迭代循环。

旧算法的欠账,其实每天都在被偿还

很多运行了多年的旧算法,早已嵌入日常生活的各个角落,你未必能意识到它们的存在,却一直在为它们的停滞付出成本。

比如外卖平台的骑手调度算法,沉淀多年却很少被真正重新优化过,它不会根据当天的天气、单量或实时路况自我调整,只是反复执行最初写下的逻辑。所以午高峰你依然需要长时间等待,下雨天配送时间依然比显示的更晚。问题不在于骑手,而在于调度系统始终没有变聪明。如果让AI持续研究、迭代这套调度逻辑,同样的骑手可以被安排得更合理,减少空驶路程的同时缩短用户的等餐时间,不是平台投入了更多人力,而是人力终于被用在了更合适的地方。

再比如导航软件,很多人都有过这样的经历:导航规划的路线走到一半才发现旁边的道路明显更快。这并非导航损坏,而是背后的路权模型依然沿用着几年前的参数,没有被系统性地重新校准。路况数据每天都在更新,但算法底层的权重却没有随之改变。如果AI能持续分析实时路况数据,自动发现权重偏差并迭代修正,导航给出的路线就不再是统计意义上的最优,而是此刻对你来说最优化的选择。

还有简历筛选环节,很多公司使用的ATS系统筛选简历,本质上还是关键词匹配,简历先经过机器滤网,再送到HR手中。这套筛选逻辑往往已经超过十年没有实质更新,它不理解语义,不关心上下文,只认关键词。结果就是,一个完整负责过大型项目管理、只是没有标注“PMP”证书的候选人,可能在第一轮就被过滤掉;而一个关键词写得漂亮、实际能力存疑的人,反而顺利进入面试环节。招聘方觉得找不到合适的人才,求职者觉得投递简历石沉大海,双方都在为这个从未被优化过的旧算法买单。

这三个场景的核心结构完全一致:旧算法运行多年,因为优化成本过高从未被真正迭代,而AI的出现,第一次让“持续改进”变得可行。这就是“AI优化AI”在普通人生活里最具体的模样。

从工具进化到工具研究自身

凯文·凯利在《失控》中描述过蜂群的本质:没有一只蜜蜂知道整个蜂巢的全貌,但成千上万只蜜蜂各自遵循简单的局部规则,持续交换信息,最终涌现出高度复杂的群体行为。这种智能不属于任何单个个体,而属于整个系统本身。

EvoMap所做的工作,正是将这一逻辑工程化:让大量智能体各司其职,互相继承经验,在没有中心调度的情况下自组织协作,完成单个智能体无法独立完成的任务。没有记忆的蜂群只是临时协作,能够沉淀经验的蜂群,才构成真正的组织。

但这件事的意义远不止于效率提升。它指向一个更深远的变化:人类用两百万年,终于将工具推到了可以研究工具自身的地步。过去,一位博士用五年时间完成的研究,背后是无数次试错、推翻与重建,这些经验大多只留存在研究者的个人判断中,即便写成论文,也是高度压缩后的版本,大量失败的路径被隐去。下一位研究者接手时,往往还要从头再踩一遍相似的坑。如果AI能够将这些试错过程系统性地记录下来,整理成可继承的经验并传递给下一个智能体,让它不必从零开始,那么原本需要五年的研究,有没有可能压缩到一周?省下的四年零五十一周,人类又可以拿来做什么?EvoMap团队希望,答案是去探索更大的问题。

未来的方向

EvoMap的愿景是构建一个“硅基生命社会”:让大量智能体各司其职,互相继承经验,在自组织协作中逐步逼近通用人工智能。这个目标听起来遥远,但EvoX已经开放体验,AutoResearch也已完全开源,实验数据可以查询,代码可以读取,他们交出的不是一个空洞的概念,而是一个可以运行、可以验证的初步答案。

在产品层面,EvoMap选择用蜂群协作的方式,将“AI优化AI”变成普通人能够打开、使用、感知到的工具。很多后来改变世界的工具,最初都只是为解决一个具体问题而生:印刷机最早被用来印刷《圣经》,互联网起步时不过是更高效的通信方式,智能手机刚出现时看起来也只是“更贵的手机”,没有人能在起点就看清全部的未来。EvoMap现在所做的,可能也正处于这样的位置。

一支规模不大、结构紧凑的年轻团队,在深圳将“AI优化AI”从一个方向性判断,做成了一款可以跑起来的产品。故事刚刚开始,边界还远未触及。如果你想看看这个起点具体长什么样,EvoX现在可以下载体验,官网地址是evomap.ai。

以上内容不代表本平台立场,仅供读者参考