文章摘要
文章围绕智能体落地展开探讨。当前智能体经验难共享,该团队提出将经验提炼为可流通资产。研究针对主Agent模式瓶颈开展实验,对比不同模式解题正确率,揭示传统模式信息传递损耗问题。还探讨智能体自组织协作,发现信息展示影响其组织形态,未来行业突破或在经验传播与动态协作。

近期连续读到两篇极具行业参考价值的AI领域文章,其中一篇关于智能体(Agent)执行层实践的思考尤为亮眼,彻底刷新了我对当前多智能体系统的认知。不同于市面上多数聚焦大模型能力升级的讨论,这篇文章的核心在于解决智能体落地中的核心痛点:如何让智能体积累的经验真正实现跨主体共享。

值得一提的是,该团队的核心技术方案曾在业内引发关注,此前有热门智能体产品被曝抄袭其自进化逻辑与代码实现,两者的核心设计高度相似。

当前的大模型能力已经有了长足进步,但每一个新启动的智能体几乎都是从零开始的“新生儿”。当相关产品在今年三月走红时,行业内戏称其为“养虾”——因为每一个新的智能体都需要从头开始“培养”,在执行任务的过程中反复踩坑、试错,最终积累的正确经验却只能停留在当前会话或者单个智能体的记忆中,无法传递给其他智能体。

举个常见的例子:一个智能体在调用外部API时,可能需要花费半小时查阅文档、调整参数,经过多次失败后才找到正确的调用方式。对这个智能体而言,它已经掌握了这套流程,但如果换一个全新的智能体处理相同任务,还是要重复同样的试错过程,无法复用前者积累的经验。

为了解决这个问题,行业内普遍的做法是将通用流程封装为Skill,让智能体可以反复调用。但Skill本质上更像是提前编写好的操作手册,它无法解决智能体在实际工作中临时积累的个性化经验如何快速传递给其他智能体的问题。

该团队的核心思路,是将智能体运行过程中积累的有效经验提炼为类似“基因”的可流通资产。当一个智能体找到问题的解决方案后,可以将其提炼、验证后上传至共享网络,后续其他智能体遇到同类问题时,可以直接继承这段经验,无需再从头摸索。

这意味着智能体不再只是反复调用固定模型的工具,它们在工作中积累的经验会逐渐成为整个系统的公共资产。沿着这个思路延伸,自然就会走向多智能体协作,也就是所谓的“智能体蜂群”。之所以用“基因”来比喻,是因为生命的进化本身就依赖基因的传播,让群体的优势可以代代延续。

我们常将AI比作人类,但两者存在两个核心差异:其一,人类可以持续学习,经历一次失败后下次会做得更好;正如行业专家所指出的,下一代AI的核心能力之一就是自主持续学习,当智能体能够跨过自我迭代的奇点,通用智能的发展将会加速。其二,人类的进化不会随着个体死亡而中断,群体经过漫长时间积累的生存能力可以通过基因传递下去。对于智能体而言,持续学习需要依赖模型层面的优化,而群体经验的传承则需要从智能体的设计层面入手。就像某些科幻作品中的虫族,单个个体未必最强,但每个个体获得的信息都可以回传到共享网络,整个种群不断调整适应环境,最终变得越来越强大。如果智能体也能拥有这种能力,将是行业的重要突破。

主Agent模式的天然瓶颈

当前主流的多智能体协作模式,大多采用“主Agent调度Sub-Agent”的架构:主Agent负责理解整体目标、拆解任务、分配工作,Sub-Agent分头执行任务后返回结果,最终由主Agent汇总所有结果形成完整输出。这种模式看起来和现实中的公司组织架构类似,逻辑上很合理,但当任务复杂度提升时,主Agent很容易成为整个系统的瓶颈。

主Agent需要同时掌握完整的任务目标和所有子任务的进度,还要逐一阅读每个Sub-Agent返回的材料,判断信息的有效性和结果的可靠性,最后重新组织整理输出。随着Sub-Agent数量的增加,主Agent需要处理的上下文长度会急剧增长,前面已经完成的结果在一轮轮汇报、压缩和转述的过程中,很容易被遗漏甚至被错误理解。

该团队的研究正是针对这一痛点,探讨了两个更底层的问题:

1. 目前主流的主Agent加Sub-Agent架构,是否已经是最优解?是否可以将任务拆解得更彻底,让每个智能体只负责边界明确的子任务,最后通过更可靠的方式拼接结果?

2. 如果不提前预设主Agent统筹、Sub-Agent执行的固定分工,仅提供一群能力相近的智能体,它们能否在执行过程中自主发现各自擅长的方向,逐渐形成稳定的分工协作关系?

同一模型,从26%到71%的正确率跃升

研究团队开展了第一组对照实验,共使用563道涵盖逻辑题、普通数学题、竞赛数学题和物理题的题目,所有实验均使用同一模型,仅调整智能体的组织和执行方式,设置了三组不同的方案:

1. 单智能体模式:由单个智能体在同一个上下文环境中完成所有题目;

2. 传统Sub-Agent模式:主Agent拆解任务并分配给Sub-Agent,Sub-Agent完成后返回报告,由主Agent汇总结果;

3. 蜂群模式:将任务拆分为原子级别的子任务,每道题分配给独立的智能体,每个智能体仅处理自己负责的题目,完成后将答案写入预设的固定位置,最终由程序按照题号直接收集所有答案,无需再经过大模型二次整理。

实验结果的差距超出预期:单智能体模式的正确率仅为26.29%,传统Sub-Agent模式的正确率为38.54%,而蜂群模式的正确率达到了70.69%至70.87%。仅仅通过调整智能体的组织和执行方式,同一模型的解题正确率就从26%提升到了接近71%。

很多人可能会认为蜂群模式效果更好是因为启动了更多智能体,消耗了更多Token,但实际上传统Sub-Agent模式同样启动了大量Sub-Agent,Token消耗并不低,但最终正确率依然远低于蜂群模式。这说明蜂群模式的核心并不在于智能体的数量,而在于任务拆分的方式、执行过程的隔离机制以及最终结果的汇合逻辑。

1. **任务拆分足够精细**:每个智能体只需要处理边界清晰的单个问题,无需同时兼顾多个目标或频繁切换任务,既方便追踪,也降低了单次任务的复杂度;

2. **独立上下文隔离**:每个智能体仅拥有自己负责任务的上下文,无需记忆整个任务的全部过程,避免了长上下文带来的信息干扰和推理偏差;

3. **程序式结果汇总**:不再让大模型对Sub-Agent的结果进行二次整理,而是由程序按照固定规则收集和合并结果,避免了自然语言转述带来的信息损耗。

多Agent系统的损耗到底藏在哪里?

研究团队进一步分析了传统Sub-Agent模式的中间结果,发现了一个反直觉的现象:在563道题目中,Sub-Agent在执行过程中其实已经答对了373道题,但经过报告传递和主Agent的最终汇总后,最终交付的正确答案仅剩下217道,有166道题明明在中间环节已经答对,最终却变成了错误答案或者直接丢失,正确答案的保留率仅为55.5%。

这一发现说明,多智能体系统的失败并不只发生在执行阶段,更多的问题出在后续的信息传递和结果汇总环节。这个过程就像传话游戏:Sub-Agent先完成任务并整理成报告,主Agent阅读报告后需要重新理解内容,再压缩整理为最终结果,每多一层自然语言的转述,就多一次信息损失的可能。原始答案可能无法被完整提取,格式可能发生变化,前面的正确内容也可能被后面的错误信息覆盖。

蜂群模式的思路非常朴素:既然题目已经被正确解答,就不需要再让另一个大模型去阅读、理解并转述这些结果,让智能体专心处理需要推理的任务,答案由程序按照固定规则收集拼接,不做任何二次加工。这种设计避开了大模型转述带来的信息损耗,最大化保留了每个智能体的执行成果。

这也提醒我们,在设计智能体工作流时,很容易陷入“凡事都交给大模型”的误区:让大模型拆解任务、让大模型执行任务、让大模型汇报结果,再让另一个大模型汇总结果。但实际上,很多有明确规则的环节,比如检查任务是否遗漏、结果是否重复、输出格式是否正确、任务是否超时等,交给传统程序处理会更加可靠。大模型更适合处理模糊和不确定的问题,而代码的确定性和稳定性则要高得多。一个高效的智能体蜂群,既需要足够的自由度让每个智能体发挥能力,也需要一套稳定的底层协议来保证所有局部结果最终可以拼接成完整的交付物。

智能体的自组织协作

很多人会有疑问:前面的实验都是提前设定了任务分工和结果收集规则,那对于更复杂的任务,比如产品开发这种需要动态调整分工的场景,这种模式是否适用?分工本身可能无法提前定死,执行过程中还可能出现新问题、需要返工或者调整任务优先级,这种情况下提前设定的规则就会失效。

针对这一问题,研究团队开展了第二组实验,探讨智能体能否在工作过程中逐渐形成专长,并根据专长选择合作伙伴,形成比人类设计更高效的组织形式。

实验初始时放入24个配置完全相同的智能体,没有提前设定任何角色。每完成一道题目,每个智能体都会总结该类题目的经验,并将其记录到自己的记忆库中,这些经验在实验中被称为“Gene”。有的智能体处理物理题较多,逐渐积累了更多物理领域的经验;有的智能体经常解决数学题,逐渐形成了数学方向的专长。经过八轮任务后,原本完全相同的智能体开始拥有不同的经历、专业侧重和历史正确率,它们的角色并非由人类提前指定,而是在一轮轮任务选择和执行中逐渐形成的。

接下来,研究团队让这些智能体自主选择合作伙伴:

当智能体只能看到彼此的社交连接关系时,它们更倾向于选择朋友的朋友,最终形成的网络保留了很多熟人小圈子;

当智能体可以看到候选者的专业侧重和历史正确率时,它们的选择立刻发生了变化:开始连接正确率更高的智能体,寻找专业能力更适合自己的合作伙伴。

同一个智能体,仅仅因为可以获取的信息不同,就会选择完全不同的合作对象。大量个体的选择累积后,整个智能体网络的形态也发生了显著变化:仅展示社交关系时,智能体更容易在原有圈子内继续连接;而展示能力和表现信息时,高正确率的智能体开始成为网络枢纽,其他智能体会打破原有关系,主动连接更适合完成任务的伙伴。同一批智能体,最终形成了两种完全不同的组织形态。

不过,目前这个实验仅验证了自组织最早期的动作——选择伙伴,这些连接还没有真正承担任务转交和协作的功能,智能体也还没有实现自主拆解任务、认领任务、处理冲突和重新分配工作的完整流程,因此现在说它们已经形成了完整的智能体社会还为时过早。但这个实验已经透露出一个重要信号:智能体的组织方式会受到可见信息的影响,系统向它们展示什么样的信息、奖励什么样的行为,它们就更容易形成什么样的组织。如果后续加入成本、信用、响应速度和历史合作记录等信息,可能会形成更复杂的协作网络。

写在最后

毫不夸张地说,这是今年我读过的关于智能体落地实践最重要的文章之一。当前的大模型已经足够聪明,单个智能体也能完成越来越长的任务,但只要任务复杂度继续提升,依靠单个主Agent管理所有事情的模式,很快就会遇到上下文长度、协调成本和结果损耗的瓶颈。

接下来行业真正的关键突破,可能会同时发生在两个方向:一是让智能体在工作中积累的经验能够被保存、验证和传播;二是让越来越多的智能体在稳定的规则下完成分工,并根据任务和自身能力动态调整协作关系。这两件事一旦逐步成熟,智能体领域将会发生一次彻底的变革。我不确定这一天具体何时到来,但读完这篇文章,我第一次清晰地看到了这条道路的方向。

以上内容不代表本平台立场,仅供读者参考