文章摘要
为评测大模型多智能体的长期协作能力,多国联合研究团队推出AgentWorld基准评测工具,将多智能体置于MMORPG沙盒环境,测试任务依赖型协作任务;对四款主流大模型的测试显示,当前大模型即便个体能力较强,仍存在明显协作短板。该工具提出CCE过程评测指标,为该领域提供了可量化的研究基础,相关论文已被COLM 2026接收。

当具备推理、编程与工具使用能力的大模型被组织成团队时,一个核心问题随之而来:这类组合能否完成单个智能体难以独立承担的复杂任务?这正是多智能体系统最具吸引力的想象——不同成员各司其职,分头探索、互补长短,从软件开发到科学研究,这类分工模式早已证明其价值。但个体能力转化为团队效能,离不开一套成熟的协作机制:人类团队需要明确共同目标、厘清职责边界,并根据新信息动态调整行动,而由大模型驱动的智能体,这些能力并非天然具备。

为了评测多智能体的长期协作能力,相关团队推出了AgentWorld benchmark,这一工具聚焦一个核心问题:当多个拥有不同角色与资源的智能体共处同一环境时,它们能否通过持续交互完成共同任务?这一问题连接了基础模型能力与实际应用,既关乎下一代模型的能力方向,也为现有模型的组织方式提供了可量化的评测标准。

协作的多层次挑战

多智能体系统能带来多重价值:最直接的是扩大探索范围,让多个智能体同时研究不同方向后汇总结果;其次是能力互补,让不同成员依托各自的工具、信息或专业领域能力承担差异化职责;更进一步则是动态配合,一个成员的行动会改变其他成员的后续任务,团队需要在执行中不断协调节奏。

不同的协作场景对机制的要求各不相同:比如汇总十篇文献的综述任务,可以采用相对独立的分工模式;但持续迭代的软件开发,则需要处理接口变更、任务依赖与计划动态调整。这也引出了更深入的问题:当工作无法被完全拆分为独立模块时,多智能体团队能否稳定创造效能增益?此时团队不仅需要明确每个成员的任务,还要理清谁在等待谁的输出、哪些信息已经过时,以及局部目标是否仍服务于整体方向,AgentWorld正是将这类相互依赖作为评测的核心。

基于沙盒环境的协作评测设计

AgentWorld将智能体置于MMORPG沙盒环境中,提供100个人工设计的基础任务与100个增强变体,每个任务需要3到20个智能体协作完成,任务涵盖材料采集、装备制作、资源分配与协同战斗等场景。

选择这类环境的意义在于,协作的后果会真实落地:如果材料未完成转交,后续的制作步骤就无法启动;如果成员未能及时沟通,其他成员可能会基于过期的计划继续行动,团队必须通过多轮交互将各自的局部行动串联成完整流程。同时,环境通过高层工具封装了导航、采集等基础操作,让评测能够聚焦于决策与协调本身:智能体无法直接访问彼此的内部推理状态,只能通过消息传递与可观察的行动建立配合,最终任务是否成功由程序化的验证规则直接判定。

协作流程可视化拆解:从资源到成品的完整链路

我们以benchmark中Task46的采矿与锻造任务为例,展示协作的完整流程:铁矿供应者、燃料供应者、冶炼师、锻造师与物流成员需要衔接各自的工作,最终制作出镐、斧头与重剑三件装备。为了聚焦交接与制作环节,我们预置了基础资源并调整了角色位置,省略了长距离移动与初始采集步骤,实际执行中物品转移、冶炼与锻造的流程均按真实逻辑推进,以下是四个关键阶段:

第一阶段:明确共同目标与现有资源。铁矿供应者持有矿石,燃料供应者拥有煤炭,物流成员准备了木材,锻造师则携带了剑柄,冶炼师与锻造师分别负责不同的加工环节。没有任何一个成员能够独立完成全部装备制作,团队需要将分散的资源与各自的加工能力进行对接。

第二阶段:打通两条供应链路。矿石与煤炭被转交给冶炼师,木材则交付给锻造师。此时冶炼师已经可以启动加工,但锻造师仍需要等待铁锭到货。对于协作系统而言,“团队持有资源”与“执行者拿到所需材料”是两个完全不同的状态,只有完成真实的资源交接,才能解锁下一步的行动条件。

第三阶段:首件成品完成,但任务尚未结束。冶炼师交付首批5根铁锭后,锻造师用这批材料与一份木材制作出了镐。此时仅完成了三项产出中的一项,后续的斧头需要3根铁锭与一份木材,重剑则需要2根铁锭与预先准备的剑柄,因此冶炼师需要持续供应材料,锻造师也需要留存后续制作所需的部件。

第四阶段:以最终产物验证整体目标。第二批5根铁锭交付后,锻造师依次完成了斧头与重剑的制作,最终核对库存时,三件新装备均已存在。这条协作链路的有效性,体现在资源如何跨角色流动、加工顺序如何精准衔接,以及成员是否始终围绕整体目标推进行动。

这个案例将团队智能的问题具象化:成员能否识别依赖关系、向正确的队友提供资源,并清晰区分局部进展与整体完成?在软件开发或科研工作中,对应的交接物可能是可用模块、实验数据或验证结论,其核心逻辑都是一个成员的工作必须成为另一个成员可直接使用的输入。

主流模型的协作表现评测

研究团队使用了Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini与DeepSeek R1-70B四款主流模型驱动智能体团队进行测试,在基础任务设置下,四款模型的成功率分别为52.0%、45.0%、36.0%与20.0%,而在增强任务中,成功率进一步下滑。

这一结果清晰地表明:即使是具备较强个体能力的模型,在需要长期配合的协作任务中仍然面临明显的困难。模型理解任务、规划行动与使用工具的能力,能否通过团队组织转化为最终交付的成果,需要被单独检验。

另外,沟通频率也无法直接反映协作质量:测试中GPT-5 Mini平均每条任务发送44.1条消息,而Gemini 3 Flash仅发送11.0条,但后者的成功率更高,这说明我们需要关注沟通是否真正改变了团队的行动方向,而非仅仅统计对话的数量。

对于模型开发者与应用团队而言,一个值得深入研究的方向是:更强的推理能力能够解决哪些协调问题,又有哪些问题需要通过优化分工方式、共享信息或增加执行反馈来改善?AgentWorld为拆解这些因素提供了可落地的实验环境。

CCE指标:从结果到过程的协作评测

仅通过任务成功率,我们只能知道任务是否完成,却无法充分解释团队是如何完成任务的。两支都成功完成任务的团队,可能一支配合流畅、效率极高,另一支则经历了大量重复劳动与无效沟通。

为此,研究团队提出了Causal Collaboration Effectiveness(简称CCE)指标,这一指标从直接促成任务完成的动作出发,向前追溯相关的行动与消息,寻找对最终结果有实际贡献的行动链。以之前的锻造任务为例,最终装备的制作依赖铁锭到位,而铁锭的获取又依赖冶炼师拿到矿石与煤炭,提醒队友持续交付材料的消息,也可能成为贡献链的一部分。CCE正是要评估这些动作与最终结果之间的真实关联。

对于成功完成的任务,CCE会计算贡献动作占总动作的比例;对于失败任务,则按研究约定记为零。这一指标为协作评测增加了过程视角:成员之间的交流与行动,是否真正形成了通向结果的有效链路?

贡献判断的过程由大模型辅助完成,研究在11个任务、两个智能体模型的84项动作判断中,得到了人工判断与GPT-4.1判断器约82%的一致率,这为该方法提供了初步支持,但目前还不能将贡献图视为经过严格干预实验验证的因果关系。因此,CCE更适合与成功率、完成时间与成本指标结合使用,它提供了一种分析协作过程的通用语言,让团队可以讨论哪些交接真正发挥了作用、哪些活动没有推动目标,而非仅通过对话是否流畅来评价协作质量。

多智能体协作的三种组织模式

从系统设计的角度,可以将协作分为三种逐渐增加相互依赖程度的组织方式,这些模式适用于不同的任务场景,也可以组合使用。

第一种是并行分工模式:多个智能体分别探索不同的任务方向,最后由一名成员汇总结果。这种模式能够充分利用模型已有的独立解决问题的能力,主要的挑战在于清晰划分任务边界、减少重复工作并整合相互矛盾的发现。

第二种是带有协调者的团队模式:一名主智能体根据整体目标分解任务、分配工作,并在收到成员的结果后调整整体计划。对于存在较多依赖关系的任务,这种模式能够提供统一的调度视角,但协调者的判断失误或信息处理能力不足,也可能成为整个团队的性能瓶颈。

第三种是能够持续相互适应的团队模式:成员在执行各自任务的同时,也会根据队友的进度、需求与环境变化动态调整行动。此时,协作能力体现为成员能够识别何时需要请求帮助、何时主动提供信息,以及何时需要改变原定的分工。

AgentWorld的长期、角色不对称与黑盒交互设置,为第三类协作能力提供了可观察的实验场景。不过,这并不意味着去中心化的协作模式一定优于集中协调模式,值得进一步比较的是:在相同的任务与资源预算下,哪种组织方式更容易取得成功,又能更快地从错误中恢复?

这三种模式的分析框架,为理解多智能体协作提供了清晰的视角,对于产业应用而言,评估一个智能体系统时,需要同时关注模型能力与组织方式:模型升级可能改善推理与规划能力,而更合适的组织方式则能让已有能力得到更充分的利用,两者的相互作用需要通过对照实验与真实任务结果来验证。

未来方向:将协作本身纳入学习与优化循环

沿着这些协作模式的路径继续探索,一个值得关注的核心方向是将协作能力本身纳入模型的学习目标。如果训练反馈仅关注单个智能体的输出是否正确,模型未必能获得足够的信号来学习何时沟通、如何理解队友的需求,以及如何为共同目标调整局部行动。

一个可行的探索方向是利用团队任务的结果与过程反馈,让模型在交互中学习这类协作决策。CCE这类指标可以帮助分析协作过程,但能否作为有效的训练信号,还需要专门的实验验证。

另一个方向是让团队的组织方式能够随任务动态调整:对于可以独立处理的任务部分,适合采用并行分工模式;对于存在强依赖的部分,则需要协调者模式;当出现不确定性时,可能需要额外的验证环节。未来的智能体系统可以研究如何动态选择团队规模、分配职责,并在执行过程中调整这些安排,而不必让所有任务都遵循同一种协作模板。

与此同时,评测体系也需要同步进化:当任务目标发生变化、成员暂时失效、不同模型共同工作时,团队是否仍然能够保持可靠?在有限的时间与计算预算下,增加一个成员带来的效能增益,能否抵消额外的沟通与协调成本?这些都是下一阶段值得系统检验的问题。

AgentWorld的核心价值,在于为多智能体协作的发展路径提供了一个共同的测量起点:将抽象的协作能力转化为可执行的任务、可观察的过程与可量化比较的结果。随着单个智能体模型的能力持续进步,我们也需要深入理解这些个体能力如何组合形成团队效能。让多个智能体共同承担复杂工作,需要模型能力、组织方式与评测反馈三者协同发展,团队智能的发展边界,取决于这三者能否形成持续改进的正向循环。

研究团队与项目信息

本次研究的论文已被COLM 2026接收,arXiv预印本链接为:

https://arxiv.org/abs/2609.31590

AgentWorld由来自OpenAgents、哥伦比亚大学、宾夕法尼亚大学、首尔大学与宾夕法尼亚州立大学的研究者共同完成,论文的共同第一作者为Raphael Shu、Yusen Zhang与Young Min Cho。

项目官方网站为:https://agentworld.io

完整的代码与数据集可在以下地址获取:https://github.com/openagents-org/agentworld

论文题目为《AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs》

以上内容不代表本平台立场,仅供读者参考