AI脚手架或加剧行业集中,模型性能差异显著

“我即是水的形态。”——来自Moltbook的ClawdBot
核心摘要:
- AI部署阶段的脚手架(即模型运行的软件环境与上下文文档)能带来显著的性能提升。在部分评测场景中,不同脚手架下模型的推理效率差异可达100倍,且在我们的数据集里,脚手架对性价比差异的解释力超过模型本身。
- 与多数AI算法创新不同,同一脚手架对不同模型、不同任务的效果存在显著差异:部分模型能从特定脚手架获得大幅性能增益,而另一些模型则受益有限,甚至可能因脚手架而表现下滑。
- 这种脚手架与模型的交互效应对AI性能评测、智能体经济都有重要影响,我们推测这可能是AI行业集中度提升的驱动因素之一。
在讨论AI模型性能提升时,人们通常会关注预训练、强化学习以及推理效率优化等核心方向,但往往忽略了部署阶段的脚手架的关键作用。事实上,脚手架对AI系统实际表现的影响正随着技术发展不断放大,甚至在不少场景下,选择合适的脚手架与选择合适的模型同等重要。
所谓脚手架(也被称为模型包装器或智能体 harness),是将单个或多个AI模型转化为可落地智能体的软件工具集。本文基于某公开智能体评测榜单的数据集,尝试量化脚手架对AI智能体性能的影响,后续内容将依次展开:明确脚手架的定义、介绍本次研究使用的数据、分析脚手架对模型性能与评测的影响、讨论研究发现对智能体经济与模型安全的意义。
- 详细定义“AI智能体脚手架”
- 介绍本次研究使用的数据与分析方法
- 阐述脚手架对模型性能与AI评测的具体影响
- 探讨研究发现对智能体行业生态与模型安全的潜在意义
一、什么是AI智能体的脚手架?
脚手架是AI模型运行时交互的软件环境与工具集,旨在优化AI系统的运行效率并解锁新的能力。广义来说,这类软件主要负责以下几类工作:
- 工具调用支持:包括终端访问、文件编辑、网络搜索、多模型调用、API接口调用等功能
- 上下文窗口管理:例如何时使用检索增强生成(RAG)、如何对上下文进行压缩处理
- 记忆管理:包括内容的存储时机、存储位置以及清理规则
- 提示工程设计:包括系统提示词、任务规划提示词的定制
- 预置技能文档:例如类似Claude Skills的预置指导文档,为模型提供特定任务的执行规范
- 多模型协同调度:包括多模型调用的频率、用途、数量等配置
- 采样与聚合策略:例如k-best采样、多数投票等结果聚合方法
- 自我反思与优化:包括反思、总结、自我批判等流程的实现
- 推理成本控制:包括token消耗限制、任务终止规则等
- 智能体运行循环:例如“思考→行动→观察→重复”的标准执行流程
目前已有部分研究探讨了脚手架的影响,例如此前的相关研究中分析了包括脚手架在内的“训练后增强技术”,发现部分技术能带来相当于10-100倍预训练计算量的性能提升。其中,LATS智能体脚手架能带来约10倍的计算等效增益。不过,自2023年以来,智能体脚手架的复杂度已经有了显著提升,本文旨在评估当前阶段脚手架对AI智能体性能的实际贡献,也期待后续研究能随着模型与脚手架技术的迭代更新,进一步完善相关分析。此外,我们也希望未来的研究能够拆解脚手架各组成部分的相对重要性,但受限于当前的数据粒度,我们暂时无法区分不同组件的具体贡献。
二、研究数据与分析方法
本文的分析属于量化脚手架影响的初步尝试,本次分析所用的图表数据由Claude Opus根据我们的指导完成,相关代码已上传至代码托管平台。
为了量化脚手架对模型性能的影响,我们使用了智能体综合评测榜单的数据集。该榜单收录了多个模型在不同脚手架下的智能体评测结果,同时报告了模型的准确率与推理成本。本次研究共纳入18个前沿模型,涵盖了不同发布时间的产品,来自Anthropic、OpenAI、Google DeepMind以及DeepSeek等机构,完整的模型列表可见附录部分。
该评测榜单包含了多个智能体基准测试,包括CORE-Bench Hard、GAIA、Online Mind2Web、SWE-bench Verified Mini、SciCode、ScienceAgentBench、TAU-bench Airline以及USACO等,覆盖了软件工程、浏览器交互、智能体搜索、科学推理以及多模态视觉推理等多个领域(各基准测试的详细说明与所需工具技能可见附录)。该榜单的核心优势在于,每个模型会在多个脚手架下运行同一项基准测试,通常包括针对该基准的专用脚手架与通用脚手架。需要说明的是,尽管被称为专用脚手架,但不少这类“specialist”脚手架在设计与功能上其实具备较强的通用性。以CORE-Bench为例,模型会同时在CORE-agent专用脚手架与HAL通用脚手架下运行测试。HAL通用脚手架基于smolagents框架构建,模型通过编写Python代码来完成所有操作,例如调用代码执行网络搜索。
本次研究的数据大多来自针对特定基准测试的专用脚手架,同时也包含了少量通用脚手架的数据,例如Claude Code。通过对比不同脚手架的表现,我们能够直观感受到脚手架对性能的影响程度,同时也初步发现专用脚手架在部分场景下优于通用脚手架。我们也期待后续研究能纳入更多类型的脚手架数据,甚至开展新的实验来进一步拓展相关结论。
数据解读的前提说明
在本次分析中,我们大多以HAL通用脚手架作为基准,对比其他脚手架的表现。这意味着我们的多数研究结果都是相对于HAL基准的相对结论,例如如果我们选择不允许工具调用的脚手架作为基准,那么本次评估的多数脚手架都会显得性能突出。此外,本次研究缺乏足够的纵向数据,无法对脚手架随时间的进化情况以及未来的改进空间做出实证性的判断。
三、脚手架对AI性能的显著影响
脚手架工程仍是一个新兴领域,因此其对性能的影响幅度大且差异显著并不令人意外。部分专用脚手架相比通用脚手架能带来巨大的性能与效率优势,而另一些则效果有限。为了分析这一点,我们将每个模型在不同脚手架下的基准测试得分(经过logit转换)与达到该得分所需的API成本进行了绘图对比。我们选择logit转换是因为基准测试的准确率介于0到1之间:当准确率接近饱和时,例如从94%提升到95%,其背后的能力提升往往比准确率处于中间区间时的1个百分点提升更大,logit转换能够有效调整这种偏差。
以下是两个基准测试(CORE-Bench Hard与SciCode)下各脚手架的性价比前沿曲线,其余基准测试的相关图表可见附录。脚手架的选择对性能的影响远超预期:在部分场景中,从通用脚手架切换到专用脚手架,能够在保持相同准确率的前提下,将推理成本降低约100倍。这个差距有多大?作为参考,AI推理的算法进步通常能以每年约10倍的速度降低固定性能下的成本,因此在最优场景下,更换脚手架带来的收益相当于约两年的模型算法进步。
此外,我们观察到使用Claude模型搭配Claude Code脚手架的组合能带来格外出色的性能表现,我们将在后续部分推测这一现象的可能原因。
CORE-bench Hard测试显示不同脚手架在成本与准确率上存在显著差异,部分改进幅度可达两个数量级。上图中的绿色点代表使用Claude-Code脚手架的Claude模型,其性能表现格外突出。
SciCode测试中,不同脚手架在帕累托前沿上的差异虽不规则但依然明显,请注意本图的坐标轴范围与上图存在差异。
以下的脚手架切换向量图展示了同一模型在两个不同脚手架下的表现变化:每个箭头从一个脚手架下的(成本,准确率)坐标指向另一个脚手架下的坐标,颜色用于区分切换后模型的准确率与成本变化情况。本文仅展示了GAIA与SciAgentBench的向量图,其余基准测试的相关图表可见附录。
在GAIA基准测试中切换脚手架会产生高度多样化的效果:部分模型既能降低成本又提升准确率,而另一些模型则会出现准确率下降、成本上升,或者两者兼具的情况。箭头方向从通用脚手架指向专用脚手架,颜色根据切换后成本与性能的变化情况而定:例如绿色箭头代表降低成本且提升性能,红色箭头代表提升成本且降低性能等。没有箭头的点代表该模型仅在一种脚手架下完成了测试。蓝色点代表在HAL通用脚手架下的测试结果。
在SciAgentBench测试中,ScienceAgentBench Self-Debug脚手架能让所有模型同时提升准确率并降低成本,相比HAL通用脚手架展现出一致的性能增益,请注意本图的坐标轴范围与上图存在差异。
我们可以看到,脚手架与模型之间存在显著的交互效应,这在GAIA测试中表现得尤为明显:从HAL通用脚手架切换到HF Open Deep Research脚手架,能让部分模型的性能得到提升,但同时也会损害另一些模型的表现。这与多数AI算法创新形成鲜明对比——后者通常像“涨潮”一样能让所有模型受益,例如GeLU激活函数或者Flash Attention,几乎所有模型都能从这类创新中获得相似的性能提升。这也与ScienceAgentBench测试的结果不同,后者的Self-Debug脚手架能为所有模型提供更统一的性能增益。
目前我们还不完全清楚为什么部分模型能从特定脚手架中获得更多优势。一种可能的解释是,部分脚手架更适合低推理预算的场景,而另一些则在高推理规模下表现更好。有趣的是,我们在附录中的帕累托前沿图表中确实观察到了这一现象的相关证据。
那么,脚手架在多大程度上会产生针对特定模型的异质性效应,而非像多数算法创新那样为所有模型带来统一的“涨潮”式提升?为了更清晰地理解这一点,我们可以将之前的向量切换图进行转换:将每个向量的原点对齐到模型在HAL通用脚手架下的表现,箭头则代表使用替代脚手架后成本与性能的变化差异,在多数图表中,这里的替代脚手架都是针对特定基准的专用脚手架。
这些图表展示了HAL通用脚手架与替代脚手架之间的logit基准测试性能差异。原点代表模型在HAL通用脚手架下的表现。箭头颜色根据专用脚手架对成本与基准准确率的影响而定:例如绿色箭头代表该脚手架能降低成本并提升性能。
通过对每个基准测试的向量结果取平均值,我们可以得到脚手架对模型性能影响的整体图景。总体而言,本次评测中的多数专用脚手架都能提升模型的准确率,但部分脚手架只能通过显著增加token消耗来实现这一点。从 across benchmarks的平均结果来看,不同脚手架的效果存在显著的异质性。需要注意的是,专用脚手架可能存在对对应基准的过拟合问题,其泛化能力可能有限。
该图表展示了上文所有以原点为中心的脚手架切换向量的平均效果。总体而言,多数专用脚手架确实能提升模型性能。置信椭圆越小,代表我们对向量的方向与幅度的置信度越高。注意:USACO测试仅包含一个数据点,因此没有对应的置信椭圆。
脚手架对AI评测榜单排名的影响
人们有时会基于智能体的能力构建模型排行榜,但除了已知的排行榜鲁棒性问题外,排行榜的结果还会对脚手架的选择非常敏感。如果不同脚手架对模型的影响并不统一,那么一个在某一脚手架下排名第20的模型,在另一脚手架下可能跃居第3位。
我们在附录中包含了脚手架对排名影响的正式分析。在部分基准测试中,例如SciCode,不同脚手架下的排名基本保持一致(秩相关系数较高),但在多数基准测试中,秩相关系数显示排名存在大幅重新排序:最终的排行榜结果很大程度上取决于你选择的测试脚手架。
基于这一发现,排行榜的设计者应该如何选择?如果目标是评估模型在典型部署场景下的实际表现,那么排行榜应该固定使用实际部署时会采用的脚手架。如果目标是评估AI系统在理想最优条件下的最大能力,那么排行榜应该让模型在多种脚手架下运行,并取其最佳表现。
不同脚手架下的模型排名存在显著差异。绿色线条代表从HAL通用智能体脚手架切换到SWE-agent harness后排名提升的模型,红色线条代表排名下降的模型。
四、研究发现的潜在意义
脚手架的存在会对监管机构、模型开发者以及整个社会产生诸多重要影响。本文将讨论其中几个关键的潜在意义,同时也会展望 beyond本次研究的未来研究方向。
5.1 脚手架可能成为AI能力提升的新方向
本次研究表明,脚手架能对模型性能产生巨大影响,且现有不同脚手架的实用价值差异显著。未来我们可能会看到更多用于识别最优脚手架及其核心特征的研究,同时也会出现竞争以构建性能更出色的脚手架系统。如果脚手架设计领域仍有大量的创新空间——尤其是AI自动化的创新方向——那么跟踪脚手架的技术进步与跟踪原始模型的能力提升将变得同等重要。
另一方面,也有可能当前的脚手架技术已经接近性能上限,进一步改进的空间有限。如果事实如此,那么随着行业向现有最优的脚手架设计或最优模型收敛,我们可能会在短期内看到性能提升,但之后将难以为继。
从推测的角度来看,有人可能会认为未来更强大的模型可能不再需要复杂的智能体脚手架——也许未来的AI系统能够在需要时自行设计所需的工具。但我们个人认为这种可能性较低,我们预计脚手架的重要性将持续存在,甚至进一步提升。
5.2 脚手架可能影响AI开发者的垄断地位
AI开发是否属于自然垄断行业一直存在争议:拥有大量计算资源的头部厂商如OpenAI与Anthropic是否会越来越主导AI服务市场,还是小型开发者会不断削弱他们的市场地位?尽管我们无法给出确定的答案,但脚手架可能是塑造最终市场格局的重要因素之一。我们的研究结果显示,使用优质的脚手架能大幅提升模型的性价比,因此从理论上来说,脚手架可能会削弱高端前沿模型的成本优势,让低成本模型也能通过优化脚手架获得出色的性能——尤其是在脚手架本身的开发成本较低的情况下。
不过,我们认为更可能出现的结果是,脚手架会导致行业集中度进一步提升。原因主要有三点:首先,尽管我们的数据不足以证明这一点,但脚手架似乎在一定程度上与计算投入存在互补效应。如果脚手架对高端模型的提升比对低成本模型更大,那么这将增加规模收益,推动行业向头部集中。
其次,我们预计脚手架的开发成本会不断上升,因为厂商会投入更多的推理计算资源来优化脚手架的设计,同时脚手架也会越来越多地部署复杂的多模型协同架构来处理更复杂的长周期任务。我们也期待未来有更多研究能探讨这一问题:脚手架的性能提升在多大程度上依赖于更多的推理计算资源?
第三,也是更有趣的一点,我们推测模型与脚手架的协同优化可能会带来额外的收益。例如,Anthropic可以在自己的Claude Code脚手架内对Claude模型进行强化学习训练,同时也可以调整脚手架的设计以充分利用Claude模型的独特能力——而这只有Anthropic拥有模型的白盒访问权限。这样一来,Claude模型与Claude Code脚手架可能会共同进化,形成外部参与者难以复制的协同性能优势。要基于专有脚手架从头训练基础模型需要极高的成本,尽管本次分析不足以证明Anthropic已经从协同优化中获得了收益,但我们也无法排除这种可能性——而且我们确实观察到Claude Code脚手架的表现格外出色。
如果这种协同优化变得越来越重要,那么Claude模型可能会被过度优化以适配Claude脚手架,导致与其他脚手架和下游应用的互操作性下降。没有模型控制权的下游脚手架开发者,甚至可能会发现随着新的Claude模型发布,他们的脚手架性能不升反降(正如部分模型在SWE-agent harness中表现下滑一样)。就像苹果在App Store中优先让自家应用获得更好表现一样,Anthropic也可以通过设计Claude的训练流程,优先支持其希望推广的下游框架。
5.3 专用场景脚手架将成为主流趋势
我们在研究中发现了大量针对特定基准测试任务优化的专用脚手架,它们在对应任务上的表现优于通用脚手架。不过由于本次研究中通用脚手架的样本量较少,我们还无法断言专用脚手架通常比通用脚手架更优秀,现在下结论还为时过早。但观察行业的发展趋势将非常有趣:如果专用脚手架确实能在对应场景中超越通用脚手架,那么我们可能会看到大量专注于特定任务或行业的脚手架服务商涌现(例如目前已经出现的Harvey与Cursor等公司,就符合这一描述)。
5.4 脚手架安全不容忽视
对于关注高级AI能力泄露或网络盗窃的人群来说,我们的研究结果表明,保护脚手架的安全可能与保护模型权重本身同样重要。不过,脚手架的安全问题相比模型权重安全,长期以来都被讨论得较少。值得注意的是,Anthropic的突破性产品Claude Code背后的脚手架曾在2026年3月意外泄露。
脚手架安全的重要性在很大程度上取决于模型与脚手架的协同优化程度。如果脚手架是高度针对特定模型定制的,那么单独泄露脚手架或模型权重的影响都会相对有限,因为攻击者需要同时获取两者才能完全复现性能。厂商可以采取积极措施,防止脚手架被单独窃取并用于攻击,例如让脚手架依赖仅在AI实验室或合法机构可用的外部API或工具。另一方面,如果脚手架本身功能强大且能在多种模型上通用,那么脚手架的泄露将带来巨大风险——在这种情况下,泄露的脚手架只需少量适配就能大幅提升大量未预期模型的能力。
五、结论与AI能力的未来发展
AI模型所嵌入的系统环境,是决定模型实际能力的重要因素,而且这种影响在未来可能会越来越大。复杂的脚手架、具备复杂信息共享机制的多智能体网络,以及我们尚未想象到的新型架构,将不断模糊“AI”的边界。要理解这些新型系统的能力——以及其对齐特性——我们就必须跳出单一模型的视角,从整体系统的角度进行分析。
附录
本附录包含以下内容:
- 本次研究中使用的基准测试与智能体列表
- 本次研究中使用的模型列表
- 脚手架与模型对性能差异的解释力分析
- 所有基准测试的帕累托分析图表、向量分析图表、排名相关系数图表,以及专用脚手架与HAL通用脚手架的对比图表
- 本次研究的代码与数据链接
基准测试详情
本次研究涵盖的基准测试包括CORE-Bench Hard、GAIA、Online Mind2Web、SWE-bench Verified Mini、SciCode、ScienceAgentBench、TAU-bench Airline以及USACO,各测试的详细说明与所需工具技能可通过公开资料查阅。
研究使用的模型
本次研究共纳入18个前沿模型配置,涵盖了不同发布时间的产品,来自Anthropic、OpenAI、Google DeepMind以及DeepSeek等机构。部分模型会在不同的推理设置下运行测试,例如高推理设置与默认设置,当同一模型在同一基准测试与脚手架下存在多次测试结果时,我们保留准确率更高的那次结果。部分模型仅在中等推理设置下运行,而o4-mini则分别在高与低推理设置下运行,我们保留了这两次结果。
脚手架与模型的解释力对比
本次分析的目标是衡量在控制推理成本与基准测试类型的前提下,脚手架与模型分别能解释多少logit转换后的性能差异(考虑到样本量,我们仅为每个基准测试添加了固定效应)。这里的核心问题是,基准测试与脚手架存在高度相关性,因为多数专用脚手架仅在单个基准测试中使用,我们不希望将基准测试之间的差异错误归因于脚手架。为了解决这一问题,我们采用了增量回归的方法:首先以logit性能为因变量,以推理成本对数与基准测试为自变量进行回归,得到调整后的R²为0.519。随后,我们分别在回归中加入模型虚拟变量与脚手架虚拟变量,观察调整后R²的变化情况。结果显示,脚手架对数据中性能差异的解释力超过模型,这进一步凸显了脚手架的重要性。
如果同时在回归中依次加入脚手架与模型变量,无论变量加入的顺序如何,最终结果都相似,这是因为脚手架与模型之间的共享方差相对较小。
所有基准测试的帕累托分析图表
各基准测试下不同脚手架的性价比前沿曲线,每个面板展示模型准确率(logit缩放)与达到该得分所需的API成本的关系,每个脚手架对应一条前沿曲线。
完整向量分析图表
其余基准测试/脚手架组合的脚手架切换向量图,每个箭头代表单个模型在两个脚手架之间的表现变化,从一个脚手架下的(成本,准确率)指向另一个脚手架下的坐标,颜色根据切换后准确率与成本的变化情况而定,与正文中的图表一致。与正文中的观察一致,我们可以看到两种类型的脚手架变化:“涨潮”式的统一提升,以及“湍流”式的异质性变化,两者的数量大致相当。
排名相关系数图表
模型在一种脚手架下的排名能在多大程度上预测其在另一种脚手架下的排名?左侧的图表展示了每个基准测试下不同脚手架对之间的斯皮尔曼ρ秩相关系数与肯德尔τ秩相关系数。多数脚手架对的排名相关性处于中等水平,但CORE-bench Hard的相关系数为负值,这意味着在一个脚手架下表现最好的模型,在另一个脚手架下未必表现出色。以GAIA测试为例,其τ=0.17,这意味着任意两个模型在不同脚手架下保持相对顺序的概率仅约为58%(这正是肯德尔τ秩相关系数的含义)。位于绿色对角线上的点代表排名保持不变的模型,而红色点则偏离对角线较远。
两种相关系数的取值范围均为-1到+1:-1代表排名完全反转,0代表无关联,+1代表排名完全一致。斯皮尔曼ρ是将皮尔逊相关系数应用于模型的排名位置而非原始得分:即取每个模型在脚手架A下的排名与在脚手架B下的排名,衡量这两组排名数据的线性相关程度。由于ρ基于排名值计算,它对模型排名的移动幅度敏感——例如一个从第2名跌至第18名的模型,会比一个从第2名跌至第4名的模型对ρ的影响更大。而肯德尔τ则仅统计每一对模型是否保持了相对顺序,忽略移动的幅度大小。
如果有任何点位于绿色虚线上,则代表该模型在不同脚手架下保持了排名,但本次分析中并无此类点。尽管如此,任意两个模型保持相对顺序的概率仍有58%。红色点代表在HAL通用脚手架下相对排名更优的模型,绿色点代表在HF Open Deep Research脚手架下相对排名更优的模型。
专用脚手架的性能提升情况
雷达图展示了不同模型在通用脚手架与专用脚手架下的最大基准测试得分。专用脚手架能让模型在多个领域获得更高的基准测试得分。
所有数据均来自公开的智能体评测榜单,本次分析的代码与数据已上传至代码托管平台。
塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/
AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

