文章摘要
现有智能体评测多针对有限明确任务,为评测智能体长程经营能力,相关团队推出E-Commerce Bench基准,以10万元本金模拟一整年全流程网店经营,基于真实电商数据做精细化设计,采用确定性内核架构保障评测可复现,从七个维度评估18款大模型,结果显示模型能力差异大,无模型全维度优秀,多数未掌握长程学习能力,该基准为长程任务评测提供新思路,也表明大模型商业能力仍有较大提升空间。

长期以来,智能体(Agent)的评测模式大多围绕明确的目标任务展开:给定具体任务后,模型需要在有限回合内尽可能达成目标,比如迷宫寻宝、撰写报告、修复代码等,最终根据交付产物质量或任务完成度评估性能,这类评测往往有清晰的自然终止状态。但真实世界的长程任务大多没有明确的终点——无论是天气预测、股票交易还是商业经营,都需要持续动态调整策略以实现长期目标。就像网店经营不会在某个上午宣告完成,上月的库存、前日的谈判结果、昨日的促销活动都会影响当日的销售表现,智能体需要在动态市场中不断优化经营思路。

为了评估模型的长程经营能力,相关团队推出了E-Commerce Bench基准,让模型以电商商家的身份在模拟市场中经营网店。相关资源链接包括项目主页、研究论文与基准代码仓库:项目主页研究论文基准代码。参与评测的智能体需要在有限的资金与时间约束下完成一系列经营决策,同时应对市场变化与不确定性因素。

本次评测的核心设定为:智能体将获得10万元启动资金,可同时开设多家店铺,在一整年的模拟经营周期内,完成品类调研、供应商谈判、商品定价、促销策划、库存管理与现金流管控等全流程运营。模拟环境不会直接告知模型市场需求上限与成本底价,所有信息都需要智能体通过自主探索获取。一年评测周期结束后,模型的表现将从盈利、现金流管理、供应商谈判、反欺诈、运营效率、执行力和长程学习能力七个维度进行综合评估。

为了最大程度还原真实电商平台的运营逻辑,基准做了多维度的精细化设计:

  • 真实市场数据支撑:基准包含6886个商品,覆盖60个品类,背后关联576家供应商与12种可开设的店铺类型。全年日历中预设了10个市场事件与8场促销活动,品类销量、退货率、节庆消费特征等数据均脱敏自主流电商平台的真实经营数据。
  • 精细化时间预算:模拟的一天从早八点到晚六点,仅提供600分钟的可用操作时间,每一次工具调用都会消耗对应时长:查询账户余额需要10分钟,开设新店需要60分钟,向供应商发送沟通消息需要30分钟。调研与执行动作共享同一预算,提前规划思考与边做边调整的时间成本存在差异。
  • 三账户结算体系:所有采购成本直接从银行账户扣除,而商品销售收入需要在发货后扣除平台佣金,进入平台担保账户,再过9天才会转入平台钱包,最终需要手动提现才能转回银行账户变为可使用的现金。
  • 仓储与快递规则:库存按照单件单日收取仓储费用,即使计划关店也无法停止仓储成本,除非选择亏本清仓处理库存。快递服务分为三档:加急快递运费翻倍,普通快递运费按标准收取,慢递运费减半;若订单超过两天未发出,将直接被取消。
  • 退货与信誉机制:商品退货率受四个因素影响:品类本身的退货基线、供应商发货的次品率、商品定价高于参考价的幅度、以及选择的快递发货速度,后两个因素由智能体自主控制。店铺信誉分会直接影响商品需求量,每产生一笔退货扣0.6分,每取消一笔订单扣1.0分,当信誉降至最低时,店铺仅能获得正常水平15%的流量。

确定性谈判内核与用户需求模型

如果市场需求与供应商行为完全随机,不同模型的评测结果会被大量噪声掩盖,无法形成有效区分与可复现的对比。因此,基准在用户需求侧完全摒弃随机采样,商品当日销量通过多因子计算得出,包括品类基础需求、价格响应系数、周末效应、促销活动、季节性特征、当日市场事件、店铺信誉、市场需求上限等。

在供应商侧,基准也没有直接使用大模型扮演供应商角色,因为这种方式会带来两个核心问题:一是相同的谈判策略在两次测试中可能得到完全不同的报价,无法保证结果的一致性;二是大模型本身存在被越狱攻击的风险,不诚实的智能体可能通过欺骗手段将供应商报价压至成本线以下,导致评测偏离原本的目标,变成越狱能力的比拼。

为此,基准将每个供应商拆分为两层架构:第一层是确定性谈判内核,供应商的每一次报价、让步、接受或终止谈判的决策,都由内核直接计算得出,商品的保留价与初始报价属于固有属性,不会随机抽取;第二层是NPC渲染层,仅由大模型负责将内核生成的决策转换为自然语言对话,让智能体感受到与真实人类谈判的交互体感,同时彻底消除随机采样带来的噪声。这种设计既保留了多轮谈判的真实感,又确保了评测结果的可复现性。

年终总资产是冰山一角:七维功能拆解

研发团队对18个不同的大模型各进行了5轮完整评测,所有模型均从10万元本金起步,但最终结果却相差数个数量级。表现最优的GPT-5.6 Sol最终总资产达到143万元,为初始本金的14.31倍;而表现最差的Qwen3.5-Plus平均期末资产仅剩下1100元。开源模型阵营中表现最好的是Qwen3.8-Max-Preview,最终回报为初始本金的4.16倍,但评测总榜前四名均为闭源模型。值得注意的是,即使是强模型也并非稳赢:90次完整评测中共有10次以破产收场,其中GPT-5.5有两次评测在一月份就因大量铺货导致资金链断裂,彼时尚未有任何销售款项结算到账。

仅通过年末总资产这一单一指标,无法完整还原智能体一整年的经营过程。365天的资产变化曲线大致可以分为三类:领先模型从年初开始便保持稳步增长;破产模型的资产曲线在早期跳水后再未回升,部分模型甚至在第一个月就耗尽资金;中间梯队的模型全年资产基本维持在10万元本金线上下,忙活一整年基本原地踏步。绝大多数破产案例的路径高度相似:在一月份集中大量进货铺货,后续却无法实现匹配的销售转化,最终因仓储成本暴涨与现金流断裂彻底失败。

单纯的盈利数据无法代表真实的经营水平,因此基准除了年末总资产之外,还额外设置了六个独立的评估维度:谈判质量、反欺诈能力、现金流与清偿能力、运营效率、运营执行力以及长程学习能力,最终形成七个维度的综合评估。对18个模型的七维能力画像显示,没有任何一个模型能够在所有维度上达到平均水平以上,每个厂商家族的代表模型中,至少有六个维度落在所有模型的中位数以下。

分维度拆解评测结果,得到了多个比总资产排名更有价值的发现:

  • 谈判质量:没有任何模型能够将供应商报价压至成本底线。研发团队将砍价能力按照0到1的区间打分,0.5分代表完全不还价、直接接受供应商初始报价。其中Claude Opus 4.7拿到了0.811的高分,确实通过谈判大幅压低了采购成本;而Kimi K2.6仅获得0.596分,仅比直接接受开价略好一点。同时团队发现,同一模型面对六种不同风格的供应商时,谈判表现差异并不大,而不同模型之间的谈判能力差距,是同一模型面对不同供应商风格差异的四倍。
  • 反欺诈能力:这是不同模型之间差距最大的维度。流向欺诈供应商的采购资金占比,最高与最低相差超过160倍:Claude Opus 4.7的欺诈采购占比仅为0.12%,而Qwen3.5-Plus则高达20.11%。作为参照,基准中的576家供应商里共有152家为欺诈方,占比26.4%。所有18个模型的欺诈采购占比均低于这一基线,说明所有模型都具备一定的欺诈供应商筛查能力。表现最优的GPT-5.6 Sol在这一维度仅排名第16位,但全年经营并未因此翻车。真正的分水岭不在于“选择哪些供应商沟通”——所有模型接触过的供应商中,欺诈方占比都接近26.4%——而在于沟通完成后的下单决策:Claude Opus 4.7在接触过的欺诈供应商中,最终下单的比例仅为4.0%,而GPT-5.6 Sol的这一比例高达31.7%。
  • 运营效率:将全年总利润折算到每次工具调用的收益上,Fable5平均每次调用能够带来479元的收益,比总资产排名第一的GPT-5.6 Sol的363元还要高,同时工具调用次数还比GPT-5.6 Sol少59.9%。进一步分析工具调用的分布可以发现,发货、快进至次日、提现、上架商品这四类操作占总调用次数的71.8%,而真正能够影响采购成本的供应商对话仅占总调用的6.0%,调价操作更是仅占0.66%,绝大多数操作时间都花费在无法改变成本结构的流程上。

长程学习能力:几乎没有模型学会压价

长程学习能力的评估一直是难点,核心在于难以定义“进步”的标准。本次基准找到了一个天然的评估标尺:供应商内核永远不会以低于保留价的价格成交,因此智能体从某一供应商处获得的历史最低成交价格,就是该供应商成本线的上界,且后续的议价空间只会越来越小。针对同一供应商、同一商品的后续进货成交价,与历史最低价格的相对位置,无需额外标注即可判断智能体是否实现了议价能力的提升。

研发团队将每次重复进货的成交价换算为其在议价区间内的相对位置,与“将已获得的价格随机重排”的零假设进行对比,得到AnchorRatio指标,1.0代表模型的出价顺序与随机排序无法区分。在8647次重复进货的样本中,18个模型仅有2个的AnchorRatio低于1.0,中位数为1.369,有15个模型向更高的采购价格方向偏离零假设超过两个标准差。同时,17个模型年末的欺诈供应商采购占比,比年初更高。整体来看,绝大多数模型在一年的经营周期中,并没有学会更高效地压低采购价格。18个模型中仅有Qwen3.8-Max-Preview展现出了明确的长程学习迹象,其AnchorRatio为0.88,说明在重复进货时能够持续将价格压向更低的水平。

写在最后

在构建E-Commerce Bench的过程中,团队曾反复纠结是否直接使用大模型扮演供应商角色,最终选择了确定性内核加渲染层的双层架构。一旦对手方也是概率模型,智能体与供应商的博弈就会变成两次采样的叠加,同一策略在两次测试中可能得到完全不同的结果,评测将失去可比性。通过将经济决策固化进确定性内核,仅保留LLM层负责将数字决策转换为自然语言对话,既保留了多轮博弈的真实交互体感,又彻底隔绝了随机噪声对评测结果的影响。这一思路不仅适用于电商谈判场景,用伪随机的确定性内核保障评测可复现性,应当成为长程任务评测的通用方案。

另一个重要的启示是,单一指标会掩盖模型的真实表现。18个模型中没有任何一个能够在七个维度上同时达到优秀水平,即使是总资产排名前三的模型,也至少有一个维度排名在十名开外,而排名垫底的模型也可能在某一维度表现并不差。如果仅通过年末总资产来评判模型,会误以为GPT-5.6 Sol在所有维度上全面领先,但实际上它的反欺诈能力仅排名第16位。长程任务的失败模式非常分散,不拆分维度进行细致评估,根本无法准确判断模型的真实短板所在。

最后,E-Commerce Bench基准仍有很大的提升空间。在谈判、反欺诈、长程学习等各个维度上,表现最优的模型距离满分仍有明显差距,七个维度的最佳成绩分别来自六个不同的模型,这说明前沿模型在商业经营能力上仍有巨大的提升空间,也印证了该基准在衡量模型商业能力方面的巨大潜力。

以上内容不代表本平台立场,仅供读者参考