文章摘要
作者自制的AIHOT大模型综合榜单收到细分测评反馈,当前缺乏真实工作场景评测。以电商场景评测集RealReplicaBench为例,多数模型通过率不到50%。其他领域如E - Bench、VibeLifeBench评测结果同样不理想。改善现状需全行业推进,作者计划整合真实场景评分到榜单中。目前大模型在真实工作场景提升空间巨大。

上周我发布了自制的AIHOT大模型综合榜单,收到了大量读者的反馈,其中点赞最高的评论提出,希望能有更细分的分类测评,直观展示不同模型在各类实际任务中的表现差异。

目前市面上的大模型评测榜单并不少,比如LiveBench、DeepSWE等,能够快速帮我们对比模型在单一能力维度的表现,比如代码编写、数学推理、浏览器操作等。但有一类评测始终非常稀缺——那就是直接评估模型在真实工作场景中的实际完成效果。

这类评测会直接给到模型一份完整的真实工作任务,让它从启动到收尾独立完成全流程,最终评估实际产出效果,覆盖金融、法律、电商、日常服务等多个领域,更贴近普通用户和职场人的真实工作与生活场景,实用性也更强。因此我一直希望能补充这类场景维度,让AIHOT榜单的评价体系更加丰富多元。

这个周末我梳理了现有的公开评测集,结果却让人意外:这类面向真实工作场景的评测数量极少,而且大部分模型在这类任务中的成功率远低于大家在代码领域的体感预期。

我找到了上周刚开源的成熟电商场景评测集RealReplicaBench,由一支专注外贸电商的团队开发,他们的内部业务数据具备很强的权威性,通过这个案例就能直观看到智能代理(Agent)在真实电商场景中的实际表现。

该评测集包含107个独立任务,开发团队基于自身电商Agent的实战经验,从160万条真实对话中提炼出20万条工作流,再筛选出2000条高商业价值的场景,最终按照可复现性和结果可判定性标准,整理出这107个任务。任务覆盖了电商全流程场景,包括供应商采购、商品上架、店铺运营、订单对账、国际物流规划、售后纠纷处理等核心环节。

我们可以通过几个典型任务来感受一下难度:定制瑜伽垫上架任务需要模型根据给定的发品计划、三家供应商报价和实拍图片,找到指定合作供应商,完成商品类目、销售国家、差异化定价和详情描述的填写,并从批量编号的相机照片中挑选出合格的商品图完成上传;跨境物流规划任务需要为东莞发往达拉斯的消费电子产品规划30天内可达的最优运输方案,计算保险、清关、海关担保和平台费用,找到总成本最低的路线,并在仿真货代平台完成海运订舱和货件验证。

还有售后退货处理任务,需要整合订单记录、物流扫描数据、仓库质检报告、客户沟通记录、现场照片、平台规则和截止时间,逐一判断每笔退货申请是接受全额退款、部分退款、拒绝退货还是需要补充证据,甚至向平台发起申诉;更复杂的跨平台对账任务则需要将天猫、京东、拼多多三套格式完全不同的原始订单数据清洗整合,统一SKU编码和订单状态,核对发货与结算的差异,计算每个SKU在各平台的收入、成本、佣金和最终利润,最终按照指定格式输出完整报表。

这些任务都是真实电商场景中的高频实操工作,看似繁琐重复,却正是智能代理最适合承接的场景。接下来我们看看,那些在代码领域表现亮眼的主流模型,在这类真实电商任务中的实际通过率如何。

本次评测基于开源的PI Harness框架执行,结果可信度较高:百分制评分下,仅有排名第一的Claude Opus 5勉强达到及格线,107个任务中完成65个,通过率60.75%;Qwen 3.8 Max与DeepSeek V4 Pro以49.53%的通过率并列第三。也就是说,大部分模型的任务通过率连50%都不到,超过一半的任务会完全失败,这就是当前大模型在真实工作场景中的真实表现。

评测的评分规则也远比想象中严格,我随机选取一个供应商采购任务来举例说明:任务背景是采购经理Dana休假归来,邮箱内积压了300封邮件,需要在当天推进铝合金笔记本支架的采购项目。模型需要从零散的邮件中还原项目最新的需求、规格和数量要求,从20家供应商中筛选出合格且单件落地成本最低的合作方。

完成选型后,还需要完成一系列标准化操作:仅为选中的报价添加正确标签,标记3封疑似更换收款账户的风险邮件,保存给供应商的回复草稿,创建项目启动会议,并按照指定格式输出JSON格式的总结报告。

这类任务的原始数据往往非常混乱,充分体现了真实办公场景的复杂性:项目需求分散在10封邮件中,中途还多次修改数量和要求;供应商会通过不同的联系人、邮箱、域名和显示名称发送报价,题目中还混入了4组名称相似但实际不同的供应商。模型需要综合工厂地址、联系电话、银行收款人信息、出口许可证等多个维度交叉验证,才能准确识别同一家供应商的不同报价。光是梳理这些信息就让人头疼,更别说完成全流程操作了。

开发团队为模型预置了Shopify、Gmail、日历、商品发布等工具接口,完成任务后,评测程序会自动检查邮箱、草稿文件、会议日历和JSON总结文件的最终状态,共计23组42项检查标准:选中的报价是否添加了正确标签?3封风险邮件是否全部标记?回复草稿的收件地址和会议日期是否准确?JSON总结中的供应商信息、报价、数量和淘汰原因是否完全匹配?

评分规则极其严格:只有所有23组检查全部通过,才能获得该任务的1分,只要有一项不达标就直接得0分。毕竟在真实的商业场景中,哪怕一步出错都可能导致订单丢失,没有“过程分”可言。最终得分按照通过任务数除以总任务数107计算,也就出现了前文提到的极低通过率,几乎没有模型能达到及格线。

如果使用开发团队自研的Accio电商Agent框架进行测试,整体通过率会有所提升:通过率超过50%的模型从2个增加到6个,毕竟该框架是针对电商场景专门优化的。当然,这只是全自动化评测的结果,在实际工作中,更多是人类与智能代理协同完成任务,实际完成率会比自动化评测更高。

如果我们对比代码领域的评测结果,就能看到明显的差距:以今年5月发布的DeepSWE评测为例,该基准包含113个任务,要求AI在真实开源代码仓库中独立完成复杂的跨文件软件工程修改。所有模型均通过mini-swe-agent框架执行,排名靠前的模型任务通过率均达到70%以上,远高于真实电商场景的表现。

类似的低通过率情况,也出现在其他领域的真实任务评测中。比如上月国内头部科技厂商联合高校发布的E-Bench评测集,模拟了王者荣耀、QQ音乐、腾讯会议三个产品场景,共计323个需要模型真实操作的任务:包括整理游戏好友与战队信息、搜索管理音乐歌单、筛选参会人员并预定会议等。

该评测测试了11个主流模型,表现最好的Kimi-K3的Avg@3得分为73.79%——这里的Avg@3指的是模型独立运行三次任务的得分平均值。但在实际场景中,我们需要的不是模型偶尔做对一次,而是能够稳定复现正确结果,因此评测团队还测试了三次运行的稳定性:表现最好的Kimi-K3三次全部正确的比例仅为58.82%,所有11个模型的稳定性得分均未超过60%。

生活服务领域的评测结果同样不容乐观:国内生活服务平台今年发布的VibeLifeBench评测,包含200个持续数周的长期生活任务,覆盖职业发展、健身规划、租房找房、日常购物、差旅安排等10个领域。该评测的最佳表现模型依然是Claude Opus 5,其Avg@3得分仅为32.5%,表现甚至比电商场景更差。

这三套评测集的任务类型、评价指标各不相同,无法直接横向对比,但至少可以证明:在各自覆盖的真实场景中,大模型的实际表现还有极大的提升空间。

想要改善这一现状,仅靠单一模型厂商的努力远远不够,需要全行业共同推进。正如该电商评测团队所言,他们会持续提炼真实工作任务,滚动更新并开放评测集数据。毕竟这类厂商的核心目标是打造智能代理与模型路由系统,只有模型能力真正提升,才能为客户创造最大价值。

但目前这类评测集大多偏向学术研究,更新频率较低,新发布的模型往往需要很长时间才能被纳入评测,因此暂时还无法将这些数据整合到AIHOT榜单中。不过我计划后续收集更多这类真实工作场景的评测集,自行搭建评测环境并完成测试,每有新模型发布就第一时间完成全量评测并更新数据,最终将这些真实场景的评分整合到AIHOT榜单中,方便大家查阅,感兴趣的朋友可以期待一下。

如果您手中有其他真实工作场景的评测集资源,欢迎在评论区留言分享。

最后我想总结的是:在AI的发展历程中,“会解题”和“会工作”之间还存在着不小的差距。当前大模型在代码编写等单一能力领域已经表现出色,但在大量真实工作场景中,依然有巨大的提升空间。毕竟,那些琐碎、混乱、没有明确标准答案的日常工作,才构成了我们真实的职场与生活,这也是AI落地真正需要攻克的难关。

以上内容不代表本平台立场,仅供读者参考