文章摘要
近期腾讯公开两套AI模型评测基准,引发行业对AI模型场景化选型的讨论。7月24日推出的WorkBuddy Bench解决了现有AI编码测试痛点,对七款主流模型测试,得出无全能冠军、执行环境影响排名、开源模型在安全赛道竞争力更强等结论;7月28日公开的E - Bench聚焦真实产品场景,11款模型测试表现未达预期。两套体系虽有局限,但证明场景化选型是趋势。

近期腾讯连续公开两套内部AI模型评测基准,将完整的测试逻辑与题库对外开放,覆盖从代码开发到真实产品场景的多类任务,引发行业对AI模型场景化选型的广泛讨论。

7月24日推出的WorkBuddy Bench,由腾讯编码助手团队联合安全实验室打造,这套体系针对性解决了现有AI编码测试的两大痛点:一是多数公开评测题目可在网络直接检索,模型易通过记忆背题获得高分;二是部分闭源评测基于自有用户会话生成,虽贴近真实场景但外部无法验证题目偏向性。

为规避这些问题,评测题目全部从真实代码提交记录、代码审查请求与安全漏洞案例逆向改写而来,改写后的任务描述经搜索引擎验证无法找到原始出处,从根源上避免模型背题。整套评测共260道题,分为四个独立赛道:

  • 代码赛道(80题):基于Django、Flask、pytest等真实开源仓库构建环境,模型需自主查找文件、修改代码并通过隐藏测试用例得分。任务含10道修 bug 题目,剩余70道覆盖功能开发、测试编写、算法实现与数据分析,每道题还会模拟开发者、算法工程师、产品经理等不同角色的沟通语气,还原真实协作场景。
  • 前端赛道(70题):并非仅要求输出网页代码,必须交付可实际运行的产品,评测时通过自动化工具模拟用户点击、交互验证与数据持久化检查,一半题目需从零搭建页面,另一半涉及现有页面修改、回归测试编写与格式转换。
  • 办公赛道(50题):模型需处理包含表格、PDF、JSON、Markdown的混合文件工作区,不仅要产出正确交付文件,还要验证关联文件更新是否合理,是否存在意外副作用。
  • 安全赛道(60题):兼顾红蓝对抗场景,含38道攻击方任务与22道防御方任务,全程用确定性程序评分,不依赖大模型作为裁判,设置五层反作弊机制。

评测在两套不同执行环境下对七款主流模型测试,产出八份成绩单,核心结论有三点:

  1. 无全能冠军:Claude Opus 4.8在代码赛道领先,GPT-5.5在其中一套办公环境拿下86.05分,HY-3在另一套办公环境获82.08分,GLM-5.2在安全赛道两套环境均排第一,得分分别为76.32与80.86。
  2. 执行环境改变排名:代码赛道变动最明显,GPT-5.5与GLM-5.2在两套环境中排名完全反转,说明同一模型搭配不同工具链会产生差异,选型不能仅看纸面分数,需结合实际工具环境。
  3. 开源模型在安全赛道竞争力更强:GLM-5.2以80.86分位居第一,其后为GPT-5.5的77.91分与Claude Opus 4.8的65.87分。

7月28日公开的E-Bench则聚焦有状态的真实产品场景,测试模型通过多步工具调用完成复杂任务的能力,由腾讯混元团队推出,整套评测共323道任务。

评测基于三款腾讯产品构建模拟环境:王者荣耀的游戏社交与组队场景、QQ音乐的歌曲搜索与歌单管理场景、腾讯会议的员工查询与日程安排场景。这套环境并非直接抓取线上数据,而是从头合成完整数据库,团队先搭建每个产品的关系数据库结构,按表间依赖导入数据,再通过校验修补时序矛盾与统计错误,最终形成包含41张表、345列、69条外键约束、7.6万行数据与1219个实体的测试环境。

任务生成流程严谨:先由Claude Opus 4.7担任出题者,可直接执行SQL查询全库、运行代码,自主探索数据库状态、挑选目标实体并记录变更作为标准答案;再由GPT-5.5、Claude Opus 4.7与GLM-5.1作为验证者,独立验证任务可解性,至少两位验证者通过的任务才会被收录。

E-Bench最核心的设计是“信息差+工具差”:出题者可查看完整数据库,能生成依赖真实数据的任务,答案由数据库实际内容决定;解题者无法直接访问数据库,只能通过业务工具逐步查询,必须完成完整信息收集后再操作,而非直接猜测答案。同时出题者可直接执行代码,解题者仅能调用有限业务工具,想要完成遍历大量数据的任务,只能通过逐条调用工具实现。评测还设置变体测试,为解题者开放代码执行能力,对比表现差异。

11款前沿模型参与测试,整体表现未达预期:表现最优的Kimi-K3准确率仅73.79%,近四分之一任务无法完成。即使表现最好的模型,三次尝试全做对的比例仅58.82%,单次做对比例为87.62%,说明当前AI模型在复杂多步任务中的可靠性仍有较大提升空间。

代码执行能力对排名影响巨大:开放代码权限后,Opus-4.8得分从68.78%跃升至81.11%,直接反超Kimi-K3与GPT-5.5;Gemini-3.5-Flash排名从第9跃升至第6,得分涨幅达47%。不同场景难度差异明显:王者荣耀场景平均完成率43.64%为最难,QQ音乐场景61.39%为最简单,腾讯会议场景58.87%居中。

"我是市场营销部渠道运营组的胡伟杰,在深圳鹏创大厦办公。突发渠道事件,要紧急拉一个跨部门对齐会。参会人包括我自己,再从我的渠道运营组里挑除我之外工龄最长的两位深圳在职正式员工,另外从产品与设计中心下面的视觉设计组挑工龄最长的那位深圳在职正式员工。一共四个人,我来当发起人和主持人。时间这本月 4 月 21 日周一到 4 月 25 日周五之间,每天 9 点到 18 点之间,按半小时为步进扫一下这四个人的日程,挑出大家共同空闲的最早一个连续 1 小时时段……"

HY-3模型通过13轮对话、94次工具调用完成全部15个数据库状态变更且无错误,这类长链条多步编排能力是传统纯文本问答评测无法有效测量的。

E-Bench还统计了单任务API成本:DeepSeek-V4-Pro单任务成本仅0.028美元,但准确率仅47.7%;Kimi-K3单任务成本0.634美元,准确率达73.8%,不同模型在成本与性能间的平衡差异显著。

虽然两套评测体系存在局限性:WorkBuddy Bench代码赛道以Python为主,跨语言覆盖有限,办公赛道未涉及OCR与GUI操作,部分模型测试配置存在细微差异;E-Bench环境与任务为合成数据,与真实线上产品复杂度有差距,且未开源环境与任务,仅覆盖单个产品内任务,未涉及跨产品流程。但它们的核心价值在于证明当前无全能AI模型,场景化选型已成为行业趋势,公开评测方法将成为未来行业标准化的重要基础。

以上内容不代表本平台立场,仅供读者参考