文章摘要
2026年7月17日,百度文心助手任务Agent登顶PinchBench v2,成首个获该榜单总榜第一的国产智能体系统。该评测重落地能力,文心靠综合实力领先。它能完成多类复杂任务,源于百度二十余年技术积累,核心技术已用于百度App等。

2026年7月17日,百度文心助手任务Agent以最高分94.6%、平均分94.4%的成绩登顶全球工程向AI智能体评测榜单PinchBench v2,成为首个以正式产品身份拿下该榜单总榜第一的国产智能体系统。在59个参评模型中,文心助手任务Agent排名第一,领先Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)以及OpenAI GPT-5.6-luna(88.7%)等竞品。

这项评测,考验的是无法注水的落地能力

PinchBench由Kilo AI推出、OpenClaw社区维护,和MMLU、GPQA这类传统大模型基准有着本质区别:传统评测更多考察模型的知识储备,也就是“知不知道”,而PinchBench的核心是验证智能体“能否完整完成一件事并交付可验证的最终结果”。

本次v2版本包含23个真实工作场景、147项具体任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,累计完成617次测试运行。评分采用“自动化校验+大模型评审”的双轨机制,全程零人工干预,确保结果客观公正。

更关键的是,PinchBench衡量的是模型与Agent框架的综合能力——即便是同一底座模型,搭载不同Agent框架,最终评测得分也会存在明显差距。这意味着文心助手任务Agent拿下榜首,靠的不是单一模型性能,而是模型能力与系统工程协同打造的综合实力。

百度AI搜索团队已在GitHub开源完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147个任务的执行快照、交付物以及大模型评审打分理由全量公开,任何人都可以逐条复现整个评测过程。

从“动口”到“动手”,落地能力拉满

本次评测中的多个高难度任务,都被文心助手任务Agent轻松完成,我们可以通过典型案例感受其能力边界:

比如财报分析任务中,要求Agent在无预设数据文件的前提下,自主检索GitLab 2025年第三财季财报原文或电话会议记录,定位相关利润率指引,计算出非GAAP运营利润率约18%,并得出其超出指引约500个基点的结论,最终将结果写入指定文件。该任务的五个自动化评分维度——文件创建、指标定位、实际值与指引值提取、基点计算结论,全部拿到满分1.0。

另一个安全工程类任务要求Agent分析Node.js应用的多个CVE漏洞,按优先级分级并制定修复计划:需将express RCE和JWT bypass两个CRITICAL级漏洞标记为P0,其中JWT bypass因存在活跃利用记录需特别标注;将PostgreSQL SQL注入定为P1并结合PCI DSS支付路径给出上下文;将仅影响构建阶段的依赖漏洞降级为P2/P3;同时制定五批次修复计划,附4月12日紧急热修、4月14日P1批次等具体部署窗口。最终大模型评审给出“所有维度表现卓越”的结论,得分同样为满分1.0。

还有合同法律分析任务,要求读取软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要——这类任务过去通常需要律师助理花费数小时。文心助手任务Agent的输出结果识别出客户方12项风险、供应商10项风险、5项共享风险,精准发现六期分期付款结构的现金流前置问题、IP转让条件的产权间隙,四个评分维度全部拿到满分1.0。

除了企业级复杂任务,文心助手任务Agent同样能轻松应对日常办公需求:比如用户上传职业数据表后,仅需提出“统一表头格式,新建汇总sheet,按职业大类制作汇总表和Top10/Bottom10榜单,生成图表对比各职业大类就业人数”的要求,这条带有内部依赖的任务链,任何环节出错都会导致流程中断,但文心助手任务Agent可自主拆解任务并一次性完成全部流程。

如果用户无法给出详细指令,仅提出模糊出行需求如“这周末想从北京去青岛玩两天solo trip”,Agent可自主检索交通、住宿、景点实时数据,排出完整行程、生成预算清单和避坑指南,交付可直接使用的完整攻略。

对于需要重复完成的高脑力劳动,用户还可设置定时任务,比如“每周一晚上十点,帮我汇总近一周的高质量AI领域论文,用投研报告风格的HTML格式交付”。文心助手任务Agent可7×24小时稳定运行,用户无需时刻在场等待响应。

为何百度能拿下这一成绩?

这一成绩背后,是长达二十余年的技术积累作为支撑。百度是一家在意图理解领域深耕多年的企业,核心技术沉淀为文心助手任务Agent提供了坚实基础。

文心助手任务Agent依托百度搜索猎户座AI引擎的多智能体框架构建。从架构逻辑来看,搜索引擎本身就是最早的Agent雏形——从接收用户意图、拆解任务、调用工具到验证结果,这套完整链路百度已经跑了二十余年。随着技术发展,百度的工具集从最初的索引爬虫,升级为代码执行环境、文件处理器和实时API接口,输出内容也从早期的蓝链列表演变为结构化报告和可运行代码,但底层任务执行逻辑一脉相承。

本次评测中,文心助手任务Agent将模型任务评估得分提升至94%以上,充分证明优秀的系统架构与工程实现,能够显著释放模型潜在能力。即便是同一底层模型,换上文心助手任务Agent的框架,任务完成率也会明显提升。在Agent时代,框架工程能力的重要性正在超过单纯的模型参数比拼。

目前,文心助手任务Agent的核心技术已全面应用于百度App及文心助手,用户可登录chat.baidu.com,点选「任务」板块即可体验相关功能。

以上内容不代表本平台立场,仅供读者参考