文章摘要
8月19日消息,国际投行杰富瑞对全球八款主流AI办公Agent进行真实办公场景实测。阿里千问办公综合得分位列第一,在各细分场景优势突出。其隐含Harness得分也居首,且使用成本低于部分海外同类模型。当前AI Agent市场竞争向企业级延伸,千问办公适配企业需求,已打通钉钉,未来可助企业提升效率。

8月19日消息,国际投行杰富瑞的分析师团队近期完成了一项针对全球八款主流AI办公Agent的真实办公场景实测。最终测试结果显示,搭载模型与工程框架协同机制的阿里千问办公,综合得分位列所有参评产品首位,表现优于美国的Claude Cowork、Codex等同类Agent工具。

本次测试共设置了五项贴近真实办公场景的任务,涵盖多文件整合的公司年报摘要生成、联网检索并对比企业经营数据、通过桌面浏览器完成信息检索与文档创作、基于业务数据制作英文演示文稿,以及参考素材生成营销宣传海报。从测试表现来看,千问办公整体发挥均衡,在复杂办公任务处理、网页浏览器操控以及多模态内容生成等细分场景中优势尤为突出,也是本次测评中唯一在所有维度都拿到90分以上成绩的Agent产品。

测试报告还将Agent的整体能力拆解为底层模型与运行框架两大模块进行专项分析。其中所谓的Harness,指的是围绕核心模型搭建的整套工程化运行机制,包含指令调度、上下文管理、工具调用、边界控制、反馈纠错以及整体治理等多维度能力。根据杰富瑞的测算结果,千问办公的隐含Harness得分位居本次参评的八款产品之首,领先于Claude Cowork、Codex等其余七款国内外主流Agent产品。这一结果也意味着,在底层模型性能之外,如何通过工程与产品能力将模型智能稳定转化为实际任务成果,正逐渐成为AI Agent赛道竞争的核心维度之一。

除了任务完成表现之外,使用成本也成为AI Agent商业化落地过程中不可忽视的重要考量因素。测试报告显示,千问办公底层搭载的Qwen 3.8 Max模型API调用价格,明显低于部分海外头部同类模型。考虑到AI Agent通常需要进行多轮推理、持续调用各类工具并执行长链路任务,企业在后续衡量Agent产品价值时,除了模型性能与产品能力外,也会进一步关注单任务执行成本(Cost per Task)。阿里Qwen模型与千问办公Agent的组合,在性能表现与使用成本之间实现了较好的平衡。

近几个月以来,AI Agent的市场竞争正逐步从个人办公场景向企业级场景延伸。杰富瑞的报告指出,对于企业级AI Agent而言,工作流适配能力与生态协同水平是构建核心竞争壁垒的关键。随着Agent持续对接企业内部数据、业务系统、协作工具以及权限体系,用户的历史任务记录、工作习惯、集成连接器、自定义技能以及自动化流程会逐步沉淀在产品当中,最终形成更高的用户使用粘性与迁移成本。

据官方介绍,千问办公不仅能够帮助个人用户提升办公效率,同时也针对企业的AI办公需求进行了专门设计,这也是该产品的核心特色之一。目前千问办公已经初步完成与钉钉IM工具的打通,企业员工可以通过该工具完成群聊内容总结、文档与表格创建、消息与邮件收发等日常办公操作。在未来,企业客户还可以将千问办公接入到自身复杂的真实工作流中,全面对接企业内部数据库与业务流程,进一步帮助企业提升整体办公与组织运营效率。

以上内容不代表本平台立场,仅供读者参考