文章摘要
鉴于GUI仍是最普及交互入口,Qwen - UI - Agent作为以真实世界为核心的GUI智能体基座模型应运而生。它在各类GUI任务评测中表现优异,对标甚至超越行业旗舰模型。具备真机训练评测、严守安全边界、支持批量操作等亮点,还能实现可扩展的长程在线强化学习,通过AI驱动数据飞轮迭代,可主动服务及实现跨平台工作流。

当前CLI、MCP等工具正快速拓展智能体的能力边界,但海量既有的数字生态尚未完成工具化改造,图形用户界面(GUI)仍是数字世界最普及、最通用的交互入口。GUI智能体有望成为现有数字设备的通用执行器,只要存在操作界面,就能替代用户完成各类真实场景下的任务。

一款合格的GUI智能体基座模型,需要满足多项核心要求:能够在真实设备上稳定运行;能力强劲的同时严守安全边界;支持跨手机、电脑执行个人工作流;有机结合GUI交互与命令行操作;高效完成长周期任务;主动提供个性化服务;能够在较少人工干预下通过AI驱动实现能力迭代。

基于上述愿景,我们推出了Qwen-UI-Agent,一款以真实世界为核心的GUI智能体基座模型,覆盖移动端、电脑端、网页端以及深度搜索场景。相关技术文档、项目详情页与代码仓库可通过公开渠道获取。

性能表现

Qwen-UI-Agent在各类GUI任务评测中全面对标甚至超越行业旗舰模型:

  • 移动端:在MobileWorld评测中取得82.1%的成绩,分别领先GPT-5.6 Sol、Claude Opus、Seed 2.1 Pro达4.8、14.6、8.9个百分点;真机基准MobileWorld-Real得分92.2%,超越Gemini 3.1 Pro、Claude Opus、GPT-5.6 Sol与Seed 2.1 Pro;AndroidDaily评测得分高达97.5%,接近满分。
  • 电脑端:OSWorld-Verified评测得分79.5%,超越GPT-5.5、Gemini 3.1 Pro与Seed 2.1 Pro;OSWorld-v2 Partial分数达40.0%,相比基线节省58%的执行步数。
  • 浏览器与深度搜索:WebArena评测得分73.6%,位列所有对比模型第一;BrowseComp-ZH得分75.0%。
  • GUI Grounding:ScreenSpot-Pro评测得分81.5%,在其余4个grounding评测基准中也全部刷新行业最优成绩。
  • 通用能力:通用智能与Agentic能力全面保持或超越训练基座模型,在两类任务上大幅领先GUI专用模型,能够从容应对真实世界的长尾需求。

更多评测细节可查阅相关技术文档。

核心亮点

真机训练,真机评测

我们搭建了覆盖100余台真实手机、150余款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建MobileWorld-Real真机基准(包含400+任务、100+应用),打通了从模拟到真实的最后一公里。

本地生活场景示例

用户需求:今天约了朋友去天目里喝咖啡,帮我在高德地图查询详细地址,打开大众点评查找1公里内人气最高的咖啡馆并记录店名,再到小红书汇总前五条笔记,分析用户推荐的热门饮品。

行程安排场景示例

用户需求:下周三从北京返回杭州,帮我查询12306最早到达杭州西的高铁班次,计算从杭州西地铁站到阿里巴巴西溪园区的通勤时间,推算到达公司的时间,最后在钉钉安排主题为“出差归来项目同步”的会议,参会人为我和张三,会议时长1小时并设置提前5分钟提醒。

严守安全边界

Qwen-UI-Agent将安全校验贯穿任务执行的全流程:面对违法或高风险请求,它不会执行任何界面操作,直接拒绝并终止任务;遇到支付、数据删除、隐私授权等敏感场景时,会在关键步骤主动暂停,向用户说明情况,待获得明确确认后再继续执行。既可以完成操作任务,也能在关键时刻停止不当操作。

GUI与CLI混合动作空间,支持批量操作

除了GUI界面操作外,模型还可以直接执行命令行操作,并且在单次决策中批量输出多个动作。在电脑端任务中,CLI动作占比接近一半,约40%的动作以批量形式输出,大幅缩短了执行路径、拓展了能力边界并提升了执行效率,例如跨平台调研产品价格、生成比价方案等场景。

居家办公桌面配置示例

用户需求:我有一张120厘米宽、60厘米长的书桌,想配一套适合居家办公的设备,总预算不超过4000元。帮我从公开网站上挑选显示器、显示器支架、键盘和台灯,如有空间可以额外添加合适设备,每类比较多款产品,确保显示器重量在支架承重范围内,所有设备能合理放置在桌面上。整理三套不同价位的方案,绘制按实际比例的桌面布局图,附上推荐理由与产品评价及链接,优先考虑性价比,分别对应1000、2000、4000元的预算,最后生成展示用的HTML文件。

可扩展的长程在线强化学习

模型支持在超过100步的超长任务轨迹上进行在线强化学习训练,同时可支持约10000个并发环境的轨迹采集,配合模型自适应课程学习机制,能够持续攻克长周期复杂任务。

例如一段长达170步的数据分析调研任务:深度分析Google(Alphabet)从2019年至今的增长轨迹,覆盖营收、营业利润、净利润、利润率、研发投入、资本开支、员工人数、主要业务板块及重大战略变化。使用统一的数据口径计算同比增长率和复合年增长率,识别广告、云计算、AI、组织调整及基础设施投资等关键转折。数据需来自Alphabet财报、SEC文件等权威来源,并通过第三方渠道交叉核验,所有图表和结论需标注出处。最终将原始资料、可复现分析脚本、Excel工作簿、六页中文PPT和简明Word摘要整理到桌面的“Google Growth Analysis”文件夹中。

该任务中,GUI负责网页检索与数据源定位,CLI负责数据下载与分析,最终生成完整的分析报告并完成视觉校验与版式修正。

AutoResearch式数据飞轮

持续提升模型能力需要一套迭代式的闭环流程,涵盖任务设计、环境构建、验证器开发、数据整理、模型训练、评估与错误分析等多个环节。当这些环节主要由人工驱动时,迭代速度较慢且难以规模化。为此,我们提出了AI驱动的数据飞轮,将人类从执行每个环节的工作中解放出来,仅需要在关键节点进行高层监督与干预。

主动服务与跨平台工作流

通过强大的工作流调度能力,智能体不再被动等待用户指令,而是可以主动提供服务。例如当检测到用户的航班被取消,智能体可以主动识别受影响的行程,检索备选航班与高铁方案,结合用户日程评估可行选项并提供调整方案,经用户确认后执行,并在手机与电脑之间无缝接力完成后续操作。

航班取消主动服务示例

场景:智能体检测到用户次日清晨的航班被取消,导致用户无法按时参加14:00的重要会议。在用户提出请求前,智能体已主动搜索替代航班和高铁方案,评估可确保按时抵达的选项,并提供可供直接决策的行程调整方案。

跨端文件管理示例

用户需求:在手机相册中找到所有收据,将它们移动到远程桌面上的receipts文件夹,按日期重命名,并在该文件夹中创建一个Excel文件汇总账单。

此外,GUI与深度搜索可以协同工作:GUI负责真实界面的交互与执行,DeepSearch负责跨来源检索、筛选与核验信息,二者结合可以将反复点击浏览的信息检索流程简化为高效的API请求,再通过界面完成后续操作,大幅缩短执行路径、拓展信息获取范围。例如用户需要找出世界杯淘汰赛中落后反超且最大落后球数最多的比赛,智能体可先通过深度搜索获取信息,再打开小红书查看相关热门帖子。

以上内容不代表本平台立场,仅供读者参考