文章摘要
国内科研团队开源KnowAct - GUIClaw,为个人AI助手带来新能力。该框架将长期任务管理与底层界面操作解耦,把任务分为Know、Route、Act、Reflect四阶段。在MobileWorld测试中,搭载Kimi - K2.6模型的它成功率达64.1%,经验和技能可跨模型迁移。其目标是让Host、工具与UI协同,未来将探索原生联合规划与行动。

当你让个人AI助手依次完成提取会议地址、转发联系人、规划路线这类跨应用任务时,它能否像人一样顺畅协作?传统的通用智能体方案往往只是简单外挂GUI工具,很容易出现跨应用信息丢失、依赖频繁变动的图形界面、执行轨迹用完即弃的问题——很多GUI智能体每次执行任务都像第一次使用设备,走过的弯路不会成为经验,成功的操作也无法沉淀为可复用的能力。

近期,国内科研团队开源了KnowAct-GUIClaw,提出了“Know Deeply,Act Perfectly”的设计范式,也就是“知道得越深,行动得越准”,为个人AI助手带来了全新的能力边界。

从“外挂GUI Agent”到Host-GUI协同

这款框架将长期任务管理与底层界面操作解耦:负责全局调度的Host Agent保留对话上下文、用户画像、外部工具和任务进度,判断“做什么”;而可插拔的GUIClaw则负责感知屏幕、规范操作、连接设备后端、校验技能并记录轨迹,决定“如何在界面上完成”。

这种分工让效率成为系统设计的一部分,只有需要读取实时页面、操作登录态应用或设备验证时,才会调用GUI智能体,其余信息型任务可以直接通过上下文和工具完成,减少不必要的视觉交互开销。

在此基础上,KnowAct-GUIClaw将一次任务组织为Know、Route、Act、Reflect四个阶段,并让经验记忆与执行技能在任务结束后重新回到下一轮决策中。

Know + Route:先理解上下文,再把跨应用任务拆清楚

在真正操作界面前,Know阶段会主动汇集当前对话、用户画像、历史任务、可用技能和经验,辅助信息不会替代用户指令和实时屏幕证据,当指令模糊时,系统会从记忆中提出明确的默认假设。

随后,Route阶段将请求拆分为单应用任务或有序跨应用工作流,每个子任务都明确声明目标应用、所需输入和输出结果,不再依赖自由文本传递信息,而是通过临时Blackboard(黑板)保存结构化中间结果,上游的观察结果直接作为下游的输入,如果缺失必要信息,工作流会直接停止,避免后续猜测编造。

比如从邮件读取时间设置闹钟、跨应用比价、读取订单发送短信这类任务,都可以通过这种方式将跨应用数据流转化为可检查、可恢复的结构化契约。

Act:统一GUI操作、可复用技能与快捷路径

进入Act阶段后,GUIClaw可以在统一的混合动作空间中执行任务,既支持基础的点击、滑动、输入等操作,也可以调用沉淀的技能、经过验证的Deep Link/Intent快捷路径,需要用户授权时也会主动发起请求。

这里的技能不是简单的轨迹重放,每个技能都包含适用平台、参数、可靠性统计、操作步骤和状态契约,调用前会检索匹配当前任务的候选技能,执行中还会逐步检查页面状态是否符合预期,如果不匹配可以进行有限恢复、跳过可选步骤,或者退回普通UI操作。

Deep Link和Intent同样遵循先发现后验证的原则,不会直接依赖应用清单,而是实际启动入口后结合前台应用、UI树、截图和参数进行页面级验证,只有通过验证的入口才会加入技能库成为快捷路径。

举个跨应用比价的例子:系统通过用户画像获取目标商品型号,分别调用京东和淘宝查询,经过验证的京东搜索快捷路径可以一步直达商品结果页,而淘宝则需要五次常规GUI操作,两个平台的价格通过Blackboard回传后,由Host完成比价并输出结果。

Reflect:让每次成功和失败都成为下一次的起点

任务结束后,系统不会保存冗长的日志,而是从执行轨迹中提炼两类长期资产:

  • 经验记忆:保存可检索的文字策略,包括成功做法、失败原因、应用选择、界面布局、快捷路径可靠性和恢复建议,用于影响后续的路由和执行判断

  • 执行技能:保存参数化、可运行、带状态验证的操作流程,用于压缩重复导航和高频交互

系统会过滤掉空轨迹、过短轨迹和异常终止的记录,对于可复用的成功过程,会从任务、平台、应用、参数、截图和控件信息中抽取新技能;对于执行失败的技能,则会根据失败步骤、页面证据和错误反馈进行定向修复,而不是生成全新流程。

这种“记住为什么、学会怎么做”的双层机制,让文本经验和可执行技能各司其职。比如在Mastodon邀请链接任务中,没有经验记忆时,GUIClaw会在移动端设置中反复尝试;而检索到历史失败经验后,系统会在低层操作开始前修正上下文,转向网页管理后台,再通过实时页面证据指导后续操作。

开源模型在MobileWorld长程任务上展现SOTA性能

在面向长程跨应用GUI任务的MobileWorld基准测试中,搭载Kimi-K2.6开源模型的KnowAct-GUIClaw取得了64.1%的成功率,达到了当前的SOTA水平。

值得注意的是,这一提升并非单纯依赖更强的基础模型:加入Host和经验记忆后,Kimi-K2.6的表现从55.6%提升至61.5%,进一步启用自进化技能后达到64.1%,累计提升了8.5个百分点。这说明持续积累的经验和可复用技能,确实可以转化为更可靠的GUI执行能力。

此外,框架沉淀的经验和技能还具备跨模型迁移潜力:将Kimi-K2.6轨迹中提炼的能力迁移到Qwen3.5-35B-A3B后,其成功率提升了16.2个百分点。同时,技能复用还可以减少重复操作,节省约6%的Token消耗,让任务执行更准确高效。

从移动端到桌面端,KnowAct-GUIClaw已经在Android、iOS、HarmonyOS和Windows等环境中完成验证,展现了良好的跨平台适配能力。

不只是“会点屏幕”:工具与UI操控协同

KnowAct-GUIClaw的目标不是让GUI智能体包办一切,而是让Host、外部工具与UI操作围绕同一任务状态协作。比如在一个会议地址查询案例中,Email任务只返回了酒店名称,无法满足后续短信和地图任务对完整地址的要求,Host检测到输出契约未满足后,先通过网页搜索补全街道地址,再将结构化结果分别传递给Messages和Maps任务,最终完成地址发送和路线规划。

另一个联系人缺失的案例中,按姓名发送消息的UI任务失败后,Host会保留当前进度,从简历中恢复电话号码后重新规划Messages子任务,让失败不再意味着整条工作流推倒重来,而是成为可以继续编排的检查点。

项目还提供了跨应用消息恢复、Blackboard比价、iPad精细图像编辑、桌面商品调研、技能引导结算和论文检索等交互演示,覆盖了移动端和桌面端多种场景。

总结与展望

KnowAct-GUIClaw从两个方向扩展了通用个人助手的能力边界:一方面,通过可插拔的GUIClaw补足了无标准API、登录态应用和动态界面中的跨平台操作能力;另一方面,通过可归因的经验记忆和技能库,建立了从执行、反思到再次执行的自进化闭环。

从“完成一次任务”走向“积累长期能力”,个人AI助手不仅需要更强的单步视觉定位能力,还需要理解用户与上下文、组织跨应用信息、选择GUI与非GUI路径,并将真实执行经验沉淀为可调用的知识和技能。这正是“Know Deeply,Act Perfectly”的核心:知行合一,知道得越深,行动得越准;每一次行动,又会反过来丰富下一次的认知。

未来团队还将探索通用外部工具与GUIClaw的原生联合规划与行动方式,让系统在同一个决策周期内权衡知识检索、工具调用和GUI操作,进一步减少Host与GUI子智能体之间的通信和串行切换开销。

以上内容不代表本平台立场,仅供读者参考