文章摘要
某AI助手团队整合后推出面向AIAgent的手机远程控制电脑功能,让远程办公和AI辅助操作更便捷。该功能支持多设备连接与切换,Windows端有独立虚拟桌面,Mac端仅支持浏览器内GUI操作。使用时需同账号登录,可发自然语言指令。虽部分软件受权限限制,但复杂任务操作流畅。团队此前开源项目有技术积累,此功能未来有望让用户摆脱本地操作依赖。

近期,某AI助手团队完成整合后,推出了一项面向AI Agent的刚需功能——手机远程控制电脑,这一更新让远程办公和AI辅助操作变得更加便捷高效。

该功能支持同时连接多台设备并自由切换,最亮眼的设计在于Windows端新增了独立虚拟桌面,AI执行任务时不会占用用户正在使用的本地桌面,实现了AI操作与个人使用互不干扰;而Mac端目前仅支持浏览器内的GUI操作,暂未推出虚拟桌面功能。

使用该功能需要确保手机和电脑端登录同一账号。在手机端点击快速操作按钮,选择对应任务类型后,系统会自动列出已登录的设备,用户可以根据需要选择对应的电脑,还可以为每一次对话分配专属项目标签,方便管理不同任务。首次连接时,电脑端会弹出授权提示,用户确认允许后即可建立连接。

用户可以通过手机向远程电脑发送自然语言指令,比如让电脑打开桌面的发票文件夹,汇总所有发票信息并整理成Excel表格;也可以在电脑端执行任务到一半时,临时离开岗位,通过手机端继续跟进并完成后续操作。

举个具体的例子,用户可以通过手机指令让电脑打开Chrome浏览器,访问指定邮箱,筛选出包含特定关键词的邮件并标记为红旗邮件。面对邮箱中大量相关邮件的情况,AI可以准确理解用户意图,仅选中符合要求的特定邮件进行标记,体现了GUI Agent不仅需要精准操作,更需要对用户意图的深度理解和信息整合能力。

在实际测试中,部分带有严格权限控制的软件无法被操作,比如部分游戏和社交软件,这属于正常的安全限制,大多数AI Agent都难以突破这类权限壁垒,避免封号等风险。

用户还可以尝试更复杂的任务,比如通过AI完成电脑密室逃脱类的任务,从访问桌面开始,按照线索依次打开不同文档、解压压缩包直至通关;也可以尝试操作专业剪辑软件进行自动剪辑,比如为视频添加加速效果和自定义封面,这类功能按钮密集的操作场景对AI的视觉定位和精准操作能力有较高要求,而该功能的表现十分流畅。

其实该AI助手背后的团队在GUI Agent领域早有技术积累,此前开源的UI-TARS-desktop项目就是一款可以通过自然语言操作电脑的原生GUI Agent工具,该项目最初仅获得少量关注,如今已经收获了超过38.6K的星标。该项目支持Windows、macOS和浏览器环境,可以通过界面截图识别元素,调用键鼠完成自动化操作,虽然暂未明确该新功能是否直接沿用该开源项目的技术,但足以证明团队在界面理解、视觉定位和电脑自动化操作领域的长期投入。

从功能逻辑来看,远程控制解决了用户必须守在电脑前的痛点,虚拟桌面解决了AI操作干扰个人使用的问题,GUI操作则解决了大量无API、无插件的软件无法被AI直接调用的难题,三者结合正是远程控制的理想形态。随着AI能力的不断完善和边界的拓展,未来用户将可以更放心地将各类任务交给AI,彻底摆脱对电脑本地操作的依赖。

以上内容不代表本平台立场,仅供读者参考