技术交流群招募:含大模型综述、论文推荐与优质资源

近期,某AI助手团队完成整合后,推出了一项面向AI Agent的刚需功能——手机远程控制电脑,这一更新让远程办公和AI辅助操作变得更加便捷高效。
该功能支持同时连接多台设备并自由切换,最亮眼的设计在于Windows端新增了独立虚拟桌面,AI执行任务时不会占用用户正在使用的本地桌面,实现了AI操作与个人使用互不干扰;而Mac端目前仅支持浏览器内的GUI操作,暂未推出虚拟桌面功能。
使用该功能需要确保手机和电脑端登录同一账号。在手机端点击快速操作按钮,选择对应任务类型后,系统会自动列出已登录的设备,用户可以根据需要选择对应的电脑,还可以为每一次对话分配专属项目标签,方便管理不同任务。首次连接时,电脑端会弹出授权提示,用户确认允许后即可建立连接。
用户可以通过手机向远程电脑发送自然语言指令,比如让电脑打开桌面的发票文件夹,汇总所有发票信息并整理成Excel表格;也可以在电脑端执行任务到一半时,临时离开岗位,通过手机端继续跟进并完成后续操作。
举个具体的例子,用户可以通过手机指令让电脑打开Chrome浏览器,访问指定邮箱,筛选出包含特定关键词的邮件并标记为红旗邮件。面对邮箱中大量相关邮件的情况,AI可以准确理解用户意图,仅选中符合要求的特定邮件进行标记,体现了GUI Agent不仅需要精准操作,更需要对用户意图的深度理解和信息整合能力。
在实际测试中,部分带有严格权限控制的软件无法被操作,比如部分游戏和社交软件,这属于正常的安全限制,大多数AI Agent都难以突破这类权限壁垒,避免封号等风险。
用户还可以尝试更复杂的任务,比如通过AI完成电脑密室逃脱类的任务,从访问桌面开始,按照线索依次打开不同文档、解压压缩包直至通关;也可以尝试操作专业剪辑软件进行自动剪辑,比如为视频添加加速效果和自定义封面,这类功能按钮密集的操作场景对AI的视觉定位和精准操作能力有较高要求,而该功能的表现十分流畅。
其实该AI助手背后的团队在GUI Agent领域早有技术积累,此前开源的UI-TARS-desktop项目就是一款可以通过自然语言操作电脑的原生GUI Agent工具,该项目最初仅获得少量关注,如今已经收获了超过38.6K的星标。该项目支持Windows、macOS和浏览器环境,可以通过界面截图识别元素,调用键鼠完成自动化操作,虽然暂未明确该新功能是否直接沿用该开源项目的技术,但足以证明团队在界面理解、视觉定位和电脑自动化操作领域的长期投入。
从功能逻辑来看,远程控制解决了用户必须守在电脑前的痛点,虚拟桌面解决了AI操作干扰个人使用的问题,GUI操作则解决了大量无API、无插件的软件无法被AI直接调用的难题,三者结合正是远程控制的理想形态。随着AI能力的不断完善和边界的拓展,未来用户将可以更放心地将各类任务交给AI,彻底摆脱对电脑本地操作的依赖。

