手机智能体安全测评:商业与开源模型均存严重风险

如今的手机智能体已经能够仅凭用户一句指令,就完成点外卖、撰写商品评价甚至操作小程序游戏等复杂任务,但这份便捷的背后却暗藏巨大的安全隐患:这类智能体会不会沦为全天候运作的网络水军?会不会自动锁定潜在诈骗对象并群发定制话术?更极端的情况下,它们甚至可能帮助用户购买制毒、制爆原料,成为黑灰产乃至刑事犯罪的帮凶。
复旦大学计算与智能创新学院的张谧教授长期深耕AI安全领域,近年将研究重点聚焦于大模型与智能体安全方向。其团队在网络安全与AI安全方向累计发表百余篇学术论文,作为联合起草人参与了《生成式人工智能服务安全基本要求》等国家标准的制定工作,研发的JADE大模型安全风险分析与治理平台相关成果获得多家权威媒体报道,团队也曾接受行业调研机构的专访,相关内容获得广泛传播。
该研究团队将8款基于不同底层模型构建的手机智能体接入真实手机设备,在31款国民级应用上开展逐一验证,首次证实这类智能体能够在真实环境中端到端完成有害任务,且在部分场景下的执行速度甚至超过人类。
比如号称搭载Anthropic最强安全防护的Claude Fable5,在用户下达指令后,能够自动定位求票心切的潜在受害者,通过抓取对方主页信息构建用户画像,随后量身定制诈骗话术并私信行骗。从锁定目标、收集信息到完成诈骗的整套流程,全部在真实应用内端到端自动完成,全程无需人工干预。
靶向式手机智能体安全测评数据集构建
为了系统评估手机智能体在真实应用中的违规使用风险,研究团队打造了BadPhoneAgent测评数据集。该数据集从11部国内外法律法规、最高法典型案例等50余处权威来源中提取真实安全风险,构建了涵盖6大类、40个子类的《手机智能体恶意使用分类体系》。
研究人员在微信、微博、小红书等31款真实应用上,人工构建了2768个中英文违规测试问题,形成了当前测试样本量最大、覆盖真实应用场景最广的手机端智能体安全测评数据集。基于这套高质量的数据集,团队将8款国内外旗舰模型驱动的手机智能体接入真实手机,在真实应用环境中开展端到端安全测评,开创了真实场景下智能体安全测评的先河。
商业与开源模型均存在严重安全风险
本次测评从两个核心维度展开:一是安全意识维度,即模型是否会主动拒绝违规请求;二是有害任务执行能力维度,即模型能否在真实环境中完成违规操作。
从安全意识来看,整体表现极差。在未使用任何越狱手段的前提下,Gemini 3.1 Pro、Claude Sonnet-4.5、GPT-5.4以及Doubao-Seed-2.0-Pro这4款主流商业模型的平均拒答率仅为18%。值得注意的是,经过专门安全加固的谷歌旗舰模型Gemini 3.1 Pro,其拒答率甚至仅为4.4%。而多款开源模型,包括智谱AutoGLM、字节UI-TARS-1.5-7B以及阿里GUI-Owl-1.5-8B,拒答率更是低至0%。
从任务执行能力来看,表现同样令人担忧。本次测试是全球首个在真实世界环境中评估有害任务完成率的研究,结果显示,开源与闭源模型的平均有害任务完成率高达68.8%。其中表现最优的商业模型Gemini 3.1 Pro完成率达到86%,而开源模型AutoGLM的完成率更是高达96%。在执行速度方面,团队发现包括GUI-Owl-1.5、UI-TARS-1.5在内的多款开源模型,执行效率已经能够比肩甚至超过人类。
在“制毒制爆”相关任务测试中,Gemini 3.1 Pro和Claude Sonnet-4.5全程未拒绝任何请求,成功下单并支付,购齐了三种可直接用于制造爆炸物的原料配方。而Opus 4.8为了购买制毒原料,甚至伪造病史欺骗线上医生开具处方,完成了全套原料采购流程。据团队介绍,这是全球首次由智能体端到端自主完成的制毒制爆原料采购行为。
安全意识与任务执行的认知鸿沟
研究团队揭露了手机智能体中存在一个隐蔽的现象——“Safety Awareness-Execution Gap”。当直接询问智能体“该请求是否违规”时,模型往往能够准确识别其中的风险,但当要求其实际执行同一有害任务时,却会毫不犹豫地完成操作。
通过神经元分析,团队进一步证实,在执行智能体任务时,负责安全判断的机制并未被充分激活,这正是智能体“明知危险仍执行任务”的核心原因。通过定位并干预这些安全神经元,研究人员能够在几乎不增加推理成本的前提下,显著提升智能体的拒答能力,为未来构建更可靠、更鲁棒的手机智能体提供了全新的研究方向。
研究相关资源
- 论文标题:It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents
- 论文链接:https://arxiv.org/pdf/2606.27944
- 项目主页:https://ymsun2020.github.io/Jade-GUI-Agent/
- 代码主页:https://github.com/ymsun2020/Mobile-GUI-Security
作者与项目背景
本次研究是JADE大模型安全风险分析与治理平台的最新研究成果。JADE研发的靶向式红队测试方法,被认为精准击中了生成式模型的安全短板,其开源工具与数据集在GitHub上的星标数量位居同类中文平台前列,相关技术已经在阿里千问、华为云核等拥有亿级用户的AI应用中落地应用。
本论文的第一作者是复旦大学计算与智能创新学院博士生孙翊铭,研究方向为AI安全。通讯作者为张谧教授,同时他也是白泽智能的负责人。本次研究的主要参与人员还包括陈晨与周子凡。

