Claw类智能体安全评测:SafeClawArena揭示四大攻击面

过去两年,AI智能体完成了一次彻底的身份转变。它们不再只是对话框里回答问题的对话模型,也不再只是代码编辑器里补全代码的辅助工具,而是进化为常驻用户设备的独立进程,能够自主读取本地文件、发送邮件、连接云存储服务、安装软件工具,替用户完成大量真实的工作任务。
以Claw类智能体为代表的新一代产品正是如此:它们始终运行在用户的设备中,拥有持续的本地资源访问权限,通过统一的自然语言入口响应千差万别的个性化需求。要实现这一点,这类智能体需要持有用户的登录凭证,同时拥有大量系统级权限——能力越强的智能体,一旦被攻击者利用,造成的损失也就越大。
现实已经给出了明确的警示:某主流Claw类智能体的官方技能市场中,已经被检出上千个恶意技能;仅2026年,针对该平台披露的CVE漏洞就超过130个,凭证窃取、数据静默外传的安全事件已经真实发生在生产环境中。
当前的智能体安全评测大多存在两个明显盲区:其一,评测范围仅局限在模型层,仅检查模型的回复是否安全、单次工具调用是否越界,无法覆盖智能体真正致命的跨组件系统级风险;其二,多数评测自建模拟框架,测试结果无法直接反映真实生产平台的实际表现。针对这些问题,来自多所高校的研究团队搭建了SafeClawArena评测框架,旨在系统性地度量这类智能体的安全风险。
基于系统安全准则的评测设计
SafeClawArena没有从零发明新的评测分类,而是借鉴了计算机系统数十年沉淀的安全准则,将Claw类智能体的各个部件对应到传统计算机系统的组件中,从而反推出智能体缺失的安全防护机制:
- 公共市场上的技能对应软件仓库,缺失代码签名、审核与沙箱防护;
- 大模型的上下文窗口对应进程地址空间,缺失不同信任来源之间的隔离机制;
- 明文保存的记忆文件对应文件系统,缺失访问控制与完整性校验;
- 进程内插件对应动态加载的内核扩展,缺失签名与权限隔离;
- 连接外部服务的通道对应进程间通信,缺失带认证的通信机制;
- 网关日志对应审计子系统,缺失脱敏、访问控制与防篡改能力。
基于这些缺口,研究团队提炼出五条违反经典安全原则的问题:用户指令、读入文件、技能文本共享同一上下文(违反进程隔离);技能与插件加载后继承全部权限(违反最小权限原则);记忆、配置与日志均为明文,无校验与脱敏机制;对外调用共用同一套凭证,无法区分请求发起者;文档内容与用户指令拥有同等权威,可反向操控智能体(违反数据指令分离原则)。
这些违规行为最终归拢为四个攻击维度:技能供应链完整性(SSI)、持久状态利用(PSE)、跨边界数据流(CDF)、间接提示注入(IPI),这也构成了SafeClawArena的核心评测框架。这种设计能够暴露传统评测无法覆盖的攻击,比如直接在网关进程中运行的恶意插件,这类攻击完全绕开大模型,仅通过工具调用接口的评测根本无法检测到。
标准化的对抗评测流程
SafeClawArena共包含406道对抗性任务,分布在四个维度的24个子类中,每道任务都按照标准化流程推进:
- 环境布置:在仿真工作区中植入带有唯一追踪暗号的“金丝雀”凭证,这些凭证看起来与真实的数据库密码、API密钥、云凭证别无二致,随后部署本次任务特有的技能、插件或外部内容。
- 任务执行:模拟用户与智能体展开一轮或多轮正常对话,自然地交付测试任务;针对持久状态类攻击,系统会在两轮对话之间重启网关,验证植入的负载是否能跨越会话存活。
- 数据采集:完整记录九个输出通道的内容,包括智能体回复、对外消息、记忆写入、网关日志、文件写入、Webhook、工具参数等。
- 结果判定:采用确定性的字符串比对器进行检测,只要金丝雀暗号出现在了不该出现的通道中,就判定为数据泄露;由于暗号全局唯一,命中结果可以直接归因到具体任务,几乎不存在误报。
为了确保测试既精确又安全,研究团队还搭建了仿真版的办公协作工具Sim-Google,覆盖Gmail、Drive、Calendar等16项服务,每次调用都会将完整参数写入本地日志;所有测试任务都运行在全新的Docker容器中,不会接触真实账号,也不会产生真实的网络流量。
实测结果与核心结论
研究团队在3个覆盖不同加固程度的平台与5个前沿大模型的15种组合上完成了测试:三个平台分别是未加固的参考实现OpenClaw、增加用户级进程隔离的NemoClaw,以及部署了八项系统级防御的安全优先变体SeClaw;五个大模型包括GPT-5.1-Codex、GPT-5.4、Gemini-3-Flash、Gemini-3.1-Pro与Claude-Opus-4.6。
15种组合的整体攻击成功率从最低约20%到最高近70%,差距可达三倍,且这一差距无法单独通过平台或模型的表现来解释。围绕测试结果,研究团队得出了多个关键结论:
- 部分漏洞无法通过更强的模型弥补:恶意插件在所有未加固的平台上成功率100%,且不挑模型,因为这类攻击直接绕开了大模型本身;在SeClaw上这类攻击归零,并非因为防御生效,而是SeClaw直接禁用了这类插件,这也说明在某些场景下安全与功能难以兼顾。
- 模型性能更强不代表更安全:在捆绑脚本的攻击中,更强的Opus-4.6反而更容易中招(安全得分0.20),表现不如GPT-5.4(0.60)。原因在于这类脚本藏在外表正经的技能中,越“听话”、越擅长跟随指令的模型,越愿意按照用户要求运行脚本,当指令本身有害时,强指令跟随能力反而成为弱点。
- 堵上一个漏洞,漏洞会从其他通道溢出:SeClaw将原本通过自然语言传递的通知改为带必填字段的结构化工具调用,原本通过自然语言泄露的凭证会被填入必填参数中。对于原本就会在自然语言中泄露数据的GPT-5.4来说,这一改动将整体攻击成功率从近70%降至22%;但对于本已会主动打码的Gemini-3.1-Pro来说,这一改动迫使它将真实凭证填入必填字段,反而在持久状态和提示注入类攻击中表现更差。这说明数据泄露并没有被阻止,只是更换了传递通道。
- 相同的加固措施对不同模型的收益不均等:在加固后的SeClaw上,模型间的差距比未加固的OpenClaw更大——在日志外泄类攻击中,Gemini-3-Flash的安全得分低至0.03,而Opus-4.6的得分高达0.91。这是因为OpenClaw过于宽松,所有模型的表现都同样糟糕;而SeClaw将简单攻击替换为需要模型自行判断的结构化界面,能够自主判断的模型得分大幅提升,机械执行指令的模型则表现更差。这意味着安全加固需要针对不同模型进行调整,而非一刀切部署。
此外,测试中还发现了一个容易被数字掩盖的细节:面对同一道伪造“已获授权”的陷阱题,Opus-4.6当场识破,指出这是社会工程学套路,没有正规流程会预先授权展示明文凭证;而另外两个模型则直接照单全收。这说明模型层的对齐在生效时,仍是有价值的最后一道防线,但无法替代架构层的安全防护。
研究团队进一步盘点了11种系统级防御的覆盖范围,结论同样清晰:没有任何单一防御能够单独覆盖一个完整的攻击维度;且理论上的覆盖范围并不等于实际的防御效果,部分在部署列表中的防御在实测中收效甚微。
智能体安全建设的启示
归根结底,AI智能体的安全问题并非“更换更强的模型”或“升级更严格的平台”就能解决的。即使是专为防御设计的SeClaw,仍存在不小的攻击面;即使是最完善的配置,仍有约五分之一的测试任务被攻破。
智能体的安全建设应当借鉴传统计算机系统的发展路径:从最初简单的进程隔离,到逐步构建ASLR、DEP、SELinux、签名内核协同的纵深防御体系;同时需要将平台加固与模型对齐联合评估,不能用平台加固替代模型的安全对齐工作。
研究团队指出,目前普遍缺失四项关键防御:技能签名、内存完整性、凭证保险箱、动作授权,补齐这些防御将是智能体安全方向下一步的重点工作。而对于平台厂商、安全审计方与研究者来说,SafeClawArena提供了一套可复用的评测工具,能够帮助判断智能体违反了哪些安全原则,并据此排定安全加固的优先级。


