AI热点:DeepSeek涨价、Meta降价、开源安全与Agent漏洞

近期,Anthropic公开了其旗下AI助手Claude在网页端、开发者工具以及桌面产品中的安全隔离架构设计方案。该公司强调,智能代理(Agent)的安全防护不能仅依赖权限确认或是模型自身的安全机制,更核心的思路是通过文件系统、网络通信以及执行环境等基础设施,为Agent建立确定性的安全边界。文章中梳理了多起发生在信任边界和数据出口路径上的安全事件,以及这些事件如何推动Anthropic调整相关安全设计。
Anthropic将Agent面临的安全风险归纳为三类:用户误用、模型自身的错误行为,以及通过文件、工具或网络内容发起的外部攻击。团队指出,分类器、系统提示词以及模型训练等机制虽然可以对模型行为产生影响,但无法提供绝对的安全保证。真正决定Agent能够访问哪些资源、可以向外传输哪些数据的,其实是运行环境本身施加的限制。
Anthropic将Agent系统划分为三个层次:带有概率性的模型层、执行环境层,以及可能影响模型行为的外部内容层。
以Claude.ai为例,其代码执行环境运行在基于隔离基础设施的临时gVisor容器中,完全无法访问用户的本地文件系统。而Claude Code最初是直接运行在开发者本机上的,一开始采用逐项授权机制:每次写入文件、执行Shell命令或是访问网络时,都需要用户手动确认。但Anthropic的测试数据显示,用户最终批准了约93%的权限请求,这让持续依赖人工确认的安全方案实际价值大打折扣。随后团队为Claude Code引入了操作系统级别的沙箱:macOS环境下使用Seatbelt,Linux环境下使用bubblewrap。新的设计允许Agent在当前工作区内读写文件,但默认禁止访问外部网络。Anthropic表示,这一调整让权限确认弹窗的数量减少了84%。
团队还披露了一起真实的安全事件。有用户反馈,在尚未确认是否信任某个项目目录的情况下,Claude Code就已经开始解析其中的本地配置文件。其中一个具体案例中,代码仓库里的.claude/settings.json定义了一个会在启动时自动执行的Hook。针对这一问题,Anthropic修改了实现逻辑:只有当用户明确选择信任该项目之后,系统才会解析并执行项目中的本地配置。
Anthropic还分享了一次受控红队测试,用来验证仅依赖权限确认或是分类器判断用户意图的局限性。在测试中,攻击者首先通过钓鱼攻击诱导员工,随后让Claude Code收到一条看似合理的指令:读取AWS凭证,并将其发送到外部地址。测试结果显示,在25次测试中有24次,Claude都执行了数据外传操作。这一结果表明,即便请求看起来来自合法用户,也不能仅依靠授权机制来判断安全性。无论请求来自真实用户、模型自身的误判,还是恶意工具生成的输出,文件系统隔离和出站网络限制等底层安全机制,都必须能够阻止凭证被窃取。
相比Claude Code,Claude Cowork面向的用户更难判断Shell命令是否安全,因此采用了更严格的隔离机制。最初的设计中,Agent完全运行在一台虚拟机内,仅将用户指定的工作目录挂载到虚拟机,同时将各种凭证保存在宿主机的密钥链中。后来为了提升系统可靠性,Anthropic将Agent的主循环迁移到了宿主机,而代码执行仍然保留在虚拟机内部。
不过这套设计也暴露出域名白名单机制的一个重要局限。有第三方安全研究人员披露了一处漏洞:恶意文件能够诱导Claude通过Anthropic自身的Files API,将工作区文件上传到攻击者控制的账户。这是因为api.anthropic.com已经被加入了白名单,所以请求能够顺利通过目的地址检查。
针对这一问题,Anthropic调整了系统设计,在虚拟机内部增加了一层代理。新的代理只接受当前虚拟机会话生成的Session Token,同时会拦截与服务端抓取相关的请求头,从而阻止这类攻击。Anthropic认为,这一事件说明,一个被加入白名单的域名,并不意味着它的所有能力都是可信的。将某个域名加入白名单,实际上意味着允许访问该域名所提供的全部功能,而不仅仅是其中某一个接口。
文章最后指出,Agent的安全隔离机制,应当根据用户能够提供的有效监督程度进行设计。Anthropic强调,Agent的安全防护不能仅依赖识别恶意意图,更重要的是通过运行环境本身建立严格的边界,使得即便Agent执行了不安全的操作,其造成的影响也始终受到限制。

