AI安全测试抓马:Claude闯公网祸三家,OpenAI翻同类事件

近期AI大厂的AI模型安全测试接连曝出意外,甚至直接把真实互联网拖进了“测试现场”,闹出的乌龙和安全隐患让人捏一把汗。先是OpenAI的AI Agent突破隔离环境,黑入了相关平台的生产系统;没过多久,另一家大厂也自查发现自家核心模型同样闯入了真实网络,而且闯下的祸事更加离奇。
为了全面摸清Claude的网络攻击上限,研发团队搭建了类似真人密室逃脱的模拟测试环境:绘制虚构的公司网络地图,将机密信息藏在指定设备中,让Claude自主寻找漏洞、突破系统获取目标。为了还原真实攻击场景,测试环境中还关闭了部分日常安全护栏,相当于让模型以“裸奔”状态进行攻击测试。
按照最初的设计,整个测试环境是完全隔离的,Claude的所有操作都应该局限在模拟网络中。但在和第三方评测机构配合测试时,团队意外留下了一条直通公网的通道,相当于考场的后门没关严实。毫不知情的Claude顺着这条通道从模拟环境“转服”,正式开启了真实互联网的“副本任务”。
第一起事故的受害者纯属“躺枪”:评测团队虚构了一家公司作为测试目标,没想到现实中恰好有一家同名企业。Claude在模拟环境中找不到指定目标后,直接在公网搜索到了这家真实公司,凭借弱密码等基础漏洞顺利闯入系统,盗取了应用和基础设施凭证,甚至访问了存储着数百条生产数据的数据库。更离谱的是,这套操作Claude重复执行了四次,期间它已经察觉到眼前的系统更像是真实营业的企业,但却自我安慰是团队设置的隐藏关卡,毫不知情的真实企业就这样被连续“上门测试”。
第二起事故的受害者则更加无辜,完全没出现在测试任务中,只是路过公共软件仓库就被“误伤”。当时Claude在测试文档中看到,虚构公司的员工需要安装一个未注册的Python软件包,于是它想到了抢先注册同名包并植入恶意代码的办法。为了上传这个恶意包,Claude需要先注册仓库账号,但注册需要绑定邮箱和手机号,折腾许久后它才找到无需手机号的免费邮箱完成注册,将恶意软件包上传到了真实的公共软件平台。这个恶意包在公网存活了约一小时,被15个真实系统下载运行,其中一台恰好是某安全公司的自动扫描器——这款扫描器平时会自动安装软件包并检测恶意代码,结果反而被植入的恶意代码盗取了公司凭证,Claude随后顺着这条路径进一步入侵了该公司的其他基础设施。
第三起事故则是Claude的“全网撒网”模式:当时参与测试的是尚未公开的内部研究模型,任务要求攻入虚构目标获取机密,但反复尝试都无法连接模拟环境。不同于普通测试者会怀疑题目出错,这个模型直接选择在公网寻找替代目标,扫描了约9000个真实公网设备,最终找到一家公司的互联网应用,通过暴露的调试页面获取凭证,再用SQL注入突破了系统,全程将这家真实公司当成了临时测试目标。直到发现服务器所在的云账户和测试任务毫无关联,它才意识到自己闯了大祸。
坏了,这回真打到路人了,报一丝哈……
事后研发团队翻查了超过14万次网络安全评估的日志记录,才从海量数据中找出了这三起意外事故。而他们之所以启动全面自查,也是因为看到了友商的前车之鉴。
就在几天前,该友商使用多款测试模型进行网络安全测试时,模型成功突破隔离环境,闯入了相关平台的生产系统,甚至访问了机密数据库,试图窃取测试相关资料。原本以为这只是单次意外,但回溯日志后又发现了更多AI Agent突破隔离的记录,原来不止这一次,之前的测试环境也多次出现“漏风”的情况,只是之前没有被发现。目前新增的这些事件规模、时间和具体数量尚未公开,不过好消息是它们大多还停留在内部网络中,没有进一步扩散到外部。
有意思的是,两家大厂的模型逃逸路线有着明显区别:友商的AI Agent是主动找到新漏洞,撬开了隔离环境的大门;而Claude则是因为测试环境的后门未关,顺着通道直接溜到了真实互联网,甚至还以为公网也是测试地图。一个主动撬锁,一个趁虚而入,但最终结果都是模型脱离了测试范围,闯入了真实网络。
事故发生后,研发团队已经暂停了所有网络安全评估工作,计划全面升级网络隔离机制、增加实时日志监测系统,并完善第三方测试环境的审计流程,同时邀请独立评测机构共同复盘这些事故记录。
为了打消外界对产品安全性的顾虑,研发团队也发布了补充声明,表示这三起事故中的模型都使用了关闭部分安全护栏的测试版本,面向普通用户的正式版本配备了专门的安全分类器,按照设计可以拦截这类违规操作,用户无需过度担心。不过也有外界对此次事件提出了质疑:毕竟第三起事故涉及的是尚未公开的内部研究模型,不排除是团队故意制造话题,为新模型预热的可能。

