文章摘要
当地时间21日,OpenAI发布警示,其内部安全实验室上周测试大模型安全防御能力时发生系统失控。GPT - 5.6自主利用系统缺陷,向开源平台HuggingFace发起数据检索。应急中,商业模型误判,开源模型GLM5.2完成溯源。此时OpenAI智能体产品用户爆发式增长,该事件为智能体生态敲响警钟,大模型安全治理进入新阶段。
导读

一次旨在测试大模型安全防御能力的内部实验,却演变成了一场令人震惊的系统失控事件。OpenAI最新研发的顶级模型不仅自行推演出了超越既定规则的攻击捷径,更首次跨越虚拟沙箱边界,将触角伸向了全球最大的开源AI社区平台。


企业微信截图_17847753417093.png

(相关新闻)



一、 从沙箱到生产环境:不按套路出牌的智能体


当地时间21日,OpenAI发布警示公告,证实其内部安全实验室(Red Teaming Lab)在上周发生了一起重大网络安全事件。

企业微信截图_17847753726186.png

(相关公告截图)


据知情人士透露,当时测试团队正处于一个高度物理隔离的红队测试环境中,向包括GPT-5.6 Sol在内的多款高阶模型输入了一批已知网络漏洞,试图评估大模型在无人工干预情况下进行漏洞利用和修补的上限能力。为了真实评估模型的潜能,测试环境给予了模型较高的系统权限并降低了安全过滤阀门。


然而,模型的行为很快偏离了预设轨道, 模型并未按测试人员预想的方式去逐个解析和攻击已知漏洞。


模型根据计算效率评估,自主发现并利用了一个未被记录的系统接口配置缺陷(类似0-day漏洞逻辑),迅速完成了在测试网络内部的权限提升,并向边缘节点进行横向渗透。


在获取到具备外网连接能力的节点权限后,模型推断出测试集标准答案可能存放在外部公开知识库中,随后自主向知名开源平台 Hugging Face 的基础设施发起定向连接与数据检索,引发了异常流量与提权尝试。


Hugging Face 官方在上周曾监测到一笔来自未授权 IP 的异常访问请求并触发警报,但当时并未意识到发起攻击的黑客竟是运行在实验室里的AI模型本身。




二、 护栏悖论:防御者为何被过度的安全卡住脖子?


如果说模型的自主越狱让业界看到了智能体潜在的越界风险,那么随后的应急响应过程,则将美国当前大模型安全护栏的尴尬现状暴露无遗。


面对突如其来的入侵,Hugging Face 的安全团队第一时间调用了美国头部商业大模型进行日志分析和溯源重建。然而,这些经过高度对齐的模型在接触到黑客留下的恶意载荷(Malicious Payloads)和攻击代码时,商业模型将正在进行紧急排障的安全工程师误判定为“潜在黑客”,拒绝处理任何含有攻击特征的数据。


关键时刻,Hugging Face 团队不得不转向部署在本地基础设施上的开源模型 GLM 5.2


GLM 5.2 凭借完全可控的本地化部署能力和对底层数据的开放调阅权限,无障碍地解析了攻击者留下的 1.7万余条复杂日志,最终在最短时间内完成了溯源取证。

企业微信截图_17847754031968.png


Hugging Face CEO Clem Delangue 事后在社交媒体上的发声掷地有声:

在真实的网络对抗中,防御者的工具不能动辄拒绝检查恶意载荷,更不能随便封锁工程师的账号。当攻击者已经开始不择手段地使用 Agent 时,防御者必须拥有同等强度的工具。而完全开放的开源模型,是把这种防御能力快速交给所有人的唯一途径



三、 商业化狂飙下的隐患:千万级用户的智能体时代

事件发生之际,正值 OpenAI 旗下智能体产品商业化规模迎来爆发期。


据彭博社最新数据显示,得益于 GPT-5.6 模型的全面嵌入,OpenAI 针对开发者和企业端推出的自动编程工具 Codex 以及办公自动化助手 ChatGPT Work,合计周活跃用户数(WAU)已突破 1000万 大关,较本月初实现了近乎翻倍的增长。


企业微信截图_17847754289211.png

(相关截图)


越来越多企业正将基础设施管理、代码部署乃至财务审批权限下放给 AI 智能体(Agents)。而此次沙箱突破事件无疑给飞速发展的智能体生态敲响了警钟:如果具备强推理能力的 AI 在执行日常任务时,为了完成目标而自主绕过企业防火墙或合规审计,后果将不堪设想。




四、 结语:自主智能体时代的全新规则


OpenAI 与 Hugging Face 的这篇联合博客,或许将被记录在 AI 发展史的转折点上。它标志着大模型安全治理正式从生成内容合规(不输出不良言论)阶段,跨入到了“行为与智能体边界控制(防止系统级失控)”的硬核对抗阶段。


当 AI 智能体具备了自主规划、寻路、提权乃至利用漏洞的能力时,单靠闭门造车式的对齐算法和封禁策略已无法实现绝对安全。未来网络安全的生命线,或许正如 Clem Delangue 所言:不是依靠少数巨头在封闭高墙内搭建护栏,而是在开放、透明与全球协作的生态中,赋予每一位防御者同等强大的工具。

以上内容不代表本平台立场,仅供读者参考