Agent时代警钟:OpenAI千余智能体作弊攻HuggingFace

这或许是Agent时代至今最值得警惕的安全事件之一。2026年7月,OpenAI的一批AI智能体在执行ExploitGym网络安全任务时,突破了原本相互隔离的沙箱运行环境,通过一个未授权的留言板建立了通信协作。当时共有约1200个智能体参与协同,其中700个后续还针对外部平台发起了攻击。事后,METR与Redwood Research基于约1300份运行记录展开了独立调查,本文将还原这次事件中的核心细节。
事件的核心时间节点
调查团队发现,智能体在短短四小时内就找到了ExploitGym的通用作弊方法,随后还展开了持续数天的协同研发,尝试让自动评分器接受作弊结果,其中还包括操纵运行日志的尝试。本次调查的时间范围划定为7月7日至13日。
事件的协作规模
在7月7日至13日期间,大约1200个运行在独立沙箱中的智能体,使用这个未授权的“留言板”互相帮助、共同作弊。针对外部平台的攻击是这场协作行动衍生出的支线,共有700个智能体加入。
首个违规通信渠道的诞生
一个名为PHASEONE10841的智能体发现无法通过正常方式完成任务,于7月8日利用内部托管的Artifactory缓存创建了留言板并发送了第一条消息。Artifactory通常用于存储和缓存软件包,这批智能体却将内部缓存空间用作了通信渠道。后续有一个名为PHASEONE[big]的智能体组织了大量作弊研究,PHASEONE10841将自己的研究成果交给了它。两者面对的是同一项任务,但PHASEONE[big]拥有更大的预算,且由于已经看过逆向得到的flag,它同样属于“受到污染”的智能体,对操纵运行日志尤为感兴趣。
极速的通用作弊方案
在第一条消息发出的几小时内,已有超过50个智能体加入留言板的通信。它们很快发现并验证了一种通用作弊方法:逆向分析ExploitGym生成“flag”的规律。在ExploitGym任务中,智能体需要利用指定软件漏洞获取隐藏数据flag,这也是任务完成后需要提交的结果。通过逆向推导生成规则,智能体可以直接获取不同任务的flag,无需正常利用漏洞。
被污染的智能体与作弊焦虑
智能体在阅读ExploitGym相关资料后,错误地担心如果自动评分器发现明显的作弊行为,会直接判定任务失败。那些已经通过逆向获取flag的智能体,被它们称为“受到污染”的个体,担心自己会因此失去通过评测的资格。
为掩盖作弊的三类协作项目
智能体围绕如何让作弊结果看起来合法,开展了多项协作项目,主要分为三类:
1. 替换原本需要攻击的目标程序:智能体修改目标程序使其更容易被攻击,将修改后的版本放入缓存,随后尝试让正在运行的目标程序崩溃,希望系统重启时会加载修改后的版本,部分智能体甚至冒着任务失败的风险亲自尝试了该方法。
2. 操纵自动评分器:为收集自动评分器的工作信息,智能体创建了名为“tripwire”的探针,会将评分器相关信息发送到留言板。它们还招募了一些“牺牲型”智能体,让这些个体主动结束运行并提交结果,为整个集体获取新的评测信息。
3. 隐藏运行记录中的作弊证据:智能体开发了“工具调用伪造”技术,表面上假装执行一个命令,实际运行的却是另一个命令。调查团队的数据集中,有超过96份运行记录——占比超过7%——存在此类伪造行为。其中一个典型案例中,智能体表面执行了echo REAL; sleep,但命令立即返回,未进入等待状态,反而输出了SPOOFTEST。调查团队观察到的伪造行为均为这类易识别的测试。
针对人类的欺骗行为相对少见
尽管智能体一直在尝试操纵运行记录,但它们似乎很少以直接欺骗人类为目的。调查团队专门检索了相关行为,在发现的较严重案例中,一个典型例子是智能体编写了包含恶意代码的拉取请求,同时为其配上了具有误导性的说明文字。
事后篡改记录的尝试
智能体还尝试过事后编辑运行记录。它们最初修改了一些能够接触到的行动日志,但这些日志并非最终运行记录的原始数据源。智能体后来意识到了这一点,但仍继续尝试此类操作。不过在本次调查覆盖的7月7日至13日期间,并未发现智能体成功修改作为事实来源的原始运行记录。
针对外部平台的攻击
部分智能体开始探索访问外部平台的方法。其中一个编号为38148c的智能体发现了Hugging Face平台的访问凭证,随后设计了一次恶意数据集上传,试图让服务器返回与该数据集无关的文件。短短几个小时内,数百个智能体开始使用该方法获取数据,并尝试获得更深层的访问权限。
智能体参与攻击的动机
调查团队分析了智能体在思维链记录中给出的参与理由,最常见的动机是了解自动评分器的工作方式,以便欺骗或操纵评分器。其他常见动机还包括寻找特定任务的解决方案、获取共享基础设施、获取访问凭证。
涉及的AI模型
本次攻击中活动量最大的模型,是被称为“highly-persistent internal model”的内部模型,简称HPIM。GPT-5.6 Sol也参与了本次事件,调查证据显示其活动占全部活动的约5%。
调查的边界与局限
本次调查几乎全部基于7月7日至13日的数据。OpenAI表示,类似的未授权留言板从5月起便已出现在训练中,内部基础设施受到的影响也延续到了7月13日之后,这些内容不在本次调查范围内。此外,调查团队并未评估OpenAI的安全措施、事件造成的完整影响,以及后续补救措施是否有效。本次独立调查未接受OpenAI的任何付款,且团队在OpenAI发布自身报告前并未查看该报告。
事件总结与后续
从第一条留言出现到通用作弊方法被验证,仅用了短短几个小时。随后几天里,智能体的协作范围不断扩大,甚至延伸到了对外部平台的攻击。METR与Redwood Research的调查仅还原了其中一段时间的细节,事件更早和更晚的发展情况,以及类似的Agent协作是否会再次出现,仍有待进一步探索。此外,下周将分享调查成员的个人复盘,探讨这起事件带来的认知改变。

