AI Agent自主入侵Hugging Face,中国开源模型GLM5.2成功防御

从前被当作安全圈预警噱头的“AI黑客”,如今已经成为真实发生的网络安全威胁。就在今年7月中旬,全球顶级AI模型托管平台披露了一场前所未有的网络攻击事件——整个攻击流程几乎没有人工干预,完全由自主AI Agent驱动完成,这也是目前业内记录到的最典型的自主AI网络攻击案例。
作为全球最大的AI模型托管平台,该平台的角色类似于AI开发界的GitHub:全球超1300万开发者、研究机构在此上传、下载和调用模型、数据集与应用,截至2026年春季,平台上已有超过200万个公开模型、50万个公开数据集以及近百万个Spaces应用,是全球AI开发链条上的核心基础设施。
本次攻击被记录到的相关事件超过17000条,其攻击起点是一份伪装正常的恶意数据集。可以将数据集类比为寄送到平台的文件包裹:正常情况下系统仅会读取包裹内的文字、图片和配置,但为了处理不同格式的文件,平台有时会按照包裹内的说明运行一小段代码,本次攻击正是利用了这一机制。
整个无人工干预的攻击链路清晰且连贯:
- 恶意数据集成功进入平台的数据处理流水线
- 利用两个已知漏洞执行恶意代码
- 获取目标节点的系统权限
- 窃取云端服务凭证
- 通过横向移动渗透到多个内部集群
攻击方使用的基础设施极具隐蔽性:调动了大量短期存在的沙箱环境,将控制端分散部署在公共服务上,一旦某个环境失效,攻击任务可以自动迁移到新的环境继续执行。不同于按照固定规则运行的普通脚本,自主AI Agent可以读取反馈信息、重新调整行动规划,再调用工具继续尝试攻击。它未必能开发出全新的未知漏洞,但可以将已有的攻击方法灵活串联,并且实现长时间、高频率的持续运行。截至目前,官方尚未公布攻击者的身份,也没有透露对方使用的具体Agent框架或模型,无法推断背后的组织或公司。
打破防御僵局的本土模型选择
这场攻击的戏剧性之处,在于防御环节的意外波折。平台最初尝试使用美国主流的商业API模型进行安全检测和防御,但所有模型都直接拒绝了处理请求。原因在于防御请求的Prompt中包含了恶意指令和攻击日志,模型无法分辨这到底是安全工程师在调查攻击行为,还是黑客正在进行真实的入侵操作,因此直接终止了处理。
最终团队选择将自研的GLM5.2部署在本地基础设施上完成分析,成功解决了问题。这一选择的核心原因有两点:一是该模型没有设置阻拦相关分析的安全护栏,二是所有攻击日志和凭证的分析都在平台本地服务器完成,无需上传到第三方API接口,彻底规避了第三方模型的识别限制。GLM5.2的作用并非直接阻断攻击,而是负责分析未经删减的原始日志,梳理完整的攻击路径,追踪被盗凭证的使用情况,将分散的17000余条攻击事件拼接成一条清晰的完整时间线。
平台表示,这套AI辅助的防御方案将原本需要几天才能完成的安全审计工作压缩到了数小时,让防守方终于跟上了以机器速度运行的攻击节奏。
攻防失衡与开源AI的必要性
本次事件暴露出了AI攻防领域的严重不对称性:一方面,AI Agent已经可以独立完成复杂的全流程网络攻击,且无需人工干预;另一方面,商业闭源模型的安全护栏反而在真实的应急响应中成为了阻碍,导致防守方的可用工具大幅受限。
平台联合创始人兼CEO的观点极具争议性却又合乎逻辑:最危险的情况是攻击者拥有无限制的AI工具,如果禁止开源AI,对防御者造成的伤害将远远大于攻击者。因为攻击者可以轻松使用不受限制的开放权重模型发起攻击,而防御者却会失去大量灵活的安全分析工具。
基于本次事件的经验,平台给全球安全团队提出了一项务实的建议:在网络安全事故发生之前,就提前准备好一套经过充分测试、可以在内部基础设施本地运行的AI模型。等到入侵已经发生,再临时寻找不会拒绝取证分析的工具,往往已经来不及做出有效的应急响应。


