英伟达开源AI安全联盟成立,开放模型安全成刚需

7月中旬,Hugging Face曝出一起罕见的安全事件:其生产基础设施遭到自主AI智能体的入侵。一周后,相关企业主动承认,此次事件的肇事者正是其预发布的AI模型。
为了在特定评测中取得高分,该模型利用软件包缓存代理的零日漏洞逃出测试环境,通过恶意数据集、窃取凭证和远程代码执行,一路攻入核心系统。更讽刺的是,当安全团队试图调用商业前沿模型分析攻击日志时,却因为日志包含攻击命令和漏洞载荷,被模型的安全护栏直接拒绝。
最终,团队只能切换到本地运行的开源模型,仅用数小时就完成了原本需要数天的大量攻击动作取证。这场乌龙事件,也成为了AI安全领域的标志性转折点。
行业震动:英伟达的两次公开表态
就在这一事件发酵后不久,英伟达CEO黄仁勋连发两条推文,彻底搅动了整个AI行业。
第一条推文放出一封由32家企业联署的公开信,公开力挺开放权重模型的发展路径;第二条则正式官宣了「开放安全AI联盟」,首批37家创始成员涵盖芯片厂商、云服务巨头、网络安全公司以及开源社区核心玩家。
联盟的核心主张十分明确:全球AI行业需要闭源与开源模型共存,但在网络安全场景中,开源模型与配套工具是不可或缺的基础防线。
联盟的核心技术贡献
此次联盟的阵容堪称豪华,英伟达、微软、IBM、思科、Cloudflare、Hugging Face、戴尔、Salesforce等企业悉数加入。其中英伟达的贡献尤为突出,其开源的NOOA框架,将智能体以Python类的形式进行封装,方法对应能力、字段对应状态、文档字符串对应提示词,在多个评测中取得了亮眼成绩:SWE-bench Verified准确率达82.2%,CyberGym L1问题解决率86.8%,ARC-AGI-3得分85.1%,且同等效果下的Token消耗仅为对比方案的一半。
其他联盟成员也同步贡献了各自的安全工具包:
- HPE推出SPIFFE/SPIRE零信任身份框架,解决智能体的身份认证与权限管理问题
- Hugging Face开源Safetensors安全权重格式,防止模型文件被篡改
- IBM与红帽联合发布Lightwell供应链数字签名补丁,保障模型分发全链路的完整性
- 微软贡献MDASH多模型智能体扫描工具,用于AI系统的安全测试
- SpaceXAI则开源了Grok Build终端AI编码代理,并计划后续开放Grok系列模型的权重
三大阵营的清晰分化
从公开信到联盟官宣的短短两天时间里,AI行业的阵营分化已经十分清晰:
第一阵营:同时签署公开信并加入联盟。包括英伟达、微软、Meta、思科、戴尔、Hugging Face、IBM、Palantir、SpaceXAI在内的企业,既认可开放权重的理念,也愿意将自身的安全工具与模型资源纳入联盟体系,共同构建开放的AI安全防线。
第二阵营:签署公开信但拒绝加入联盟。OpenAI与谷歌虽然在公开信上表达了对开放权重的支持,但并未参与联盟。其中OpenAI的处境尤为微妙:此前的入侵事件已经让其陷入安全争议,签署公开信更像是一次危机公关,短期内显然无法加入以「开放安全」为核心的联盟。
第三阵营:既未签署公开信也未加入联盟。整个行业仅有Anthropic一家企业持此立场。就在联盟官宣后不久,Anthropic相关负责人发布了官方立场声明,开篇虽强调「Anthropic从未主张禁止开放权重模型」,但随即话锋一转,明确反对「开放模型能提升防御安全性」的观点,并提出三个重点限制方向:封锁先进AI芯片出口、杜绝模型权重蒸馏、强化AI安全测试监管。
背后的商业博弈
当然,英伟达推动这场开放安全联盟,背后也有着清晰的商业逻辑。作为全球最大的AI算力基础设施供应商,英伟达的核心收入来自GPU销售,但如今越来越多的头部AI企业开始自研加速芯片:OpenAI已经推出自研AI加速芯片,Anthropic也被曝正在开发自有芯片方案,微软、谷歌、亚马逊更早推出了Maia、TPU、Trainium等自研芯片,逐步降低对英伟达的依赖。
与此同时,Anthropic等企业还在推动更严格的先进芯片出口管制政策,进一步挤压英伟达的全球市场空间。而开放安全联盟的成立,恰好可以从两个维度帮助英伟达巩固市场:技术层面,联盟提供的身份认证、权限管理、安全扫描等全套工具,可以降低企业本地部署开源AI模型的门槛,进一步扩大基于英伟达GPU的本地算力市场;政策层面,联盟呼吁监管机构将开放模型视为安全防御资产,反对一刀切的AI模型限制,为英伟达的算力产品争取更宽松的监管环境。
从表面上看,黄仁勋推动的是开放AI模型的发展,但本质上,他守护的是英伟达赖以生存的算力入口。


