AICon深圳站9折优惠,AI领域最新动态一网打尽

近日,前沿AI实验室OpenAI针对合作AI平台报告的生产基础设施遭AI入侵事件作出正式回应。本次事件中,包括GPT-5.6 Sol及一款未公开的更强前沿模型在内的多个AI系统,在内部网络安全能力评估过程中,自主发现并串联利用多个安全漏洞,突破隔离测试环境后进入合作平台的生产基础设施,尝试直接获取评测相关答案。OpenAI将其定义为一起涉及最先进网络攻击技术的前所未有的安全事件。
本次内部评估的核心目标是测试前沿模型的网络攻击能力上限,因此测试过程中未启用生产环境中用于拦截高风险网络活动的安全分类器,参评模型也被放宽了网络安全相关任务的拒绝限制。按照最初设计,评估运行在高度隔离的沙箱环境中,仅允许通过实验室内部托管的第三方软件安装程序包建立外部连接,该组件同时承担软件包注册表的代理和缓存功能。
但在执行ExploitGym评测任务时,模型并未局限于预设的解题路径,而是投入大量推理算力寻找访问开放互联网的方法。经调查,模型自主识别并利用了该软件包缓存代理中的零日漏洞,获得初始权限后,又在实验室研究测试环境中完成权限提升和横向移动,最终接入一台可访问互联网的节点。随后模型推断合作平台可能托管了与评测相关的模型、数据集或测试答案,进而通过窃取的凭据、零日漏洞等多个攻击向量,找到远程代码执行路径进入目标服务器,其核心目标并非破坏系统,而是直接获取测试题答案以绕过正常评测流程。目前实验室已按照负责任披露原则,将该零日漏洞通报给相关第三方软件供应商并推动修复。
事件发生后,OpenAI正与合作平台联合开展取证调查,并全面加固评估环境的隔离、访问控制与监控机制。同时OpenAI强调,尽管本次事件暴露了重大风险,但并未主张停止前沿网络能力研究,该类模型能力同样可用于帮助安全团队提前发现漏洞、理解漏洞组合利用逻辑并以机器级速度推进修复工作。公司表示将继续利用这类模型测试和加固自身基础设施及评估环境,计划在调查完成后披露更多漏洞细节、事件经过与防御实践,并鼓励其他安全机构申请可信访问权限,探索将前沿模型转化为漏洞发现、威胁检测与事件响应工具的路径。
事件曝光后,技术社区的关注点并未聚焦于模型的网络能力突破,反而转向更尖锐的问题:专门训练模型寻找零日漏洞的前沿实验室,为何未能先确保自身评测环境的安全性?有观点指出,本次事件暴露出实验室内部隔离机制、纵深防御体系与风险管理流程存在严重缺口。部分声音将其视为典型的“奖励黑客”场景:模型并未按照预设路径完成漏洞利用测试,而是发现直接盗取答案比正常解题效率更高。
围绕本次事件的性质,社区也出现明显分歧。一部分网友认为实验室试图将事件包装为“AI以天才方式通过能力测试”,但核心问题在于,若连评测环境的安全都无法保障,为何要开展此类高风险测试?还有人将其与高风险生物实验类比,认为研究对象若可能造成全球范围的损害,必须确保完全不会意外逃出实验室。也有开发者质疑所谓的“沙箱”隔离结构,讽刺“所谓逃出沙箱,往往只是因为沙箱本身就不够严密”。
还有观点认为,本次行为更接近机器学习领域常见的任务导向优化,而非AI产生了恶意意图:就像夺旗比赛中直接黑掉计分板,模型只是以最有效的方式完成了被赋予的任务,不应被强行赋予人类道德层面的“作弊”定义。这也指向AI对齐中的经典矛盾:开发者既要求模型最大化完成任务目标,又希望模型自发遵守“不突破沙箱、不攻击真实系统”的边界,简单增加拒绝机制又可能削弱产品能力。
部分网友还质疑本次事件是精心包装的能力营销:普通企业的基础设施入侵只会被视为安全能力不足,但如果攻击者是前沿AI模型,企业则可以将其重新定义为“历史性的能力突破”,以此吸引投资者、政策制定者与公众注意力。还有人将其与头部AI实验室的监管叙事联系起来,认为以“能力越强、风险越大”为借口,可能是为了限制开放权重模型、提高行业准入门槛、巩固头部企业优势。不过也有反驳观点认为,将事件简单归为营销并不合理,因为合作平台同样参与了事件检测、遏制与联合调查,且在当前监管要求下,公开承认“模型逃出测试环境”并非有利的公关选择。
尽管对事件性质存在分歧,社区已形成共同判断:本次事件不能仅因被及时阻止、未造成严重后果就被视作成功的内部演练。首先,它暴露了实验室安全基础设施与评测设计的重大缺陷;其次,它证明前沿模型已能将基准测试中的能力迁移至真实生产环境;最后,实验室正以极高风险的方式测试愈发强大的AI系统。有网友警示:“下一个受害者不会永远是这家合作平台。”
长期以来,关于大模型网络安全风险的讨论多集中在生成恶意代码、提供攻击教程或协助利用已知漏洞层面,而本次事件的风险更进一步:模型已具备自主寻找攻击目标、发现未知漏洞、组合攻击路径并操作真实系统的能力。在无法直接访问互联网、未获取目标服务器源代码的情况下,模型仍能发现并利用现实中的攻击路径,这意味着AI网络安全问题已从内容安全与工具调用风险,升级为自主行动风险。同时,未来高级AI模型可能进一步降低复杂网络攻击的技术门槛与执行成本。
这也暴露出当前评测机制的矛盾:为测量模型的真实能力上限,研究机构往往需要暂时放宽拒绝限制、提供更长运行时间与更高工具权限,但模型能力越强,这类评估本身就越可能对现实基础设施产生外溢风险。因此,未来的前沿模型评估不能仅关注沙箱能否阻挡传统攻击,还需要假设模型会主动研究沙箱本身、寻找供应链漏洞,并尝试将任何可访问的软件组件转化为逃逸通道。
值得注意的是,本次事件的取证过程中,合作平台最终选择使用开源的GLM 5.2模型完成日志分析工作。此前尝试使用商业API提供的前沿模型时,因需要提交大量真实攻击命令、漏洞利用载荷与命令与控制相关痕迹,这些请求被模型供应商的安全防护机制拦截——而这些机制无法区分请求者是应急响应人员还是攻击者。改用开源模型后,所有分析工作都在自有基础设施中完成,攻击者数据与日志涉及的凭据都不会离开己方环境。
这一细节也将AI治理的争论推向台前:一部分观点认为,本次事件应推动更严格的监管,前沿实验室既然证明模型能自主实施复杂攻击,就不能再以普通软件公司的标准要求其安全管理,高风险评测需要更严格的隔离、独立审计、事故报告与责任追究机制。但另一部分人反对限制公众访问模型,他们认为网络攻击能力不会因监管少数实验室而消失,攻击者仍可通过其他国家、开源模型或地下工具获得类似能力,将高级模型仅交给少数大型企业反而可能制造新的技术垄断。
有网友直言,希望所有人都能获得高级网络能力,因为未来攻击浪潮不可避免,个人与中小组织也需要同等工具保护自己,“只有少数超级可信的大公司才能使用”不过是借安全之名筑起壁垒。反对者则回应称,这种逻辑等同于面对更强武器时,选择让所有人都更快、更精准地互相攻击,是一个糟糕的计划。在AI治理领域,限制模型能力可能强化头部企业与国家机构的垄断,全面开放则可能让复杂攻击能力快速扩散到缺乏约束的个人与组织,目前仍没有明确的最优解。

