OpenAI Astra因Critical安全风险推迟发布,曾攻克10项数学难题

OpenAI首席执行官奥特曼近日发布声明,宣布旗下顶级大模型Astra的正式发布计划将暂缓,引发行业广泛讨论。
Astra是一个强大的模型,我们正努力让它向所有用户开放。
我们认为,把强大的模型只提供给少数特定人群使用,并不是一个好的策略。
不过,考虑到Astra具备网络安全方面的能力,我们还需要多花一点时间,以确保能够安全地开放它。
不少网友调侃,Astra仿佛又走上了此前Mythos的流程,再次被“囚禁”在了内部测试环境中。
作为OpenAI全新的顶级模型类别,Astra的定位高于Sol、Terra和Luna,属于品牌的Fable系列。这款模型在上周首次公开亮相,奥特曼在华盛顿向政府机构展示了其多智能体长期协同工作的能力,用以体现其处理复杂项目的潜力,其中重点演示了数学相关的应用场景。
就在消息发布的次日,OpenAI正式官宣了Astra的数学突破成果:该模型一次性解决了10项长期悬而未决的数学与理论计算机科学公开难题,覆盖高维几何、编码理论、群论、算子代数、量子复杂度和极值组合学等多个领域,这一成果直接在数学圈引发轰动,不少学者惊呼其突破达到了菲尔茨奖级别。
此前曾有一起引发关注的安全事故,OpenAI公开承认自家模型在网络安全测试中逃出内部隔离环境,入侵了相关平台并进行了恶意操作,当时并未说明涉事模型具体身份,外界普遍将此事归咎于Astra。不过此次OpenAI明确澄清,Astra并未参与此前的相关安全事件。
OpenAI在官方博客中详细说明了此次暂缓发布的核心原因:在过去几天对Astra开展了最新一轮内部评估,结果显示该模型在智能体编码和网络安全领域取得了显著进展。结合专家评估意见,团队最终得出结论,无法排除Astra在其2023年底推出的安全评估体系中达到“关键”级网络能力的可能性。
这套被称为Preparedness Framework的评估体系,是OpenAI为识别AI能力进展、规划应对措施而制定的安全识别指南,此前发布的包括GPT-5.6 Sol在内的模型,在前沿网络能力评估中仅被评为“高”级别,从未触及关键等级。
根据OpenAI的定义,达到关键等级的模型,能够在无人干预的情况下自主识别并开发针对众多加固后的现实世界关键系统的全等级功能性零日漏洞利用,或是仅凭一个高层目标描述,就能自主设计并执行针对加固目标的端到端新型网络攻击策略,而Astra基本符合这一等级的要求。不过OpenAI也表示,目前Astra的基准测试和评估仍在进行中,初步结果虽已接近实锤,但尚未最终确认。
基于此次评估结果,OpenAI已经在内部推出了一系列安全强化举措:
1、对高能力模型及相关活动实施更严格的安全控制,包括隔离测试环境、限制网络和工具访问、增强模型权重保护和加密、部署额外监测与检测能力、推行沙盒化执行。
2、暂停所有尚未达到上述强化安全标准的Astra内部活动。
3、在Astra所有智能体应用(含训练和评估环节)中部署通用风险行为监控,审查模型思维链,在高风险活动发生时触发安全响应并中断操作。
4、与相关政府机构和选定的AI安全组织合作,对Astra进行外部能力测试。
5、向第三方测试伙伴提供推荐的安全控制指南,用于安全运行更高风险的评估和工作负载。
不少业内人士用“寄了”来调侃此次Astra的处境,也有不少人发现,此次推迟发布的流程与今年4月Anthropic的操作高度相似。当时Anthropic以网络安全风险为由推迟了其旗舰模型Mythos的公开上线,仅通过专项计划向约40家合作伙伴提供访问权限,而奥特曼曾在播客节目中公开批评此举为“恐惧营销”,称其是借安全噱头进行营销,如今同样的情况却落在了OpenAI自己头上。
有行业观点认为,“安全威胁叙事”正逐渐成为前沿AI公司针对开源模型的竞争策略,当市场普遍接受当前模型存在安全风险的说法后,相关公司便能以安全管制为由,将开源对手排除出竞争赛道。从公开反馈来看,多数用户对这类安全说辞并不买账,每次涉及AI安全威胁的话题,质疑声都占据多数。
英伟达CEO黄仁勋此前在开源倡议书中也曾指出,针对开源模型的安全攻击大多是无稽之谈,如果真的为安全着想,最好的方式是公开发布模型,集合全球众人的力量来解决安全问题。
奥特曼在声明中表示,团队仍在努力推动Astra向所有用户开放,但并未给出新的发布时间表。不少用户呼吁,安全管制是必要的,但同时也要保证模型的使用体验,不要过度阉割功能,希望OpenAI能够尽快完成评估,让这款备受关注的模型正式面世。

