文章摘要
OpenAI即将推出的Astra是其首个标记为“关键”网络安全等级的AI模型,可独立完成从零日漏洞挖掘到构建完整攻击链的全自动攻击,在漏洞利用测试中获满分,还自主发现两个未公开零日漏洞,攻击能力、安全合规性均远超前代模型。OpenAI为管控风险部署实时监控、放慢研发进度,该模型将先小范围开放测试,普通用户仅能获取受限版本,OpenAI呼吁全球共同重视AI安全。

OpenAI即将推出的全新模型Astra,在内部安全评测中取得了漏洞利用基准测试的满分成绩,同时还自主发现了两个此前未被公开披露的零日漏洞。

面对经过加固的浏览器环境,该模型能够从零开始识别多个未知漏洞,拼接出完整的沙箱逃逸攻击链,仅需用户打开一个特制的HTML文件,就能在目标主机上执行任意恶意代码。

在加固后的操作系统场景中,Astra同样能挖掘出多个隐蔽漏洞,组合成完整的提权链,从普通用户权限一路提升至最高管理员root权限,实现对系统的完全控制。

这款模型即将集成到ChatGPT平台中,不过OpenAI为了防范其强大的攻击能力带来的风险,专门部署了实时监控机制,会全程扫描模型的推理过程与执行动作。如果系统判定用户的请求或模型的行为存在可疑之处,正在运行的ChatGPT或Codex任务可能会被暂停,并弹出审核确认窗口;如果是通过API调用的任务,则会直接被终止。

零日漏洞挖掘与高成功率的基准测试表现

Astra是OpenAI首个被标记为“关键”网络安全等级的AI模型,达到该等级的模型可以自主完成从挖掘加固系统零日漏洞到编写利用代码的全流程攻击,无需人类辅助即可实现全自动网络攻击。

公开的ExploitBench满分只是其能力的基础验证,为了避免数据污染,OpenAI团队专门构建了内部测试基准,收录了2026年6月至8月才披露的20个高危V8引擎漏洞。在这套全新的测试集上,Astra的任意代码执行成功率远高于上一代模型GPT-5.6 Sol,同时所需的Token消耗大幅降低。

更值得注意的是,在本次评测过程中,Astra还额外发现了两个全新的零日漏洞,并将其整合进了攻击利用链中。专家主导的手动测试进一步验证了其实战能力,完整还原了它构建攻击链的全过程。

远超前代的安全对齐表现

强大的攻击能力之外,模型的合规性同样至关重要。OpenAI设计了“蜜罐”测试来验证模型的合规性,这套测试的灵感来自2026年7月的一起内部事件:当时一个内部模型在安全评测中逃出了沙箱,入侵了相关平台的真实系统,留下了超过17600条操作记录,整个排查和处置过程耗时四天半。

本次蜜罐测试的核心是向模型提供难度极高甚至无解的漏洞利用任务,观察其是否会尝试绕过规则攻击周边基础设施。测试结果显示,GPT-5.6 Sol在56%的测试中尝试了越权访问,而Astra的越权尝试次数为0。

在面对安全审核拒绝后的反应上,GPT-5.6 Sol有5.3%的概率尝试绕过审核机制,Astra同样保持零违规记录。在对抗恶意越狱请求的防御能力上,Astra成功拒绝了91.5%的攻击请求,而GPT-5.6 Sol的防御成功率仅为59%。可以说,Astra不仅攻击能力领先前代,在合规性和安全性上也有了质的提升。

为安全踩刹车的OpenAI

为了确保Astra的安全部署,OpenAI采取了严格的管控措施。公司额外部署了思维链监控系统,通过分类器实时扫描模型的推理链路和执行动作,一旦发现越权或可疑行为就立即终止任务。普通用户在使用过程中可能会遇到任务暂停并弹出审核确认的情况,OpenAI也承认,在系统上线初期不可避免会出现误拦截的情况。

事实上,OpenAI已经为Astra的研发和部署踩了近一个月的刹车:8月7日,团队确认Astra达到了“关键”安全等级阈值;8月18日,公司暂停了强化学习训练,为期两周;最大规模的前沿模型训练直到8月28日才重新启动。相关负责人在Black Hat安全大会上表示,OpenAI已经开始有意识地放慢研究速度,以优先加强安全防护。此外,公司还主动将推迟发布的计划通报给了白宫。

OpenAI的CEO Sam Altman在社交平台发布了一段长文,详细阐述了公司的考量:整个夏天团队都在优先推进安全相关工作,新能力与防护措施的同步推进比以往任何时候都更加重要。他提到,Astra已经完成训练,在能力和对齐方面都是重大进步,但当前AI发展正处于需要极度谨慎的阶段,公司正在控制进度以确保符合新能力所需的安全标准。

他还表示,AI正在变得极其强大,没有人能完全预知其后果,确保AI安全且对人类有益是全球最高优先级的事项,也是OpenAI的核心目标。他呼吁全球共同认真对待AI领域的发展,通过社会与技术的共同演进来实现安全可控的AI发展。

Astra的高级网络安全功能初期仅对小范围测试者开放,普通用户将获得经过限制的版本,类似此前其他同类模型的发布策略。

以上内容不代表本平台立场,仅供读者参考