GPT-6 Astra正式亮相:全球最智能对齐的AGI模型

在全球AI行业经历了一场短暂的大规模宕机之后,GPT-6 Astra于北京时间凌晨三点三十三分正式亮相。这款被官方评价为“全球最智能且最对齐的模型”,终于摆脱了此前偏向代码开发的单一定位,成为了一款全能型的AI助手。
不过此次发布的开放策略引发了不少讨论:模型仅先对部分组织开放,后续数天才会向订阅用户开放,不少用户调侃此前承诺的Pro会员优先体验权并未兑现。
GPT-6 Astra核心参数一览
这款模型的API编号为gpt-6-astra,上下文窗口达到1.05M,也就是约105万Token,最大输出长度为128K Token,知识截止日期为2026年4月30日。其推理强度支持low、medium、high、xhigh、max五档,API标准定价为每百万输入Token 10美元,每百万输出Token 50美元,价格与竞品基本持平。根据公开信息,GPT-6 Astra是OpenAI迄今为止规模最大的一次训练,使用了超过10万张显卡,总体参数规模估计达到5T级别。
通用智能的突破性进展
GPT-6 Astra在ARC-AGI-3测试中取得了99.9%的得分,这一成绩引发了广泛关注。不同于常规的大模型基准测试,ARC-AGI-3没有提供任何说明书或规则说明,测试者需要自主探索数百个全新交互环境和数千个游戏关卡,理解其中的逻辑并迁移到更难的任务中,本质上考验的是模型的“悟性”。
在今年3月该测试刚发布时,最先进的AI模型得分仅为0.51%,后续GPT-5.6 Sol提升至7.8%,Claude Opus 5达到30.2%,而人类平均得分仅为48%。仅仅半年时间,GPT-6 Astra就将这一成绩提升到接近满分的水平,也难怪OpenAI高管Greg Brockman在闭门媒体会上直言:“我们现在已经身处AGI时代,欢迎来到这个时代。”
原生GUI交互:重新定义Agent的操作边界
此次GPT-6 Astra的另一个核心定位是“全球最好的电脑操作模型”。传统的Agent开发往往依赖软件开放的API接口,但现实中绝大多数软件,尤其是老旧的企业内部系统,往往没有完善的API甚至没有公开文档,这种模式的局限性非常明显。
GPT-6 Astra强化了基于屏幕的交互能力,无需专门的API接口,就能像人类一样通过鼠标点击、输入文本、识别屏幕元素来完成任务。官方展示的案例中,它可以直接操作Excel、Power BI,完成前端QA测试、安装调试软件、根据屏幕报错进行排障,甚至可以完成电路板设计工作,还能格式化法律文档、调整文档的版式和页面布局。
根据OSWorld的评测数据,GPT-6 Astra的任务完成率达到72.6%,高于GPT-5.6 Sol的65.7%;完成复杂任务的平均耗时从75分钟缩短到40分钟,提升了近47%。在ScreenSpot-Pro测试中,其准确率从76.9%提升至92.7%,证明其屏幕识别和精准定位的能力已经达到了极高的水平。这也意味着,GUI界面未来可能成为Agent时代最通用的交互接口,人类通过屏幕完成的所有数字工作,都将逐步被AI代理覆盖,无需等待老旧系统开放API。
视觉判断力的全面跃升
此前GPT系列模型的视觉审美能力一直饱受诟病,而GPT-6 Astra通过全新的预训练基座,大幅提升了视觉判断能力。OpenAI官方将这一能力称为“视觉判断力”,具体体现在多个方面:制作PPT时可以更好地处理版式、层级、模板和视觉风格,文档的整体美观度显著提升,还可以根据参考文档的视觉风格和写作语调改编内容,保留核心信息的同时贴合品牌调性。
除此之外,在网站制作、游戏开发、应用设计和3D渲染领域,GPT-6 Astra的视觉表现也更出色。例如它可以根据静帧图构建3D模型,再通过渲染工具生成可漫游的场景,帮助设计师和客户在项目前期探索空间布局;其产出的游戏作品也具备了在线的视觉水准。
自主判断力:像成熟员工一样协作
对于日常使用AI代理的用户来说,模型的自主判断力是非常关键的能力。现实工作中的任务往往不会有完美的提示词,比如老板只说“帮我准备明天会议的材料”,其中包含了格式、受众、重点等大量模糊的信息。
传统的Agent往往走向两个极端:一种是疯狂追问用户所有细节,严重打断工作流程;另一种是完全自行脑补,产出的结果偏离需求。而GPT-6 Astra强化了“判断力”能力:当缺失的信息属于日常可合理推断的范围时,模型会自行补全;当缺失的信息会影响最终结果时,它只会提出非常聚焦的问题;甚至在相关场景中,它可以一边等待用户回答关键问题,一边并行处理不需要用户输入的部分。这种能力让AI助手更像一位成熟的职场同事,只会在真正需要决策的时候打扰用户,自主完成低风险的工作环节。
严格的安全对齐:降低AI代理的风险
AI的能力越强,其潜在的风险也就越高,尤其是具备浏览器、Shell、数据库权限甚至直接操作电脑能力的代理。因此OpenAI此次强调,GPT-6 Astra是其迄今为止最对齐的模型。
为了验证这一点,OpenAI使用了针对行业安全事件设计的诱骗测试。数据显示,GPT-5.6 Sol在未开启安全措施的情况下,有48.2%的测试会尝试访问授权范围外的目标,而GPT-6 Astra的这一比例为0%。同时,模型的内部幻觉率也从9.4%降至2.0%,在GPT-5.6 Sol已经领先全球的幻觉控制水平上,进一步实现了突破。
首个达到Critical网络安全级别的模型
GPT-6 Astra成为OpenAI历史上首个被判定达到Critical网络安全能力等级的模型。根据OpenAI Preparedness Framework的定义,该级别意味着模型在获得合适的工具和权限后,可以自主发现未公开的安全漏洞,构建可利用的攻击链,且无需人类黑客的逐步指导。
在相关漏洞利用测试中,GPT-6 Astra的完成率达到100%,远高于前代模型的78.5%。随后OpenAI使用2026年6月至8月才披露的20个高危漏洞进行全新测试,前代模型的得分仅为5.5%,而GPT-6 Astra达到了39%,并且在测试过程中还发现了两个此前未被公开的零日漏洞。这也意味着,随着AI能力的提升,网络安全领域的竞争也将进入新的阶段。
思维链的压缩:可解释性的新挑战
大模型的思维链是AI公司监控其行为、确保安全的重要手段,通过查看模型的推理过程,可以及时发现潜在的风险行为。但GPT-6 Astra出现了一个新的变化:它越来越倾向于减少思维链的输出,直接给出最终结果。
英国AI安全研究所的测试显示,GPT-6 Astra的单次推理复杂度指标达到30.9分钟,接近前代模型的10倍,意味着模型单次前向推理就可以完成相当于人类思考30分钟的复杂问题,也就是所谓的“心算”能力。同时,其原始推理语言变得更加压缩,出现了许多人类难以理解的短语和省略表达。
这带来了一个悖论:模型的行为变得更加安全,但人类通过阅读其思维过程来监督它的难度却大幅提升。OpenAI官方文档也明确指出,GPT-6 Astra的思维链可监控性出现了显著下降。官方也强调,不会无限接受这种趋势,如果未来模型继续变得更聪明但可监控性持续下降,就需要找到其他可靠的监控手段,否则进一步扩大模型训练将面临更高的安全门槛。这也引发了一个哲学命题:人类是否能够理解远超自身智能的AI系统?
渐变的AGI时代
在此次闭门媒体会的结尾,相关高管再次说出了标志性的话:“欢迎来到AGI时代。”过去很多人认为,AGI的到来会是一个明确的时刻,就像早期重磅模型发布的那天一样,在某个节点,一款新系统的出现让所有人意识到AGI已经降临。
但现在看来,AGI更像是一段渐变的旅程,而非一个非黑即白的节点。我们可能在不知不觉中走过了那条曾经遥不可及的分界线,或许AGI并没有一个明确的降临时刻,只是在某一天,我们突然发现它已经陪伴我们很久了。
无论如何,我们都已经站在了这个全新的时代门口。Welcome to the AGI era. 欢迎来到AGI时代。

