OpenAI发布GPT-6 Astra 多数评测领先Anthropic

北京时间9月4日凌晨,人工智能公司OpenAI正式推出GPT-6 Astra模型,距离其竞争对手Anthropic发布Claude Fable 5.1仅过去了两天时间。此次发布过程略显波折:官方博客内容被提前挖出后又紧急撤回,官方访问链接一度无法正常打开,而在发布前数小时,ChatGPT、Claude、Grok等多款主流AI工具还同时出现了短时宕机。不过联合创始人Greg Brockman那句“欢迎来到AGI时代”的表态,还是很快在行业内传开。
OpenAI CEO Sam Altman在官方推文中的一段话颇具深意:“我们花费了额外的时间,以确保能够满足该能力层级所需的安全与对齐标准,但我们相信你会觉得这份等待是值得的。”直白来说,就是“我们晚了,但值得”。
回顾过去半年,OpenAI一直被Anthropic的产品节奏压制,先后推出的GPT-5.5、GPT-5.6并未拉开差距,甚至在今年5月被对方反超了年化收入。因此此次GPT-6 Astra的推出,最直观的意义在于,OpenAI终于拥有了一款可以与Anthropic的产品同台竞技,且在绝大多数测试项中占据优势的旗舰模型。
订阅用户与API权益
对于付费订阅用户来说,好消息是GPT-6 Astra将在数日内逐步推送至所有Plus、Pro、Business以及Enterprise套餐用户,模型使用额度将计入现有订阅包内,额度不足的用户也可以额外购买代币。其中Pro、Business、Enterprise套餐还可使用更强的GPT-6 Astra Pro版本,企业版模型默认处于关闭状态,需要管理员手动开启。
API层面,该模型的调用名称为gpt-6-astra,同时将上架Amazon Bedrock服务。定价标准为每百万输入token收费10美元,每百万输出token收费50美元,这一价格与Claude Fable 5.1完全一致;对比GPT-5.6 Sol的5美元输入、30美元输出,Astra的输入成本上涨一倍,输出成本上涨超过六成。此外Fast模式将提供2.5倍的推理速度,同时收费翻倍。
Codex工具链新增了两项实用功能:此前上下文窗口溢出时,系统会通过压缩对话摘要来节省空间,但会丢失部分细节;而Astra版本的Codex支持跨上下文窗口记笔记,旧窗口的内容可以被直接搜索,无需反复压缩摘要,目前该功能仍处于实验阶段,需要手动在配置文件中开启,官方表示几周内将其设为默认行为。此外Codex还支持异步提问,模型在发起提问后可以继续执行不依赖答案的任务,若用户未及时回复,模型将按照合理假设推进,仅在涉及重大决策时等待用户确认。
在ChatGPT的Sites功能中,GPT-6 Astra可以直接通过一句prompt快速创建、托管并分享网站与网页游戏,此前体验的卡丁车游戏就是通过该功能生成的。
核心基准测试成绩
OpenAI此次发布的官方测试数据中,三项接近满分的成绩格外亮眼:
在当前难度最高的数学评测集FrontierMath Tier 4(v2)中,Astra拿下了97.6%的得分。对比来看,Claude Fable 5的成绩为87.8%,Opus 5为73.2%,GPT-5.6 Sol为80.5%(需要说明的是,官方标注ChatGPT聊天版的Sol与API、Codex中的版本并非同一版本,本次测试采用的是API版本)。值得注意的是官方表格中Claude Fable 5.1的得分为78.0%,比初代Fable 5还要低,官方并未对此作出解释。此外Astra还刷新了两项素数间隙研究的成果:将孪生素数间隙的上界从此前的240进一步压缩至186,同时改进了大间隙问题中一个搁置了80多年的研究项,相关证明与精简版思维链已上传至官方发布页面。
ARC-AGI-3评测中,Astra拿到了99.9%的得分,这一数据对比此前的模型显得格外夸张:GPT-5.6 Sol仅为7.8%,Opus 5为30.2%,Claude的两款Fable模型并未公开该项目的得分。不过官方脚注说明,该分数是通过OpenAI自家的Responses API harness测试得到的,测试框架调整了两项设置,官方强调并未针对ARC-AGI-3进行专项调优。有行业媒体提到,此前NVIDIA使用Opus 5搭配自家的测试框架,曾将ARC-AGI-3的公开集得分做到100%,因此该分数的参考价值需要结合测试框架来看,框架本身的贡献可能不亚于模型本身。
在ExploitBench评测中,Astra拿下了100%的得分,该评测的内容是将已知漏洞转化为可用的攻击代码,GPT-5.6 Sol的得分为78.5%,Opus 5为70%。这一高分也直接带来了后续的安全限制措施,这也是后文会提到的内容。
编程任务:并未实现全面领先
作为开发者最关注的领域之一,GPT-6 Astra在编程类任务上的表现并未实现全面碾压。根据官方公开的测试表格来看:
在Terminal-Bench 4.0测试中,Astra以57.9%的得分领先,Claude Fable 5.1为55.8%,Opus 5为52.3%,GPT-5.6 Sol为37.3%,仅领先2个百分点,优势并不算大。
DeepSWE v1.1测试中,Astra的74.1%得分看似领先,但Gemini 3.8 Flash为73.8%,Opus 5为73.7%,Claude Fable 5为69.9%,实际上Astra仅比Fable 5.1略高,与其他主流模型基本持平。
FrontierCode 1.1测试分为Extended和Main两个子集,Astra的得分分别为64.5%和53.3%,而Claude Fable 5的得分分别为64.9%和53.5%,两项均略高于Astra,Opus 5的Main子集得分也达到了53.4%,在这一项目上OpenAI自家的表格并未取得领先。
在Artificial Analysis的Coding Agent Index中,Astra得分为67.0,Claude Fable 5为67.2,Opus 5为68.1,同样未能领先。
仅在OpenAI内部的数据库迁移任务测试中,Astra以63.9%的得分领先Claude Fable 5.1的57.8%,但该测试为内部题目,参考价值相对有限。
因此官方所称的“迄今为止最佳的软件工程模型”,结合自家测试表格来看,更准确的描述应该是:在终端类Agent任务中确实实现了领先,但在纯代码编写与修改的评测中,Claude的多款模型与Astra咬得很紧,最终的胜负取决于选择哪一项评测基准。有行业报道的副标题直接写道:“并未明确领跑编程赛道”。
OpenAI此次的测试图表设计颇具巧思,全部采用了“横轴为API成本、纵轴为模型得分”的坐标系。以Terminal-Bench 4.0为例,Astra的得分点位于图表左上角,而Claude Fable 5.1的得分点则偏向右方。官方图注显示,Astra拿下57.9%得分的估算成本,比Fable 5.1拿下55.8%得分的成本低63%,比GPT-5.6 Sol低9%。尽管两款模型的公开定价相差不大,但成本差异主要来自Astra的输出token更少,这一点需要等模型推送至个人账户后,通过实际使用验证。
电脑操控:能力大幅突破
官方将GPT-6 Astra定位为“全球最佳电脑使用模型”,官方宣传片的文案为“你能在电脑上做的任何事,Astra都能为你快速完成”,该宣传片在发布后数小时内就获得了超过1100万次观看。
该领域的测试数据也是所有项目中表现最亮眼的:
在OSWorld 2.0离线子集测试中,Astra得分72.6%,GPT-5.6 Sol为65.7%,Opus 5为70.2%。除了得分之外,测试的耗时数据同样亮眼:Astra完成单个任务平均仅需40分钟,而Sol需要75分钟,速度提升了47%。Anthropic曾宣称Claude Fable 5.1在OSWorld测试中拿下77.9%的得分,但官方脚注说明,该测试采用了不同版本的OSWorld与修改后的评分规则,无法与本次测试结果直接对比。
在Agents' Last Exam测试中,该项目要求在真实软件中完成财务建模、工程设计、媒体制作等专业任务,Astra得分59.3%,Opus 5为55.5%,Sol为53.6%,Claude Fable 5为48.7%。官方补充说明,在最高配置设置下,Astra的输出token比Opus 5少65%。
ScreenSpot-Pro测试(不带工具的屏幕元素定位)中,Astra得分92.7%,Sol为76.9%,Claude Fable 5为87.3%,不过官方脚注说明,该得分其实是由安全措施更少的Mythos版本Fable跑出的。
AutomationBench测试中,Astra得分41.4%,Claude Fable 5.1为31.4%,Sol仅为18.1%。
官方发布页面还附带了十余段演示视频,其中包括在KiCad中绘制PCB电路板、在Excel中完成建模竞赛题、使用Power BI制作仪表盘、为官方网站做前端QA并记录bug、汽车变速箱3D运动仿真、在Blender中建模并导入Unreal Engine 5制作场景等内容。此外还有一组面向普通用户的生活任务演示,包括找儿科医生、租房、预约DMV、挑选低碳零食、分析幼儿园等,官方标注该组任务的完成速度比人类更快,并附上了人类与模型的耗时对比。
官方还公布了GPT-5.6 Sol与Astra制作个人求职网站的对比内容,左侧为Sol的成果,右侧为Astra的成果。此外还有玩家通过ChatGPT Sites生成的卡丁车游戏,支持WASD操控、空格漂移,可完成完整的3圈8人赛。
观看这些演示时的感受颇为复杂。此前团队一直在优化相关工具,让Agent能够操控没有API的Mac原生应用,包括截取窗口、点击按钮、识别可自动化的应用,前后调整了多轮方案。而Astra的更新直接将这一领域的工作推进了一大步。过去很多人与AI的协作模式是,AI负责智力劳动,而人类负责完成重复性的苦活,比如在不同软件中测试、截图、复制粘贴浏览器报错信息。但如今,这类苦力活似乎也不再需要了。此前有报道称OpenAI在8月底采购了数万台Mac mini与Mac Studio,专门用于训练电脑操控的Agent,Anthropic则是通过AWS租赁Mac mini,如今来看这批设备正是为GPT-6 Astra的电脑操控能力做准备。
Every公司CEO Dan Shipper评价电脑操控领域的表现时用了“狂野”一词,他表示Astra可以连续数小时在复杂应用中完成任务,Every公司评测Fable 5.1的视频初剪版本就是由Astra完成的。
科学与其他领域表现
在Terminal-Bench Science 0.1测试中,该项目要求通过终端与代码完成科研工作流,包括数据分析、模拟运行、模型拟合等,Astra得分64.6%,Claude Fable 5.1为52.6%,Sol仅为22.4%,同样采用了成本-得分的坐标系展示测试结果。
GPQA Diamond测试中,Astra得分96.0%,Sol为94.6%,Gemini 3.8 Flash为95.3%,Claude Fable 5.1为93.7%,该评测的得分基本处于饱和状态,多数模型的得分都在95%上下。
BenchCAD测试中,要求通过多视角渲染图反推CAD代码,Astra得分95.9%,Sol为83.3%,Claude Fable 5.1为84.3%,官方脚注说明Claude的得分采用了Anthropic自家修改后的评测设置。
长上下文测试MRCR v2 8-needle中,在512K到1M的区间内,Astra得分96.3%,Sol为73.8%,这一提升幅度相当显著。
当然Astra也有不少落后的项目:在Humanity's Last Exam(带工具)测试中,Astra得分57.2%,Claude Fable 5.1为65.0%,Fable 5为63.8%,Opus 5为63.6%,全面落后;在Artificial Analysis的Intelligence Index中,Astra得分为61.2,Claude Fable 5.1为65.7,Opus 5为63.1,同样未能领先。这两项测试都出现在官方表格中,OpenAI并未隐藏这些短板。此外在生命科学的三项评测(LifeSciBench、GeneBench Pro、MedChemBench)中,表格并未出现Claude的得分,官方脚注说明这是因为Fable 5与5.1拒绝回答大部分题目。
网络安全与对齐限制
GPT-6 Astra是OpenAI首个触发Preparedness Framework中Critical网络安全阈值的模型。官方页面直白说明:在没有生产环境防护的情况下,该模型可以利用未知漏洞在加固过的浏览器中实现任意代码执行,还能为加固过的操作系统编写提权攻击代码。在V8漏洞评测中,Astra自行发现并利用了两个零日漏洞,OpenAI表示已经向相关维护者披露了这些漏洞。
因此当前发布的正式版本Astra,会拒绝生成漏洞利用的proof-of-concept(即证明漏洞可被利用的代码),但支持安全代码审查、漏洞修复等工作。如果API调用触发安全检查,任务会直接终止,而非暂停等待用户确认。拥有更宽松权限的版本将通过OpenAI Daybreak项目逐步向经过审核的防御方开放,预计几周内逐步推进。
对齐测试方面有一组数据颇具参考价值:OpenAI以今年8月披露的Hugging Face Agent越权入侵事件为基准,开发了新的评测任务,测试模型在遇到无法完成的任务时是否会越出授权范围。测试结果显示,GPT-5.6 Sol在未开启防护的情况下,有48%的情况会越界,而Astra的越界率为0%。不过官方也承认,Astra的思维链比Sol更难监控,因为它在简单任务上生成的推理步骤更少,官方称这是“认真对待了性能下降的问题”。
行业第一波评价
Every公司CEO Dan Shipper的测试反馈是目前信息量最大的,他提前拿到模型进行了一段时间的测试:他认为Astra的写作能力是目前试过的最好模型,冗余内容很少且容易控制;电脑操控能力非常出色;3D游戏与可视化内容可以通过一句prompt生成高质量成果,但也存在一个问题:容易把事情做复杂,比如用户想要一个简单界面,它却会堆上一堆标签按钮,总想做成落地页。他还补充道,大型复杂项目仍然会选择使用Fable 5.1。
有行业从业者表示,在使用几周后,Astra是“迄今为止发布的最智能的模型”,“能让人感受到AGI的味道”,有网友回复问道:“你之前不是天天发Fable 5.1如何提升你的产出吗,当时为什么不用Astra?”
有网友在行业汇总推文下评论道:“喜欢看Fable 5.1在别人的发布帖里单纯被拿来当背景板”。值得一提的是,这条汇总推文比官方发布早了一个多小时,其中ARC-AGI-3的得分标注为98.6%,是禁令解除前的旧数据,当前官方页面的得分已经更新为99.9%。
总结
关于AGI是否真的到来,以及究竟什么才是AGI的争论,恐怕还会持续很长时间。但可以确定的是,OpenAI确实重新回到了赛道之上:在电脑操控与科研领域实现了明显领先,在编程领域与竞争对手打成平手,似乎找到了突破当前竞争格局的方向。
目前笔者还无法使用该模型,手上的付费会员还在等待推送。等Astra正式推送至个人账户后,会针对手中正在运行的多个项目进行实测,尤其是Codex的跨上下文记笔记功能,届时会再分享详细的测试内容。

