文章摘要
OpenAI发布GPT-6 Astra,将其视作首个AGI时代的AI系统,整体研发方向转向科学探索而非编码优化。该模型科学推理能力大幅提升,还协助推进了停滞80余年的素数间隔研究,运行效能更高,工业工程能力可落地,但编码能力进步有限,未和主流模型拉开代际差距。

近期推出的全新架构GPT-6 Astra模型,被内部视作首个AGI时代的AI系统。这款模型在科学研究与抽象推理领域实现了大幅跃升,其独特的智力模式能够有效减少推理步骤,用更少的Token消耗实现更高水平的智能输出。不过值得注意的是,它在编码能力上进步有限,表现不如Fable系列模型。

在定价层面,GPT-6 Astra采用10in 50out的计费规则,对齐了Fable与Mythos的定价体系。有观点认为外界可能将Mythos视为首款AGI模型,但由于无法实际调用该产品,暂无法做出客观评价。不过可以确定的是,AI研发赛道正在从内卷式的编码优化,转向聚焦科学探索的新方向。

科学研究能力

在Terminal-Bench Science 0.1这项科研终端与管线自主操作测试中,GPT-6 Astra的得分从上一代GPT-5.6 Sol的22.4%暴涨至64.6%,大幅领先Fable 5.1的52.6%。前沿科研级数学测试FrontierMath Tier 4 (v2)中,模型拿到了97.6%的高分。更具突破性的是,这款模型协助数学家Julia Stadlmann将素数间隔的上界从240推进到186,推动了一项维持80多年未被突破的数学研究界限。

智能与运行效能

在动作与步数效率测试ARC-AGI-3中,GPT-6 Astra在96%的关卡里,摸索并破解未知机制所需的动作步数少于人类中位数水平,平均动作数量减少了51.7%。它不再依赖暴力穷举的方式,而是能够在上下文环境中现场发明代数简记法(DSL)来压缩状态,优化解题路径。

从任务级能效比来看,尽管GPT-6 Astra每百万Token的单价更高,但在OSWorld 2.0这类长流程复杂任务中,单任务耗时从75分钟压缩到了40分钟左右,整体的Token总消耗量也有显著减少。

工业工程能力

专业工业软件测试BenchCAD中,GPT-6 Astra取得了95.9%的得分,领先Fable 5.1的84.3%,相关能力已经可以直接落地应用于KiCad PCB电路设计、Unity 3D场景排布,以及金融建模世界杯赛事的相关任务中。

编程能力表现

在真实软件工程能力测试DeepSWE v1.1中,GPT-6 Astra的得分为74.1%,对标Claude Opus 5的74.0%、Gemini 3.8 Flash的73.7%,甚至略低于Meta Muse Spark 1.3的75.4%,整体处于和其他主流模型同一水平的平台期,并未拉开代际差距。

在Artificial Analysis(AA)综合智能与智能体指数评测中,GPT-6 Astra仅拿到61.2分,几乎和上一代GPT-5.6 Sol的61分左右持平,在编码智能体指数上也没有出现断层式的提升。

关于GPT-6 Astra的完整详细介绍,可以前往官方平台查阅一手专业资料:https://openai.com/index/gpt-6-astra/

以上内容不代表本平台立场,仅供读者参考