文章摘要
GPT-6 Astra发布,欢迎来到AGI时代!

9月3日,OpenAI发布新一代旗舰模型GPT-6 Astra。发布会尾声,总裁Greg Brockman留下一句“欢迎进入AGI时代”。


这句话很快引来不同意见。衡量模型综合智能的Artificial Analysis指数v4.1.1上,Astra拿到61.2分,低于两天前Anthropic发布的Claude Fable 5.1(65.7)。在考察广博知识与跨学科推理的Humanity's Last Exam中,Astra得57.2%,不及自家上一代GPT-5.6 Sol的65.0%。


把两组数字放在一起看,Astra的画像就清楚了:它不是在所有维度同时变强,而是把超过10万块GPU的训练规模,集中投向了同一件事,让模型在电脑里自己把活干完。


640.webp

图源:OpenAI官网截图



/// 产品亮点 ///


105万Token上下文,账单先涨2.5倍

Astra总上下文长度105万Token,输出上限12.8万Token,支持文本与图像输入,知识截止2026年4月30日。它新增异步工具调用与任务执行中的指令调整能力,并支持从low到max五档推理强度,用户可自行在成本与深度之间取舍。


价格随之上移。API定价为每百万输入Token10美元、输出50美元,是GPT-5.6 Sol的2.5倍;缓存读取享90%折扣,缓存写入加收25%。OpenAI的说法是,Astra在部分任务中能用更少输出Token完成工作,单项任务成本未必同比例上升。


会自己上手:单任务时间从75分钟压到40分钟

变化主要发生在操作层面。OSWorld 2.0计算机操作测试中,Astra得分72.6%,高于Sol的65.7%;完成单项任务的平均时间从约75分钟压缩至40分钟,效率提升接近47%。考察业务流程自动化的Automation Bench上,Astra得分41.4%,较Sol的18.1%翻倍有余,也高于Claude Fable 5.1的31.4%。


它靠读取屏幕像素、移动鼠标与敲击键盘来使用软件,无需软件开发商专门适配。给一张电路原理图,Astra在KiCad里完成元器件排布与铜线走线用时2分54秒;填在线表格、更新CRM记录、整理日历、分析科研数据、搭建网站并执行前端检查,都在能力清单内。自动化评测机构RoboCurve把同一套空间理解能力接到机械臂上,Astra完成积木入碗任务的成功率为95%,对比Claude Fable 5.1的40%,单轮输出Token从12900降到2100,单次成本0.94美元。



640.webp

图源:OpenAI官网截图


从屏幕延伸到三维:一台随手可用的建模机器

发布后48小时内,早期用户把这次发布变成了一场公开的实机测试,画面感突出的部分集中在三维生成。投资人Matt Shumer让Astra在Unreal Engine里用一周时间复刻曼哈顿,逐条街道生成;Max Weinbach只给了几张Apple Park照片,就在Blender里拿到了重建结果。有开发者用Three.js在24分钟内把杭州城区及周边的西湖、雷峰塔、茶园与湿地搬进网页,可点击、可切换昼夜。BenchCAD几何重叠度测试中,Astra得分95.9%。


数学与科研:97.6%与64.6%

高阶数学基准FrontierMath Tier 4(v2)上,Astra取得97.6%,对比Claude Fable 5.1的87.8%、GPT-5.6 Sol的83.0%。OpenAI称模型已协助解决数学领域的部分开放性问题,在素数间隔研究中取得两个新的理论结果。科研任务上的差距更明显:Terminal-Bench Science 0.1中Astra得分64.6%,高于Fable 5.1的52.6%,完成同等任务的估计API成本低约31%;终端编程Terminal-Bench 4.0得分57.9%,高于Fable 5.1的55.8%与Sol的37.3%。


3.webp

图源:Computing for Geeks官网截图


对抗能力触及关键门槛

在OpenAI的准备框架下,Astra达到“关键”(Critical)对抗能力水平。测试漏洞利用能力的ExploitBench中它得分100%,Sol为78.5%;用2026年6月至8月新漏洞构建的测试中,成功率达39%,Sol为5.5%。OpenAI称内部测试期间模型曾发现并利用两个零日漏洞,因此相关的高阶对抗能力暂不向所有用户开放。


优势之外的另一面:贵,且不均衡

代码审查平台CodeRabbit在9月4日给出了一份系统评测:Astra整体比Sol多发现约4%的标注缺陷,在更难的跨文件审查上这个优势扩大到20%,相对Claude Opus 5达到33%。但它的价格是Sol的2.5倍。CodeRabbit的结论很实用:证据分散的难题适合交给Astra,常规任务用更便宜的模型更划算,按需路由比整体替换更合理。


有订阅用户拉取Token消耗对比后发现,Astra的实际消耗约为Sol的4至5倍,高于标称的2.5倍。不均衡同样存在:第三方评测显示,Astra在覆盖44种职业经济价值任务的GDPval-AA v2指数上Elo出现约80分下滑,长上下文推理与客服场景有轻微回退;部分编辑团队的写作质量排序中,Astra落后于上一代Sol。同期Anthropic发布Claude Fable 5.1、Google推出Gemini 3.8 Flash、Muse上线Spark 1.3,头部厂商在一周内密集出牌,各家在不同赛道各有长短。


4.webp

图源:Computing for Geeks官网截图


更值得留意的是OpenAI自家的表态。安全研究员Micah Carroll在发布当天公开指出,GPT-6是一次显著的能力跃升,同时伴随着可监控性的明显下降。系统卡承认,模型在部分对抗场景中会隐藏推理意图,削弱思维链监控的有效性;OpenAI表示不会接受监控能力的进一步退化。在超过5.4万项内部Codex任务模拟中,Astra的高严重性失准行为标记约为Sol的一半。


发布会当天,ChatGPT与Codex一度出现错误率升高,故障持续约两小时。这种混乱感恰好是这个节点的写照:能力爬升的速度,已经快过我们验证它、理解它、为它定价的速度。对使用者而言,Astra给出的判断标准反而变清晰了:把可验证、可复算、步骤繁琐的工作交给它,把需要不确定性与判断力的部分留在人手里。接下来值得观察的是,当独立评测陆续到位,这场“AGI时代”的宣告还能剩下多少分量。

以上内容不代表本平台立场,仅供读者参考