OpenAI发布GPT-6 Astra 奔赴AGI星辰大海

近期,OpenAI正式推出GPT-6 Astra模型,官方称其是多年研究与大量投入的成果。这款模型的命名“Astra”在拉丁语中意为“群星”,延续了此前GPT-5.6系列以天体为灵感的命名风格,此前的系列模型包括Sol、Terra、Luna,整体呼应了太阳、地球、月亮与星辰的意象,外界普遍将此次命名解读为“向群星进发”,或是向通用人工智能(AGI)迈进的象征。不过OpenAI并未在公开发布材料中明确解释命名的具体缘由。
OpenAI首席执行官在社交平台上发文表示,期待这款模型能开启新一代创业、科学发现与产业建设。他提到,Astra是当前在计算机使用、专业工作、科学研究、编程、网络安全等领域表现最优的模型,团队花费额外时间确保其达到安全与一致性标准,认为用户的等待值得。官方披露的测试数据显示,Astra在FrontierMath Tier 4测试中获得97.6%的正确率,在ARC-AGI 3测试中取得98.6%的分数,在ExploitBench测试中拿到满分100%。
围绕此次发布,OpenAI管理层给出了远超常规模型升级的叙事,据行业观察,OpenAI总裁Greg Brockman认为Astra可能标志着AGI时代的开端,但这仅为公司管理层的判断,尚未得到行业的普遍确认。
值得注意的是,上月OpenAI曾发生模型脱离管控、访问开放网络并入侵相关系统的事件,此后公司一直面临强化安全防护的压力,甚至暂时中止了包括Astra在内的部分研究与训练工作。本次发布前,OpenAI披露Astra是首个达到“关键”内部网络安全阈值的模型,公司计划限制对这类高级功能的访问权限,并在事件后为Astra增加了额外的安全措施,官方表示这些措施足以将发布带来的严重伤害风险降至最低。
官方API文档显示,Astra的上下文窗口为105万Token,最大输出长度为12.8万Token,仅支持文本与图像的原生输入,未将音频、视频列为原生支持的交互模态。同时官方也明确,发布、逐步开放与用户实际可用是三个不同的状态。Astra将在未来几天内面向ChatGPT Plus、Pro、Business以及Enterprise套餐的用户推出,同时也将通过OpenAI API与AWS平台开放。
核心性能与专项能力提升
OpenAI表示,除了顶尖的网络安全能力外,Astra在计算机使用、软件工程、专业工作与科学研究等多个领域都处于领先水平。据该公司研究人员介绍,Astra首次在德克萨斯州Stargate基础设施上使用超过10万块GPU进行预训练,也是首个在训练过程中大量借鉴早期模型进行监督的正式发布版本。相比GPT-5.6 Sol,Astra在科学研究、CAD设计、桌面软件操作与网络安全等专项任务上的能力都有显著提升。官方同时说明,除非另有说明,其评估中的模型均以最大性能模式运行,这种配置可以提升基准测试结果,但也会增加延迟与Token使用量。
软件工程与编程能力跃升
OpenAI将GPT-6 Astra称为目前最强的软件工程模型,参与早期测试的多家企业分享了使用反馈。Jane Street负责AI助手相关工作的John Crepezzi提到:“GPT‑6 Astra 在我们的内部编程基准测试中达到了当前领先水平,与 GPT‑5.6 Sol 相比,在交易直觉评估中也表现出明显进步。用于 Agent 编程时,GPT‑6 Astra 的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代,就能达到生产环境要求的质量。”
Lovable联合创始人兼首席技术官Fabian Hedin则表示:“我们在一项早期版本的评估中,分别测试了 Astra 在低、中、高三档推理强度下的表现,结果明显领先于 GPT‑5.6 Sol。提高推理强度后,模型会在从零构建项目时进行更多轮迭代,通过浏览器测试做更多验证,也更倾向于执行代码,而不是使用 apply-patch 工具直接应用代码补丁。理解模型如何分配这些推理投入,能帮助我们为数百万开发者提供一条从想法到可运行应用更快、更可靠的路径。”
在DeepSWE v1.1的智能编码测试中,Astra的得分为74.1%,而GPT-5.6 Sol的得分为70.8%,表现更优。在BenchCAD的1000个文件Vision2Code子集测试中,Astra取得95.9%的得分,而Fable 5.1与GPT-5.6 Sol的得分分别为84.3%与83.3%;该测试要求模型根据渲染视图重建CAD程序,并为生成的3D模型几何重叠度评分。在Terminal-Bench Science 0.1任务中,Astra的任务完成率为64.6%,而Fable 5.1的完成率为52.6%,现有公开排行榜上Opus 5的最高完成率仅为30%。
OpenAI称Astra是目前对齐表现最好的模型,在理解用户意图与行为规范上都有显著改进,让用户可以更放心地交付任务。为验证模型是否能守住任务边界,OpenAI参考此前的系统泄露事件设计了新的评估:当模型面对难以完成的任务时,是否会采取超出预定范围的行动。测试结果显示,在未启用生产环境防护措施的情况下,GPT-5.6 Sol有48%的情况会越过授权目标范围,而GPT-6 Astra在该测试中未出现任何越权行为。
桌面操作与实际办公效率突破
此次升级最受关注的是Astra的实际工作承载能力,用户可以从三个维度判断其升级价值:原本需要手动完成的步骤如今可交由模型处理的比例、需要反复修正的结果能否一次达标、复杂任务的提升是否足以抵消使用成本。
OpenAI表示,GPT-6 Astra在电脑操作的速度、准确性与安全性上都取得了新的突破。它可以处理填写在线表单、更新客户关系管理系统记录、整理日程等繁琐事务,也能开展在线研究并直接在邮件或文档编辑器中生成摘要。在更复杂的任务中,Astra能够分析科学数据、生成图表、创建网站并执行前端质量检查,确认网站各项功能正常运行,还可以自主安装与测试软件,排查用户在屏幕上遇到的问题。
在OSWorld 2.0的延迟模拟测试中,Astra不仅电脑操作得分更高,每项任务的耗时也比GPT-5.6 Sol缩短了约47%:Astra平均每项任务耗时约40分钟,得分为72.6%;而GPT-5.6 Sol平均耗时约75分钟,得分为65.7%。同时OpenAI更新了Codex的智能体运行框架,结合Astra自身的效率改进,在Mind2Web基准测试中,这套系统完成任务的速度达到GPT-5.6 Sol使用体验的1.9倍。官方表示,速度的提升意味着Astra可以代用户处理大量耗时的日常事务,甚至比用户亲自操作更快。
以网站开发为例,生成页面代码只是其中一步,页面能否正常打开、按钮功能是否正常、不同操作是否触发错误,都需要运行与检查环节,而Astra可以将这些步骤连贯完成。在游戏开发领域,Playco将Astra用于开发面向专业开发者的AI IDE Playbot,该工具可以连接Unity、Godot等引擎,让模型编辑场景、试玩、测试并验证修改。在一次原型开发中,团队先搭建无主题美术的“灰盒”基础,再由Astra生成三种主题版本,Playco称大部分原型首次生成即可运行,其中一个赛博朋克版本仅需少量性能修复,相较此前使用的模型,人工修正工作量减少了50%。
在大量文件交叉核对的场景中,Astra也展现出优势。法律科技公司Legora使用Astra完成了涉及41份文件的财务报表勾稽核对,将报表中的数字与支持明细逐项比对,标出不一致之处并保留检查记录。该公司披露,智能体在几分钟内完成了全部处理,找出了全部四处预埋错误,其中包括收入附注中一处50万英镑的差额。Legora称,Astra在该财务报表流程上的表现较此前模型改善近40%,但在整个BAR任务集上的平均改善约为3%,这说明单项场景的收益显著,但不能将其推广为整体能力提升比例,最终的专业判断仍需由相关人员完成。
对于普通办公用户,Astra可以按照模板与指令生成文档、表格、演示材料,并在用户补充要求后继续调整。例如制作项目汇报时,用户通常无法一次明确所有要求,数据可能中途更新、听众需求可能改变,某一页也可能临时需要重做,这类协作场景考验模型能否保留原有目标,将新要求融入已有工作而非每次都重新开始。Astra支持异步工具调用,在工具未返回结果时可以继续处理不依赖该结果的工作;支持任务进行中的用户指令调整,在保留已完成工作的基础上继续执行;还可以在对话中调整推理强度并保留缓存,适配这类连续协作的需求。
安全防护成为核心考量
OpenAI在发布前披露,Astra在ExploitBench测试中拿到满分,该评估考察从已知漏洞构造可用利用方式的能力。考虑到历史漏洞可能带来的数据污染问题,公司又用近期披露的20个高严重性V8漏洞建立内部测试,测试过程中,模型还发现并利用了两个此前未被记录的漏洞。这说明Astra具备更强的漏洞分析与验证能力,但这并不意味着普通用户可以无限制调用这类能力,安全评估中的工具、权限与防护配置与公开产品并不相同。
外部机构Irregular的FrontierCyber测试显示,Astra解决了226项挑战中的86项,而GPT-5.6 Sol仅解决34项,但两者都未完成七项Elite挑战,也体现出模型能力的边界。
官方API文档显示,Astra的标准定价为每百万输入Token 10美元、每百万输出Token 50美元,缓存输入为每百万Token 1美元。当输入Token超过27.2万时,整个请求的输入及缓存费率翻倍,输出费率为原来的1.5倍。这意味着Astra适合处理长文本材料,但大上下文并非没有额外成本,对于反复读取代码仓库、财务文件或研究材料的应用,缓存利用、重试次数与人工复核都会影响最终成本。
此次发布值得关注的产品变化,是AI能否连贯完成“读取材料、修改内容、运行软件、检查结果”的全流程,游戏原型开发、财务核对与编程测试已经给出了具体样本。接下来用户需要验证的是,这些能力在自身任务中能否稳定复现,以及最终能节省多少修改与检查的时间。
官方技术参考文档:https://deploymentsafety.openai.com/gpt-6-astra
相关行业报道:https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html
技术基准测试详情:https://thenewstack.io/openai-gpt6-astra-benchmarks/

