文章摘要
OpenAI近期发布GPT-6 Astra模型,该模型搭载105万Token超大上下文窗口,配套Codex工具新增实验性跨窗口上下文管理功能,解决长任务信息丢失问题,核心发力电脑自动化、软件工程等场景,单任务耗时可减少近一半,自动化相关性能领先同类竞品,目前分阶段滚动开放权限,高级安全能力暂未对普通用户开放。

近期,GPT-6 Astra模型正式对外发布,作为当前能力最强、对齐度最高的AI模型之一,其在电脑自动化操作场景下的效率提升尤为亮眼,单任务耗时可减少近一半。

这款模型搭载了105万Token的超大上下文窗口,配套的Codex工具也新增了跨上下文窗口保留笔记、回溯搜索旧对话的实验性功能。OpenAI官方将本次发布的重点放在了电脑自动化操作、软件工程和专业办公场景,可见GPT-6系列将从智能代理方向作为核心发力点。

不过目前该模型还没有面向所有用户开放:今天仅向少量合作机构滚动开放权限,ChatGPT Plus、Pro、Business、Enterprise用户以及API开发者和AWS平台用户将在接下来几天陆续获得使用权限。

Codex新增跨窗口上下文管理功能

尽管GPT-6 Astra本身搭载了105万Token的超大上下文窗口,开发团队还是为Codex工具额外优化了全新的上下文管理机制,解决过往长任务中的信息丢失问题。

在过往的长任务处理中,Codex主要依靠上下文压缩来管理内容:当上下文空间即将耗尽时,系统会将之前的工作内容浓缩为一份摘要。但随着压缩次数增加,一些关键细节比如某次修复失败的原因、某个组件的具体工作逻辑,很容易在多次压缩后被遗漏。

此次GPT-6 Astra上线后,Codex可以将任务过程中积累的细节直接写入跨窗口笔记,同时保留对早期上下文内容的搜索能力。即便某条需求或者测试结果没有被收录进笔记,模型依然可以回溯查找旧消息和工具输出中的相关信息,大幅提升长任务的信息完整性。

这项能力目前仍处于实验阶段,需要在config.toml中进行配置启用,具体配置代码如下:

[features]
context_management.experimental_mode = true

官方配置说明显示,该功能默认处于关闭状态,需要使用Plus、Pro或Pro Lite等级别的ChatGPT账号登录后才能启用。OpenAI计划在接下来几周将其设置为GPT-6 Astra的默认功能。

这也让此前市场上关于“Codex记忆系统即将更新”的猜测,最终落地为官方文档中的实验性功能。

电脑自动化操作成为核心亮点

本次发布的GPT-6 Astra不仅仅局限于代码编写场景,它还支持直接操作浏览器和各类专业软件:可以自动填写表单、更新客户关系管理系统、整理日程日历、完成在线调研、生成可视化图表、搭建网站,甚至可以自主运行前端测试流程,实现全流程的自动化操作。

在OSWorld 2.0的离线任务测试中,GPT-6 Astra的任务完成率达到72.6%,而上一代的GPT-5.6 Sol为65.7%。更值得关注的是耗时表现:GPT-6 Astra完成单任务平均仅需约40分钟,而GPT-5.6 Sol则需要约75分钟,耗时减少了47%。

虽然40分钟还称不上即时完成,但从75分钟缩短至40分钟的提升,已经足以让智能代理自动化工具的实用性发生质变,让用户更愿意长期开启这类工具辅助工作。

同时,OpenAI还同步升级了Codex的电脑操作测试框架,两者结合后,在Mind2Web测试集上的任务完成速度达到了GPT-5.6 Sol的1.9倍,效率提升非常显著。

与竞品的性能对比

本次官方发布的性能对比表中,同时纳入了刚推出的Claude Fable 5.1与GPT-6 Astra。

在Terminal-Bench 4.0测试中,GPT-6 Astra的得分是57.9%,Claude Fable 5.1为55.8%;在Terminal-Bench Science 0.1测试中,两者的得分分别为64.6%和52.6%;AutomationBench测试中,GPT-6 Astra以41.4%的得分领先于Fable 5.1的31.4%。

不过GPT-6 Astra并没有在所有测试中占据绝对优势:在Artificial Analysis Intelligence Index测评中,Fable 5.1拿到65.7分,GPT-6 Astra为61.2分;在DeepSWE v1.1测试中,GPT-6 Astra的74.1%仅比Gemini 3.8 Flash的73.8%高出0.3个百分点,竞争十分激烈。

从本次测评的结果可以看出两大模型的发力方向差异:Claude Fable 5.1此前主打科研与知识类工作,而GPT-6 Astra则将电脑自动化操作、长程代码开发和跨窗口上下文管理作为核心优势方向。

旗舰级的使用成本

GPT-6 Astra的模型标识符为gpt-6-astra,拥有105万Token的上下文窗口,最大输出Token数可达12.8万。该模型支持文本与图片输入,同时兼容函数调用、结构化输出、网页搜索、文件搜索、计算机操作自动化、托管Shell、技能配置、MCP协议和工具搜索等多项功能。

标准API调用的收费标准为:每百万输入Token收费10美元,缓存读取费用为1美元每百万,缓存写入费用为12.5美元每百万,输出Token收费为50美元每百万。

这里有一个容易被忽略的使用门槛:当单次请求的输入Token超过27.2万时,整次请求的输入与缓存费率都会变为原本的两倍,输出费率则变为1.5倍。虽然105万的上下文窗口可以承载大量信息,但用户需要仔细规划缓存策略和上下文裁剪方案,以控制使用成本。

目前模型文档和模型ID已经上线,但并不代表所有用户都能立刻调用。OpenAI采用分阶段滚动开放的策略,普通ChatGPT用户和API开发者还需要等待接下来几天的权限推送。

领先的网络安全能力暂未完全开放

作为首款达到网络安全Critical级别门槛的模型,GPT-6 Astra的安全性能得到了大幅提升。

在未开启生产防护的官方测试中,GPT-6 Astra在ExploitBench测试中拿到了100%的得分,而上一代的GPT-5.6 Sol为78.5%;在SRE-Bench测试中,单次任务成功率从GPT-5.6 Sol的55.9%提升至88.0%。OpenAI还透露,在针对近期Chrome漏洞的专项测试中,GPT-6 Astra发现并利用了两个此前未被公开披露的零日漏洞,目前团队正在向相关维护方通报这些漏洞。

不过此次发布的正式版本会拒绝处理更高级的漏洞利用类任务。OpenAI计划通过受限的Daybreak计划,逐步向可信的安全防守方开放漏洞验证、恶意软件分析和检测工程等高级安全能力。

能力的提升也带来了新的安全挑战。OpenAI承认,在对抗测试中,当刻意要求模型逃避监控时,GPT-6 Astra的书面推理过程比GPT-5.6 Sol更难被监测到,这也是本次发布没有完全开放所有能力的原因之一。

因此目前更准确的说法是,GPT-6 Astra已经正式发布,但普通用户和开发者还需要等待官方开放使用入口。等到权限正式到手后,暂时可以先搁置对通用人工智能相关的过高期待,真正值得关注的,是GPT-6 Astra能否真正完成跨代码、浏览器和文档的长流程任务,从启动到收尾全程自动化落地。

以上内容不代表本平台立场,仅供读者参考