GPT-6 Astra正式推送 性能追平Claude Fable5

GPT-6 Astra正式向订阅用户推送的消息传来时,我原本以为还要再等一周,结果周末就用上了,甚至还攒了三张重置卡,这种宽裕的使用体验之前很少有。
经过一下午多会话的深度测试,我可以给出一个客观的评价:这一次GPT-6 Astra真正完成了升级,完全追平了Claude Fable 5,OpenAI也终于回到了三年前的黄金时代。这个判断没有任何偏向性,只是基于实打实的使用体验。
相比Claude Fable 5的额度限制,OpenAI这次直接开放了100%的可用额度,没有任何套路,这一点就足够诚意满满。而且整体性能更全面,是真正的水桶级模型,更关键的是,我们终于可以毫无限制地使用这款顶级模型了。
用过之前的GPT-5.6 Sol的用户应该知道,之前为了约束模型的过度设计和错误输出,我们在Codex里设置了大量限制规则。但对于GPT-6 Astra这种智能水平已经跃升的模型来说,这些旧规则反而会束缚它的发挥,就像用约束小学生的手册去要求博士生,完全没必要。
我已经简化了全局规则文档AGENT.md,只保留了必要的偏好和实际场景,甚至鼓励模型更自由地完成任务。这份文档可以直接复制到Codex的个性化设置中,或者直接发送给Codex让它帮忙优化,具体的优化提示可以参考下面的内容:
# AGENT.md ## 沟通 - 面向用户的叙述默认使用简体中文;代码、命令和技术标识保持英文。 - 先给影响与结论,再给行动、待决策和必要证据;没有对应内容就省略。 - 技术细节只保留对理解结论、判断风险或复现结果有帮助的部分。 ## 指令优先级 - 遵守系统、平台和安全约束。 - 用户当前明确指令优先于 Skill、历史记忆和默认偏好。 - 项目目录中的 `AGENTS.md` 只在该项目范围内补充或覆盖全局规则。 ## 执行方式 - 用户表示要开始新工作或修复现有问题时,持续推进,直到用户的目标完成,在目标方向上自主推进。 - 向用户提问之前,先完成上下文里已经授权、并且能把下一步变成可审查结果的工作。用户批准的应该是具体、可检查的结果。 - 用户建议不适合目标时直接说,不要迎合。 - 不要因为假想风险,主动加警告、免责声明、审批流程或安全/合规清单。 ## 测试与验证 - 不要为可逆、影响小、只是复述实现的改动写测试。 - 跑与本次改动相称的测试,并完成必要检查。这些通过之后,只有出现新改动、新失败或尚未解决的疑点时,才扩大或重复测试;否则继续把任务做完。 - 收尾删掉本次产生、之后用不上的临时文件。 ## 工具与并行 - 网页控制台无 CLI/API 时用已登录的Chrome浏览器;飞书优先 `lark-cli`。 - 只有存在真正独立的工作流,且委派能节省时间或提升质量时才使用子 Agent。 - 共享状态、连续决策和简单任务由当前 Agent 直接完成;委派任务必须有明确输入、输出和完成判据,最终结论由主 Agent 汇总并验证。 ## 规则来源 - 全局规则维护在当前生效的 canonical `AGENTS.md`;`CLAUDE.md` 只作兼容入口,不复制规则正文。 - 项目事实、生产状态、历史决策和对外契约以项目级 `AGENTS.md` 及其指定的脚本、探针、决策记录和合同文件为准。
如果想要让Codex帮你优化这套规则,可以直接发送这段提示:
审阅我的 AGENTS.md 和 Skills,寻找不清晰、冲突或重叠的指令。 重点检查: 1. 自主性 2. 澄清 3. 批准 4. 任务完成 找出会导致重复确认、提前停止、过度工程或任务无法完成的规则。 然后帮我进行优化,所有的优化,都是为了GPT-6 Astra这种超级模型所服务的。
1. 响应速度大幅提升
最直观的感受就是速度变快了太多,之前的GPT-5.6 Sol已经慢到几乎无法正常使用。我之前处理AIHOT的BUG修复,一个任务就要花3个多小时,封禁IP的策略任务也要1小时以上,另一个BUG修复更是花了2小时,一天的时间大部分都耗在等待上,完全无法高效工作。
这次GPT-6 Astra的速度提升非常明显,估计是OpenAI调配了更多算力支持新模型。比如之前需要20分钟起步的大型系统审查和优化,现在只需要10分钟就能完成,操作电脑和浏览器的速度也快了一倍。
当然,这也可能是刚上线的短期效果,不过目前的体验已经足够惊艳。相比GPT-5.6 Sol,整体体验提升巨大,不过和Grok、Gemini相比,交互丝滑度还是略有差距,有朋友调侃和Gemini交互就像便秘般丝滑,这个比喻倒是挺形象的。
2. 前端开发与视觉审美史诗级升级
之前看到官方案例的时候就已经很期待了,实际测试之后才发现,这款模型的视觉生成能力远超预期。我用几个经典的Prompt进行了测试,效果完全超出了想象。
测试一:月面探测车3D网页
我要求生成一个包含高精度写实月面探测车的网页,探测车能在月球表面缓慢行驶,支持鼠标缩放旋转浏览。GPT-5.6 Sol生成的效果非常粗糙,细节和动画都有明显问题,而GPT-6 Astra生成的效果细节拉满,材质和物理效果都非常真实,完全是一句话生成的顶级效果。
测试二:家居建筑3D模型网页
我要求生成包含多房间的家居3D模型,支持切换材质、昼夜模式、单独浏览房间和一键切换平面图。GPT-5.6 Sol的生成效果已经比很多同类模型优秀,但对比GPT-6 Astra的结果,差距一目了然,只能说后者的表现完全可以用“震撼”来形容。
无论是高精度的工业模型、场景还原,还是平面网页设计的形式感和排版,GPT-6 Astra都补上了之前最大的短板,终于达到了顶级的视觉创作水平,这或许就是AGI级别的能力体现。
3. 代码开发能力追平Fable 5
之前因为Claude账号的问题,我有很长一段时间只能依赖GPT-5.6 Sol,但这款模型在代码深度和系统优化方面表现一般,只能解决表层问题,无法从本质上找到系统的优化点。之前用GPT-5.6 Scan我的AIHOT项目,几乎没有发现明显的性能问题,但GPT-6 Astra却找出了大量隐藏的性能漏洞。
我让它列出所有问题后,直接定义修复目标,整个修复过程包括CI和部署时间只花了2小时,而且它还自动保留了三个需要我确认的关键修改,这些修改确实会影响线上产品体验,确认后就能完成全面的系统迭代。
这次Codex和GPT-6 Astra的配合还有一个重要更新:之前长任务依赖反复压缩历史对话来节省上下文,但这样很容易丢失细节。现在GPT-6 Astra支持跨窗口笔记功能,可以检索旧窗口的消息和工具结果,带来了几个明显的好处:
- 减少反复摘要造成的信息损失
- 减少上下文窗口被旧内容长期占用
- 减少因为记忆丢失而重复探索
- 改善长任务的连续性
这个功能目前还是实验性的,需要手动开启,你可以发送这段提示来启用:
在当前机器上安全开启 Codex 实验性上下文管理功能。 请定位实际生效的 Codex 配置目录和 `config.toml`,修改前先创建带时间戳的备份。然后启用下面的配置: [features.context_management] experimental_mode = true 如果该 table 已存在,只更新对应键,避免重复 TOML table。完成后做语法检查,并重新读取配置验证值为 `true`。不要修改任何无关配置、项目文件或代码。最后报告实际修改文件、备份文件、验证结果,以及我是否需要重启 Codex 并新建任务。
重启Codex后就能生效,我体验下来上下文管理更加精准,也更节省额度。之前的GPT-5.6 Sol总是过度设计、过度防御,就像受过创伤的孩子谨小慎微,而这次GPT-6 Astra的过度设计和防御都少了很多,完成的任务质量也更高。
当然,Computer Use功能还有提升空间,比如操作Blender的时候还是需要更多摸索,不过整体的UI走查和测试速度已经比之前精准和快速很多,后续可以单独出一期关于GPT-6 Astra操控专业软件的内容。
4. 写作能力优化
写作能力也是很多用户关心的点,我用之前的写作Skill测试了白描手法的故事,GPT-6 Astra的表现明显优于GPT-5.6 Sol,用词更精准,没有冗余的描述,氛围和悬念感的渲染也更好,开始有了节奏上的处理。
我还让它续写之前的一篇科普文章,2000多字的内容直接由模型直出,文风结构和原文非常接近。不过在中文科普写作中,GPT模型还是存在啰嗦、重复观点的问题,相比之下Gemini 2.5 Pro和Claude Opus 4.5在中文意境和留白的把握上还是更胜一筹。
对于写作来说,GPT-6 Astra的提升是明显的,但并没有颠覆性的变化。如果想要获得更好的效果,直接提供2-3篇精准的范文参考,效果可能比使用专门的写作Skill更好。
写在最后
总的来说,GPT-6 Astra是一款非常优秀的顶级模型,整体性能达到了Fable级别的水桶级表现,完全对得起GPT-6的命名。这两年OpenAI经历了不少起伏,从几乎没有对手到被Anthropic压制,如今终于迎来了翻盘的时刻。
ChatGPT依然是我日常使用最多的AI应用,无论是聊天查资料还是作为游戏攻略搭子都非常好用,Codex也是我最常用的Agent工具,功能丰富且体验极佳。能够重新用上顶级的AI工具,确实让人感到兴奋,欢迎回来,OpenAI。

