GPT-6 Astra正式发布 行业热议OpenAI最新AI模型

近期GPT-6 Astra的正式发布引发了行业广泛关注,多位科技行业从业者分享了他们的观察与实测结果。
GPT-6 Astra发布的官方回应与补偿措施
OpenAI首席执行官Sam Altman对GPT-6 Astra的发布表达了高度认可,他表示这是目前自己最喜爱的一支OpenAI官方视频,也让他对后续的AI产品形态充满期待。同时他也坦诚本次发布过程存在混乱,并向全体用户致歉。作为补偿,OpenAI将从发布当日起,为付费ChatGPT用户按照未获得Astra访问权限的天数,补发可累积的使用额度重置次数。
OpenAI的Thibault Sottiaux进一步解释了Astra的使用规则,所有套餐的Astra调用都会计入用户的正常使用额度,用户无需额外申请试用次数,可以将全部可用额度用于Astra服务。他还透露,首批补偿的重置次数将在数小时内开始发放,团队正在快速推进Astra的全量开放工作。同时他也指出,现有的AGI基准测试很快会被新一代模型突破,行业接下来需要讨论的核心问题是如何重新设定AI能力的评估目标。
企业端实测表现
Box的首席执行官Aaron Levie分享了Astra早期版本的企业级测试结果。在Box定制的高难度企业任务集合中,GPT-6 Astra的总体得分达到77%,而上一代的GPT-5.6 Sol仅为74%。在具体任务场景中,Astra的表现提升尤为显著:在媒体与娱乐任务中,得分从48%跃升至100%,能够结合不同年份、国家、内容类型与税收优惠条件精准计算盈利能力,避免重复统计问题,而Sol则出现了比例计算错误;在科技任务中,得分从69%提升至97%,可以准确识别文档中的指标缺口,将替代指标标记为proxy并指出增长数据间的不一致,而Sol曾错误将proxy指标当作真实数据;在法律任务中,得分从69%提升至93%,能够明确判断合同结构是否合规、金额是否符合政策依据,并引用相关条款作为支撑,而Sol则未给出任何引用,这在法律场景中属于严重失误;在医疗任务中,得分从53%提升至77%,可以更精准地识别放射学术语错误并判断严重程度;在能源任务中,得分从82%提升至97%,能够准确区分真正缺失的数据与测量异常导致的记录问题。Aaron Levie还透露,Astra很快将接入Box AI Studio。他同时表示,开放权重AI赛道已经迎来关键发展阶段,基础设施平台逐步成熟、模型能力持续迭代、开发者生态不断完善,商业模式也已初步成型。
行业视角与技术讨论
Cognition团队视角
Cognition的Swyx认为本次GPT-6 Astra的市场反响远超预期,标志着AI工程领域进入了全新的发展阶段。
基准测试讨论
FirstMark Capital的Matt Turck回顾了ARC-AGI基准测试的设计初衷,该测试从诞生之初就旨在避免单纯通过扩大语言模型参数规模来提升分数的误区。2024年,初代o1模型在ARC-AGI上的得分仅为18%;而到了2026年推出的ARC-AGI-3测试中,当时的前沿模型得分甚至只有约0.5%。但他指出,GPT-6 Astra配合原生测试框架后,已经完全“饱和”了ARC-AGI-3测试。传统的AI基准测试正再次面临寿命危机:当模型具备更强的工具调用、任务规划与分解能力后,原本用于测试推理能力的题目,会逐渐成为完整智能体工作流的一部分,不再能准确反映模型的真实能力边界。
Vercel团队观点
Vercel的Guillermo Rauch提到,曾经“反馈是一份礼物”只是一句客套话,但如今用户的批评意见与智能体的完整操作记录,已经可以直接转化为改进产品的精准提示词。他感谢所有主动提交问题、指出细节或转发智能体操作记录的用户。他还介绍了Vercel的AI Gateway编码智能体设置方式,通过运行~/vercel ai-gateway coding-agents setup,编码智能体即可接入AI Gateway,获得更高的服务可用性、可观测性、预算控制能力与模型切换灵活性。
Replit团队观点
Replit的Amjad Masad认为GPT-6是一次显著的能力跃升,将解锁一大批此前难以实现的新应用场景,Replit也将很快接入该模型。他还转发了Marvin Minsky在《The Emotion Machine》中的观点:情绪并非人类智能之外的附属现象,而是智能运行方式的核心组成部分。Minsky将不同的思考策略视为“选择器”,系统会根据不同情境切换对应的思维模式。这一观点与当前智能体的设计思路高度契合:智能系统不仅需要生成答案,更需要判断何时该进行检索、规划、反思或调整策略。
字节跳动视角
字节跳动的Zara Zhang直言,Grok Bot才是OpenClaw原本应该达成的形态。她更看重智能体能否融入已有的聊天与社交场景,在真实对话中持续存在、接收上下文信息并直接执行操作,而非被限制在独立的专属窗口中。她还呼吁AI产品创始人多发布真实的屏幕录制内容,展示产品的实际界面、操作流程与思考过程,而非仅发布经过精心包装的上线宣传片。她表示,对于AI产品而言,真实的工作流展示往往比官方宣传片更能体现产品的实际价值。
多智能体协作讨论
Peter Steinberger提到,在群聊场景中集成智能体工具非常实用,他计划分享自己公开构建产品的过程,以及多智能体协作的实践经验。他强调,智能体技术的核心并非单个智能体能否独立完成任务,而是多个用户与多个智能体能否在同一个对话空间中协同工作。群聊场景有望成为智能体协作、任务分配与上下文共享的全新交互界面。
Claude Code优化方向
Anthropic的Boris Cherny公开征集用户对Claude Code扩展性的反馈,他表示团队正在探索一个“既疯狂又令人兴奋”的方向,目标是让Claude Code更容易被改造、组合与扩展。Anthropic的Thariq也补充说明,Claude Code团队正在优化产品的可定制性,这里的“可定制”指的是允许用户更深入地调整智能体的工作流、可用工具与行为逻辑。
智能体落地案例
FPV Ventures的Nikunj Kothari分享了短片《The Collective》的制作过程。他首先通过语音备忘录将创作想法提交给Claude,由Claude整理成完整的项目规格文档;随后将创作目标交给Codex,配合Reactor、Gemini与Nano Banana等工具连续运行数小时,逐场生成、修改并反馈创作内容。他本人仅投入了不到20分钟的主动操作时间,主要工作是提出创作方向、审核生成结果,并通过新的目标指令让智能体继续调整优化。本次创作的整体成本约为:Reactor花费17美元,Nano Banana花费4美元,Codex消耗了每周额度的14%。他还提到,自己使用Claude Fable 5.1重新分析了Dwarkesh与Ajeya Cotra的节目内容,让模型将OpenAI与Hugging Face的相关事件改写成逐场叙事,再结合Codex与图像模型制作完整影片。他承认事实核查环节仍需要人工参与,并欢迎读者指出内容中可能存在的错误。此外,他也批评了当前主流的首席助理类产品:忙碌人群的一半以上重要信息分散在封闭系统与手机中,真正的智能首席助理需要整合这些分散的信息,识别任务优先级,具备情景记忆能力并主动采取行动,否则这类产品仅仅是精致化的办公协作工具外壳。
智能体速度瓶颈
South Park Commons的Aditya Agarwal认为,当前智能体技术最大的限制并非能力不足,而是运行速度。如果智能体的运行速度能够提升10到100倍,用户与智能体的互动方式、使用深度以及可以委托的任务范围都将发生翻天覆地的变化。

