文章摘要
GPT-5.6发布,分Sol、Terra、Luna三档位,带来ultra模式和程序化工具调用两项升级。与竞品对比,各方面表现优异,定价依档位不同。同时推出ChatGPT Work,具备三项核心能力。此外,完成架构调整,加强安全措施,发布后引发社区热议。

不少AI开发者和研究者在GPT-5.6系列模型正式发布后第一时间展开了测试与应用:社区创作者Matt Shumer让旗舰模型GPT-5.6-Sol自主运行一周,搭建出了全像素体素风格的“方块版曼哈顿”乐高城;数学研究者nasqret则借助该模型推进了代数几何中K3曲面的相关研究,通过调取技术文档、编写程序、验证计算方案,最终突破了原有猜想。但同时也有用户吐槽,新推出的ultra模式Token消耗极高,仅15分钟就用完了Pro会员5小时的额度限额。

OpenAI CEO奥特曼表示,GPT-5.6是该公司迄今最强的AI模型,配套的技术博客也可能是团队近年最优秀的博客内容之一。

目前ChatGPT、Codex以及相关API已全面开放使用,原有的Codex桌面应用已升级为全新的ChatGPT桌面应用,老版ChatGPT桌面应用则更名为“ChatGPT Classic”。

GPT-5.6系列模型档位与核心能力

GPT-5.6家族分为三个档位,命名分别对应太阳、地球与月亮:

  • Sol:旗舰模型,主打最高等级的AI能力;
  • Terra:平衡款模型,面向日常办公与通用工作场景;
  • Luna:高性价比档位,速度最快且成本最低。

官方介绍,GPT-5.6 Sol在编码、知识工作、网络安全、科学任务等多个领域达到了行业顶尖水平,同时能够以更少的Token消耗和更低的估算成本完成任务。

两大全新功能升级

本次GPT-5.6带来了两项关键的功能升级:

其一为ultra模式:与此前的max模式相比,max模式主要是让模型在单个任务中投入更多推理时间,而ultra模式则更进一步,直接将任务交由多个智能体并行处理。按照OpenAI的说明,ultra模式默认协调4个智能体同时工作,最多可扩展至16个智能体协同完成任务。

其二为程序化工具调用(Programmatic Tool Calling):该功能允许模型自行编写轻量程序来协调多个工具的调用、处理中间结果、监控任务进度并自主决定下一步动作,无需开发者提前写死每一步脚本,也无需将每次工具返回的结果都重新塞回模型中处理,能够让工具密集型任务以更少的Token消耗和模型往返次数完成。

性能与能力对比

在与竞品Fable 5的对比测试中,GPT-5.6 Sol表现亮眼:在覆盖55个专业领域的长周期工作流测试Agents’ Last Exam上,Sol以53.6分刷新纪录,比Fable 5高出13.1分;即便调低到中等推理强度,仍能以大约四分之一的成本领先11.4分。即便是小尺寸的Terra和Luna模型,也能以约十六分之一的成本反超Fable 5。

代码能力方面,官方称GPT-5.6 Sol是OpenAI目前最强的代码模型。在Artificial Analysis Intelligence Index测试中,最高推理强度下的Sol与Fable 5的分差被压缩到1分以内,但完成任务的时间减少61%,成本仅为对方的一半。

设计能力上,GPT-5.6实现了飞跃式提升:仅需要高层级的指示,就能生成美观、符合人体工学且功能完整的界面。更关键的是,模型具备电脑操作能力,可以检查和打磨渲染后的最终效果,而非仅生成底层代码或文字内容,能够自主发现视觉和功能上的问题,在交付前完成收尾打磨。比如一款帆船主题的游戏,就是由GPT-5.6自主生成,其前端设计与互动体验都相当流畅。

此外,GPT-5.6还能完成端到端的知识工作:可以将Slack、Notion、Microsoft 365、Google Drive等平台中的零散日常工作素材,转化为专业水准、可直接分享的成果。在相关评测中,Sol在BrowseComp上拿到92.2%的新纪录,在OSWorld 2.0上达到62.6%,该成绩甚至超过了Claude Opus 4.8,同时输出的Token数量减少了85%。

在演示文稿、文档、表格等具体产出场景中,GPT-5.6的“遵循模板和参考文件”能力得到了显著提升:能够识别一份幻灯片的整体设计体系,包括布局、字体、间距、配色,乃至幻灯片母版中的隐藏规则,并将这些规范一致地套用到新的内容上。

定价方案

GPT-5.6系列的定价(每百万Token)如下:

  • Sol:输入$5/输出$30;
  • Terra:输入$2.5/输出$15;
  • Luna:输入$1/输出$6。

ChatGPT Work正式登场

本次发布同步推出了ChatGPT Work,该工具由Codex和GPT-5.6驱动,能够跨应用和文件行动,必要时可以持续运行数小时,将用户的目标转化为最终的完成品。

ChatGPT Work主要具备三项核心能力:

  • 跨应用取材与跨文件行动:通过内置的“统一插件目录”,ChatGPT Work首发即可连接Google Drive、SharePoint、Slack、Microsoft Teams、Gmail等多款第三方服务,用户既可以主动指定需要调用的数据源,也可以让模型自行判断应该去哪里获取所需信息。
  • 产出“成品”而非草稿:官方给出的应用场景包括根据任务直接生成Excel表格、Word文档、幻灯片、报告或网站,模型会自动检查渲染后的最终效果并完成收尾打磨。
  • 长任务与持续监督并存:任务既可以一次性运行,也可以按计划重复执行,或者根据触发条件(比如某个文件被更新)自动启动,该机制复用了ChatGPT中已有的“Scheduled Tasks”功能。在任务执行过程中,用户可以随时查看进度、回答模型的追问、调整任务方向,或者对关键动作进行审批。

此外,ChatGPT Work还强调了Auto-Review安全机制:让能力更强的模型在关键动作真正执行前先进行一遍检查,在对抗性红队测试中,该机制成功拦下了所有尝试窃取受保护数据的攻击。

产品架构调整

本次发布还完成了ChatGPT桌面端的产品架构合并:原桌面端不再仅作为聊天窗口,而是拆分为Chat、Work、Codex三种模式:

  • Chat模式:用于问答、搜索、头脑风暴等轻量对话场景;
  • Work模式:面向研究选题、信息分析、文档/表格/演示文稿/网站等成果型任务;
  • Codex模式:继续专注软件开发,展示更多技术细节如代码、diff、PR等,而Work模式则会抽象掉这些技术细节,仅呈现最终结果。

同时,OpenAI宣布将逐步淘汰独立的Atlas浏览器,相关的智能体浏览能力将并入ChatGPT内置浏览器和新的Chrome侧边栏扩展。

安全措施与测试结果

本次GPT-5.6将安全放在了重要位置,官方称其为“迄今最强的网络安全模型”,且同样做到了以更少的Token消耗实现更强的能力。

在多项网络安全测试中,GPT-5.6取得了显著领先:在ExploitBench(衡量从发现漏洞代码到实现任意代码执行的完整进展)上,GPT-5.6得分73.5%,而GPT-5.5在相同Token预算下仅为47.9%;在ExploitGym(要求智能体将真实漏洞转化为可用的漏洞利用程序)测试中,两小时时限内的最高通过率从GPT-5.5的15.1%提升至24.9%,六小时时限下更是达到33.7%;在SEC-Bench Pro(测试复杂软件中的概念验证生成)上得分71.2%,大幅领先GPT-5.5的45.8%,同时延迟表现也更优。

出于对滥用风险的考量,GPT-5.6仅对“防御性”网络安全任务提供公开支持,包括代码安全审查、补丁开发、威胁建模、蓝队工作等;而更高级别的能力,比如漏洞分诊验证、恶意软件分析、检测工程、补丁验证,仅向OpenAI Daybreak的“网络安全可信访问”计划中通过身份验证的个人和机构开放。

官方披露,这一代模型投入了前所未有的算力进行安全测试,最终结论是GPT-5.6在网络安全和生物两个维度均未越过“关键(Critical)”风险阈值。具体到网络安全领域,测试显示模型更擅长“找到并修复漏洞”,而非可靠地对加固过的目标发起自主端到端攻击,这给了防御方抢先补洞的窗口期;在生物领域,模型能够支持合法研究,但不具备从头设计或合成高危新型威胁的端到端能力。

社区反响与行业动态

GPT-5.6发布后,社区迅速掀起了讨论热潮。不少网友制作了相关梗图调侃,而另一家AI公司Anthropic在发布会后连夜回应,放出了“我们重置了大家的额度”的调侃言论,引发了更多讨论。


塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/

AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

以上内容不代表本平台立场,仅供读者参考