ChatGPT 5.6 Sol & Work双升级,AI办公体验再突破

曾经的AI行业屠龙者,又回来了。
就在不久前的官方直播中,GPT-5.6正式对外发布,同时ChatGPT也迎来了2022年诞生以来最重磅的一次升级。从预热动画里就能看出端倪:ChatGPT和Codex完成了历史性的合体,曾经独立的Codex应用彻底融入ChatGPT生态,从此市面上不再有单独的Codex,只有全新的ChatGPT。
当你打开新版界面时会发现,原来的ChatGPT聊天界面已经被大幅重构,整体UI完全沿用了Codex的设计风格,只有角落一个小小的聊天Tab,还在提醒着人们这个产品曾经的身份。而这也标志着,由ChatGPT开启的大众AI启蒙时代,正式完成了它的历史使命,属于智能Agent的全新纪元已经到来。
一、GPT-5.6家族:全能模型的全面升级
本次OpenAI一共推出了三款全新模型,分别是代表行业巅峰的新旗舰Sol、适配日常工作的均衡型Terra,以及主打高性价比的基础款Luna。我们重点来聊聊GPT-5.6 Sol,这也是目前OpenAI对外开放的最先进的智能模型。
要知道这款模型的实力到底有多强,只需要看竞争对手的反应就知道:在GPT-5.6 Sol发布当天,其竞品公司就紧急重置了用户的使用额度。
作为一名运营着AI资讯网站的开发者,我最近半年一直被持续的网络攻击困扰:网站部署了边缘代理、DDoS防护、封禁策略和JS挑战,但每天还是会遭遇各类攻击,上周一天内就被攻击四轮,早间的防护没能顶住导致网站一度宕机,下午的三轮攻击才成功拦截。
在这个过程中,之前常用的Claude Fable 5几乎派不上用场——只要提到网络安全、DDoS相关的内容,就会被自动切换到基础模型,而且这款模型虽然规划和逻辑能力出色,但在具体执行上经常顾此失彼,还存在一定的幻觉问题,最关键的是使用成本极高,很快就会耗尽额度。
而GPT-5.5虽然代码执行能力不错,改BUG的效率很高,但规划和方案设计能力严重不足,经常在没有全盘思考的情况下就开始动手,虽然幻觉率低,但细节考虑不周,做出来的安全防护方案漏洞百出,最后还是需要靠仅剩少量额度的Claude Fable 5来兜底修正。
用一个形象的比喻来说,Claude Fable 5就像是一位总监级别的大神,虽然思路清晰、规划能力强,但在执行细节上容易出现偏差,经常会按照自己的逻辑完成工作,却偏离了用户的真实需求;而GPT-5.5则像是一位高级工程师,执行能力出色,但缺乏全局视角,就像网友形容的那样:“会议室里刚听到一半描述,就已经开始在白板上画方案了”。
那段时间的处境非常尴尬:Claude Fable 5额度耗尽,GPT-5.5只能处理中等规模的项目,这也是我如此期待GPT-5.6的核心原因——我希望它能同时兼具优秀的规划能力和强大的执行能力,彻底解决之前的痛点。
在OpenAI6月26日发布前瞻预告后,终于在近日迎来了GPT-5.6的正式上线。我第一时间将GPT-5.6 Sol调到最高的Ultra档位开始测试,经过5小时的高强度并行开发,对这款模型有了切身的体会:它是目前市面上综合能力最均衡的模型,不仅价格亲民、性价比极高,在非超大型任务上的规划能力已经可以媲美Claude Fable 5,Agent能力和代码执行的幻觉率极低、精度极高,配合Codex的交互体验和远程编码功能都非常出色,浏览器控制也更加稳定。
唯一的短板依然是前端审美和内容创作,相比Claude还有一定的差距,但除此之外,几乎找不到再使用其他模型的理由。而且好消息是,GPT-5.6 Sol已经纳入订阅计划,付费用户可以直接使用。
接下来我们看看官方公布的跑分数据:在覆盖55个领域的专业工作流测试Agents' Last Exam中,GPT-5.6 Sol以53.6分刷新了历史纪录,比Claude Fable 5高出13.1分;即使使用中等推理模式,依然能以约四分之一的成本领先Fable 5达11.4分。
在AA智能指数测试中,GPT-5.6仅比Fable 5低1分,但任务完成时间缩短了61%,成本预估降低了约一半。而在编程领域的优势更加明显:在Artificial Analysis编程智能体指数测试中,开启最大推理能力的GPT-5.6 Sol以80分创下新标杆,比Fable 5高出2.8分,同时输出Token减少一半以上,耗时缩短一半以上,成本降低约三分之一。
在ExploitBench测试中,GPT-5.6 Sol在可比的输出Token预算下得分达到73.5%,这意味着只需要极低的成本,就能达到和Claude Fable 5几乎相当的网络安全效果。
在我的实际测试中,虽然偶尔会触发内容安全限制,但在说明是为了优化边缘代理防护策略后,模型顺利完成了任务。我当时因为语音输入有误,把EO识别成了EU,但这并不影响整体效果。我开启了Ultra档位和快速模式,仅用21分钟就得到了一份非常详细的审查报告。
以我使用的200美元Pro套餐为例,5小时的高强度使用仅消耗了20%的额度,周额度仅用了2%-3%。对比Claude Fable 5,即使搭配Ultracode,同样的使用强度一周额度会消耗8%-10%,差距非常明显。
这次测试的质量也超出预期:我之前的边缘代理防护规则是由Claude Fable 5搭建的,GPT-5.5做了多次补丁优化,但一直没能找到所有的漏洞,而GPT-5.6 Sol直接找出了11处之前都没发现的问题,并且一键完成了修复,整个过程没有出现任何BUG,只等后续攻击来临时验证实际防护效果。
另一个案例能很好地体现GPT-5.6和Claude Fable 5的差异:我一直有一个痛点,就是为了让网站用户不用翻墙就能浏览资讯,做了新闻详情页自动抓取还原的功能,但要适配几百个不同的源站,还原完整的阅读体验、保留格式、超链接、代码块和图表等,难度非常大,之前用Opus 4.8和GPT-5.5开发的效果都很差。
我同时把这个需求交给了GPT-5.6 Sol和Claude Fable 5,并且使用了相同的参考文档,唯一的变量就是模型本身。最终的结果让我意外:GPT-5.6的方案在细致程度上甚至超过了Fable 5。
比如,虽然很多源站是通过API和RSS抓取的,本身带有清晰的正文内容,但GPT-5.6并没有直接信任这些数据源,而是提出必须进行结构化的正文抽离,这一点是Claude Fable 5遗漏的细节。另外,对于同域名下重复出现的导航、固定CTA内容,两款模型都考虑到了可以通过统计识别并删除,但GPT-5.6的方案考虑得更加周全。
而且GPT-5.6的输出可读性更强,方案的逻辑清晰容易理解,而Claude Fable 5的信息密度过高,读起来比较费力。最终我选择了让GPT-5.6 Sol开启目标模式执行这个任务,因为我对Claude能否长时间稳定处理这么多细节没有信心,很容易出现幻觉、顾此失彼,而GPT-5.6的幻觉率极低,配合目标模式可以精准完成任务。
最后说说前端审美:虽然GPT-5.6相比GPT-5.5已经有了大幅进步,但相比Claude还是有一定差距。比如我之前让GPT-5.5生成台风数据可视化大屏,效果差强人意;而GPT-5.6的输出则明显改善,至少不会出现明显的AI生成排版问题。
目前GPT-5.6的使用权限分为不同档位:Plus和Pro用户可以使用GPT-5.6 Sol,免费和Go用户只能使用Terra;最高档的Ultra推理等级仅对100美元和200美元的Pro用户开放,Plus用户无法使用。
定价方面,GPT-5.6按每百万Token计费:Sol为5美元输入/30美元输出,Terra为2.5美元输入/15美元输出,Luna为1美元输入/6美元输出。同时GPT-5.6还引入了更可预测的提示缓存功能,支持显式缓存断点和30分钟的最低缓存生命周期,缓存写入按非缓存输入价格的1.25倍计费,缓存读取则可以享受90%的折扣。
二、ChatGPT Work:从聊天助手到全能工作Agent
这次更新最让人意外的,就是ChatGPT和Codex的正式合并,也就是我们开头提到的全新ChatGPT Work模式。现在用户可以在左上角直接切换工作和聊天模式,其实本质上和之前的Cowork与Claude Code的区别类似。
Codex本身就是一款通用的Agent工具,既能编写代码也能处理办公任务,但市场上一直存在一个心智门槛:很多用户认为“能写代码”就意味着上手难度高,需要专业技能。因此OpenAI没有选择推出全新的Codex Work,而是直接对拥有10亿周活用户的ChatGPT进行改造,将其升级为ChatGPT Work,这样老用户迁移起来更加自然,也降低了用户的认知门槛。
国内的WorkBuddy已经拥有千万日活,也印证了这类工作类Agent的市场潜力。ChatGPT Work的最大心智差异,就是将原本偏向代码的菜单栏替换成了Doc、PPT、Excel三件套,让用户体感上更像是在使用一款办公辅助工具。
我自己也尝试用GPT-5.6 Sol制作了一份关于本次更新的PPT,虽然整体审美还有提升空间,但已经完全可以满足日常办公需求。而且这款模型处理表格和数据分析的能力非常出色,是目前市面上性价比最高的工作类Agent产品。
值得一提的是,原来的ChatGPT聊天模式被移动到了角落的一个小Tab中,仿佛在宣告这个初代AI聊天助手的历史使命已经完成。点击这个Tab后,右下角会弹出一个小巧的聊天界面,就是我们熟悉的ChatGPT对话功能。
本次更新还有一个非常实用的新功能:站点部署功能。对于非开发者来说,想要将自己开发的AI应用部署到线上供他人使用一直是个难题,而OpenAI推出的Sites技能完美解决了这个问题:用户只需要用Prompt发送“用Sites部署”的指令,系统就会自动完成部署并提供一个可分享的域名,不管是给同事还是朋友使用都非常方便。
写在最后
这一次的更新,再次证明了OpenAI依然拥有强大的生命力,还是当年那个敢于挑战行业巨头的屠龙少年。曾经的OpenAI从追赶者变成了行业领导者,但随着时间推移也逐渐被用户诟病,甚至被认为已经变成了新的“恶龙”。
直到Anthropic异军突起,OpenAI一度被打得节节败退,灰溜溜地让出了王座。但很快他们重新调整了方向,砍掉了过于傲慢的项目,回归用户需求,推出更贴合大众使用的产品和模型。如今的OpenAI再次站到了对手面前,宣告着新一轮的AI赛道竞争正式开启。
塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/
AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

