多模型协作新范式:Fable5+GPT5.6打造高效AI工作流

近期AI大模型领域迎来一系列重磅更新,OpenAI不仅正式推出了GPT 5.6全家桶,完成了Codex与ChatGPT的全面整合,还提前披露了跳过5.x版本直接发布GPT-6的研发计划,就连竞品也因此快速做出了响应调整。
本次更新最直观的变化是产品架构的重构:OpenAI直接将Codex更名为ChatGPT,原有的ChatGPT则改名为ChatGPT Classic,全新的整合产品分为三个核心区域:一是保留原有Codex的代码差异对比与合并请求展示功能;二是新增ChatGPT Work模块,将代码生成的中间过程隐藏,定位类似竞品的协同办公工具;三是将原生聊天界面迁移至左侧侧边栏,整体主打全场景覆盖的大而全体验。
除此之外,产品还新增了站点部署功能,用户通过与模型对话生成的可视化网页,可以直接一键部署为可分享的公开站点。同时新版内置浏览器也迎来了全面升级,支持导入本地密码与Cookie,新增多标签页浏览与文件下载能力,大幅提升了在线操作的便利性。
GPT 5.6家族目前分为三个档位以适配不同需求:
- Sol:超大杯版本,主打复杂推理与长时间自主任务,上下文窗口从272k提升至372k,还新增了两个专属推理档位——max模式让模型投入更多时间进行深度思考,ultra模式则会调用多个子Agent并行处理任务,重型复杂任务可选择max或ultra,日常轻量任务使用默认High模式即可。
- Terra:大杯版本,性能接近GPT-5.5,但使用成本仅为其一半。
- Luna:中杯版本,主打轻量快速的基础交互需求。
API定价方面,Sol版本每百万输入token收费5美元,输出token收费30美元,比竞品Fable5便宜约43.5%。实测中还发现,5.6 Sol版本对内置插件的调用主动性有明显优化,例如此前GPT5.5生成图表时不会主动调用Canvas Design插件,而新版模型可以自动识别需求并调用对应工具。
根据早期测试者的反馈,Fable 5虽然具备更强的逻辑规划能力,但出错率也相对更高,更适合用于项目前期的方案制定;而GPT 5.6 Sol则在执行落地层面表现更出色,目标驱动与闭环处理能力更强,尤其擅长持续数小时甚至数天的长周期任务。更值得关注的是,在Cerebras芯片的加速支持下,Sol版本的推理速度达到了750 tokens/s,比Fable 5快了整整10倍。
OpenAI还透露了一个更大的计划:将跳过GPT 5.x系列,直接推出GPT-6。此前OpenAI计划沿用代号为「Spud」的4T token预训练底座完成从5.5到GPT-6的迭代,但目前已经临时更改了研发路线。多位爆料者均提到,GPT-6将作为OpenAI对标Mythos的下一代旗舰模型,基于规模大幅提升的全新预训练底座打造,预计将在一个月后正式发布。
国内赛道同样动作频繁:DeepSeek V4正式版预计将于7月中旬上线,其能力有望追平甚至超过GLM-5.2;同时DeepSeek还在研发更大参数规模的全新模型,将与MiniMax即将推出的2.7T参数的M3 Pro展开竞争。
此外,OpenAI还宣布GPT-5.4将于7月23日正式下线,此前推出的Atla浏览器也将同步关停,后续相关功能将以浏览器插件的形式继续提供。
一、 黑盒用户自查提示语
借助Codex的浏览器自动化能力,GPT 5.6可以完全脱离代码层面的分析,模拟真实用户的操作流程来测试产品体验。具体提示语可参考:
## 真实用户走查提示语 使用浏览器或电脑控制功能打开 [网址],像真实用户一样,把以下流程逐一完整走一遍:[注册]、[结账]、[修改设置]。 不要通过阅读代码来猜测结果。每一步都要真实地点击、输入、等待并截图。 记录所有可能让第一次使用的人感到困惑或受阻的问题,包括: - 页面加载缓慢 - 报错 - 文案让人看不懂 - 找不到按钮 - 当前状态不明确 - 返回上一页后数据丢失 输出一份按严重程度排序的报告。每个问题都要包含: - 复现步骤 - 你判断的根本原因 - 建议的修复方案 然后直接修复这些问题,再把完整流程重新走一遍,确认没有引入回归问题。 把我当成一个第一次打开这个产品、从未读过代码的普通用户。
笔者在优化自己的AI热点聚合工具时就使用了这套提示语,无需额外找测试人员,就能模拟完全陌生用户的视角找出产品体验盲区,大幅提升了迭代效率。
二、 红队审查提示语
在制定项目开发计划时,可以让GPT 5.6 Sol扮演红队角色,对已有计划进行质疑与证伪,提前识别潜在风险。具体提示语如下:
## 红队审查提示语 在开始制定这份计划之前,先充当我的红队。你的判断力就是最重要的武器。 把我的计划当成一个需要被攻击和证伪的假设。 首先完整复述一遍我的计划,确认你理解无误,然后开始质疑它。 假设六个月后,这个计划已经失败。从失败结果倒推最可能的三个原因: - 哪项未经验证的假设被我直接当成了事实? - 哪种失败情形是我从未考虑过的? - 我为了省事,在哪个地方过于乐观? - 有没有更简单的办法可以实现同一个目标? 针对每个原因,分别给出: - 触发条件 - 失败代价 - 一个能够尽早证伪它的最小实验 最后给出明确结论: - 可以直接做 - 先做某项实验,验证后再做 - 推倒重来
笔者在优化「搭子Skill」工作流时就使用了这套提示语,该工作流原本计划让Claude出计划、Codex实现代码、Claude验收,但通过红队审查发现了三个核心问题:一是误将耗时环节归结到了启动脚本,实际是多次调用模型的时间被重复计算;二是不同Agent的代码版本出现了偏移,未被及时发现;三是所有任务都使用重型交付流程,小任务完全可以直接简化处理。后续调整后,工作流效率提升明显。此外在优化PPT生成工具时,这套提示语也帮助提前识别了未考虑到的假设盲区,减少了返工时间。
三、 多模型协同编排技巧
除了单模型优化,还可以通过多模型协同进一步提升效率。简单版的技巧是将Fable 5的提示语总结为行动规范,嵌入到给Sol的提示语开头,调整后的Sol执行风格会更加利落,例如在页面设计时不会将思考过程混杂在页面文案中。
进阶版本则是笔者自研的四模型编排方案:参考公开数据,Sonnet 5搭配Fable 5作为计划顾问时,在SWE-bench Pro上可以达到Fable5约92%的得分,但成本仅为63%——仅需调用一次Fable5确定方向,后续由Sonnet5完成大部分执行工作。在此基础上可以进一步优化:让Fable5负责整体计划制定,Opus4.8作为深度推理子Agent处理复杂逻辑,Sonnet5负责轻量开发任务,Codex则作为独立视角的高级工程师参与评审;遇到高风险决策时,让Opus和Codex背对背独立完成同一任务,再由Fable5综合最优解。这套编排规则仅需在配置文件中简单编写即可快速落地,笔者使用该流程仅通过一次Fable5的计划制定,就完成了自用待办清单的全面优化,相关开源内容将于下周正式发布。
目前笔者的全部期待都集中在一个月后的GPT-6上:Fable5证明了新一代大模型的上限潜力,而GPT5.6 Sol则解决了竞品存在的成本高、封号风险等问题。如果GPT-6能够搭载规模远超Spud的全新预训练底座,再结合Sol的高效执行能力,下半年的AI领域无疑将迎来新一轮的爆发式发展。
塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/
AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

