文章摘要
作者对新上线的Opus 5进行24小时深度试用,消耗28亿Token后全面测评。Opus 5多数核心能力超Fable 5,在部分专业场景不如GPT - 5.6 Sol。二者各有优势,适合不同任务,AI工具分工渐明,还有视觉交互模型表现出色。

最近Opus 5正式上线后,笔者第一时间进行了长达24小时的深度试用,期间仅一周的使用额度就消耗了72%,刚好同步推进一款新产品的启动工作,涵盖产品定位梳理、技术架构搭建、竞品调研和MVP拆解等全流程。对比此前使用GPT-5.6的体验,整体感受非常鲜明。

累计试用下来共消耗了28亿Token,以下是针对这款模型的全面测评总结:

  1. Opus 5的多数核心能力都超过了面向普通用户的降智版Fable 5,同时售价更为亲民,目前已经没有继续使用Fable 5的必要。
  2. Opus 5并非对GPT-5.6 Sol实现全方位碾压,在复杂后端逻辑梳理、架构设计等专业技术场景中,其表现不如GPT-5.6 Sol。
  3. Opus 5更适合带有即时反馈的协作类任务,比如边讨论边推进工作;在Claude Code工具中使用时,它更像一位具备沟通能力的资深产品伙伴,这是GPT-5.6系列模型一直未能实现的体验。而GPT-5.6 Sol则更适合长时间无人托管的长周期任务。
  4. Opus 5的思考力度档位建议选择Extra即可,官方也承认Max档位很容易出现“想多了”的过度思考问题。
  5. Opus 5存在过于主动的问题,会不自觉扩大任务范围,偶尔会出现“好心办大事”的情况,目前笔者在使用时会主动限制其探索未提及任务的权限。
  6. 相较于Opus 4.8和Fable 5,Opus 5偶尔会给出逻辑完整、语气自信但因果判断存在偏差的分析结论。
  7. 两款模型的定位差异非常明显:Opus 5更像具备产品思维、擅长沟通且技术功底扎实的资深产品经理;而GPT-5.6 Sol则更像执行力强、适合压测与审查的无感情工程执行机器。

总评维度

  • 产品开发综合体验:Opus 5 优于 GPT-5.6 Sol
  • 纯编码工程执行力:GPT-5.6 Sol 仍略胜一筹
  • 模型整体能力:二者处于同一级别,暂时没有一方实现全面领先

结合笔者的实际使用场景,整理了不同任务对应的模型推荐清单:

任务类型 推荐模型
产品创意讨论 Opus 5
MVP框架设计 Opus 5
竞品调研分析 Opus 5
快速实现从创意到产品的全流程 Opus 5
前端体验优化与设计 Opus 5
大型陌生代码库理解 Opus 5
文案类创作工作 Opus 5
创意头脑风暴 Opus 5
复杂后端架构设计 GPT-5.6 Sol
代码Debug调试 GPT-5.6 Sol
代码质量审查 GPT-5.6 Sol
浏览器自动化任务 GPT-5.6 Sol
不容出错的严谨型任务 GPT-5.6 Sol
无人值守Agent自动任务 GPT-5.6 Sol
针对既定目标的长时间循环迭代任务 GPT-5.6 Sol

不少用户都会询问,如果只能二选一应该怎么选,笔者经过反复思考后发现这个问题并没有标准答案。

目前AI工具的分工正在逐渐清晰:一类模型负责陪伴用户完成创造与协作,另一类则专注于高效执行既定任务。

另外还有一个容易被忽略的细节:部分专注于视觉与交互的模型表现同样出色,比如Kimi K3在前端审美层面的表现,目前已经超过了Opus 5和Fable 5。

你对这两款模型有什么使用体验?欢迎在评论区分享交流

以上内容不代表本平台立场,仅供读者参考