Claude Opus 5 发布:性能逼近 Fable 5

本周六凌晨,等待已久的Claude Opus 5正式推送上线,目前已经在全系列Claude产品中全线开放使用。这个版本带来了不少让人惊喜的升级:100万的上下文窗口,知识截止时间更新到了2026年5月,算得上是当前最新的大模型之一了。
我本来已经在大型AI开发平台上挂好了几个目标任务,准备早睡休息,结果看到更新消息瞬间精神,立刻暂停了所有任务,全部迁移到Claude中用Opus 5重新跑一遍。就连当天早些时候用GPT-5.6 Sol完成的一批工作,我也打算重新用Opus 5再验证一次。
不少用户看到Opus 5的跑分后都直呼离谱,尤其是在ARC-AGI-3这项测试中,Opus 5拿到了30.2%的得分,而第二名的GPT-5.6 Sol仅为7.8%,就连前代的Opus 4.8也只有1.5%,相当于直接做到了第二名的近四倍。这项测试一直是衡量模型抽象推理、陌生任务泛化能力的关键指标,过去很多模型只能复刻已知内容,遇到陌生规则就容易出错,因此ARC-AGI-3的得分能很好体现模型的真实智力水平。
更意外的是,Opus 5在AA跑分上甚至比Claude Fable 5还要出色,但价格却只有Fable 5的一半。具体来看,Opus 5的定价和前代Opus 4.8保持一致,输入每百万Token收费5美元,输出每百万Token25美元。同时还提供Fast模式,速度可以提升到2.5倍,但价格会翻倍。
不少人看到这些数据后可能会问,那是不是可以直接放弃Claude Fable 5了?其实并非这么简单,当前模型厂商放出的评测数据往往集中在代码、Agent、办公等通用场景,实际使用中的差异需要结合真实场景来看。
根据实际的系统对比数据,Claude Fable 5更像是一颗纯粹的“超级大脑”,擅长无工具推理、原生视觉理解、专业医疗表达、高难度编程以及网络安全这类极端复杂的专业任务;而Opus 5则更像一个成熟的执行型Agent,擅长调用工具、检查结果、修正错误并反复尝试,最终任务完成率更高。简单来说,前者是预训练带来的版本之子,后者则是强化学习打磨后的实用利器。
因此在复杂工程任务、Agent落地任务这类真实场景中,Opus 5的表现会更出色,但在方案设计、整体规划这类需要深度思考的环节,Claude Fable 5依然是更优的选择。所以Opus 5暂时还没有完全淘汰Fable 5,但如果是需要大规模落地干活的场景,我已经准备直接切换到Opus 5了。毕竟之前很多用户因为Fable 5的额度限制,只能退而求其次用Opus 4.8,现在终于有了更合适的中间方案:50%额度的Fable 5加上50%额度的Opus 5,兼顾效果和成本。
最近这段时间我刚好在重构自己的AI资讯平台AIHOT的API、RSS和Skill模块,因为之前上线太仓促,效果并不理想,这次重构一方面是为了优化用户的使用体验,另一方面也是为了降低服务器的请求压力,减轻我的运维负担。当时我的Fable 5额度已经用完了,就用了一个小技巧,通过ChatGPT网页版的GPT-5.6 Sol Pro来完成部分工作,它的审查深度和思考质量都比本地的同系列模型更好,还不会消耗我的平台额度。
完成初步方案后,我把它发给了大型AI开发平台上的GPT-5.6 Sol、Kimi K3和Opus 4.8进行深度评审,这几个模型都只挑出了一些无关痛痒的小问题,我以为已经没问题了,就让GPT-5.6 Sol Ultra自动执行,花了大概三个小时完成了重构。之后我又用Kimi K3和GPT-5.6 Sol做了对抗式审查,也没发现什么大问题,结果刚用Opus 5跑了一遍,就发现了一个严重的漏洞,甚至让我瞬间出了一身冷汗。
这个漏洞涉及边缘缓存击穿,两周前我就因为类似的攻击被爬取流量导致账单暴涨,现在又遇到同样的问题,赶紧连夜修复。除了代码层面的优化,Opus 5在UI设计方面也表现出色,配合Claude Design可以让界面细节变得更精致。之前我用GPT-5.6 Sol设计的Agent接入界面非常粗糙,Opus 4.8做的版本也不尽如人意,这次用Opus 5重新设计后,整体观感正常了不少。不过在写作场景上,目前还是Claude Opus 4.6的表现最好。
这次Opus 5的更新,还给Claude Code的使用方式带来了很大的变化,官方也推出了对应的使用教程。随着模型能力的不断进化,我们会发现很多之前需要的约束和插件已经变得没有必要了。比如几个月前我推荐过的Superpowers插件,放到现在来看,已经几乎没有用处了。我现在本地保留的自定义插件也只剩下6个,几乎都是自己开发的。
模型越强,需要的外部限制就越少。这次官方为了适配Opus 5和Fable 5,直接删掉了Claude Code中80%以上的System Prompt,结果编码评测并没有出现可测量的下降。很多时候我们会给模型设置很多冲突的规则,比如要求保留文档、禁止添加注释,同时又要和旧版本保持一致,这会让模型需要花费大量Token去调和这些冲突,上下文越长,这类冲突就越多。
官方将Claude 5时代的使用逻辑总结成了六组核心心法: 从过去给模型明确规则,转变为给它足够的判断空间; 从提供大量示例,转变为设计清晰的调用接口; 从把所有内容放在上下文最前面,转变为按需展开; 从重复提醒规则,转变为用简洁的语言说明工具用途; 从把记忆塞进单独的文件,转变为使用自动记忆功能; 从只提供简单的规格说明,转变为直接给出完整的代码、测试、HTML原型和参考示例。
简单来说,现在的开发逻辑已经从“给模型规划好任务方案”,变成了“设计一个让模型自主完成目标的工作环境”,真正优秀的环境会把状态、权限、约束和反馈都内置其中,只把目标和判断留给模型。我自己的使用体验也验证了这一点,现在我几乎只保留几个自定义插件、MCP和官方工具,加上一些标准化的文档,上手Opus 5的过程非常顺畅。官方也推荐大家在使用Claude Code时先运行/doctor命令,清理掉无用的冗余配置。现在确实是时候简化我们的Agent和工作流了,模型的能力正在吞噬那些不必要的中间环节。
最后,结合这段时间的使用体验,我给大家分享一下我当前的模型使用工作流: 大体量重构方案规划和底层研究,依然交给Claude Fable 5; 常规的方案设计和代码评审,使用Claude Opus 5; 代码执行和BUG修复,可以根据场景选择Claude Opus 5或者GPT-5.6 Sol,在电脑前的时候我更倾向于用Claude,不在的话就选GPT; 大型代码审查则会用ChatGPT网页版的GPT-5.6 Sol Pro; UI设计则搭配Claude Design和Opus 5; 部分项目的展示站则会用Kimi K3,它直接生成的前端界面效果非常出色。
能明显感觉到,模型的迭代速度正在越来越快,感觉已经迈过了某个技术奇点。就像相关模型收购专业开发工具之后,模型能力和迭代速度都迎来了爆发,接下来可能真的会进入两周一更的节奏。几乎每天睁开眼,就能看到新的大模型上线,我们的能力边界也在不断被拓宽,这大概是AI时代最让人幸福的事情之一了。


