Claude Opus 5:能力近Fable 5,价格减半

就在近期,AI领域推出了Claude系列的最新模型Opus 5,这款产品的核心亮点是性能接近顶级模型Fable 5,但API调用成本仅为后者的一半。官方还将GPT-5.6 Sol纳入了基准测试榜单,直接对标当前主流的高端大模型,展现出抢占市场的姿态。
过去不到两个月的时间里,Claude家族接连推出了Mythos 5、Fable 5和Sonnet 5,系列命名越来越像一套奇幻小说的角色列表,不少用户已经懒得去记每个型号对应的定位了。不过这次的Opus 5定位却非常清晰。
Fable 5依然坚守着Claude系列的能力上限,而Opus 5则承担了将顶尖性能下沉到日常工作流中的核心任务。
Opus 5的API定价为每百万输入token收费5美元,输出token收费25美元,这一价格和上一代的Opus 4.8保持一致,却仅为Fable 5的一半。不同于常规发布强调“最强”的宣传逻辑,官方反复强调的核心问题是:在相同的预算下,模型能够将任务完成到何种程度。
理清Claude家族的分层逻辑
目前Claude系列模型已经形成了清晰的四层体系:Mythos 5作为能力天花板,仅对少数特定合作机构开放;Fable 5是面向大众的最高性能版本;Opus 5则瞄准了需要高频使用、长时间运行且需要严格控制成本的专业工作场景;至于Sonnet和Haiku,则继续承担低延迟、低成本的轻量任务。
Opus 5最显著的变化,是它已经从“偶尔请出来解难题”的辅助工具,变成了官方希望用户日常使用的主力模型。Max套餐用户可以默认使用它,Pro套餐用户也将它作为当前的最高档选择。这一定位的变化,将直接影响很多团队的模型路由策略。过去遇到长程Agent、复杂代码库或专业知识工作时,团队总要在“能力是否足够”和“账单是否承受得起”之间反复权衡;Opus 5则试图将这道选择题变得更简单。
跑分亮眼,核心优势在于性价比
官方直接将GPT-5.6 Sol纳入了对比基准测试榜单,展现出对标头部竞品的姿态:在Frontier-Bench v0.1测试中,Opus 5拿到了43.3%的得分,而GPT-5.6 Sol为34.4%;GDPval-AA v2测试中,Opus 5以1861分领先对手的1736分;在BrowserComp测试中,Opus 5仅以90.8%比90.4%的微弱差距略胜一筹。
仅凭这几项测试无法得出Opus 5全面超越GPT-5.6 Sol的结论,但官方选择将其作为对照对象,已经清晰地表明了想要抢占的市场位置。
在编程能力方面,Opus 5在Frontier-Bench v0.1中的得分超过了其他参测模型,甚至达到了Opus 4.8的两倍以上,但单任务成本反而更低;在CursorBench 3.2测试中,Opus 5最高effort档位的表现和Fable 5的峰值仅相差不到0.5%,但成本仅为后者的一半左右。
推理和电脑操作领域也有几组亮眼的数据:
- 在ARC-AGI 3测试中,Opus 5的成绩超过次优模型三倍;
- 在Zapier AutomationBench测试中,同等成本下的任务通过率约为次优模型的1.5倍;
- 在OSWorld 2.0测试中,它仅用略高于三分之一的成本,就超过了Fable 5的最佳成绩;
- 在官方的生命科学评测中,有机化学和蛋白质任务的得分分别比Opus 4.8高出10.2和7.7个百分点。
当然,基准测试永远可以挑选漂亮的展示角度。对普通用户来说,更实际的问题是:它会不会在任务做到八成时突然宣布“已经完成”,把最后两成烂摊子留给用户?
三个真实案例,比排行榜更具参考价值
官方展示了三个和任务验证强相关的实际案例,恰好都围绕“自我验证”展开:
第一个任务要求模型根据机械零件图在FreeCAD中重建3D模型,但没有提供直接查看图片的工具。Opus 5并没有卡在“无法获取图片”的问题上,而是现场编写了一套计算机视觉流水线,从像素数据中提取几何信息,最终完成了零件的3D重建。
第二个案例来自一款流行的开源包管理器,Opus 5不仅找到了bug的根源,还修复了社区现有方案遗漏的边缘场景;而对照模型仅解决了表面症状,就草率报告“问题已解决”。
第三个案例更贴近真实开发场景:工程师需要接入一家新交易所的行情数据,但没有可用的实时行情用于验证,Opus 5直接搭建了一套测试装置,对解析逻辑进行了完整校验。
这三个案例共同展现了一个关键变化:模型开始主动为自己的输出寻找验证依据。会编写代码固然重要,但清楚何时不该草率收尾,往往是更核心的能力。
还有一位用户反馈,Opus 5在一次架构讨论中直接否决了他的方案,在用户坚持后,模型并没有一味顺从,而是将争议聚焦到具体的设计细节上,最终给出了折中解决方案。这种不急于讨好用户的表现,让它更像一位可以协作的专业同事。
effort档位:比模型名更重要的调节旋钮
Opus 5还提供了可调节的effort档位功能,日常产品中包含low、medium、high三个档位,API测试中还开放了xhigh和max档位。调低档位可以获得更快的响应速度,减少token消耗;拉高档位则会让模型投入更多计算资源,换取更高的性能上限。这一功能并非炫技,而是将原本由后台控制的成本策略直接交给了用户。
简单任务可以使用low或medium档位,复杂重构任务则可以开启high档位,只有真正棘手的工作才需要推到最高档位。根据Harvey的早期测试,Opus 5在较低的推理档位就能达到Opus 4.8最高档位的输出质量,平均减少了26%的token生成量;在另一组金融建模测试中,任务耗时下降了60%。当然这些数据来自早期测试,实际迁移时最好用自身的任务场景进行验证,但可以看出,未来选择模型时,或许还要顺带选择“它值得投入多少思考时间”。
安全策略:不再只有“拒绝”选项
本次发布中,Opus 5的安全策略也有了明显优化。在自动化行为审计中,Opus 5的综合失准行为得分仅为2.3,是近期Claude系列模型中最低的;官方同时强调,这款模型并没有在生物研究和进攻性网络安全领域推出新的危险能力。
在安全分类器方面,Opus 5的网络安全分类器预计比Fable5少介入约85%的请求:它允许源码漏洞分析,但会拦截二进制漏洞扫描、渗透测试和exploit生成。当Claude.ai、Claude Code和Claude Cowork遇到被标记的请求时,默认会回退到Opus 4.8,而不是直接向用户发送拒绝信息;API用户也可以配置自动回退机制。而生物类任务的路由逻辑则相反:原本在Fable5中被拦截的请求,会被转发到Opus 5,而不是能力更弱的Opus 4.8。这种做法比“分类器越严格越安全”的思路更细致:先判断请求的风险类型,再将其交给最合适的模型处理。
开放情况与定价细节
目前Opus 5已经在Claude、Claude Code、Claude Cowork以及API平台全面开放,API对应的模型名称为claude-opus-5,上下文窗口达到100万token。
其标准定价依然为每百万输入token5美元,输出token25美元。Fast模式的响应速度约为默认模式的2.5倍,价格则为基础定价的两倍。开发者端还有两项beta更新:会话中途更换工具不会导致prompt cache失效;被安全分类器标记的请求可以配置自动模型回退机制。
总结与展望
Opus 5并没有抢占Claude系列的能力王座,它所做的是一件更务实的事:将接近顶级的性能,装进了可以高频调用的成本区间。比起那些漂亮的跑分图表,我更关注三个案例中反复出现的行为:看不到资源就自己搭建工具,没有测试环境就自己创造环境,完成测试后还要再确认一遍“是否真的正确”。
如果这种自我验证的能力能够在真实任务中稳定发挥,Opus 5或许会成为许多人的默认模型。想要验证这一点其实很简单:不要再给它准备好的演示题,直接把那件你一直不敢交给Agent的棘手任务交给它。完成后再看,它究竟是半价的Fable 5,还是一张更会讲性价比的发布海报。

