文章摘要
Anthropic推出的Claude Opus 5,价格仅为旗舰Claude Fable 5的一半,性能却近乎追平。它在多项测试中表现出色,在编程、知识工作等方面甚至反超旗舰。不过,它在法律、医疗领域有短板,token消耗速度也待验证。目前已向付费用户开放。

Anthropic近期推出了全新的Claude Opus 5,作为定位介于顶级旗舰Claude Fable 5和上一代Opus 4.8之间的型号,它最大的卖点在于仅需旗舰一半的价格,却能拿到几乎追平旗舰的性能表现。

最让人惊喜的测试成绩来自ARC-AGI-3:这个测试会给AI出从未见过的新题,完全依靠现场推导规律,没有参考答案可以背诵,也没有过往题目可以练习。此前这项测试的最好成绩是OpenAI的GPT-5.6 Sol的7.8%,上一代Claude Opus 4.8仅拿到1.5%,而Claude Opus 5一举拿下30.2%,不仅是上一代的20倍有余,更是GPT-5.6 Sol成绩的四倍,直接实现了断档领先,有网友评价这不是小幅进步,而是实现了跨越式提升。


在定价方面,Claude Opus 5的API价格和上一代Opus 4.8完全一致:每百万输入token收费5美元,每百万输出token收费25美元,仅为旗舰Claude Fable 5的一半。第三方AI评测机构的综合排行榜显示,Claude Opus 5在27项基准测试中拿下14项第一,总分达到74.82%,仅比Claude Fable 5的75.14%低不到0.4个百分点。简单计算下来,用户只需花费一半的成本,就能获得旗舰级99.6%的性能,这也是Claude Opus 5最核心的竞争优势。

作为Claude系列的传统强项,编程能力在Claude Opus 5上再次得到强化。在Frontier-Bench v0.1测试中,这项测试评估AI在命令行中自主编写代码完成任务的能力,Claude Opus 5拿到了43.3%的准确率,甚至比Claude Fable 5的33.7%还要高出近10个百分点,同时领先GPT-5.6 Sol的34.4%,而上一代Opus 4.8仅为21.1%,得分是上一代的两倍多,使用成本却没有变化。

有一个极具代表性的测试案例:测试方向Claude Opus 5提供了一张机器零件图纸,要求在FreeCAD中重建3D模型,但故意断开了查看图纸的接口。在无法直接获取图纸信息的情况下,Claude Opus 5自主编写了一套图像识别程序,从原始像素数据中提取几何信息,完整复原了整个零件模型,经过反复测试都能成功完成任务,而其他参与测试的模型五次尝试全部失败,相当于在考试中发现题目存在问题后,自行修正并正确作答。


除了编程领域,Claude Opus 5在知识工作和电脑操作方面也实现了对旗舰Claude Fable 5的反超。在知识工作综合评分GDPval-AA v2中,Claude Opus 5拿到1861分,超过了Claude Fable 5的1747分和GPT-5.6 Sol的1736分;在电脑操作能力测试OSWorld 2.0中,Claude Opus 5的得分达到70.6%,同样高于Claude Fable 5的66.1%,这两项此前都是旗舰模型Claude Fable 5的优势领域。

在业务自动化测试AutomationBench中,Claude Opus 5的表现同样亮眼:它在最低推理档位的通过率,就已经超过了所有其他模型开到最高档位的成绩,最终整体得分26%,第二名GPT-5.6 Sol仅为18.1%。还有网友发现了官方发布的对比图中的一处小失误:在FrontierCode测试项中,Claude Fable 5得分53.5%,Claude Opus 5为53.4%,但官方却将高亮标注在了Claude Opus 5的条目上,引发了不少网友的调侃。

实际使用场景中,Claude Opus 5也展现出了远超前代的能力。某交易公司的工程师表示,他用Claude Opus 5在会话中搭建了新交易所的完整市场数据接入系统,而此前的模型即便给出详细方案也无法完成这项工作;由于没有现成的测试数据验证代码正确性,Claude Opus 5还自主搭建了一套测试工具来完成验证。在漏洞修复方面,Claude Opus 5能够找到开源包管理器漏洞的根源,还修复了社区补丁遗漏的边界情况,而其他模型往往仅修复表面问题就宣称解决了问题。有网友使用Claude Opus 5生成了风洞模拟、细胞构件等可视化页面,画面细节远超预期,甚至有人调侃应该直接将其命名为Claude Fable 6。


当然Claude Opus 5也存在明显的短板。在DeepSWE v1.1编码测试中,Claude Opus 5拿到68.8%的成绩,略低于GPT-5.6 Sol的72.7%,OpenAI仍在这项测试中保持领先;在法律类任务Legal Agent Benchmark中,Claude Opus 5仅获得11.7%的得分,低于Claude Fable 5的13.3%;医疗类任务HealthBench Professional的得分59.8%,也低于Claude Mythos 5的66.0%。在法律、医疗这类高度专业化的领域,Claude Opus 5还有不小的提升空间。

模型性能越强,越需要关注安全性表现。Anthropic设计了自动化行为审计测试,专门评估模型是否会欺骗用户、做出不当行为或被诱导执行恶意操作,这项测试的分数越低代表安全性越好。Claude Opus 5的得分仅为2.30分,是近期四款Claude模型中最低的,优于Opus 4.8的2.85分、Claude Mythos 5的2.81分和Claude Sonnet 5的3.35分,安全性得到了进一步强化。

在网络安全领域,Anthropic并未专门针对网络安全任务训练Claude Opus 5,但随着模型整体能力的提升,其找漏洞的能力自动接近了Claude Mythos 5的水平(79.4% vs 80.0%)。不过从“找到漏洞”到“写出可用的攻击代码”仍有较大差距:Claude Mythos 5成功开发了13个漏洞的利用代码,而Claude Opus 5仅成功4个,符合“可以帮你排查问题,但不会协助进行恶意攻击”的安全定位。此外,Anthropic调整了安全分类器,Claude Opus 5比Claude Fable 5宽松85%,允许用户扫描源码漏洞,但仍严格限制渗透测试和漏洞利用相关的操作。


不过也有实测反馈指出,Claude Opus 5的token消耗速度比Claude Fable 5还要快,仅三个提示词就会耗尽额度。虽然单价仅为旗舰的一半,但如果实际token消耗更快,节省的成本可能被抵消,具体的使用成本还需要更多实测数据来验证。同时网上关于Claude Opus 5的口碑出现了两极分化,有用户认为Opus分支从4.6版本开始就已经失去了竞争力,实际使用效果仍需要用户自行测试判断。

目前Claude Opus 5已经面向所有Claude付费用户开放,Claude Max的默认模型已经切换为Claude Opus 5,Claude Pro用户也可以使用该模型。同时Fast模式同步上线,比标准模式快2.5倍,但API价格会翻倍。如果你正在使用上一代的Claude Opus 4.8,可以直接升级到Opus 5,价格保持不变,性能却能直逼旗舰级的Claude Fable 5。

以上内容不代表本平台立场,仅供读者参考