Anthropic Opus 5发布:性能超Fable 5价格减半,网友开启疯玩模式

此前多次提前流出测试版本的Claude Opus 5,终于在近期正式对外发布。这款新模型上线后迅速引发全球开发者群体的热烈关注,大量爱好者第一时间对其进行了全方位测试,各类创意玩法层出不穷。
从核心测试数据来看,Opus 5不仅实现了性能反超,还拥有极具竞争力的定价:仅为竞品Fable 5的一半成本,却在多项硬核评测中追平甚至超越了对手。
在Frontier-Bench基准测试中,Opus 5拿下了43.3%的得分,反超了包括Fable 5在内的所有同级别模型,性能更是达到了上一代Opus 4.8的两倍以上。
在CursorBench最高努力模式下,Opus 5的成绩也接近定价两倍于它的Fable 5峰值表现,仅相差0.5个百分点。
官方公布的演示案例中,包含了可实时显示气流路径的风洞可视化效果,气流绕过障碍物的细节清晰可见;还有支持360度旋转的3D细胞结构模型,连内质网上密集的核糖体都得到了精准呈现。
更值得关注的是,为了匹配Opus 5出色的逻辑判断能力,开发团队将Claude Code原有的系统提示词删除了超过80%,但编码类评测的成绩并未出现任何下滑。早在Opus 5泄露阶段就有网友评价其表现堪比Fable 6,正式发布后更多开发者认同了这一判断。
Opus 5上线仅半天,就有大量开发者分享了自己的实测体验,其表现远超多数人的预期。
有开发者原本认为Opus 5只是一款定价更低的Fable 5替代品,但实测后直接推翻了自己的判断,坦言自己“大错特错”。他仅使用了5倍Max订阅额度的27%,就让Opus 5生成了一款可流畅运行的Rocket League克隆版游戏,相关代码还被开源到了评论区。
另一位开发者在完成竞技场对决场景的生成测试后,评价也发生了巨大转变:从最初认为“只是接近竞品水平”,变成了“完全甩开了所有对手”。他放出的对比视频让不少网友直呼“这就是Fable 6”,后续补充的对比测试更让他惊呼“差点从椅子上摔下来”,因为Opus 5 Max直接打破了他此前设定的测试标准。该开发者表示,这样的生成效果已经不像是代码生成的画面,更像是将提示词输入图像生成器后,直接得到了一张可以“走进”的完整地图。
开发者Alex Ermolov测试了滑雪场景的生成,最终结论是Opus 5与Fable 5打成平手,但甩开了他测试过的所有其他模型,首次生成的场景就没有明显穿模问题,滑行物理效果也完全符合真实逻辑。
在Minecraft复刻测试中,开发者Chetaslua将这次生成称为“迄今为止最出色的一次创作”,将其接入Unity引擎后,游戏开发效率得到了显著提升。
Opus 5对物理规律的掌握同样精准,在连环机关场景测试中,每个环节的运行都严格符合真实物理规则。
开发者Noema为Opus 5设置了一个极具挑战性的提示词:仅用单个HTML文件,生成一条从1945年到2055年动态变化的街区,建筑、车辆、店铺、人群、灯光和音效都要随着年份自动调整。即使将生成难度从Max降到High,Opus 5的结果依然远超Fable 5和GPT-5.6 Sol,Noema仅用三个单词评价:“是个怪物”。
在阿波罗任务点火升空场景的测试中,从火箭喷焰效果到实时刷新的遥测数据,几乎全部由程序自动生成,没有使用现成的素材库拼接。
在CAD机械设计领域,网友直接将Opus 5封神,表示其在多数机械设计任务中的表现超越了Fable 5。
教育场景方面,开发者Matt Shumer基于Opus 5打造了一款实时AI家教原型。Opus 5负责对话交互和学习方向判断,配合专门训练的小型世界模型实现实时渲染,虽然目前仍处于初步阶段,但已经可以一边讲解分数概念,一边在画板上同步绘制对应的图形。
有开发者尝试让Opus 5(Low Effort模式)生成三羧酸循环过程的3D网页动画演示。其核心思路是仅描述化学过程,将几何计算交由程序完成:Opus 5针对每一步反应仅输出原子清单和键表,每个化学键都标注了反应前后的键级,以此同时定义反应物和产物;三维坐标通过几何优化器实时求解,根据元素类型和键级获取标准键长,通过配位数推导杂化类型确定键角,再结合非键排斥和平面性约束进行迭代收敛;产物构型以反应物坐标为起点再次优化,仅保留必要的位移,离去的小分子会自动被推开飞散;最后Opus 5将代码单独抽出,校验键长和键角无误后,使用Three.js渲染为球棍模型。最终生成的动画不仅准确还原了反应过程,键长、键角等真实结构参数也都符合实际化学数据。
第三方测试平台atomic.chat通过三个破坏场景测试进行了更细致的横向对比,并统计了生成成本:同样是龙卷风卷起场地、重锤砸楼、卡车压塌桁架桥三个任务,Opus 5仅花费0.508美元就全部完成;Fable 5的花费几乎是Opus 5的两倍,但测试效果存在明显缺陷:龙卷风无法卷起地面物体,楼房在锤子接触前就自行坍塌,桥梁被直接炸成木棍堆;GPT 5.6的成本最低,仅0.14美元,但重锤完全没有接触到楼房,表现和同期的Kimi K3相当。此前有观点认为Opus 5虽然单价更低,但Token消耗量大,综合成本未必比Fable 5便宜,这次测试结果证明这只是个例。
自带自主验证能力的新一代模型
开发者Victor M进行了一项更硬核的自检测试:要求基于波音747的公开数据,用代码在浏览器中重建出可旋转查看的3D模型。
Fable 5耗时42分钟完成任务,生成了4个文件、约1000行代码,搭建了Puppeteer渲染管线,进行了17轮渲染并检查54张截图,仅通过肉眼对比判断模型是否正确。
Opus 5则耗时71分钟,生成了20个模块、约4000行代码,使用Playwright渲染管线,设置了25套镜头预设,还额外编写了一个测量脚本。其验证方式是从渲染画面中提取正射轮廓,计算翼展、轴距、机翼前缘后掠角等14项具体指标,逐项与波音747-400的公开数据核对公差。
此外Opus 5还做了多项Fable 5没有的优化:前43分钟仅渲染无涂装的素模,确认轮廓无误后再添加涂装;中途添加了调试参数,可以单独渲染某个子部件方便排查问题;最后将6个视角拼接为一张联系表,无需逐张翻看图样。
Victor M总结称,Fable 5的交付速度比Opus 5快约40%,尺寸表也更易读取,但两者使用了相同的波音747-400真实数据,Fable 5从未通过重建后的模型反向验证各项参数是否正确。
这种“自主验证”的特性在官方案例中同样有所体现:比如在Frontier-Bench的一道测试题中,要求Opus 5根据一张机械零件图纸生成代码,使用FreeCAD重建3D模型,但不提供直接看图的权限,Opus 5自行编写了一套计算机视觉管道,从像素图像中提取几何数据完成零件重建,且多次测试均成功,而同条件下其他模型五次尝试均未完成。
还有一个开源包管理器的真实bug修复案例,社区提交的补丁仅解决了表面问题,Opus 5则顺藤摸瓜找到了底层根源,同时修复了边缘场景的异常情况。一位量化交易工程师使用Opus 5搭建新交易所的实时行情源,此前的所有模型都无法完成任务,Opus 5发现没有实时数据可以验证后,自行搭建了一套测试环境,专门检查代码解析交易所数据的正确性。
综合来看,Opus 5的性价比优势十分突出:定价方面,Opus 5和上一代Opus 4.8保持一致,输入每百万Token收费5美元,输出每百万Token收费25美元,仅为Fable 5的一半价格,同时还保留了Fast模式,以两倍价格换取2.5倍的生成速度。
除了价格优势,Opus 5的跑分表现同样亮眼:在Frontier-Bench v0.1这类硬核编程任务中,它拿下了43.3%的得分,远超Fable 5的33.7%,是上一代Opus 4.8(21.1%)的两倍以上。
Opus 5表现最突出的测试项目是ARC-AGI-3,该测试专门评估模型处理从未见过的全新问题的能力,Opus 5拿到了30.2%的得分,而GPT-5.6 Sol仅为7.8%,差距接近四倍,相比上一代Opus 4.8更是提升了近20倍。
在专门挑战顶尖模型的高难度测试Human’s Last Exam中,不使用工具时Opus 5的得分为56.3%,与Fable 5的56.5%几乎持平;开启工具后,Opus 5的成绩提升至64.7%,反超了Fable 5的63.9%。
在网页搜索、编程智能体指数、深度搜索问答等项目中,Opus 5也实现了小幅领先:BrowseComp得分90.8% vs 87.4%,AA Coding Agent Index 66.7% vs 65.8%,DeepSearchQA 95% vs 94.7%。
此前官方曾在FrontierCode榜单上出现过标注错误,将得分更低的模型标记为获胜者,目前该问题已经得到修正。在电脑操作和业务流程测试中,Opus 5的优势更加明显:OSWorld 2.0测试中得分70.6%,领先Fable 5的66.1%,而且官方表示Opus 5在该项测试中的成本仅为Fable 5的三分之一不到。
此前在Opus 5泄露风波中频繁出现的Cursor联创人员评价称,Opus 5以Opus系列的价格,实现了接近Fable系列的性能。此外,Opus 5在今年的IMO 2026竞赛中拿到了满分成绩,且未使用任何外部工具。同时,Opus 5的内容拦截频率比Fable 5降低了约85%,缓解了此前用户对Fable 5过于严格的安全护栏的不满。
上下文工程的重大优化
Opus 5发布当天,Anthropic工程师Thariq发表了一篇关于Claude Code类产品上下文设计的文章,其中最引人关注的一点是:Claude Code的系统提示词被删除了超过80%,但编码评测成绩并未出现任何下滑。
这一改动是专门针对Opus 5、Fable 5这类新一代模型开发的,其背后的核心逻辑是:当模型的逻辑判断能力足够强时,就可以将原本由规则硬约束的部分交还给模型自主处理。最典型的例子就是“默认不写注释”这条规则:早期模型判断力不足,开发团队为了避免生成杂乱无章的注释,强制要求默认不添加注释,但当用户需要详细注释时,这条规则反而会带来不便。现在这条规则被替换为“编写代码时贴合周围代码的风格,匹配注释密度、命名习惯和代码规范”,将判断权完全交还给模型。
类似的逻辑也被应用到了工具设计中:过去开发团队通过提供大量示例来教模型如何使用工具,但示例越多,模型的可选路径反而被限制得越死。现在团队转而优化工具接口本身,比如Todo工具仅保留“待处理”“进行中”“已完成”三个状态,模型可以自行判断如何使用,无需额外示例。
随着模型判断力的提升,上下文内容也无需一次性全部提供给模型。系统提示词从最初将所有场景说明直接塞入,改为“渐进式披露”:将代码审查这类不常用的功能说明单独拆分为技能文件,模型在需要时自行调用。记忆功能也得到了优化,过去需要用户手动将信息写入CLAUDE.md,现在Claude可以自主判断哪些信息值得留存,并自动保存为记忆。
这些改动背后的核心思路是:规则、示例和记忆原本都是为判断力不足的模型搭建的“脚手架”,当模型能够独立承担任务时,这些脚手架就可以逐步拆除。
行业评价动态
Opus 5发布后,马斯克也参与了相关讨论,他分享了一张FrontierCode的性价比对比图,表示只有Grok 4.5和Opus 5处于帕累托最优前沿,也就是多目标优化问题中所有最优权衡解构成的边界线。按照他的说法,Grok 4.5虽然性能不及Opus 5,但价格低廉,是同等性能档位中成本最低的模型之一。

