文章摘要
Anthropic推出全新升级的Claude Opus 5,成为兼顾日常与顶级性能的主力视觉 - 语言模型,综合表现优、成本低。它支持图文输入,性能在多测试中领先。构建上用公、专有数据训练,安全防护有回退机制。其解决了Claude Fable 5的部分问题,但也有易产生幻觉等不足。虽定价高,但Anthropic押注特定领域,认为客户愿为性能付溢价。

在推出Claude Fable 5之后,Anthropic的旗舰Opus系列曾一度仅作为高端备选方案,未来走向不明。如今该系列迎来全新升级,Claude Opus 5正式登场,成为一款兼顾日常使用需求与顶级性能的主力视觉-语言模型,综合表现优于前代的Claude Fable 5,且运行成本更低。

产品核心概况

这款模型支持文本与图片输入,单轮输入最大可达100万token,输出文本长度上限为128000token,生成速度可达52.8token/秒。其知识截止时间为2026年5月。

Claude Opus 5提供五档推理等级(low、medium、high、xhigh、max,默认设置为high),支持工具调用,从512token起即可使用提示缓存功能,还配备了约为标准速度2.5倍的快速模式,且全程无数据保留机制。

性能方面,该模型在第三方行业评测的Intelligence Index中以61分位列第一,在ARC-AGI-3测试中同样表现亮眼,该测试用于评估智能体在陌生交互环境中的学习效率。

价格与可用性上,Claude Max订阅用户可默认使用该模型(订阅费用为每月100-200美元),Claude Pro订阅用户也可使用其作为最强可用模型(订阅费每月20美元)。API调用价格为每100万输入/缓存输入/输出token分别收取5美元/0.5美元/25美元;快速模式仅对Claude API开放,收费标准为每100万输入/缓存输入/输出token分别10美元/1美元/50美元。目前官方并未披露该模型的参数量、架构、训练数据及训练方法。

模型构建与安全机制

Anthropic仅公开了Claude Opus 5少量的构建细节,主要集中在训练与模型控制层面。该模型使用公共与专有数据进行训练,数据来源包括公开网站收集的素材以及其他模型生成的内容,随后根据公司宪章中定义的人类价值观进行了微调,且官方特意将网络安全任务排除在了训练范围之外。

与前代模型相比,Claude Opus 5在未被明确要求的情况下,更擅长将任务委派给子智能体,同时自我检查能力也有所提升。官方提醒开发者,应避免直接沿用为早期模型编写的验证类指令,因为这类指令可能会让Claude Opus 5出现过度验证的问题。

在安全防护方面,被标记为网络安全风险的交互会自动回退至Claude Opus 4.8,但该情况的出现频率比Claude Fable 5更低。其安全检测机制为:每次请求时都会有探针读取模型的内部激活状态,将疑似违规内容交由第二个模型进行输入输出判断,检测范围涵盖模型读取的所有内容,包括记忆、文件、搜索结果以及连接的工具,任意一项触发阈值都会引发回退。官方明确,扫描源代码漏洞等日常防御性工作是被允许的,但生成漏洞利用代码、渗透攻击等进攻性请求会触发回退;与Claude Fable 5不同,Claude Opus 5不会对生物学、化学及生命科学相关问题进行回退,官方认为该模型在这些领域的安全风险更低。

实测性能表现

Claude Opus 5在多项基准测试中都处于领先位置,单次任务成本低于Claude Fable 5,但高于多数其他模型,其在陌生环境学习能力测试中的优势尤为突出。

在Intelligence Index这项包含9项经济实用型任务的综合评测中,Claude Opus 5在max推理设置下拿到61分,略高于启用回退并使用max推理的Claude Fable 5(60分)以及OpenAI的GPT-5.6 Sol(59分)。成本对比上差距更为明显:Claude Opus 5平均每项任务花费2.03美元,介于Claude Fable 5的2.75美元与GPT-5.6 Sol的1.54美元之间。当使用xhigh推理设置时,Claude Opus 5在Coding Agent Index中与GPT-5.6 Sol的max推理版本并列第一,得分均为67分。此外,在GPTval-AA v2、AA-Briefcase(两项均用于评估智能体式知识工作能力)以及MMMU-Pro(多模态推理测试)中,Claude Opus 5的表现也优于Claude Fable 5与其他所有竞品。

在ARC-AGI-3测试中,该测试会将AI智能体放入从未接触过的游戏环境中,评估其学习规则的效率,Claude Opus 5在high推理设置下取得了30.2%的正确率,单次运行成本约2.07万美元,成绩几乎是次优模型GPT-5.6 Sol(max推理设置下7.8%正确率,成本2.51万美元)的四倍。

在Terminal-Bench 3.0这项评估模型完成业务工作流能力的测试中,Claude Opus 5以max推理设置位列第一,完成了43.5%的任务量;在其继任测试Zapier AutomationBench中,该模型同样表现领先,该测试用于评估智能体解决计算机自动化任务的能力,Claude Opus 5的任务成功率为26.2%。在CursorBench 3.2这项针对编程能力的测试中,Claude Opus 5以70%的正确率、每项任务8.23美元的成本,仅次于max推理设置下的Claude Fable 5(70.5%正确率,每项任务17.32美元)。

行业动态背景

7月22日,美国白宫科学顾问迈克尔·克拉齐奥斯公开表示,Moonshot AI推出的Kimi K3开源权重模型,是通过蒸馏Claude Fable 5打造而成,该模型在第三方行业评测的Intelligence Index中排名第四。随后美国财政部长斯科特·贝森特威胁将对相关方实施制裁。不过Laude Institute的研究员Braden Hancock指出,Claude Fable 5公开可用仅短短几周,根本不足以完成数据蒸馏、模型训练及发布的全流程,该说法让这场争议变得更加复杂。

产品升级的核心意义

Claude Opus 5解决了长期以来用户对Claude Fable 5的诸多不满:比如前代模型常对良性科学问题进行回退或拒答、无法纳入多数订阅套餐、定价高昂,以及严苛的30天数据保留政策。不过需要注意的是,在部分场景下Claude Fable 5仍有其溢价价值:比如Claude Opus 5更容易产生幻觉内容,事实回忆能力也相对更弱,且当前的基准测试可能并未完全覆盖两款模型的差异。但对绝大多数开发者的使用场景来说,这款全新升级的模型都是一次受欢迎的更新。

行业视角与思考

尽管全新的Opus系列模型比Fable或Mythos系列更便宜,但整体定价依然偏高。与其他AI实验室追求更快速度与更低成本的路线不同,Anthropic选择了相反的方向:打造更大、推理速度稍慢、知识储备更丰富但定价也更高的模型。该公司押注在网络安全、软件工程、文档生成等领域,认为客户愿意为顶级性能支付溢价,甚至在需要更快推理速度时,愿意支付双倍的快速模式费用。

以上内容不代表本平台立场,仅供读者参考