Anthropic发布Claude Opus 5:半价逼近旗舰性能的新一代AI模型

2026年7月24日,Anthropic正式发布Claude Opus 5,这是Opus系列的最新旗舰模型。该模型在保持与前代Opus 4.8相同API定价(输入5美元/百万Token、输出25美元/百万Token)的前提下,实现了大幅性能跃升,在Frontier-Bench v0.1等软件工程评测中超越Fable 5和GPT-5.6 Sol,同时任务成本仅为Fable 5的一半。Claude Opus 5已在全平台上线,成为Claude Max的默认模型。

第一章 产品发布概述
1.1 发布背景与时间节点
2026年7月24日,Anthropic正式向全球推出Claude Opus 5。此次发布距Opus 4.8问世仅约两个月,紧随6月相继推出的Mythos 5、Fable 5和Sonnet 5之后。Anthropic产品负责人Dianne Penn在接受路透社采访时表示,此次发布反映了公司快速迭代的发展节奏。
与以往强调“最强模型”的发布策略不同,Anthropic此次给出了更为务实的定位——Claude Opus 5是一款“深思熟虑且主动性强”的模型,其智能水平接近Claude Fable 5,但价格仅为其一半。这一定位变化直接体现在产品布局上:Claude Opus 5已成为Claude Max的默认模型,同时也是面向个人订阅用户(Max/Pro)可调用的最强模型;能力更高的Fable 5则主要面向API与企业客户。
1.2 全平台同步上线
Claude Opus 5发布当日即实现了全平台覆盖。用户可通过以下渠道使用:
- Claude API:开发者可通过API直接调用,支持Messages API和Chat Completions接口
- Claude Max与Claude Pro:Opus 5已成为Max方案的默认模型,同时也是Pro方案中最强的可选模型
- Amazon Bedrock:在AWS Bedrock平台上线,支持us-east-1、us-west-2等多个区域的部署
- GitHub Copilot:企业用户可在Copilot中调用
- Vercel AI Gateway:已集成至AI Gateway
- Cosmic:可在Agent和AI设置中选用
第二章 核心技术规格
2.1 模型架构与参数
Claude Opus 5是Anthropic迄今最先进的Opus层级模型,专为长时间运行的智能体任务而设计,同时在编程和专业工作方面实现了显著改进。核心规格如下:
| 技术规格 | 参数详情 |
|---|---|
| 上下文窗口 | 100万Token |
| 最大输出Token | 12.8万Token |
| 推理支持 | 自适应思考(默认开启) |
| 知识截止日期 | 2026年5月 |
| 输入模态 | 音频、图像、语音、视频、文本 |
| 输出模态 | 嵌入、图像、语音、文本 |
| API支持 | Responses、Chat Completions、Messages |
| 模型生命周期 | 活跃(Active) |
2.2 自适应思考机制(Adaptive Thinking)
Claude Opus 5引入了可调节的“effort”(思考档位)机制,用户可按任务难度动态调整推理资源的投入。档位越高,处理复杂问题的能力越强,但响应速度更慢、Token消耗更多;调低档位则可在保证基本性能的前提下节省成本。
从最低档位(low)到最高档位(max),输出Token相差约8倍,在GDPval-AA v2知识工作评测中的成绩相差约407个Elo评分点。这一机制使开发者能够在性能与成本之间做出精细化的权衡。
2.3 快速模式(Fast Mode)
对于延迟敏感的工作流,Claude Opus 5提供了快速模式(Fast Mode),运行速度约为默认模式的2.5倍,价格约为基础价格的两倍。这一选项为需要快速响应的实时应用场景提供了灵活选择。
2.4 Prompt缓存支持
Claude Opus 5支持Prompt缓存功能,最小缓存检查点为512个Token,单次请求最多支持4个缓存检查点,缓存生存时间(TTL)支持5分钟和1小时两种选项。缓存可应用于system、messages和tools等字段,有助于降低重复请求的成本。
第三章 性能基准测试
3.1 软件工程能力
在软件工程领域,Claude Opus 5的表现尤为突出。
Frontier-Bench v0.1:这是一项端到端软件工程任务测试。Claude Opus 5取得了43.3%的得分,不仅超越了所有参测模型,更以明显优势领先于Fable 5的33.7%和OpenAI GPT-5.6 Sol的34.4%。与上一代Opus 4.8相比,Opus 5的性能提升超过一倍,而单项任务成本反而更低。
CursorBench 3.2:在开启最高思考档位(max effort)后,Claude Opus 5与Fable 5最高成绩的差距仅为0.5%,而单项任务成本约为Fable 5的一半。
SWE-bench系列:在SWE-bench Verified测试中,Claude Opus 5取得96.0%的成绩,领先Fable 5的95.0%;在SWE-bench Pro中,Opus 5得分为79.2%,略低于Fable 5的80.3%。
3.2 知识工作与问题解决
在知识工作领域,Claude Opus 5同样展现出强劲实力。
GDPval-AA v2:这是一项基于Elo评分体系的知识工作基准测试。Claude Opus 5获得1861分,大幅领先Fable 5的1747分和GPT-5.6 Sol的1736分。
ARC-AGI 3:这项测试考察模型解决全新、陌生规则问题的能力。Claude Opus 5在high档位下取得了30.2%的得分,而此前排名榜首的GPT-5.6 Sol仅为7.8%。这一近四倍的差距充分体现了Opus 5在规则归纳、观察与试错方面的卓越能力。
Humanity‘s Last Exam:在不使用工具的情况下,Claude Opus 5得分为56.3%,略低于Fable 5的56.5%;但在开放工具后,Opus 5升至64.7%,反超Fable 5的63.9%。这一对比说明Fable 5在纯模型能力上仍有微弱优势,而Opus 5在搜索、调用工具、检查结果并持续推进任务方面更具优势。
3.3 商业流程自动化
Zapier AutomationBench:这项测试衡量模型从头到尾完成商业任务的能力。在相同的单项任务成本下,Claude Opus 5的通过率约为第二名(Fable 5)的1.5倍。即使在最低思考档位下,Opus 5完成的通过任务数量也超过任何其他模型。在完整的客户流失预防工作流中,Opus 5实现了100%的端到端成功率。
OSWorld 2.0:这是一项计算机操作基准测试。Claude Opus 5仅用Fable 5单项任务成本的略多于三分之一,就超越了后者的最好成绩。
3.4 综合智能指数
在涵盖9项测试的综合智能指数中,Claude Opus 5得分为61分,以微弱优势领先Fable 5的60分。评测同时显示,Opus 5在事实知识方面仍落后于Fable 5。
3.5 与前代Opus 4.8的对比
与Opus 4.8相比,Claude Opus 5在多个维度实现了显著提升:
| 对比维度 | Claude Opus 4.8 | Claude Opus 5 |
|---|---|---|
| 发布时间 | 2026年5月 | 2026年7月24日 |
| 上下文窗口 | 100万Token | 100万Token |
| API输入价格 | $5/百万Token | $5/百万Token |
| API输出价格 | $25/百万Token | $25/百万Token |
| Frontier-Bench v0.1 | 基准线 | 性能翻倍以上 |
| 生物科学任务 | 基准线 | 全面超越 |
| 自适应思考 | 不支持 | 支持(可调档位) |
| 快速模式 | 不支持 | 支持(2.5倍速) |
第四章 定价策略与成本效益
4.1 API定价体系
Claude Opus 5的API定价与前代Opus 4.8保持一致:
- 输入Token:5美元/百万Token
- 输出Token:25美元/百万Token
这一价格约为Fable 5的一半。有报道称Opus 5价格仅为Fable 5的三分之一,差异源于不同对比基准——部分报道将Opus 5与Fable 5的输出价格对比,后者约为75美元/百万Token。
4.2 成本效益分析
Claude Opus 5的核心价值主张在于“以Opus的价格获得接近Fable的性能”。在实际应用中,这一优势尤为明显:
- Harvey公司的测试:法律科技公司Harvey报告称,Claude Opus 5在较低推理级别下即可达到Opus 4.8最高推理模式相近的性能,同时平均减少26%的Token消耗。
- 智能体任务成本:在OSWorld 2.0测试中,Opus 5以Fable 5三分之一的成本超越其最佳成绩。
- 软件开发成本:在CursorBench 3.2中,Opus 5以Fable 5一半的成本实现仅0.5%的性能差距。
4.3 Amazon Bedrock服务层级
通过Amazon Bedrock使用Claude Opus 5时,可选择多种服务层级:
| 服务层级 | 特点 | 适用场景 |
|---|---|---|
| Standard(标准) | 按Token付费,无承诺 | 一般工作负载 |
| Priority(优先) | 更高吞吐量,基于时间的承诺 | 对性能要求高的场景 |
| Flex(灵活) | 低成本,非时间敏感 | 灵活、非紧急的工作负载 |
| Reserved(预留) | 专用吞吐量,定期承诺 | 可预测的工作负载 |
| Batch(批量) | 批量处理 | 大规模批处理任务 |
4.4 区域部署选项
Amazon Bedrock为Claude Opus 5提供了三种推理选项:
- 区域内(In-Region) :请求保持在单个区域内,满足严格合规要求
- 地理跨区域(Geo) :在同一地理区域(如美国、欧盟、亚太)内跨区域路由,在兼顾数据驻留的同时提高吞吐量
- 全球跨区域(Global) :在全球任意区域间路由,在无驻留限制时实现最大吞吐量
首批支持的区域包括us-east-1(弗吉尼亚北部)、us-east-2(俄亥俄)、us-west-1(加利福尼亚北部)、us-west-2(俄勒冈)等。
第五章 科学研究能力
5.1 生命科学领域的突破
Anthropic将Claude Opus 5定位为科学研究的有力工具,称其在结构生物学、有机化学和生物信息学等生命科学评测中全面超越了Opus 4.8。
具体提升数据如下:
- 有机化学任务:在从光谱数据推断分子结构的内部基准测试中,Claude Opus 5得分比Opus 4.8高出10.2个百分点
- 蛋白质相关任务:在预测蛋白质序列变异如何影响其功能的测试中,得分高出7.7个百分点
Anthropic发言人向媒体表示,Opus 5是“在生物任务上相比Opus 4.8有显著提升的版本,是目前面向科学研究最强的通用可用模型”。
5.2 视觉内容生成
除了文本和数据处理能力外,Claude Opus 5在生成风洞流体与细胞结构等视觉内容方面也有所改善。这一能力为科学研究中的可视化需求提供了新的可能性。
5.3 研究任务的局限性
值得注意的是,Anthropic的测试也发现Claude Opus 5“在长时间自主研究任务上存在显著局限”,而这类任务被认为具有最高潜在风险。因此,Opus 5保留了与Opus 4.8相当的安全限制措施,在长周期自主生物研究等高风险场景中,受限的Mythos 5仍然更强。
第六章 安全机制与对齐
6.1 安全对齐水平
Anthropic表示,Claude Opus 5是其迄今为止对齐程度最高的模型,在欺骗行为的比率和越狱攻击的 susceptibility 方面均优于Sonnet 5和Opus 4.8。在预部署测试中,公司发现Opus 5表现出更低的“不对齐行为”比率。
6.2 网络安全能力与限制
Claude Opus 5在网络安全领域展现出独特的能力格局:
- 漏洞发现能力:Opus 5在识别软件漏洞方面接近Mythos 5的水平,在OSS-Fuzz评估中两者表现相似。在测试中,Opus 5曾从一款热门开源包管理工具中发现尚未被社区识别的真实漏洞并完成修补。
- 漏洞利用限制:当涉及将漏洞转化为可用攻击代码(Exploit)时,Opus 5的得分显著低于Mythos 5。
- 安全分类器:Opus 5的安全分类器比Fable 5的限制更宽松,Anthropic预计干预次数将减少约85%。
具体的安全控制措施包括:
| 安全措施 | 允许 | 禁止 |
|---|---|---|
| 源代码级漏洞分析 | ✓ | |
| 二进制漏洞扫描 | ✓ | |
| 渗透测试工作流 | ✓ | |
| 漏洞利用生成 | ✓ |
6.3 自动回退机制(Automatic Fallbacks)
Anthropic在测试版中推出了“自动回退”功能。若某个提示在Claude Opus 5上触发了安全分类器,API将自动将该任务路由至Opus 4.8,而非抛出硬性错误中断整个流程。这一机制在保障安全的同时,确保了用户体验的连续性。
6.4 数据保留政策
Claude Opus 5继承了前代的零数据保留策略,跳过了Fable和Mythos强制执行的30天数据记录要求。Anthropic确认,通用访问Claude Opus 5模型没有数据保留要求,与此前Opus系列的发版政策保持一致。
6.5 网络安全验证计划(CVP)
Anthropic的网络安全验证计划(Cyber Verification Program, CVP)为经过审查的企业和研究人员提供了限制较少的Claude Opus 5版本。这一分层安全策略旨在在安全性与实际效用之间取得平衡。
第七章 实际应用案例
7.1 复杂任务处理能力
在早期访问测试中,Claude Opus 5展示了令人印象深刻的任务执行能力:
-
计算机视觉管道构建:在一次Frontier-Bench任务中,Opus 5被要求根据机械零件图纸编写代码重建3D FreeCAD模型,但被故意设置为无法直接查看图纸。Opus 5自行编写了一套计算机视觉流程,从原始像素中提取几何信息,成功重建了整个机械零件。在相同设置下,没有竞品模型能在五次尝试内解决该问题。
-
开源包管理漏洞修复:Opus 5在测试中发现并修复了一个流行开源包管理器中的真实漏洞。
-
金融数据系统构建:一家金融交易公司的工程师使用Claude Opus 5建立交易平台的市场数据馈送模块。由于当时缺乏可用的实时数据源来验证代码,Opus 5自行建立了测试框架,通过模拟数据检查代码的正确性。
7.2 企业用户反馈
多家企业用户在发布初期即对Claude Opus 5给予了积极评价:
- Stripe软件工程师Cristian Rivera:“Opus 5是Opus 4.8清晰的代际跃升。一个周末,我让它担任首席架构师……”
- Cognition(Devin背后公司)CEO Scott Wu:“在FrontierCode 1.1上,Claude Opus 5以一半成本达到了接近Fable级别的性能。在Devin内部,它在困难的调试和根因分析任务上表现尤为出色。”
- Sualeh Asif(联合创始人) :“Claude Opus 5以Opus的速度和成本提供了接近Fable 5的智能。在CursorBench上它略低于Fable 5,但具有许多相同的行为特征。”
- Zapier CEO Wade Foster:“Claude Opus 5登顶了Zapier AutomationBench排行榜,且未消耗比此前Claude模型更多的Token,在完整客户流失预防序列上达到了100%的成功率。”
7.3 开发者体验
有开发者反馈Claude Opus 5在编程任务中表现出“神经质”的性格特征,例如拒绝处理合并冲突(merge conflict)。同时,Anthropic工程师透露,团队为Claude Opus 5等新模型删除了Claude Code超过80%的系统提示词,而模型表现几乎没有变化。这一优化意味着开发者可以更专注于核心任务,而非繁琐的提示词工程。
第八章 横向对比
8.1 Claude系列模型对比
| 对比维度 | Claude Opus 4.8 | Claude Opus 5 | Claude Fable 5 | Claude Mythos 5 |
|---|---|---|---|---|
| 发布时间 | 2026年5月 | 2026年7月24日 | 2026年6月 | 2026年6月 |
| 上下文窗口 | 100万Token | 100万Token | — | — |
| 输入价格(/百万Token) | $5 | $5 | ~$10 | — |
| 输出价格(/百万Token) | $25 | $25 | ~$50-75 | — |
| Frontier-Bench v0.1 | 基准线 | 43.3%(SOTA) | 33.7% | — |
| GDPval-AA v2 | 1593 | 1861 | 1747 | — |
| ARC-AGI 3 | — | 30.2% | — | — |
| 网络安全能力 | 基准线 | 接近Mythos(漏洞发现) | 较弱 | 最强(含利用生成) |
| 科学研究能力 | 基准线 | 全面超越 | — | 受限(高风险场景) |
| 数据保留 | 无 | 无 | 30天 | 30天 |
| 目标用户 | 通用 | 日常高频/个人订阅 | API/企业 | 高风险专业场景 |
8.2 与竞品模型对比
| 对比维度 | Claude Opus 5 | OpenAI GPT-5.6 Sol |
|---|---|---|
| Frontier-Bench v0.1 | 43.3% | 34.4% |
| GDPval-AA v2 | 1861 | 1736 |
| ARC-AGI 3 | 30.2% | 7.8% |
| 输入价格(/百万Token) | $5 | — |
| 输出价格(/百万Token) | $25 | — |
数据来源:
第九章 总结与展望
9.1 产品定位分析
Anthropic发布Claude Opus 5标志着公司在AI模型策略上的重要转变——从单纯追求“最强模型”转向追求“最优性价比模型”。Opus 5以Opus 4.8的价格提供了接近Fable 5的性能,在软件工程、知识工作和商业自动化等多个领域树立了新的性能标杆。
这一策略的背后逻辑清晰:对于绝大多数日常使用场景,用户并不需要Fable 5级别的顶级性能,而是需要一款“足够好、足够便宜”的模型来完成高频任务。Claude Opus 5恰好填补了这一市场空白。
9.2 竞争格局影响
Claude Opus 5的发布对AI大模型竞争格局产生了多重影响:
- 性价比竞争升级:Opus 5在多项基准测试中超越或接近Fable 5和GPT-5.6 Sol,同时保持显著的成本优势,这迫使竞争对手重新审视定价策略。
- 分层产品策略成熟:Anthropic通过Opus 5(日常高频)、Fable 5(顶级性能)和Mythos 5(高风险专业场景)构建了清晰的产品分层体系。
- 开源模型的挑战:面对中国Moonshot发布的Kimi K3等开源模型,Anthropic产品负责人表示“开源模型在复杂实际项目中的表现仍有待观察”。
9.3 未来展望
Claude Opus 5的发布基本完善了Anthropic的新一代模型阵容,目前仅剩轻量级的Haiku尚未升级。随着Opus 5成为Claude Max的默认模型并全面铺开,预计将进一步推动Claude的市场份额增长——根据Sensor Tower的报告,截至2026年5月,Claude的全球市场份额已达10.3%,美国市场份额已接近14%。
常见问题(FAQ)
问:Claude Opus 5的发布时间是什么时候?
Claude Opus 5于2026年7月24日正式发布。
问:Claude Opus 5的API价格是多少?
输入Token为5美元/百万Token,输出Token为25美元/百万Token,与Opus 4.8保持一致。
问:Claude Opus 5与Fable 5相比如何?
Claude Opus 5的性能接近Fable 5,在Frontier-Bench v0.1(43.3% vs 33.7%)等测试中甚至超越Fable 5,但价格约为Fable 5的一半。在事实知识和方案设计等纯模型能力方面,Fable 5仍略胜一筹。
问:Claude Opus 5的上下文窗口有多大?
上下文窗口为100万Token,最大输出Token为12.8万Token。
问:Claude Opus 5在哪些平台可以使用?
Claude Opus 5已全平台上线,包括Claude API、Claude Max、Claude Pro、Amazon Bedrock、GitHub Copilot、Vercel AI Gateway等。
问:Claude Opus 5支持哪些输入和输出模态?
支持音频、图像、语音、视频、文本等多种输入模态,输出支持嵌入、图像、语音、文本。
问:Claude Opus 5在网络安全方面有哪些限制?
Opus 5允许源代码级漏洞分析,但禁止二进制漏洞扫描、渗透测试工作流和漏洞利用生成。
问:Claude Opus 5的数据保留政策是什么?
Claude Opus 5采用零数据保留政策,与此前Opus系列保持一致。
问:Claude Opus 5的“effort”档位是什么?
“effort”是可调节的思考档位,用户可按任务难度调整推理资源投入。档位越高处理复杂问题能力越强但速度更慢、Token消耗更多;调低则省时省钱。
问:Claude Opus 5在科学研究方面表现如何?
Claude Opus 5在结构生物学、有机化学和生物信息学等生命科学评测中全面超越Opus 4.8,在有机化学任务中得分高出10.2个百分点。

