Anthropic Fable 5.1模型发布:编程与科研能力全面超越前代

2026年9月1日,Anthropic正式推出Claude Fable 5.1模型,这是该公司旗舰级AI模型的最新版本。Anthropic Fable 5.1模型在保持与前代相同基础定价的同时,将缓存读取价格下调75%,使典型工作负载成本降低约25%,高度智能体化任务最高可降本45%。在Terminal-Bench-Science 0.1基准测试中,Fable 5.1模型得分52.6%,较Fable 5的24.7%翻倍以上,同时超越Opus 5和GPT-5.6 Sol。Anthropic将Fable 5.1模型定位为“全球最先进的编程与知识工作模型”,并同步推出受限访问的Mythos 5.1版本。

一、Anthropic Fable 5.1模型概述:旗舰升级的核心逻辑
Anthropic Fable 5.1模型的发布,标志着这家AI公司在模型能力与经济性之间找到了新的平衡点。与Fable 5仅相隔不到三个月,Anthropic便推出了这一迭代版本,反映出大模型竞争节奏的持续加快。
从产品策略来看,Anthropic Fable 5.1模型延续了“同权重、不同安全级别”的双轨发布模式。Fable 5.1面向所有用户开放,通过Claude API及主流云平台提供;Mythos 5.1则仅向经过审核的网络安全和生命科学机构开放。两者共享相同的底层模型权重,区别仅在于安全防护机制的严格程度。
1.1 发布时机与战略意图
Anthropic Fable 5.1模型的发布时间点极具战略意味。Anthropic已于2026年6月1日秘密向美国SEC提交IPO文件,预计在美国劳动节(9月7日)后公开招股书,最快于9月底至10月初上市。Fable 5.1模型被广泛视为Anthropic在IPO前最后一次重量级模型发布,既是对企业客户展示技术实力的“路演”,也是对潜在投资者的能力证明。
1.2 核心规格参数
Anthropic Fable 5.1模型在基础架构层面延续了Fable 5的设计:
- 上下文窗口:100万Token
- 最大输出:128K Token
- 知识截止日期:2026年6月
- 自适应思考:始终开启,不可关闭
- 努力程度(Effort) :可配置Low/Medium/High/XHigh/Max,Claude Code中默认High,Claude.ai和Claude Cowork中默认Medium
- 输入模态:文本+图像
- 输出模态:文本
- 退役承诺:不早于2027年9月1日
二、Anthropic Fable 5.1模型性能深度解析
Anthropic Fable 5.1模型在多项基准测试中展现出显著的能力跃升,尤其体现在智能体(Agent)类任务上。
2.1 智能体科学研究:Terminal-Bench-Science 0.1
在Anthropic新推出的Terminal-Bench-Science 0.1基准上,Fable 5.1模型取得了52.6%的通过率。这一成绩是Fable 5(24.7%)的两倍以上,也大幅领先Opus 5(29.0%)和GPT-5.6 Sol(22.4%)。该基准测试的是AI智能体在终端环境中执行连续科学研究任务的能力。
值得注意的是,Fable 5.1模型的这项提升并非渐进式优化,而是在同一测试框架下的代际跨越。有分析指出,Fable 5在该基准上表现偏弱,而Fable 5.1模型彻底刷新了整个榜单。
2.2 智能体编程:Terminal-Bench 4.0
在Terminal-Bench 4.0编程基准上,Fable 5.1模型得分55.8%,高于Fable 5的42.0%和Opus 5的52.3%。而放宽安全限制后的Mythos 5.1则达到60.9%,成为该测试中得分最高的版本。
2.3 知识工作与业务自动化
- GDPval-AA v2:Fable 5.1模型得分1853,高于Opus 5的1824和Fable 5的1723
- AutomationBench:Fable 5.1模型得分31.4%,Fable 5为17.1%,Opus 5为26.9%
- CursorBench 3.2.0:Fable 5.1模型达到73.4%
2.4 人工智能分析指数
在Artificial Analysis Intelligence Index中,Anthropic Fable 5.1模型以Max Effort设置取得66分,位居榜首。在High Effort设置下得分为60。不过,Fable 5.1模型的推理速度相对较慢,约为47 Token/秒。
2.5 HLE基准
在HLE(Humanity’s Last Exam)基准上,Anthropic Fable 5.1模型得分59.1%,超越了此前Fable 5保持的55.5%最佳成绩。
三、Anthropic Fable 5.1模型定价策略与经济性分析
Anthropic Fable 5.1模型最引人注目的变化并非性能提升本身,而是围绕成本结构的系统性优化。
3.1 基础定价保持不变
Fable 5.1模型的输入和输出基础价格与Fable 5完全一致:
- 输入Token:10美元/百万
- 输出Token:50美元/百万
3.2 缓存读取价格下调75%
Anthropic Fable 5.1模型将缓存读取(Cache Read)价格从1美元/百万Token降至0.25美元/百万Token,降幅达75%。
缓存读取可理解为:当一段上下文已被模型处理过后,后续请求无需每次按完整输入价格重新读取。对于单次问答,这部分成本影响有限;但对于连续运行数小时的智能体任务——需要反复读取系统提示词、代码库、工具定义以及已处理过的上下文——缓存读取占成本比重极高。
3.3 实际成本降幅测算
Anthropic基于2026年8月四周的实际使用数据进行了测算:
| 工作负载类型 | 成本降幅 |
|---|---|
| 典型工作负载 | 约25% |
| 高度智能体化任务 | 最高约45% |
有开发者指出,即便缓存命中率很高,单次复杂编码任务的成本仍可能累积至20至50美元。Fable 5.1模型的定价在旗舰模型阵容中仍属高端——同样按100万输入加100万输出计算,其价格是GPT-5.6 Sol的2.5倍。
3.4 缓存写入价格
Anthropic Fable 5.1模型的缓存写入价格未作调整:
- 5分钟缓存写入:12.50美元/百万Token
- 1小时缓存写入:20美元/百万Token
四、Anthropic Fable 5.1模型与竞品横向对比
| 对比维度 | Anthropic Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| 输入定价(/百万Token) | $10 | $10 | $5 | $4 |
| 输出定价(/百万Token) | $50 | $50 | $25 | $20 |
| 缓存读取(/百万Token) | $0.25 | $1.00 | — | $0.40 |
| 上下文窗口 | 1M Token | 1M Token | 1M Token | — |
| 知识截止日期 | 2026年6月 | 2026年1月 | — | — |
五、Anthropic Fable 5.1模型的安全防护机制
Anthropic Fable 5.1模型在安全防护层面进行了重要迭代,核心方向是减少误报(False Positives),同时为特定专业场景提供更精准的访问控制。
5.1 Fable 5.1与Mythos 5.1的差异化设计
Fable 5.1模型与Mythos 5.1共享相同的底层模型权重,区别仅在于安全防护级别。Fable 5.1模型面向所有用户开放,安全防护较为严格;Mythos 5.1则仅向经过审核的网络安全和生命科学机构开放,安全限制相对宽松。
这种“同一模型、双重安全配置”的策略,使Anthropic能够在满足通用安全要求的同时,为专业科研场景保留高阶能力的访问通道。
5.2 网络安全防护优化
Anthropic Fable 5.1模型在网络安全领域的防护机制得到显著改进:
- 误报减少约60% :新版防护措施拦截的误报数量比此前减少约60%
- 漏洞发现能力开放:Fable 5.1模型现在可用于发现软件源代码中的安全漏洞,但不会用于开发针对这些漏洞的利用程序
- 部分任务仍回退至Opus:渗透测试、漏洞利用生成、基于二进制的漏洞扫描等高级安全任务,仍将回退至Opus模型处理
5.3 生物学防护优化
在生物学领域,Anthropic Fable 5.1模型的防护机制同样进行了调整:
- 基础生物学误报减少85% :与Fable 5发布时的防护机制相比,Fable 5.1模型在基础生物学和医学问题上的误报减少约85%
- Mythos 5.1的高级生物学访问:Anthropic与美国政府合作建立了访问计划,允许研究人员利用Mythos 5.1的高级生物学能力,并计划近期向科学家开放注册
- 研究级生物学仍受限:高级研究生物学任务仍路由至Opus模型处理
5.4 企业级前沿防护措施(EFS)
Anthropic Fable 5.1模型配套推出了Enterprise Frontier Safeguards(EFS):
- 完全隐私保护:EFS将客户数据存储在由企业完全控制的云基础设施中,而非Anthropic的系统,实现零数据保留级别的隐私保护
- 分阶段推出:EFS将于2026年秋季开始分阶段向企业客户推出
- 过渡方案:在EFS正式可用之前,符合条件的客户可使用零数据保留政策使用Fable 5.1模型
六、Anthropic Fable 5.1模型的真实世界应用案例
Anthropic Fable 5.1模型在基准测试之外,已在多个真实场景中展现出差异化能力。
6.1 Millennium:解决困扰四五年之久的罕见崩溃
投资公司Millennium遇到一个极为罕见的软件崩溃问题,大约每运行100万次才发生一次。该问题已困扰团队四五年,包括此前使用过的各种模型在内,均未能找到原因。
Anthropic Fable 5.1模型最终对外部供应商的软件库进行了反汇编,将结果与系统崩溃时留下的核心转储文件进行比对,最终将问题定位到该软件库中的一个Bug。Anthropic官方称,Fable 5.1模型解决了内部系统中一个工程师和其他模型经过数年尝试仍无法解释的罕见崩溃。
6.2 Ramp:38小时无人值守机器学习任务
Ramp测试了一项持续运行的机器学习任务。Anthropic Fable 5.1模型在无人值守的情况下运行了38小时,重新检查此前得到的结果后,判断其中存在标签造成的误差,并进一步启动了6项实验。实验运行一夜后,模型返回了新的结果以及下一步建议。
6.3 Browserbase:浏览器智能体任务
Browserbase让Anthropic Fable 5.1模型执行浏览器智能体任务,在其最困难的一项测试中完成率达到82%,高于Opus 5的74%和Fable 5的57%。
6.4 MongoDB:三天完成复杂原型
MongoDB使用Anthropic Fable 5.1模型在大约三天内完成了一个复杂原型:先读取公司各项服务的代码和文档,提出设计方案,再连续运行数小时将其实现出来。
6.5 金星地形图重绘
在科学研究领域,Anthropic Fable 5.1模型基于NASA麦哲伦任务30多年前的雷达图像,训练了一个神经网络,绘制了覆盖金星三分之一区域的高分辨率高程地图。分辨率从之前的10至20公里精细到2至3公里,高程精度提升了25%。
6.6 分子设计
Mythos 5.1利用开源蛋白质设计和折叠工具,设计出了高亲和力结合剂。在三个靶点上,其结合亲和力比Adaptyv Bio蛋白质设计竞赛的最佳参赛作品高出10倍;在12个靶点上的命中率接近50%,而目前蛋白质设计的典型命中率为10%至15%。
七、Anthropic Fable 5.1模型的技术局限与注意事项
7.1 推理速度较慢
Anthropic Fable 5.1模型在推理速度方面存在明显短板。在Artificial Analysis的测试中,其输出速度约为47 Token/秒,被标注为“ notably slow ”。
7.2 拒绝率较高
Anthropic Fable 5.1模型的拒绝率(Refusal Rate)显著高于此前的Claude模型。API在请求被阻止时会返回标准HTTP 200响应,其中stop_reason为"refusal",并附带包含限制类别的stop_details对象。提示阶段的拒绝(推理开始前被阻止)不计费;流中拒绝(部分输出后被阻止)则对阻止前生成的Token计费。
7.3 采样参数限制
Anthropic Fable 5.1模型对采样参数有严格限制:
temperature必须设置为1.0或不设置top_p必须设置为0.99或不设置temperature和top_p不能同时指定- 不支持
top_k
7.4 水印与模型蒸馏限制
Anthropic Fable 5.1模型在文本输出中嵌入了水印,但跳过代码Token以避免影响准确性。同时,新的API限制针对大规模模型蒸馏(Model Distillation)进行了约束。
7.5 成本考量
尽管Anthropic Fable 5.1模型在缓存读取方面大幅降价,但其基础定价在旗舰模型中仍属最高一档。Anthropic官方甚至建议,大多数任务优先从价格只有一半的Opus 5开始,仅当面对高难度推理、长时间Agent任务,或Opus 5在高Effort下仍不够用时,再升级至Fable 5.1模型。
八、Anthropic Fable 5.1模型的行业影响与展望
8.1 对AI编程领域的冲击
Anthropic Fable 5.1模型在编程基准上的表现已引起行业广泛关注。Every CEO Dan Shipper称其为“我们使用过的最强编程模型,而且速度快、Token效率高,关键是真的像正常人一样说话”。Box CEO Aaron Levie表示,其公司的智能体在使用Fable 5.1模型时捕捉到了Fable 5在相同测试中遗漏的数据细微差别和歧义。
8.2 企业级AI的范式转变
Anthropic Fable 5.1模型所代表的方向,是大模型从“单次问答”向“长时间自主工作”的演进。它能够在数小时内持续完成编程、研究和知识工作,并在过程中自主验证结果、调整优先级。这种能力使AI从辅助工具向自主代理人(Autonomous Agent)的角色迈进了一大步。
8.3 成本竞争与市场格局
Anthropic Fable 5.1模型的发布也反映了AI模型市场竞争格局的变化——即便是最前沿的模型也开始强调性价比。在OpenAI以更低价格提供GPT-5.6 Sol的背景下,Anthropic选择通过优化缓存成本而非降低基础定价来回应企业客户的价格压力。
8.4 科研民主化的双刃剑
Anthropic Fable 5.1模型在科研领域展现出的能力——从蛋白质设计到行星地形绘制——为科学研究提供了前所未有的工具。然而,Mythos 5.1仅向经过审核的机构开放,也反映了Anthropic在推动科研民主化与防范双重用途风险之间的审慎平衡。
九、Anthropic Fable 5.1模型常见问题(FAQ)
问:Anthropic Fable 5.1模型与Fable 5的主要区别是什么?
Anthropic Fable 5.1模型在保持相同基础定价(输入$10/百万Token,输出$50/百万Token)的同时,将缓存读取价格从$1降至$0.25/百万Token(降幅75%),使典型工作负载成本降低约25%。性能方面,Fable 5.1模型在Terminal-Bench-Science 0.1上得分52.6%,是Fable 5(24.7%)的两倍以上。知识截止日期从2026年1月更新至2026年6月。
问:Anthropic Fable 5.1模型与Mythos 5.1有何关系?
两者共享相同的底层模型权重,区别仅在于安全防护级别。Anthropic Fable 5.1模型面向所有用户开放;Mythos 5.1仅通过可信访问计划向经过审核的网络安全和生命科学机构提供。Mythos 5.1在Terminal-Bench 4.0上得分60.9%,高于Fable 5.1模型的55.8%。
问:Anthropic Fable 5.1模型的成本真的更低吗?
是的,但取决于使用模式。对于缓存读取占比较高的智能体任务,Anthropic Fable 5.1模型的成本降幅最高可达45%。但对于缓存命中率低的短对话任务,成本与Fable 5基本相同。
问:Anthropic Fable 5.1模型支持哪些输入输出模态?
Anthropic Fable 5.1模型支持文本和图像输入,输出仅为文本。
问:Anthropic Fable 5.1模型的知识截止到什么时间?
Anthropic Fable 5.1模型的知识截止日期为2026年6月,比Fable 5的2026年1月晚了5个月。
问:Anthropic Fable 5.1模型何时会退役?
Anthropic承诺Anthropic Fable 5.1模型的退役时间不早于2027年9月1日。
问:Anthropic Fable 5.1模型可以在哪些平台使用?
Anthropic Fable 5.1模型可通过Claude API、Amazon Bedrock(模型ID:anthropic.claude-fable-5-1)及主流云平台使用。在Claude平台(Claude.ai、Claude Code、Claude Cowork)上也可直接访问。
问:Anthropic Fable 5.1模型在安全方面有哪些改进?
Anthropic Fable 5.1模型的网络安全误报减少约60%,生物学误报减少约85%。同时,Fable 5.1模型现在可用于发现软件源代码中的安全漏洞。企业级前沿防护措施(EFS)将于2026年秋季推出,实现完全的数据隐私保护。
问:Anthropic Fable 5.1模型适合什么类型的任务?
Anthropic官方建议将Anthropic Fable 5.1模型用于高难度推理任务、长时间运行的智能体任务,以及Opus 5在高Effort下仍不够用的场景。具体包括:大规模代码库级软件开发、多步骤科学研究、复杂知识工作、文档/电子表格/幻灯片处理等。
问:Anthropic Fable 5.1模型的Effort参数如何设置?
Anthropic Fable 5.1模型支持Low、Medium、High、XHigh、Max五个Effort级别。在Claude Code中默认High,在Claude Cowork和Claude.ai上默认Medium。Low或Medium设置下,Fable 5.1模型即可达到与Fable 5相当或更好的结果,且成本更低。

