Anthropic发布两款新AI模型 跑分全第一最高降45%

近日,人工智能企业Anthropic正式推出两款全新大模型产品:Fable 5.1与Mythos 5.1,凭借全方位的性能升级与成本优化,引发行业广泛关注。
本次发布的两款模型在八项公开基准测试中全部斩获第一,同时实现了最高45%的成本下调,核心性能与性价比均实现了突破性提升。尤其是在科学研究与代码开发两大场景中,Fable 5.1的表现明显领先于上一代Fable 5,以及同期的其他同类竞品。
从直观的性能对比来看,以中低推理档位运行的Fable 5.1,其综合表现基本等同于上一代Mythos 5在极高甚至最高推理档位下的效果,实现了对同系列高端型号的性能反超。
在定价策略上,Fable 5.1实现了关键成本项的大幅下调:缓存读取单价降至每百万token 0.25美元,降幅高达75%;而输入与输出的单价则保持与Fable 5一致,分别为每百万token 10美元与50美元。看似仅调整了一项收费标准,但由于智能体任务中缓存读取成本占比极高,实际降本效果显著。根据Anthropic公布的数据,典型工作负载的整体成本较Fable 5降低约25%,对于高度智能化的复杂任务,成本降幅最高可达45%。
无论你此前使用Claude处理何种任务,Fable 5.1都能完成更多工作,且在高难度环节的表现更加出色。
Fable 5.1的核心优势之一在于其对多步骤复杂任务的出色处理能力。在超长链路的任务中,哪怕第二步出现细微错误,普通模型往往会在第40步左右出现整体逻辑崩塌,但Fable 5.1可以实现全程稳定的输出;当遇到无法解决的难题时,它还能清晰告知用户此前尝试过的所有方案,以及当前卡住的具体环节。此外,据相关研究员反馈,Fable 5.1在写作场景中大幅减少了粗体、标题、列表与引号的使用,对风格提示词的遵从度也有显著提升。
产品开放政策上,Fable 5.1将面向所有用户全面开放,而Mythos 5.1则仅通过受信访问计划,向经过审核的网络安全与生命科学领域机构提供服务。
除了跑分成绩之外,Anthropic还展示了两款模型在多个科研领域的实战应用成果。
在蛋白质设计领域,研究团队使用Mythos 5.1结合开源蛋白质设计与折叠工具,开发出高亲和力结合蛋白方案,并将设计结果送往两家外部机构进行实验验证。在三个测试靶标中,Mythos 5.1设计的结合蛋白亲和力达到了Adaptyv Bio蛋白质设计竞赛最佳方案的10倍;在全部12个测试靶标中,其方案命中率接近50%,而当前行业内的典型命中率仅为10%到15%。高亲和力结合蛋白是多数常见药物开发流程的第一步,直接决定了药物能否以较低剂量实现预期效果。
在天文学领域,Fable 5.1基于NASA麦哲伦号30多年前拍摄的雷达图像训练了专用神经网络,成功为金星三分之一的表面生成了全新的高分辨率地形图。此前已有的金星地形图仅覆盖五分之一的表面积,分辨率在10到20公里之间;而Fable 5.1将分辨率提升至2至3公里,高度精度较此前提升了25%。这份地形图已通过CC协议开源发布,可供即将开展任务的NASA VERITAS与ESA EnVision项目参考,帮助确定未来观测的重点地质特征。
在计算生物学领域,Mythos 5.1通过编写自定义GPU内核并缓存中间结果,将7个开源深度学习模型的运行速度提升了最高2.5倍,且输出结果与原模型完全一致。在实际研究场景中,生物学家往往需要对这类模型运行数千次,以测试人类基因附近所有可能的突变;经过优化的模型可将GPU成本降低30%到60%。值得一提的是,这类性能优化通常需要专业性能工程团队花费数周时间完成,多数学术实验室无力承担相关成本,但Mythos 5.1仅用数天就实现了这一效果,且全程仅依赖公开源代码。Anthropic计划在近期将这些优化方案开源共享。
伴随Fable 5.1的发布,Anthropic还推出了多项安全优化与API更新。
在安全层面,Fable 5.1的网络安全误报率较上一代降低了60%,目前允许用于软件漏洞发现场景,但仍严格禁止开发漏洞利用程序;渗透测试、漏洞利用生成、基于二进制的漏洞扫描等双重用途任务,仍会被自动重定向到Opus系列模型处理。此外,基础生物学与医学问题的误报率降低了85%,但涉及生命科学研发的查询仍会路由到Opus模型,专业人员需通过Mythos 5.1的生命科学验证计划(LSVP)获取访问权限。
本次更新的核心API改动之一是新增了反蒸馏机制。从发布之日起,新注册的API账户将无法在多轮对话中,手动编辑Claude的上下文内容的同时保留思维链记录。此前行业内曾出现一种公开的攻击手法:在多轮对话中,攻击者手动篡改Claude的历史上下文,但刻意保留思维链记录,以此在新的对抗性指令下,重放模型在原有指令下产生的推理过程。现在这一漏洞路径已被彻底封堵。
具体实现上,系统会为每个思维链区块添加唯一签名。当用户在后续请求中将助手的回复回传给API时,系统会通过该签名完成两项验证:一是确认当前模型是否有权限读取该区块,二是验证该区块之前的整段对话(包括系统提示词、工具列表、所有历史消息)是否与生成该区块时完全一致。只要对话中的任何内容被改动,签名校验就会失败。
校验失败后的处理逻辑,取决于开发者设置的prefix_mismatch_behavior参数:默认值为“error”,此时系统会直接返回400状态码,拒绝请求;如果将参数设置为“drop_block”,系统会静默丢弃该区块及后续所有的思维链内容,但请求本身会正常执行,且被丢弃的部分不会产生计费,相关信息会在响应的input_transformations数组中列出。
官方文档列出了所有会触发校验失败的操作:包括编辑、重新排列或删除任何历史的用户、助手或系统消息,修改顶层系统提示词,对工具列表进行增删或改名,从对话历史中间抽掉某个思维链区块但保留后续区块,以及引用了在两次请求之间内容发生变化的图片或文档URL。任何一项操作都会导致后续所有思维链区块失效。
与之相对,部分操作不会触发校验:在对话末尾追加新消息、从历史记录开头移除思维链区块、修改max_tokens等请求参数、增减cache_control标记,以及服务端的压缩或上下文编辑操作。此外,系统还采用了链式校验设计:每个思维链区块都会记录前一个区块的信息,形成跨轮次的校验链条。用户可以从链条头部移除区块,但如果从中间抽掉任意一个区块,后续所有区块都会随之失效,整条校验链从断裂处往后全部作废。
为了避免开发者的开发流程受到影响,Anthropic同时提供了一系列替代方案:如果需要中途修改指令,可以使用对话内系统消息替代直接修改顶层提示词;如果需要为每轮对话添加临时提醒,可以使用带clear_at参数的轮次级系统消息,替代“先插入再删除”的旧方法;如果需要中途增减工具,可以使用tool_addition和tool_removal区块,替代直接编辑工具列表;如果需要裁剪上下文,可以使用服务端压缩和上下文编辑功能,替代客户端的粗暴截断操作。
对于使用官方产品的用户,包括Claude Code、claude.ai、Claude Managed Agents以及Claude Agent SDK,无需进行任何修改,这些产品已经自动保证了对话前缀不会被篡改。而对于直接调用Messages API的开发者,Anthropic建议将messages数组严格按照只追加的模式使用,并在prefix_mismatch_behavior设置为“drop_block”的模式下,完成完整的多轮会话测试,检查日志中是否出现prefix_binding_mismatch条目。
此外,官方还特别提醒了一个容易踩坑的场景:如果开发者维护的是一个工具或框架,用户使用自己的API密钥进行调用,那么新注册的用户会更早触发校验机制。这是因为开发者自身的密钥大概率是在8月31日之前注册的,暂时不会被强制执行校验规则。对此,官方建议开发者提前设置好prefix_mismatch_behavior参数并完成测试,避免等到用户反馈问题后再进行修复。
此次Anthropic的大动作,也让同行感受到了竞争压力。据了解,其竞争对手OpenAI的全新模型Astra尚未完成开发,仅象征性地发布了相关预告。此外,相关行业人士也在两款模型发布之际罕见发声,呼吁全球加强人工智能领域的网络安全建设。

