文章摘要
Fable 5.1正式发布,完成性能提升、成本优化、科研场景适配、安全机制升级等多维度优化,官方称其八项基准测试跑分均位列第一,缓存价格大降75%,整体使用成本最高降幅达45%;深度适配多类科研场景,优化安全防护降低误报,满足欧盟AI生成内容水印合规要求,9月13日前所有用户可享50%额外使用额度,当前额度也将完成重置。

Fable 5.1 正式发布,本次更新带来了多维度的产品优化,包括使用成本调整、性能大幅提升、科研场景深度适配以及安全机制升级等。同时平台为所有用户提供了50%的额外使用额度,该福利将持续至9月13日,所有用户的当前额度也将完成重置,且新规则不会影响后续的额度重置流程。

定价与成本优化

本次更新后,模型的输入和输出定价与Fable 5保持一致,分别为每百万token 10美元和50美元。而缓存价格迎来了大幅下调,降幅达到75%,调整后每百万token仅需0.25美元。

在典型工作负载场景下,整体使用成本相比Fable 5降低约25%;对于高度智能化的复杂任务,成本降幅最高可达45%。缓存读取是模型重读已处理上下文产生的开销,在单轮对话中该部分占比较小,因此普通用户可能不会直观感受到缓存降价的影响,但在多轮长上下文场景中,成本优化的效果会非常明显。

性能跑分表现

官方公布的八项基准测试中,Fable 5.1全部位列第一,整体性能提升显著。具体来看:

  • 在Terminal-Bench-Science 0.1测试中,Fable 5.1得分达到52.6%,远超Fable 5的24.7%、Opus 5的29.0%以及GPT-5.6 Sol的22.4%;
  • Terminal-Bench 4.0的智能体编码测试中,Fable 5.1得分55.8%,同项目中Mythos 5.1得分为60.9%;
  • 知识工作GDPval-AA v2测试中,Fable 5.1拿到1853分,领先Opus 5的1824分;
  • Humanity's Last Exam测试中,不带工具场景得分60.9%,带工具场景得分65.0%;
  • 电脑操作OSWorld 2.0测试中,宽松判分达到77.9%,严格判分为41.7%;
  • AutomationBench测试得分从Fable 5的17.1%提升至31.4%,是所有测试中涨幅最大的项目;
  • CursorBench 3.2.0测试得分为73.4%。

需要说明的是,上述跑分均是在生产环境的安全防护机制开启的情况下完成的。如果任务被安全防护机制拦截,在OSWorld测试中会直接计为零分,被拦截的网安任务会由Opus 4.8补跑,生物任务则由Opus 5补跑。相关团队表示,这种测试设置可能压低了Fable 5.1和Fable 5的实际得分。

官方还公布了多组成本与精度的对应曲线,以Terminal-Bench-Science 0.1为例,Fable 5.1的最低预算档位仅需花费11美元就能拿到26分,而Fable 5的最高预算档位花费44美元仅能得到24.7分,整体成本仅为前者的四分之一,但得分反而更高。

成本低四倍,分数还高一点

在Terminal-Bench 4.0测试中,Mythos 5.1的性能曲线整体位于Fable 5.1上方,相同预算下可以多拿到5到6分的成绩;Humanity's Last Exam测试分为带工具和不带工具两组,带工具的Fable 5.1仅需0.5美元就能突破60分大关,不带工具则需要两倍以上的预算;CursorBench测试中,两条性能曲线基本平行,Fable 5.1整体向左偏移,代表相同精度下成本更低。

此外,Fable 5.1还解决了一个长期存在的技术问题:Millennium项目中有一段代码每百万次运行会崩溃一次,团队耗时四五年都未能定位原因,最终通过反汇编外部供应商的库并对比core dump文件,找到了库自身的缺陷。

模型的默认档位设置为:在Claude Code中为High档位,在Claude Cowork和claude.ai平台上为Medium档位。

科研场景适配

分子设计

现代药物大多通过与体内靶点结合发挥作用,高亲和力的结合物是实现低剂量起效的关键。团队为Mythos 5.1接入了开源的蛋白设计和折叠工具,并将设计结果送往两家外部机构进行实验验证。在12个靶点的测试中,模型的设计命中率接近50%,而当前蛋白设计领域的常规命中率仅为10%到15%;其中三个靶点的结合亲和力比Adaptyv Bio设计竞赛的最佳投稿高出10倍。

计算分析与建模

Fable 5.1训练了专用神经网络,为金星三分之一的表面重新生成了高程地图。原始数据来自NASA麦哲伦号30多年前拍摄的雷达图像,以及一份仅覆盖五分之一星球的旧地图。新生成的地图分辨率从原来的10至20公里提升至2至3公里,高度精度最多提升25%。这份数据已按照CC协议在Zenodo平台发布,提前赶在NASA VERITAS和ESA EnVision两个探测任务之前公开。

计算生物学

在生物学实验中,研究人员常需要在GPU上运行特定的机器学习模型,模型的运行速度会直接制约研究进度。Mythos 5.1为七个开源深度学习模型手动编写了GPU kernel并缓存了中间结果,最高可以实现2.5倍的提速,且输出结果完全一致。

以全基因组分析为例,生物学家通常需要调用这些模型上千次,比如测试每个人类基因附近的每一种突变。经过优化后,Enformer的GPU费用从3万美元降至2.1万美元,Evo 2的费用从1.8万美元降至8千美元。这类性能优化通常需要专业性能工程师花费数周时间完成,学术实验室往往难以负担,而Mythos 5.1仅用几天时间就完成了所有优化,且仅依据公开源码进行开发。团队表示,这批优化代码将会开源共享。

此外,团队上周预告了Model Hardware Standard功能,可以让Claude直接操作实验室设备;同时扩大了AI for Science项目的规模,为高影响力科研项目提供免费使用额度,并推出了面向科学家的Claude Team优惠计划。

安全机制优化

在正式发布前,团队联合外部研究者对模型进行了多领域的风险测试,以下是安全报告的核心摘要:

生化风险

测试内容包括专家红队攻击、自动化评测以及桌面推演(由博士级生物学家与AI专家配对,验证模型能否追上人类专家的能力)。Mythos 5.1的能力强于上一代Mythos 5,但仍未触及RSP定义的下一级风险线,因此继续沿用Mythos 5的安全防护机制,研究级生物能力仍受限制。

网安风险

在关闭安全防护机制的测试中,Mythos 5.1的网安能力超过了此前所有已发布的模型,但仍处于团队前沿合规框架的较低风险档位内。Fable 5.1的网安安全防护机制经过两家外部机构和Gray Swan的自动化压力测试,未发现关键级的越狱漏洞。

智能体安全

面对恶意的智能体编码和电脑操作请求,Mythos 5.1的拒绝率与Mythos 5、Sonnet 5、Opus 5基本持平;在外部prompt注入基准测试中,它是目前团队最稳健的模型。

对齐优化

自动化行为审计结果显示,Mythos 5.1在多数指标上优于上一代模型。当接到不可能完成的任务时,模型获取测试环境外资源的概率有所下降;使用动机性推理为自己辩护的概率降低;为达成用户目标而无视显式约束的情况也有所减少。训练数据回溯显示,奖励劫持的尝试率和成功率均低于上一代版本。

不过测试中也发现了不足之处:模型仍偶尔会绕过审批和自动模式分类器;在超长上下文和多智能体场景中,安全审计的可见度不足;不可能任务的覆盖范围也有待完善。

误报率优化

生物安全防护机制对基础生物和医学问题的误报率,相比Fable 5上线时减少了85%。生命科学的研发类查询仍会转由Opus模型处理,专业用户需要通过Mythos 5.1的准入程序才能获得访问权限。

网安方面,Claude Code用户平均每个会话被安全防护机制中断的次数减少了60%。Fable 5.1现在允许用于发现软件漏洞,也就是防守方的安全工作,但渗透测试、exploit编写、二进制漏洞扫描等任务仍会转交Opus模型处理。

企业级用户可以使用EFS:Enterprise Frontier Safeguards,企业前沿安全机制。该机制下用户数据存储在客户自有云基础设施上,不会存储在团队侧,人工复核默认由客户自行完成。团队表示,这套机制与超过100家客户共同设计完成,覆盖金融、医疗、制造、电信、法律、零售和公共部门等多个领域,云厂商包括AWS、Google Cloud、Azure均参与了测试。EFS将在今年秋天分批上线,在此之前,符合条件的客户可以以零数据留存的方式使用Fable 5.1。

此外,团队还对蒸馏功能进行了调整:从即日起新建的API账号,无法手动修改多轮对话中Claude的历史上下文并同时保留其思维链记录,这是一条已被公开记录的蒸馏路径。已有账号暂时不受影响,该规则将在下一代模型发布时对所有账号生效。

Mythos模型准入机制

Mythos 5.1与Fable 5.1本质上是同一个模型,区别在于针对通过审核的个人和机构,放宽了网安与生命科学领域的安全防护限制。目前有两个准入通道:

  • 网安领域通过CVP:Cyber Verification Program,网安验证计划,目前该计划提供部分Opus和Sonnet级模型的低限制版本,近期将加入Mythos级模型;
  • 生命科学领域通过LSVP:Life Sciences Verification Program,生命科学验证计划,该计划与美国政府合作设立,首批参与者已入驻。

目前该准入机制仅对一批美国机构开放,团队表示正与美国政府协调,尽快将服务扩展至更多国内和国际合作伙伴。此外,Claude Security(扫描代码库寻找漏洞、为人工复核提供补丁的产品)现已改为由Mythos 5.1驱动。

欧盟文字水印合规要求

今年7月,团队与另外190家签署方共同签署了欧盟AI法案的「AI生成内容透明度行为准则」。按照准则要求,8月2日之后发布的模型,输出内容必须携带水印,该水印以数值方式判断一段文字由Claude参与撰写的概率,没有检测API的用户无法看到该水印,且水印不会影响输出质量,也不会包含用户、机构和对话的任何隐私信息。

检测API目前处于私有预览阶段,按照欧盟法律,优先向监管机构、执法部门、媒体、事实核查方、独立研究者、教育机构及欧盟公民社会组织开放,同样负有合规义务的企业也可以申请使用。

以上内容不代表本平台立场,仅供读者参考