文章摘要
近期Anthropic推出两款共享核心底座的全新大模型Claude Fable 5.1与Claude Mythos 5.1。Fable 5.1在8项基准测试中全部登顶,性能超越GPT等竞品,优势覆盖编程、复杂长周期任务,下调多项资费并推出不同推理档位平衡性能成本;Mythos 5.1专注科研领域,性能亮眼。发布后OpenAI CEO奥尔特曼剧透将很快推出下一代AI产品。

近期AI领域迎来重磅更新,企业Anthropic正式推出两款全新大模型Claude Fable 5.1与Claude Mythos 5.1,两款模型共享同一核心底座,仅在安全护栏配置上存在细微差异。

Fable 5.1的核心优势集中在编程开发、知识工作以及长周期复杂任务场景中。根据官方公布的测试数据,这款模型在全部8项基准测试中均拿下第一名,性能超越前代Fable 5、Opus 5以及GPT-5.6 Sol。据第三方分析机构数据,Fable 5.1在AI分析指数榜拿到66分,位列榜首,超过Claude Opus 5的63分、Claude Fable 5的62分、GPT-5.6 Sol的61分以及Grok 4.6的61分。

Fable 5.1发布数小时后,OpenAI联合创始人兼CEO萨姆·奥尔特曼在社交平台发文剧透,称OpenAI很快也将推出下一代产品,其表示团队此前一直将安全作为优先推进的事项。

定价策略与成本权衡

定价方面,Anthropic宣布Fable 5.1整体计费比Fable 5低25%,其中缓存读取资费下调75%,智能体类任务的价格最大降幅可达45%。具体来看,Fable 5.1的API缓存读取操作成本为每百万Token 0.25美元,常规业务负载成本降幅约25%,在复杂代码开发、高智能属性任务场景中,成本最高可节约45%。除缓存资费外,其余定价与Fable 5保持一致:输入Token每百万10美元,输出Token每百万50美元。

不过第三方分析数据显示,尽管缓存读取资费大幅下调,Fable 5.1单任务实际成本仍比Fable 5高出20%,核心原因是其输出Token消耗量约为前代的1.7倍。不过内部测试显示,低推理档位的Fable 5.1在性能上与Fable 5高版本相当,但成本仅为后者的三分之一。同时有不少网友反馈,自己的模型额度被官方重置。

开发者实测对比

目前已经有大量开发者在社交平台分享了Fable 5.1的使用体验,其中不乏与其他模型的对比测试。有开发者让Fable 5.1与GPT-5.6 Sol分别生成多个独立3D场景,包括私人岛屿上的未来主义豪宅、带钻石枝形吊灯的宏伟大厅等,结果显示Fable 5.1的画面细节更加丰富,但完成任务的成本是GPT-5.6 Sol的6倍。

还有开发者对比了两款模型生成游戏的能力,测试发现Fable 5.1在用户界面和游戏体验上都优于另一款主流模型,运行机制更流畅,交互体验更出色,对比模型的生成成本为11美元,而Fable 5.1为18美元。

另有开发者使用Fable 5.1设计房屋并制作渲染动画,画面流畅度极高,连客厅桌椅在镜子上的反射影子都十分逼真,有网友评论称看完后后悔选择了设计师职业。还有开发者用Fable 5.1制作出了高质量的赛车类游戏,对开发成果表示十分满意。

核心性能与跑分表现

官方基准测试数据显示,Fable 5.1的性能远高于前代Fable 5,在低或中等难度设置下,Fable 5.1可以取得与Fable 5相当甚至更好的效果,同时成本更低。在全部8项基准测试中,Fable 5.1均拿下第一名,尤其是在科学研究和业务工作流这两个长程智能体测试中,与其他模型拉开了显著差距。

在科学研究智能体测试中,Fable 5.1的得分达到52.6%,而其他三款模型的得分均在22%到29%之间。此外,Fable 5.1不会通过拉低输出质量的捷径完成任务,其具备精准定位软件问题根源的能力。比如某投资机构的内部系统存在一处历时数年未被排查出的罕见崩溃故障,内部工程师和其他大模型都未能找到诱因,而Fable 5.1成功定位到了问题原因。

专业科研场景能力:Mythos 5.1

另一款模型Mythos 5.1则专注于科学研究场景,官方也公布了多项能力演示案例:

在分子设计领域,研究团队为模型接入开源蛋白质设计与折叠工具,结果显示Mythos 5.1可以设计出亲和力更高的结合剂。针对3个靶点,其结合亲和力比当前竞赛中表现最优的同类方案高出10倍,在12个靶点测试中整体命中率接近50%,高于行业10%到15%的常规水平。

在计算分析与建模方面,依托NASA三十多年前麦哲伦探测器任务获取的雷达影像,以及一份仅覆盖金星五分之一区域的高程地图,Fable 5.1通过训练神经网络,生成了覆盖金星三分之一地表的全新高分辨率高程图,分辨率从原先的10到20公里提升至2到3公里,测高精度最高提升25%。

在计算生物学领域,基于GPU运行专用机器学习模型是常规科研操作,模型运算速度往往成为科研进展的主要瓶颈。Mythos 5.1可以自动编写定制GPU算子,并对中间计算结果进行缓存处理,让七套开源深度学习模型获得最高2.5倍的性能提升。

安全与数据管理策略

安全管控方面,Mythos 5.1将沿用Mythos 5的安全策略,对生物研究相关能力实施访问限制。Anthropic暂未发现Fable 5.1的网络安全防护机制存在重大漏洞,针对恶意智能体编程、计算机操作类请求的拒绝率与多款主流模型基本持平。自动化行为审计结果显示,Claude Mythos 5.1的对齐表现优于前代Mythos 5。

在数据保留与安全机制上,Anthropic推出全新企业安全防护体系,效果等同于零数据留存策略,将数据存储在完全由客户管控的云基础设施中,该功能将在今年秋末分阶段面向企业客户推出。网络安全场景下,新版安全策略的误报数量较此前下降60%,部分得益于Fable 5.1已支持挖掘软件漏洞。官方还将联合相关政府部门搭建专项访问计划,开放Mythos 5.1的高阶生物能力,很快将面向科研人员开启申请通道。

Mythos 5.1将通过两个可信计划对外开放:一是生命科学验证计划,面向生命科学领域专业人员开放,使用者可以在其余安全防护机制生效的前提下,启用适配专业研发场景的防护策略来调用模型;二是网络安全验证计划,向防御性安全研究工作开放部分主流系列模型,配套放宽网络安全相关防护限制,近期该计划将纳入Claude Mythos系列模型。

此外,根据相关监管法案要求,8月2日之后发布的模型输出结果都会添加水印机制,这种水印不会影响模型输出的质量和内容,也不会包含用户、用户组织以及用户与模型的对话相关信息。

结语

整体来看,Fable 5.1在跑分榜单上全面领跑,但实际单任务成本因为输出Token消耗量增加而有所上升,若非缓存读取资费下调的加持,其单任务成本反而会提升。不过通过下调缓存读取资费、新增不同推理档位设定,Anthropic将更多成本和模型能力的选择权交给了开发者。这也意味着,对于自动化工作流这类生产业务来说,Token标价已经不再是衡量成本的核心标尺,真实单任务开销、缓存命中率、推理档位调优才是更重要的考量因素。

以上内容不代表本平台立场,仅供读者参考