文章摘要
Anthropic近期推出新版大模型Claude Opus 5.5,其性能优于前代及自家旗舰Fable 5.1、OpenAI GPT-6 Astra,定价更低,还为订阅用户提供额度重置权益。该模型发布仅一个半小时后,OpenAI便跟进推出两款GPT-6新模型并大幅降价,闭源前沿AI大模型价格战进一步升级,实测显示Opus 5.5整体性价比突出。

近期AI大模型领域迎来新一轮更新热潮,Anthropic旗下的Claude系列推出了全新的Opus 5.5版本,这款新模型不仅比前代Opus 5在速度和成本上更具优势,在跑分测试中更是击败了自家旗舰Fable 5.1以及GPT-6 Astra。同时,平台还为所有订阅用户提供了一次额度重置权益,更新到最新版Claude Code后即可直接体验。

值得注意的是,此次更新的时间点颇具戏剧性:就在Opus 5.5发布仅一个半小时后,OpenAI也同步推出了GPT-6 Sol和GPT-6 Luna两款新模型,两大厂商的隔空交锋让这场AI升级浪潮更受关注。

一、闭源模型价格战再度升级

OpenAI此次推出的两款新模型在价格上极具竞争力,以每百万token的输入/输出价格为例:

  • GPT-6 Sol:2美元/10美元,相比上一代促销价4美元/20美元直接砍半,属于折上折优惠
  • GPT-6 Luna:0.1美元/0.5美元,前代价格为0.2美元/1.2美元,输出价降幅接近60%

对比同期其他模型,Fable 5.1和GPT-6 Astra的定价为10美元/50美元,Opus 5.5刚调整为4美元/20美元,GPT-6 Sol就将价格压到了其一半水平;而GPT-6 Luna的价格甚至比部分同类开源模型更低,直接将闭源前沿模型的价格拉到了新的区间。

有意思的是,OpenAI最初的发布对比素材仍使用了Opus 5和Fable 5.1,或许是因为Opus 5.5发布过于仓促,素材来不及更新,如今看来这份对比已经略显尴尬。

二、快速上手Opus 5.5的正确姿势

想要体验Opus 5.5,需要将Claude Code更新到2.1.280及以上版本,该版本已将Opus 5.5设为默认的Opus系列模型,支持1M上下文长度。如果在模型列表中找不到该版本,可在终端执行`claude update`命令,重启后启动界面显示Opus 5.5即为更新成功。

需要注意的是,Opus 5.5不再支持关闭thinking功能,习惯通过该功能节省额度的用户需要调整使用习惯。

三、额度重置:订阅用户的专属福利

此次更新中最受关注的新增功能之一便是额度重置权益。用户可在网页版或桌面端的Settings → Usage页面中找到Resets选项卡,点击即可将当周额度全额重置。

需要说明的是,此次重置并不会改变原有的周额度刷新周期,只是在重置时刻到下一次自然刷新之间重新提供100%的可用额度,越接近自然重置时间使用该权益的性价比越低。该权益的有效期为一个月,国内用户有效期至10月23日,北美用户至10月22日。

此外,Claude Code的5小时额度从更新日起提升20%,加上Opus 5.5本身的低定价,相同额度下可完成的任务量最多提升25%。

四、性能解析:比Opus 5更便宜,比Fable 5.1更强

从定价来看,Opus 5.5相比Opus 5每百万token输入4美元/输出20美元,前代为5美元/25美元,单价下降20%;其中缓存读取价格从0.5美元降至0.2美元,降幅达60%,而缓存读取正是智能体和编程任务中的主要成本项,对于长上下文任务来说成本节省更为明显。

结合Opus 5.5本身的token使用效率提升,官方表示典型任务下可比Opus 5便宜约40%,输出速度更是提升了30%以上。对比Fable 5.1,Opus 5.5的单价仅为其五分之二,性价比优势显著。

跑分测试方面,官方公布的9项测试中Opus 5.5对Fable 5.1实现全胜,更详细的13项测试结果也显示其全面领先。其中Terminal-Bench 4.0得分66.4%,远超Fable 5.1的55.8%和Opus 5的52.3%,不过官方备注显示该测试中Opus 5.5使用了xhigh档位,GPT-6 Astra使用high档位,均为各自的最高配置。

SWE-bench Pro得分89.9%,同样高于Fable 5.1的81.2%;GDPval-AA得分1846分,覆盖44个职业的真实工作任务,表现优于Fable 5.1的1735分和GPT-6 Astra的1542分。

当然Opus 5.5也存在部分弱项:在AutomationBench测试中得分40.0%,略低于GPT-6 Astra的41.4%;Terminal-Bench-Science科研类终端任务得分58.7%,落后于GPT-6 Astra的64.6%;此外在OfficeQA办公文档问答和编码环境提示词注入测试中,Fable 5.1表现略好;而Toolathlon工具调用测试中,Opus 5.5甚至被前代Opus 5以77.8% vs 80.6%反超。

第三方综合智能指数中,Opus 5.5以58分排名第一,Fable 5.1和GPT-6 Astra均为53分,同期国产模型表现也十分亮眼。

此外需要注意,并非档位越高效果越好:Terminal-Bench 4.0测试中,Opus 5.5的max档得分反而比xhigh档更低,high档即可达到64%以上的得分;FrontierCode测试中,medium档(默认档)得分54.6%,max档仅为54.4%,更高的档位反而会导致模型额外修改非要求内容,拉低得分。不少用户调侃“想得越多,效果越差”。

写作方面,Opus 5.5相比前代也有明显优化,会先给出结论再解释细节,符合用户的使用习惯。

五、实测对比:三款模型同台竞技

为了直观对比三款模型的表现,我们使用Claude Code订阅通道进行了统一测试,使用相同的提示词和设置,不启用额外工具,每道题仅取首次结果(Blender建模任务除外),鹈鹕骑车任务每个模型测试三次。测试成本按照官方API价格折算,以下是测试结果:

整体来看,11道测试题完成后,Opus 5.5总花费8.78美元,Opus 5为12.37美元,Fable 5.1为19.52美元,Opus 5.5比Opus 5节省29%,比Fable 5.1节省55%;耗时方面Opus 5.5仅用72分钟,Opus 5则需要105分钟。其中10道题中Opus 5.5都是成本最低的,仅鹈鹕骑车第三次测试中略逊于Opus 5。

1. 鹈鹕骑车

经典的SVG绘图任务,提示词为“Generate an SVG of a pelican riding a bicycle”。三款模型的表现都相当不错,Opus 5.5的三次绘制都包含了踏板和链条,鹈鹕的腿部姿态也贴合踏板位置;Fable 5.1的后两张图车架出现断开,且未绘制踏板和链条。每张图的生成时间仅半分钟到一分钟。

2. Blender建模宋代斗拱

这是最能体现智能体能力的测试,我们让两款Opus模型独立完成宋式柱头铺作的爆炸轴测图建模,要求构件竖直拉开悬浮、显示榫卯开口,并用3D文字标注构件名称,最多允许8轮迭代修改。

Opus 5.5共进行了8轮迭代,Opus 5进行了6轮迭代,耗时均约17分钟,但成本差距明显:Opus 5.5花费2.38美元,Opus 5花费4.74美元。Opus 5.5在迭代过程中发现了分层顺序错误和轴测视角下的下沉问题,并进行了修正,最终完成的模型包含17个构件,覆盖了柱头方、橑檐方等细节;而Opus 5的模型带有木纹纹理,右侧添加了原位组合小样,但构件数量为21个,画面比例略显竖长。

3. 机械蝴蝶建模

参考海外社交平台的对比案例,我们使用提示词“用three.js做一只漂亮的机械蝴蝶,交付一个单文件HTML”进行测试。三款模型均能正常运行,Opus 5.5的模型翅膀最接近真实蝴蝶形状,带有彩色玻璃格纹且翅膀会扇动;Opus 5的翅膀偏细长,更像蜻蜓,底部添加了齿轮装饰;Fable 5.1的翅膀呈平展状态,类似标本。成本方面Opus 5.5为0.90美元,Opus 5为1.20美元,Fable 5.1为1.10美元,Fable 5.1完成速度最快,仅用4分多钟。

4. 试金石题库测试

我们选取了7道来自艺术史和建筑史的测试题,每道题都包含特定的专业细节,以下是部分测试结果:

  • 永字八法:Opus 5.5的笔顺正确,且能同步标注每一笔对应的八法名称,表现出色。
  • 高迪的悬链:Opus 5.5的表现最佳,模拟了倒挂沙袋链条和镜像翻转后的教堂拱顶结构,随沙袋变化同步调整拱顶形态;Opus 5的代码存在语法错误,无法渲染画面;Fable 5.1的镜像倒影较淡;GPT-6 Astra因额度耗尽未参与测试。
  • 万神殿的光:Opus 5.5正确还原了藻井排布和壁龛细节,时间随场景变化,但关键的穹顶光斑效果不明显;GPT-6 Astra的斜射光柱效果更出色。
  • 迈布里奇的奔马:三款Claude模型均完成了任务,GPT-6 Astra的版式最精致;Opus 5的画面无背板,马匹位置缺失。
  • 苏巴朗的静物:三款Claude模型均正确还原了原画的物品摆放顺序,GPT-6 Astra的脚本生成过多物体导致渲染黑屏。

整体来看,Opus 5.5的测试完成率最高,7道题全部顺利完成,而Opus 5有两道题未成功渲染,虽然成本更低,但完成稳定性稍差。

六、社区反馈与总结

海外社交平台上,不少开发者和研究者对Opus 5.5给出了高度评价。Claude Code负责人分享了测试案例:将HAProxy从C语言重写为Rust,Opus 5.5仅用9.5小时,成本比Fable 5.1低51%,且通过了几乎全部测试。有开发者表示,Opus 5.5正在将不少转用其他模型的开发者拉回Claude,甚至有人认为“现在几乎找不到使用其他模型的理由”。

总体而言,Opus 5.5在性能和成本上的表现都无可挑剔,仅在部分审美类任务和专业细分领域存在小幅短板。对于订阅用户来说,更新Claude Code后直接使用默认的Opus 5.5即可获得更好的性价比,相同额度下可完成更多任务,还能享受一次额度重置权益。

此次两大厂商的同步降价,也标志着闭源前沿AI模型的价格战进入新阶段,后续多款模型的更新也值得期待。笔者此次使用了重置额度完成了多项测试,整体体验相当值得。

以上内容不代表本平台立场,仅供读者参考