文章摘要
近期Anthropic与OpenAI几乎同步推出Claude Opus 5.5、GPT-6 Sol与Luna两款重量级大模型,头部AI厂商正式打响降本大战。双方均将旗舰能力下放至高性价比日常型号,走差异化技术路线,作者针对不同用户场景给出选型建议,当前AI使用成本持续走低,头部厂商已展开全域市场布局。

最近AI大模型领域的更新节奏远超预期,此前不少声音呼吁行业放慢迭代速度,但头部厂商的新模型却如同雨后春笋般接连推出。就在不久前,两款重量级竞品几乎同时发布——Anthropic的Claude Opus 5.5,以及OpenAI的GPT-6 Sol和GPT-6 Luna,加上此前预热的其他模型,俨然一场聚焦帕累托前沿的技术军备竞赛。

Claude Opus 5.5:回归初心的性价比旗舰

作为Claude 5.5系列的首款模型,Opus 5.5的版本跨度相当大,这在Claude的迭代历史中并不多见。笔者通过临时账号体验后发现,这款模型的沟通质感回到了Opus 4.6的状态,充满了自然的交互感,虽然官方将其定位为性价比模型,但依然让人想起初代Opus带来的惊艳体验。

以下是这款模型的核心参数整理:

模型名 claude-opus-5-5
上下文窗口 1M Token
最大输出长度 128K Token
知识截止日期 2026年6月
思考模式 Adaptive Thinking,始终开启
默认努力等级 medium
输入价格 4美元 / 百万Token
输出价格 20美元 / 百万Token
缓存读取 0.2美元 / 百万Token
5分钟缓存写入 5美元 / 百万Token
1小时缓存写入 8美元 / 百万Token

相比上一代Opus 5,Opus 5.5的整体使用成本直接下降40%,输出速度提升30%以上。在多数非大型复杂任务中,它已经可以达到Fable 5.1的表现水准,只有超大型高难度工作才需要动用旗舰级的Fable模型。

在代码开发领域,Opus 5.5已经达到了当前的顶尖水准。

比如在Terminal-Bench 4.0这个测试真实终端环境下复杂多步任务能力的基准中,Opus 5.5拿下了66.4%的最高分,几乎所有代码相关的测试项目都拿到了顶尖成绩,就像初代Opus发布时在代码执行能力上全面超越Fable 5一样。

不过也有两个例外场景:在Terminal-Bench-Science这类科研任务中,Opus 5.5的得分是58.7%,不如另一款模型的64.6%;在AutomationBench跨软件工作测试中,Opus 5.5拿到40.0%,而GPT-6 Astra的得分是41.4%。至于Computer Use能力,虽然没有公开测试分数,但所有人都清楚GPT-6 Astra依然是该领域的绝对标杆。

从这些差异可以看出两家厂商的差异化竞争方向:Anthropic更侧重代码能力和内容审美,认为代码是通往通用人工智能的核心基石;而OpenAI则更专注于全面的智能体能力,包括推理、软件操作、科研场景等多个维度。

不过单纯依靠单一评测基准,无法完全衡量一个模型的真实质量。就像产品开发中的前期规划和架构设计能力,Fable系列在这方面依然是顶尖水准,这依赖于大参数规模、全球知识储备和智能涌现能力。

虽然Opus 5.5在部分特定执行任务上可以超过Fable,但如果说整体性能超越Fable,显然并不客观。本质上来说,Opus 5.5就是Fable 5.1的官方蒸馏模型,在很多垂直场景中表现更强,参数量更小、速度更快、成本更低,但也存在一个潜在陷阱:在高难度任务中,这类非旗舰模型会持续进行超长推理、反复尝试,却无法解决问题,反而会消耗更多的Token,整体成本反而比旗舰模型更高。

就像Opus 5.5虽然性能强劲,但单任务的输出Token数会大幅增加,很多智能表现都是通过超长推理换来的,一旦陷入困境就会出现无效消耗的问题。Anthropic也明确提示:当任务结果至关重要时,一定要使用最高级的旗舰模型。

根据海外社交平台上的测试案例,Opus 5.5在部分场景下的表现甚至比GPT-6 Astra更加精细,但代价是速度更慢、成本更高。能与GPT-6 Astra相提并论,本身就是对Opus 5.5的极高赞誉。

本次更新还优化了交互沟通体验。此前用户反馈Opus 5经常出现表达绕弯、术语过多、重点不突出的问题,而5.5版本会将核心信息放在最前面,减少不必要的解释和奇怪措辞,创作体验也回到了类似Claude 4.6的状态。

总结来说,Claude Opus 5.5是一款非常出色的模型,Anthropic将原本只有旗舰模型才能完成的工作,下放至了可以日常常驻使用的价位区间,这显然也是受到了OpenAI带来的竞争压力。根据官方的成本指南:日常的功能开发、调试、代码评审等工作,可以使用Opus 5.5;而当任务结果比Token成本更重要、需要长时间无人监督,或是Opus 5.5连续失败时,再切换到Fable 5.1。简单来说,Fable更像是专家级顾问,而Opus 5.5则是日常主力员工。

GPT-6 Sol & Luna:降本增效的日常主力

对于多数用户来说,Claude的使用门槛较高,而OpenAI的GPT系列则是更易获取的选择。GPT-6 Sol和Luna的推出,正是为了解决此前GPT-6 Astra定价过高、额度不足的痛点。

其实早在之前的分享中,笔者就预判GPT-6 Sol很快就会上线,上线后日常执行任务会优先选择Sol,只有高难度任务才切换到Astra。如今这款模型已经在Codex平台上线,可直接使用。

GPT-6 Sol和Luna的核心目标,就是将GPT-6 Astra的训练能力下放至更快、更便宜的模型中,就像Claude的Fable和Opus的关系一样。两家厂商几乎在同一时间推出类似的产品策略,本质上都是在争夺“用更低成本获得更多智能”的帕累托前沿阵地。

两款模型的定价相比GPT-5.6的同类型产品下降了50%,其中Luna的输入和输出价格甚至比Deepseek还要更低,不过缓存价格依然比Deepseek高出约3倍。Luna最适合的场景是各类应用背后的自动化任务,比如每日上万次的信息处理工作,这类场景缓存命中率通常不高,大概在30%左右,Luna的成本优势会更加明显。

两款模型的知识截止日期并不相同,其中Luna的最新截止日期为2026年5月18日。

关于GPT-6 Sol的性能表现,笔者认为比预期稍差,但成本降幅超出预期。

在AA基准测试中,Sol仅比GPT-5.6 Sol稍强,而Opus 5.5则直接拿下了最高分。虽然AA基准的细节时常受到诟病,但整体趋势依然具有参考价值。可以说Sol的核心定位就是基于新架构,在小幅提升性能的同时大幅降低成本。

比如在AutomationBench这个测试Agent跨47种工具完成真实业务流程的基准中,GPT-6 Sol xhigh的得分是33.2%,单个任务的平均成本仅为0.27美元;而GPT-6 Astra low的得分是30.3%,但单个任务成本是Sol的3.9倍;如果使用Fable 5.1搭配Opus 5 fallback,得分是31.4%,成本至少是Sol的8.9倍。需要说明的是,由于Opus 5.5和Sol几乎同时发布,OpenAI的官方对比图中并没有加入Opus 5.5,否则对比结果会更难看。

GPT系列的优势在于Token效率极高,确实能实实在在地节省成本。本次更新还大幅优化了事实错误率,笔者此前就将GPT作为主要的事实核查工具,其幻觉问题已经得到了很好的控制,本次更新后更是接近GPT-6 Astra的水准。需要注意的是,如果开启轻度或中等推理等级,依然容易出现事实错误,因此笔者推荐日常使用高推理等级,使用Luna时则需要开启最高等级。

笔者实测发现,GPT-6 Sol在细节审美和创作完成度上有明显降级。比如使用工具创建复杂模型时,细节完成度差距明显;对比经典场景的生成效果,高端模型的细节更加完整,而Sol的生成结果存在明显的结构bug。不过考虑到成本下降了约70%,这样的权衡依然是可以接受的。

目前GPT-6 Sol和Luna已经开始在ChatGPT Work和Codex平台推送,但令人疑惑的是,OpenAI表示这两款模型尚未在普通Chat界面上线,用户当前的聊天模式依然使用的是GPT-5.6 Sol。

不同场景下的模型选择指南

当前AI模型数量繁多,每天都有新模型推出,很多用户都纠结于该如何选择。笔者根据自身使用经验,给出以下参考建议:

1. 可以稳定订阅Claude且不会被封号的用户

虽然笔者对Anthropic这家公司有不少个人看法,但从用户体验角度来说,如果可以稳定使用Claude,依然是非常推荐的选择。复杂规划和方案设计可以使用Claude Fable 5.1,日常任务执行则使用Opus 5.5,这应该是当前最完善的组合之一。

2. 无法使用Claude,但可以订阅海外ChatGPT的用户

可以优先选择ChatGPT服务,虽然GPT系列在创作、认知洞察和代码能力上稍逊于Claude,但它拥有更完善的C端体验、无限额度的聊天模式、易用的Codex客户端,GPT-6系列依然是全球顶尖的AI模型。复杂规划和方案可以使用GPT-6 Astra或GPT-6 Pro,日常执行任务使用GPT-6 Astra high或GPT-6 Sol xhigh,大规模批量自动化任务则可以使用GPT-6 Luna。

3. 只能使用国产模型的用户

当前国内的多款主流模型都各有特色,并没有代际级的差距,可以根据使用习惯选择。其中部分模型更适合规划和方案设计,另有一批模型则更适合日常执行任务。需要注意的是,国内模型订阅建议只选择月卡或季卡,不要购买年卡,避免不必要的风险。

头部厂商的产品线布局已经越来越成熟,和此前的市场结构不同,过去头部厂商专注于高端市场,国产模型主打中端和性价比路线,如今头部厂商也开始覆盖中端乃至入门级市场,全域布局。

不过对于所有用户来说,这都是一件好事。当前AI智能的使用成本正在持续下降,同等性能的AI服务成本每季度大约下降47%,再过几个月到半年时间,AI智能或许会像水电煤一样成为人人都能用得起的基础服务,届时或许会迎来真正的AI大繁荣时代。

以上内容不代表本平台立场,仅供读者参考