Anthropic发布Claude Sonnet 5.5:中端模型首次在编码上反超旗舰,账单却可能更贵?

Anthropic发布Claude Sonnet 5.5,这是Claude 5.5家族第二款模型,输出速度提升30%以上,Terminal-Bench 4.0编码得分从上一代的10.3%飙升至70.6%,反超旗舰Opus 5.5。但独立测试揭示其Token消耗量为史上最高,每任务成本反而可能翻倍。

一、这次升级到底变了什么?
2026年9月28日,Anthropic发布了Claude Sonnet 5.5,距离Opus 5.5上线仅隔六天。Anthropic对Sonnet 5.5的定位非常明确:不是旗舰替代品,而是高频日常工作的主力模型。官方用了一句话概括它与Opus 5.5的关系——“a faster, lower-cost complement”,即更快、更低成本的工作搭档。
如果你把它理解为“Sonnet 5的小幅迭代”,那就完全低估了这次发布。从基准数据看,Sonnet 5.5在多项核心测试上的提升幅度,更像是一次代际跳升。
Sonnet 5.5 vs Sonnet 5:核心升级一览
| 对比维度 | Claude Sonnet 5 | Claude Sonnet 5.5 | 变化幅度 |
|---|---|---|---|
| 输出速度 | 基准 | 提升30%以上 | 显著加快 |
| 每任务成本 | 基准 | 最高降低30% | 多数场景更省 |
| Terminal-Bench 4.0 | 10.3% | 70.6% | 提升近7倍 |
| GDPval-AA v2.1 | 1449 | 1844 | +395分 |
| OSWorld 2.1(部分) | 57.0% | 80.1% | +23.1个百分点 |
| Chartography(无工具) | 15.6% | 61.6% | 提升近4倍 |
| 输入/输出定价 | $2/$10 | $2/$10 | 保持不变 |
| 上下文窗口 | 1M tokens | 1M tokens | 不变 |
| 安全防护 | 标准 | 对标Opus级别 | 首次升级 |
数据来源:Anthropic官方发布页面及基准测试表
这张表里最值得关注的两个数字:Terminal-Bench 4.0从10.3%跳到70.6%,GDPval-AA从1449跳到1844。前者衡量的是AI智能体独立完成终端操作的能力,后者测试的是跨职业的真实工作表现。这两个维度的跃升,意味着Sonnet 5.5在“动手干活”这件事上,跟上一代已不在同一个量级。
关键规格速览
Sonnet 5.5的API模型ID为claude-sonnet-5-5,于2026年9月28日发布,退役日期不早于2027年9月28日。核心规格如下:
- 上下文窗口:1M tokens输入,128K tokens最大输出(Batch API下可通过beta标头扩展到300K)
- 输入模态:文本和图像输入,文本输出
- 知识截止日期:2026年6月
- 思考模式:自适应思考(Adaptive Thinking),默认开启
- 努力程度档位:五档(low/medium/high/xhigh/max),API默认high,Claude Code和Claude应用默认medium
- 定价:$2/百万输入tokens,$10/百万输出tokens,$0.20/百万缓存读取tokens
- 最小可缓存提示长度:512 tokens(Sonnet 5为1024)
一个容易被忽略的细节:Sonnet 5.5使用了与Sonnet 5相同的分词器(Tokenizer),这意味着现有的token计数可以直接沿用。对于已经在生产环境中做成本估算的团队来说,这一点减少了迁移时的不确定性。
二、Terminal-Bench反超Opus 5.5,但这不意味着Sonnet全面超越
Sonnet 5.5最引人注目的数据,莫过于在Terminal-Bench 4.0上以70.6%反超Opus 5.5的66.4%。一个中端模型在编码任务上击败了旗舰模型,这在AI模型竞争中并不常见。
基准测试全景对比
| 测试项目 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% | — |
| FrontierCode 1.1 (Max) | 46.2% | 42.4% | 54.4% | 49.3% |
| FrontierCode 1.1 (Xhigh) | 52.1% | — | — | — |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1 | 1811 | 1359 | 1822 | 1483 |
| Humanity’s Last Exam | 64.5% | 54.9% | 67.7% | — |
| OSWorld 2.1 (部分) | 80.1% | 57.0% | 81.8% | — |
| Chartography(无工具) | 61.6% | 15.6% | 64.4% | 53.6% |
数据来源:Anthropic官方基准表
仔细看这张表,会发现一个更微妙的格局:Sonnet 5.5在Terminal-Bench上确实反超了Opus 5.5,但在其他几乎所有测试上,Opus 5.5仍然领先——差距不大(GDPval-AA只差2分),但始终存在。CursorBench上Sonnet 5.5的55.5%落后Opus 5.5的57.8%约2.3个百分点,FrontierCode在Max档位上差距更大(46.2%对54.4%)。
Anthropic自己在发布说明中也坦承:“在复杂、开放式、需要持续判断的工作上,Opus 5.5依然明显更强”。这句话不应该被忽略——Terminal-Bench上的反超,很大程度上得益于Sonnet 5.5在工具调用上的策略性优化:它能更频繁地批量发起工具调用,从而在结构化任务中减少步骤、提高效率。这是一种“效率型优势”,而非“能力型碾压”。
Sonnet 5.5在Terminal-Bench上的表现有一个有趣的机制值得深挖:它能够同时启动多个子智能体并行工作,而不突破成本上限。这一特性让它在需要大量终端操作的结构化任务中获得了速度优势——本质上,它赢在“跑得快、协调得好”,而不是“想得深”。
用Sonnet 5.5还是Opus 5.5?分场景决策
| 工作类型 | 推荐模型 | 原因 |
|---|---|---|
| 智能体编码、终端自动化 | Sonnet 5.5 | Terminal-Bench得分更高,速度更快 |
| 修复Bug、日常开发迭代 | Sonnet 5.5 | 速度快、成本可控、质量足够 |
| 文档/幻灯片/表格生成 | Sonnet 5.5 | 设计感强,官方特别强调“a sharp eye for design” |
| 复杂架构设计、开放式推理 | Opus 5.5 | 多步判断、开放式任务上持续领先 |
| 高风险网络安全分析 | Opus 5.5 | Sonnet 5.5的部分安全请求会回退到Sonnet 5 |
| 长周期自主智能体工作 | Opus 5.5 | 持续判断能力更可靠 |
三、速度提升30%,账单却可能翻倍:Token消耗悖论
Anthropic在发布中声称Sonnet 5.5“多数工作场景成本最多降低30%”,理由是同一定价下需要的Token更少。然而,独立测试机构Artificial Analysis的实测结果揭示了一个截然不同的画面。
在最高努力程度(Max effort)下,Sonnet 5.5在Intelligence Index上的每任务成本为**$7.60**,而Sonnet 5在同等条件下为$5.09——成本实际上涨了约49%。
原因在于Token消耗模式。Artificial Analysis的数据显示,Sonnet 5.5在Max effort下每个任务平均消耗约193,000个输出Token,这是该机构测得的最高值,比Opus 5.5和Sonnet 5高出约60%,是GPT-6 Astra的约7倍。
成本谜题拆解:为什么“更省”变成了“更贵”?
| 成本场景 | Sonnet 5 | Sonnet 5.5 | 变化 |
|---|---|---|---|
| 每百万Token定价 | $2/$10 | $2/$10 | 不变 |
| 每任务平均Token量(Max) | 基准 | 增加约60% | 显著增加 |
| 每任务成本(Max effort) | $5.09 | $7.60 | +49% |
| 每任务成本(High effort) | 较低 | 与Sonnet 5接近或更低 | 取决于任务类型 |
| 每任务成本(Low/Medium effort) | 较低 | 明显更低 | 显著降低 |
数据来源:Artificial Analysis独立测试
这个矛盾的核心在于努力程度档位的重新校准。Sonnet 5.5提供了五档effort设置(low/medium/high/xhigh/max),但同名档位在Sonnet 5和Sonnet 5.5上的“思考量”并不等同——官方迁移指南的第一条建议就是“重新运行你的effort sweep”。
简单来说:
- 低档位场景(low/medium):Sonnet 5.5的优化确实带来成本下降,适合简单任务
- 高档位场景(xhigh/max):Sonnet 5.5更“用力”,消耗更多Token来换取更高准确性,成本上升
- 默认档位(API的high、Claude Code的medium):多数日常任务在这两档上能取得较好的性价比平衡
Anthropic的“省30%”和Artificial Analysis的“贵49%”都是真实数据,区别在于测的是哪个effort档位。对于需要最高准确性的编码和推理任务,Sonnet 5.5的Token消耗确实会推高账单。
Effort档位选择速查
| 场景 | 建议档位 | 预期成本 | 预期质量 |
|---|---|---|---|
| 简单格式化、摘要 | low | 最低 | 足够 |
| 日常代码补全、文档生成 | medium/high | 中等 | 良好 |
| 复杂Bug修复、多步推理 | xhigh | 较高 | 优秀 |
| 关键编码任务、高准确性需求 | max | 最高 | 最佳 |
四、与GPT-6 Sol同价对垒:中端模型市场的正面对决
Sonnet 5.5的定价——每百万输入tokens $2、输出tokens $10——与OpenAI的GPT-6 Sol完全一致。两者在2026年9月下旬相隔六天先后发布,摆明了是正面对标。
Sonnet 5.5 vs GPT-6 Sol:关键维度对比
| 对比维度 | Claude Sonnet 5.5 | GPT-6 Sol |
|---|---|---|
| 输入定价 | $2/百万tokens | $2/百万tokens |
| 输出定价 | $10/百万tokens | $10/百万tokens |
| 上下文窗口 | 1M tokens | 需查阅OpenAI文档 |
| 知识截止日期 | 2026年6月 | 需查阅OpenAI文档 |
| Terminal-Bench 4.0 | 70.6% | 未公布同项成绩 |
| FrontierCode 1.1 | 46.2%(Max) | 49.3% |
| GDPval-AA v2.1 | 1844 | 1487 |
| Chartography(无工具) | 61.6% | 53.6% |
| 智能指数(Artificial Analysis) | 56 | 47 |
数据来源:Anthropic官方基准表及Artificial Analysis数据
从对比来看,Sonnet 5.5在知识工作和视觉理解方面对GPT-6 Sol形成明显优势——GDPval-AA高出357分,Chartography高出8个百分点。但在FrontierCode的Max档位上,GPT-6 Sol以49.3%小幅领先Sonnet 5.5的46.2%。
一个需要留意的事实是:Sonnet 5.5在Artificial Analysis智能指数上得分为56,而GPT-6 Sol为47。两者定价相同,但综合能力评估上Sonnet 5.5领先约9分。这让Sonnet 5.5在同价位产品中具有明显的性价比优势。
Sonnet 5.5在中国市场的实际表现
从中国开发者的视角来看,Sonnet 5.5的发布引发了不少讨论。有开发者指出,随着OpenAI的Codex应用持续优化,部分用户已在评估从Claude Code迁移到Codex的可能性。但也有早期客户反馈显示,Box报告新模型比上一版快2.4倍,Slack表示在未修改提示词的情况下获得了更好、更快的结果。
这种分化反馈说明:Sonnet 5.5的能力提升是真实的,但实际使用效果很大程度上取决于团队的工作流和任务类型。对于深度依赖Claude Code生态的团队,迁移成本较低;而对于已经在OpenAI生态中沉淀了工作流的团队,切换的动机则需要更审慎的评估。
五、首次下放顶级安全防护
Sonnet 5.5是首个搭载与Opus级别相当的网络安全防护措施的Sonnet模型。这意味着Anthropic首次将旗舰模型的安全标准下放到了中端产品线。
具体来说,Sonnet 5.5配备了针对“推理提取攻击”(通过蒸馏手段提取模型推理过程的攻击)的安全分类器。在Anthropic的自动化行为审计中,Sonnet 5.5在大多数对齐指标上持平或优于Sonnet 5。
但这些安全措施并非没有代价。根据系统卡,源代码漏洞扫描是允许的,但编译后二进制文件的漏洞发现会被阻止。此外,无害的网络安全相关请求,Sonnet 5.5的拒绝率也可能高于Sonnet 5。对于从事安全研究或逆向工程的团队,这是一个需要提前评估的约束。
Sonnet 5.5的安全防护升级是一个清晰的信号:Anthropic正在将安全能力从“旗舰专属”转变为“产品线标配”。对于企业用户而言,这意味着即便是使用价格更低的Sonnet模型,也能获得与旗舰模型相近的安全保障水平。
六、API迁移:五项破坏性变更与三项关键调整
如果你的团队已经在生产环境中使用Sonnet 5,迁移到Sonnet 5.5需要注意五项破坏性变更。官方迁移指南提供了请求前后的对比示例,这里梳理最关键的三项调整:
| 迁移项 | 变更内容 | 操作要点 |
|---|---|---|
| 思考设置 | temperature、top_p、top_k设置非默认值会返回400错误 |
移除或使用默认值 |
| 工具调用间文本 | 文本以thinking块返回,流式输出可能“静默” | 设置display值或关闭前置思考 |
| 强制工具使用 | 不再支持强制工具调用 | 调整提示词策略 |
| Effort档位 | 同名档位思考量不等同 | 重新运行effort sweep |
| 缓存写入定价 | $2.50/百万(5分钟),$4/百万(1小时) | 评估缓存策略 |
| 最小缓存提示长度 | 从1024降至512 tokens | 可缓存更短提示 |
数据来源:Claude Platform官方迁移文档
其中最容易造成生产事故的是工具调用之间文本返回形式的变化。如果你的应用依赖流式输出在工具调用之间展示推理文本,升级后用户界面会在工具调用期间“静默”,直到你设置了正确的display值或关闭前置思考。这个问题不会导致请求失败,但会直接影响用户体验,属于“不报错但体验变差”的静默回归,需要在灰度阶段重点监控。
另一个需要特别注意的是effort档位的重新校准。在Sonnet 5上设置为high的请求,迁移到Sonnet 5.5后如果继续使用high,实际的思考量可能与之前不同。建议的做法是:先在低档位跑一轮基准测试,再逐步提高档位,找到成本和质量的平衡点。
七、独到见解:Sonnet 5.5的真正价值不在于“便宜”
综合所有数据,我对Sonnet 5.5的判断是:它解决的不是“成本问题”,而是“能力密度问题”。
见解一:中端模型正在压缩旗舰模型的存在空间
Sonnet 5.5在GDPval-AA上仅落后Opus 5.5两分,在AA-Briefcase上仅落后11分,在CursorBench上仅落后2.3个百分点。这些差距对于大多数日常开发工作来说,已经小到不影响实际产出质量。
这意味着一个趋势正在加速:旗舰模型的价值正在从“日常使用”向“极限场景”收缩。Opus 5.5的核心用户将越来越集中在需要持续判断、开放式推理和长周期自主工作的场景中,而绝大多数“干活”的任务将被Sonnet级别模型承包。
对于开发团队来说,这意味着一个务实的策略调整:将Opus 5.5保留给架构设计和关键决策,将Sonnet 5.5作为日常编码和文档工作的默认模型。这种分层使用策略,可能比单纯追求“用最强模型”带来更高的综合效率。
见解二:Token效率是下一阶段的核心竞争维度
Sonnet 5.5的“成本悖论”揭示了一个被忽视的事实:模型行业的竞争正在从“每Token多少钱”转向“每任务多少钱” 。
当各家的每百万Token定价趋同时(Sonnet 5.5和GPT-6 Sol都是$2/$10),真正的成本差异来自完成任务所需的Token总量。Sonnet 5.5在Max effort下193K的输出Token量,虽然推高了单次成本,但换来了Terminal-Bench上近7倍的得分提升。这是“用Token换质量”的策略,在关键编码任务上是值得的。
但对于高频、低复杂度的任务,用Max effort跑Sonnet 5.5反而是浪费。学会按任务复杂度选择effort档位,比选择哪个模型更重要。
见解三:安全防护的下放将重塑企业采购标准
Sonnet 5.5首次在Sonnet级别产品上提供Opus级别的安全防护,这将改变企业用户对中端模型的预期。当安全能力不再是旗舰专属,企业在选择模型时的核心考量将从“哪个更安全”转向“哪个在同等安全水平下效率更高”。这对Anthropic的竞品构成了直接压力——如果中端模型也能提供顶级安全防护,竞品需要在其他维度上提供更有说服力的差异化价值。
八、常见问题解答
Claude Sonnet 5.5是什么?
Claude Sonnet 5.5是Anthropic于2026年9月28日发布的中端AI模型,是Claude 5.5家族的第二款产品(首款为Opus 5.5)。它在保持与Sonnet 5相同定价($2/$10每百万tokens)的前提下,将输出速度提升30%以上,在Terminal-Bench 4.0智能体编码测试上从10.3%跃升至70.6%,首次在中端产品线上反超旗舰Opus 5.5的66.4%。
Claude Sonnet 5.5和Opus 5.5应该怎么选?
核心判断标准是任务的“开放性”和“判断需求”。Sonnet 5.5在结构化、有明确边界的任务上表现突出——修复Bug、日常编码、生成文档和表格、执行终端操作——且速度更快。Opus 5.5则在需要持续判断、多步推理和开放式探索的任务上保持明显优势。一个务实的策略是分层使用:日常任务用Sonnet 5.5,复杂架构决策和长周期智能体任务用Opus 5.5。
Sonnet 5.5真的比Sonnet 5便宜30%吗?
取决于你使用的effort档位。在低档位(low/medium)下,Sonnet 5.5确实更省,因为Token消耗更少。但在最高档位(Max effort)下,独立测试显示每任务成本反而上涨了约49%,因为它会消耗更多Token来追求更高准确性。官方“省30%”和第三方“贵49%”的说法都是对的,只是测的档位不同。
从Sonnet 5迁移到Sonnet 5.5需要注意什么?
五项破坏性变更需要处理,最关键的三项是:一是移除temperature、top_p、top_k的非默认设置(会返回400错误);二是处理工具调用之间文本返回形式的变化(流式输出可能出现“静默”);三是重新校准effort档位(同名档位的思考量已经不同)。此外,Sonnet 5.5不再支持强制工具调用。
Sonnet 5.5和GPT-6 Sol哪个更好?
两者定价完全相同($2/$10),但能力侧重不同。Sonnet 5.5在知识工作(GDPval-AA 1844对1487)、视觉理解(Chartography 61.6%对53.6%)和综合智能指数(56对47)上领先。GPT-6 Sol在FrontierCode Max档位上小幅领先(49.3%对46.2%)。如果你的工作集中在智能体编码和知识工作领域,Sonnet 5.5的综合优势更明显。
Sonnet 5.5的安全防护会影响正常开发吗?
常规的软件开发和大多数生命科学工作不受影响。但从事安全研究或逆向工程的团队需要注意:编译后二进制文件的漏洞发现会被阻止,无害的网络安全相关请求的拒绝率也可能高于Sonnet 5。Anthropic表示安全防护针对的是一小部分高风险请求。

