Anthropic同步发布轻量模型Haiku 5.5:小模型的能力拐点已经到来

2026年10月7日,Anthropic正式发布Claude Haiku 5.5,这是Haiku系列迄今速度最快、成本最低、能力最强的小型模型。运行成本较Haiku 4.5平均下降约75%,API输入价格降至每百万token 0.10美元。Anthropic同步发布轻量模型Haiku 5.5,在知识工作、计算机操作和智能体编程三项基准上实现了跨越式提升,标志着轻量模型从辅助工具向独立执行体的关键转折。

一、一次不太寻常的“小模型”发布
在AI模型领域的常规节奏里,小模型的迭代通常遵循一套可预期的模式:大模型先升级,小模型在半年到一年后“继承”部分能力,性能提升几个百分点,价格微调。这条规律在Haiku系列上一直如此——从Haiku 3到Haiku 4.5,每一代都在稳步前进,但从未跨过那条“能不能独立干活”的分界线。
Haiku 5.5打破了这个惯性。
Artificial Analysis给出的智能指数是43分,而Haiku 4.5只有17分。一年时间,26分的跃升,放在任何一家厂商的产品谱系里都不算正常。Artificial Analysis的智能指数是一个复合指标,把推理、数学、代码、智能体任务等测试揉成一个数。单一基准可以靠记忆和模式匹配糊弄过去,但跨任务的复合评测很难。43分意味着Haiku 5.5在相当一部分场景下可以独立跑完多步骤流程,而不是只能返回一句“我建议你……”——这是小模型叙事中一个根本性的身份转变。
更值得注意的是,Anthropic同步发布轻量模型Haiku 5.5的时机。Opus 5.5(2026年9月22日)、Sonnet 5.5(2026年9月底)已经先后落地,Haiku 5.5补齐了Claude 5.5系列的最后一块拼图。至此,Anthropic形成了“Opus管复杂推理、Sonnet管通用执行、Haiku管跑量和速度”的三层矩阵。小模型在这个架构里的角色,从“省钱的备选项”变成了“被默认调用的执行层”。
二、基准数据:代际跃升到底有多真实
先看Anthropic官方公布的完整基准数据:
| 基准测试 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1(知识工作) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1(知识工作) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1(计算机操作) | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity‘s Last Exam(无工具) | 45.9% | 10.2% | — | 56.9% |
| Humanity’s Last Exam(有工具) | 57.4% | 18.7% | — | 64.5% |
| Terminal-Bench 4.0(智能体编程) | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main(编程) | 46.4% | — | 42.4% | 52.1% |
| Chartography(视觉推理) | 46.4% | 6.4% | 29.1% | 61.6% |
数据来源:Anthropic官方发布公告,2026年10月7日。
这组数据里,有几处变化值得单独拎出来看。
OSWorld 2.1的72.4% 是最扎眼的一项。这个基准测试的是模型通过多步骤操作完成真实计算机任务的能力——打开应用、导航界面、填写表单、在软件之间传递数据。Haiku 4.5在这个测试上只有15.7%,几乎不具备实用价值。Haiku 5.5直接跳到72.4%,把GPT-6 Luna的48.9%甩开了23.5个百分点。这个跃升意味着Haiku 5.5第一次具备了“让AI替你操作电脑”的工程可行性,而不是只能停留在演示阶段。
Terminal-Bench 4.0的39.2% 同样值得注意。Haiku 4.5在这个基准上是0.0%——完全无法完成终端环境下的智能体编程任务。Haiku 5.5的39.2%虽然不及Sonnet 5.5的70.6%,但已经超过了GPT-6 Luna的16.4%两倍以上。对于一个定位为“子智能体”的模型来说,这个水平足以承担代码库级别的简单修改和工具链调用。
Humanity‘s Last Exam的表现则暴露了小模型的边界。Haiku 5.5在无工具模式下拿到45.9%,有工具时升至57.4%,与Sonnet 5.5的56.9%和64.5%仍有明显差距。这说明在处理需要深度多步推理的复杂问题时,Haiku 5.5依然不是Sonnet 5.5的替代品。它的优势区间在执行层,而非推理层。
三、Effort参数:小模型第一次拥有了“油门”
Haiku 5.5是Haiku系列中首款支持effort参数调节的模型。这个看似不起眼的功能,实际上改变了小模型的使用逻辑。
Effort参数提供low、medium、high、xhigh、max五档设置。low档最便宜、最快,适合简单聊天和分类任务;medium是默认档位;xhigh和max档则留给那些“质量提升值得付出额外成本”的场景。Adaptive thinking默认开启,可以根据任务的复杂度自动调整思考深度,而effort参数则提供了人工干预的杠杆。
这个设计的精妙之处在于:它把“成本还是智能”的决策权从模型厂商手里交还给了开发者。过去,小模型和大模型之间的选择是一道非此即彼的二元题——要么用便宜的但能力有限,要么用贵的但能力足够。Haiku 5.5的effort参数把这道题变成了一个连续变量。一个客服对话的轮次可以用low档,同一套系统里的复杂工单分析可以临时切到high档,不需要在两个模型之间来回切换。
从工程角度看,这降低了多模型架构的复杂度。开发者不需要再维护一套“什么时候调用Haiku、什么时候调用Sonnet”的路由逻辑,至少在相当一部分场景下,同一个Haiku 5.5实例可以通过effort档位覆盖从简单到中等复杂度的任务光谱。
不过,这里有一个容易被忽视的细节:effort参数的实际成本影响并不完全直观。Anthropic在Artificial Analysis的测试中显示,Haiku 5.5在max effort下的智能指数为43,但每完成一项AA index任务的成本是0.21美元;降到high effort后,指数只掉2分(到41),但成本降到0.08美元。对于大部分生产环境来说,high档可能是性价比最优的平衡点。
四、定价结构:数字背后的隐性成本
价格是这次发布中最容易被误读的部分。
Anthropic给出的数字很清晰:100K token以内的请求,输入$0.10/MTok,输出$0.50/MTok,相较Haiku 4.5的$1/$5下降了90%。超过100K token的请求,价格调整为$0.50/$2.50。Anthropic指出,企业约90%的Haiku历史请求都集中在100K token以内,这意味着大多数现有工作负载可以直接享受最大降幅。
但Haiku 5.5使用了一个“更吝啬的分词器”。根据开发者Simon Willison的实测,同一段长提示词在Haiku 5.5上的token计数约为Haiku 4.5的1.25倍。Anthropic官方文档也确认了这一点:Haiku 5.5使用与Claude 4.7之后模型相同的新分词器,相同文本比Haiku 4.5多计约30%的token。
这对实际成本的影响需要重新计算。名义价格下降了90%,但token数量增加了约25%-30%,实际成本降幅大约在85%-87% 之间,而不是90%。当然,这仍然是一个巨大的降幅,但理解这个差异对于做容量规划和成本预估的工程团队来说很重要。
另一个需要留意的点是100K token的分界线。Haiku 5.5的上下文窗口是100万token,但价格在100K处有一个5倍的跳升。对于文档处理、长对话压缩这类场景,如果单次请求经常超过100K,成本优势会显著收窄。Anthropic同时将Sonnet 5.5的缓存读取价格从$0.20降至$0.10/MTok,使得Sonnet 5.5在大部分智能体任务上的成本降低了约20%。如果工作负载偏向长上下文且对质量要求较高,Sonnet 5.5在降价后的性价比反而可能更有竞争力。
五、产品矩阵中的真实位置
把Haiku 5.5放进Anthropic当前的产品版图里看,它的位置比“便宜版Claude”要复杂得多。
| 维度 | Haiku 5.5 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|---|
| 输入价格 | $0.10/MTok(≤100K) | $2.00/MTok | $4.00/MTok |
| 输出价格 | $0.50/MTok(≤100K) | $10.00/MTok | $20.00/MTok |
| 上下文窗口 | 100万token | 100万token | 100万token |
| 最大输出 | 128K | 128K | 128K |
| 默认effort | medium | high | medium |
| 定位 | 高吞吐执行层 | 通用工作层 | 复杂推理层 |
数据来源:Anthropic官方文档及Vercel AI Gateway。
Haiku 5.5的输入价格是Sonnet 5.5的二十分之一。这个倍率在模型定价史上并不多见。当两个模型共享相同的上下文窗口和输出上限,价格差达到20倍时,选择逻辑会发生质变。
在Anthropic的客户实测中,这种质变已经有了具体的数据支撑。Asana报告任务完成延迟降低超过30%,单轮推理速度提升最高2.5倍。HubSpot的CRM任务套件综合准确率达到92.8%,是该套件历史最高。Box的综合评分比Haiku 4.5高出11分,延迟约减半。
但Haiku 5.5不适合的场景同样清晰。需要多步推理链的复杂分析报告、大规模代码重构与架构设计、对输出准确率要求极高的法律和医疗合规内容,这些场景下Sonnet 5.5或Opus 5.5仍然是更合理的选择。Haiku 5.5的价值在于它把“够用线”往上顶了一截——多轮工具调用、长文档结构化抽取、代码库级别的简单修改,这些以前需要调用贵模型才敢做的功能,现在放进便宜档位也敢试了。
六、Anthropic同步发布轻量模型Haiku 5.5的战略信号
把Haiku 5.5的发布放在Anthropic 2026年下半年的整体节奏里看,有一个信号值得认真对待。
Anthropic在9月22日发布Opus 5.5,9月底发布Sonnet 5.5,10月7日发布Haiku 5.5。三款模型在两周内密集落地,覆盖从$0.10到$4.00的输入价格区间。这种节奏不像是在逐款打磨,更像是在快速完成产品矩阵的卡位。
轻量模型市场的竞争正在从“谁更便宜”转向“谁在便宜的同时能真正干活”。GPT-6 Luna、Gemini 3.8 Flash、Kimi K3、GLM-5.3 Flash——这一档位的选择已经足够拥挤。Haiku 5.5的策略不是单纯压低价格,而是用大幅提升的智能体能力重新定义“轻量模型能做什么”。OSWorld 72.4%和Terminal-Bench 39.2%这两个数字,如果能在第三方复现中站得住,说明Anthropic在模型蒸馏和推理效率优化上取得了实质性突破——用更低的推理成本,达到了竞品轻量线的水平。
一个更深层的判断:当小模型的智能指数逼近两年前的旗舰水平,它的角色就从“缓冲垫”变成了“默认项”。企业级部署里,推理开销是持续出血的口子。一个价格低一个数量级、能力达到旗舰八成的小模型,能吃掉的工作负载比例远超预期。Haiku 5.5的发布,本质上是在推动这个替代过程加速。
七、开发者需要重新校准的决策框架
Haiku 5.5的出现,让模型选型从一个静态判断变成了一个动态优化问题。
第一层校准是场景匹配。 高并发文本分类、实时客服对话、多模型Agent架构中的子智能体执行、浏览器和桌面自动化操作——这些是Haiku 5.5的主场。复杂分析报告、大规模代码架构设计、高合规要求的法律医疗输出——这些场景仍然需要Sonnet 5.5或Opus 5.5。但两者的边界正在移动。一年前“需要Sonnet”的任务,现在Haiku 5.5可能已经够用了。
第二层校准是成本重算。 名义价格降了90%,但token数量涨了约30%,实际降幅约85%-87%。更重要的是,prompt caching(缓存读取$0.01/MTok)和Batch API(50%折扣)可以叠加使用,高频重复调用的场景下综合成本可以进一步下探。开发者需要根据自己的请求模式重新算一遍账,而不是简单地按标价乘以调用量。
第三层校准是架构设计。 Effort参数意味着同一个模型实例可以服务不同复杂度的任务。一个客服系统不需要为“简单问答”和“工单分析”分别部署不同的模型,一个Haiku 5.5实例通过动态调整effort档位就能覆盖大部分场景。这简化了系统架构,但也要求开发者在提示词设计上更精细地匹配effort档位。
FAQ
Q1:Haiku 5.5的“运行成本下降75%”和“API价格下降90%”是什么关系?
两者统计口径不同。“下降90%”指的是100K token以内请求的标准API标价变化:输入从$1.00降至$0.10,输出从$5.00降至$5.50。 “下降75%”是Anthropic根据实际使用模式计算的综合运行成本,综合了缓存、批处理和不同请求长度的分布。
Q2:新分词器对成本的影响到底有多大?
Haiku 5.5使用的分词器比Haiku 4.5约多计30%的token,实测中同一段提示词约多计25%。这意味着标价下降90%之后,实际成本下降幅度约为85%-87%。在做容量规划时,建议按25%-30%的token增量进行估算。
Q3:Haiku 5.5能在本地部署吗?
不能。Haiku 5.5是闭源模型,仅通过Anthropic API、Amazon Bedrock、Google Cloud和Microsoft Foundry提供。如果对本地部署有硬性要求,需要考虑开源替代方案。
Q4:Effort参数对成本的实际影响如何?
根据Artificial Analysis的数据,max effort下每项任务成本约$0.21,high effort下降至$0.08,智能指数从43降到41。对于大部分生产环境,high档可能是性价比最优的选择。low档适合分类、路由等简单任务,medium档作为默认值适合大多数对话场景。
Q5:Haiku 5.5适合替代Sonnet 5.5吗?
取决于任务类型。在高并发、低延迟、中等复杂度的任务上,Haiku 5.5的性价比明显更高。但在需要深度多步推理、大规模代码重构或高准确性输出的场景中,Sonnet 5.5仍然是必要的。关键的判断依据不是“模型够不够聪明”,而是“任务容错率和失败成本有多高”。
Q6:Haiku 5.5的知识截止日期是什么时候?
2026年6月,与Sonnet 5.5和Opus 5.5一致。这意味着2026年6月之后的事件和知识不在模型训练数据中。
Q7:这次发布对轻量模型赛道意味着什么?
Haiku 5.5把轻量模型的智能体能力上限往上顶了一截。OSWorld从15.7%到72.4%的跃升,让“便宜模型只能做简单事”的假设不再成立。接下来值得关注的是竞品(GPT-6 Luna、Gemini 3.8 Flash等)的回应速度,以及小模型能力提升对多模型架构设计思路的实际影响。

