Claude Haiku 5.5 于 10 月 7 日推出,价格为每百万代币 0.10 美元/0.50 美元,在提示数量低于 10 万的情况下,比 Haiku 4.5 低 90%。 5 倍长提示层、基准测试和 Sonnet 5.5 缓存削减对构建者意味着什么。

人择发布 克劳德俳句 5.5 10 月 7 日,称其为“我们发布过的最便宜、最快、功能最强大的小型型号”。这是 Claude 5.5 代的第三款也是最后一款车型,于 15 天后抵达 作品5.5 (9 月 22 日)和 Sonnet 5.5 后九天(9 月 28 日)。
标题是价格。对于最多 100,000 个令牌的提示,Haiku 5.5 每百万个输入令牌的成本为 0.10 美元,每百万个输出令牌的成本为 0.50 美元。它所取代的 Haiku 4.5 售价分别为 1 美元和 5 美元。这是每个代币价格的十分之一。
同一天,Anthropic 将 Sonnet 5.5 上的提示缓存读取价格减半,并宣布为 Max 和 Team 订阅者提供每月 API 积分。对于在克劳德上运行代理或大容量管道的任何人来说,所有这三个变化都落在同一张账单上。
从 4.6 开始,每个 Claude 模型都以统一费率计费其完整的 1M 代币上下文。 Haiku 5.5 是个例外:提示运行超过 100,000 个令牌的请求将为所有内容(包括输出)支付五倍的短提示费率。下图是在 Anthropic 上检查的 定价页面 2026 年 10 月 9 日,以每百万代币美元为单位。
| 型号 | 输入 | 输出 | 缓存命中 | 批次(输入/输出) |
|---|---|---|---|---|
| Haiku 5.5,提示高达 100K | 0.10 美元 | 0.50 美元 | 0.01 美元 | $0.05 / $0.25 |
| Haiku 5.5,提示超过100K | 0.50 美元 | 2.50 美元 | 0.05 美元 | $0.25 / $1.25 |
| 俳句 4.5 | 1 美元 | 5 美元 | 0.10 美元 | $0.50 / $2.50 |
| 十四行诗 5.5 | 2 美元 | 10 美元 | 0.10 美元(原价 0.20 美元) | - |
| 作品5.5 | 4 美元 | 20 美元 | 0.20 美元 | - |
重要的规则就在细则中。 Anthropic 的文档称,请求的提示长度“计算其所有输入令牌,包括缓存读取和缓存写入”,并且“即使其提示的一部分是缓存命中,超过阈值的请求也会支付更高的价格”。缓存使长上下文的重新发送成本更低。它不会让你回到线下。
一个有效的例子展示了悬崖。带有 90,000 个令牌提示和 2,000 个令牌输出的请求成本约为 0.010 美元。将提示增加到 150,000 个代币,成本约为 0.08 美元 - 提示时间延长三分之二的费用是原来的八倍。这个长请求仍然是 Haiku 4.5 收费的一半(0.16 美元),因此没有人比以前支付更多费用。但 10 倍的节省仅低于 10 万美元。
这也是 Anthropic 自己的储蓄索赔额小于表中显示的原因。据称,Haiku 5.5 的“运行成本平均降低了 75% 左右”,这是一个包含长提示的综合数字。短提示中每个代币的削减是 90%。 SiliconANGLE 报告 大约 90% 的请求都低于 100,000 个代币,这是定价背后的赌注。
Anthropic 将 Haiku 5.5 与 OpenAI 的小模型进行了对比, GPT-6 露娜。在 Anthropic 发布的基准测试中,Haiku 5.5 在所有六项测试中都击败了 Luna,两者都有得分。卢娜在人类期末考试中尚未公布任何结果。 Sonnet 5.5 在每一行上都领先于 Haiku 5.5。

Haiku 4.5 的差距足以改变小模型的用途。 OSWorld 2.1 离线子集上的计算机使用率从 15.7% 上升到 72.4%,而 Luna 为 48.9%。在 Terminal-Bench 4.0(一项代理编码测试)上,Haiku 4.5 得分为 0.0%,Haiku 5.5 得分为 39.2%。露娜获得 16.4%; Sonnet 5.5 获得 70.6%。 GDPval-AA v2.1 上的知识工作 Elo 增加了一倍多,从 735 增加到 1620。
编码是与十四行诗的距离仍然可见的地方。 Terminal-Bench 的准确率是 39.2% 对 70.6%,因此仅使用俳句的编码代理完成的任务要少得多。 FrontierCode 更接近,为 46.4%,而 Sonnet 为 52.1%,尽管 Sonnet 是在其“Xhigh”工作设置下运行的。
Haiku 5.5 也是第一个具有可调整工作量设置的 Haiku,因此团队可以根据请求根据质量来权衡成本,而不是切换模型。它有一个 1M 令牌上下文窗口和多达 128,000 个输出令牌。发布帖子中的客户引用包括 Asana 报告延迟降低了 30% 以上,Box 报告分数比 Haiku 4.5 高出 11 分,延迟大约只有一半。
第二个变化比较安静,但对代理构建者来说可能更重要。 Sonnet 5.5 提示缓存读取从每百万代币 0.20 美元下降到 0.10 美元,即基本输入价格的 0.05 倍,而不是 0.1 倍。根据 平台发行说明,“缓存写入和所有其他价格均保持不变。”

代理循环每次都会重新发送相同的长上下文,因此缓存读取通常是账单上最大的一行。 Anthropic 估计,此次削减使得 Sonnet 5.5“在大多数代理工作上便宜了约 20%”。与 Haiku 5.5 不同,Sonnet 5.5 在整个上下文中保持统一定价,因此 400K 令牌的缓存会话可以获得全额折扣。
Anthropic 还为应用程序订阅者增加了每月 API 积分:最多 5 次每月 100 美元,最多 20 次每月 200 美元,团队最多 500 美元,由用户汇总。它们是通过链接克劳德控制台组织来声明的。
最明显的赢家是简短、重复且数量众多的工作负载:分类、摘要、提取、支持回复、数据库查询和由较大模型扇出的子代理。人为名称实时客户支持和浏览器使用作为速度敏感的情况。从 Haiku 4.5 迁移这些内容只需更改型号 ID 即可, claude-haiku-5-5,并将每个代币成本降低 90%。

长上下文工作需要仔细观察。将整个代码库或 200 页合约输入小型模型的管道将在 Haiku 5.5 上为每个请求支付 0.50 / 2.50 美元。这仍然比 Haiku 4.5 便宜,但与 Sonnet 5.5 的输入差距缩小至 4 倍。如果一项工作的大小通常略高于 100K,那么修剪或压缩提示以使其低于该线是值得的。
谁不应该单独转向俳句:运行严肃的编码代理的团队。终端-工作台间隙表示 Sonnet 5.5 或 更大的克劳德模型 仍然是正确的主要模型,Haiku 5.5 在下面进行廉价的查找。
Haiku 5.5 已在 Web、iOS 和 Android 上的 Claude 应用程序中为 Free、Pro、Max、Team 和 Enterprise 用户、Claude Code、Claude Platform 以及 Amazon Web Services、Google Cloud 和 Microsoft Foundry 提供。人类发表了 系统卡 日期为 10 月 7 日,报告了几乎所有一致性评估的改进。其网络安全保障措施比 Haiku 4.5 更严格,但比其他最近的 Claude 型号宽松一些。

Haiku 4.5 的退役日期尚未公布。计划弃用的一个是 Sonnet 4.5,它于 2026 年 11 月 30 日离开 API;仍在关注的任何人都可以与我们的报道进行比较 克劳德十四行诗 5。随着 Haiku 5.5 的推出,所有三款 5.5 型号均在不到三周的时间内发货。