Claude Opus 5.5 于 9 月 22 日推出,标价低 20%,缓存读取便宜 60%,自我报告的基准测试比 Fable 5.1 胜出。定价、基准、保障措施以及建筑商应该做什么。

Anthropic 于 2026 年 9 月 22 日星期二发布了 Claude Opus 5.5,即 Opus 5 于 7 月 24 日发布两个月后。它是新一代 Claude 5.5 的第一个模型,并在 API 中发布为 claude-opus-5-5。 Sonnet 5.5 和 Haiku 5.5 将在“未来几周”推出, TechCrunch 报道。
对于旗舰产品来说,这样的宣传是不寻常的。它的成本低于它所取代的型号,并且在 Anthropic 自己的基准测试中,它击败了 Fable 5.1(该系列中尺寸更大、价格更高的型号)。 Anthropic 称其为“迄今为止我们测试过的性能最强的模型” 公告。
这也是自首席执行官达里奥·阿莫代 (Dario Amodei) 发布 召唤前线 9 月 14 日。时间紧迫:据报道,OpenAI 的 GPT-6 模型更新在当天大约 90 分钟后发布,我们的文章对此进行了介绍 GPT-6 Sol 和 Luna 定价。
除一条线外,其他条线的标价均下降 20%,其中一条线下降了 60%。数字为每百万代币,如 Anthropic 公告页面上发布的那样(于 2026 年 9 月 27 日检查)。
| 每 1M 代币 | 作品 5 | 作品5.5 | 改变 |
|---|---|---|---|
| 输入 | 5.00 美元 | 4.00 美元 | -20% |
| 输出 | $25.00 | $20.00 | -20% |
| 缓存读取 | 0.50 美元 | 0.20 美元 | -60% |
| 缓存写入 | 6.25 美元 | 5.00 美元 | -20% |
快速模式每百万代币的投入成本为 8 美元,产出成本为 40 美元。
缓存读取剪切比标题更重要。长时间运行的代理会重新发送相同的上下文 - 存储库、合约集、对话历史记录 - 每个任务数十次,并且大多数这些令牌会在缓存读取时计费。 Anthropic 认为,由于更便宜的缓存读取以及每个任务更少的令牌,因此在典型工作负载上的综合效果比 Opus 5 低约 40%。这 40% 是 Anthropic 对典型账单的估计,而不是标价下调。几乎不接触缓存的工作负载接近 20%。
速度也随之移动。输出生成速度比 Opus 5 快 30% 以上, 据科技共和国报道。 Pro、Max、Team 和 Enterprise 的订阅者可以获得更高的五小时使用限制,以及速率限制重置,他们可以在需要时进行储蓄和支出。除了 Claude 应用程序和 Claude 平台 API 之外,该模型还位于 AWS、Google Cloud 和 Microsoft Azure 上。
本节中的每个数字均由 Anthropic 自行报告。代理编码方面的差距最大:Terminal-Bench 4.0 从 Opus 5 上的 52.3% 跃升至 66.4%,比 OpenAI 的 GPT-6 Astra 领先 8 个百分点以上,比 Fable 5.1 领先 10 个百分点以上。

| 基准测试 | 作品5.5 | 寓言5.1 | 作品 5 | GPT-6 阿斯特拉 |
|---|---|---|---|---|
| 终端工作台4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| 前沿代码 v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| 光标基准4.0 | 57.8% | 51.8% | 46.6% | - |
| GDPval-AA v2.1 (Elo) | 1846年 | 1735 | 1708 | 第1542章 |
| 自动化工作台 | 40.0% | 31.4% | 26.9% | 41.4% |
| 人类的最后考试 | 67.7% | 65.6% | 63.6% | 57.2% |
阅读表格了解其损失和胜利。 GPT-6 Astra 仍然占据 AutomationBench 的领先地位,为 41.4% 到 40.0%,在 FrontierCode 上领先 Astra 为 1.1 个百分点 - 足够接近,独立运行比供应商自己的图表更重要。最大的单一跳跃是在科学风格的终端工作中,Terminal-Bench-Science 0.1 从 Opus 5 上的 29.0% 上升到 58.7%。 Anthropic 还列出了 OSWorld 2.0 的计算机使用分数为 81.8%,而 Fable 5.1 的分数为 80.7%,但将其标记为部分分数。

Anthropic 的公告包含了抢先体验的客户的评价。它们是供应商的选择,但它们的观点是相同的:节省的资金来自更少的转弯和更便宜的代币。
“在我们的代理编码任务中,Claude Opus 5.5 在大约一半的轮次、时间和输出令牌方面与 Opus 5 的质量相当,从而将工作负载的成本降低了 40% 到 50%。” - Optiver 人工智能工程全球主管 Noyan Tokgozoglu
Quantium 的 Harley Barnes 表示,一项复杂的编码任务“以前需要在四天内进行 38 次提示,现在改为在三个小时内进行 11 次提示”。 Box 看到 Opus 5.5 使用了 Opus 5 的三分之一,答案是“在不损失准确性的情况下减少了 40% 的冗长”。德勤 (Deloitte) 的首席信息官 Carl Bennett 报告称,Opus 5.5 在最低工作量设置下发现了代码审查中 72% 的已知错误,而 Opus 5 在高工作量设置下发现了 56%。 Hebbia 测量的端到端财务工作流程的标题覆盖率为 86.6%,高于 60.3%。
最引人注目的说法来自 Stripe。一次 Opus 5.5 会议通过 40 个堆积拉取请求的多日重新基准指导了十几个人,第二天下午所有 40 个都通过了 CI。 Anthropic 添加了自己的示例:680,000 行代码迁移在一天内完成,合并分析花费了 63 分钟,而不是 Opus 5 上的 93 分钟,成本约为一半。写作方式也发生了变化 - TechCrunch 注意到输出更加清晰,行话更少,关键信息放在首位。
Opus 5.5 附带与 Fable 5.1 类似的保障措施。它限制了在编译程序中查找漏洞和可识别的生物武器工作的帮助,而触发过滤器的网络安全请求则回落到旧版 Opus 4.8。安全公司和生命科学实验室可以通过 Anthropic 的网络验证计划和生命科学验证计划申请更广泛的访问权限。 “保留思维”反蒸馏保护措施适用于 2026 年 8 月 31 日之后创建的 API 帐户,并且输出带有水印以符合欧盟人工智能法案。

对于安全测试,Anthropic 对大约 2,000 个场景进行了自动行为审核,报告了迄今为止的最佳分数,并在发布前让 METR 和 Frontier Design 评估了模型。据称,Opus 5.5 规避收容边界的可能性比 Opus 5 低 85%,并且在每个测试设置中的即时注入阻力方面都与 Opus 5 相当或优于 Opus 5。
对于大多数 API 用户来说,这是模型 ID 交换。对于具有大量上下文重用的代理循环来说,这种情况最为明显,其中 60% 的缓存读取削减在每个回合都会复合。在编码代理上购买 Fable 5.1 的团队应该在本周重新运行他们自己的评估:如果 Anthropic 的数字能够完成他们的任务,他们就会从更便宜的模型中获得相同或更好的结果。
两组应在切换前进行测试。安全工具供应商可能会发现 Opus 4.8 已经回答了一些请求,直到他们通过了验证程序。任何运行简短、单次提示且几乎没有缓存的人都应该为 20% 的列表削减预算,而不是 40% 的数字。
接下来是 Sonnet 5.5 和 Haiku 5.5,这将决定价格下降是否达到大多数应用程序实际运行的高容量层。有关该家庭的早期步骤,请参阅我们的报道 克劳德十四行诗 5;对于消费者计划,我们的 克劳德评论。 Anthropic 本周的其他新闻是 克劳德的酶发现。