Claude Haiku 5.5 发布:短提示词价格降到 Haiku 4.5 的 1/10,OSWorld 从 15.7% 涨到 72.4%

Anthropic 在 10 月 7 日发布了 Claude Haiku 5.5。距离 Opus 5.5 发布过去两周,距离 Sonnet 5.5 过去九天,5.5 这一代的 Opus、Sonnet、Haiku 到这里就出齐了。上一代 Haiku 还是 4.5,中间没有出过 Haiku 5。

这次最显眼的变化是价格。短提示词的单价只有 Haiku 4.5 的十分之一,跑分却大幅领先上一代。

基本参数

以下来自 Claude 官方文档的模型对比页:

项目 Claude Haiku 5.5
API 模型 ID claude-haiku-5-5(Bedrock 上是 anthropic.claude-haiku-5-5)
上下文窗口 1M tokens
最大输出 128K tokens(Batch API 加 beta 头可到 300K)
思考模式 Adaptive,默认 effort 为 medium
知识截止 2026 年 6 月
退役时间 不早于 2027 年 10 月 7 日

可用平台有 Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud 和 Microsoft Foundry。

这是第一个支持 effort 参数的 Haiku,可以在 low 到 max 之间调。调高了答得更好,但思考 token 按输出计费,单次请求会更贵。

价格:便宜很多,但有个 100K 门槛

每百万 tokens 的价格:

项目 提示词 ≤100K 提示词 >100K Haiku 4.5
输入 $0.10 $0.50 $1.00
输出 $0.50 $2.50 $5.00
缓存读取 $0.01 $0.05 $0.10
缓存写入(5 分钟) $0.125 $0.625 $1.25

Batch API 照例再打五折。

价格表上写的是降了 90%,但 Anthropic 自己给的平均数是便宜约 75%。差在两处:

  • 提示词超过 100K 后单价翻 5 倍,这部分只比 Haiku 4.5 便宜一半。按 Anthropic 的说法,以前约 90% 的 Haiku 请求都在 100K 以内。
  • 新 tokenizer 切得更碎。DataCamp 的测算是同样一段文字要多出约 30% 的 tokens。

所以迁移前最好拿自己的真实请求跑一遍账单,别直接按 1/10 算。

跑分

下表是 Anthropic 发布时给出的数据(厂商自测,经 DataCamp 和 The Decoder 转述,两边数字一致):

测试 Haiku 5.5 Haiku 4.5 Sonnet 5.5 GPT-6 Luna
OSWorld 2.1(电脑操作) 72.4% 15.7% 83.9% 48.9%
Terminal-Bench 4.0 39.2% 0.0% 70.6% 16.4%
FrontierCode 1.1 (Main) 46.4% — 52.1% 42.4%
Humanity's Last Exam(无工具) 45.9% 10.2% 56.9% —
Humanity's Last Exam(有工具) 57.4% 18.7% 64.5% —
GDPval-AA v2.1(Elo) 1620 735 1840 1437

OSWorld 从 15.7% 跳到 72.4%,这个提升挺夸张。Anthropic 这次也给 Python 和 TypeScript SDK 加了电脑操作和浏览器操作的 beta 支持,看得出这类自动化场景是这次的重点。

第三方评测方面,Artificial Analysis 给 Haiku 5.5(max effort)的智能指数是 43 分,同价位推理模型的中位数是 13 分。它测到的 API 输出速度约 240 tokens/秒,同价位中位数约 110。

Sonnet 5.5 每一项都比它高。Terminal-Bench 4.0 上 Haiku 5.5 十个任务大约只能完成四个,复杂的代码智能体任务还是交给 Sonnet 或 Opus。

适合拿来做什么

官方的定位是高并发、对延迟敏感的活:分类、信息抽取、路由、摘要、上下文压缩、客服。在 Claude Code 这类工具里,它适合给 Opus 5.5 或 Sonnet 5.5 当子代理,做一些边角任务。

我觉得最实际的用法是把现有 Haiku 4.5 的批量任务直接换过来,然后对比账单。短提示词的批处理应该能省下一大截。

从 Haiku 4.5 迁移要注意

这些写法在 Haiku 5.5 上会直接报错:

  • 用 budget_tokens 手动开启 extended thinking
  • 把 temperature、top_p、top_k 设成非默认值
  • assistant 消息预填(prefill)

另外,回复可能以 thinking 块开头,解析时要按块类型读取,别直接取第一个块。修改历史对话会让之前的 thinking 块失效,所以对话最好只追加不改写。安全分类器拒绝时会返回 refusal 停止原因,没有自动换模型兜底。

其他

  • 网络安全方面的限制比 Haiku 4.5 更严,但允许的防御类任务比 Sonnet 5.5 多。渗透测试依旧不行。
  • 同时宣布的还有:Sonnet 5.5 的缓存读取降价一半($0.20 → $0.10),Max 和 Team 订阅附带每月 API 额度。

参考来源: