Haiku 5.5降价75%,但长提示只便宜一半
Anthropic 上线 Claude Haiku 5.5,官方说它是"最便宜、最快、也最强的小模型"。

便宜九成,和便宜一半
定价表分两档,单位都是每百万 token。十万 token 以内的请求:输入 0.10 美元、输出 0.50 美元、缓存读 0.01 美元,三项都比上一代便宜九成。越过十万 token 之后,这三项按五倍计价,跟前一代比只便宜一半。
Anthropic 在博客里给了个分布:历史请求里大约 90% 的提示都在十万 token 以内。要是你的主力场景是整库代码补全、整份财报问答这类活,很可能正好落在那剩下的一成里,预算就得按"便宜一半"写,别拿 75% 去报账。
缓存命中率才是账单的变量
你的 agent 每一轮都在重发同一段系统提示和历史,这段走缓存读,价格是上一代的十分之一。服务没把它存下来复用,省下的就只剩输入端那九成。
具体差多少可以算一遍。一个 agent 服务每轮重发 2 万 token 的提示和历史,跑满 10 万轮就是 20 亿 token 的缓存读:按上一代 0.10 美元每百万算,这段要 200 美元;按这一代 0.01 美元算,20 美元。推理质量没变,这段的差价是 180 美元。
怎么量自己的命中率?把上一周的请求日志拉出来,看有多少 token 落在缓存读这一项上。这一项占比高的服务,这次降价拿到的是十倍;占比低的服务,拿到的是输入端那九成,重新灌上下文的钱还会一点点吃掉它。
同一天,Sonnet 5.5 的缓存读也从 0.20 美元降到 0.10 美元,官方估算这让大多数 agent 任务的整体成本降约 20%。已经在用 Sonnet 5.5 的团队,这条的变化比换不换 Haiku 更大。
跑分和边界
能力这边也不是白送。官方基准里,Haiku 5.5 在 OSWorld 2.1 离线子集拿到 72.4%,Haiku 4.5 只有 15.7%;Terminal-Bench 4.0 是 39.2%,上一代是 0.0%;Humanity's Last Exam 无工具 45.9%,上一代 10.2%。这也是 Haiku 级模型第一次带上 effort 档位,可以自己选省钱还是选聪明。
Asana 的工程师在官方博客里说,他们拿它跑 AI Teammates 的评估集,任务完成延迟降了三成以上,每个 agent turn 的推理速度最高快 2.5 倍。effort 档位按任务分级就行:分类、摘要、压缩这类跑低档,需要多步推理的再抬上去。
边界也一起说清楚。每天跑几万次短分类、提示又能命中缓存的活,这次降价省得最多;一次性的长文档分析就不一样,省下的会明显缩水。还有一类任务跟价格无关:官方写明 Haiku 5.5 的网络安全护栏比上一代更严,渗透测试这类请求会被直接挡住,再便宜也用不上。
我拿官方那张定价表按自己的调用量算了一遍,结论比标题上的 75% 悲观一点。你要是有兴趣,也可以照着自己最近一周的请求分布算算,看落在哪一档。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
