今天早晨,AI 编程圈撞上了两件事:OpenAI 正式推出 GPT-6,免费及 Go 用户接入 Luna。另一边,Anthropic 发布了 Claude Haiku 5.5。对每天靠 Claude Code 和 API 干活的人来说,影响最直接的是后者:官方口径是均价约降 75%。短请求的 API 价格更是直接砍到上一代的十分之一。微博微博36氪
乍一看是价格战开打。但把官方口径、媒体报道和 B 站这一波速测视频连评论区全部翻完之后,我的结论是:这波降价有三个边界条件,踩中任何一个,你想象中的「便宜」都会变成「贵」。它不是给所有人准备的,尤其不是给想拿它当长会话主模型的人准备的。
先看数字:到底便宜成什么样
发布节奏本身就有信息量:继 9 月 22 日 Opus 5.5、9 月 28 日 Sonnet 5.5 之后,Haiku 5.5 是 Anthropic 半个月内补齐的第三款 5.5 模型,也是 Haiku 这一档时隔一年的首次更新。价格结构是这样的(美元/百万 token):36氪
模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
Haiku 4.5(上一代) | $1 | $5 | 缓存读 $0.1 |
Haiku 5.5(提示词≤10万token) | $0.1 | $0.5 | 缓存读 $0.01、缓存写 $0.125 |
Haiku 5.5(提示词>10万token) | $0.5 | $2.5 | 当场涨 5 倍 |
Sonnet 5.5 | $2 | $10 | 9月底发布,与上代同价 |
Opus 5.5 | $4 | $20 | Sonnet 5.5 的两倍 |
GPT-6 Luna | $0.1 | $0.5 | 上月发布,与 Haiku 5.5 同价 |
作为参照,9 月底发布的 Sonnet 5.5 保持输入 $2、输出 $10 的上代定价,刚好是 Opus 5.5 的一半。而 Haiku 5.5 的地板价,是贴着上个月发布的 GPT-6 Luna 打的。微博36氪
价格之外,规格也动了大手术:上下文从上一代的 20 万 token 直接拉到 100 万,最大输出从 6.4 万翻倍到 12.8 万 token。跑分端,上一代在 Terminal-Bench 4.0 编程测试里是尴尬的 0 分,Haiku 5.5 拉到了 39.2%;OSWorld 2.1 离线子集 72.4%,同期 GPT-6 Luna 是 48.9%;GDPval-AA 知识工作拿了 1620 分,是前代 735 分的两倍多,也高于 Luna 的 1437 分。36氪36氪
第三方口径同样惊人:Artificial Analysis 的智能指数里,Haiku 5.5 击败 GLM-5.3-Flash 和 DeepSeek V4.1 Flash,只落后 Kimi K3 一分。具体到数字,AA 给 Haiku 5.5 打了 43 分,比前代的 17 分整整高出 26 分,与 Kimi K3 的 44 分只差一线。微博微博

数字确实漂亮。但坑也全埋在数字里。
边界一:10 万 token 的价格悬崖
$0.1/$0.5 的地板价,只适用于提示词不超过 10 万 token 的请求。一旦越过,输入变 $0.5、输出变 $2.5,当场涨 5 倍。更微妙的是:模型上下文宣传拉到了 100 万 token,但低价档只覆盖前 10 万——你能塞进去的越多,越容易滑出便宜区间。微博
这对 Claude Code 重度用户意味着什么,大家都懂:主会话跑一阵子,上下文轻松突破 10 万。B站一条前端速测的评论区就有人直接点破,超过 10 万上下文之后价格直接是 Luna 的好几倍,甚至想不出来该用这个模型的地方。而同价位的 GPT-6 Luna,目前没有这道悬崖。哔哩哔哩
所以第一个反常识结论:拿 Haiku 5.5 当长会话主模型,可能反而比 Luna 贵。官方自己都没敢说全线降 90%,措辞是大多数典型工作负载的实际成本降约 75%——和「最高降 90%」之间的那段差距,就是被悬崖和用法结构吃掉的。36氪
边界二:effort 档位,单价便宜不等于任务便宜
Haiku 5.5 首次纳入了可调节的 effort 推理强度。档位的代价直接写在第三方图表里:Artificial Analysis 的指数图把 Haiku 5.5 按 effort 拆了档——max 档 43 分、high 档 38 分、low 档只有 29 分,前代 17 分。B站有 UP 主看完测试细节后点出关键:高分表现主要依赖 max 档位的长思维链展开,token 消耗会跟着水涨船高。微博哔哩哔哩
这就是经典的「单价 × 用量」陷阱:纸面上 $0.5/百万输出足够便宜,但 effort 拉满之后,单任务的输出 token 可能翻几倍,实际单任务成本未必比上一代低多少。官方迁移文档的变更表里还有一行不太起眼的字——同样的文本会被计入更多 token,新分词器会进一步放大账单的不确定性。哔哩哔哩

还有一点要拎清:编程、电脑操作这些官方基准表,全部是厂商自测,第三方独立测评尚未发布。目前第三方口径只有 Artificial Analysis 的指数图可参照,43 分是真的,但「编程能力追上中杯」还得等更多独立实测来盖章。哔哩哔哩
边界三:前端实测口碑分化,别只看 43 分
AA 的 43 分是综合智能指数,但分段实测的口碑已经裂开了。今天 B站至少出了两条前端速测,一条标题是《Haiku5.5前端简评:有点区,但便宜》。另一条直接把它称作「前端审美黑洞」。哔哩哔哩哔哩哔哩
评论区更不留情:「总体应该是和 Luna 坐一桌的水平,就很鸡肋。」还有人今早拿它跑大型场景任务,把第三方工具 OpenCode 的额度干爆了都没做完,看完半成品直言不如国产 Flash 三幻神。哔哩哔哩
当然,几个前端样本推翻不了 26 分的综合涨幅。但翻开官方基准表你会发现,补齐的是知识工作、电脑操作、编程这些科目,表里压根没有前端审美这一项——这代 Haiku 补完的是「能不能干活」,没管「好不好看」。

所以结论只能是:它适合在多 Agent 架构里当子任务执行者和路由跑腿,别指望它承担高复杂度的核心推理。这恰好和官方定位对上了:Haiku 5.5 瞄准高吞吐、成本敏感型应用,负责摘要、压缩、数据库查询、分类这些活,并可搭配 Opus 5.5 和 Sonnet 5.5 担任编码子智能体。哔哩哔哩微博
为什么偏偏是现在发一折价的小模型
把镜头拉远,这次发布的时机不是偶然。华尔街见闻的标题直接点破:IPO 前,Anthropic 推出小模型「性价比之王」。招股书里的数字更直白:去年收入 46 亿美元、增长 12 倍,亏损却高达 420 亿美元。另有 5180 亿美元的算力承诺压在头上,IPO 估值可能超过 2 万亿。上市前把「用量故事」做大,比把「单价故事」做大重要得多。微博36氪36氪
而大客户那头正在上闸。据 The Information 报道(The Decoder 10 月 5 日转述):Meta 内部用 Claude Code 的人从约 6 万降到约 3 万,且在一个 28 天周期里,Meta 光 Claude Code 就花掉超过 1.05 亿美元。企业客户全在做同一件事:给 AI 编程成本上闸。Anthropic 的应对,就是把「哪些活该由哪个模型干」的价格打下来。微博
而且这次砍价的不止 Haiku:Sonnet 5.5 的缓存读取价格同时减半,从每百万 token $0.2 降到 $0.1。36氪
更狠的是给订阅用户直接发钱:从本周开始,Claude Max 和 Team 用户每月会收到一笔 Claude Platform API 额度,Max 5x 送 $100、Max 20x 送 $200,Team 按席位最多共享 $500。36氪

同一天,GPT-6 Luna 也推给了免费用户——两家在「便宜小模型」这条赛道贴脸对撞,拼的就是谁家牛马更省草料。降价加送额度这一套组合拳,与其说是让利,不如说是上市前抢用量、抢开发者心智。
那么,谁用 Haiku 5.5 真省钱
按用途切一刀。
值得马上切的(短上下文、高频率、不吃审美,三条都满足):
Claude Code 里的子代理/后台任务:搜代码库、总结文件、跑测试收结果,每次上下文独立且小,天然待在 ≤10 万的低价区
流水线高吞吐任务:分类、压缩、数据库查询、格式转换
带大 system prompt 的高频短请求:缓存读取只要 $0.01/百万 token,重复提示词几乎白送
算一笔账。假设你的工作流每天跑 100 次子代理调用,每次约 8K 输入 + 2K 输出(子任务上下文的常见量级):
方案 | 单次成本 | 每天 | 每月(30天) |
|---|---|---|---|
子代理用 Sonnet 5.5 | $0.036 | $3.6 | $108 |
子代理用 Haiku 5.5(≤10万) | $0.0018 | $0.18 | $5.4 |
20 倍差距,每月省下约 $100。这才是官方「平均成本降 75%」的正确打开方式——省在任务分配上,不是省在模型替换上。订阅党还有一层隐藏折扣:上面那笔每月 $100-200 的 API 额度,拿来在第三方框架里跑子代理正合适,相当于牛马的草料钱被订阅费包圆了。
先别急着切的:
长会话主模型:上下文常态超 10 万,过悬崖之后 Luna 反而更划算
前端/UI 生成:目前实测口碑最差的就是这项
复杂推理主任务:官方自己都把它定位成「子智能体」,别让它做架构决策
三个行动建议
Claude Code 订阅党:把子代理、后台任务这类小模型槽位指到 Haiku 5.5,主会话留在 Sonnet 5.5。这是当下确定性最高的省钱组合,不用等任何评测。
API 开发者:切换前先做影子测试——统计自己典型请求的上下文长度分布。大头在 10 万以内就大胆切;长上下文请求多,单独按 5 倍悬崖价再算一遍,别被「最高降 90%」的标题带走。effort 档位建议从 low/medium 起步试跑,确认质量够用再谈省钱,别一上来就 max 档把 token 烧穿。
观望党:等两周第三方评测。两个观察信号:一是 Artificial Analysis 之外是否有更多独立实测跟进(目前官方基准全是厂商自测);二是 Claude Code 官方会不会把子代理默认槽位直接换成 Haiku 5.5——官方自己敢默认,才是真的能跟。
最后照例提醒:以上跑分和降幅目前都来自厂商自测与发布头几个小时的社区速测,样本还小。26 分的进步大概率是真的,但「对你的工作流便宜几倍」,只有拿自己的请求分布算过才知道。