如果你这个月在用 Claude 干活,账单结构正在你眼皮底下重排。
9 月 22 日 Opus 5.5、9 月 28 日 Sonnet 5.5 之后,Anthropic 半个月没停手:10 月 7 日(美东时间)发布 Haiku 5.5,同时把 Sonnet 5.5 的缓存读取价砍半;10 月 8 日上线 Dashboards 和 Motion,Docs、Slides、Design 结束测试向全部套餐开放;10 月 9 日宣布 Claude Managed Agents(管理智能体)加入动态工作流,单次执行最多并行调度 1000 个智能体;10 月 10 日,Claude Code Projects 向 Pro/Max 全量开放。 知乎上"Claude 发布 Haiku5.5,跑分暴涨并降价 75%,这意味着什么"的提问浏览量超过 80 万;小红书两边同时有人喊"顶级牛马模型堪比开工福利"、有人骂"价格刺客,便宜纯属陷阱"——那条说 Haiku 5.5 拿 Flash 价格杀进中国模型旗舰区的帖子拿了 96 个赞、127 条评论。知乎小红书
吵归吵,这轮优惠能不能进你的工作流,得把条款逐行读完。
一、"降 90%"是真的,但它有门槛:10 万 token
Haiku 5.5 的标价:单次请求 10 万 token 以内,输入 $0.10、输出 $0.50、缓存读取 $0.01(每百万 token),上一代 Haiku 4.5 对应的是 $1、$5、$0.1。 但同一个价目表里藏着另一行:Prompt 超过 10 万 token,整次请求按长上下文档计费,价格是短档的 5 倍——输入 $0.50、输出 $2.50、缓存 $0.05。知乎知乎
所以社区里"砍 90%“和"砍 75%“两个说法都没算错:短请求按标价确实是零头价,Anthropic 自己给的口径是"大多数典型工作负载实际成本约降 75%”。真正要看的是你的活儿落在哪一档:分类、抽取、摘要、格式改写这类高频短任务,是真省;把整本项目、整份合同直接喂进去做长文精读,Haiku 5.5 可能比你还觉得贵的上一代更贵。有人发帖说这是"两端赢、中间输”,不是情绪,是账单形状。小红书

参照对象 GPT-6 Luna 同价($0.10/$0.50/$0.01),但它的悬崖来得更晚也更浅:超过 27.2 万输入 token 才转长档,且输入和缓存只翻倍、输出涨 1.5 倍。你的活儿卡在 10 万到 27 万 token 之间,同样的请求放 Haiku 上贵 5 倍,放 Luna 上还是短档价。跑批量任务前先看清这个门槛,或者干脆拆块、走 Batch。
跑分侧补一句反证:Haiku 5.5 在多数 Agent 基准压过 Luna,OSWorld 2.1 拿到 72.4% 对 48.9%,但在偏真实网页操作的 AutomationBench-AA 上以 35.4% 输给 Luna 的 53.2%——别把"小模型打骨折"读成"全面接管"。 更该被划重点的是 effort 标注:AA 智能指数的 43.4 分是 max effort 跑出来的,默认 medium 只有 34 分;每任务实测价也被输出长度吃回去,Haiku 每任务 $0.21,Luna 只要 $0.07——看到不带 effort 标注的榜单截图,先划走。 另外公告说它是"目前最快的 Claude",脚注老实补了"指各模型都跑在标准速度下的情况",开了快速模式的 Opus 还是比它快。知乎小红书
二、两笔容易被跳过的钱:缓存减半与每月白送的 API 额度
这一轮里对重度用户影响最大的可能反而是小字:Sonnet 5.5 缓存读取从每百万 token $0.20 降到 $0.10,未注明限时。 官方估算这一刀会让大多数 Agent 任务总成本再降约 20%,但同一位知乎测算者提醒:"降价 50%"不等于总账单降 50%,能省多少取决于你的任务里有多少 token 走缓存读取。天天挂着几十步工作流的人省的是复利;单轮短调用的人,感知接近于零。知乎
另一笔是真金白银:本周起 Claude Max 和 Team 用户每月额外获得一笔 Claude Platform API 额度——Max 5x 是 $100,Max 20x 是 $200,Team 按席位汇总最高每月共享 $500,可用于 Claude API、Batch API、Console Playground、Managed Agents 和 Agent SDK,任何可用模型都行。 按面值算,Max 20x 用户每月交 $200 订阅、Anthropic 又原样返一份 API 额度。知乎
但有 5 个边界条件别跳过:①不能抵扣 Claude Code 里的交互式使用;②不能抵订阅超额后的 Extra Usage;③走 Bedrock、Google Cloud Vertex、Microsoft Foundry 的调用不算;④新订阅要先满 7 天;⑤当月没用完就过期,每个计费周期重新发。 翻译成人话:这笔额度是给你在订阅之外搭第二条流水线用的——自己的脚本、批处理、Agent SDK 项目——不是给你日常对话续命的。用不上 API 的人,它的价值约等于零。知乎

三、1000 个智能体并行,买的是"完工时间",不是"省钱"
动态工作流的官方定义:主智能体规划任务、分派子任务、子任务完成后汇总,单次执行最多并行 1000 个智能体,典型场景是把代码检查这类大任务拆成多份并行处理。 目前处于公开测试阶段。IT之家

反证同样在流传:Vals 的实测显示,多智能体团队的成本达到单智能体的 1.8 至 5.1 倍,四组对比里只有一组拿到统计显著提升。小红书
再加一条安全侧信:《纽约时报》报道 Anthropic 的智能体在执行任务时提交了 20 份不完整、未获处理的签证申请,Anthropic 随后暂停了所有内部评估的实时联网。 这两件事拼出来的结论是:并行调度解决的是"什么时候交付",成本不降反升;而智能体一旦拿到真实世界动作权,验收成本会高到你怀疑人生。小红书
所以"什么活适合拆成多智能体"的判据就一条:可拆分、可独立验收、无真实副作用——批量代码审查、海量信息分类、并行查资料可以;长依赖链、需要全局判断、会提交/付款/对外发送的活,先别上。已经在考虑"要不要多开 Agent"的人,这周更稳的入口其实是刚全量开放的 Claude Code Projects:一个项目一段持续对话,Claude 当协调者按任务开线程,而不是直接冲 1000 并行。哔哩哔哩
四、为什么突然撒币:看懂动机,再决定投入多深
路透社已经把 Haiku 5.5 放进 IPO 语境:Anthropic 年化收入从 2025 年底约 $90 亿冲到 2026 年 7 月底超 $650 亿,IPO 营销可能推迟到 11 月美国中期选举之后。但另一边,Ramp 的企业 AI 支出追踪显示 GPT-6 Astra 拿了约 13%、Claude 约 8%,OpenRouter 上的用户支出 2.5 年来第一次被 OpenAI 反超。 所有标价几乎贴着 OpenAI 打:Haiku 压到和 Luna 一样,Sonnet 缓存追平 GPT-6.1 Sol。这轮"补贴"买的是你的调用习惯和账单承诺,"当月过期"的额度本身就是烧速设计。知乎

对你最实际的含义:窗口期先用、但别 all in——别为了吃额度把整条工作流重写进某个折扣周期,等 IPO 落地或对手跟价,条款大概率还会再变。
五、对号入座:你的账单结构决定这周做什么
高频短任务为主(分类/抽取/摘要/模板改写):本周就把 worker 模型换 Haiku 5.5;先拿 10–20 个真实任务试跑,确认平均单次输入没越过 10 万 token,再批量切。Free/Pro 用户同样能用到 Haiku 5.5,Docs/Slides/Design 结束测试后所有套餐都能用、包括免费版——这半边是零成本增量。哔哩哔哩
长任务为主(整本资料精读、大上下文工作流):别照搬"90% 降价",先核对你的 token 分布;10 万上下反复越线的,拆块或留在 Sonnet 5.5 吃缓存减半,都比撞进 5 倍长档划算。
挂着 Agent/工作流的重度用户:主力留 Sonnet 5.5(官方口径总成本再降约 20%);Max/Team 用户把免费 API 额度定向到自己脚本、Batch 和 Agent SDK 上,记住 5 个边界条件,月底剩多少作废多少。
观望多智能体的:这周不动。盯三个信号——动态工作流公测结束后的计价条款、Vals 之外更多第三方面板数据、Anthropic 对智能体联网动作权的进一步处置;真要试,从 10 个并行以内、可独立验收的弱耦合任务起步。
一句话收束:这半个月 Anthropic 把"跑腿的、常驻的、并行的"三层的价全动了。降价是真的,门槛也是真的——先看清自己的账单长什么样,再决定这轮红利吃到哪一档。