9月28日晚上,Anthropic 把 Claude Sonnet 5.5 放了出来。距离 Opus 5.5 发布,只隔了不到一周。微博
真正让开发者圈子炸锅的,不是"又出新模型",而是一个反常识的数字:在终端智能体编程评测 Terminal-Bench 4.0 上,上一代 Sonnet 5 只拿了 10.3%,Sonnet 5.5 直接跳到 70.6%——不仅把前代甩开近七倍,还反超了自家旗舰 Opus 5.5 的 66.4%。中端模型把旗舰按在地上摩擦,这在模型发布史上并不多见。知乎
B站今早的实测视频评论区已经吵翻了:有人说"神中神,有 4.6 刚出那会的震撼",也有人泼冷水"跑分王而已,长线任务算下来根本没省多少"。哔哩哔哩
两边说的其实都对,只是各算各的账。这篇文章把 Sonnet 5.5 发布前后的信息翻了个遍,替你算清三笔账:API 标价账、真实任务成本账、订阅额度账。看完你就知道自己该不该换、什么时候换。

第一笔账:API 标价账——"便宜一半"是真的,但有前提
先把官方数字摆上桌:
模型 | 输入(每百万token) | 输出(每百万token) | 缓存读取 |
|---|---|---|---|
Sonnet 5.5 | $2 | $10 | $0.20 |
Opus 5.5 | $4 | $20 | $0.20 |
单看标价,Sonnet 5.5 的输入输出价格刚好是 Opus 5.5 的一半,和上一代 Sonnet 5 持平,也就是"加量不加价"。官方还给了两个效率数字:速度比 Sonnet 5 快 30% 以上,单任务 token 消耗更少,综合下来大部分任务成本最多再降 30%。知乎微博
但这里有个被大多数人忽略的细节:缓存读取价,Sonnet 5.5 和 Opus 5.5 一模一样,都是每百万 token 0.2 美元。为什么这个细节要命?因为写代码、跑 Agent 这类工作负载,九成的输入 token 都是缓存命中。知乎有位作者用 Claude Code 做了个端到端实测:同一条长链条指令分别丢给 Sonnet 5.5 和 Opus 5.5,两边各吃掉 495 万和 557 万缓存 token,各自产生 1 美元左右的固定成本——直接把"标价差 50%“稀释成了"实际账单差不到四成”。知乎
所以第一笔账的结论是:标价便宜一半是真的,但你的真实账单便宜多少,取决于你的负载里缓存占多大头。缓存命中率越高,Sonnet 的价格优势越薄。
第二笔账:真实任务成本账——跑分反超,但"糙"是真实存在的
Terminal-Bench 70.6% 对 66.4%,跑分上 Sonnet 5.5 确实赢了旗舰。其他几个基准也好看:
FrontierCode High 强度:比同档 Sonnet 5 高 10 分,单任务成本约为后者的十五分之一。知乎
CursorBench(模拟真实编程会话):最佳成绩和 Opus 5.5 只差约 2 分
GDPval-AA(覆盖 9 个行业、44 种职业的真实知识工作):1844 对 1846,和 Opus 5.5 基本打平

但跑分持平不等于体验持平。还是上面那位知乎作者的实测,发现了两个 Sonnet 5.5 省不掉钱的地方:
一是收尾质量。 同一个"生成动画视频并配解说"的任务,两边都一次跑通,但 Sonnet 5.5 交付的成片里有语义错误——把官方原文"Anthropic 自家模型里最不爱试探边界的"过度引申成了"所有模型里",而且它自己没查出来。Opus 5.5 初稿也犯了同样的毛病,但它在交工前主动分叉出一个子 Agent 逐句复核原文,把错误修正了。Sonnet 的核验只对了数字,没拦住语义。知乎
二是审美和细节。 Three.js 太阳系交互、500 字短篇小说、视频混音,三类任务 Opus 5.5 都明显更细腻;Sonnet 5.5 属于"完全能干活,就是糙了点"——视频尺寸给了个非标准的 1920×1260,日志里还老实承认"未试听成片"。B站评论区的吐槽也指向同一件事:“试了一下只能说是跑分王,长线任务各种雷霆大思考,思考过度效果还不好,不如 Opus”。知乎哔哩哔哩
所以第二笔账的结论是:任务边界越清晰、越短程,Sonnet 5.5 的性价比越高;任务越长、越开放、越需要"交工前自己检查一遍",Opus 5.5 的溢价就越值。 官方自己的定位也是这么切的:Opus 管复杂研判,Sonnet 管日常执行。
更省的用法不是二选一,而是路由:先让 Sonnet 5.5 跑,失败或不确定时再升级到 Opus。Anthropic 这次还给了个新旋钮——“强度档位”(effort):Claude Code 默认 Medium,Platform 默认 High。强度越低,响应越快、token 越省。简单任务调低档,复杂任务再拉高,这比换模型更细粒度地控制成本。知乎
第三笔账:订阅额度账——这周真正的大新闻,可能不是模型
如果你不是 API 开发者,而是每月掏 20 美元的 Claude Pro 或 100/200 美元 Max 订阅用户,那么这周对你影响最大的,其实是另一件事。
9 月 25 日,Claude Code 悄悄改了限额规则,三件事叠在一起:
触顶不再腰斩。 以前撞到 5 小时用量上限,代码改到一半直接切断,留个半成品给你。现在它会找一个"优雅收尾点",把当前任务尽量做完再停——收尾用的是从每周限额里划出的一小笔固定额度。Pro 每周一次,Max 每次触顶都可用。知乎
订阅限额上调。 Pro、Max、Team、Enterprise 的 5 小时限额全部提升。
限额重置可以攒了。 新的 rate limit reset 能存起来自选时机启用——有发布节奏的人,可以把余量攒到冲刺日一次性烧。

再叠加 Sonnet 5.5:模型更快、单任务 token 更少,同样的 5 小时窗口能塞进更多轮对话。有知乎作者专门算过订阅杠杆(月额度按 API 价折算的金额 ÷ 月费),Claude Pro 这一档在 20 美元价位里折扣力度是最大的。为什么这笔账和 Sonnet 5.5 直接相关?因为订阅用户的额度和模型选择是绑定的:你让 Sonnet 5.5 少思考、少绕路、一次合并多个工具调用,省下来的每一轮,都是你 5 小时窗口里的额度。 早期测试者的反馈里就提到,Sonnet 5.5 更常把多个工具调用合并处理,步骤更少——这对 API 用户是省钱,对订阅用户就是省命。知乎知乎

当然,也别指望一步登天。小红书这周还有帖子在讨论"额度到顶怎么收尾"“京东内部也开始限额”,额度焦虑不会因为这个版本直接消失,只是缓解。
谁该换、谁该等:四类人四条路线
路线一:Claude Code 重度用户(每天都在烧额度)——直接换,今天就换。
Sonnet 5.5 在 Claude Code 里已经可用。你的负载以修 bug、补测试、写文档这类边界清晰的任务为主,正是它的主场。注意一个迁移细节:如果你之前关掉了 Sonnet 的思考模式,切到 5.5 要改用新的 between_tools 设置,否则默认行为变了,日志、成本、延迟都会跟着变。知乎
路线二:API 开发者——先看缓存命中率,再决定迁移节奏。
缓存读取价没降($0.20),你的负载缓存占比越高,迁移收益越小。先拿一周的真实账单跑个对照:同样任务分别走 Sonnet 5.5 和 Opus 5.5,看实际差价再切流量。另外,网络安全类任务现在会被自动分流到 Opus 4.8 执行,做安全研究的注意这是行为变化。知乎
路线三:20 美元档观望党(在 ChatGPT Plus 和 Claude Pro 之间摇摆)——这是你入场时机里比较好的一个。
模型加量不加价、限额上调、触顶优雅收尾,三件事同周发生。但要认清一个现实:国内用户注册需要境外手机号和网络环境,小红书这周还有"Claude Code 活动封号,好一招钓鱼执法"的吐槽帖。账号风险是真实成本,算进决策里。
路线四:普通办公用户(写文档、做 PPT 为主)——可以等几周。
官方明确 Haiku 5.5 还在路上,会继续覆盖大批量、成本敏感场景。三档产品线齐了之后再整体评估,你的用量大概率撑不满 Opus 档,等一等性价比更高。知乎
接下来盯什么
Haiku 5.5 什么时候落地:三档齐了,订阅内的模型路由才算完整,届时值得重算一遍额度账。
OpenAI 的回应:B站评论区已经在刷"OpenAI 不拿出来点东西真的就 gg 了",还有人说"Codex 额度好像砍了,特别不耐用"。GPT-6 Sol 刚发布就被 Sonnet 5.5 在多项基准上压制,接下来一两周大概率有动作。哔哩哔哩
优雅收尾的实际额度消耗:新规说收尾额度从每周限额里划,具体划多少、Pro 每周一次够不够用,要等一两周真实用户的账单反馈。
你自己的账单:别信任何人的结论,包括这篇。拿你最高频的三类任务,分别用 Sonnet 5.5 和 Opus 5.5 各跑一遍,对比实际消耗和交付质量——这是唯一可靠的选型依据。
最后说句公道话:这轮发布最值得记住的不是 70.6% 这个数字,而是行业惯例被打破的那一下——过去两年"新模型更强也更贵",9 月下旬开始,"更强"和"更便宜"第一次同时出现。之前按"能力够用就锁死旧模型"做的所有成本规划,都值得重算一遍。