Claude把单价砍了两成,你的任务账单反涨21%
输入从每百万 token 5 美元降到 4 美元,输出从 25 降到 20,缓存读取从 0.50 砍到 0.20。同一周,单任务成本从 10.79 美元涨到 13.04 美元,涨了两成。
Anthropic 9 月 22 日发布 Claude Opus 5.5。价格表上每一行都往下走。输入从每百万 token 5 美元降到 4 美元,输出从 25 美元降到 20 美元,各降两成。缓存读取降得更狠,从 0.50 美元掉到 0.20 美元。
按这张表算,同样多的 token,账单该变小。
同一周,Artificial Analysis 放出 Coding Agent Index 的测评结果。Opus 5.5 在 Claude Code 满负荷下拿到 66 分,排第一。Opus 5 是 60 分,Claude Fable 5.1 是 62 分。分数旁边跟着另一个数字,单任务成本 13.04 美元。Opus 5 是 10.79 美元。
涨了 21%。价格表在降,账单在涨,两件事同时为真,得先把 token 用量拆开看。
降价的是单价,变长的是任务
原因就摆在用量那一栏。
一个测评任务,Opus 5.5 平均要用掉约 1560 万 token。Opus 5 是 1140 万,多用三成多。缓存读取从 1090 万涨到 1460 万,涨得还算温和。
变贵的那一栏是输出。Opus 5.5 每个任务输出约 33.3 万 token。Opus 5 是 13.7 万,多了 1.4 倍。
我算了一遍输出这一项,33.3 万 token 按每百万 20 美元算,差不多 6.66 美元。这一项占掉整个 13.04 美元的一半。用量翻倍的那一栏,正好是价目表里最贵的那一栏。
缓存读取反过来。1460 万 token 按 0.20 美元算,总共不到 3 美元。量大价低,砍六成也没多少肉。

单价的降幅是真的,缓存的折扣也是真的。在一个跑满的智能体循环里,它们被一个想得更久、写得更多的模型吃掉了。
还有一笔账不在报价单上。Opus 5.5 把自适应思考改成了强制开启。开发者不能再关掉推理,只能用一个 effort 参数调深浅。旧接口也弃用了一批,包括原来那套计算机操作接口。已经跑通的工作流得改代码,还要更新测试用例。这部分是人力,价目表里查不到。它先于省下的那点 token 钱到账。
同一天还有一件事。OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,输入输出定在每百万 2 美元和 10 美元、0.10 美元和 0.50 美元。比它们替换掉的 GPT-5.6 便宜一半左右。两家实验室九十分钟内先后出手,比的从聪明程度换成了同一件活的报价。
这笔账我打算一直记下去。模型每季度换一代,计价口径跟着换一次。关注一下,下次出新的报价单你直接看我的算法。
同一份答卷,两个都对的答案
几天前,Artificial Analysis 给过 Opus 5.5 另一个数字,单任务成本 5.98 美元。Opus 5 是 5.86 美元,几乎持平。那次测的是 Intelligence Index,一问一答,输出 token 约 11.9 万。
两个数字都不假。差在任务有多长。
短对话里,降价和多用 token 正好抵消。智能体任务里,一个任务变成一长串工具调用。上下文一直往里堆,堆进的全是输出那一栏。输出最贵,任务越长,抵消越差。
这解释了一件很实际的事。照着一问一答的榜单做估算,会严重低估智能体的账单。买模型的人和管预算的人看的是同一张价目表,得出的数字能差一倍。

按那个测评的算法,一个团队每天跑 500 个满负荷任务,两个单价的差是每天 1125 美元,一个月约 3.4 万美元。任务数没变,钱多掏了。
这笔钱往哪儿去,也值得看清楚。价目表写的是厂商对厂商的报价,落到个人头上还隔着好几层。用 Opus 跑编程的 IDE 和智能体工具会把成本转给订阅用户。你用 Cursor 也好,用 Claude Code 也好,账单最后落在每月扣款那个数字上,只是换了个名字出现。夹在中间的是做工具的人,他们得决定自己扛还是往下传,多数会往下传。
受影响最大的是把 AI 编程当日常工具的人。他们每月的支出里,AI 订阅只占一小块,这一块却在悄悄长大,而工资不会跟着涨。这类支出最麻烦的地方是它没有固定金额。房租水电都有数,这个月多花的钱花在了哪一步,用户自己也说不清。
得分涨得最猛的几项都在编程上。Terminal-Bench 4.0 从 54.5% 升到 63.1%,一次涨 8.6 个百分点。DeepSWE v1.1 从 62.5% 到 68.4%。SWE-Atlas-QnA 从 62.1% 到 66.4%。GitHub 的首席产品官 Mario Rodriguez 说,Opus 5.5 在 GitHub 那边跑的测试里,token 和步骤都算少的。在 VS Code 里,它解掉的终端任务比 Opus 5 多,用的步骤不到一半。
厂商自己的口径也不一样。Anthropic 在发布材料里写,默认设置下典型工作负载成本降约 40%。依据是它压缩了往返轮次和重复的上下文。这个说法成立,前提是活够长、上下文能反复复用。活短、每单都要重新喂的,省下的钱落在别处。
零售行业换计价口径这件事我见过好几轮。最早按单收费,后来按人天,再后来按工时。每次换口径,客户都说新算法更透明。然后第一份账单出来,总额涨了。原因都差不多,新口径把原来打包送掉的东西单独计了价。AI 模型从每百万 token 换成每个任务,走的是同一条路。做报价那些年我学会的第一件事,是先问清楚对方按哪个口径报。差一个口径,同一件活的价钱能差出三成。
我给自己的做法很简单。每天的任务按长度分两档,长的留在满负荷设置上,短的改走便宜档。先跑一遍,看账单掉不掉。另外把每个任务的输出 token 单独记一行。这项涨了,说明模型在我不知道的地方写多了。
我押的是这一条。未来一年,AI 编程的报价单会越来越便宜,账单会越来越贵。单价可以打折,任务长度不行。决定你每月付多少钱的,已经从每百万 token 挪到了每个任务。
