最近用 Claude Code 或者 Codex 写东西的朋友,大概都有同一种体感:明明模型单价一降再降,自己的额度却越来越不经用,五小时限额说撞就撞,周额度到周三就见底。你以为是自己的错觉,但这周密集出来的一批报道和数据说明——不是错觉,而且不止你一个人这样,连微软、Meta、Uber 这种巨头都在同一道题上翻了车。
这周最值得看的一条行业线索,就是"Token 越便宜,账单越贵"这个悖论。它同时解释了为什么你的订阅越来越不够用、为什么大厂集体开始砍 AI 预算、以及为什么创业公司正在批量投奔中国开源模型。三件事看似无关,其实是同一本账。
先说机制:单价在跌,消耗涨得更快
Token 单价确实在降,大约每十八个月降一个数量级。但另一头,单次任务吃掉的 token 涨得比降价更快。原因不难理解:现在的 AI 编程工具都是智能体模式,你说一句"把标题改短一点",它发出去的不是这一句话,而是把从开工到现在的完整会话记录打包带上——读过的文件、改过的代码、来回说过的每句话,一次工具调用就是将近百万 token 的缓存重读。缓存价便宜,但照样算进你的额度。活越复杂、调用链越长,账单膨胀越快。36氪

所以"模型越便宜、账单越贵"不是段子,是结构性的。就拿 Anthropic 自家最便宜的模型算一笔账:同样一百万次调用,上一代 Haiku 4.5 的账单是一万零五百美元,新一代 Haiku 5.5 直接降到一千零五十美元,再叠上缓存,只要五百二十美元——单价这一头确实在跳水。跳水的是单价,膨胀的是用量,两股力量在你我的账单上对冲。硅谷年初还流行一个词叫 TokenMaxxing——谁烧的 token 多谁生产力高,半年后没人再提了,因为账单到期了。知乎
巨头们的账本:一个比一个难看
最刺眼的案例来自 Uber。据外媒报道,Uber 五千人的工程团队铺开 Claude Code 之后,渗透率几个月内从 32% 冲到 84%,单个工程师每月 token 开销 500 到 2000 美元,2026 全年的 AI 编程预算不到四个月就烧光了。CTO 今年 4 月公开承认"措手不及"。有个更极端的例子:智能体框架 OpenClaw 一个实例自主跑一天,能消耗一千到五千美元的 API 成本,而用户付的只是每月两百美元的 Claude Max 套餐——到四月初,跑在外面的 OpenClaw 实例超过 13.5 万个。Anthropic 随后要求这类第三方框架单独计费,部分用户的支出直接涨了十倍甚至几十倍。十六天后,GitHub 停掉了 Copilot Pro 和 Pro+ 的新注册,理由同样直白:智能体工作流消耗的算力经常超过用户一个月付的钱。36氪
买得最多的两家,这周自己也收手了。据 The Information 报道和多方证实,微软把内部员工的 AI 月度额度从最高 10 万美元压到 1 万美元左右,六万多人的云与 AI 部门先落地;内部用 Anthropic 技术的年化支出原本预计至少 10 亿美元,现在被砍掉三分之一还多,工程师被要求转向自研的 MAI-Code-1-Flash 和自家 Copilot。Meta 更直接:内部用 Claude Code 的人从年初的六万掉到三万,正好一半——今年 6 月他们就给各组织上了预算和 token 上限,最高峰时 Meta 员工三十天烧掉 60.2 万亿 token,最近 28 天在 Claude Code 上花掉超过 1.05 亿美元。Meta 收紧还有另一层考虑:如果员工用 Claude 写的代码进了自家训练数据,等于帮竞品做了模型蒸馏。知乎
有个细节容易被标题党带偏:微软砍的只是内部自用那部分,给 Copilot 客户功能调用 Anthropic 模型的年支出至少 20 亿美元,规模还在涨。Anthropic 的年化收入也从年初约 90 亿美元涨到了 650 亿。所以这不是"AI 编程不行了"的故事,而是"按人头卖许可、按用量付账单"这套错位模式撑不住了的故事。知乎
美国企业 AI 预算,正在裂成三层
把上面的案例摆到一起,新浪科技这周的梳理给出了一个清晰的三层结构:
第一层,有能力自造模型的巨头:微软、Meta 自建替代品,省钱和推自家产品一步完成。第二层,Uber 这样的中型公司:账单和巨头一个量级,手里却没有自己的前沿模型,只能砍座席、降档用便宜模型、或者把预算滑到下一财年——Gartner 预计 2026 年 AI 预算里有 25% 会"滑档"到 2027 年,主要就是这一层贡献的。第三层,创业公司和小团队:没有合规包袱也没有自研能力,决策变量只剩性价比,于是批量投奔中国开源模型。36氪
第三层的数据最扎眼。模型路由平台 OpenRouter 上,中国模型的周度份额峰值已经到 46.4%,超过美国模型的 35.7%;单一供应商里 DeepSeek 以 17.6% 居首,每周约 5.13 万亿 token,通义千问 13.9%。价差几乎解释了一切:DeepSeek V4 Flash 每百万输入 token 收 0.14 美元,GPT-5.5 收 5 美元,整体价差 4 倍到 100 倍。连 Airbnb 都在客服场景选了通义千问而不是 ChatGPT。36氪

需要说清一个边界:46.4% 不等于中国模型拿下了美国企业市场的一半。OpenRouter 的用户结构天然偏向开发者和中小团队,直接跟 Anthropic、OpenAI 签企业合同的大客户流量不在这个池子里。中国模型占领的是美国创业公司市场——但对美国前沿实验室来说这更要命,因为今天用 DeepSeek 起步的创业公司,三年后长大了很可能不会回头。
OpenAI 的应对是连降两轮价:7 月底 GPT-5.6 Luna 直降 80%,9 月 22 日 GPT-6 Sol 降到每百万 token 输入 2 美元、输出 10 美元,正好是九十分钟前上线的 Claude Opus 5.5 定价的一半,Luna 更是降到 0.10/0.50 美元,并明确说这是永久价不是促销。还有一个值得玩味的信号:OpenAI 现在开始强调"每美元智能"这个指标——在 0.14 美元对 5 美元的量级差距面前,正面比价已经没法比了,只能比性能。36氪
回到你自己:三本账怎么算
看完全行业,回到个人订阅用户身上。你其实就是一个"微型 Uber"——工具按人头卖给你,账单按用量走,没人帮你踩刹车。这周社区里恰好有一套被验证过的省钱办法,值得抄作业:
一是消耗账:把自动压缩阈值改小。百万上下文模型默认要等会话涨到约 96.7 万 token 才自动压缩一次,意味着在那之前每条消息都背着整段对话。开发者 rohit 用自己 7 天的会话记录做了回放测算:把阈值设到 40 万 token,周额度能省 29%;设 30 万省 36%,但压缩次数从 82 次涨到 126 次,再往下就不划算了。操作就一行命令:在 Claude Code 里输入 /autocompact 400k。Anthropic 做 Claude Code 的 Lydia Hallie 也出来确认过这个机制。注意两件事:如果你之前设置过 CLAUDE_CODE_DISABLE_1M_CONTEXT 变量,现在应该删掉,不然阈值设了也白设;真正要紧的规矩写进 CLAUDE.md 最稳,它在压缩后会重新加载,聊天里交代的迟早被压成一句话。知乎

二是额度账:养成三个习惯。一件事做完、开始下一件之前手动敲 /compact,还可以跟一句"重点保留某某修复过程",让摘要按你的意思留;换不相干的新活直接 /clear,不花额度;如果你在用刚对 Pro/Max 全量放开的 Projects 云端线程,格外小心——每个线程都是完整会话,跟你本地共用一份额度,默认还全用 Opus 高强度模式,撞到上限不会停,挂着等额度重置接着跑。管得住的办法是:给线程换小模型、调低 effort、少开线程数,闲置超过一小时的旧线程别再派新活(缓存过期后它要把整段历史重读一遍)。知乎
三是价差账:要不要投奔国产模型。知乎上已经跑通的主流策略是"国产 Coding Plan 打底,难啃的再找海外模型"——日常写代码、生成脚本用 DeepSeek、通义、Kimi 的编程套餐,成本和额度压力立刻降一个量级;碰到真正复杂的架构活再切回 Claude 或 GPT。Claude Code 本身支持改 API 配置接国产模型,工作流一行不用改。但对个人用户也要泼一句冷水:国产模型在长上下文稳定性、工具调用兼容性上和海外旗舰仍有差距,切换前先用小额套餐试一周,别一步到位年付。

接下来值得盯的信号
这轮账单危机还远没结束,三个信号可以继续追:OpenAI 降价之后 Anthropic 会不会跟进旗舰模型调价——Haiku 5.5 已经降到 0.10/0.50 美元,和 GPT-6 Luna 完全同价。美国政府对开源权重模型的态度会不会明朗——7 月那封公开信上英伟达、微软、Meta、IBM、戴尔都签了名,Anthropic 没签,规则落地之日,就是中型企业敢不敢换中国模型之时;以及你自己下个月的账单——毕竟它每个月都来一次,单价好商量,难的是消耗的节奏没人管。知乎
