8 月 30 日,OpenAI Codex 的工程负责人 Tibo(国内社区叫他"赛博义父")发了一条在订阅制产品里近乎道歉的公告:团队逐条排查了数千份用户报告,修了 8 类会"额外消耗额度"的问题,同时给所有 Codex 和 ChatGPT Work 付费用户重置使用额度,官方口径是"按使用方式不同,同等额度预计可多支撑 10%~50%"。知乎
付费用户先品一下这句话:你上周觉得自己"用光"的额度,可能有一部分根本不是你用掉的。
我把这次事件、OpenAI 官方计费口径、知乎社区的实测和这轮国产 Flash 模型的定价放一起核了一遍,把这几天社区里吵个不停的"额度去哪了"算成四笔账。如果你正在给 Codex、Claude Code 或国产编程 Plan 交月费,升级套餐之前先把这四笔账看完。
第一笔账:你的额度有一部分被"看不见的进程"吃掉了
OpenAI 自己披露的数字比大多数人猜的狠:个别异常的 /goal 自主任务,一次就烧掉用户一周额度的 15%~70%;旧版 Computer History 在部分场景每周最多吃掉约五分之一的额度;一个后台记忆进程因为停止条件永远无法满足,跑了 15000 次。知乎
OpenAI 官方帮助文档同时说清了一件事:额度不看你发了几条消息,看的是 token 量、模型选择、任务/上下文规模、本地还是云端执行、Fast mode、上下文压缩、工具调用,以及 reviews、automations、subagents、terminals、memories 这五类后台任务。知乎 有 Pro 用户翻本地日志,发现自动评审任务约占其记录用量的 75%——个案不能直接推成普遍结论,但方向和官方修的 Bug 完全一致:消耗发生在你看不见的地方。
8 个 Bug 归成四类就是四种"隐形账单":上下文重复编码(同一份信息被反复压缩、总结、计费)、后台任务缺硬终止、自主循环没有预算熔断(检查发生在钱花出去之后)、子 Agent 悄悄升级更贵的模型。记住这四类,下次再遇到"烧得不对劲",你知道往哪儿查。

第二笔账:就算没有 Bug,Agent 这个用法本身就贵
知乎上有个具体的个人观察:长会话里,光读写缓存一小时就能膨胀到 30~50 万 token——而这段时间你可能只改了一行代码。知乎 机制像一块白板:说过的话全留在板上,AI 每答一轮要把整块板重读一遍。知乎聊得越久,每句话越贵;到了 Agent 模式,一个任务要几十次模型调用闭环,贵的地方还会乘以几十。所以省钱的第一个动作不是"少问",而是别一个窗口从早用到晚:换窗之前,让 AI 把当前会话的目标、已定决策、下一步和约束压成一段交接说明,贴进新窗口接着干;长期项目的记忆从对话里搬进文件,开工先读、收工更新。规则文件(比如 CLAUDE.md)同理——它常驻、每一轮都被完整重读并重新计费,写得越厚,你问一句"改个错别字"都在先啃一遍整本书。

再补两刀:需求一次说全,挤牙膏式改五轮,等于让白板被完整重读五遍;明确告诉它"只给结论、200 字以内"——AI 写出来的字也计费,而且通常比你输入的还贵。
第三笔账:所有活都丢给旗舰档,本身就是最大浪费
先看一个大盘数字:OpenRouter 周 Token 消耗量到 8 月 30 日已冲到 113 万亿,环比涨 21%。知乎 全世界都在用 Agent 烧 token,价格自然卷出分层——7 到 9 月,DeepSeek、智谱、阿里、腾讯集体转身押注 Flash 档:Agent 闭环需要几十次模型循环调用,而意图路由、信息抽取、工具调用这些活,根本用不上旗舰的深度推理,成本却按几十倍翻。
现在的价格带(按百万 token):GLM-5.3-Flash 和 Qwen3.8-Flash 输入约 0.8 元、输出约 2.7~2.8 元;智谱有限时 5 折,9 月 9 日截止,折后输入 0.4 元。36氪 DeepSeek V4 Flash 坚持峰谷价:高峰输入 3.0 元、输出 9.0 元,闲时减半。上下文缓存命中还能再砍:Qwen 输入低至 0.1 元,DeepSeek 闲时低至 0.05 元。第三方 ArtificialAnalysis 智能指数上,GLM-5.3-Flash 拿到 57 分、DeepSeek V4 Flash 50 分——"轻量等于不能用"这个旧印象,今年已经站不住了。
实操上就是把活分档:搜文件、整理日志、格式转换、批量改错这类体力活,交给便宜档;真正要架构决策的那一步再请旗舰。这几天流传的开源思路也是这个逻辑——让本地 Agent 干体力活,复杂推理交给强档处理。知乎

用 Claude 的,把 Haiku/Sonnet/Opus 按任务切档、简单问题调低"思考力度",是同一件事。
第四笔账:买套餐之前,先搞清你按什么口径被计量
AI 编程订阅已经分裂成三类 Plan:Coding Plan(编程套餐)、Token Plan(按量)、Agent Plan(智能体套餐,按 AFP"燃料值"折算)。知乎最坑的不是价格,是计量口径互不相通:次数、积分、Credits、AFP、token 五种单位混用;重置窗口也不一样——有 7 天一刷、每天一刷,也有从你第一句话开始计时的 5 小时滚动窗口。智谱 8 月刚涨过价,OpenAI 这周也被社区发现政策更新:Codex 的邀请额度重置卡下线,改成了积分奖励。知乎
所以下单前至少核对三件事:条款是否禁止跑第三方 Agent(部分 Coding Plan 明确禁止);"不够用"之后按什么规则恢复;把套餐折算成每百万 token 单价,对照上面 Flash 价格带,你就知道所谓"划算"是多少。
现在动手:四步自查,外加盯住三个信号
打开官方用量面板或导出本地日志,按"哪个任务在花钱"看结构,而不是按消息数看总量;
强制换窗:会话超过几十轮就打包交接、开新窗口,把长期记忆落成文件;
找一天,把体力活全部降级到便宜档试跑,体感一下哪些活根本不需要旗舰;
按自己的日均消耗选 Plan 档位,别按焦虑充值。
三个继续观察的信号:OpenAI 承诺的"在应用里更直观展示额度去向"有没有上线——这比这次重置额度更有实质意义;你订阅的 Codex/Claude 这个月的额度重置政策有没有悄悄变化;以及 9 月 9 日智谱 5 折到期前后,Flash 价格战会不会再掀一轮降价。知乎
OpenAI 用真金白银的额度重置,替所有 Agent 用户交了一次学费。四笔账算下来你会发现:省额度这件事,习惯占一半,选型占另一半——剩下的那一小块,才轮到怪厂商的 Bug。