英文区的 Codex 用户快把 OpenAI 的评论区冲爆了。这几天不少人发现,ChatGPT Codex 的额度消耗突然变得不对劲——以前一周能用满的量,现在一两天就见底,而且是在只用官方客户端的情况下。微博质疑很集中:官方是不是偷偷砍额度了?
OpenAI 负责 Codex 的 Tibo 发帖回应:我们没有悄悄改额度,很多反馈额度不对劲的人,其实在用 sub2api 这种共享接口工具。微博评论区并不买账,大量用户说自己根本没碰过这类工具,正经用官方应用额度照样缩水。社区目前的猜测指向两个方向:新模型本身更吃资源,或者后台统计有 bug。截至发稿,官方没有给出进一步定论。其实早在 6 月底,Tibo 就公开承认过,Codex 的用量「被消耗得比预期快」,当时给出的原因,就是后台机制在偷偷多烧 Token:自动审查更勤了、子代理被多叫了几次、后台建议还能重复跑。知乎
国内用户同样在肉疼。今天微博上有人吐槽,codex 做个 ppt 用掉 20 额度,肉疼。微博这场风波戳中的,正是多智能体时代最现实的问题:工作方式变了,计费方式没变。多个 Agent 并行干活,AI 自己读代码、跑测试、修 bug,每一步都在消耗 Token,额度是线性烧的。
多智能体为什么特别烧钱
Anthropic 8 月 14 日的官方博客给了一个很清晰的公式:一次会话的成本,约等于进入上下文的 Token 数量、乘以它停留的轮数、再乘以同时运行的上下文个数。知乎
第一个变量最直观。Agent 完成一次任务,通常不是一次模型调用:它先读文件,再改代码,再跑测试,文件内容和命令输出不断累积进对话,之后每一次请求都要带着这堆「行李」重新发送。一个稍微复杂的任务,几百轮就出去了。36氪这也是 Codex 这次风波的底层背景——Agent 时代消耗的不再是提问次数,而是工作量。

第二个变量容易被忽视。一个已经没用的文件,不会因为命中了 prompt cache 就从上下文里消失,它照样占着窗口,照样在后续每一轮里被携带。知乎
第三个变量是多智能体特有的。并行开的 Agent 越多,上下文就越多。今年 2 月 OpenAI 发布 Codex 桌面版时,核心卖点就是多智能体并行——Agent A 在重构数据库,Agent B 同时写单元测试。有用户实测同时跑 3 到 5 个 Agent 很爽,但另一面是设备风扇狂转、额度狂烧。社区还发现,Codex 面对超大上下文时偶尔会陷入「自循环」:反复读文件、定计划、再推翻,白白消耗 Token。36氪
OpenAI 的答案:只把最强模型用在 20% 的步骤上
8 月 16 日到 17 日,OpenAI 全量上线了 GPT-5.6 的「多智能体 v2」。核心变化是:主 Agent 可以把不同子任务自动委派给不同模型,每个子 Agent 还能单独设置推理强度。现在 Codex 手里的牌很清晰:GPT-5.6 Sol 负责最复杂的 Agentic 编码,Terra 是日常编程主力,Luna 最快也最便宜,另有网络安全专用的 Daybreak 和通用兜底的 GPT-5.5。

官方给出的逻辑是一句话:复杂任务里只有 20% 的步骤真正需要最强模型,其余都可以交给便宜模型。36氪OpenAI 总裁 Greg Brockman 说得更直接,这是在「朝着告别手动选模型的方向前进」。
不过这事有坑。三周前,Codex 的模型清单里 Sol 和 Terra 被标成了 multi_agent_v2,最便宜的 Luna 却还标着 v1,结果主 Agent 想派活给 Luna,系统直接回一句「未知模型」。开发者在 GitHub 上开了多个 issue,OpenAI 官方论坛还有帖子标题就叫「把 Luna 还给我们」,说之前靠钩子强行用 Luna 效果惊人,现在这条路被堵死了。36氪这个插曲提醒一件事:分级调度确实省钱,但调度策略掌握在平台手里,规则一变,用户的工作流就要跟着抖。
Token 正在变成一种场内交易的商品
个人在为额度焦虑,资本在用更大的数字看这门生意。就在 8 月 19 日,做支付聚合的 Stripe 花超过 70 亿美元,收购了模型聚合平台 OpenRouter——而今年 5 月,OpenRouter 的估值还只有 13 亿美元。知乎
OpenRouter 做的,说白了是一个 Token 交易市场。它自己不部署模型,而是把模型原厂、云厂商和第三方 Token 服务商聚合到一个平台上。截至今年 5 月,平台接入的模型超过 400 款,每周处理的 Token 量从半年前的 5 万亿涨到 25 万亿。
关键在于,同一个模型,不同服务商手里的价格、延迟、稳定性完全不同。像 MiniMax M3 这样的模型,平台上有包括官方在内的多家服务商在卖,有的价格比原厂还低;你还能对比各家最近 3 天的正常运行时间,挑更稳的那家。会选渠道,本身就是一种省钱手段。知乎

那为什么不直接找原厂买?因为当企业把模型接进客服、Agent 或内部系统,几百个请求同时进来,官方的速率限制就会亮红灯,高峰期算力紧张时,原厂优先保的是自家核心业务和大客户。中间商卖的,其实是「让模型能力稳定进入生产环境」。国内这门生意同样热闹:有硅基流动这类自己租算力部署开源模型的,也有清程极智 AI Ping 这类做聚合的,火山方舟、阿里云百炼、百度千帆这些大厂的 MaaS 平台也在跑。

但生意并不好做。硅基流动的上市申请书显示,其 2025 年公有云服务毛利率为 -119%。知乎一年发出的免费 Token 代金券就有 5421 万元,几乎赶上全年收入。Token 正在高度同质化,最后拼的是高并发扛不扛得住,以及有没有智能体编排、成本管理这些配套工具。
现在就能做的五件事
不管额度风波最后等来的是官方解释还是补偿,成本主动权有一部分始终在自己手里。几个机制明确、可以马上做的动作:
无关任务拆会话。Anthropic 官方的建议是:切换到无关任务用 /clear,从空上下文开始;同一任务进入新阶段用 /compact,把历史换成摘要。知乎官方文章里有个对照:同样是修复测试,先搜仓库、多读文件的会话,Token 消耗明显高于直接定位目标文件的那次。
控制进入上下文的东西。知道要改哪个文件,就用 @ 直接引用,省掉搜索和读取的步骤;给测试命令加 quiet 参数。命令输出超过约 30000 字符会被存进文件只留预览,但阈值以内的几百行输出仍会完整进入上下文,并在后续轮次里一直留着。
别打断 prompt cache。请求前缀一致时,已计算过的部分可以复用。注意缓存有效期:Claude 订阅默认一小时,API 直连默认只有五分钟,两次请求间隔超了,就要按全价重新预填充。
把搜代码、查日志这类脏活交给子 Agent。中间材料在独立上下文里消化,主会话只接收最终结果。这是多智能体架构里最正统的省钱路径。
手动给任务分级。在智能调度全面铺开之前,把架构决策、复杂重构这些「关键的 20%」留给最强模型,跑测试、格式化、搜索、总结这类步骤交给便宜档位。36氪
值得继续盯的信号有三个:OpenAI 会不会对额度统计给出定论;多智能体 v2 的委派名单会不会向第三方模型开放;以及 Stripe 收购之后,OpenRouter 的中立定位和各家 Token 价格会不会生变。多智能体架构的下半场,拼的已经不是能不能跑,而是跑不跑得起。