这两天 OpenAI 的更新有点密,密到很多人还没反应过来,自己的 Codex 额度消耗方式已经变了。
先把时间线捋一下,这周三件事:
第一件,8月16日,Codex 负责人 Tibo 亲自在 X 上给出三行配置,让 GPT-5.6 Sol 在 Codex 里解锁完整的 100 万 token 上下文——此前这个数字被锁在 272K,用户想改都改不了。帖子发出后 300 多万人围观。量子位但注意他的原话后半句:长上下文虽好,勿贪杯。微博
第二件,几乎同一时间,OpenAI 工程师 Eric Provencher 宣布 Multi-Agent V2 全量上线:主 Agent 可以把子任务自动委派给不同的模型,每个子 Agent 还能单独设推理强度。36氪OpenAI 总裁 Greg Brockman 的说法是"朝着告别手动选模型的方向前进"。
第三件,ChatGPT 前端做了一次大换血。官方内部拿一个聊了 741 轮、体积 231MB 的"怪物级"对话做测试:打开时间从 27.62 秒降到 1.66 秒,应用加载提速 94%,打开一次对话要发的网络请求从 894 次砍到 16 次。36氪

单看每一条,都是好消息。但把它们放在一起,再对照社区这两天的真实反馈,你会发现这次更新最值得聊的不是"OpenAI 又送福利了",而是一个更实际的问题:哪些变化是真省钱,哪些变化会悄悄烧穿你的额度。
先说争议最大的 1M 上下文。
很多人第一反应是:上下文从 272K 放开到 1M,白送的容量,不开白不开。但社区里最先劝退大家的,恰恰是重度用户自己。

机制上有两个坑。第一个坑是计费倍率:Codex 的长上下文计费是分段加权的,超过 272K 这条线之后,token 消耗按 2 倍计算。第二个坑更隐蔽:Codex 默认在 250K 左右自动压缩历史,这本来是个省额度的设计;你把上下文开到 1M,等于把这个自动压缩的保险丝也一起拔了,长线程会一路滑进高计费区间。
有用户在知乎算过一笔具体的账:同样一轮对话,默认配置下发送 100K token、按 1 倍计,就是 100K 加权消耗;开了 1M 之后,上下文堆到 400K、按 2 倍计,一轮就是 800K——不是翻倍,是 8 倍。知乎
这还不是全部。一份被国内 AI 日报引用的评测数据显示,GPT-5.6 Sol 在 256K—512K 区间的准确率还有 91.5%,到 512K—1M 区间掉到 73% 左右。微博知乎上有重度用户的体感更直接:GPT-5.6 系列上下文超过 300K 就"开始流口水",注意力集中不了,需要反复干预引导,“原始的 272K 设置非常甜点”。知乎
所以结论可能和直觉相反:对绝大多数任务,1M 上下文除了更贵,没有好处。它真正适合的场景很窄——一次性要塞进超大代码库或超长文档、而且你明确知道自己在做什么的重度任务。日常写代码、跑测试、改 bug,272K 的默认值反而是成本和效果的最佳平衡点。Tibo 自己都提醒"勿贪杯",这种官方人员主动劝退的场面,不多见。
再说 Multi-Agent V2。
这次变化的核心是:你不用再手动纠结"这个任务该用 Sol 还是 Luna"了。主 Agent 会自己拆任务、分派给不同模型——复杂推理给最强的 GPT-5.6 Sol,日常编程给 Terra,轻活快活给最便宜的 Luna,每个子 Agent 的推理强度还能单独调。

OpenAI 敢这么做的底气,来自 GPT-5.6 这一代的性价比结构确实变了。官方工程指南里有个很扎眼的数字:在 BrowseComp 搜索基准上,轻量模型 Luna 拿到 84.04% 的成绩,几乎追平上一代旗舰 GPT-5.5 的 84.36%,但单次任务成本从 33.27 美元降到 1.33 美元,降了 96%。知乎另一份文档理解场景的案例里,Luna 用大约十八分之一的成本保留了 GPT-5.5 约 98% 的信息提取准确率。
翻译成人话:过去"任务越复杂越要上最强模型"的经验,在这一代开始失效了。官方自己的最佳实践都在强调——别默认用最强模型,让轻量模型多干活。对按量付费的 API 用户,这是实打实的降本。
但对 Codex 订阅用户,这里藏着一个反直觉的地方:Multi-Agent 是并行跑子任务的。理论上每个子任务分给了更便宜的模型,单位成本降了;可一旦几个子 Agent 同时开工,各自的上下文都在独立累积,你的总额度消耗速度未必变慢,反而可能变快。微博上这两天"codex 额度干完了""额度像流水"的吐槽密度明显变高,虽然不能全归因于这次更新,但如果你打算把多 Agent 并行用起来,对额度的盯防要比以前更紧。微博
另外补一个背景:V2 上线前还出过一段插曲。三周前 Codex 的模型清单里,Sol 和 Terra 被标成了 V2,最便宜的 Luna 却还标在 V1,导致主 Agent 想派活给 Luna 直接报"未知模型",GitHub 上为此开了至少两个 issue,官方论坛还有帖子喊"把 Luna 还给我们"——有人靠钩子强行绕过限制用 Luna,效果不错,后来这条路被堵死。36氪这次全量上线算是把这个坑填上了,Luna 重新回到了可被委派的位置。
第三件事,ChatGPT 前端提速,反而是三件事里最没争议、纯赚的一件。
以前长对话越聊越卡,是 Agent 时代的通病:一个复杂任务让它读代码、跑测试、改完再验一遍,几百轮就出去了,网页越来越沉。这次 OpenAI 的思路是不再在你打开对话时加载全部历史,只加载当下需要的那一小部分——741 轮的怪物对话 1.66 秒打开,内存占用砍掉四成。如果你的 ChatGPT 里躺着几个聊了几个月的超长会话,这几天应该能明显感觉到变轻快了。

最后,把这轮更新落到具体的人头上:
如果你是 ChatGPT Plus 用户(每月 20 美元那档):1M 上下文建议默认不开,272K 足够;Multi-Agent V2 可以放心用,但并行任务从两三个开始,别一上来开一堆子 Agent;顺手检查一下自己的使用习惯——社区里流传一个省钱思路,Pro 用户可以通过 MCP 调用高速版模型 codex-spark,那条额度是独立的,不占通用 Codex 额度。微博
如果你是 Pro 用户、经常跑长任务:1M 只在你明确需要一次塞进超大上下文的任务前临时开,用完改回去;把 model_auto_compact_token_limit 这类参数盯紧,别让长线程裸奔进高计费区间。
如果你还在观望、考虑要不要订阅:可以先用免费版 ChatGPT 里已经放开的 Luna 试试水。它现在免费,但社区反馈免费版能力相比此前有缩水,体验打折。知乎真要当生产力用,Plus 的 Codex 额度在 5 小时窗口内允许的消息量,按用户对比大约是 Claude Pro 同价位的 3 到 5 倍,对"主要拿来写代码"的人性价比是站得住的。知乎国内开通注意两点:官方网页订阅就是 20 美元/月,第三方代充普遍在 160—180 元,明显低于这个价位的渠道要警惕;不要把账号密码和验证码交给任何陌生人。知乎
往后看,还有两个信号值得盯:一是 Tibo 顺手爆料的下一代模型 Astra(坊间叫它 GPT-6),已经出现在 Codex 的产品清单预告里。知乎二是社区里流传的"额度重置规则要调整"的说法,目前只是传闻,但每次 Codex 有大更新,计费口径往往是跟着变的——这两件事一旦落地,今天这份省钱攻略还得再校准。
一句话总结这轮更新:1M 上下文是给少数人的工具,不是给所有人的福利;Multi-Agent V2 是真的在替你省"选模型"的心,但省不省额度取决于你怎么用;前端提速人人有份。OpenAI 把选择权还给了用户,而选择权这东西,从来都是要自己算账的。