ChatGPT/Codex 的订阅用户,这周 OpenAI 把玩法改了。OpenAI 工程师 Eric Provencher 正式宣布,多智能体 v2(Multi-Agent V2)全量上线:主 Agent 可以把子任务自动委派给任意支持的模型,每个子 Agent 还支持单独设置推理强度。36氪OpenAI 总裁 Brockman 的说法更直接:“朝着告别手动选模型的方向前进”。微博翻译一下:AI 替你选模型,AI 替你派活。社区对这事的态度分成了两派,有人觉得这东西本来早就该实现。微博也有人什么都不说,先默默看了眼自己的额度余额。两种立场都有道理,关键看你是哪种用户。
到底改了什么
以前一个任务用哪个模型,得你自己挑,现在主 Agent 会自动把任务拆开、委派给合适的模型。先看 OpenAI 现在手里这副牌——GPT-5.6 Sol:最强,复杂的 Agentic 编码;GPT-5.6 Terra:日常编程主力;GPT-5.6 Luna:最快、最便宜;Daybreak:网络安全专用;GPT-5.5:复杂编程、研究、通用任务。36氪官方的算盘打得很清楚:复杂任务只有约 20% 的步骤需要最强模型,其余交给便宜模型,推理成本大幅下降。微博

配套的前端优化也很实在。OpenAI 内部测试用的是一个 741 轮、231MB 的“怪物级”对话,打开它的平均时间从 27.62 秒降到 1.66 秒,单次打开要发的网络请求从 894 次砍到 16 次。36氪对常年挂着长任务的用户来说,这是能直接感知到的提速。

官方算盘是降本,但实测有两个坑
第一个坑:自动委派本身还没完全对齐。三周前 Codex 的模型清单里,Sol 和 Terra 被标成 multi_agent_v2,最便宜的 Luna 却被标成 v1,结果主 Agent 想派活给 Luna 时,系统直接回一句“未知模型”,开发者在 GitHub 上为这事开了至少两个 issue,OpenAI 官方论坛还有帖子喊话“把 Luna 还给我们”。36氪如果你的用法正好依赖 Luna 这种便宜模型跑高频简单任务,全托管之前,先确认委派是否稳定。
第二个坑:额度消耗失控。有微博用户的实测很有代表性:一堆智能体并行跑,爽是真的爽,钱也是哗哗的流。微博原因不神秘,OpenAI 自己的解释是 Sol 干活太积极:并行调用更多工具、安排子 Agent,Token 就跟着哗哗往下掉。知乎这笔钱不只是个人用户的感受。一篇被广泛转发的编译文章说得更直白:AI 本应取代人类劳动,结果人比软件还要便宜,这是有史以来的第一次。36氪文章里还给出了顶尖企业的人均 Token 消费趋势,多智能体越“自动”,这条曲线涨得越快。

三类用户,三种用法
重度用户(额度充足、任务复杂多样):值得开,但建议先小范围试跑 2-3 天,对比同一类任务在 V2 和你之前手动选模型时的额度消耗速度,再决定要不要全托管。这不是过度谨慎,“自动选模型”等于把成本结构从明处搬进黑箱,你得先看到真实数据。
额度紧张的用户:说实话,手动选型反而更可控。简单任务——格式化、小修小补、生成初稿——直接指定最快最便宜的 Luna,把 Sol 留给真正需要深度的步骤。这种用法不“落后”,只是你自己做了模型调度,省下的额度是实打实的。
需要审核结果的协作用户(在 Codex 里并行跑多个任务):记住多 Agent 不会自动替你做最终判断,适合并行的是彼此独立、边界清楚的任务,最终是否采用改动,仍由你逐项看 diff 决定。知乎越“自动”的时候,这一步越不能省。
三个值得继续盯的信号
1)额度政策的反复。OpenAI 已经做过一轮优化,官方口径是额度大约能多撑 18%,但之前暂时取消的 5 小时限制也跟着恢复了。知乎V2 全量后额度规则会不会再变,是直接关系到钱包的事,值得持续盯。
2)Luna 委派的修复进度。“把 Luna 还给我们”不是个例,便宜模型是很多人的日常主力。如果标记问题反复出现,或者 Luna 委派再受限制,V2 的成本优势会大打折扣。
3)Ultrafast 模式的铺开进度。OpenAI 已在 8 月 13 日给 GPT-5.6 Sol 上线了 Ultrafast 模式,官方把它定义为同一模型的新服务层级,先在 API 推出,算力由 Cerebras 支持,最高比标准处理快 14 倍、每秒生成 750 个 output tokens。知乎这个速度选项什么时候进入订阅侧,会再次改变多智能体任务的性价比算法。
最后一句
AI 替你选模型、替你派活,不是免费午餐,它本质上是把“用哪个模型、花多少钱”这个决定,从你手里挪进了黑箱。黑箱也许更聪明,但在它足够透明之前,别摘掉自己的额度警报:先试跑、算清账,再交方向盘。