这周AI圈的热闹,几乎全在GPT-6 Astra身上:9月上旬OpenAI正式发布的新模型,晒出的成绩单很炸——ARC-AGI-3上从上一代的7.8%直接跳到99.9%。微博36氪报道里,它在专家级数学基准FrontierMath Tier4拿到了98%的通关级分数,OpenAI还甩出一篇165页技术报告,宣布调度10000个Agent协同推演88小时,给出了纳维-斯托克斯方程奇异性问题的机器验证证明。36氪微博上有博主晒完全程后直呼,“距离彻底退订Claude的日子不远了”。微博
但热度底下,有一批人体验完全是另一回事。知乎一位开发者的帖子标题就很说明问题:用GPT-6 Astra配Ultra档跑了两个任务,Plus额度直接快见底——他默默切回了GPT-5.6 Sol。评论区有人提醒他:Tibo早就说过,用Astra的话,思考程度选低或者中就可以了。知乎
问题一下就从"换不换Astra"变成了另一个更要命的:模型和推理档位这两个旋钮,你到底会拧吗? 9月份这批新模型(Astra、Kimi K3、小米MiMo-X预览版)全在主打"复杂推理",但推理这件事,早就不是开个开关那么简单了。
档位调的不是智商,是预算
多数人对"深度思考模式"的理解还停留在:开了更聪明,关了更笨。这是这轮讨论里最大的误区。
一篇被国内技术圈反复转的论文《Controlling Reasoning Effort in LLMs》把这事说透了:Low、Medium、High这些档位,是模型在后训练阶段(SFT、RLVR或蒸馏)就学会的可条件控制的计算策略。知乎系统提示告诉它"这次用低档",它改变的不只是思维链长度,而是搜索深度、验证次数、回溯意愿、工具调用方式和停止时机——同一颗脑子,换一套干活方式。
为什么第一代推理模型(从R1那一代开始)不会控档?因为RLVR训练只检查最终答案对不对,模型在试错中自己发现"多写几步、回头检查能得分",于是学会了想得多,但从来没学过什么问题值得想多少。所以现在各家都在补这门课:Kimi在K2.5时代用Toggle式训练,让模型先稳定答对、再启用预算约束,官方口径是性能不变输出token省25%~30%;Nemotron把完整推理随机截断,教模型预算烧完也要把答案收尾;Qwen3则把thinking和no-thinking样本混在一个模型里练。知乎
一个反直觉的结论就藏在这里:档位越高不等于越聪明,小模型开高档和大模型开低档的成本性能曲线会交叉。 那位切回Sol的开发者后来自己的判断就是:Astra+轻度,完全可能强于Sol+极高——让资深程序员想十分钟,和让中级程序员磨一个小时,后者花的时间多,不代表结果一定好。
各家档位接口混战:K3先上Max,Codex把Ultra做成了"分身"
把9月各家现状摆一张表,你会发现厂商对"推理强度"的理解差异比模型参数还大:
GPT系:GPT-5.6就是三款模型(Sol/Terra/Luna)×五档推理的结构,别名gpt-5.6默认指向Sol;Codex里新加的Ultra是特殊档位,OpenAI对它的定义是目前最大推理等级,可以把一个复杂任务拆给多个Subagent并行完成——不只纵向想得更深,还默认横向分身。官方说明里Ultra的定位是大型代码审查、复杂研究、可明确拆分的任务,还按任务类型给了模型+档位推荐。知乎
Kimi K3:7月16日发布的2.8T MoE,首发只有Max档,Low/High是后补的。原因不难理解:Max是把模型天生的长推理释放出来,Low要求它在受限预算下保持智商在线,稳定性验证更难。更要注意的是K3官方自己在Limit里承认,它不太会及时收手——长周期高难任务特别强化过,默认主动性偏高,普通问题容易想过头。知乎
DeepSeek V4:走的"专家模式"开关路线,App和网页端切换即用。但用户侧的怨气值得看——小红书上"苦V4思考模式久矣"的帖子不少,Chatbox直到7月底更新才补上关闭思考的开关,Coze智能体还有人专门发帖问怎么关掉思考过程。小红书
小米MiMo-X:9月8日刚开邀测的Pro/Flash双预览版,官方口径是系列模型面向真实专业工作场景优化,主打复杂推理和多Agent协作,档位接口细节还没全放开。微博
也就是说,你在一个模型上养成的"档位肌肉记忆",换个平台全部作废。
烧掉的不只是额度:三笔容易被忽略的隐藏账
第一笔:档位消耗比。 B站"停用WorkBuddy深度思考模式"那条视频的评论区,有人直接给出了实测体感:max会用x2的消耗、增加x0.2的性能,日常写代码区别不大。哔哩哔哩个例不能当结论,但它指向一个真问题:高档位的质量溢价在简单任务上收敛极快,而账单不会。
第二笔:缓存账。 同一条视频下27个赞的评论提醒了很多人没想到的点:频繁开关思考模式会降低上下文缓存命中,反而推高成本。哔哩哔哩正确姿势是在新会话里定好策略再跑,而不是同一个长对话里来回切——尤其跑Agent长任务、缓存命中差异被放大的时候。
第三笔:污染账。 过度思考不只是浪费。对"支付接口偶尔重复扣款"这类问题,Max档允许的推理轨迹会做更多路径和边界尝试,任务简单时反而可能把修复边界"想脏"。评论区那句刻薄话其实很精准:"模型在thinking里模拟程序跑半天,还不如非思考模式新建两个demo。"更朴素的成本还有时间——简单问题回复慢到让人想摔键盘,是各家思考模式的共同吐槽点。
一张实操表:先选模型,再拧档位
把本周社区的争论和官方说明捏到一起,Codex用户可以直接抄这套默认策略(其他家的开关逻辑同理):
任务类型 | 建议档位 | 理由 |
|---|---|---|
解释代码、改单个函数、按明确需求生成内容 | 轻度 | 目标明确范围小,多花预算基本白花 |
读项目、跨文件修改、跑测试的日常开发 | 中等 | 大多数开发任务的最优性价比点 |
复杂Bug、架构设计、高不确定性任务 | 高/极高 | 需要验证次数和回溯意愿真正上去 |
大型代码审查、可拆分的复杂研究 | Ultra | 官方定义的适用场景,注意多Agent=横向算力叠加计费 |
两条附加纪律:换到新模型(比如刚上手的Astra)时,把旧模型的档位习惯清零,从低档往上试,而不是机械沿用"极高";用K3这类默认激进的模型跑简单任务前,先看它有没有给你可用的低档位,没有就换模型,别硬按。
最后留个观察清单:K3补出来的Low/High稳不稳、MiMo-X正式档位的消耗口径、以及数学圈对Astra那组benchmark的质疑会不会发酵——陶哲轩已经在讨论当科技巨头凭算力集群几天内平推公开研究线索时,传统学术交流面临的冲击了。36氪成绩越炸,越要等证据自己变硬。
思考按token计费的时代,档位不是立场,预算才是。下次下单之前先问一句:这个任务,配得上让模型想多久?