过去一周,ChatGPT编程用户的口碑坐了一趟完整的过山车。9月23日,GPT-6 Sol踩着Opus 5.5发布90分钟的节点上线,API价格直接打到前代一半,号称"性能略超5.6 Sol"。知乎用户"小侯飞氘"信了,结果"浪费了我一天的时间,以及一周的额度"——社区最狠的猜测是"6 Sol其实是5.6 Terra的马甲"。9月28-29日口碑跌到谷底,正好叠加200美元Pro档官宣用量减半。然后DevDay 2026上,GPT-6.1 Sol来了:官方口径是"以Astra五分之一的价格,提供接近Astra的智能"。第二天,“如何评价OpenAI发布的GPT-6.1 Sol"冲上知乎热榜,浏览量88万+,风向从"失望透顶"变成"你也还是有可取之处的”。知乎微博36氪
我把知乎上两份一手实测、36氪的DevDay复盘、两篇专门算账的知乎专栏和微博小红书的讨论翻完对完,结论就一句话:这次官方口径基本站住了,但"站住"说的是大盘;额度账、缓存账、返工溢价、升档账这4笔,得你自己对完再切。

第一笔账:额度账——"烧额度"这次真被治了,但便宜不在单价上
先看两组真实消耗(都是Pro用户的一手记录,口径是周额度百分比):
小侯飞氘切到6.1 Sol写代码:跑了半天,消耗周额度10%出头;同一天他忘了改subagent规则,几个Astra high档智能体自动跑起来,一小时烧掉15%。同样是"跑智能体",两者实际烧额度的速度差了近10倍。知乎
对比他9月初用Astra的体验:“pro5x的周额度一般半天到一天就用完了”;Plus用户更惨,“一般对话一两次,5h额度就没了”,这也是9月中旬口碑崩掉的底层原因。
但有个细节大多数人只看了一半:知乎通宵实测6.1 Sol的"夜神不说话"给出的缺点第一条就是超长思维链——复杂项目分析速度远慢于Astra、做事喜欢事无巨细的防御性编程。而API计费里,推理token是计入输出计费的(专栏作者"学AI不秃头"算账时特别标注:billing output含reasoning tokens,“不能只数屏幕上显示的文字”)。单价便宜、思维链变长,两者是相乘关系:同样完成任务,如果输出token涨了50%,$2/$10的单价实际到手成本只降了三分之一。官方评测里"单任务成本约为Astra的七分之一",这个七分之一才是真正的口径。知乎知乎
"接近Astra"在benchmark层面成立的部分:DeepSWE v1.1高推理档与Astra持平;OSWorld 2.0电脑操作比GPT-6 Sol高7个百分点,距Astra只差2.1个百分点;低推理档的事实错误率从11.4%降到7.7%。也就是说:能力上限确实摸到了,慢的是过程,不是结果。36氪
第二笔账:缓存账——"再砍一半"听着响,实际算下来差$0.004
6.1 Sol普通输入仍是$2/百万token、输出$10,基础单价没涨;真正降的是缓存读取:$0.20→$0.10,比标准输入便宜95%。听上去Agent用户要省大钱——但学AI不秃头用真实结构算了一遍:40K命中缓存输入+10K普通输入+5K计费输出,6.1全程$0.074,6 Sol是$0.078。整次请求只省$0.004,约5%。普通输入和输出仍然占账单大头,没命中缓存的内容不能按缓存价算。知乎

还有个272K的坑要记住:单次输入超过272K,整个请求的输入与缓存费率翻倍、输出1.5倍。长上下文重度用户,账单先翻倍再谈折扣。
第三笔账:返工溢价——最贵的从来不是模型账单,是返工
9月中旬那场集体教训值得写在墙上:5.6 Sol单价便宜,但复杂问题"返工次数明显比Astra多";Astra一个任务计费口径$0.45(20K输入+5K输出),是6.1的5倍($0.09)——但比起返工烧掉的额度和时间,模型单价反而是整张账单里最小的一项。6 Sol翻车把这个成本拉满:“浪费了一天时间+一周额度”(小侯飞氘),这个就是"便宜新模型"的真实成本。知乎
所以选择逻辑应该反过来:不是"哪个模型便宜",而是"同一任务,能不能一次修对、会不会破坏测试、事后还要改多少"。专栏作者"達聲"的实测口径把这层说透了:6.1最高档单任务约$0.72,仍然低于Astra最低档的约$0.82——对绝大多数任务,6.1从低档起步、按需求跳档,比无脑开顶配或守着Astra都划算。Astra多花的钱,要验证它真的换来"更少的关键遗漏"才算数:同材料、同任务,$0.36的差额能不能省掉一次五分钟返工,用你自己的修改记录回答。知乎

第四笔账:升档账——Pro500先别急着看,10月29日才是坎
DevDay把价格带从$20一路铺到$500:Pro500月费500美元、额度25倍于Plus、独占"最快Astra"和Ultrafast快车道。但那位通宵实测的用户犹豫之后给出的答案是"算了":多模态任务挪去Gemini Ultra档,Coding单独又买了KIMI k3的MAX档——因为Sol系列的缺点里明明白白写着"低审美"。重度用户的真实解已经从"全家桶升档"变成"按任务拼多模型"。36氪知乎
另外两个跟钱包直接相关的倒计时:
存量Pro用户的老20X额度只保留到10月29日,官方对grandfathering能续多久没有承诺。过渡期保留原限额+一笔一次性额度补偿,这是目前官方给的全部。知乎
隐藏加分项:全天候智能体Dots(每人一台专属云电脑)已打包进Pro及以上订阅,且与Dots对话不计用量。如果你是Pro,用量减半的坏消息里,这是唯一实打实的"加量"。36氪
谁先切、谁等一等
常规Codex/Work编程流:先切。默认medium档起步,范围小任务规则清楚的用low,跨文件排查再上high,xhigh留给可等待的长任务。注意6.1 Sol目前只在ChatGPT Work和Codex开放,普通聊天窗口暂不提供;宣传中"最高8倍速"的Ultrafast版还要等几天。36氪
6 Sol流程已经跑稳的:别急着全换。挑一个熟悉的真实任务双跑,保留旧结果再对比。知乎
走Chat Completions的:先停。6.1不支持none/minimal推理档、工具调用要求Responses API、temperature/top_p要移除——兼容性坑比能力评估优先,调用报错先查适配,别急着骂新模型。
跨模块疑难调试、错误代价极高的:Astra留着。用同一份材料验证值不值那5倍差价。
靠审美的内容工作和多模态重度任务:Sol不是你的菜。"低审美"是社区一手反馈,别硬用。

接下来盯这四个信号
模型更新已经进了周更节奏:9月3日Astra、9月23日Sol/Luna、9月底6.1 Sol——下一周6.2或者7真来了,按这四笔账再对一遍。
Ultrafast档上线后计不计额度、加价多少;几天内推出,盯官宣。
10月29日存量额度换口径,老用户实际剩多少。
CPO Tibo Sottiaux承诺的"每美元能买到的工作量只会随时间上升"和5小时窗口废除,会不会在下一轮调价里继续兑现。36氪
Anthropic的Opus 5.5还在桌上——这一轮6.1 Sol就是被它逼出来的7天一发的结果。对"版本抢跑"最省钱的态度是:把每个新版当候选,不当截止日。这篇先收藏,真来了再对账。