今天是9月20日。如果你的ChatGPT Plus、Kimi会员或者Claude订阅这个月底到期,续费按钮可以先停一停——量子位在9月20日把这两周命名为"基模决战周",微博上#全球基模决战即将打响#的决赛前瞻已经开列名单:中秋到国庆的13天假期,几乎每家模型公司都有新牌要出。 问题从来不是"有没有新模型",而是哪些是官宣、哪些是灰度穿马甲、哪些纯属跑分——以及你手里那笔订阅费,该不该等这两周。微博
一张表先看证据强度:官宣、暗示、马甲、口头,不是一回事
厂商 / 模型 | 截至9月20日的状态 | 证据强度 |
|---|---|---|
OpenAI GPT-6 Astra | 9月初已发布;9月11日$200 Pro档暂停新用户购买,Codex负责人Tibo Sottiaux明确是保算力;9月19-20日用户报告20X重新开放,但仅限老账号、新账号仍开不了 | 官宣+后续信号 |
阶跃星辰 Step5 Preview | 9月19日全量开放API,注册送体验额度 | 官宣 |
DeepSeek V4.1 Pro | 未官宣,但9月10日V4.1 Flash发布时官方文档写明"在V4.1 Pro上线之前"——卡片已经印好,只差翻牌,按历史节奏落在9月底到10月初 | 官方暗示 |
阿里 Qwen4 | 8月底开源Qwen3.8-Flash-Next,官方明说这是Qwen4底层架构的early preview | 官方暗示 |
Anthropic Opus 5.2 / Fable 5.2 | 9月15日起开发者发现ClaudeCode里模型slug指向5.2并开启灰度;9月17晚灰测通道突然切断、次日恢复且扩大到Chat和Cowork;路透社报道Anthropic正考虑发布新模型,名字和时间未公开 | 灰度+媒体 |
谷歌 Gemini 4 Pro | 9月17日Arena出现同名冒牌的"gemini-3.8-flash"测试位(真3.8 Flash月初已发布),社区推断是旗舰马甲、代号Argon,PS5矢量图、体素宝塔等demo刷屏;但谷歌零确认,网传"全面超越GPT-6"的跑分图反被网友质疑"太假" | 匿名马甲 |
Kimi K3.1 | 官方账号9月20日放出一串数字,对照π正好是"3.1"后面的小节;此前Arena出现过"adamant-ananke"测试位,9月1日Polymarket给"9月发布"的赔率一度到91% | 哑谜+平台信号 |
xAI Grok 4.7 | 马斯克原话:“needs a few more days to cook” | 口头预告 |
值得多说一句的是谷歌那行:疯传的那张对比图正是这轮预期的源头,DeepSWE、GDPval、HLE等13组测试里它全部第一,但AI前线的原话是"这些参数目前仍属于社区测试结果,尚未得到Google确认"。36氪

为什么全挤在这两周出牌
第一层是算力倒逼出来的错位。量子位引述的数字是:GPT-6 Astra已拿走约13%的企业AI支出,Claude Fable约8%。 OpenAI月初被捧成新王,9月11日却把最赚钱的$200 Pro档直接封盘,官方口径就是给Astra保算力。 仅8天后的9月19-20日,20X又陆续重开,但首批只还给老账号、新账号依然开不了——强是真强,挤也是真挤,挤到什么程度,Pro档这一开一关就是最诚实的压力表。 你越需要保算力,对手越有动力用新模型抢叙事,Anthropic在上市传闻期提前放风新模型、谷歌宁可用马甲让网友"自来水"式测半年,都是同一个算盘。36氪微博微博
第二层才是普通用户摸得到的部分:新旗舰扎堆,价格额度和免费窗口会跟着松动。Step5 Preview在Artificial Analysis的智能指数44分(榜首Fable 5.1和GPT-6 Astra在53分上下),API定价百万token输入$1、输出$2.7,实测干一单活约$0.58,量子位称其单任务成本约为Claude Opus 5的1/8。看到这种数字,付费会员的正确反应不是"马上换",而是意识到:你准备按原价续的这笔钱,可能两周内就变成了"更贵的那一档"。36氪

但跑分和能用之间,这次Step5正好撞上活样本
B站那条Step5基准测试视频的评论区,比任何测评都真实:
“看完AA的分去官网买了9.9刀试水,让它做个托盘小工具,干了两个小时没干完,月额度烧掉一截”;
“跑分跑得很厉害,实际用起来拉胯,速度、价格、吞吐全方位不如”;
评论区里扎心的判断:“我说白了国模如果没有明显超过ds的能力,很难有吸引力”,一条普通用户跟帖,比厂商PPT诚实。哔哩哔哩
还有人直接提醒:薅免费额度归薅,先搞清自己的提示词会不会被上传。
这不是阶跃一家的问题,是所有"发布即灰度、灰度即跑分"阶段的通病:马甲checkpoint告诉你的是发布后"可能有多强",9.9刀试水单告诉你的是钱包"多久会烧完"。决战周里每次上新,都值得先用免费额度跑一轮自己的真实任务,再谈付费。

你属于哪种人:等、续、换对号入座
写代码、跑Agent的重度用户:Claude 5.2已在灰度:有开发者发现,自己明明选择的还是Opus5,但部分复杂任务里的表现却和此前版本明显不同。 V4.1 Pro、K3.1、Grok 4.7都指向同一个窗口期。手头的订阅按最短周期续,别急着上车年费;等slug换名、文档翻牌之后再决定主力工具。36氪
ChatGPT Plus轻度用户:你真正的痛点不是新模型,是档位。9月5日小红书热帖直接标题开问"GPT是要放弃plus用户了么",说的就是新旗舰和Plus档位之间的那道墙,这条吐槽底下堆了169条评论。 Pro档9月11日封盘、9月19日起又陆续重开,升级通道忽开忽关。如果你不需要Astra干重活,这轮决战跟你的钱包关系不大;需要的话,盯的不是Plus,而是Pro重开是不是轮到你所在的区域和账号。小红书
国产模型比价用户:Step5这类"发布+送30天免费额度"是白嫖多家横向实测的最好时点,一分钱不用花。但参考评论区教训,白嫖完别因为"支持国产"提前付费,让能力差自己说话。
生图、视频用户:这轮决战基本集中在文本和代码,发布窗口一个都碰不到图像视频——你该付的费照付,不用陪跑。
出手信号清单:等到这四件事再做决定
Arena里"gemini-3.8-flash""adamant-ananke"这类马甲位消失或换真名——历史上马甲撤下往往就在官宣前几天;
ClaudeCode模型列表的slug和官方changelog出现5.2正式条目;
OpenAI Pro订阅的全量重开——9月11日封盘、9月19-20日20X已对老账号回归,这个$200档什么时候向新用户全量放行,是算力最诚实的压力表;
DeepSeek、月之暗面官方把"暗示"变成"官宣"的那一刻。
决战周里最贵的从来不是哪个会员,而是你今天签字、两周后必然变价变额度的那份长约。先把付钱的手收回来,看完这两周再说。