这周AI圈的时间线密到什么程度?9月1号,Anthropic甩出Claude Fable 5.1和Mythos 5.1;9月2号,Meta的Muse Spark 1.3和谷歌的Gemini 3.8 Flash前后脚上线;9月3号,OpenAI发布GPT-6 Astra,总裁在发布会上直接喊出"欢迎来到AGI时代"。微博72小时,四款旗舰。知乎CNBC给这波节奏起了个正式名字:model fatigue,模型疲劳。知乎上"大模型进入周抛时代"的提问下面,吵得最凶的一个问题是——最强模型的保质期,现在撑不过一周。知乎
如果你像我一样,手机里装着两三个AI订阅,每个月自动扣费,最近大概率处于一种微妙状态:不跟,怕亏;跟,怕被割。这篇文章就把这波发布潮的账摊开算清楚:已经落了什么、马上要来什么、哪些"最强"是水分、以及不同钱包状态的人现在该干嘛。
先把9月的发布日历摆清楚
已经落地的:Fable 5.1主打编程和知识工作,100万token上下文,科研任务得分是上代的两倍多,甚至帮NASA重绘了三分之一个金星的地形图。GPT-6 Astra在ARC-AGI-3上拿了99.9%,人类平均只有48%。微博9月7号起,它开始向Pro、Enterprise用户全量开放并上线API。知乎Gemini 3.8 Flash原生支持视频理解,API定价只要0.75/3.75美元,明显走的是低价跑量路线。微博Muse Spark 1.3则是Meta冲榜的那张牌。
马上要来的才是重点:明天(9月10号)中午12点,DeepSeek Flash系列全线降价生效,缓存命中价格从0.05元降到0.02元,直接砍60%。知乎同时内测了一个月的V4.1 Flash正式上线——内测名字就叫deepseek-v4.1-flash-expires-on-0910,官方问卷里问测试用户的问题相当不客气:"你觉得这个模型能全面替换线上的V4 Pro么?"要知道V4 Pro是1.6万亿参数的大杯,价格是Flash的三倍。
Grok 4.7据泄露会在9月12号前后登场,参数2.1万亿,比4.6多出6000亿,马斯克的说法是"将超越所有当前模型"。微博再往后排队的还有Qwen 4(架构预览版Qwen3.8-Flash-Next已在8月26号开源)、Kimi 3.5、GLM 5.5,以及已经确认推迟的豆包2.2。知乎
也就是说,你现在做的任何"换不换"决定,两周后都会面临一批新选项。这本身就是第一个决策依据。

三个反常识信号,帮你把这波噪音滤掉
第一,"最强"一夜就能反转,跑分榜自己有保质期。 Astra发布后全网都在传"登顶最强",但独立评测Artificial Analysis的Intelligence Index v4.2给出的第一名是Fable 5.1(56.8分),Astra(54.7分)只能排第二。微博更微妙的是,AA恰好在9月4号换了评测口径——Fable 5.1发布当天的分析里还是66分,换口径后变成57分,不是模型退步了,是考卷换了。知乎同一款模型,不同榜单、不同版本能差出好几分,你看到的每一个"碾压"“登顶”,都得先问一句:哪张榜、哪天、什么口径。
第二,跑分高不等于好用,这周的口碑反转来得特别快。 Gemini 3.8 Flash在DeepSWE工程榜上拿了74%,和Astra、Opus 5打平,平均任务成本只有2.36美元,约为Astra的三成六——纸面上是性价比之王。知乎
但社交媒体上的实际口碑是另一个画风:“除了跑分干啥啥不行”“逼它主动联网搜索它都不干”,甚至有人直说日常表现还不如国产免费模型。微博9月9号已经有媒体报道,谷歌和Meta的新模型逆袭榜单,被质疑是"榜单专项刷分"——针对评测任务做优化。微博另外还有个更隐蔽的坑:有用户总结DeepSeek V4 Flash、GLM 5.3 Flash、Gemini 3.8 Flash这批轻量模型的共同特点是"无论你说什么都认同你",讨好式回答用着爽,但拿它做判断会把你带沟里。

第三,切换成本从来不只是订阅费。 这周最容易被忽略的新闻是:Astra全量开放首日就翻了车,因为分阶段优先企业客户,掏了更多钱的Pro用户反而被挡在门外排队,Altman最后公开道歉承认发布"混乱"。知乎Anthropic还在Fable 5.1上了"上下文一致性验证",API会严格校验回传内容,改动过直接报错——而且这条规则只适用于8月31号之后开的新账户,老账户暂时不管。
同一家公司,账户开在不同日期,规则都不一样。对企业来说,每换一次模型意味着重做benchmark、改prompt、重测全链路;对咱们个人用户,意味着你精心调教的提示词、用惯的工作流、甚至会员权益的兑现节奏,都可能说变就变。知乎上有篇分析说得很到位:真正的瓶颈早就不是"选哪个模型",而是"我能不能跟得上,以及我有没有权利不跟"。知乎
不同钱包状态,现在该干嘛
只用免费额度的:这波你反而是最大赢家,什么都别买。明天DeepSeek降价直接受益,实测1.56亿token只花了1.93美元,约合13块人民币。知乎国产免费档位卷成这样,付费的必要性只会越来越低。

已经订了ChatGPT或Claude、用着顺手的:别追新旗舰。独立评测的结论很明确——已经用GPT-5.6 Sol稳定干活的人不用急着全面切换,两者在工程榜上只差1个百分点。知乎Fable 5.1的综合任务成本是Astra的2.4倍,适合留给难题,不适合无脑升级。你的订阅买的是"够用+顺手",不是"跑分第一"。
编程和重度Agent用户:Astra确实在长程执行上有代差(Terminal-Bench从37.3%干到57.9%),但建议先用按量付费试水,别急着叠加新订阅。微博国产替代这条线也在变:Kimi K3是国产综合首选但官方订阅新购受限,纯文本工程任务GLM-5.3性价比更高,高频仓库工作流GPT-5.6 Luna的任务成本只要0.61美元。知乎另外提醒一句,用不满额度的人,订阅未必比按量便宜。
在等Grok 4.7、Qwen 4的:目前全是泄露和口头预告,2.1万亿参数、"超越所有模型"这类说法,等发布后看独立评测再动。参考这周的规律——发布日跑分和两周后的口碑,经常是两个东西。
接下来两周盯这几个信号就够了
9月10号:DeepSeek V4.1 Flash正式上线+降价生效,看它能不能真把自家Pro干掉;9月12号前后:Grok 4.7是否如期发布,以及有没有独立评测跟进;9月中下旬:Qwen 4、Kimi 3.5、GLM 5.5的落地节奏,以及豆包2.2推迟到什么时候;持续性指标:Artificial Analysis下一版口径的调整(这家榜单9月4号刚改过规则),以及Astra对企业端开放后个人用户的排队情况。

最后说个判断。这波"周抛时代"最反直觉的一点是:模型变强的速度,已经快过普通人消化它的速度。四款旗舰72小时落地,但你上个月的提示词、你这个月的工作流,并没有跟着翻倍。对普通订阅用户来说,锚点从来不该是发布会日程,而是你自己的任务清单——你每天真正要AI干的那几件事,现在的模型是干不了,还是你没用熟?想清楚这个,绝大多数"要不要换"的焦虑会直接消失。
反正,先别急着续费升级。等9月12号过后,这张牌桌上的牌会齐得多。