上周五到现在,蹲AI新闻的人体验很魔幻:等的那个跳票了,没盯的那个当晚就全量上线了。
先说等的这个。9月2日,马斯克在X上放话:Grok 4.7"十天后上线,9月12日见"——2.1万亿参数,比刚发一个月的Grok 4.6涨40%,还喂了大量SpaceX的独家工程数据,号称"性能超越所有现有AI模型"。他甚至提前打预防针式的自信:“如果有模型在真实工程上比4.7更强,我会感到震惊”。今日头条微博

结果9月12日当天,等来的不是发布,是马斯克本人确认延期:还需要"几天时间完善"。知乎
有博主翻了下账本,这已经是Grok 4.7第四次推迟:7月底承诺8月21日前,8月12日改口"9月初",9月2日喊出"10天后",然后就是这次。更难得的是,老马这回没甩锅算力,而是亲口承认了翻车原因——强化学习阶段把"回复长度"惩罚得太狠,导致模型面对明明有能力解决的高难度任务时,为了简短而提前放弃;同时自我核查的严谨度也不够。他还补了一句:根本原因"可能"如此,团队尚未完全确认。微博知乎
翻译一下:2.1万亿参数的新旗舰,被训得"连话都说不利索"了。
这不是段子,是真实用户早有体感的问题。一位用了Grok 4.6的博主写道:“最大的问题就是回答越来越短,很多时候观点刚展开一点就结束了”。他顺便点了整个行业的穴:Opus 5那类模型又走向另一个极端,一件简单的事讲半天——"话多话少"本身,已经成了大模型最难调的参数之一。微博
跳票背后:一场被直播"救场"的发布
耐人寻味的是xAI的下一步操作。就在跳票消息发酵的当口,官方宣布9月15日至17日在旧金山连开三天、累计约30小时的直播——Grok Bot Galaxy:三名员工现场用GrokBot模拟经营一家初创公司,从商业计划、写代码到部署上线全流程公开演示,每天北京时间23:30开到次日9:00,官方甚至鼓励去现场围观。这个日期选得很讲究:恰好卡在Grok 4.7"该发没发"的窗口期。社区已经在传新档期是9月18日前后,但官方没确认。换句话说,模型跳票了,戏不能停——先让Agent直播顶上去。对围观群众来说这反而是好事:连续30小时不剪辑的实操,比任何发布会PPT都难演。是骡子是马,周三凌晨见分晓。微博
同一周,别人在"悄咪咪"干活
Grok 4.7跳票的同一周,另外几家可没闲着:
Kimi K2.8-Preview,9月11日零配置全量上线。月之暗面这波被社区评价为"悄咪咪":Kimi Code CLI全量推送,Model ID不变(还是kimi-for-coding),第三方工具不用改任何配置,后台自动切换。官方口径谦虚——“综合性能接近K3”,但权限放得大方:全部会员可用最高1M上下文,思考强度调节下放,还新增了图片和视频输入。TRAE中国版Day0同步首发。微博知乎微博

有用户实测后评价:“KIMI+K2.8用来做脚本类工具太舒服了,确实是超优质码农,且TOKEN消耗也很低”。要知道K3发布才两个月,K2.8等于把旗舰能力打了骨折往下放——背景是月之暗面8月ARR刚破10亿美元(6月才3亿),尝到甜头的打法就是"以量换钱"。微博知乎
GPT-6这边,一边停售一边泄露。GPT-6 Astra 9月3日发布后需求爆表,OpenAI 9月10日宣布暂停$200/月Pro档的新增订阅和升级,现有用户不受影响,恢复时间未定。核心产品负责人的原话是"从未见过这样陡峭的增长曲线"。与此同时,9月12日有开发者发现疑似GPT-6 Sol的模型标识出现在OpenAI API里,被解读为发布比预期(DevDay)更早的信号。OpenAI官方博客甚至发文提醒开发者"重新审视GPT-6 Astra时代的技能指令与提示词"——模型强了,你之前写的那些Skill可能都该重写了。微博知乎微博

DeepSeek两天内改了口。前脚宣布V4.1 Flash全面超越V4 Pro、准备下线Pro并把请求自动切过去,后脚(9月12日)就撤回:9月14日后V4 Pro API继续提供,价格不变。对靠API吃饭的开发者来说,这波反复比涨价还吓人——今天迁移,明天回滚,折腾的都是工时。知乎
别只盯跑分:这周还有两条"冷水"
模型大战里最容易犯的错,是拿榜单当购买依据。这周恰好来了两盆冷水:
一盆来自分析机构SemiAnalysis,9月8日连发五条推文点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3是"刷榜痕迹最明显的两个模型"。另一盆来自新发布的Real-SWE基准——用真实企业的私有代码库考AI,结果最强模型通过率仅38.8%。连Cursor都因为公开基准被刷爆,自己搞了个私有基准CursorBench 4.0,结果显示:Claude Fable 5.1和Opus 5"贵但确实最强",Grok 4.6"表现不突出"。微博微博知乎
榜单之外,用户行为更诚实。有观察汇总称,一批用户正从Opus 5、GPT-6 Astra、Grok 4.6这些最新旗舰回退到Opus 4.6、Grok 4.5等前代模型,理由高度一致:更贵、性能不稳定、实际改进有限。"追新"在2026年的秋天,第一次成了需要论证的选择。微博
时间表 + 怎么办
把本周信息拼成一张表,9月的牌局一目了然:
时间 | 事件 | 状态 |
|---|---|---|
9月3日 | GPT-6 Astra发布 | 已上线;$200档9月10日暂停新订阅 |
9月11日 | Kimi K2.8-Preview全量上线 | 已上线;零配置,会员可用1M上下文 |
9月12日 | Grok 4.7原定发布日 | 第四次跳票,社区猜测9月18日前后 |
9月12日 | DeepSeek撤回V4 Pro下线计划 | API继续提供,价格不变 |
9月12日 | GPT-6 Sol疑似泄露API | 非官方,待官宣 |
9月15-17日 | GrokBot Galaxy三天直播 | 已官宣,北京时间每天23:30起 |
9月内 | Qwen 4、GLM 5.5、Kimi 3.5等 | 排队中,无确切档期 |
对着这张表,三类人三种做法:
在等Grok 4.7的人:别拿会员赌一个没发布的模型。两个观察点——9月15-17日的直播翻不翻车(GrokBot真能干30小时活,比跑分有说服力);9月18日前后有没有真发布。另外提前知道两件事:SuperGrok $30/月档的周额度比不少人预期少,有开发者实测后直言"强,但还不是第二个Codex"。CursorBench显示4.6编码并不突出,4.7是"翻盘局",翻盘前不必急着切换年费。知乎

写代码、跑Agent的人:Kimi K2.8今天就能白嫖试用。用kimi-for-coding的什么都不用改,已经自动切过去了;TRAE中国版Pro会员可直接选。1M上下文+低token消耗,做脚本类工具是舒适区。唯一提醒:它还挂着Preview后缀,生产环境建议先跑自己的真实用例,别只看"接近K3"四个字。
已经付着GPT-6或Claude的人:先别升级,也别焦虑。$200档停售说明算力紧张是行业性的,回退潮说明"最新"不等于"最适合"。你的旧订阅+新模型的免费试用额度,足够撑到9月底各家牌全部亮完——Qwen 4和GLM 5.5还在路上,这时候all in任何一家都是下策。
模型大战打到第四年,最大的变化不是模型变强了,而是"等一等"的成本变低了:跳票的会补上,全量的随时能试,泄露的等官宣就行。真正贵的从来不是会员费,是在信息不全的时候做的决定。
这周三凌晨的GrokBot直播,你会蹲吗?评论区聊聊你在用哪家,以及被哪个模型"背刺"过。