如果你这两天正在纠结要不要给AI工具续费、换模型,那刚刚发生的事值得你先停三分钟。
9月2日凌晨,阿里通义千问甩出 Qwen3.8-Max-0902:参数规模推到2.4万亿,上下文窗口稳定在100万token,输入定价每百万token 2美元、输出6美元。知乎 训练方向明确写着两个词——Coding 和 Cowork。同一天,它拿下 CodeArena 全球前端编程榜第一。知乎

更热闹的是隔壁:腾讯混元 Hy4 preview 上线才5天,服务器直接被用户挤爆,官方紧急扩容推理集群。微博 Hy4 preview 在 WorkBuddy 的限时免费,也延长到了9月30日。知乎 而月之暗面的 Kimi K3 反向操作,API 价格比上一代翻了5倍,输出每百万token 要100元。知乎 一边免费、一边降价、一边涨价,国产大模型第一梯队这轮洗牌,一天之内全摆上台面了。
先给结论:这波没有通杀的赢家,只有不同场景下的最优解。换不换、换谁,取决于你拿它干什么,以及你愿意为"第一"这两个字付多少钱。
先泼盆冷水:这些"第一"都是单项冠军
CodeArena 是 Arena.ai 旗下的编程盲测榜单,这次 Qwen3.8-Max 登顶的是 WebDev 前端开发分项,不是综合榜。往前翻,7月 Kimi K3 发布时,也曾在 CodeArena 前端盲测中拿到全球第一。知乎 这个榜单的头部席位是轮着坐的,而且只考"前端这一门"。看分差就知道轮换有多激烈:Qwen3.8-Max-0902 以1691分居首,只领先第二名 Claude Opus 5 三分(1688);此前坐过头把交椅的 Kimi K3 退到第三(1674);上线才五天的腾讯 Hy4 preview 也挤进了前六(1629)。小红书 单项冠军尚且几天一换座,综合强弱就更不是一张榜能说清的了。
36氪昨天一篇报道的标题说得很直白:《都说自己是第一,中国最强的大模型到底是谁?》。36氪 知乎上吵得更直接,有个高讨论度的回答是这么划线的:真正第一梯队的是 K3,摸到第一梯队的是 Qwen3.8-Max,其他都是"牛马模型",能干活,但别指望搞高精尖。知乎

所以看这波新闻的正确姿势是:别问"谁最强",问"我这个活儿谁最合适、谁最便宜"。
五家的主场,一张表看清
这轮混战里五家各有各的护城河:
Kimi K3:2.8万亿参数、100万上下文、权重开源,长程编程和 Agent 编排是强项,社区公认"快"。代价是价格——输入每百万token 20元、输出100元、缓存命中1元,比上一代翻了5倍。另外它正在跟微软、亚马逊、谷歌谈云上托管,想要最高30%的服务收入分成。知乎 这事如果谈成,开源旗舰的商业模式会是一个分水岭。
Qwen3.8-Max-0902:2.4万亿参数,这次主打 Coding 和 Cowork(多智能体协作),定价激进,输入约每百万token 12元、输出约36元。同时阿里还把 Qwen3.8-27B 直接开源,冲上 Hugging Face 趋势榜,知乎相关问题热度65万+,把一堆娱乐话题挤在后面。知乎
GLM-5.3:走的是开发者生态路线。OpenRouter 平台截至8月30日的一周,Token 消耗量达到113万亿,首次突破100万亿关口,智谱一家就有四款模型进入头部,超过 DeepSeek。知乎 之前匿名霸榜的神秘模型"Ox Alpha",8月26日被智谱官宣就是 GLM-5.3-Flash——免费预览期闷声刷量,正式亮明身份后依然稳居消耗榜前列。生态厚意味着第三方工具、网关、教程都最全。
DeepSeek V4:Flash 版打性价比,9月2日又放出视觉实验版。真正要盯的是两件事:V4 Pro 还没落地,以及 DeepSeek 刚开源的 Harness 智能体框架——社区已经在讨论它是"Agent 的新斩杀线",对标的是 Claude Code。
腾讯混元 Hy4 preview:770B总参、49B激活、100万上下文、全部开源,首发塞进自家 AI 办公平台 WorkBuddy,限时免费。官方同步放出的12项基准测试,把它和 Qwen 3.8 Max、DeepSeek V4 Pro、GLM 5.3、Kimi K3、GPT 5.6、Claude Opus 5 摆进同一张图,DeepSWE 这类编程项比上一代翻倍还多。知乎 办公场景实测也能打——45分钟出一份带数据校验的研究报告、1小时排查9个代码缺陷。缺点也写在明面上:慢,高峰排队5分钟起步。

真正该算的账:五个成本数字
模型再强,用起来烧不起也白搭。这轮竞争真正的胜负手在价格,五个数字值得记一下:
第一,输出价。Kimi K3 输出每百万token 100元,Qwen3.8-Max 约36元,差出将近3倍。如果你主要用它写长文档、出报告、跑长任务,输出价就是你账单的大头。
第二,缓存命中价——这是最容易被忽略的隐藏变量。长会话、长系统提示词、Agent 反复调用同一批上下文,走的全是缓存价:K3 缓存1元,Qwen 约1.2元(0.17美元),Hy4 preview 只要0.3元。对每天挂在 Agent 里跑几十轮的用户,缓存价的差异比输出价还疼。
第三,免费窗口。Hy4 preview 在 WorkBuddy 限时免费到9月30日,办公党、报告党可以先白嫖一个月再决定去留,零成本试错。
第四,订阅和按量的分界线。只在一家的官方工具里用,买订阅套餐通常划算;但一旦你混着用——比如 Claude Code 里接国产模型、自建 Agent 多模型路由——订阅额度就不灵活了,按量 API 加第三方网关反而省心。小红书上已经有人在问"opencode 套餐用完了,换智谱 Lite 还是别的",这就是典型的岔路口。小红书
第五,开源的隐性成本。Qwen3.8-27B 一张高端消费级显卡就能跑,数据不出内网;但本地部署要自己维护,时间也是钱。

顺带一提性价比的刻度:在 CodeArena 的性价比榜单(帕累托前沿)上,Qwen3.8-Max-0902 每百万token综合均价约5美元,被社区称为新一代前沿模型的"斩杀线",压在前沿的最前端。小红书 旗舰能力卖中端价,这就是它敢凌晨两点发布的底气。
所以,谁该换、谁该等
重度编程党:如果你现在用着 K3 按量计费、账单肉疼,可以把 Qwen3.8-Max-0902 拉进候选,先在自己的真实任务上跑两天盲测再换。前端、网页类开发它是当前的单项冠军。
办公文档党:别急着买任何东西,9月30日之前 Hy4 preview 免费,先让它替你出几份报告。注意它慢,适合"扔个任务去喝咖啡"的用法,不适合蹲在屏幕前等结果。
Kimi Code 订阅用户:K3 按量涨价5倍,对订阅用户反而像个锚点——先看套餐内的 K3 额度和限速有没有跟着变,再决定续不续。别被"涨价焦虑"推着做决定。
本地部署玩家:Qwen3.8-27B 和 Hy4 的开源权重都值得下,27B 量化后消费级显卡能跑,隐私敏感的场景这是唯一解。
最后留三个继续观察的信号:DeepSeek V4 Pro 什么时候发、定价多少——它大概率是下一轮价格战的扳机;K3 跟美国云厂商的30%分成谈判结果——谈成了,开源旗舰的定价逻辑会重写;9月30日 Hy4 免费期结束后的价格——那才是腾讯的真实底牌。
这波洗牌对普通用户其实是好事:第一梯队的门槛被卷上来了,价格被卷下去了。你要做的只有一件事——别为"第一"买单,为你的场景买单。