Qwen3.8-Max凌晨登顶,国产第一梯队一夜洗牌:换模型前,先看这5个成本数字

源自32位全网作者

02:00

如果你这两天正在纠结要不要给AI工具续费、换模型,那刚刚发生的事值得你先停三分钟。

9月2日凌晨,阿里通义千问甩出 Qwen3.8-Max-0902:参数规模推到2.4万亿,上下文窗口稳定在100万token,输入定价每百万token 2美元、输出6美元。知乎 训练方向明确写着两个词——Coding 和 Cowork。同一天,它拿下 CodeArena 全球前端编程榜第一。知乎

Qwen3.8-Max凌晨登顶,国产第一梯队一夜洗牌:换模型前,先看这5个成本数字

更热闹的是隔壁:腾讯混元 Hy4 preview 上线才5天,服务器直接被用户挤爆,官方紧急扩容推理集群。微博 Hy4 preview 在 WorkBuddy 的限时免费,也延长到了9月30日。知乎 而月之暗面的 Kimi K3 反向操作,API 价格比上一代翻了5倍,输出每百万token 要100元。知乎 一边免费、一边降价、一边涨价,国产大模型第一梯队这轮洗牌,一天之内全摆上台面了。

先给结论:这波没有通杀的赢家,只有不同场景下的最优解。换不换、换谁,取决于你拿它干什么,以及你愿意为"第一"这两个字付多少钱。

先泼盆冷水:这些"第一"都是单项冠军

CodeArena 是 Arena.ai 旗下的编程盲测榜单,这次 Qwen3.8-Max 登顶的是 WebDev 前端开发分项,不是综合榜。往前翻,7月 Kimi K3 发布时,也曾在 CodeArena 前端盲测中拿到全球第一。知乎 这个榜单的头部席位是轮着坐的,而且只考"前端这一门"。看分差就知道轮换有多激烈:Qwen3.8-Max-0902 以1691分居首,只领先第二名 Claude Opus 5 三分(1688);此前坐过头把交椅的 Kimi K3 退到第三(1674);上线才五天的腾讯 Hy4 preview 也挤进了前六(1629)。小红书 单项冠军尚且几天一换座,综合强弱就更不是一张榜能说清的了。

36氪昨天一篇报道的标题说得很直白:《都说自己是第一,中国最强的大模型到底是谁?》。36氪 知乎上吵得更直接,有个高讨论度的回答是这么划线的:真正第一梯队的是 K3,摸到第一梯队的是 Qwen3.8-Max,其他都是"牛马模型",能干活,但别指望搞高精尖。知乎

Qwen3.8-Max凌晨登顶,国产第一梯队一夜洗牌:换模型前,先看这5个成本数字

所以看这波新闻的正确姿势是:别问"谁最强",问"我这个活儿谁最合适、谁最便宜"。

五家的主场,一张表看清

这轮混战里五家各有各的护城河:

Kimi K3:2.8万亿参数、100万上下文、权重开源,长程编程和 Agent 编排是强项,社区公认"快"。代价是价格——输入每百万token 20元、输出100元、缓存命中1元,比上一代翻了5倍。另外它正在跟微软、亚马逊、谷歌谈云上托管,想要最高30%的服务收入分成。知乎 这事如果谈成,开源旗舰的商业模式会是一个分水岭。

Qwen3.8-Max-0902:2.4万亿参数,这次主打 Coding 和 Cowork(多智能体协作),定价激进,输入约每百万token 12元、输出约36元。同时阿里还把 Qwen3.8-27B 直接开源,冲上 Hugging Face 趋势榜,知乎相关问题热度65万+,把一堆娱乐话题挤在后面。知乎

GLM-5.3:走的是开发者生态路线。OpenRouter 平台截至8月30日的一周,Token 消耗量达到113万亿,首次突破100万亿关口,智谱一家就有四款模型进入头部,超过 DeepSeek。知乎 之前匿名霸榜的神秘模型"Ox Alpha",8月26日被智谱官宣就是 GLM-5.3-Flash——免费预览期闷声刷量,正式亮明身份后依然稳居消耗榜前列。生态厚意味着第三方工具、网关、教程都最全。

DeepSeek V4:Flash 版打性价比,9月2日又放出视觉实验版。真正要盯的是两件事:V4 Pro 还没落地,以及 DeepSeek 刚开源的 Harness 智能体框架——社区已经在讨论它是"Agent 的新斩杀线",对标的是 Claude Code。

腾讯混元 Hy4 preview:770B总参、49B激活、100万上下文、全部开源,首发塞进自家 AI 办公平台 WorkBuddy,限时免费。官方同步放出的12项基准测试,把它和 Qwen 3.8 Max、DeepSeek V4 Pro、GLM 5.3、Kimi K3、GPT 5.6、Claude Opus 5 摆进同一张图,DeepSWE 这类编程项比上一代翻倍还多。知乎 办公场景实测也能打——45分钟出一份带数据校验的研究报告、1小时排查9个代码缺陷。缺点也写在明面上:慢,高峰排队5分钟起步。

Qwen3.8-Max凌晨登顶,国产第一梯队一夜洗牌:换模型前,先看这5个成本数字

真正该算的账:五个成本数字

模型再强,用起来烧不起也白搭。这轮竞争真正的胜负手在价格,五个数字值得记一下:

第一,输出价。Kimi K3 输出每百万token 100元,Qwen3.8-Max 约36元,差出将近3倍。如果你主要用它写长文档、出报告、跑长任务,输出价就是你账单的大头。

第二,缓存命中价——这是最容易被忽略的隐藏变量。长会话、长系统提示词、Agent 反复调用同一批上下文,走的全是缓存价:K3 缓存1元,Qwen 约1.2元(0.17美元),Hy4 preview 只要0.3元。对每天挂在 Agent 里跑几十轮的用户,缓存价的差异比输出价还疼。

第三,免费窗口。Hy4 preview 在 WorkBuddy 限时免费到9月30日,办公党、报告党可以先白嫖一个月再决定去留,零成本试错。

第四,订阅和按量的分界线。只在一家的官方工具里用,买订阅套餐通常划算;但一旦你混着用——比如 Claude Code 里接国产模型、自建 Agent 多模型路由——订阅额度就不灵活了,按量 API 加第三方网关反而省心。小红书上已经有人在问"opencode 套餐用完了,换智谱 Lite 还是别的",这就是典型的岔路口。小红书

第五,开源的隐性成本。Qwen3.8-27B 一张高端消费级显卡就能跑,数据不出内网;但本地部署要自己维护,时间也是钱。

Qwen3.8-Max凌晨登顶,国产第一梯队一夜洗牌:换模型前,先看这5个成本数字

顺带一提性价比的刻度:在 CodeArena 的性价比榜单(帕累托前沿)上,Qwen3.8-Max-0902 每百万token综合均价约5美元,被社区称为新一代前沿模型的"斩杀线",压在前沿的最前端。小红书 旗舰能力卖中端价,这就是它敢凌晨两点发布的底气。

所以,谁该换、谁该等

重度编程党:如果你现在用着 K3 按量计费、账单肉疼,可以把 Qwen3.8-Max-0902 拉进候选,先在自己的真实任务上跑两天盲测再换。前端、网页类开发它是当前的单项冠军。

办公文档党:别急着买任何东西,9月30日之前 Hy4 preview 免费,先让它替你出几份报告。注意它慢,适合"扔个任务去喝咖啡"的用法,不适合蹲在屏幕前等结果。

Kimi Code 订阅用户:K3 按量涨价5倍,对订阅用户反而像个锚点——先看套餐内的 K3 额度和限速有没有跟着变,再决定续不续。别被"涨价焦虑"推着做决定。

本地部署玩家:Qwen3.8-27B 和 Hy4 的开源权重都值得下,27B 量化后消费级显卡能跑,隐私敏感的场景这是唯一解。

最后留三个继续观察的信号:DeepSeek V4 Pro 什么时候发、定价多少——它大概率是下一轮价格战的扳机;K3 跟美国云厂商的30%分成谈判结果——谈成了,开源旗舰的定价逻辑会重写;9月30日 Hy4 免费期结束后的价格——那才是腾讯的真实底牌。

这波洗牌对普通用户其实是好事:第一梯队的门槛被卷上来了,价格被卷下去了。你要做的只有一件事——别为"第一"买单,为你的场景买单。

内容由AI生成

精选参考来源

1. Qwen3.8-Max-0902 发布:2.4T 参数、1M 上下文,2 美元/百万 token——通义千问又扔了一颗核弹

2. 如何评价阿里 Qwen3.8-Max 登顶 CodeArena 全球前端编程第一?国产大模型代码能力深度解析

3. 腾讯混元Hy4 preview上线即爆火!调用激增WorkBuddy已紧急扩容

4. 如何看待 Kimi K3 模型价格较上一代翻5倍,达到输出100元,输入20元,缓存命中1元?

5. 《"元坐标"视域下的AI治理方案——从KimiK3的"幻觉"跃升到OpenAI的自主入侵失控事件》

6. 海外模型依然强大,但国模不是"追赶者"了

7. 都说自己是第一,中国最强的大模型到底是谁?

8. 为什么kimi、glm、deepseek v4、qwen3hy4都快速达到了第一梯队水平?

9. KimiK3要向美国云厂商"收租"了:开放权重模型的商业化分水岭

10. 阿里Qwen3.8开源登顶,65万人围观:国产大模型这次真的赢了吗

11. 周Token消耗榜丨113万亿再创新高,智谱四款模型入榜首超DeepSeek

12. coding plan 推荐

13. qwen3.8-max-0902发布,codearena登顶

14. 腾讯混元发布并开源Hy4 preview

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章