8月26日深夜,千问团队把 Qwen3.8-Flash-Next 的权重扔上了 HuggingFace 和魔搭:125B 总参的 MoE 多模态模型、每 token 只激活 6B,这是基于下一代 Qwen4 架构的先导预览版。智谱同晚跟进开源了 GLM-5.3-Flash。但真正该停下来看的是价格:即将上架千问AI平台的 `qwen3.8-flash`,每百万 token 输入 1 元、输出 3 元,比 DeepSeek-V4-Flash 最便宜的闲时价低 33.33%。36氪而它恰好只有 DeepSeek 高峰价的三分之一。网易
第一笔账:价格战的底色是"涨价",不是"内卷"
DeepSeek 8 月 17 日刚对 V4 系列提价,首次引入峰谷定价:V4-Flash 输出价格从每百万 token 2 元涨到高峰 9 元,涨幅 350%,缓存命中的输入价格涨了 400%。知乎需求的底座是真的——MiniMax 创始人在业绩会上报过一个数字:7 月的 token 消耗量是今年 1 月的 20 倍。所以千问这一刀砍的不是谁的成本,是把"刚被验证过的需求"用低价接走。对个人开发者:轻度挂 Codex 或 Claude Code 每月约 2000 万 token,账单从 39 元掉到 26 元;重度跑批上亿 token,省的是几十块。但如果你习惯白天跑任务,面对的是三倍的峰谷差。还有个没人放进标题的数字:在缓存命中率 90% 的设定下,1M 上下文的 prefill 吞吐是前代 Qwen3.7-Plus 的 8.6 倍,跑长上下文 Agent 的人,省下的时间比差价值钱。36氪
第二笔账:三个坑,换之前看清楚
“绝大多数第一”≠全赢。千问放出的基准里,仓库级代码生成测试略逊 DeepSeek,别拿它当全能冠军。36氪

两个"Qwen3.8"不是一回事:开源权重带 -Next 后缀、是预览版,API 上架的是 `qwen3.8-flash`、首发进千问办公。看测评别把两个版本混着比。
"激活 6B"不是低显存:125B 主干必须驻留,51B N-gram Embedding 靠提前确定查询位置放进主内存异步预取,外加 4B 的 MTP 模块,架构账要算全。知乎
第三笔账:本地部署,社区三天就把配方卷出来了
开源不到 72 小时,知乎已经有 unsloth int4 GGUF 的 4090 配方:生成 40 token/s、prompt 1100 token/s,100k 上下文降到 22,显存占用顶到 93%,靠 llama.cpp 卸载参数层跑出来的性能是有折扣的。知乎B 站同期还有一批 16GB 显存挖掘 27B 版的实测视频在更新。哔哩哔哩结论很清晰:24GB 级显卡能跑但跑不爽,vLLM/SGLang 对主模型参数层的卸载支持还得再等社区——对绝大多数人,1 元/百万 token 的 API 比买卡划算得多。

谁现在切,谁再等等
已在用 Claude Code/Codex 的:千问 API 兼容 OpenAI 与 Anthropic 协议,改个模型名十分钟跑通,今天就该拿真实负载测一轮账单。36氪长文档 Agent 用户:优先切,缓存吞吐是这代架构的隐藏红利。纯聊天用户、单卡 24GB 玩家、主战场是仓库级代码的:等 Qwen4 完整版、等社区量化生态、或干脆按兵不动。接下来盯三个信号:DeepSeek 九天前刚涨上去的价会不会被围剿打回去;GLM-5.3-Flash 限时一折到期后回不回原价;以及 Qwen4 发布会不会把这套"总参数不算数、激活参数定生死"的新架构直接变成行业标准。