8月26日晚上,阿里千问开源了Qwen3.8-Flash-Next,同晚智谱也放出了GLM-5.3-Flash——国产大模型又一次"连夜开源+连夜降价"。36氪不过四天过去,网上大部分文章还停留在"输入1元、输出3元"的发布夜价格上,而官方计价页其实已经悄悄改过一轮了。这篇文章把API路线和本地部署路线两笔账都算清楚,再决定要不要上车。
它到底是什么:Qwen4架构的"先导预览版"
先说清楚这次开源的是什么。Qwen3.8-Flash-Next不是Qwen4正式版,而是基于下一代Qwen4架构构建的先导预览版:主模型125B参数,外加51B的N-gram Embedding,每个token只激活6B参数;原生支持262144 token上下文,通过YaRN可以扩展到100万。36氪

千问团队自己放出的基准测试里,它在编程、智能体、多模态等大多数项目上超过了DeepSeek-V4-Flash正式版、Qwen3.8-27B和Claude Opus 4.6(Max),训练开销只有前代Qwen3.7-Plus的约1/9。36氪千问官方说法是:提前放出架构改动,是为了在Qwen4完整家族发布前,先让社区帮忙检验。
注意两个关键词:一是"预览版",二是"千问团队自己放出的基准测试"。这两点直接决定了后面的避坑部分。
API这笔账:真实价格是0.8元,不是1元
这次最有信息差的是价格。发布夜官方模型面板显示的是输入1元/百万tokens、输出3元、缓存命中0.016元;但随后官方计价页(platform.qianwenai.com/pricing/api)更新为输入0.8元、输出2.7元、缓存命中0.1元。B站最早做对比实测的UP主也专门置顶了更正:按新价重算,千问的综合成本约为DeepSeek V4 Flash空闲时段的84%、高峰时段的约42%。哔哩哔哩
这个"高峰约42%"才是关键。DeepSeek V4 Flash分高峰/空闲两档价,晚上干活最猛的时候价格上浮,而Qwen3.8-Flash目前是单一低价。也就是说,如果你习惯下班后让Claude Code跑长任务,新价下的千问在高峰时段反而便宜得多。
对用Claude Code、Codex的人来说,这次还有个实打实的便利:千问AI平台的API原生兼容Anthropic接口和OpenAI Chat Completions/Responses协议,官方明确可以直接配合Claude Code、Codex使用,不需要中间转换。36氪知乎这两天已经出现一批"CC-Switch一键切换Claude Code后端到国产API"的保姆级教程,说明这个玩法已经跑通了。知乎
简单算笔账:假设你是重度Claude Code用户,每天消耗约2000万tokens(其中九成是缓存命中的重复上下文),按新价估算,输入侧非缓存部分约1.6元、缓存命中约1.8元、输出约2.7元,一天6元上下,一个月180元左右。这个数字对习惯按官方订阅计费的人是数量级的差距,而且国产API不需要折腾海外支付和网络。更重要的是,这种用法正好落在它的主场:官方给出的实验里,90%前缀缓存命中率下,Flash-Next在1M上下文时的Prefill吞吐是前代Qwen3.7-Plus的8.6倍——重度Agent用户的高缓存复用场景,恰好是这套架构优化最狠的地方。36氪

本地部署这笔账:6B激活不等于你的电脑带得动
再看本地路线。B站社区这几天相当热闹:官方发布视频播放量两万多,实测部署视频评论区一百多条,很多人第一反应是——“每token只激活6B,那岂不是消费级显卡就能跑?”
答案是:不能,至少现在不能。
MoE模型的激活参数只决定推理时的计算量,但125B的主模型权重和51B的N-gram Embedding都得先装进存储。实测过的UP主和评论区反馈基本一致:128GB统一内存的Mac"不够,长上下文效率退化很严重";有海外开发者在llama.cpp上把N-gram Embedding卸载到SSD,才在DGX Spark这类128GB设备上单机跑起来,且声称不掉性能——也就是说,128GB目前只是"勉强够"的门槛,还得依赖社区魔改方案。哔哩哔哩评论区甚至有人直接说"这得要等到10月份的M5 Ultra 512G版才玩得开"。
更扎心的是效果。有用户实测后发现,量化版本(NVFP4、Q4)在部分任务上打不过BF16精度的Qwen3.8-27B,“知识问题打不过DeepSeek Flash的Q2”。哔哩哔哩评论区因此出现了灵魂拷问:"如果打不过27B,是不是就没有必要折腾了?“目前对大多数人来说,这个拷问的答案偏向"是”——27B稠密模型16GB显存就能跑,教程已经铺满B站,而Flash-Next的本地部署还处在"极客抢首发"阶段。
智谱那边也别急着对比:GLM-5.3-Flash(就是之前刷屏的匿名模型"牛来")目前本地部署只有全精度版,门槛只会更高。哔哩哔哩
三个坑,提前说清
第一,基准测试是千问团队自己测的,对比对象里最亮的两个是DeepSeek-V4-Flash-0731和Claude Opus 4.6(Max)——不是所有对手都是最新版本。36氪社区独立实测还在积累中,官方数据和体感之间的差距需要时间验证。

第二,知乎上已经有争议:这次开源的是预览版权重,原生1M上下文的完整权重并没有放出来,有开发者吐槽"回回开源社区都只能蹲一手阉割版"。知乎如果你指望拿开源权重做深度二次开发,先看清楚开放范围。
第三,它终究是预览版。千问明说这是给社区检验用的,真实复现、FP8部署、长上下文压测中暴露的问题会在Qwen4正式版里调优。拿它当生产环境主力后端之前,至少留一个备用模型。
结论:API是真香路线,本地先观望
把两笔账合起来,结论比较清楚:
如果你是Claude Code、Codex或者各类Agent的重度用户,现在就可以试API路线——0.8元/2.7元的定价、原生Anthropic协议、高峰期比DeepSeek便宜一半以上,切换成本几乎只是改一个base URL。建议先从非关键任务跑起,观察一两周稳定性。
如果你是想"模型自由"的本地部署党,Flash-Next现阶段不是为你准备的:128GB内存只是入场券,量化版还打不过更小的27B。不如先用27B过渡,等三件事——Qwen4正式版开源、llama.cpp生态把N-gram卸载做成标准方案、以及你钱包里的M5 Ultra 512G。
值得持续盯的信号:Qwen4完整模型家族的发布时间、DeepSeek V4 Flash会不会跟价、以及智谱GLM-5.3-Flash什么时候出量化版。这一轮国产模型价格战,大概率还没到底。