今晚,魔搭社区悄悄上线了 Qwen3.8-Flash-Next 的预发布页,权重定在北京时间明晚(8月26日)23:00 正式开源。微博哔哩哔哩微博

我知道很多人在想什么:Qwen3.8-27B 才开源了一周,我教程刚看完、量化版刚下好,新的就来了?现在跑起来,会不会明天就过时?
先说结论,再摆依据:值不值得等这 24 小时,不取决于新模型多强,取决于你手上是什么硬件。 我分三类情况给你答案,但在那之前,得先把 Flash-Next 到底是什么说清楚——因为现在社区传的消息,有真的,也有互相打架的。
先弄清楚:Flash-Next 确认的和不确认的
确认的部分,多个信源能对上:
这是一款基于下一代 Qwen4 架构的多模态 MoE 模型。微博IT之家、多位科技博主都引用了魔搭预告页的信息,官方描述里有两个关键架构变化:一是 GDN 混合架构(这个在 3.8-27B 上已经用过,三层线性注意力加一层全注意力的组合),二是新的 Qwen 稀疏注意力机制(QSA)。官方给它的定位很明确:Agentic 编程、长程任务、多模态智能。
有意思的是它的名字——挂着 3.8 的编号,底子却是 Qwen4 架构。按社区的理解,这等于 Qwen4 正式发布前,先把架构层面的进步拿出来让社区跑起来、适配起来。微博
不确认的部分,你必须知道:参数量现在是一笔糊涂账。
目前社区流传着两个版本。一个是 B 站有博主从模型页信息整理出的"176B 总参数、6B 激活、51B N-gram 查表"。哔哩哔哩另一个是微博上有人猜测"莫非就是之前传的 Qwen3.8-35B-A3B"。微博这两个说法互相矛盾,官方都还没盖章。看到任何把某个参数量当确定事实传播的内容,先留个心眼,一切以明晚 23:00 开源时的实际文件为准。
MoE 对想本地跑的人意味着什么
这是全文最值钱的一段,因为大多数快讯只会告诉你"新模型来了",不会告诉你架构变化对你那台机器意味着什么。
Qwen3.8-27B 是稠密模型:27B 参数,你生成每一个 token,这 27B 参数都要完整参与计算。所以它吃显存的量基本等于"参数量×量化位数",Q4 量化版 16GB 显存就能跑,这是它对普通玩家最友好的地方。但代价是速度受内存带宽限制——这也是为什么社区这一周都在折腾 MTP 推测解码给它提速,RTX 4090 从 47.7 tok/s 提到 76.3,A6000 从 26.7 提到 52.5,都是为了让稠密模型"跑得不那么憋屈"。36氪

Flash-Next 是 MoE(混合专家),逻辑完全反过来:每个 token 只激活一小部分参数,所以解码速度天然快得多;但总参数量决定你要装下它需要多少显存/内存。 一句话总结:MoE 是速度怪物,但也是容量怪物。
由此可以推出两个判断(注意,这是基于架构原理和社区爆料的推断,明晚实测为准):
如果它真是 176B 总参的大 MoE,那基本是云端和机房的事,消费级显卡不用惦记,连 64GB 的 Mac 都得靠极致量化挣扎;
如果它是 35B-A3B 这类小 MoE,Q4 量化大约 20GB 上下,24GB 显卡刚好装下,而 3B 级激活参数意味着解码速度会比 27B 稠密快一大截——那对本地玩家就是实打实的代际升级。
两种可能,对应的策略完全不同。所以下面的建议,我把两种情况都覆盖了。
三类硬件,三种答案
第一类:16GB 及以下显存,或者普通笔记本。别等,27B 就是你的菜。
理由很直接:不管 Flash-Next 是哪个尺寸,总参数量大概率超出你的显存预算——176B 不用想,就算 35B 的 Q4 也得 20GB 起步。而 27B 这一周的生态成熟度是实打实的:开源两天下载破百万,社区贡献了约 500 个量化版本。36氪vLLM、SGLang、Ollama、LM Studio 第一天全部跟进,NVIDIA、AMD、平头哥、摩尔线程都完成了适配。你现在部署,用的是一个被上百万人踩过的成熟方案。

顺便提醒一句:如果你已经跑上了 27B 但觉得慢、觉得"编程能力不如宣传",先别怪模型。这一周社区的真实反馈是——同一份权重,chat template、推理框架、reasoning_effort 设置不同,表现天差地别。哔哩哔哩有人测出它代码能力不如 Gemma4,换个框架就正常了。小红书默认的高强度思考模式也会让简单任务慢得离谱。知乎这是调教问题,不是模型问题,调好了再决定去留。
第二类:24GB 显存,或 64GB 以上统一内存的 Mac。值得等这 24 小时。
你的硬件正好卡在"小 MoE 能装下"的门槛上。如果明晚开出来的是 35B-A3B 这类尺寸,你将获得比 27B 快得多的解码体验,而能力预期还不低——官方把它放在 Agentic 编程和长程任务的探索前沿。等待成本只有一天,潜在回报是架构级的。
而且参考 27B 的节奏:发布 12 小时内 HuggingFace 趋势榜登顶,两天内约 500 个量化版本,推理框架当天适配。36氪Flash-Next 的生态落地大概率也是这个速度,你不需要等很久才有"能用的版本"。

第三类:纯用云端、没有本地硬件。不用部署,但明晚值得围观。
Flash-Next 是 Qwen4 架构的首次公开亮相,它跑出来的水平,基本预告了接下来 Qwen 全系(包括云端 API)的方向。看个热闹也有信息量。
明晚 23:00 的围观清单
不管你等不等,明晚开源后建议按这个顺序看,比刷情绪帖有效率:
参数量和激活参数——两个社区传闻当场见分晓,也直接决定你的硬件装不装得下;
协议——27B 用的是 Apache 2.0,商用无忧;Flash-Next 如果同样宽松,价值翻倍;
上下文长度和是否带 MTP——决定长任务能力和后续提速空间;
推理框架首日支持——vLLM、SGLang、Ollama、LM Studio 谁先跟上;
量化版本速度——Q4 GGUF 多快出现,决定普通玩家多快能上手;
首波实测对比 27B——重点看编程和 Agent 场景,别看总分。
最后说句实在话:这一波开源模型的节奏已经快到"周更"了,27B 才一周,Flash-Next 就来,后面还有正式版 Qwen4。追是追不完的,硬件和用途才是你自己的锚。24 小时不长,等得起的就等一个明确答案;等不起的,27B 现在依然是本地能跑到的第一梯队,不亏。