当前位置:
AIGC文章详情

Qwen3.8-Flash-Next 明晚 23:00 开源:Qwen4 架构首秀,想本地跑的用户值得等这 24 小时吗?

源自36位全网作者

06:37

今晚,魔搭社区悄悄上线了 Qwen3.8-Flash-Next 的预发布页,权重定在北京时间明晚(8月26日)23:00 正式开源。微博哔哩哔哩微博

Qwen3.8-Flash-Next 明晚 23:00 开源:Qwen4 架构首秀,想本地跑的用户值得等这 24 小时吗?

我知道很多人在想什么:Qwen3.8-27B 才开源了一周,我教程刚看完、量化版刚下好,新的就来了?现在跑起来,会不会明天就过时?

先说结论,再摆依据:值不值得等这 24 小时,不取决于新模型多强,取决于你手上是什么硬件。 我分三类情况给你答案,但在那之前,得先把 Flash-Next 到底是什么说清楚——因为现在社区传的消息,有真的,也有互相打架的。

先弄清楚:Flash-Next 确认的和不确认的

确认的部分,多个信源能对上:

这是一款基于下一代 Qwen4 架构的多模态 MoE 模型微博IT之家、多位科技博主都引用了魔搭预告页的信息,官方描述里有两个关键架构变化:一是 GDN 混合架构(这个在 3.8-27B 上已经用过,三层线性注意力加一层全注意力的组合),二是新的 Qwen 稀疏注意力机制(QSA)。官方给它的定位很明确:Agentic 编程、长程任务、多模态智能。

有意思的是它的名字——挂着 3.8 的编号,底子却是 Qwen4 架构。按社区的理解,这等于 Qwen4 正式发布前,先把架构层面的进步拿出来让社区跑起来、适配起来。微博

不确认的部分,你必须知道:参数量现在是一笔糊涂账。

目前社区流传着两个版本。一个是 B 站有博主从模型页信息整理出的"176B 总参数、6B 激活、51B N-gram 查表"。哔哩哔哩另一个是微博上有人猜测"莫非就是之前传的 Qwen3.8-35B-A3B"。微博这两个说法互相矛盾,官方都还没盖章。看到任何把某个参数量当确定事实传播的内容,先留个心眼,一切以明晚 23:00 开源时的实际文件为准。

MoE 对想本地跑的人意味着什么

这是全文最值钱的一段,因为大多数快讯只会告诉你"新模型来了",不会告诉你架构变化对你那台机器意味着什么。

Qwen3.8-27B 是稠密模型:27B 参数,你生成每一个 token,这 27B 参数都要完整参与计算。所以它吃显存的量基本等于"参数量×量化位数",Q4 量化版 16GB 显存就能跑,这是它对普通玩家最友好的地方。但代价是速度受内存带宽限制——这也是为什么社区这一周都在折腾 MTP 推测解码给它提速,RTX 4090 从 47.7 tok/s 提到 76.3,A6000 从 26.7 提到 52.5,都是为了让稠密模型"跑得不那么憋屈"。36氪

Qwen3.8-Flash-Next 明晚 23:00 开源:Qwen4 架构首秀,想本地跑的用户值得等这 24 小时吗?

Flash-Next 是 MoE(混合专家),逻辑完全反过来:每个 token 只激活一小部分参数,所以解码速度天然快得多;但总参数量决定你要装下它需要多少显存/内存。 一句话总结:MoE 是速度怪物,但也是容量怪物。

由此可以推出两个判断(注意,这是基于架构原理和社区爆料的推断,明晚实测为准):

  • 如果它真是 176B 总参的大 MoE,那基本是云端和机房的事,消费级显卡不用惦记,连 64GB 的 Mac 都得靠极致量化挣扎;

  • 如果它是 35B-A3B 这类小 MoE,Q4 量化大约 20GB 上下,24GB 显卡刚好装下,而 3B 级激活参数意味着解码速度会比 27B 稠密快一大截——那对本地玩家就是实打实的代际升级。

两种可能,对应的策略完全不同。所以下面的建议,我把两种情况都覆盖了。

三类硬件,三种答案

第一类:16GB 及以下显存,或者普通笔记本。别等,27B 就是你的菜。

理由很直接:不管 Flash-Next 是哪个尺寸,总参数量大概率超出你的显存预算——176B 不用想,就算 35B 的 Q4 也得 20GB 起步。而 27B 这一周的生态成熟度是实打实的:开源两天下载破百万,社区贡献了约 500 个量化版本。36氪vLLM、SGLang、Ollama、LM Studio 第一天全部跟进,NVIDIA、AMD、平头哥、摩尔线程都完成了适配。你现在部署,用的是一个被上百万人踩过的成熟方案。

Qwen3.8-Flash-Next 明晚 23:00 开源:Qwen4 架构首秀,想本地跑的用户值得等这 24 小时吗?

顺便提醒一句:如果你已经跑上了 27B 但觉得慢、觉得"编程能力不如宣传",先别怪模型。这一周社区的真实反馈是——同一份权重,chat template、推理框架、reasoning_effort 设置不同,表现天差地别。哔哩哔哩有人测出它代码能力不如 Gemma4,换个框架就正常了。小红书默认的高强度思考模式也会让简单任务慢得离谱。知乎这是调教问题,不是模型问题,调好了再决定去留。

第二类:24GB 显存,或 64GB 以上统一内存的 Mac。值得等这 24 小时。

你的硬件正好卡在"小 MoE 能装下"的门槛上。如果明晚开出来的是 35B-A3B 这类尺寸,你将获得比 27B 快得多的解码体验,而能力预期还不低——官方把它放在 Agentic 编程和长程任务的探索前沿。等待成本只有一天,潜在回报是架构级的。

而且参考 27B 的节奏:发布 12 小时内 HuggingFace 趋势榜登顶,两天内约 500 个量化版本,推理框架当天适配。36氪Flash-Next 的生态落地大概率也是这个速度,你不需要等很久才有"能用的版本"。

Qwen3.8-Flash-Next 明晚 23:00 开源:Qwen4 架构首秀,想本地跑的用户值得等这 24 小时吗?

第三类:纯用云端、没有本地硬件。不用部署,但明晚值得围观。

Flash-Next 是 Qwen4 架构的首次公开亮相,它跑出来的水平,基本预告了接下来 Qwen 全系(包括云端 API)的方向。看个热闹也有信息量。

明晚 23:00 的围观清单

不管你等不等,明晚开源后建议按这个顺序看,比刷情绪帖有效率:

  1. 参数量和激活参数——两个社区传闻当场见分晓,也直接决定你的硬件装不装得下;

  2. 协议——27B 用的是 Apache 2.0,商用无忧;Flash-Next 如果同样宽松,价值翻倍;

  3. 上下文长度和是否带 MTP——决定长任务能力和后续提速空间;

  4. 推理框架首日支持——vLLM、SGLang、Ollama、LM Studio 谁先跟上;

  5. 量化版本速度——Q4 GGUF 多快出现,决定普通玩家多快能上手;

  6. 首波实测对比 27B——重点看编程和 Agent 场景,别看总分。

最后说句实在话:这一波开源模型的节奏已经快到"周更"了,27B 才一周,Flash-Next 就来,后面还有正式版 Qwen4。追是追不完的,硬件和用途才是你自己的锚。24 小时不长,等得起的就等一个明确答案;等不起的,27B 现在依然是本地能跑到的第一梯队,不亏。

内容由AI生成

精选参考来源

1. 【基于下一代 Qwen4 架构所构建的多模态 MoE 模型,阿里千问预告明晚开源 Qwen3.8-Flash-Next】魔搭社区(ModelScope)显示,阿里千问 Qwen3.8-Flash-Next 模型将于北京时间 08 月 26 日 23:00 开源。

2. 咦 Qwen还有新货~ Qwen3.8-Flash-Next,明天开源。“Qwen3.8-Flash-Next 是基于下一代 Qwen4 架构所构建的多模态 MoE 模型。通过引入 GDN 混合架构以及 Qwen 稀疏注意力机制(QSA)等全新的架构变更,Qwen3.8-Flash-Next探索了下一代模型能力与性能的新前沿, 在Agentic编程,长程任务以及多模态智能等方面都展现了突出的能力。我们提前发布这些架构上的改进,以便社区能为即将推出的完整 Qwen4 模型家族做好准备。”

3. Qwen4还没发,架构先来了:Qwen3.8-Flash-Next明晚发布阿里把 Qwen4 的下一代架构提前拿出来了。ModelScope 上线 Qwen3.8-Flash-Next 预告页,这是一款基于 Qwen4 架构的多模态 MoE(混合专家模型,每次只调用部分参数),预计 8 月 26 日 23:00 公开发布。官方称,提前放出这套架构,是为了让社区为后续完整的 Qwen4 模型家族做准备。所以严格说,明晚来的还不是 Qwen4 正式版,更像是一次「Qwen4 技术预览」。这种做法阿里以前用过。2025 年 Qwen3-Next 率先引入 Gated DeltaNet 和普通注意力混合架构,后来 Qwen3.5 系列继续沿用了这套设计。阿里本月初才发布 2.4T 参数的 Qwen3.8-Max,不到一个月就开始公开下一代架构,节奏相当快。

4. #Qwen3.8-Flash-Next# 莫非就是之前传的 #Qwen3.8-35B-A3B#

5. Qwen3.8-Flash-Next重磅来袭:176B 总参、6B 激活、51B N-gram 查表 Qwen4 架构

6. [速报] Qwen4 级架构来了!Qwen3.8-Flash-Next 明晚 23 点开源

7. 从模型能力到工程优化,海外开发者正在“榨干” Qwen3.8-27B

8. Qwen3.8-27B 被称为新的「模型斩杀线」,为什么?如何看待这一变化?

9. qwen3.8:27b VS Gemma4:31b

10. 同模型不同命?实测Qwen3.8在Pi Agent与OpenCode中的表现差异 | Cloud Codes

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章