当前位置:
AIGC文章详情

总参176B,激活只有6B:Qwen3.8-Flash-Next明晚开源,熬夜蹲之前先把这几笔硬件账算清

源自317位全网作者

07:05

本地部署圈昨晚有点躁动。

8月25日,Qwen悄悄在ModelScope挂出了Qwen3.8-Flash-Next的模型页:明晚8月26日23点(北京时间),权重正式开源。哔哩哔哩微博名字带着3.8,官方页面却写得很明白——这是一款基于下一代Qwen4架构构建的多模态MoE模型。微博Qwen4还没正式发布,架构先放出来了。

总参176B,激活只有6B:Qwen3.8-Flash-Next明晚开源,熬夜蹲之前先把这几笔硬件账算清

B站几个速报视频的评论区,已经刷起了"源神"。哔哩哔哩但兴奋归兴奋,对本地部署玩家来说,明晚之前要做的第一件事不是清空硬盘,而是先把这几笔硬件账算清楚。

模型页上的三个数字:176B、6B、51B

先看已经公开的信息。官方简介里的定位写得很直白:“通过引入GDN混合架构以及Qwen稀疏注意力机制(QSA)等全新的架构变更,Qwen3.8-Flash-Next探索了下一代模型能力与性能的新前沿”,探索方向是Agentic编程、长程任务以及多模态智能。微博

而速报视频的标题直接把三个数字摆了出来:总参176B、激活参数6B,外加51B的N-gram查表。哔哩哔哩

MoE是什么,本地部署的老玩家都懂:总参决定"占多大地方",激活参数决定"算得多费劲"。6B的激活,意味着每个token的计算负载大致相当于一款6B级稠密模型——这正是让消费级硬件党兴奋的点:理论上,能跑27B的机器都带得动它。问题只剩一个:176B的权重,得先放得下。评论区有人已经做了道加法:125B的MoE,加上51B的N-gram查表,约等于176B总参。哔哩哔哩这个拆法是否准确,要等明晚开源后验证,但这三个数字基本决定了它瞄准的是什么硬件。

这也是社区第一处分歧的来源。评论区对Flash-Next的能力预期出奇地克制:高赞评论写的是"高情商:能力对标qwen3.7 plus,低情商:能力对标qwen3.8 27b"。哔哩哔哩大家默认它是追速度的Flash位模型,不是旗舰。还有人在底下追问"没有35b a3b了吗"——小尺寸变体的呼声,从预告片评论区一直延续到了27B的部署帖里。

全社区为什么都在等MoE:27B把小显存用户折腾了十天

要理解这次预告的热度,得把时间往回拨一点。8月14日,Qwen3.8-27B开源,官方承诺"所有开发者、科研机构和企业均可自由下载、部署和使用"。知乎这个27B稠密模型确实能打,知乎上最高赞的评价说得直白:“你本地部署一个Qwen3.8-27B,你将拥有一个Opus4.6”。知乎海外开发者那边也流传着一句很有传播力的说法:“Qwen3.8-27B是能在你笔记本上免费运行的Opus4.6Max”。微博但接下来的十天,本地部署圈一直在跟一件事较劲:显存。

满血BF16版要55.6G显存,量化版能压到17G。哔哩哔哩基于官方4比特量化版的优化教程已经能做到200K上下文,文件占用17.74GB。知乎而在那条16G显存跑27B的热门视频下,UP主的Q3量化实测最快能调到70t/s,点赞最高的评论是"我也在等a3b,跑27b还是太为难16GB显卡了"。哔哩哔哩

等的就是这种MoE:能力往上走,激活往下走,消费级硬件也能跑。连那位16G视频的UP主都在简介里写"期待Qwen3.8 35B-A3B和Qwen3.8 122B-A10B的开源"。哔哩哔哩Flash-Next不是孤例,社区把它看作Qwen3.8系MoE阵容开闸的信号。

三笔硬件账:你的机器在哪一档

权重还没放出来,精确显存占用给不了,但估算方法不复杂:权重体积≈参数量×每参数字节数,4bit量化大约按每参数0.5~0.6字节算。按UP主们整理的量化档位常识,4bit是主流选择:体积约满血的1/3,质量损失不到一成,8bit近无损则要32GB起步。哔哩哔哩把Flash-Next的三个数套进去:

  • MoE部分(社区推测约125B):Q4量化约需70GB空间;IQ系极限量化还能再压,代价是效果。

  • N-gram查表(51B):这次最大的变量。查表的性质决定了它未必和权重抢显存,很可能放到内存里——但以什么格式存、加载策略如何,都要等开源。这直接决定128GB的机器是"刚好够"还是"不够"。

  • KV cache与多模态:官方定位里有长程任务和多模态,长上下文吃KV缓存,图像输入要额外加载视觉编码器,预算都要留余量。

对号入座,本地部署用户手里的三类常见配置:

第一档:128GB级统一内存机器——Mac Studio(M3 Ultra)、NVIDIA DGX Spark、以及基于DGX Spark方案打造的华硕Ascent GX10。小红书这一档大概率是Flash-Next的第一甜点:Q4全套权重整体放进统一内存,6B激活虽有带宽压力但可用性在线。评论区已经有人喊"我的128G统一内存主机已经饥渴难耐了",还有人更现实地担心起价格。哔哩哔哩手里有这档机器的,明晚值得蹲。

总参176B,激活只有6B:Qwen3.8-Flash-Next明晚开源,熬夜蹲之前先把这几笔硬件账算清

第二档:24~32G显存+64~96G内存——多数本地部署玩家的主力配置。全量塞进显存没戏,现实路径是等IQ量化+CPU混合卸载,评论区"喔吼,我的12G显卡+96G内存可以整活了吗"的期待就是这种玩法。哔哩哔哩要有心理预期:MoE本地推理的瓶颈在内存带宽,卸载之后的速度,不能对标同激活规模的稠密模型。参考先例:百B级MoE Qwen3.5-122B-A10B此前已经有人在Ollama上本地跑通——路子是通的,速度看配置。知乎

第三档:16G及以下显存、没有大内存——说实话,这个模型暂时与你无关。16G硬上176B的极限量化,不叫部署,叫受刑。安心把27B量化版用好,或者等Qwen后续会不会放小尺寸变体——从27B部署帖到Flash-Next预告片,等35B-A3B的人一直不少,那才是小显存的真正甜点。

等明晚,还是先用27B?

这个问题两边其实都有清晰答案。值得等的:你有Agentic编程、长程任务的需求,而27B稠密的上下文和显存上限已经让你捉襟见肘;或者你正好有128GB级机器,MoE就是为你准备的;又或者你对27B的多模态能力不满——Flash-Next从定位上就覆盖了Agentic编程、长程任务与多模态智能。微博

不用急着换的:27B的生态已经磨合了十天,成熟度摆在那。上周Inco AI团队开源的27B投机解码草稿模型DFlash2,参数量1.92B、约3.85GB。知乎它的平均接受长度达到4.80,高于Qwen3.8原生MTP的4.28,已有UP主在4090 24G上把Qwen3.8-27b-Q4的生成速度实测拉到80Token每秒。哔哩哔哩llama.cpp几天前也刚更新0.2.0大版本,官方视频标题直接写着"速度提升42%?"。哔哩哔哩开箱即用的体验,Flash-Next开源首日大概率追不上这个状态。

总参176B,激活只有6B:Qwen3.8-Flash-Next明晚开源,熬夜蹲之前先把这几笔硬件账算清

模型等得起,也就一个晚上;贵的是你不确定自己的硬件装不装得下、跑不跑得动、用不用得上。所以,与其熬夜抢下载,不如把明晚当成"信息核对之夜"。

明晚23点,先核对这五件事

  1. 许可证:是否延续27B的Apache 2.0——这是本地部署能否放心用于生产的前提。哔哩哔哩

  2. 文件体积与量化:原始权重多大,unsloth系GGUF全套量化是否同步上架——上次27B开源,第二天量化就挂上了ModelScope,下载量一天破万。知乎

  3. N-gram查表的存储格式:它直接决定128GB机器是"刚好够"还是"不够"。

  4. 上下文长度:长程任务的定位下,KV缓存预算要跟上下文一起算。

  5. 工具链支持:llama.cpp、Ollama、MLX首日能不能跑,多模态输入是否就绪——GDN混合架构和QSA稀疏注意力,对推理框架也是新东西。

最后给已经决定熬夜的朋友提个醒:本地部署这行,开源模型永远不缺,缺的是适合自己的那台机器。明晚的Flash-Next,可能是本地部署圈硬件焦虑被集体治愈的开始——如果总参、激活、查表三笔账都算得过来的话;也可能只是新一轮焦虑的开端。

23点,见分晓。

内容由AI生成

精选参考来源

1. Qwen3.8-Flash-Next重磅来袭:176B总参、6B激活、51BN-gram查表Qwen4架构

2. 【基于下一代Qwen4架构所构建的多模态MoE模型,阿里千问预告明晚开源Qwen3.8-Flash-Next】魔搭社区(ModelScope)显示,阿里千问Qwen3.8-Flash-Next模型将于北京时间08月26日23:00开源。

3. 咦Qwen还有新货~Qwen3.8-Flash-Next,明天开源。

4. 刚刚,Qwen3.8-27B开源了!

5. 如何评价阿里开源的Qwen3.8-27B?

6. 阿里刚刚开源了Qwen3.8-27B模型,在海外开发者那口碑不错。

7. 千问3.8-27B本地部署全攻略:满血55.6Gvs量化17G,配置/显存/成本对比

8. 24G显卡本地运行Qwen3.827b的一些优化经验

9. 16G显存Qwen3.827B本地部署Hermes实现PPT自由

10. 华硕GX10超算主机,128G+8T大容量

11. 用ollama跑从别的地方下载的模型

12. Qwen3.8-27B-DFlash2开源:1.92B草稿模型,SGLang单并发吞吐达自回归3.4倍

13. DSFlash2双倍Token生成速度,Qwen3.8-27b-Q4,80Token每秒,4090显卡24GB本地部署

14. 快更新!llama.cpp更新大版本0.2.0:速度提升42%?

15. Qwen3.8-27B实测:V100上的部署要点与Q4/Q8全量基准

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章