千问Qwen4架构提前剧透:四大核心升级重塑大模型效率

源自47位全网作者

07:30

近期,千问开源了基于其下一代 Qwen4 架构打造的 Qwen3.8-Flash-Next 模型,并开放了模型权重。此举并非一次常规的产品迭代,而是将下一代旗舰模型 Qwen4 的核心架构提前向整个开源社区进行了一次“预演”。这一新架构的核心思路在于,用更少的计算换取更高的智能,将算力更精准地分配到有价值的地方。

千问Qwen4架构提前剧透:四大核心升级重塑大模型效率

Qwen3.8-Flash-Next 是一款采用混合专家(MoE)架构的多模态模型。其主模型参数量达到 125B(1250亿),但得益于稀疏激活技术,在处理每个 token 时,实际参与计算的“激活参数”仅为 6B。这种设计允许模型在保持巨大知识容量的同时,大幅降低单次推理的计算成本。官方数据显示,新模型的训练成本仅为上一代旗舰 Qwen3.7-Plus 的约九分之一,但在代码和办公等关键任务上,其能力反而实现了超越。

相较于前代,Qwen4 的架构雏形主要呈现出四大值得关注的变化:

在注意力机制上,模型采用了 Gated DeltaNet (GDN) 与 Qwen Sparse Attention (QSA) 相结合的混合架构。在每四层网络中,有三层使用 GDN 将历史信息高效地压缩到一个固定大小的状态中,好比为长篇文档撰写一份“浓缩笔记”。剩下的一层则使用 QSA,通过一个轻量级索引器,在“微块(micro-block)”粒度上精准地从原文中检索最相关的内容。这种“高效记忆”与“精准查找”的组合,显著降低了处理百万级长上下文时的计算和显存开销,在 1M token 的场景下,其内核最高可实现数倍的加速。

在残差连接上,新架构引入了门控残差(Gated Residual)机制。它将传统 Transformer 中单一的信息传递通道扩展为四条并行的“车道”,并利用动态门控来智能控制每条“车道”上信息的读写。这种设计改善了信息在深层网络中的传递效率,避免了关键信息在传递过程中被稀释或干扰,从而提升了模型的训练稳定性和最终性能。

再次,在模型容量扩展方式上,新架构引入了高达 51B 参数的 N-gram Embedding。这可以理解为一个巨大的“外挂记忆库”或“短语查询表”。它利用局部上下文(如当前词和前几个词组成的短语)直接查表获取信息,以极低的计算代价为模型补充了丰富的局部模式记忆。值得一提的是,这部分参数可以被卸载到成本更低的主机内存中,通过异步预取与模型计算重叠,在不长期占用宝贵 GPU 显存的情况下,有效扩展了模型容量。

在训练优化方面,新架构采用了 Muon Optimizer,并针对新架构的特性重新拟合了缩放定律(Scaling Law)。通过对不同类型的参数采用不同的优化策略,模型得以在更稳定、高效的状态下进行训练。这使得训练过程可以直接从目标批次大小开始,省去了传统的预热阶段,进一步提升了训练效率和吞吐量,是实现训练成本大幅下降的关键。

千问通过 Qwen3.8-Flash-Next 提前展示了 Qwen4 的核心设计哲学:从单纯追求参数规模,转向对计算效率和智能密度的极致探索。通过在注意力、残差、知识存储和训练优化等多个环节进行系统性创新,新架构实现了“计算稀疏、参数访问稀疏、上下文访问稀疏”的全面优化。将这一架构先行开源,也体现了一种新的开源策略——让整个开发者社区提前参与到下一代架构的验证与生态建设中,为未来 Qwen4 完整系列的落地铺平道路。

内容由AI生成

精选参考来源

1. Qwen3.8-Flash开源,Qwen4架构雏形提前曝光

Qwen3.8-Flash开源,Qwen4架构雏形提前曝光 Qwen3.8-Flash刚刚发布,真正值得关注的可能不只是“更强、更快、更便宜”,而是——千问把下一代Next架构也一起拿出来了。 1

2. 仅6B激活就干翻旗舰!千问4预览版开源了

仅6B激活就干翻旗舰!千问4预览版开源了 千问这波操作是真的"开源"。半夜发布Qwen3.8-Flash-Next:Qwen4架构的早期预览版,开放权重,直接能下载。官方推文一天120万浏览,读完28

3. Qwen3.8 Flash 开源,比 qwen3.8-27B 更好

Qwen3.8 Flash 开源,比 qwen3.8-27B 更好 Qwen 开源了 Qwen3.8-Flash-Next。 它不是 Qwen4 本身,而是 Qwen4 架构的提前开源预览,类似当年

4. Qwen3.8-Flash-Next开源,Qwen4架构先行

Qwen3.8-Flash-Next开源,Qwen4架构先行 Qwen 正式开源 Qwen3.8-Flash-Next。 Qwen3.8-Flash-Next率先开放了下一代 Qwen4 的架构:

5. Qwen4 还没来,千问先把下一代架构亮出来了

Qwen4 还没来,千问先把下一代架构亮出来了 8月26日,千问发布 Qwen3.8-Flash,并开放 Qwen3.8-Flash-Next 权重。Next 命名更强调它的另一层身份:Qwen4下一

6. Qwen4架构提前露面了?干翻 A 社🐶

Qwen4架构提前露面了?干翻 A 社🐶 作为天天泡开源社区的开发者,Qwen这波我是真没跟上。Qwen4下一代架构,已通过Qwen3.8 Flash-Next公开预演,核心升级 4 点👇 1️⃣

7. Qwen下一代架构首秀

Qwen下一代架构首秀 千问这次发布Qwen3.8-Flash,真正值得看的可能不只是模型又快了、又便宜了,而是Qwen把下一代模型架构提前拿出来了。 Qwen3.8-Flash总Transfor

8. ⚡Qwen4还没发,阿里为什么先上Flash?

⚡Qwen4还没发,阿里为什么先上Flash? 北京时间今晚 11 点(27日 00:00 UTC+9),Qwen3.8-Flash-Next 正式开源,附带 FP8 量化版。 官方给的定调:直接

9. 阿里千问正式发布Qwen3.8-Flash

阿里千问正式发布Qwen3.8-Flash 阿里千问正式发布Qwen3.8-Flash界面快讯1787748215 8月26日,阿里千问正式发布Qwen3.8-Flash。据介绍,这是一个多模态MoE

10. 突发,Qwen3.8今天开源

突发,Qwen3.8今天开源 🚨突发 Qwen今天将正式开源 Qwen3.8-Flash-Next🔥 官方倒计时页面已经挂出来了 预计北京时间8月26日23点开放权重 但这个名字真的有点会骗人

11. 千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注?

千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注? 虽然今天晚上整个圈子的风头几乎被智谱GLM-5.3-Flash给完全夺走了。但对于天天折腾本地部

12. Qwen3.8-Flash架构曝光,极致性价比

Qwen3.8-Flash架构曝光,极致性价比 分享一下Qwen3.8-Flash 架构图,Qwen4 架构早期开源预览 规模:125B 主干 MoE + 51B N-gram Embedding

13. Qwen3.8-Flash-Next 为什么只激活 6B?

Qwen3.8-Flash-Next 为什么只激活 6B? Qwen3.8-Flash-Next 的几个参数数字很容易被混在一起:总权重约 180B,语言主模型 125B,每个 token 在主干里激

14. 阿里云发布 Qwen3.8-Flash-Next,基于下一代 Qwen4 架构

阿里云发布 Qwen3.8-Flash-Next,基于下一代 Qwen4 架构 阿里云发布 Qwen3.8-Flash-Next,基于下一代 Qwen4 架构西瓜散人1787664331 8 月,阿里

15. 千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注?

千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注? 终于发布了,和之前泄漏的基本一致,Qwen3.8-Flash-Next 包含 125B 主模型参

16. Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6?

Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6? Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6?不二小段1787824049 Qwen

17. Qwen3.8-Flash:全新架构,更强更稳更划算

Qwen3.8-Flash:全新架构,更强更稳更划算 今晚,我们正式发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embe

18. 阿里把 Qwen4 的底牌提前掀了

阿里把 Qwen4 的底牌提前掀了 阿里把 Qwen4 的底牌提前掀了:训练成本只剩 1/9,大模型开始换一种玩法。 阿里昨晚发布 Qwen3.8-Flash,但真正值得看的,是同步开放权重的 Qwe

19. 【AIGC日报 · 2026-08-27】今日简讯:1、阿里发布Qwen3.8-Flash,以极低价格和新架构预演Qwe...

【AIGC日报 · 2026-08-27】今日简讯:1、阿里发布Qwen3.8-Flash,以极低价格和新架构预演Qwe... 【AIGC日报 · 2026-08-27】今日简讯:1、阿里发布Qwen

20. Qwen3.8-Flash-Next要来了,125B

Qwen3.8-Flash-Next要来了,125B 传说中的Qwen3.8的新模型要来了 125B是个相当甜品的配置,只不过激活参数小,和当年的Qwen3 Next类似,实验性质 去年Qwen3

21. #阿里发布Qwen3.8Flash# Qwen3.8-Flash 正式发布,极致的性价比模型:每百万Tokens输入仅1...

#阿里发布Qwen3.8Flash# Qwen3.8-Flash 正式发布,极致的性价比模型:每百万Tokens输入仅1... Qwen3.8-Flash 正式发布,极致的性价比模型:每百万Toke

22. #阿里发布Qwen3.8Flash#阿里这次彻底刷新了大模型的性价比天花板,全新Qwen3.8-Flash多模态MoE模...

#阿里发布Qwen3.8Flash#阿里这次彻底刷新了大模型的性价比天花板,全新Qwen3.8-Flash多模态MoE模... 阿里这次彻底刷新了大模型的性价比天花板,全新Qwen3.8-Flash多

23. 刚刚!Qwen4 架构提前开源:输入1块输出3块

刚刚!Qwen4 架构提前开源:输入1块输出3块 刚刚,千问官宣了 💣 Qwen3.8-Flash 权重正式开源,HuggingFace + ModelScope 已上线。这不是小迭代——是 Qwen

24. #阿里发布Qwen3.8Flash#国产大模型性价比再被拉高,千问Qwen3.8‑Flash正式亮相,作为Qwen4的架...

#阿里发布Qwen3.8Flash#国产大模型性价比再被拉高,千问Qwen3.8‑Flash正式亮相,作为Qwen4的架... 国产大模型性价比再被拉高,千问Qwen3.8‑Flash正式亮相,作为Q

25. 阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6B

阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6B 阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6BIT之家178774805

26. Qwen3.8-Flash-Next 架构大更新!

Qwen3.8-Flash-Next 架构大更新! 好久没有看到这么激进的模型结构了,目前大家都还在讨论到底是稀疏派还是线性派呢?Qwen3.8-Flash-Next(Qwen4)说:我全都要!我要把

27. vLLM Day 0 支持 Qwen3.8-Flash-Next

vLLM Day 0 支持 Qwen3.8-Flash-Next 🎉 @通义实验室 Qwen3.8-Flash-Next 开源,vLLM Day 0 支持,NVIDIA 与 AMD 上均已验证。

28. Qwen3.8-Flash-Nextext 大模型本地部署与费用分析

Qwen3.8-Flash-Nextext 大模型本地部署与费用分析 Qwen3.8-Flash-Nextext 大模型本地部署与费用分析北漂的老余1787778650 目录模型概述:新一代 MoE

29. Qwen3.8-Flash-Next

Qwen3.8-Flash-Next 看Benchmark的表现,能力应该是对标DeepseekV4Flash的 Qwen有Next后缀的,一般都有架构上的创新 Qwen版的Sparse Attent

30. 180B塞进128GB,Qwen-flash dgx 可跑

180B塞进128GB,Qwen-flash dgx 可跑 果然还是可以跑的,作者 @0xBakeer 在一台 NVIDIA DGX Spark(GB10,128GB 统一内存)上,跑通了 Qwen3

31. Qwen3.8-Flash-Next 今晚出!4.0模型曝光了

Qwen3.8-Flash-Next 今晚出!4.0模型曝光了 ⚠️注意注意! 今天晚上:Qwen3.8-Flash-Next——基于下一代 Qwen4 架构打造的多模态 MoE 模型!官方倒计时页面

32. Qwen3.8-Flash-Next单卡Pro6000跑起来了

Qwen3.8-Flash-Next单卡Pro6000跑起来了 Qwen3.8 Flash Next在Pro6000单卡上跑起来了 说结论 用满96G显存加70G内存 能跑150k左右上下文(暂时

33. 🆕Qwen4架构抢先预览!

🆕Qwen4架构抢先预览! 今晚,我们正式发布Qwen3.8-Flash ,这是一个多模态 MoE 模型。主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token

34. 千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷

千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷 千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷36氪1787791711 智东西8月27日报道,昨晚,阿里千问大模型团队

35. 对比了智谱和Qwen的Flash模型架构:好像啊

对比了智谱和Qwen的Flash模型架构:好像啊 一款大模型,名字带着 Flash; 用混合注意力架构,基本每3层线性注意力,插入1层稀疏注意力; 稀疏注意力的索引器,先把相邻4个Token压缩在

36. Qwen 4用上DeepSeek的Engram!125B MoE一张4090能跑不用量化

Qwen 4用上DeepSeek的Engram!125B MoE一张4090能跑不用量化 Qwen 4用上DeepSeek的Engram!125B MoE一张4090能跑不用量化量子位17877979

37. #阿里发布Qwen3.8Flash#阿里推出全新多模态MoE模型Qwen3.8‑Flash,125B主模型搭配51B的N...

#阿里发布Qwen3.8Flash#阿里推出全新多模态MoE模型Qwen3.8‑Flash,125B主模型搭配51B的N... 阿里推出全新多模态MoE模型Qwen3.8‑Flash,125B主模型搭

38. 4090跑Qwen3.8 Flash Next,实测44 t/s

4090跑Qwen3.8 Flash Next,实测44 t/s 折腾完了:Qwen3.8 Flash Next 已成功部署到 RTX 4090 服务器。 最终方案是 4×4090 + llama.c

39. 好久没读过这么精彩的 Tech Report 了。

好久没读过这么精彩的 Tech Report 了。 强烈推荐大家读一读 Qwen3.8-Flash 的 Tech Report,真的非常精彩。 我读完之后最大的感受是,它没有发明什么惊天动地的新架

40. #阿里发布Qwen3.8Flash# 阿里今晚放出新王炸,Qwen3.8‑Flash 正式亮相!作为多模态 MoE 模型...

#阿里发布Qwen3.8Flash# 阿里今晚放出新王炸,Qwen3.8‑Flash 正式亮相!作为多模态 MoE 模型... 阿里今晚放出新王炸,Qwen3.8‑Flash 正式亮相!作为多模态

41. 8月最新国产三大Flash模型从夯到拉

8月最新国产三大Flash模型从夯到拉 今天真是大日子 把 GLM-5.3-Flash、Qwen3.8-Flash-Next、DeepSeek V4 Flash Vision Exp 三个模型重新对了

42. GLM-5.3-Flash与Qwen3.8-Flash-Next孰强?

GLM-5.3-Flash与Qwen3.8-Flash-Next孰强? 商战总是朴实无华,Qwen3.8-Flash-Next 原计划23:00开源,结果提前俩小时就放出了权重和技术文件,原来是GLM

43. 大晚上,智谱和千问发了新模型,名字、定位、尺寸都有很多相似点,这都是提前商量好了吗? 1. GLM‑5.3‑Flas...

大晚上,智谱和千问发了新模型,名字、定位、尺寸都有很多相似点,这都是提前商量好了吗? 1. GLM‑5.3‑Flas... 大晚上,智谱和千问发了新模型,名字、定位、尺寸都有很多相似点,这都是提前

44. Qwen-3.8 27B开源权重发布,有什么值得关注的地方?

Qwen-3.8 27B开源权重发布,有什么值得关注的地方? 我看完官方benchmark的第一反应是,这分数假的吧。一个27B的稠密模型,SWE-bench Pro把Claude Opus 4.6

45. 三大 Flash 模型一图看懂

三大 Flash 模型一图看懂 8 月 26 号晚,智谱和阿里同日发布新模型,加上 21 号 DeepSeek 上线的视觉版,三款「Flash」级模型凑齐了。 都是 MoE、都是百万级上下文、官方

46. 怎么看Qwen 3.8 27B在人工智能指数得分追平GPT 5.6 luna,单卡小模型生产力来了吗?

怎么看Qwen 3.8 27B在人工智能指数得分追平GPT 5.6 luna,单卡小模型生产力来了吗? Artificial Analysis Intelligence Index 上,Qwen 3.

47. 注意力机制从MHA到稀疏注意力和线性注意力

注意力机制从MHA到稀疏注意力和线性注意力 2026年LLM真正从原来的对话模型逐渐走入到日常的工作生活中去,对于上下文的要求也越来越高,虽然很多harness通过一些工程上的上下文压缩也可以做到长程
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章