阿里Qwen3.8发布:下一代架构提前亮相,开启智能效能新时代

源自50位全网作者

07:16

8月26日,阿里巴巴通义千问团队发布并开源了名为 Qwen3.8-Flash-Next 的新模型,引发了业界的广泛关注。这并非一次常规的模型更新,而是下一代 Qwen4 系列模型架构的一次提前亮相,旨在让社区提前检验其全新的设计理念。这次发布的核心信号十分明确:大模型的发展正从单纯追求参数规模的“军备竞赛”,转向更加注重计算效率和性价比的“智能效能”新阶段。

阿里Qwen3.8发布:下一代架构提前亮相,开启智能效能新时代

Qwen3.8-Flash-Next 的设计理念可以概括为“用更少的计算,换取更有效的智能”。其主模型参数量为1250亿,但通过混合专家(MoE)架构,每次处理一个 token 时仅激活约60亿参数。与上一代模型 Qwen3.7-Plus 相比,其训练成本降低了近90%,但在编程、办公等关键任务上的能力反而有所增强。这种“小马拉大车”式的效率提升,得益于其架构上的四大核心革新。

首先是注意力机制的重塑。为了解决超长文本处理中计算量和显存开销激增的难题,模型采用了 Gated DeltaNet (GDN) 与 Qwen稀疏注意力 (QSA) 相结合的混合架构。其中,大部分网络层使用GDN高效地将历史信息压缩成固定大小的“记忆状态”,而少数层则保留QSA,负责对原文进行精准的关键信息检索。QSA本身也经过了优化,它会先用一个轻量级的索引器筛选出最值得关注的上下文区域,再进行精细计算。这套组合可以通俗地理解为:GDN负责高效“记住”,QSA负责精准“查找”,在处理百万级token的长文本时,显著提升了处理速度。

其次是信息在网络层间传递方式的优化。传统的模型架构中,信息在单一的“残差流”中传递,深层网络中的早期重要信息容易被稀释。Qwen3.8-Flash-Next 引入了门控残差(Gated Residual)机制,将这条单行道扩展为四条并行车道,并让模型根据内容动态决定信息在不同车道间的读写。这使得一些早期关键信息可以“直达”后续网络层,避免在传递过程中丢失,从而提升了模型的训练稳定性和处理长程任务的能力。

第三大亮点是模型容量的低成本扩展。除了1250亿的主模型参数,Qwen3.8-Flash-Next还额外配备了一个高达510亿参数的N-gram Embedding模块。它像一个“外挂记忆库”,通过查询由最近几个词元组成的局部语境,为模型提供更丰富的短语和模式知识。其巧妙之处在于,这个巨大的“记忆库”可以被放置在成本更低的CPU内存中,在需要时通过异步方式提前加载,几乎不增加核心计算的负担,也无需长期占用宝贵的GPU显存。这一设计不仅为模型能力扩展提供了新思路,也为在消费级硬件上部署超大规模模型打开了一扇窗。

训练方法的优化也是其高效率的关键。团队采用了更先进的Muon优化器,并针对新架构重新拟合了“缩放定律”(Scaling Law),使得训练过程更加高效稳定。实验发现,传统训练中常见的“批次大小预热”步骤已不再必要,直接从目标规模开始训练反而效率更高。这些优化共同促成了训练成本的大幅下降。

在性能表现上,Qwen3.8-Flash-Next 在多个公开基准测试中,展现了与DeepSeek-V4-Flash、Claude Opus 4.6等顶尖模型相匹敌甚至超越的实力。同时,其开源版本(Qwen3.8-Flash-Next)迅速在Hugging Face和魔搭社区上线,遵循商业友好的Apache 2.0协议。其对应的API服务(Qwen3.8-Flash)也给出了极具竞争力的定价,每百万token的输入和输出价格显著低于市场主流模型,进一步拉低了高性能大模型的使用门槛。

对于本地部署的爱好者而言,这款模型带来了惊喜。尽管其完整权重高达上百GB,但得益于N-gram Embedding可被卸载至CPU内存的特性,社区开发者已经成功在双RTX 4090等高端消费级硬件上,通过量化等技术跑通了该模型,并获得了不错的推理速度。这标志着个人用户在本地体验和利用前沿大模型的能力又向前迈进了一大步。

Qwen3.8-Flash-Next的发布,不仅是通义千问自身技术路线的一次重要演进,也为整个大模型行业的发展趋势提供了新的注解。它所展示的计算稀疏、参数访问稀疏和上下文访问稀疏的“三位一体”高效设计,预示着未来的竞争将更多地围绕如何在有限的资源下实现任务效能最大化展开,而不再仅仅是参数量的比拼。通过提前开源下一代架构,阿里也意在借助社区的力量共同探索和完善,为即将到来的Qwen4时代铺平道路。

内容由AI生成

精选参考来源

1. Qwen3.8-Flash:全新架构,更强更稳更划算

Qwen3.8-Flash:全新架构,更强更稳更划算 今晚,我们正式发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embe

2. 千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注?

千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注? 终于发布了,和之前泄漏的基本一致,Qwen3.8-Flash-Next 包含 125B 主模型参

3. Qwen3.8-Flash-Nextext 大模型本地部署与费用分析

Qwen3.8-Flash-Nextext 大模型本地部署与费用分析 Qwen3.8-Flash-Nextext 大模型本地部署与费用分析北漂的老余1787778650 目录模型概述:新一代 MoE

4. (转)Qwen3.8-Flash-Next 的 GGUF,111GB 模型在双 4090 96G 竟然跑通了。这模型是真...

(转)Qwen3.8-Flash-Next 的 GGUF,111GB 模型在双 4090 96G 竟然跑通了。这模型是真... (转)Qwen3.8-Flash-Next 的 GGUF,111GB 模

5. 通义千问突然开源新模型,成本砍到只剩一成,行业要变天了

通义千问突然开源新模型,成本砍到只剩一成,行业要变天了 通义千问突然开源新模型,成本砍到只剩一成,行业要变天了刹那永恒w1787777819 8月26号晚上11点,通义千问悄悄上线一个叫Qwen3.8

6. 千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注?

千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注? 虽然今天晚上整个圈子的风头几乎被智谱GLM-5.3-Flash给完全夺走了。但对于天天折腾本地部

7. Qwen3.8-Flash-Next coming soon 👀

Qwen3.8-Flash-Next coming soon 👀 🚨 Qwen4 前哨,准备开源! Qwen3.8-Flash-Next——基于下一代 Qwen4 架构打造的多模态 MoE 模型!

8. ⚡Qwen4还没发,阿里为什么先上Flash?

⚡Qwen4还没发,阿里为什么先上Flash? 北京时间今晚 11 点(27日 00:00 UTC+9),Qwen3.8-Flash-Next 正式开源,附带 FP8 量化版。 官方给的定调:直接

9. Qwen下一代架构首秀

Qwen下一代架构首秀 千问这次发布Qwen3.8-Flash,真正值得看的可能不只是模型又快了、又便宜了,而是Qwen把下一代模型架构提前拿出来了。 Qwen3.8-Flash总Transfor

10. GLM-5.3-Flash与Qwen3.8-Flash-Next孰强?

GLM-5.3-Flash与Qwen3.8-Flash-Next孰强? 商战总是朴实无华,Qwen3.8-Flash-Next 原计划23:00开源,结果提前俩小时就放出了权重和技术文件,原来是GLM

11. 咦 Qwen还有新货~ Qwen3.8-Flash-Next,明天开源。“Qwen3.8-Flash-Next 是基于下...

咦 Qwen还有新货~ Qwen3.8-Flash-Next,明天开源。“Qwen3.8-Flash-Next 是基于下... 咦 Qwen还有新货~ Qwen3.8-Flash-Next,明天开源。

12. 如何评价阿里开源的 Qwen3.8-27B?

如何评价阿里开源的 Qwen3.8-27B? 如何评价?这玩意太 TM 适合本地部一下子了。你本地部署一个 Qwen 3.8 - 27B,你将拥有一个 Opus 4.6。就在上周 DeepSeek-V

13. Qwen3.8-Flash-Next 为什么只激活 6B?

Qwen3.8-Flash-Next 为什么只激活 6B? Qwen3.8-Flash-Next 的几个参数数字很容易被混在一起:总权重约 180B,语言主模型 125B,每个 token 在主干里激

14. 阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6B

阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6B 阿里通义Qwen3.8-Flash发布:125B参数MoE模型,每token仅激活6BIT之家178774805

15. Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6?

Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6? Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6?不二小段1787824049 Qwen

16. 大模型新的“斩杀线”,竟是Qwen3.8-Flash

大模型新的“斩杀线”,竟是Qwen3.8-Flash 刚刚,阿里发布并开源了Qwen3.8-Flash。 Qwen3.8-Flash也是多模态模型,总参数量为 125B,每次只激活 6B,另外加入

17. vLLM Day 0 支持 Qwen3.8-Flash-Next

vLLM Day 0 支持 Qwen3.8-Flash-Next 🎉 @通义实验室 Qwen3.8-Flash-Next 开源,vLLM Day 0 支持,NVIDIA 与 AMD 上均已验证。

18. Qwen3.8-Flash-Next 架构大更新!

Qwen3.8-Flash-Next 架构大更新! 好久没有看到这么激进的模型结构了,目前大家都还在讨论到底是稀疏派还是线性派呢?Qwen3.8-Flash-Next(Qwen4)说:我全都要!我要把

19. 对比了智谱和Qwen的Flash模型架构:好像啊

对比了智谱和Qwen的Flash模型架构:好像啊 一款大模型,名字带着 Flash; 用混合注意力架构,基本每3层线性注意力,插入1层稀疏注意力; 稀疏注意力的索引器,先把相邻4个Token压缩在

20. 从堆参数到写代码:阿里的Qwen3.8在做什么

从堆参数到写代码:阿里的Qwen3.8在做什么 从堆参数到写代码:阿里的Qwen3.8在做什么 阿里通义千问发布 Qwen3.8:2.4万亿参数 MoE 架构、16 天自主敲代码做出开源项目 oh-m

21. Qwen3.8-Flash-Next单卡Pro6000跑起来了

Qwen3.8-Flash-Next单卡Pro6000跑起来了 Qwen3.8 Flash Next在Pro6000单卡上跑起来了 说结论 用满96G显存加70G内存 能跑150k左右上下文(暂时

22. Qwen3.8-Flash-Next要来了,125B

Qwen3.8-Flash-Next要来了,125B 传说中的Qwen3.8的新模型要来了 125B是个相当甜品的配置,只不过激活参数小,和当年的Qwen3 Next类似,实验性质 去年Qwen3

23. Qwen3.8-Max王者归来,但真正的考试才刚开始

Qwen3.8-Max王者归来,但真正的考试才刚开始 这次不只是一次参数升级。 它同时给出了旗舰能力、低价API、开放权重,以及面向本地部署的27B模型。 这说明千问重新找到了自己最有竞争力的位置:

24. 千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷

千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷 千问智谱连夜开源,都比DeepSeek便宜,国产大模型价格猛卷36氪1787791711 智东西8月27日报道,昨晚,阿里千问大模型团队

25. 阿里把 Qwen4 的底牌提前掀了

阿里把 Qwen4 的底牌提前掀了 阿里把 Qwen4 的底牌提前掀了:训练成本只剩 1/9,大模型开始换一种玩法。 阿里昨晚发布 Qwen3.8-Flash,但真正值得看的,是同步开放权重的 Qwe

26. Qwen-3.8 27B开源权重发布,有什么值得关注的地方?

Qwen-3.8 27B开源权重发布,有什么值得关注的地方? 结论前置:小模型中的性能豪杰,阿里再现了一次当年QwQ-32b的高光时刻。和去年QwQ-32b的横空出世一样,今年【首个】(3.5-27b

27. 阿里首个开源MAX模型Qwen3.8 MAX深度评测

阿里首个开源MAX模型Qwen3.8 MAX深度评测 阿里悄悄放了个大招——Qwen3.8 MAX 预览版来了,这是 Qwen 3.8 系列首次公开亮相,也是 Qwen MAX 家族有史以来第一个开放

28. 比DeepSeek V4 Flash 还猛的来了

比DeepSeek V4 Flash 还猛的来了 知名大模型测评网站 Artificial Analysis 今天公布了Qwen3.8-27B的智能指数:52分。图2 这个分数追平了GPT-5.6

29. 4090跑Qwen3.8 Flash Next,实测44 t/s

4090跑Qwen3.8 Flash Next,实测44 t/s 折腾完了:Qwen3.8 Flash Next 已成功部署到 RTX 4090 服务器。 最终方案是 4×4090 + llama.c

30. AI日报|Qwen 3.8新王但默认坑到

AI日报|Qwen 3.8新王但默认坑到 本地模型新王Qwen 3.8 27B,默认设置能把人逼疯——画个圆思考几分钟,生成2万多个token,8K上下文根本不够用,拉到262K才勉强能跑。拿到手第一

31. #阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B...

#阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B... 据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参

32. 8月最新国产三大Flash模型从夯到拉

8月最新国产三大Flash模型从夯到拉 今天真是大日子 把 GLM-5.3-Flash、Qwen3.8-Flash-Next、DeepSeek V4 Flash Vision Exp 三个模型重新对了

33. Qwen3.8-Flash开源一天就降价了

Qwen3.8-Flash开源一天就降价了 Qwen3.8-Flash 刚发布一天,阿里云就降价了。每百万 Token 输入从 1 元降到 0.8 元,输出从 3 元降到 2.7 元,分别下降 20%

34. 一张图看懂 Qwen3.8-27B架构

一张图看懂 Qwen3.8-27B架构 最近把 Qwen3.8-27B 的完整神经网络架构拆了一遍,最大的感受是: 它并不是简单地堆叠几十层标准 Attention,而是把 Gated DeltaNe

35. Qwen3.8-Flash-Next 预计 8.26 23:00 开源

Qwen3.8-Flash-Next 预计 8.26 23:00 开源 🚀 锐龙 AIMAX 395 的第二春来了! Qwen3.8-Flash-Next 预计 8.26 23:00 开源 倒计时

36. 硅基行-你的Qwen3.8 27b可能一直用错了!

硅基行-你的Qwen3.8 27b可能一直用错了! Qwen3.8-27B发布当天部署实测,Q8_0量化跑在魔改4090D 48G上。还发现一个超级隐藏大哥。 实测速度(48G显存全GPU) - De

37. 一个flag让本地大模型提速92%

一个flag让本地大模型提速92% GitHub上有个204星的小项目,README写"一行代码解锁33%加速"。我不信,因为我测过Qwen3.8-27B在RTX 5060上只有3.8 tok/s,差

38. 如何评价阿里开源的 Qwen3.8-27B?

如何评价阿里开源的 Qwen3.8-27B? 最大的问题是慢。换言之,除了慢,没别的毛病。甚至可以说,强得可怕。一开始我用ollama一键部署,接opencode 各种报错,no user query

39. 三大 Flash 模型一图看懂

三大 Flash 模型一图看懂 8 月 26 号晚,智谱和阿里同日发布新模型,加上 21 号 DeepSeek 上线的视觉版,三款「Flash」级模型凑齐了。 都是 MoE、都是百万级上下文、官方

40. 实测 Qwen3.8:快 4 倍,慢 2.4 倍

实测 Qwen3.8:快 4 倍,慢 2.4 倍 全能的二毛·评测篇 03 ———— Qwen3.8-27B 今天凌晨刚开源,朋友圈都在转🔥 我默默把家里的 3080 打开了。 同一台显卡、同一个端口

41. 好久没读过这么精彩的 Tech Report 了。

好久没读过这么精彩的 Tech Report 了。 强烈推荐大家读一读 Qwen3.8-Flash 的 Tech Report,真的非常精彩。 我读完之后最大的感受是,它没有发明什么惊天动地的新架

42. Qwen3.8发布,源神又回到了他的黄金王座上!

Qwen3.8发布,源神又回到了他的黄金王座上! 我的源神又回到了他的黄金王座上! 今天阿里发布了新的Qwen3.8的正式版,而且这次Qwen3.8-Max的总参数量为2.4T,激活参数95B,并

43. 锁死Qwen3.8做我的长期图片/视频处理Agent

锁死Qwen3.8做我的长期图片/视频处理Agent 早就听说Qwen 3.8的VL能力很强,今天拿它来做我的视频合成。 刚开始帮我做了mask生成、抠图和视频合成。虽然结果都很符合需求,但是我都把它

44. Qwen-3.8 27B开源权重发布,有什么值得关注的地方?

Qwen-3.8 27B开源权重发布,有什么值得关注的地方? 我擦,这我就没看懂了,这反差怎么回事??Qwen 3.8 max 官方 API 支持多模态,然后开源的 Qwen3.8-2.4T-A95B

45. Qwen 3.8 27B:用过神仙模型,再也回不去了

Qwen 3.8 27B:用过神仙模型,再也回不去了 最近有开发者实测 Qwen 3.8 27B,不仅一次性写完代码,还自动测试了整个塔防游戏!这表现直接把前代 3.6 35B 秒成渣,以至于他怀疑自

46. 24G显卡本地运行Qwen 3.8 27b的一些优化经验

24G显卡本地运行Qwen 3.8 27b的一些优化经验 优化了大概1-2天,Windows+LM studio+3090ti这个软硬件平台,输出速度从20-30tps优化到50-60tps,感觉已经

47. Qwen3.8 Max我先试试,大家都想知道什么

Qwen3.8 Max我先试试,大家都想知道什么 虽然各种token plan都够用了 但作为Qwen的老粉 还是要体验一下的 我觉得很多朋友因为限购原因也在做其他考虑 我给大家先踩踩坑,看看Qw

48. 大晚上,智谱和千问发了新模型,名字、定位、尺寸都有很多相似点,这都是提前商量好了吗? 1. GLM‑5.3‑Flas...

大晚上,智谱和千问发了新模型,名字、定位、尺寸都有很多相似点,这都是提前商量好了吗? 1. GLM‑5.3‑Flas... 大晚上,智谱和千问发了新模型,名字、定位、尺寸都有很多相似点,这都是提前

49. DeepSeek调价后,替代方案一次来两份

DeepSeek调价后,替代方案一次来两份 DeepSeek刚涨价,平替一夜来两个! 8月26日晚,智谱GLM-5.3-Flash和阿里Qwen3.8-Flash几乎同一时间发布并开源,双双对标涨价的

50. Qwen3.8刚刚拿了个全球第一!

Qwen3.8刚刚拿了个全球第一! 就在刚刚,Artificial Analysis 公布最新榜单,Qwen3.8-Max以55.4分登顶 Agentic Index(智能体能力)排行榜,超越 Cla
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章