Qwen3.8-Flash深度解析:成本降九成,6B激活性能挑战Opus

源自50位全网作者

07:20

近日,阿里巴巴发布并开源了其最新大模型 Qwen3.8-Flash,因其宣称的“训练成本降低九成”和“仅激活6B参数性能超Opus4.6”而备受关注。这款模型不仅是一次常规升级,更被视为其下一代Qwen4系列架构的“抢先预览版”,引发了业界的广泛讨论和开发者的实际测试。

综合各方信息,Qwen3.8-Flash的核心特点在于其全新的架构设计,旨在实现极致的计算效率和性价比。它并未走传统“大力出奇迹”的路线,而是通过一系列技术创新,试图在保持甚至提升模型能力的同时,大幅削减训练和推理的成本。

新架构:更聪明地分配算力

Qwen3.8-Flash深度解析:成本降九成,6B激活性能挑战Opus

Qwen3.8-Flash成功的关键在于其全新的“Next”架构,这套架构主要从四个方面进行了革新,核心思想是“把算力花在刀刃上”:

1. 混合注意力机制 (GDN + QSA):为了解决处理长文本时计算量剧增的问题,新架构采用了混合模式。其中,大部分网络层使用一种名为GDN的技术,它像一个高效的“笔记员”,不断将历史信息压缩成固定大小的“摘要”,从而在处理长序列时保持近乎线性的计算成本。而少数层则保留了更强大的稀疏注意力(QSA),它像一个精准的“搜索引擎”,能在需要时快速、准确地从海量原文中找到关键信息。这种“记摘要”与“精准查找”的结合,使得模型既能“记得住”长篇内容,又能“找得快”关键细节,在处理百万级Token长上下文时,速度得到数倍提升。

2. 门控残差网络 (Gated Residual):传统模型的信息传递路径像一条单行道,层数越深,早期重要信息越容易丢失。新架构引入了类似“多车道高速公路”的门控残差机制,将信息流拓宽为4条并行分支,并通过动态“门控”来智能控制每条“车道”的信息流量。这确保了关键信息能够顺畅地从模型的浅层传递到深层,显著提升了训练的稳定性和模型处理复杂逻辑的能力。

3. N-gram嵌入 (Embedding):为了在不显著增加计算量的前提下扩充模型的“知识库”,新架构引入了一个高达510亿参数的N-gram嵌入模块。它不同于需要复杂计算的核心模型参数,更像一个巨大的“查表式”记忆库。当模型遇到常见的词组或短语时,可以直接查询这个“表格”来获取预存的知识,几乎不增加额外的计算负担。巧妙的是,这部分巨大的参数可以被存放在成本更低的普通内存中,通过异步预取技术与GPU计算并行工作,实现了低成本的模型容量扩展。

4. 协同优化 (Optimization):配合全新的架构,阿里团队采用了新的优化器(Muon Optimizer),并重新拟合了模型的“成长规律”(Scaling Law)。这意味着他们找到了更高效的训练方法,可以用更大的学习率和批次大小进行训练,甚至省去了传统训练中“批次预热”等耗时步骤。这些优化共同作用,成为训练成本大幅降低至上一代模型约九分之一的关键。

性能、成本与实际体验

基于上述架构革新,Qwen3.8-Flash展现出了几个显著的特点:

* 参数与激活的“反差”:模型总参数量高达1250亿(主模型)+510亿(N-gram),但 благодаря MoE(混合专家)架构,每个Token在推理时仅需激活约60亿参数。这就像一个庞大的专家团队,每次只派出最相关的几位专家来解决问题,从而在拥有巨大潜力的同时,保持了极高的运行效率。

* 极具竞争力的成本:训练成本的大幅降低,直接体现在了API服务的定价上。其API定价远低于市面上同级别的模型,例如每百万Tokens的输入价格低至0.8-1元人民币,缓存命中价格更是低至0.1元。这种定价策略,使得高频、大规模调用AI模型成为可能,尤其对于需要反复调用模型的Agent(智能体)应用场景极为友好。

* 实际体验与社区反馈:模型开源后,社区反响热烈。许多开发者在消费级硬件(如RTX 4090)上进行了本地部署测试。反馈显示,虽然125B+51B的总参数量对内存(RAM)要求很高,本地部署有一定门槛,但确实可以在高端个人设备上运行。在性能方面,不少测评认为其在编码、办公和Agent任务上表现突出,与官方宣称的“性能超越Opus4.6”在部分基准测试中得到印证。但也有观点指出,MoE架构可能存在输出不稳定的问题,模型的真实能力和可靠性,仍需在更多真实、复杂的业务场景中进行长期检验。对于绝大多数用户而言,直接使用官方提供的API服务是体验该模型最便捷、最具性价比的方式。

总结

Qwen3.8-Flash的发布,标志着大模型行业的竞争焦点正在从单纯的参数竞赛,转向“效率与成本”的综合比拼。它通过一系列架构创新,展示了一条在控制成本的同时,依然能实现顶尖性能的技术路径。虽然“实际体验是否全面超越旗舰模型”尚待更多验证,但它无疑以极低的成本门槛和强大的专用能力,重新定义了“性价比”,为AI技术的大规模普及和应用,尤其是在Agent等高频调用场景的落地,提供了坚实的基础。作为Qwen4架构的先行者,它的表现也让外界对下一代大模型的进化方向有了更清晰的期待。

内容由AI生成

精选参考来源

1. 今晚,我们正式发布Qwen3.8-Flash ,这是一个多模态 MoE 模型。主模型参数量为125B,额外配备 51B ...

今晚,我们正式发布Qwen3.8-Flash ,这是一个多模态 MoE 模型。主模型参数量为125B,额外配备 51B ... 今晚,我们正式发布Qwen3.8-Flash ,这是一个多模态 MoE

2. 🆕Qwen4架构抢先预览!

🆕Qwen4架构抢先预览! 今晚,我们正式发布Qwen3.8-Flash ,这是一个多模态 MoE 模型。主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token

3. Qwen3.8-Flash-Next 架构大更新!

Qwen3.8-Flash-Next 架构大更新! 好久没有看到这么激进的模型结构了,目前大家都还在讨论到底是稀疏派还是线性派呢?Qwen3.8-Flash-Next(Qwen4)说:我全都要!我要把

4. 千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注?

千问开源基于 Qwen4 架构的 Qwen3.8-Flash-Next,下一代架构有什么变化值得关注? 终于发布了,和之前泄漏的基本一致,Qwen3.8-Flash-Next 包含 125B 主模型参

5. Qwen 3.8 Flash测评报告!究竟有多能打?

Qwen 3.8 Flash测评报告!究竟有多能打? 好视频扶持计划 期待已久的 Qwen-3.8‑Flash 实测报告新鲜出炉!这款全新的 MoE 多模态大模型,主参 125B,每次仅激活 6B 参

6. Qwen3.8-Flash-Next 今晚出!4.0模型曝光了

Qwen3.8-Flash-Next 今晚出!4.0模型曝光了 ⚠️注意注意! 今天晚上:Qwen3.8-Flash-Next——基于下一代 Qwen4 架构打造的多模态 MoE 模型!官方倒计时页面

7. Qwen3.8-Flash架构曝光,极致性价比

Qwen3.8-Flash架构曝光,极致性价比 分享一下Qwen3.8-Flash 架构图,Qwen4 架构早期开源预览 规模:125B 主干 MoE + 51B N-gram Embedding

8. Qwen3.8-Flash-Next开源,Qwen4架构先行

Qwen3.8-Flash-Next开源,Qwen4架构先行 Qwen 正式开源 Qwen3.8-Flash-Next。 Qwen3.8-Flash-Next率先开放了下一代 Qwen4 的架构:

9. vLLM Day 0 支持 Qwen3.8-Flash-Next

vLLM Day 0 支持 Qwen3.8-Flash-Next 🎉 @通义实验室 Qwen3.8-Flash-Next 开源,vLLM Day 0 支持,NVIDIA 与 AMD 上均已验证。

10. 刚刚,Qwen3.8-Flash开源了!

刚刚,Qwen3.8-Flash开源了! - Qwen3.8-Flash刚刚发布并同步开源。 125B Transformer参数,每Token仅激活6B,整体性能超Claude Opus4.6、接近

11. Qwen3.8-Flash-Next 来了

Qwen3.8-Flash-Next 来了 Qwen3.8-Flash-Next 来了!一款基于全新架构构建的开源权重多模态 MoE 模型,原生支持 256K 上下文长度,可通过 YaRN 扩展至 1

12. #阿里发布Qwen3.8Flash#阿里正式发布了Qwen3.8-Flash,是可以支持多种内容形式的多模态模型。不用去...

#阿里发布Qwen3.8Flash#阿里正式发布了Qwen3.8-Flash,是可以支持多种内容形式的多模态模型。不用去... 阿里正式发布了Qwen3.8-Flash,是可以支持多种内容形式的多模态

13. #阿里发布Qwen3.8Flash# 以往大模型变强往往伴随成本飙升,这次新模型走出了不一样的路线。仅激活部分参数就达到...

#阿里发布Qwen3.8Flash# 以往大模型变强往往伴随成本飙升,这次新模型走出了不一样的路线。仅激活部分参数就达到... 以往大模型变强往往伴随成本飙升,这次新模型走出了不一样的路线。仅激活部

14. Qwen3.8-Flash-Nextext 大模型本地部署与费用分析

Qwen3.8-Flash-Nextext 大模型本地部署与费用分析 Qwen3.8-Flash-Nextext 大模型本地部署与费用分析北漂的老余1787778650 目录模型概述:新一代 MoE

15. 仅6B激活就干翻旗舰!千问4预览版开源了

仅6B激活就干翻旗舰!千问4预览版开源了 千问这波操作是真的"开源"。半夜发布Qwen3.8-Flash-Next:Qwen4架构的早期预览版,开放权重,直接能下载。官方推文一天120万浏览,读完28

16. #阿里发布Qwen3.8Flash#如果你曾被大模型的昂贵账单劝退,今晚的Qwen3.8-Flash值得你重拾热情。阿里...

#阿里发布Qwen3.8Flash#如果你曾被大模型的昂贵账单劝退,今晚的Qwen3.8-Flash值得你重拾热情。阿里... 如果你曾被大模型的昂贵账单劝退,今晚的Qwen3.8-Flash值得你重

17. #阿里发布Qwen3.8Flash# 大模型这行,过去比的是谁家参数大。千问这次换了个比法:参数可以小,算力不能白烧。...

#阿里发布Qwen3.8Flash# 大模型这行,过去比的是谁家参数大。千问这次换了个比法:参数可以小,算力不能白烧。... 大模型这行,过去比的是谁家参数大。千问这次换了个比法:参数可以小,算

18. #阿里发布Qwen3.8Flash#阿里Qwen3.8-Flash正式亮相了,这不是一次常规迭代,而是一场架构效率的革命...

#阿里发布Qwen3.8Flash#阿里Qwen3.8-Flash正式亮相了,这不是一次常规迭代,而是一场架构效率的革命... 阿里Qwen3.8-Flash正式亮相了,这不是一次常规迭代,而是一场架

19. #阿里发布Qwen3.8Flash#刚刚阿里扔出一记重磅,Qwen3.8‑Flash正式发布还直接开源,这波操作着实让人...

#阿里发布Qwen3.8Flash#刚刚阿里扔出一记重磅,Qwen3.8‑Flash正式发布还直接开源,这波操作着实让人... 刚刚阿里扔出一记重磅,Qwen3.8‑Flash正式发布还直接开源,这波

20. #微博声浪计划# #听见微博# 💡 今日思考:阿里Qwen3.8-Flash的发布极具象征意义。它不仅以"前代十二分之...

#微博声浪计划# #听见微博# 💡 今日思考:阿里Qwen3.8-Flash的发布极具象征意义。它不仅以"前代十二分之... 💡 今日思考:阿里Qwen3.8-Flash的发布极具象征意义。它不仅

21. Qwen4 还没来,千问先把下一代架构亮出来了

Qwen4 还没来,千问先把下一代架构亮出来了 8月26日,千问发布 Qwen3.8-Flash,并开放 Qwen3.8-Flash-Next 权重。Next 命名更强调它的另一层身份:Qwen4下一

22. #阿里发布Qwen3.8Flash#大模型的内卷已经彻底换赛道了,不再疯狂堆参数,而是死磕算力效率。阿里Qwen3.8‑...

#阿里发布Qwen3.8Flash#大模型的内卷已经彻底换赛道了,不再疯狂堆参数,而是死磕算力效率。阿里Qwen3.8‑... 大模型的内卷已经彻底换赛道了,不再疯狂堆参数,而是死磕算力效率。阿里Qw

23. 如何评价阿里开源的 Qwen3.8-27B?

如何评价阿里开源的 Qwen3.8-27B? 最大的问题是慢。换言之,除了慢,没别的毛病。甚至可以说,强得可怕。一开始我用ollama一键部署,接opencode 各种报错,no user query

24. #阿里发布Qwen3.8Flash# 下一代Qwen4.0同架构的甜品级模型,也是市面上所有flash模型要挑战的一座山...

#阿里发布Qwen3.8Flash# 下一代Qwen4.0同架构的甜品级模型,也是市面上所有flash模型要挑战的一座山... 下一代Qwen4.0同架构的甜品级模型,也是市面上所有flash模型要

25. #阿里发布Qwen3.8Flash#阿里毫无预兆放出Qwen3.8‑Flash,并且选择直接开源,这波出手直接搅动国内大...

#阿里发布Qwen3.8Flash#阿里毫无预兆放出Qwen3.8‑Flash,并且选择直接开源,这波出手直接搅动国内大... 阿里毫无预兆放出Qwen3.8‑Flash,并且选择直接开源,这波出手直

26. 对比了智谱和Qwen的Flash模型架构:好像啊

对比了智谱和Qwen的Flash模型架构:好像啊 一款大模型,名字带着 Flash; 用混合注意力架构,基本每3层线性注意力,插入1层稀疏注意力; 稀疏注意力的索引器,先把相邻4个Token压缩在

27. 阿里开源Qwen3.8-Flash!每百万Tokens输入仅1元 输出3元

阿里开源Qwen3.8-Flash!每百万Tokens输入仅1元 输出3元 阿里开源Qwen3.8-Flash!每百万Tokens输入仅1元 输出3元财闻1787749241 8月26日晚间消息,阿里

28. #阿里发布Qwen3.8Flash#大模型行业的竞争逻辑正在悄然发生转变,不再一味比拼参数规模,算力效率成为新的角逐重点...

#阿里发布Qwen3.8Flash#大模型行业的竞争逻辑正在悄然发生转变,不再一味比拼参数规模,算力效率成为新的角逐重点... 大模型行业的竞争逻辑正在悄然发生转变,不再一味比拼参数规模,算力效率成为

29. 8月最新国产三大Flash模型从夯到拉

8月最新国产三大Flash模型从夯到拉 今天真是大日子 把 GLM-5.3-Flash、Qwen3.8-Flash-Next、DeepSeek V4 Flash Vision Exp 三个模型重新对了

30. Qwen3.8-Flash-Next coming soon 👀

Qwen3.8-Flash-Next coming soon 👀 🚨 Qwen4 前哨,准备开源! Qwen3.8-Flash-Next——基于下一代 Qwen4 架构打造的多模态 MoE 模型!

31. Qwen3.8-Flash:全新架构,更强更稳更划算

Qwen3.8-Flash:全新架构,更强更稳更划算 今晚,我们正式发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embe

32. Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6?

Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6? Qwen3.8-Flash-Next发布!消费级硬件可部署,干翻Opus4.6?不二小段1787824049 Qwen

33. Qwen3.8-Flash-Next单卡Pro6000跑起来了

Qwen3.8-Flash-Next单卡Pro6000跑起来了 Qwen3.8 Flash Next在Pro6000单卡上跑起来了 说结论 用满96G显存加70G内存 能跑150k左右上下文(暂时

34. 突发,Qwen3.8今天开源

突发,Qwen3.8今天开源 🚨突发 Qwen今天将正式开源 Qwen3.8-Flash-Next🔥 官方倒计时页面已经挂出来了 预计北京时间8月26日23点开放权重 但这个名字真的有点会骗人

35. #阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B...

#阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B... 据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参

36. 大模型新斩杀线出现,竞争逻辑彻底改写阿里千问发布Qwen3.8‑Flash,依托架构革新,仅激活6B参数,性能超越Opu...

大模型新斩杀线出现,竞争逻辑彻底改写阿里千问发布Qwen3.8‑Flash,依托架构革新,仅激活6B参数,性能超越Opu... 大模型新斩杀线出现,竞争逻辑彻底改写阿里千问发布Qwen3.8‑Flas

37. 阿里深夜开源核弹!Qwen3.8-Flash 6B

阿里深夜开源核弹!Qwen3.8-Flash 6B 完整的标题应该是《阿里深夜开源核弹!Qwen3.8-Flash:千亿参数只开6B,性能干翻Claude Opus,价格屠到DeepSeek的1/3》

38. 阿里又在大模型领域砸下一颗重磅弹——千问Qwen3.8-Flash发布并同步开源。这次主打的就是“极致性价比”。模型千亿...

阿里又在大模型领域砸下一颗重磅弹——千问Qwen3.8-Flash发布并同步开源。这次主打的就是“极致性价比”。模型千亿... 阿里又在大模型领域砸下一颗重磅弹——千问Qwen3.8-Flash发布并

39. 三大 Flash 模型一图看懂

三大 Flash 模型一图看懂 8 月 26 号晚,智谱和阿里同日发布新模型,加上 21 号 DeepSeek 上线的视觉版,三款「Flash」级模型凑齐了。 都是 MoE、都是百万级上下文、官方

40. #阿里发布Qwen3.8Flash# Qwen3.8-Flash 正式发布,极致的性价比模型:每百万Tokens输入仅1...

#阿里发布Qwen3.8Flash# Qwen3.8-Flash 正式发布,极致的性价比模型:每百万Tokens输入仅1... Qwen3.8-Flash 正式发布,极致的性价比模型:每百万Toke

41. Qwen3.8-Flash开源,Qwen4架构雏形提前曝光

Qwen3.8-Flash开源,Qwen4架构雏形提前曝光 Qwen3.8-Flash刚刚发布,真正值得关注的可能不只是“更强、更快、更便宜”,而是——千问把下一代Next架构也一起拿出来了。 1

42. Qwen-3.8 27B开源权重发布,有什么值得关注的地方?

Qwen-3.8 27B开源权重发布,有什么值得关注的地方? 我看完官方benchmark的第一反应是,这分数假的吧。一个27B的稠密模型,SWE-bench Pro把Claude Opus 4.6

43. DeepSeek调价后,替代方案一次来两份

DeepSeek调价后,替代方案一次来两份 DeepSeek刚涨价,平替一夜来两个! 8月26日晚,智谱GLM-5.3-Flash和阿里Qwen3.8-Flash几乎同一时间发布并开源,双双对标涨价的

44. 如何评价阿里开源的 Qwen3.8-27B?

如何评价阿里开源的 Qwen3.8-27B? Artificial Analysis Intelligence 指标出来了52分!! 比想象中高得多,比肩GPT-5.6Luna,难怪Luna网页版对

45. 被Qwen3.827B刷屏了

被Qwen3.827B刷屏了 这两天推上被Qwen3.8 27B刷屏了。 一年前的人想必很难理解,现在竟然可以在本地消费级硬件上,跑一个opus 4.6级别的模型。。那tm得多幸福啊。 Sim

46. Qwen3.8-Flash凌晨开源:我放弃了本地部署

Qwen3.8-Flash凌晨开源:我放弃了本地部署 Qwen3.8-Flash凌晨开源:我放弃了本地部署程序员阿胜1787812651 8月26日晚上11点,阿里把Qwen3.8-Flash-Nex

47. 百万Tokens只要1元,阿里千问重划斩杀线!

百万Tokens只要1元,阿里千问重划斩杀线! 阿里千问扔出一枚炸弹。 Qwen3.8-Flash 把 Claude Opus4.6 的价格打到 3%,能力却逼近 Opus 4.8,输入每百万 T

48. 4090跑Qwen3.8 Flash Next,实测44 t/s

4090跑Qwen3.8 Flash Next,实测44 t/s 折腾完了:Qwen3.8 Flash Next 已成功部署到 RTX 4090 服务器。 最终方案是 4×4090 + llama.c

49. 阿里把 Qwen4 的底牌提前掀了

阿里把 Qwen4 的底牌提前掀了 阿里把 Qwen4 的底牌提前掀了:训练成本只剩 1/9,大模型开始换一种玩法。 阿里昨晚发布 Qwen3.8-Flash,但真正值得看的,是同步开放权重的 Qwe

50. 好久没读过这么精彩的 Tech Report 了。

好久没读过这么精彩的 Tech Report 了。 强烈推荐大家读一读 Qwen3.8-Flash 的 Tech Report,真的非常精彩。 我读完之后最大的感受是,它没有发明什么惊天动地的新架
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章