8月26日,阿里巴巴通义千问团队发布并开源了名为 Qwen3.8-Flash-Next 的新模型,引发了业界的广泛关注。这并非一次常规的模型更新,而是下一代 Qwen4 系列模型架构的一次提前亮相,旨在让社区提前检验其全新的设计理念。这次发布的核心信号十分明确:大模型的发展正从单纯追求参数规模的“军备竞赛”,转向更加注重计算效率和性价比的“智能效能”新阶段。

Qwen3.8-Flash-Next 的设计理念可以概括为“用更少的计算,换取更有效的智能”。其主模型参数量为1250亿,但通过混合专家(MoE)架构,每次处理一个 token 时仅激活约60亿参数。与上一代模型 Qwen3.7-Plus 相比,其训练成本降低了近90%,但在编程、办公等关键任务上的能力反而有所增强。这种“小马拉大车”式的效率提升,得益于其架构上的四大核心革新。
首先是注意力机制的重塑。为了解决超长文本处理中计算量和显存开销激增的难题,模型采用了 Gated DeltaNet (GDN) 与 Qwen稀疏注意力 (QSA) 相结合的混合架构。其中,大部分网络层使用GDN高效地将历史信息压缩成固定大小的“记忆状态”,而少数层则保留QSA,负责对原文进行精准的关键信息检索。QSA本身也经过了优化,它会先用一个轻量级的索引器筛选出最值得关注的上下文区域,再进行精细计算。这套组合可以通俗地理解为:GDN负责高效“记住”,QSA负责精准“查找”,在处理百万级token的长文本时,显著提升了处理速度。
其次是信息在网络层间传递方式的优化。传统的模型架构中,信息在单一的“残差流”中传递,深层网络中的早期重要信息容易被稀释。Qwen3.8-Flash-Next 引入了门控残差(Gated Residual)机制,将这条单行道扩展为四条并行车道,并让模型根据内容动态决定信息在不同车道间的读写。这使得一些早期关键信息可以“直达”后续网络层,避免在传递过程中丢失,从而提升了模型的训练稳定性和处理长程任务的能力。
第三大亮点是模型容量的低成本扩展。除了1250亿的主模型参数,Qwen3.8-Flash-Next还额外配备了一个高达510亿参数的N-gram Embedding模块。它像一个“外挂记忆库”,通过查询由最近几个词元组成的局部语境,为模型提供更丰富的短语和模式知识。其巧妙之处在于,这个巨大的“记忆库”可以被放置在成本更低的CPU内存中,在需要时通过异步方式提前加载,几乎不增加核心计算的负担,也无需长期占用宝贵的GPU显存。这一设计不仅为模型能力扩展提供了新思路,也为在消费级硬件上部署超大规模模型打开了一扇窗。
训练方法的优化也是其高效率的关键。团队采用了更先进的Muon优化器,并针对新架构重新拟合了“缩放定律”(Scaling Law),使得训练过程更加高效稳定。实验发现,传统训练中常见的“批次大小预热”步骤已不再必要,直接从目标规模开始训练反而效率更高。这些优化共同促成了训练成本的大幅下降。
在性能表现上,Qwen3.8-Flash-Next 在多个公开基准测试中,展现了与DeepSeek-V4-Flash、Claude Opus 4.6等顶尖模型相匹敌甚至超越的实力。同时,其开源版本(Qwen3.8-Flash-Next)迅速在Hugging Face和魔搭社区上线,遵循商业友好的Apache 2.0协议。其对应的API服务(Qwen3.8-Flash)也给出了极具竞争力的定价,每百万token的输入和输出价格显著低于市场主流模型,进一步拉低了高性能大模型的使用门槛。
对于本地部署的爱好者而言,这款模型带来了惊喜。尽管其完整权重高达上百GB,但得益于N-gram Embedding可被卸载至CPU内存的特性,社区开发者已经成功在双RTX 4090等高端消费级硬件上,通过量化等技术跑通了该模型,并获得了不错的推理速度。这标志着个人用户在本地体验和利用前沿大模型的能力又向前迈进了一大步。
Qwen3.8-Flash-Next的发布,不仅是通义千问自身技术路线的一次重要演进,也为整个大模型行业的发展趋势提供了新的注解。它所展示的计算稀疏、参数访问稀疏和上下文访问稀疏的“三位一体”高效设计,预示着未来的竞争将更多地围绕如何在有限的资源下实现任务效能最大化展开,而不再仅仅是参数量的比拼。通过提前开源下一代架构,阿里也意在借助社区的力量共同探索和完善,为即将到来的Qwen4时代铺平道路。