近期,千问开源了基于其下一代 Qwen4 架构打造的 Qwen3.8-Flash-Next 模型,并开放了模型权重。此举并非一次常规的产品迭代,而是将下一代旗舰模型 Qwen4 的核心架构提前向整个开源社区进行了一次“预演”。这一新架构的核心思路在于,用更少的计算换取更高的智能,将算力更精准地分配到有价值的地方。

Qwen3.8-Flash-Next 是一款采用混合专家(MoE)架构的多模态模型。其主模型参数量达到 125B(1250亿),但得益于稀疏激活技术,在处理每个 token 时,实际参与计算的“激活参数”仅为 6B。这种设计允许模型在保持巨大知识容量的同时,大幅降低单次推理的计算成本。官方数据显示,新模型的训练成本仅为上一代旗舰 Qwen3.7-Plus 的约九分之一,但在代码和办公等关键任务上,其能力反而实现了超越。
相较于前代,Qwen4 的架构雏形主要呈现出四大值得关注的变化:
在注意力机制上,模型采用了 Gated DeltaNet (GDN) 与 Qwen Sparse Attention (QSA) 相结合的混合架构。在每四层网络中,有三层使用 GDN 将历史信息高效地压缩到一个固定大小的状态中,好比为长篇文档撰写一份“浓缩笔记”。剩下的一层则使用 QSA,通过一个轻量级索引器,在“微块(micro-block)”粒度上精准地从原文中检索最相关的内容。这种“高效记忆”与“精准查找”的组合,显著降低了处理百万级长上下文时的计算和显存开销,在 1M token 的场景下,其内核最高可实现数倍的加速。
在残差连接上,新架构引入了门控残差(Gated Residual)机制。它将传统 Transformer 中单一的信息传递通道扩展为四条并行的“车道”,并利用动态门控来智能控制每条“车道”上信息的读写。这种设计改善了信息在深层网络中的传递效率,避免了关键信息在传递过程中被稀释或干扰,从而提升了模型的训练稳定性和最终性能。
再次,在模型容量扩展方式上,新架构引入了高达 51B 参数的 N-gram Embedding。这可以理解为一个巨大的“外挂记忆库”或“短语查询表”。它利用局部上下文(如当前词和前几个词组成的短语)直接查表获取信息,以极低的计算代价为模型补充了丰富的局部模式记忆。值得一提的是,这部分参数可以被卸载到成本更低的主机内存中,通过异步预取与模型计算重叠,在不长期占用宝贵 GPU 显存的情况下,有效扩展了模型容量。
在训练优化方面,新架构采用了 Muon Optimizer,并针对新架构的特性重新拟合了缩放定律(Scaling Law)。通过对不同类型的参数采用不同的优化策略,模型得以在更稳定、高效的状态下进行训练。这使得训练过程可以直接从目标批次大小开始,省去了传统的预热阶段,进一步提升了训练效率和吞吐量,是实现训练成本大幅下降的关键。
千问通过 Qwen3.8-Flash-Next 提前展示了 Qwen4 的核心设计哲学:从单纯追求参数规模,转向对计算效率和智能密度的极致探索。通过在注意力、残差、知识存储和训练优化等多个环节进行系统性创新,新架构实现了“计算稀疏、参数访问稀疏、上下文访问稀疏”的全面优化。将这一架构先行开源,也体现了一种新的开源策略——让整个开发者社区提前参与到下一代架构的验证与生态建设中,为未来 Qwen4 完整系列的落地铺平道路。