通义千问团队的Qwen3.5-MoE模型在架构上实现了重大跃迁。本文深度解析了其与前代Qwen3-MoE的核心差异,揭示了从极简设计到精细化工程的演进思路,为理解前沿大模型架构提供了清晰的技术路径。
智能速览
其MoE设计恢复了共享专家机制,确保通用知识处理的稳定性。
引入零中心化RMSNorm与MTP训练目标,优化了训练稳定性与生成效果。
相比前代,Qwen3.5-MoE以更少激活参数实现了更大的模型容量。
精华内容
从Qwen3-MoE到Qwen3.5-MoE,架构的演进不仅是参数量的堆砌,更是设计哲学的深刻变革。下面将深入其核心技术细节。
注意力机制变革
Qwen3-MoE在所有层都采用标准的Grouped Query Attention (GQA) 全注意力机制,这是一种经典但处理长序列时计算成本较高的方案。Qwen3.5-MoE则引入了创新的混合注意力机制,以Qwen3.5-35B-A3B为例,其40层中75%的层使用GatedDeltaNet线性注意力,剩余25%的层使用全GQA注意力,模式为每隔4层使用一次全注意力。
GatedDeltaNet是一种结合了Delta Rule和门控机制的线性注意力变体,具有O(1)的单步推理复杂度,极大地降低了长序列处理的计算开销。这种混合设计使得模型在保持强大建模能力的同时,能够高效处理高达256K的超长上下文,是架构上的一次重大突破。
MoE设计演进
设计哲学上,Qwen3-MoE遵循“极简主义”,移除了共享专家,采用纯Top-K路由设计,所有token仅被路由至选中的专家处理。以Qwen3-30B-A3B为例,其拥有128个维度为768的专家,激活参数约为0.66B。
Qwen3.5-MoE则转向“增强式MoE”,恢复了共享专家和门控融合机制,与DeepSeekMoE的设计理念更接近。共享专家确保每个token都能获得通用知识的保底处理,而路由专家则提供特化知识。以Qwen3.5-35B-A3B为例,其专家数量增至256或512个,但单个专家维度降至512,通过增加专家数量和多样性来提升整体容量,其激活参数约为0.58B,实现了总容量更大但激活参数更少的目标。
多项关键创新
除了注意力与MoE模块的革新,Qwen3.5-MoE还引入了多项关键技术来提升整体性能。首先是零中心化RMSNorm,通过在初始化时将权重偏置设为0,使模型行为更接近恒等映射,这有利于深层网络的训练稳定性。
其次,模型引入了MTP(Multi-Token Prediction)训练目标,旨在通过一次性预测多个token来提升生成速度和质量。此外,作为多模态模型,Qwen3.5-MoE还采用了M-RoPE(Multimodal RoPE)进行位置编码,以更好地对齐不同模态的信息。这些创新共同构成了Qwen3.5-MoE强大的技术基础。
Qwen3.5-MoE的架构升级,标志着大模型设计正从单一范式走向精细化组合。这种用复杂度换取效率与能力的思路,或将成为未来超大规模模型演进的重要方向。