面对大模型长文本处理成本高昂的行业痛点,Qwen3.5并未追随主流的稀疏化路径,而是创新性地引入Linear Attention机制。这一突破不仅显著降低了计算复杂度,更通过精巧的混合架构设计,在性能与效率之间找到了新的平衡点,为AI落地应用提供了前瞻性的解决方案。
智能速览
Qwen3.5采用Gated DeltaNet与Gated Attention的混合架构
Linear Attention将计算复杂度从O(n²)降至O(n),大幅降低长文本成本
通过门控机制与局部卷积优化信息流,实现高效特征融合
Qwen3.5-397B-A17B解码吞吐量较前代最高提升8.6倍
MoE版本通过稀疏化计算,进一步提升了模型处理效率
精华内容
Qwen3.5的革新不仅在于理论突破,更在于工程实践上的精妙设计。下面深入其模型架构,解析Linear Attention如何实现降本增效,以及MoE版本如何进一步释放算力潜能。
混合注意力架构
Qwen3.5的核心创新在于其混合注意力机制。模型整体包含32个Transformer层,每3个Linear Attention层间隔设置1个Full Attention层。这种设计旨在利用Linear Attention处理长序列的低成本优势,同时保留Full Attention捕捉全局依赖的精确性。
在具体参数上,模型的Hidden Size为4096,MLP的Intermediate Size为12288,并采用了与众不同的Zero Centered RMSNorm,为模型训练的稳定性提供了保障。
Linear Attention揭秘
Qwen3.5的Linear Attention,即Gated DeltaRule,是降低算力消耗的关键。传统Self-Attention的计算复杂度为O(n²),而Gated DeltaRule通过一种状态记忆机制,将复杂度优化至O(n)。这意味着,模型在推理时无需维护随文本长度线性增长的KV Cache,仅需一个维度固定的状态矩阵。
其实现过程包含对当前Token及其前4个历史Token的局部卷积融合,再通过门控机制控制历史信息的衰减与新Token的权重,最终以点乘为主的计算完成注意力输出,极大提升了长文本处理效率。
性能数据实测
理论上的优化最终反映在实际性能上。根据测试数据,在处理32K长度的文本时,Qwen3.5-397B-A17B的解码吞吐量是Qwen3.5-235B-A22B的2.5倍,是Qwen3-Max的8.6倍。当文本长度扩展至256K时,其吞吐量优势进一步扩大,达到了Qwen3.5-235B-A22B的2.6倍。
这一显著的性能飞跃,证明了Linear Attention架构在处理超长上下文任务时,具有压倒性的效率和成本优势。
MoE模型探索
为进一步提升效率,Qwen3.5还推出了MoE(混合专家)版本。该模型共40层,所有层的MLP模块均采用MoE结构。对于每个输入的Token,系统会通过路由算法选择8个专家进行计算,其结果加权汇总后,再与一个共享专家的输出进行门控融合。
这种稀疏激活的方式,使得模型在参数量巨大的同时,实际计算量维持在较低水平,实现了规模与效率的双重突破。
Qwen3.5通过引入Linear Attention,为大模型领域开辟了一条降低推理成本的新赛道,其工程实践上的精巧设计值得深思。随着模型与机器人等实体结合,这种高效能架构的价值将愈发凸显。未来,AI技术的演进还会在哪些维度上带来颠覆性变革?