张大妈

Qwen3.5源码逻辑与模型架构

源自知乎:骑虎南下

02-18 10:16

Qwen3.5-397B-A17B凭借荣获NIPS最佳论文的Gated Attention技术,实现了从理论到工程的突破。本文通过梳理Transformer仓库源码,深度剖析其混合架构设计、Gated DeltaNet实现及MoE稀疏化细节,为理解Linear Attention与门控机制提供直观视角。

Qwen3.5源码逻辑与模型架构智能速览

  • 混合架构设计:32层结构,每3层Linear Attention间隔1层Full Attention

  • 核心算子解析:Gated DeltaRule替代标准Attention,复杂度降至O(n)

  • MoE稀疏化:Qwen3.5-MoE模型采用40层全MoE设计,8个路由专家+1个共享专家

  • 极致性能:397B模型解码吞吐量较前代提升8.6倍,支持256K上下文

Qwen3.5源码逻辑与模型架构精华内容

Qwen3.5的创新在于将Linear Attention的高效性与Full Attention的精准度结合,通过源码视角更能洞察其工程落地细节。

混合架构概览

Qwen3.5 Text Dense模型采用32层Transformer结构,核心策略是每3层Linear Attention间隔1层Full Attention。模型Hidden Size设定为4096,词典长度32K,MLP中间层维度为12288。值得注意的是,其归一化层采用了Zero Centered RMSNorm,这与Deepseek或LLaMa的经典实现存在显著差异。

Linear Attention核心

Linear Attention模块利用Gated DeltaRule替代传统Self-Attention,将计算复杂度从O(n²)降至O(n)。算子流程上,首先对Q/K/V进行线性变换,随后对当前Token及前4个历史Token进行因果局部卷积。通过门控衰减因子和权重控制,系统仅需维护一个维度不受文本长度影响的状态记忆矩阵,大幅降低了推理时的KV Cache压力。

Full Attention设计

Full Attention模块在结构上与标准Self-Attention类似,采用了分组查询注意力(GQA),Q Head为16,K/V Head为2。其独特之处在于输入经过Gate Linear层和Sigmoid激活后生成0~1之间的门控因子,对输出进行精细化的门限控制,确保特征传递的准确性。

MoE模型细节

Qwen3.5-MoE模型整体扩展至40层,且所有层的MLP模块均采用MoE设计。Hidden Size调整为2048,依然保持3:1的混合注意力比例。在专家路由策略上,每个Token由8个路由专家加权累加,并与1个共享专家的门控结果相结合,有效提升了模型参数利用效率。

397B超大模型

397B超大规模模型包含60层主网络与1层MTP草稿模型。主网络中45层为Linear Attention,15层为Full Attention,Hidden Size为4096,词表高达248320。该模型MoE配置升级,每Token选择10个路由专家,配合MTP层实现随机采样,单次推理可生成两个Token,实测解码吞吐量相比前代大幅提升。

Qwen3.5通过混合架构与MoE技术的深度融合,不仅解决了长上下文推理的效率瓶颈,更在超大模型规模下实现了吞吐量的质变。这种从理论到源码层面的工程优化,为未来大模型架构设计提供了极具参考价值的范本。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章