如何评价 2 月 16 日发布的 Qwen3.5 的性能表现?

源自知乎:王召德

02-18 10:32

Qwen3.5作为通义千问系列的最新大模型,在除夕夜开源后引发了广泛关注。其核心价值在于对传统Transformer架构进行了颠覆性升级,通过引入混合注意力机制、门控归一化等创新,在保持性能的同时显著降低了推理成本与内存占用,为端侧大模型部署带来了新的可能性。

如何评价 2 月 16 日发布的 Qwen3.5 的性能表现?智能速览

  • Qwen3.5采用混合注意力,3层线性注意力搭配1层标准注意力。

  • 创新性的DeltaNet线性注意力,使KV Cache大小降至传统模型的1/4。

  • 引入Shared Expert机制,增强了MoE模型的稳定性和表达能力。

  • 默认以多模态VLM形态发布,集成先进的视觉编码与位置编码方案。

  • 词表扩展至24.8万,并内置MTP多Token预测以提升推理吞吐量。

如何评价 2 月 16 日发布的 Qwen3.5 的性能表现?精华内容

Qwen3.5的升级并非简单的参数量提升,而是一次彻头彻尾的架构革新。MNN团队对其进行了全面适配,这些技术创新共同构成了其在端侧高效运行的基础。

混合注意力机制

Qwen3.5最大的架构变化在于引入了DeltaNet线性注意力与标准Full Attention的混合使用。模型以3:1的比例交替部署这两种注意力机制,即每4层网络中有3层使用DeltaNet,1层使用标准注意力。

DeltaNet通过维护一个Key-Value记忆矩阵,利用门控衰减规则实现线性复杂度的序列建模,大幅降低了推理计算量。而间隔插入的标准Attention层则确保了模型对关键信息的精确捕获,兼顾了效率与性能。

内存与效率优化

得益于DeltaNet的设计,Qwen3.5的KV Cache内存占用得到革命性优化,其大小仅为纯Transformer模型的约四分之一,极大缓解了长序列推理时的内存压力。

此外,模型采用了Gated RMSNorm,通过引入门控信号增强了归一化的灵活性。在词表方面,从Qwen系列的15.2万扩展至24.8万,增幅超过63%,这能更高效地处理多语言及专业领域文本,缩短Token序列长度,直接提升推理效率。

专家与多模态升级

在MoE(混合专家)层,Qwen3.5引入了Shared Expert机制。与传统MoE仅路由到少数专家不同,所有Token都会经过一个共享的公共专家,其输出与被选中的路由专家输出相加,增强了模型的稳定性和知识共享能力。

与Qwen3不同,Qwen3.5默认以多模态视觉语言模型(VLM)形态发布,继承了Qwen3-VL成熟的ViT编码器与Interleaved M-RoPE位置编码方案,具备强大的视觉理解与动态分辨率处理能力。

位置编码与推理加速

Qwen3.5对位置编码进行了精细调整,引入了partial_rotary_factor参数,仅对部分维度应用旋转位置编码(RoPE),其余维度保持不变,使模型在编码位置信息的同时保留部分“位置无关”特征。

更关键的是,模型内置了MTP(Multi-Token Prediction)多Token预测能力。这是一种推测解码技术,通过一个轻量级的额外层,在一次前向传播中并行预测后续多个Token,显著提升了推理吞吐量,为端侧流畅体验提供了技术保障。

Qwen3.5通过一系列精巧的架构设计,成功在模型性能与端侧部署效率之间找到了新的平衡点。这些革新不仅展示了大模型技术演进的方向,也为移动端和嵌入式设备上运行更强大的AI应用铺平了道路。未来,端侧AI的体验边界将被如何重新定义?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章