张大妈

Qwen3.5小型模型来了,0.8B到9B毫无保留原创

源自知乎:章北海mlpy

03-05 12:39

阿里巴巴发布了Qwen3.5小型模型系列(0.8B至9B),全部开源并支持视觉输入。这些模型采用全新架构,在大幅降低计算量的同时,性能却向更大尺寸的模型看齐,为边缘部署和轻量化应用带来了新的可能。

Qwen3.5小型模型来了,0.8B到9B毫无保留原创智能速览

  • Qwen3.5小型模型系列(0.8B/2B/4B/9B)全线开源,均支持原生多模态输入。

  • 采用全新门控增量网络架构,显著降低推理时的内存与计算消耗。

  • 9B模型在多项基准测试中性能超越80B参数级别的大模型。

  • 系列模型支持201种语言,全球化部署潜力巨大。

Qwen3.5小型模型来了,0.8B到9B毫无保留原创精华内容

新架构的引入和惊人的性能数据,让这些小型模型不再是“大模型的阉割版”,而是具备了独立竞争力的解决方案。

架构革新

Qwen3.5小模型采用了与大模型一致的全新架构:Gated Delta Networks(门控增量网络)。以9B模型为例,其注意力层设计为每4层中有3层使用线性注意力(Gated DeltaNet),仅有1层使用传统的全注意力。

这种设计大幅降低了推理时的内存占用和计算量,使其在处理长上下文任务时更具优势,实现了更低的计算成本和更高的智能水平。

性能实测

官方基准测试数据显示,9B模型在多项评测中性能已经超越了80B参数级别的大模型,这一表现令人惊叹。

对于显存有限的用户,例如Mac用户或需要轻量化部署的场景,9B模型是27B模型之外的绝佳选择。它以更紧凑的体积,提供了足以应对复杂任务的强大性能,性价比极高。

多模态与多语言

该系列模型实现了原生多模态能力,并非在文本模型后简单挂接视觉编码器。它在预训练阶段就进行了图像与文本的早期融合,官方称其多模态训练效率接近纯文本训练的100%。

此外,模型对全球语言的支持扩展至201种,极大地提升了其在多语言环境和全球化应用场景中的实用价值。

场景定位

不同尺寸的模型各有明确的定位。0.8B和2B模型微型、快速,专为边缘设备和端侧部署设计。4B模型则是一个惊喜,其Agent和多模态能力远超同尺寸预期,是轻量级代理的优秀选择。

9B模型作为系列中的“旗舰”,以其紧凑的体积和强大的性能,成为缩小与更大模型差距的关键角色,适用场景最为广泛。

Qwen3.5小型模型的发布,标志着小模型时代的真正到来。它们在性能、效率和功能上取得了卓越平衡,为开发者和研究者提供了强大且灵活的工具。期待后续的量化版本,让本地大模型体验再上一个台阶。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章