张大妈

阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

源自知乎:刘聪NLP

02-17 10:08

阿里Qwen团队在除夕夜开源了Qwen3.5-Plus模型,这不仅是一次技术迭代,更是对开源社区的重大贡献。该模型采用MoE架构与原生多模态设计,上下文长度扩展至百万级别。通过对模型进行多维度实测,可以深入了解其在视觉推理、OCR及复杂逻辑任务中的真实表现,为开发者和研究者提供极具价值的参考。

阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?智能速览

  • Qwen3.5-Plus采用397B MoE架构,激活参数仅17B,提升效率。

  • 模型支持原生多模态处理,并将上下文长度扩展至1M Token。

  • 在视觉任务中,网页复刻和目标识别表现优异,优于部分竞品。

  • OCR识别能力强大,但在极端长尾案例中仍有提升空间。

  • 文本逻辑推理准确,尤其在处理生活化场景问题时表现出色。

阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?精华内容

Qwen3.5-Plus的发布引发了广泛关注,其实际能力究竟如何?通过一系列严谨的测试,可以对其在复杂任务上的表现有一个清晰的认知。

架构解析

Qwen3.5-Plus是一个总参数量达397B的MoE模型,但每次推理只激活17B参数,由1个共享专家和512个路由专家组成,兼顾了规模与效率。其核心技术采用了Linear Attention Gated DeltaNet与Gated Attention,并原生支持多模态处理。通过M-RoPE和3D位置编码,模型能够将时空信息直接融入位置嵌入,实现了对动态内容的原生理解。此外,模型的上下文长度扩展到了惊人的1M Token,词表也增至250K,覆盖201种语言。

视觉推理实测

在视觉任务测试中,Qwen3.5-Plus展现了强大的图像理解与复刻能力。根据提示,模型能够准确复刻出与原图片高度相似的网页结构,效果显著优于前代模型Qwen3-VL,甚至在迷宫路线复刻任务中表现优于Gemini 3 Pro。目标识别任务,如找到特定状态的人物或物品,也能准确完成。然而,在面对复杂的空间逻辑推理时,例如规划走出迷宫的路径或判断六面体展开图,模型会出错,这表明其在高维度空间变换上仍有局限。

阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

文本处理能力

模型的OCR识别能力表现突出,能够准确识别常规印刷体、部分手写体以及图片中的小字母,达到了业界领先水平。但在一些极其复杂的OCR案例中,识别效果仍不理想,存在长尾问题。在文本逻辑推理方面,模型能够准确理解和分析故事中的隐含信息,如解决“父亲为何崩溃”的逻辑谜题。对于生活化的决策问题,如“50米距离是否开车去洗车”,也能给出合理的建议,体现了良好的实用性。

待提升之处

尽管表现全面,但Qwen3.5-Plus也存在一些明显短板。例如,在识别时钟时间时,模型连续回答错误,说明其在特定视觉符号的解读上存在困难。虽然能猜出部分成语,但稳定性不足。在泛化能力测试中,面对稍加变化的同类问题,模型可能会被答案误导,反映出其鲁棒性仍有待加强。这些不足可能源于激活参数量相对有限,在面对需要深度推理和强泛化能力的任务时,表现不够稳定。

阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

总体来看,Qwen3.5-Plus是当前开源大模型领域的一次重要进步,尤其在多模态处理和长上下文理解上优势明显。虽然仍有提升空间,但其强大的综合能力已为社区带来了新的可能。随着开源社区的持续投入,未来其表现更加值得期待。

阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?关键评论

  • 全面,就想找这样的第一时间测试!

  • 有网友实测询问,模型反馈的上下文长度为256K,与1M的说法存在出入。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章