张大妈

马年新春第一炸:原生多模态Qwen3.5-Plus发布 原生多模态Qwen3.5-Plus发布,媲美Gemini3 #千问35

源自抖音:老周聊AI

02-26 13:56

千问3.5-Plus的发布标志着原生多模态架构的一次重要跃迁。它通过统一的训练框架和线性注意力机制,在显著降低成本的同时,大幅提升了性能与推理效率,为开发者提供了新的可能。

马年新春第一炸:原生多模态Qwen3.5-Plus发布 原生多模态Qwen3.5-Plus发布,媲美Gemini3 #千问35智能速览

  • 千问3.5-Plus实现了原生多模态统一训练,告别了拼接式方案。

  • 采用线性注意力机制,将推理吞吐量最高提升19倍。

  • 支持长达两小时的视频直接输入,并进行内容分析与摘要。

  • 视觉理解与代码能力原生融合,可实现手绘草图转代码。

  • API定价为每百万Token 0.8元,性价比优势突出。

马年新春第一炸:原生多模态Qwen3.5-Plus发布 原生多模态Qwen3.5-Plus发布,媲美Gemini3 #千问35精华内容

此次升级的核心在于架构重构,它不仅是参数和性能的提升,更是对AI模型效率与能力边界的重新定义。

原生多模态

与此前千问3系列采用的LLM+视觉模块两段式架构不同,千问3.5-Plus实现了真正的原生多模态。它将视觉感知与语言推理融合在统一的训练框架中,从“两个人配合”转变为“一个人同时搞定”。这种架构代际跃迁,使其在总参数为3970亿、激活参数为170亿的情况下,性能超越前代,同时显存占用降低了60%。

线性注意力

千问3.5-Plus引入了Gate Delta Levels线性注意力机制,与传统的Transformer注意力进行混合。其核心思路是通过优化算法,将计算复杂度从与序列长度的平方成正比(O(n²))降至线性关系(O(n))。这意味着AI处理长文本时效率剧增。实测数据显示,在32K上下文长度下,其解码吞吐量是千问3 Max的8.6倍;在256K上下文下,这一数字提升至19倍。

视觉新应用

架构升级带来了全新的应用场景。一方面,模型支持直接输入长达两小时(约1百万Token)的视频,并进行内容分析与摘要,极大提升了长视频处理效率。另一方面,视觉理解与代码能力的原生融合,催生了“视觉编程”能力。手绘的UI草图可以直接转化为可用代码,一张截图即可定位并修复界面问题,成为强大的生产力工具。

性能与成本

在多项评测中,千问3.5-Plus展现出领先的性能。它在通用视觉问答、文本识别、空间智能等基准中均名列前茅,并在GSM8K等通用Agent评测中超越了Gemini 1.5 Pro。更关键的是其成本优势,官方公布的API调用价格为每百万Token仅0.8元。结合其性能提升与价格优势,为大规模应用提供了极具吸引力的选择。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章