千问3.5-Plus的发布标志着原生多模态架构的一次重要跃迁。它通过统一的训练框架和线性注意力机制,在显著降低成本的同时,大幅提升了性能与推理效率,为开发者提供了新的可能。
智能速览
千问3.5-Plus实现了原生多模态统一训练,告别了拼接式方案。
采用线性注意力机制,将推理吞吐量最高提升19倍。
支持长达两小时的视频直接输入,并进行内容分析与摘要。
视觉理解与代码能力原生融合,可实现手绘草图转代码。
API定价为每百万Token 0.8元,性价比优势突出。
精华内容
此次升级的核心在于架构重构,它不仅是参数和性能的提升,更是对AI模型效率与能力边界的重新定义。
原生多模态
与此前千问3系列采用的LLM+视觉模块两段式架构不同,千问3.5-Plus实现了真正的原生多模态。它将视觉感知与语言推理融合在统一的训练框架中,从“两个人配合”转变为“一个人同时搞定”。这种架构代际跃迁,使其在总参数为3970亿、激活参数为170亿的情况下,性能超越前代,同时显存占用降低了60%。
线性注意力
千问3.5-Plus引入了Gate Delta Levels线性注意力机制,与传统的Transformer注意力进行混合。其核心思路是通过优化算法,将计算复杂度从与序列长度的平方成正比(O(n²))降至线性关系(O(n))。这意味着AI处理长文本时效率剧增。实测数据显示,在32K上下文长度下,其解码吞吐量是千问3 Max的8.6倍;在256K上下文下,这一数字提升至19倍。
视觉新应用
架构升级带来了全新的应用场景。一方面,模型支持直接输入长达两小时(约1百万Token)的视频,并进行内容分析与摘要,极大提升了长视频处理效率。另一方面,视觉理解与代码能力的原生融合,催生了“视觉编程”能力。手绘的UI草图可以直接转化为可用代码,一张截图即可定位并修复界面问题,成为强大的生产力工具。
性能与成本
在多项评测中,千问3.5-Plus展现出领先的性能。它在通用视觉问答、文本识别、空间智能等基准中均名列前茅,并在GSM8K等通用Agent评测中超越了Gemini 1.5 Pro。更关键的是其成本优势,官方公布的API调用价格为每百万Token仅0.8元。结合其性能提升与价格优势,为大规模应用提供了极具吸引力的选择。