阿里巴巴推出的Qwen3.5-Plus模型实现了从纯文本到原生多模态的代际跃迁。它不仅以更少参数达到顶尖性能,还在多项评测中超越GPT和Claude等竞争对手,同时在推理效率上实现数倍提升,展示了大模型在性能、效率与多模态能力上的全新突破。
智能速览
Qwen3.5-Plus完成从纯文本到原生多模态模型的代际跃迁。
模型以不到40%的参数量获得与Qwen3-Max相当的顶尖性能。
在MMLU-Pro等多项知识推理评测中,得分超越GPT-5.2与Claude 4.5。
采用自研门控技术,推理效率在32K上下文下提升8.6倍。
新增自主操作手机与电脑能力,显著提升Agent智能体效率。
精华内容
Qwen3.5-Plus的突破并非偶然,而是源于技术创新与数据优化的深度融合,下面将从多个维度进行详细解析。
性能基准
Qwen3.5-Plus在多项权威评测中展现了顶尖实力。在知识推理评测MMLU-Pro中,该模型取得87.8分,超越了GPT-5.2。面对博士级难题GPQA,其得分高达88.4分,同样高于Claude 4.5。此外,在指令遵循能力评测IFBench中,它以76.5分刷新了行业纪录。这些数据共同证实了其强大的认知与理解能力,已达到业界领先水平。
效率革命
该模型的核心优势在于极致的效率提升。通过自研门控技术与混合架构,总计397B参数的模型在运行时仅需激活17B参数。这种设计带来了显著的性能增益:在32K上下文场景下,吞吐量提升8.6倍;在处理256K超长上下文时,吞吐量最大提升达19倍。同时,其视觉能力也大幅增强,在MathVison、RealWorldQA等多模态评测中均获得最佳成绩,实现了性能与效率的平衡。
智能体应用
除了在评测中表现出色,Qwen3.5-Plus还获得了更强的实际操作能力。它支持自主操作手机与电脑,能够跨越不同应用执行复杂任务。这意味着该模型可以作为一个更高效的智能体,帮助用户完成信息整合、操作调度等工作,将AI从“对话”工具向“执行”助手推进了一大步,极大地拓展了AI的应用场景。
Qwen3.5-Plus的出现,标志着大模型在追求性能的同时,对效率和实用性的探索进入新阶段。它不仅是参数和评测分数的胜利,更是AI技术向更智能、更自主方向发展的缩影。未来的AI将如何深度融入日常生活?这值得期待。