张大妈

阿里通义千问Qwen3.5 除夕如期开源

源自UP主:小工蚁创始人

02-19 11:24

Qwen3.5在除夕夜正式开源,作为通义系列首款原生多模态旗舰模型,它以Apache 2.0协议免费商用,兼顾397B参数规模与仅17B激活量的高效混合架构,在OCR、代码生成、长上下文及智能体任务中实测表现超越多个国际竞品,为企业级部署提供新基准。

阿里通义千问Qwen3.5 除夕如期开源智能速览

  • 采用Gated Delta Networks + 稀疏MoE混合架构,总参3970亿,单次前向仅激活170亿参数

  • 多模态能力突出,OCR专项评测达79分,接近Gemini-3 Pro水平

  • TerminalBench2终端命令准确率从22.5%跃升至52.5%,智能体编程能力显著增强

  • 支持256K原生上下文,可扩展至1M token,BFCL-V4长文本理解评测领先多数竞品

  • 语言覆盖扩展至201种语言及方言,全球本地化支持能力大幅提升

  • 在MMLU-Redux、C-Eval、IFEval等权威榜单中多项指标超越Qwen3-Max-Thinking和Claude 4.5 Opus

阿里通义千问Qwen3.5 除夕如期开源精华内容

当大模型竞争从‘堆参数’转向‘提效率’,Qwen3.5以开源旗舰姿态给出系统性解法:不是更大,而是更聪明——用混合架构压缩计算开销,用多模态原生设计强化场景落地,用1M token上下文支撑真实业务流。

架构革新

Qwen3.5-397B-A17B采用创新混合架构:线性注意力机制(Gated Delta Networks)与稀疏Mixture-of-Experts(MoE)协同工作。总参数量3970亿,但每次前向传播仅激活170亿参数,推理吞吐提升42%,延迟降低31%。对比同能力级别的Kimi K2.5-1T-A32B(32B激活),其算力成本下降约37%,更适合企业私有化部署。

多模态实战

在OCR强相关任务中,Qwen3.5在官方多模态评测集上取得79.0分,高于Qwen3-VL-2.5(74.2分)、接近Gemini-3 Pro(79.4分),显著优于Claude 4.5 Opus(70.7分)。该能力已集成至Qwen Chat API,支持PDF表格识别、手写体提取与跨语言文档结构化解析,实测对模糊扫描件的字段召回率达86.3%,较前代提升11.5个百分点。

智能体进化

TerminalBench2评测显示,Qwen3.5在终端命令生成准确率上达52.5%,较Qwen3.0的22.5%提升133%。在Search Agent任务中,其工具调用成功率87.1%,高于Claude 4.5 Opus(83.3%)和GPT-5.2(84.0%)。BFCL-V4长上下文智能体评测得分72.9,为当前开源模型最高分,验证其在复杂任务链中的稳定性。

语言广度

语言支持从119种扩展至201种,新增覆盖斯瓦希里语、孟加拉语方言、菲律宾他加禄语变体等18种低资源语言。在PIQA多语言常识推理测试中,Qwen3.5在非洲语言子集准确率达79.7%,比Qwen3提升9.2个百分点;在中文C-Eval测试中达94.0分,超越Qwen3-Max-Thinking(93.7分)与Gemini-3 Pro(93.5分)。

长文理解

原生支持256K上下文,通过动态窗口扩展技术可处理1M token输入。LongBench v2评测中,Qwen3.5在长文档摘要任务得分70.7,领先GPT-5.2(68.7分)与Claude 4.5 Opus(64.4分);在AA-LCR(长上下文指令遵循)任务中达72.4分,是目前唯一在该指标超70分的开源模型。实测处理120页PDF合同全文时,关键条款提取完整率达93.6%。

Qwen3.5标志着开源大模型进入‘高效能旗舰’新阶段:它不靠参数堆砌取胜,而以架构创新平衡性能与成本,以多模态原生设计打通图文代码边界,以百万级上下文支撑真实业务流。当更多企业开始评估AI基建ROI,这类兼具能力、效率与合规性的开源模型,或许正成为下一代智能体底座的关键选项。未来模型能否在垂直领域实现同等突破?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章