阿里新一代大模型Qwen3.5开源后,如何高效部署成为关键。英特尔第一时间完成了至强6处理器与Gaudi 2E加速器的适配与优化,不仅释放了硬件潜能,还通过单节点部署等方式显著降低了应用门槛,为开发者提供了清晰的落地路径。
智能速览
英特尔为阿里巴巴开源的Qwen3.5大模型提供第一时间支持。
至强6处理器通过AMX技术,在纯CPU环境下即可为模型提供出色推理加速。
Gaudi 2E加速器支持FP8量化版本,单节点8卡即可完成模型部署。
英特尔平台已全面支持Qwen3.5的原生多模态场景,包括文本、图片和视频。
官方已提供详细的技术资源与安装部署指南,方便开发者上手。
精华内容
英特尔对Qwen3.5的优化不止于软件层面,更深入到硬件核心,旨在最大化释放算力潜能,简化部署流程。
至强6 CPU优化
英特尔针对Qwen3.5-397B-A17B版本,优化了其关键组件与算子,特别是Gated Delta Networks。
这种优化充分释放了至强6处理器内置的英特尔AMX(高级矩阵扩展)技术的潜能,让用户在不依赖独立GPU或专用加速卡的情况下,仅使用CPU即可为该大型模型提供出色的推理加速支持。
这意味着对于已有至强6服务器基础设施的用户,可以更低成本地快速体验和部署Qwen3.5模型。
Gaudi 2E加速方案
对于追求极致性能的用户,英特尔的Gaudi 2E AI加速器提供了另一条路径。
该加速器不仅支持Qwen3.5的BF16原始版本,还同时支持FP8量化版本,后者能在保持模型精度的同时大幅提升推理效率并降低显存占用。
官方方案显示,仅需一个配备8块Gaudi 2E PCIe加速卡(单卡96GB HBM)的单节点,即可完成部署,实现了8卡总计768GB的HBM容量,显著降低了大规模应用的部署门槛。
全场景支持与开发
无论是至强6处理器还是Gaudi 2E加速器,都已全方位支持Qwen3.5的原生多模态能力,涵盖了纯文本、文本加图片以及文本加视频等多种应用场景。
为了帮助开发者快速上手,英特尔已将相关的技术资源、优化代码及详细的安装部署指南分享至GitHub。
开发者可以根据官方提供的Python代码和步骤,轻松完成在两种硬件平台上的模型安装、配置与应用,加速了从模型到实际产品的转化过程。
英特尔对Qwen3.5的快速响应与深度优化,展现了其推动开源AI生态落地的决心。通过提供多样化的硬件支持和详尽的技术指引,英特尔正有效降低顶尖大模型的使用门槛。未来,这种软硬件协同的加速模式将如何影响AI开发格局?