vLLM针对AMD Instinct GPU系列推出了原生推理优化,通过与Embedded LLM团队合作,提供了7个全新的注意力后端。这些优化通过独特的AITER汇编内核,显著提升了大模型推理的吞吐量,为在AMD平台上部署大语言模型提供了高效的解决方案。技术解析与基准测试数据揭示了其性能飞跃的关键。
智能速览
vLLM为AMD Instinct GPU提供了7个全新的注意力后端。
核心后端ROCM_AITER_FA在MHA模型上TPS提升2.7至4.4倍。
核心后端ROCM_AITER_MLA在MLA模型上性能提升1.2至1.5倍。
性能飞跃主要归功于专用的AITER汇编decode内核。
用户可通过简单配置自动启用最优后端以获得加速。
精华内容
此次优化并非简单的适配,而是深入硬件指令集的底层重构。通过剖析其架构设计与性能基准数据,可以清晰看到vLLM在AMD平台上实现推理加速的内在逻辑与技术亮点。
架构革新
vLLM针对AMD Instinct GPU(如MI300X/MI325X/MI355X)引入了7个注意力后端,分为标准多头注意力(MHA)和DeepSeek的多头潜在注意力(MLA)两大类。这种分类设计确保了对不同模型架构的全面支持和优化。其中,ROCM_AITER_FA作为MHA的推荐后端,采用了创新的3路路由架构,为prefill、extend和decode阶段分别配置了专用计算内核,从而实现了执行效率的最大化。
MHA性能飞跃
在MHA基准测试中,以Qwen3-235B模型为例(输入序列长度10K,输出序列长度1K),ROCM_AITER_FA后端的表现极为出色。与原有的ROCM_ATTN后端相比,其每秒Token数(TPS)提升了2.7到4.4倍。这一性能增益在MI300X、MI325X及MI355X三代硬件上均得到验证,展现了优化方案的广泛适用性和稳定性。
MLA精准优化
针对DeepSeek模型的MLA架构,ROCM_AITER_MLA后端同样带来了显著提升。在DeepSeek-R1模型的基准测试中(同样ISL=10K,OSL=1K),该后端相较于社区常用的TRITON_MLA方案,TPS实现了1.2至1.5倍的增长。分析指出,这部分性能提升主要得益于其共享的高效AITER汇编decode内核,它在解码阶段实现了更优的计算密度和内存访问模式。
简化部署
为了降低用户使用门槛,vLLM提供了便捷的启用方式。用户只需设置环境变量`VLLM_ROCM_USE_AITER=1`,vLLM在启动服务时会自动为MHA模型选择ROCM_AITER_FA后端,为MLA模型选择ROCM_AITER_MLA后端。对于有特殊需求的高级用户,也可以通过`–attention-backend`参数手动指定后端,实现了灵活性与易用性的平衡。
vLLM在AMD ROCm上的这次深度优化,不仅为AI开发者带来了实实在在的性能红利,也展现了开源社区在推动异构计算发展中的关键作用。随着硬件的不断迭代和软件生态的持续完善,未来在AMD平台上运行大模型的成本门槛是否会进一步降低?