当前位置:
AIGC文章详情

ROCm 7.14 发布满月:AMD 把 4 个已知问题写进官方文档,修复方法也全给了

源自9位全网作者

07:09

ROCm 的名声一直是分裂的。一边是晒实测的:7900 XTX 跑 Qwen3.8-27B,生成速度能干到 65 tok/s 往上。另一边完全是两种画风:公司买了 AMD GPU,每天用 ROCm 像荒野求生,官方 kernel 会出 NaN,显存只增不减。小红书后一条这种帖子能拿 360 多个赞、140 多条评论,说明不是个例。

ROCm 7.14 发布满月:AMD 把 4 个已知问题写进官方文档,修复方法也全给了

有意思的是,两边说的都是真的。7 月 16 日发布的 ROCm 7.14 是这几年动作最大的一版,但 AMD 自己也在官方 release notes 里,给消费级显卡列了 4 条已知问题。速度差距里有多少是硬件的锅、多少是装法的锅,这篇把官方文档、AMD 官方博客的测试数据和 B站、知乎、小红书社区的实测评论摆在一起,一次对清楚。

7.14 到底改了什么

先说安装。7.14 是切到 TheRock 新构建体系后的第一个正式版,单一安装包支持所有 Linux 发行版,不用再按发行版找包。GitHubROCm 的安装长期被社区吐槽是"Linux 安装噩梦",这话不是没有出处。哔哩哔哩这次终于正面处理了:组件按需选装,core、core-dev、dev-tools、core-sdk、opencl 分开,纯跑推理装 core 就够;还支持一次装多个 GPU 架构、自动检测显卡。

框架版本整体跨了一大步:PyTorch 2.12、vLLM 0.23、SGLang 0.5.13、JAX 0.10、TensorFlow 2.21,其中 SGLang 是第一次支持消费级 Radeon 卡。GitHub硬件支持也在扩:APU 新增 Ryzen AI MAX+ PRO 495/490/485 和 Ryzen AI 400 系;显卡方面,TheRock 官方支持页上,RDNA3(7000 系)、RDNA3.5(Strix Halo)、RDNA4(9000 系)在 Linux 上全部 Release-Ready,Windows 上 RDNA3 和 3.5 也到位了,只有 RDNA4 还停在"Build Passing",Sanity Tested 和 Release Ready 两栏空着。GitHub用 9070 系、人在 Windows 的,还得再等等。

顺带说个小知识:版本号从 7.2 直接跳到 7.14 不是打错了,AMD 从 7.9 开始拉了一条预览流,7.9、7.13 都是预览版,7.14 是预览流之后第一个正式版。社区 7 月初实测"7.13 比 7.2 明显更好",追的就是这条线。

AMD 自己承认的 4 个已知问题

大厂的 release notes 一般只报喜,7.14 这份给消费卡专门开了已知问题章节,而且每条都配了规避方法,这个态度值得单独记一笔。逐条说。

第一条,RDNA3 推理性能低于预期。官方确认:RX 7900 系、RX 7800 XT 和 Ryzen AI MAX 系列,在 PyTorch 低于 2.14 时跑 vLLM FP16 decode、batch 大于等于 8,性能会低于预期。GitHub给的规避方法是设环境变量 TORCH_BLAS_PREFER_HIPBLASLT=1,切到 hipBLASLt 后端,这个设置到 PyTorch 2.14 会变成默认。如果你的 7900 跑出来的速度明显低于别人晒的,先查这个变量,再怪硬件。

第二条,部分 Radeon 卡上 LLM 预热时间显著变长。绕的地方在于:出问题的版本范围是 vLLM 0.21.0 到 0.25.0,而 7.14 官方适配的 vLLM 正好是 0.23.0,恰好落在问题区间里。GitHub官方方案二选一:退到 0.21 之前,或者直接上 0.26 及以上,修复已经合进去了。

第三条,SGLang 首次上 Radeon,但要手动关两个开关。官方镜像里 AITER 和 SGLANG_ROCM_FUSED_DECODE_MLA 默认是开的,Radeon 用户需要分别设成 false,不然部分负载会直接失败。另外有几类模型目前在 A 卡上还跑不正常,包括 GPT-OSS-20B、MiniMax-M2.7 这类 MoE 模型和 Qwen3-ASR。

第四条最小:部分 Radeon 卡缺 libnuma 时,PyTorch 导入会弹警告,装上系统的 libnuma 包就好。

速度对账:官方 51.8,社区 65.57,差的不是卡

这是分歧最大的地方,先看官方口径。AMD 官方博客 8 月给的 Qwen3.8-27B Day-0 数据:单张 Radeon AI PRO R9700 最高 51.8 tok/s,Ryzen AI Max+ 395 最高 24.5 tok/s。AMD官网

ROCm 7.14 发布满月:AMD 把 4 个已知问题写进官方文档,修复方法也全给了

但注意测试条件:均在 Windows 上用 llama.cpp 的 Vulkan 后端测出,开了 MTP 加速。AMD官网换句话说,AMD 官方交出来的"快",走的不是 ROCm 路线,是 Vulkan。

社区换一种环境,数字就完全不一样:

  • 7900 XTX,WSL Ubuntu 上跑 ROCm FP4 量化加 MTP4,prefill 724.97 tok/s,生成 65.57 tok/s。哔哩哔哩

  • 同卡同模型,有人在 Win11 下重新编译后稳定跑出平均 47.4 tok/s。

  • 知乎有用户两块 7900 XTX 用了三个月,27B 模型稳定 36+ t/s,ComfyUI 出图、出视频全靠这套。知乎

  • 还有一种是长上下文连续任务:有人连续跑了两个多小时,后段输出掉到 10 多个 tok/s。

但要看清这些数字是怎么晒出来的:测速工具默认最大只跑 8k 长度,短上下文里跑到 70 多很容易,换成上下文不断积累的任务,速度完全是另一回事。哔哩哔哩所以社区里标榜 70、80 tok/s 的,大多只晒了短上下文的头段峰值。真实用起来,上下文积累之后速度会一路往下走。同一张卡,28 到 65 tok/s 的差距,大头不在硬件,在环境、量化和上下文长度。

社区踩过的坑还不止官方列的那 4 条。有知乎用户把三个月的折腾整理成了帖:HIP_VISIBLE_DEVICES 这个环境变量,llama.cpp 系列认,PyTorch ROCm 版在某些情况下会直接忽略。知乎按文档把 ComfyUI 绑到指定显卡,跑起来直接 OOM,因为不同框架看到的"0 号卡"根本不是同一块物理卡。下面这张图就是他画的三套编号体系打架现场:

ROCm 7.14 发布满月:AMD 把 4 个已知问题写进官方文档,修复方法也全给了

还有更细的:开核显当显示输出后,Xorg 仍会在独显上留下大约 300MB 的显存占用。知乎升级内核时,amdgpu 驱动兼容性和 Secure Boot 还会轮流拦你一遍。这些就是"荒野求生"抱怨的真实来源:不是跑不起来,是每一层的规则都不一样,踩错一个就重来。反面证据也摆一下:到现在,PyTorch 测试套件里仍有 200 多个单元测试在 ROCm 上是被跳过的。小红书

该不该升 7.14:按情况来

Linux 加 7900 系或 7800 XT:建议升,通用安装器和组件化安装本身就值回票价。升完记住两件事:设 TORCH_BLAS_PREFER_HIPBLASLT=1;用 vLLM 的话直接上 0.26 及以上。

Windows 用户:现阶段别急着上原生 ROCm。AMD 官方 Day-0 数据走的本来就是 Windows 加 llama.cpp 加 Vulkan 的组合。社区实测里,A 卡 Windows 跑 Vulkan 的速度也压着 ROCm。哔哩哔哩也有人反映 Windows 下 LM Studio 加 ROCm 经常死机,结论是跑模型还是 Linux 省心。

ROCm 7.14 发布满月:AMD 把 4 个已知问题写进官方文档,修复方法也全给了

想在 Windows 上玩,llama.cpp 加 Vulkan 是坑最少的路;非要 ROCm,走 WSL2。

ComfyUI 出图为主的:升 7.14 的收益是微提升,风险不高,注意换内核时的驱动兼容就行——那个坑跟 ROCm 版本无关。

9070 系和 RDNA4:Linux 已经 Release-Ready,可以直接上;Windows 等 sanity 测试通过再说。

后面几个值得盯的信号。AMD 7 月底在 Advancing AI 2026 上发布的 ROCm.ai——让 AI 智能体替你装环境、调显卡——方向是对的,但现阶段更适合当观察项,等社区实测。知乎更近的几件事可以顺手盯着:PyTorch 2.14 会把 hipBLASLt 设为 RDNA3 的默认后端,到时候那条环境变量可以退休;vLLM 0.26 已经带上了预热问题的修复;TheRock nightly 对更多消费卡的支持也在推进。

一句话收尾:7.14 是 ROCm 离"装上就能用"最近的一版,但"装上就能用"的前提是先看完官方那份已知问题清单。这次 AMD 把问题和修法都写明白了,社区 65.57 和官方 51.8 的差距也说明,A 卡的性能兑现实在取决于你走哪条路线。已经在跑的,按这篇对一遍环境;想进场的,这是两年里门槛最低的一段时间。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章