9月13日,知乎一个老问题《为啥AMD的ROCm 26年被越来越多的广泛使用,Nvidia的CUDA不是一家独大么?》被顶上了一条新回答,题下挂着159万的浏览量。回答写得很直白:ROCm10已经很强大了,速度优化很好,已经是MOE神器。同一个9月,另一条6.7万浏览的老问题《如何使用虚拟机或wsl2使用rocm进行深度学习》下面,出现了第一篇把适用范围直接写明白的保姆级教程:Win11 WSL2装Ubuntu 26.04+ROCm 10.0+PyTorch,适用型号一栏写着"AMD Radeon RX 7900 XTX(gfx1100)"。知乎
放在两年前,A卡用户想拿手里的卡跑AI,开场白是"先做好思想准备";装不上、识别不到卡、依赖冲突,是ComfyUI话题下点赞最高的失败样本。但从8月底ROCm 10发布开始,"跑通了"的帖子突然在各平台冒出来——只是被转得最广的那条消息《直接跳两个大版本!AMD ROCm 10正式发布:推理性能暴涨3.3倍》,恰恰是全文最需要重新对一遍账的一条。这篇把散在官方博客、玩家教程和两篇互相打架的实测里的料拼齐,对完四本账,再决定你动手、补票还是躺平。快科技
第一本账:3.3倍是谁的3.3倍——跟你那张游戏卡无关
把官方技术博客的脚注还原出来(转载见知乎@热血废人 8月31日),这笔账是这样的:
对比对象:ROCm 7.0 vs “ROCm.AI预览版(ROCm 7.2.2)”——不是ROCm 10对7的升级幅度,3.3倍是"套件"的增益,不是"版本号"的增益。知乎
硬件:8张Instinct MI355X数据中心卡的系统,不是单张桌面卡;
口径:GLM-5、Kimi-K2.5、DeepSeek-R1-0528三个模型按每秒生成Token数的综合平均,训练侧2.4倍同样是Megatron-LM下三个模型的平均。测试日期2026年7月7日,AMD Performance Labs自家实验室。
一个彩蛋:官方博客在MI350-82训练项的软件配置里写的是"ROCm 7.2.1+Primus v26.3",与正文声明的7.2.2差了一个小版本,连官方转载作者都专门加注提醒"建议确认这一处版本号是否准确"。
所以把标题读成"我给游戏卡升个ROCm 10,AI就快3.3倍",是第一本账就记错了。更值得记住的反而是官方自己交底的话:ROCm CLI目前是Technology Preview,从ROCm 7.13开始支持,对ROCm 10的正式支持即将推出。 ROCm.AI这套东西,GA归GA,没全就绪。知乎
第二本账:四种gfx,四种"能用",别拿一个词混着说
"ROCm 10支持不支持我的卡"是个错误问法。把9月以来各平台的一手样本按GPU架构归位,它其实是一条光谱。先别急着装环境,把速查表对着自己的卡查一遍——装ROCm时最劝退新人的,恰恰就是很多人照着教程复制、却连卡对应哪个gfx编号都没对上。小红书

RDNA4(gfx1200/1201——RX 9060对应gfx1200、RX 9070系对应gfx1201):一手样本最"凡尔赛"。9月17日微博用户@水鱼实测:ComfyUI自带的kitchen attention在minimaxh3、f2k、krea2、qwen-edit-2511多个模型上比自己为ROCm 10编译的sageattention 2.2还快,结论是——那我还折腾啥rocm10编译sage2.2,直接等bug修好了用厨房+rocm10完事了。注意这句话的两层意思:一是RDNA4上官方路线已通、第三方优化反而还有bug;二是"通"不等于"快",最快的做法可能是不折腾。微博
RDNA3(gfx1100/1101,7900系):教程党已经把路趟平了。知乎@hhyygg 9月13日发布了全流程教程。文中写进了三个关键细节:要单独从GitHub装librocdxg.so,不装rocminfo直接报错;amd-smi在WSL里会报"Drivers not loaded",但这是噪音、不影响计算;PyTorch走AMD官方wheel源,装完自动带出rocm-sdk-core、rocm-sdk-libraries和按架构拆分的rocm-sdk-device-gfx1100包——这个"按gfx拆包"的形态,就是ROCm 10统一SDK在消费端的样子。这一代卡还有把天花板顶高的人肉实测:9月4日小红书一篇《RX 7900 XTX 24GB跑Qwen3.8-27B分享》晒出的复现配方是ROCm 7.2.4+ROCmFP4/STRIX+DFlash2、KV Q4_0、330W功率墙,decode从33.65 tok/s拉到98.61 tok/s(约2.9倍),4K prompt下仍有约59.5 tok/s,20题质量抽检对了19题。参数、文件名、启动flag被作者整版钉在了"最终配方"卡上:知乎小红书

Strix Halo(gfx1151,锐龙AI Max+ 395/495这批,速查表里它对应"Ryzen AI Max+ 395·8060S·RDNA3.5"那一行):能跑与否取决于构建补齐。

知乎@枫淡月 9月6日在同一台395(128G统一内存)上跑了两轮:旧构建ROCm全败;新llama.cpp b1324-windows-rocm-gfx1151构建补齐架构后翻盘,Windows下64G/96G都能加载,首字延迟约0.85秒、96G长上下文吞吐约161 tok/s都是全场最佳,解码22 tok/s只比Vulkan的23低一点。瓶颈是那条约256GB/s的LPDDR5X统一内存总线,换后端改不了物理。但诡异的是,Ubuntu侧ROCm依旧全败、只能96G顶满跑Vulkan,同一块硬件在两个系统下的显存加载门槛差了"近200倍"(0.5G vs 96G)。而且8月29日岳东晓博士的另一条实测说的是反的:Ubuntu 26.04+ROCm 10在Strix Halo上编译llama.cpp零错误、零警告,并且Llama.cpp+ROCm的性能明显超过了Vulkan。两份一手报告直接打架,能对上账的变量只剩构建版本和量化档位——这就是当下ROCm生态的成色:能用是按构建生效的,经验是不可复制的。知乎微博
RDNA2(gfx1030,6950XT这批):压根没进ROCm 10的wheel矩阵。同一位作者hhyygg 9月9日的方案是退回驱动Adrenalin 26.8.1+ROCm 7.14.1,在Win11 WSL2上把ComfyUI跑通,但带着三条紧箍咒:ComfyUI必须钉死v0.34.0(master会报aimdo memory compile error)、启动必须加–disable-dynamic-vram、ROCm版本与全平台脱钩。老卡的准确描述不是"不能用",也不是"能用了",而是"在一条退役版本线上能用,且每一步都有人替你踩过坑"——这在过去也是不敢想的。知乎
第三本账:ROCm.AI三件套,官方给的到底是哪三件
把ROCm 10真正的消费端意义讲清楚,得看三个组件的实际成色(拆解来自知乎@AMD算力极客社 9月9日一手上手+官方口径):
AMD Skills:官方塞进Claude Code、Cursor、Codex的"经过验证的AMD知识包",本地路线封装在官方推理框架Lemonade上(底层llama.cpp/whisper.cpp,对外OpenAI兼容API);服务器方向目前只覆盖vLLM,SGLang还在计划里;而且正式目录8个Skill里,marketplace实际只上了5个——Hyperloom同样没到消费端。
ROCm CLI:单个二进制、不用预装ROCm就能跑,内置15类已知故障诊断——amdgpu被blacklist、框架wheel和ROCm版本不匹配、核显独显同时暴露导致崩溃这些"炼丹老演员"都在列——但15个对应修复方案现阶段只有4个能自动执行。作者实测评语很克制:“骨架搭好了,但诊断逻辑和细节还在打磨”,甚至把一条机器上实际正常加载的配置扫成了故障。知乎
Hyperloom:自主优化agent,跑"分析trace→改代码→重测→回滚"的循环,12小时预设的目标收益从30%提到50%,还有GSM8K准确率闸门兜底(跌超5个百分点强制回滚)。但它的验证矩阵只有MI300X、MI325X、MI355X三张数据中心卡,Radeon和Ryzen不在列。
一句话:对消费者,ROCm 10最重要的不是任何倍数,而是"装环境"第一次从玄学变成了有官方入口的产品——尽管这个入口还是预览版。
第四本账:为什么偏偏是现在——AI在涨,显卡在贵,两头同时到店
9月16日,MLCommons发布MLPerf Inference v6.1,AMD、英伟达等厂商同步提交结果。AMD称以512颗MI355X组成的系统跑出575万token/秒刷新纪录,英伟达新一代Vera Rubin首次提交结果。数据中心侧的ROCm声量已经不是PPT。IT之家微博
9月10日,七彩虹在北京展出搭载锐龙AI Max+ PRO 495、最高192GB统一内存的灵创Mini Pro和"适配ROCm生态"的灵创K16移动AI工作站——渠道开始把ROCm当卖点写进产品页。快科技
同一天空下:9月17日,供应链消息平台与多家外媒同步曝出:AMD已向多家合作客户下发通知,计划对旗下全系列芯片统一上调报价,涨幅约10%,预计在2026年第四季度正式落地。从显卡到AI加速卡,从主板芯片组到可能涉及的CPU,整条产品线都在涨价清单里。9月18日播放4.9万、评论822条的《显卡日报》头条就是"下代显卡普遍延期"。货架上卖得最凶的新A卡也在这轮涨价名单的射程里——今年最走量的RX 9070 XT,8月一度凭单款冲到德国最大零售商Mindfactory榜单前列。小红书哔哩哔哩小红书

想"等495上桌"的人等的也不是空气:9月4日已经有人把搭载192GB内存的AI Max+ 495迷你主机数出了六款即将上市。实机长这样:小红书

两线并读,结论就出来了:现在既不是"为了ROCm去换新A卡"的时点(涨价在路上、下代没新卡),也不再是"因为A卡软件是坨屎所以绕道"的时点——后者是两年前高赞帖的口径,而今天的安装教程是用户自己写出来的。
行动清单:三类人,三个动作,一个观察清单
手里是RDNA3/RDNA4、想跑ComfyUI或PyTorch的:动。走WSL2路线,抄hhyygg的作业,版本按教程钉死(Ubuntu 26.04+ROCm 10.0;PyTorch用官方wheel源),先看自己卡的gfx编号再动手——你的gfx编号,比任何"暴涨"标题都值钱。
手里是RDNA2老卡的:躺,但有姿势。6950XT这个级别"残值"第一次有了官方级教程背书:26.8.1驱动+7.14.1+ComfyUI v0.34.0,跑图推理够你用到卖。别为了"AI兼容"贱卖它,也别头铁升ROCm 10——矩阵里没有你的包。
想靠换卡上桌AI的观望者:等两个价格信号——10%涨价落地后的实价货架,和PRO 495那批192GB新平台的真实渠道报价;再等四个技术信号——llama.cpp等主流构建对Windows原生ROCm的版本扩散、Hyperloom会不会把Radeon/Ryzen写进验证矩阵、ROCm CLI对10的正式支持何时翻牌、AMD Skills的marketplace会不会补到8个。这四个里任何一个落地,"按摩店炼丹"的叙事都要重写一遍。
ROCm 10没把A卡变成CUDA,但它第一次给A卡的AI生态写了一份用户可以自己更新的说明书。说明书的封面写的不是"YES",是一行小字:按架构分档、按构建生效、按版本回滚。