ROCm 10发布这一周:官方的3.3倍、社区的78 tok/s和一张通宵账单,想逃A卡的先看后两层

源自38位全网作者

09-01 04:54

上周(8月28日前后),AMD正式发布ROCm 10.0.0,这个软件栈走到第十年,顺带把年初Advancing AI上亮相的ROCm.AI推进到GA。知乎上ROCm相关的问题页一周之内冒出六篇以上跟进:有官方解读、有五篇连发的迁移避坑系列、有7900 XTX用户跑了三个月后的踩坑复盘。最传神的是一条高赞回答里的话——2025年ROCm还很脆弱,2026年ROCm我已经在用了。知乎 与此同时,英伟达那边的行情是财报后单日市值暴增、消费卡全线涨价、HBM继续被AI服务器挤占。两条线一凑,"要不逃去A卡"这个问题,2026年夏天第一次有了认真算账的价值。

但先别动手。这波信息里混着三种成色完全不同的数字,分清了再决定掏不掏钱。

第一层:官方数字很响,但基本不关你的事

ROCm 10发布会给的头条是:相同硬件上,采用ROCm.AI配置的系统比ROCm 7推理性能平均提升3.3倍、训练平均提升2.4倍。知乎

把测试条件念一遍:搭载8张AMD Instinct MI355X的数据中心系统,2026年7月7日AMD Performance Labs自测;推理用的是GLM-5、Kimi-K2.5、DeepSeek-R1-0528三个模型的每秒生成token平均增幅,训练是Megatron-LM跑DeepSeek-V2-Lite、V3-16B和Qwen3-30B-A3B。也就是说,3.3倍是"8卡数据中心大模型服务"对"8卡数据中心大模型服务",跟你手里那张7900 XTX或者RX 9700没有关系。

更有意思的细节:介绍这篇内容的知乎作者顺手核对原文时发现,标题写着ROCm 7.0对比预览版7.2.2,下面具体软件配置写的却是7.2.1加Primus v26.3——AMD自己的材料版本号都对不齐。知乎 官方数字当方向看可以,当你的预期值,不行。

真正对本地玩家有用的ROCm 10内容反而是那些不起眼的:ROCm CLI开始支持同时管理多个版本的运行时、可回滚(技术预览,从ROCm 7.13起步,对ROCm 10的正式支持"即将推出");Hyperloom这套agentic优化系统开始兼容vLLM和SGLang,能自动分析瓶颈、改kernel、跑基准验证;AMD Skills进了Claude Code、Cursor、Codex的Marketplace,让编程Agent自带AMD平台手册。这几件事的共同点是:它们冲的不是跑分,是"配置一晚上"这个成本。

ROCm 10发布这一周:官方的3.3倍、社区的78 tok/s和一张通宵账单,想逃A卡的先看后两层

第二层:社区数字才是A卡玩家的真成绩

消费级AMD卡这波最炸的实测来自一个商业公司名单之外的项目:R9V,社区开发者为RDNA4手写的一整套推理kernel。双张RX 9700开TP,配Unsloth IQ4_XS量化、MTP投机解码、SSD n-gram缓存、128K上下文跑Qwen3.8-Flash-Next,实测生成78 tok/s、prefill 1510 tok/s。知乎

比数字更值得看的是结构:生成端大约3倍提升,prefill端到了30倍。为什么差一个数量级?prefill的本质是大矩阵乘大矩阵,计算密度高,手写kernel可以逐个CU调度、把显存带宽榨到流水线上线满负荷;而decode逐token串行,瓶颈从算力换成了显存带宽和延迟,kernel写得再花哨也救不了架构问题。

这条规律对你选负载直接有效:如果你的场景是长文档喂进去、RAG预处理、批量跑图跑视频的"首token前重活",A卡社区kernel的溢价是真的;如果你要的是chat流式吐字手感,瓶颈在带宽,别拿prefill的30倍脑补自己的体感。

ROCm 10发布这一周:官方的3.3倍、社区的78 tok/s和一张通宵账单,想逃A卡的先看后两层

再补一个个体样本:一位双7900 XTX(各24GB)用户跑了三个月,27B模型稳定36+ t/s,ComfyUI出图出视频全在这两张卡上,他的结论很直接——这套配置如果用N卡要多花不止一倍的钱。知乎

第三层:通宵账单,这才是"逃A卡"的真实税率

生态差距不体现在跑分帖里,体现在这些具体的坑上(均来自知乎实测与避坑系列,每一条都有人真金白银熬过):

一、卡号玄学。llama.cpp系(llama-server、Ollama)老老实实听HIP_VISIBLE_DEVICES,PyTorch ROCm版某些情况下直接无视它,看到的还是三块物理卡——你以为把ComfyUI绑到了空闲的GPU1,其实它压在了满载推理的GPU0上OOM。知乎 跨框架枚举规则不一致,配置前得先查清楚每个程序用哪套编号,正解是绕开环境变量直接给物理卡号。

二、显示栈税。把显示输出切去核显、独显看似释放了,Xorg在枚举阶段还是会"碰"一遍所有DRI设备,留下约300MB显存占用和偶尔9%的利用率波动;写Xorg配置强制只用核显,结果xrdp远程桌面指着旧render节点直接罢工,GNOME闪退,再清一层残留会话才复原。知乎

三、内核连环坑。升7.0内核,amdgpu DKMS编译失败,因为6.16.13驱动不支持新内核API;换官方仓库新驱动编过了,重启又被Secure Boot拦下——unsigned内核直接拒载,最后进BIOS关Secure Boot。知乎 AMD驱动更新周期和内核周期不同步,这条在N卡上你很少要操心。

四、最阴的一种:能编译,结果不对。CUDA到ROCm迁移有两道认知鸿沟——wave宽度不同、矩阵核fragment布局不同,代码跑得通、数字悄悄错。那位连写五篇的作者留下的原则是:别用类型字段猜布局,让pipeline和epilogue共用同一套dispatcher编码,在目标架构、指令、shape、数据类型和库版本上全部验证。知乎 同一篇系列还给了微基准的警戒线:跨run的时钟和温度漂移制造过30-40%的假加速,他把30%以下一律先当噪声。知乎

这四类坑没有一类是"AMD不能跑AI",全是"AMD跑AI的每一步都要自己签字确认"。

ROCm 10发布这一周:官方的3.3倍、社区的78 tok/s和一张通宵账单,想逃A卡的先看后两层

反手泼的三瓢冷水

第一,价格窗口正在缩。"5090涨到三万五所以AMD真香"的前提是AMD不涨——但8月12日的消息是,AMD RX9000系列Q3全面涨价,RX 9070 XT销售指导价定到6999元,大显存型号涨幅最高接近50%。微博 显存涨价是全行业的:存储原厂把产能大幅倾斜给AI服务器所需的高带宽内存,消费级显卡显存供应收紧、采购成本抬升,这轮没有谁替谁留座位。新华网

第二,"AMD把带宽和显存拉上来,生态马上倒向ROCm"这种论点,成立的前提至今没兑现。知乎 消费线用的是GDDR,数据中心Instinct才配HBM,R9V们再能打,也是在用软件补硬件带宽的物理差距。

第三,社区路线没有SLA。官方优化的优先级永远是卖给云厂商的Instinct,消费级卡靠的是"有人觉得这件事值得做,有人提PR,有人merge"。R9V今天能到78 tok/s,明天作者弃坑、或者一张新卡出来kernel全部重调,都是正常剧情。

所以谁现在该动手,谁再等等

已经手握RDNA3/RDNA4卡的人(7900 XTX、RX 9700系):现在就试。 你的沉没成本为零,跑27B级量化推理和ComfyUI的实测速度已经站得住,上面那四类坑照着清单逐个排,一晚上一个,排完就是复利。

想为了跑大模型新买卡、预算紧的人:别急着为省钱选A。 这轮显存普涨下A卡和N卡的差价没有稳定结论,而生态税要用你自己的晚上付。等等党至少等三个信号:ROCm CLI对ROCm 10的正式支持落地、Hyperloom的agentic优化从Instinct扩展到消费级卡、AMD Skills目录出现RDNA4的成体系内容——这三个都发生,说明"配置成本"真的在被官方压下来。

ROCm 10发布这一周:官方的3.3倍、社区的78 tok/s和一张通宵账单,想逃A卡的先看后两层

要正经微调、跑高并发服务的人:暂时还是N卡的事。 vLLM在AMD多卡消费卡上能跑,但社区实测的一致提醒是这话大方向没错、魔鬼全在细节里,tensor并行怎么切、通信损失多大,都得按自己的卡和负载逐项验证。知乎 官方那份3.3倍的答卷,也确实是数据中心卡的答卷。

垄断的门是不是被撬开了缝,现在下结论太早。但对已经坐在A卡上的人来说,这个夏天第一次不用赌——官方数字看方向,社区数字看上限,通宵账单看成本。三张表都摊开算完,你大概就知道自己在这盘棋里该落子还是该看戏了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章