官方3.3倍和论坛-80%都是真的:这两个月被吵翻的A卡本地AI实测账,我给拼齐了

源自55位全网作者

18:13

上几周 N 卡行情闹得很凶:5090D 有过单日涨两千七的记录,华强北有人直接封仓。就在这个节骨眼上,小红书"本地部署"标签里换了一种画风——《买了AMD显卡,却不会选AI模型?直接抄作业》拿到 99 赞 85 评,《本地部署qwen 3.8 27b》评论区堆了 90 条,最高赞在问:还有比这张卡更有性价比的选择吗?还有人花 1.6 万装了台纯 A 卡 AI 主机,一个月后回来交作业:跑通了——很多人不看好,说 N 卡才是唯一选择。小红书小红书

用 A 卡跑本地 AI 的人,比过去任何时候都密。但评论区是分裂的:有人晒 ROCm 提速截图,有人抽完半个月 ROCm 才转投 Vulkan。官方新闻稿写着"推理平均提升 3.3 倍",论坛实测却说 Vulkan 比 ROCm 快 38%–80%。微博

诡异的是,这些说法同时为真。而抄作业之前,你得先知道每句话各自的适用范围。我把这两个月的实测和公告摊开——从 Instinct 数据中心卡、24G 独显、Strix Halo 核显到云上微调——按五本账给你算完。

第一本账:官方的 3.3 倍是真的,但它说的不是你的卡

8 月底 AMD 正式发布 ROCm 10,软件栈走到第十年。公告里最有冲击力的数字:同一硬件上,采用 ROCm.AI 配置的系统相比 ROCm 7,推理性能平均提升 3.3 倍、训练平均提升 2.4 倍。知乎

这个 3.3 倍要读三个限定词:同硬件对比的是自家上一版;优化主体是 AMD Skills、ROCm CLI 和 Hyperloom 这套 AI 原生工具,其中 Hyperloom 是个会自己 profiling、找瓶颈、改 kernel、跑基准验证的 Agent——上个月 AI 写 kernel 那波热潮,AMD 把它产品化了;落地范围优先覆盖 Instinct 加速卡上的 vLLM 和 SGLang。知乎

行业的共同标尺也追了上来:9 月中旬 MLPerf Inference v6.1 放榜,AMD 用 512 张 MI355X 刷新 DeepSeek R1 的吞吐纪录,英伟达 Vera Rubin 首次现身。微博

官方3.3倍和论坛-80%都是真的:这两个月被吵翻的A卡本地AI实测账,我给拼齐了

配套的第三方佐证(转述 SemiAnalysis 的对比,出场的是 MI355X 和 B300):8 月 12 日到 8 月 31 日两周,MI355X 在 Qwen3.5 397B 上的 P90 首字延迟从 2.0–5.5 秒压到 0.9–3.5 秒区间,响应速度提升近一倍。吞吐性价比从此前约 50M tok/$ 的天花板,冲到 80–110M,TP2 工况最高约 140M;MiniMax M3 上的交互速度从约 55 tok/s/user 提到 230 tok/s/user;每小时 TCO 是 1.5 美元对 2.26 美元。B300 在低时延段依然领先,但差距已经不是"天堑"两个字能形容的了。小红书

官方3.3倍和论坛-80%都是真的:这两个月被吵翻的A卡本地AI实测账,我给拼齐了

这本账对普通玩家的意义是间接的:数据中心卡追上来,租赁平台开始摆出便宜大碗的 AMD 实例——10 月初刚出的租赁行情全解读,标题就把问题挑明了:从 4090 到 H200,租卡还是买卡?至于你机箱里那张 7900XTX,请看第二本账——结论会反过来。知乎

第二本账:你那张卡的现场账,两个方向相反的实测同时为真

先说独显阵营。9 月底一篇综合了抡锤者论坛基准、ROCm 官方文档和 llama.cpp 社区的实测指南给了个反常识结论:在 7900XTX 上跑 llama.cpp 单流,Vulkan 后端比 ROCm 快 38%–80%,原因是 ROCm 在 gfx1100 上的 GPU 利用率呈脉冲式波动,Vulkan 反而是稳定吞吐的那个。知乎

官方3.3倍和论坛-80%都是真的:这两个月被吵翻的A卡本地AI实测账,我给拼齐了

更新一代的卡也在交数据:AMD 算力极客社 9 月 22 日把 Qwen3.8-27B 放到 R9700 和 Strix Halo 395 上做 MTP 开关对照——R9700 不开 MTP 是 24.4 tok/s,开 MTP=2 到 42.2,对官方公布的 51.8 复现率 81.4%;395 从 10.9 到 17.7,官方成绩 24.5,复现率 72.2%。图底自己标了两行口径:本图是 Linux RADV 实测,官方成绩是 Windows 11 环境,“不能视为同条件复现”。这张对照值得截图保存——它第一次把"官方成绩"和"你能跑出的成绩"之间那条缝标在了明面上。

同一篇 7900XTX 指南里还有几个要记进预算的细节:Qwen3.8 的 MTP 投机解码接受率 84.9%(Qwen3.6 是 79.6%),decode 更快;但 ROCm + MTP 在这张卡上首次对话显存会暴增约 5GB,上下文别超过 8K。以及 Qwen3.8 在 ROCm 下容易触发 GTT 溢出——模型加载一切正常,第一次大请求之后 decode 骤降 40%;它的混合架构只有 16 层需要 KV cache、其余 48 层走线性注意力,才让 262K 上下文在 24G 上成为可能,前提是拔掉显示器跑 headless。知乎

再说核显阵营,方向完全相反。Ryzen AI Max+ 395 的 8060S 核显(gfx1151,共享系统内存)上,有人做了 20+ 组参数对照:单流生成 Vulkan 只快 13%,但一到并发,ROCm 的 4 路首字延迟 386 ms,Vulkan 要 4217 ms,差 11 倍;prefill 快 44%–185%。带宽被 CPU 和 GPU 抢着用的核显上,谁调度效率高谁活。知乎

两边都有一个共同的坑底:构建版本。395 作者最初用旧 ROCm 构建跑 llama.cpp,只有 15 tok/s——不是卡不行,是那个构建根本不认识 gfx1151,静默退回 CPU。Windows 上的 ROCm 官方长期只认独显;换成带 gfx115X 设备库的新构建后,`–device` 参数还从 `hip:0` 改叫 `ROCm0`,旧参数照抄直接启动报错。知乎

反证也要摆在桌上:同一位做 20+ 组实测的作者,8 月中补了情况通报——ROCm 后端加载的 7 个模型全部异常,经常停摆、输出无限循环,最终还是换回 Vulkan。加上"抽半个月 ROCm"那位的个案,社区里"ROCm 不稳"的印象不是空穴来风。所以别问"ROCm 和 Vulkan 谁强",要问"我的任务落在哪一格"。知乎

第三本账:底层账——分歧是并行计算的结构性问题

为什么同一张卡换个后端差出 80%、换个工况又反过来?这不是玄学,是两种负载形态在吃不同的资源。

W7900D 上那篇 vLLM-ROCm 排查文档把 decode 阶段的线性层拆得很干净:decode 时矩阵 M 经常等于 1,kernel 启动、tile 填充、通用 epilogue 的固定开销摊不平,真正要算的乘加反而很少——而这种开销会被每个 token 反复放大。所以 ROCm 的路径选择是分三档的:`m=n=1` 走 `torch.dot`,只有一边等于 1 且两边都小于 64 才交给 rocBLAS 的 GEMV,更大一点的 shape 才轮到 Composable Kernel 的 tile 并行 GEMM。三条路径的差别,本质是"固定开销由谁买单"。知乎

而 prefill 是大矩阵、算力受限,tile 并行能吃饱,这正是 ROCm 的主场——所以 395 上并发一开,ROCm 的首字延迟赢一个数量级:请求进来就被 prefill 快速消化,GPU 不空转,队列不排队。

同一批实测里还有两个反直觉结论值得记住:核显上 MoE 35B 比 dense 27B 快——带宽瓶颈下,MoE 每 token 只读约 3B 参数,dense 要把 27B 权重全读一遍;MTP 不是开了就赚,跑 MoE 模型直接关掉,只有 dense 模型才值得考虑。服务参数里也有两个互不相干的开关:`–load-mode mlock` 是 prefill 增益(实测约 1.57 倍),`–cache-ram` 给大值则是并发毒药,最优配置是 `–cache-ram 0` 配 mlock。量化同理:Q4_K_M 起步,想省体积上 UD-Q4_K_XL,Q6_K 在核显上纯亏。知乎

第四本账:抄作业的成本——云上微调的连环坑

A 卡不只是推理。蚂蚁那场具身智能比赛把 ROCm 云实例塞给了大批新手,Datawhale 联合 AMD 的活动号称 15 分钟部署 Gemma4。真跑起来什么体验?9 月底一位选手交了一份 4 个坑的全程记录:在 K8s 白名单代理里,pip 遇到源不可达只是警告后继续,Notebook 偏用 uv,直接判定解析失败硬报错;环境预装 transformers 4.57.6 不认识 gemma4,必须升 5.17.0,可预装 vllm 0.16.1 锁死 `transformers<5`,升级 vllm 又需要那个被墙的源——闭环死锁。破法竟是"微调根本不需要 vllm"——删掉一个不需要的依赖,比攻克一个被墙的源容易一万倍。想另建一个干净 venv?工具看不见父环境的 ROCm torch,会给你装一套 CUDA 版 torch 把 AMD 环境直接报废。知乎

趟完之后:74.88 秒训练、只动 0.63% 参数、193MB adapter,情绪分类准确率从 0.594 提到 0.734。结论:A 卡云上微调可行,但请把"15 分钟"理解成"趟完坑之后"。知乎

云这条路本身也在铺开:AMD Radeon Cloud 把 9 个大模型做成了免费 API,OpenAI 兼容、国内直连、免绑卡——先用后买。知乎

官方3.3倍和论坛-80%都是真的:这两个月被吵翻的A卡本地AI实测账,我给拼齐了

第五本账:买卡账——"A 卡便宜"这扇窗可能比你想的关得快

很多人转 A 卡的动机很朴素:N 卡涨疯了,A 卡量大管饱。但这个前提正在松动:9 月 17 日供应链消息曝出 AMD 已向客户下发通知,计划对旗下全系列芯片统一上调报价,涨幅约 10%,预计 2026 年 Q4 落地——主板芯片组第一次上表,AM5 的 B650/B850/X870 一个都绕不开。源头是台积电把代工价上调约 10%,从 N2 到部分成熟制程。上个月还是 Radeon 单涨,这个月是全家桶。小红书

所以双十一前你会看到最尴尬的局面:两边都在涨,A 卡"性价比窗口"不是没有,但在收窄。接下来的变量值得盯:官方公布 RDNA4 架构 AI 算力达到 RDNA3 的 4 倍以上、最高 1557 TOPS。新架构对 ROCm 设备库的覆盖速度直接决定下代卡的起跑线;Instinct 这边新一代平台年内发布,它每进一步,消费卡的租赁价和软件适配都会跟着动。小红书

给你的任务分层抄作业表

  • 纯单流聊天、偶尔生图,手里是 7900XTX 这类 RDNA3 独显:llama.cpp 走 Vulkan,SD.cpp 走 Vulkan,先别碰 ROCm。想走 ComfyUI 的话,ROCm 10 官方重点调优名单里有 SDXL Base、FLUX.2 KLEIN 和 Wan 2.2,小红书已有实测帖把 SDXL 默认工作流顺利跑通、明确验证了 GPU 真的在干活。小红书

  • iGPU 党也别急,Qwen-Image 2.1 在 780M 核显上约 20 分钟一张 1024 图,能玩,别指望快。知乎

  • 想在一台机器上挂并发 API(家庭助手、多人用):395 这类 Strix Halo + 带 gfx115X 设备库的新 ROCm 构建,并发账 ROCm 赢;旧构建静默回落 CPU 的坑先查。

  • 要 LoRA 微调:直接买云上实例,预算给依赖冲突留三小时,记住"删掉不需要的 vllm"这一招。

  • 还没买卡、正在观望:不建议为了 AI 在 10–11 月急着上车 A 卡——AMD 的 10% 涨幅 Q4 落地,RDNA4 生态覆盖和新平台实测数据要 Q4 才明朗。同样的钱,晚三个月的价格和软件栈可能是另一本账。

值得继续盯的信号

ROCm 10 对 gfx1100/gfx1151 设备库的覆盖公告——微博已有首批玩家给出积极样本:Ubuntu 26.04 装 ROCm 10 后在 Strix Halo 编译 llama.cpp 零错误、零警告干净通过,并称 llama.cpp+ROCm 性能明显超过 Vulkan,“终于改变了 ROCM 在消费级显卡上不如 Vulkan 的尴尬”。这仍是个案,方向对不对,得看 gfx1100 那一代什么时候跟上。另外两条线:vLLM 0.30 之后 Prefill/Decode 分离部署成了显学,ROCm 后端的小矩阵路径优化还在往里合——那篇 W7900D 排查文档追的就是这条线;以及小红书"抄作业"帖评论区里,交作业的能不能多过问"怎么办"的。微博

最后说一句这轮最值钱的东西:官方 3.3 倍和论坛的 -80% 都成立,不是因为谁撒谎,而是因为数据中心、独显单流、核显并发本来就是三道不同的并行计算题。抄作业前先看作者那张卡的型号和后端——比看模型参数重要。

你的 A 卡跑什么型号、走的哪个后端、实测多少 tok/s?评论区把作业交上来,下个月我把这些数字拼成一张表。

内容由AI生成

精选参考来源

1. 本地部署qwen 3.8 27b🤔

2. 我花了 1.6 万,装了一台只属于我的 AI 电脑

3. 抽了半个月ROCm,最后发现原来是ROCm本身是个垃圾,换Vulkan直接一转攻势,说点啥好呢……

4. AMD ROCm 10:为 AMD 平台带来 ROCm.AI 的 AI 原生开发体验

5. 【AI 推理 MLPerf 6.1 发布:AMD 以 512 个 MI355X 刷新纪录、英伟达 Vera Rubin 首次现身】科技媒体 Wccftech 昨日(9 月 16 日)发布博文,报道称在 MLPerf Inference v6.1 发布后,AMD、NVIDIA 等厂商同步提交结果。

6. CUDA已不足为虑:AMD显卡AI神优化 性能暴涨

7. 2026年GPU算力租赁行情全解读:从4090到H200,租卡还是买卡?

8. 单卡 7900XTX 运行 Qwen 27B 本地大模型 — 完整方案指南

9. AMD 395 / 8060S 核显本地跑 Qwen3.6:后端、量化、MTP 怎么选(实测 20+ 组参数)

10. W7900D 上 ROCm GEMM 路径:decode 小矩阵该走 dot、GEMV 还是 CK GEMM

11. 我在 AMD ROCm 云上真跑通了 Gemma4 情绪 LoRA 微调:准确率 0.594 → 0.734,附 4 个坑和全套截图

12. AMD 免费送 9 个大模型,国内直连

13. AMD全面涨价10%!显卡、主板、CPU无一例

14. AMD RDNA 4架构算力暴增4倍:最高1557 TOPS!

15. AMD显卡也能玩AI出图!一篇讲清如何实测生图

16. 真贫民AI绘画:AMD集成显卡跑最新Qwen-Image 2.1

17. AMD 发布 ROCM 10: 十年磨一剑,AMD在软件生态方面取得重大进展,ROCM 10 发布使在AMD 硬件上AI部署不再需要查看复杂的匹配矩阵。我第一时间在 Ubuntu 26.04 上安装了 rocm 10,然后在 Strix Halo 下编译了 llama.cpp ,零错误、零警告干净通过。另外 Llama.cpp+Rocm 的性能明显超过了 Vulkan ,终于改变了 ROCM 在消费级显卡上不如 Vulkan 的尴尬。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章