最近,本地跑大模型的圈子里在传一个视频:技术频道 CloudCodes 把 CUDA 13 和 ROCm 7.14 拉出来做了一次深度对比。
纸面很有诱惑力:AMD MI355X 的参数对标 NVIDIA B200。哔哩哔哩视频里还对比了 GLM-5 的推理成本,简介称 AMD 有大约四成的价格优势。
但点开评论区,画风完全不一样。一条高赞评论说:“amd不是不能用,就是折腾点。”
今天把视频、评论区、知乎上最近的实战教程整合起来,盘一个问题:便宜的 A 卡,到底是不是到了能捡的时候?

一、纸面从没输过,但 ROCm 的门槛也从没少过
视频里列了五个技术壁垒,简介里点名了三个,个个扎心:
GPU 白名单限制:ROCm 官方支持的型号有限,名单外的卡能用,但属于"后果自负";
Linux 安装噩梦:装过的都懂;
Windows 生态缺失:Windows 用户基本只剩 WSL2 + Docker 一条路。知乎上 7 月有两篇教程,一篇记录了在 Windows 机器上通过 WSL2 和 Docker 跑通 AMD Radeon RX 7900 XTX 的 ROCm 计算的真实折腾过程。知乎另一篇面向 780M 核显,ROCm 7.13 技术预览版已经正式支持 gfx1103。知乎
最有意思的是性能部分:一个 vLLM 的代码修复,把 MI355X 的推理性能拉高了 12 倍。哔哩哔哩这个数字是双刃的。一方面说明社区修复真的有用;另一方面也说明,没人修的时候,性能就趴在那里。A 卡的算力未必低,缺的是"有人调"——这恰恰是生态现在最缺的东西。
二、评论区吵成两派,但都有实锤
“能用派”:
一位 7900 XTX 用户的高赞评论(16 赞)说,跑comfyui现在rocm7.14生态也很不错了,最新的minimax h3基本很顺,各种ai框架和项目很多都有rocm版本,没有的话让AI自己修改编译出来也不是不行。哔哩哔哩按他的说法,7900xtx跑文字大模型走 Vulkan 后端也挺省事。
“别碰派”:
故事更具体。一位用户在评论(11 赞)里说,自己买了两张 9060xt,结果由于 ROCm 对主板 PCIe 插槽有要求,普通游戏主板上这两张卡在 vLLM 下没法做张量并行。哔哩哔哩他的原话很扎心:“对于一个team来讲,这些事情都是工作。但是对于一个个人来讲,这些都是灾难。”
还有更深一层的观点。评论区有人指出,这不只是软件差距——AMD 从 gfx1250 开始才补全了张量并行、数据移动、全局屏障这类硬件特性,gfx90a、gfx942、gfx950 这些老代际就算了。哔哩哔哩你选哪张卡,决定了你的起点。这是本轮讨论里最反直觉的结论:A 卡跑 AI 的坑,有一部分是软件更新救不回来的。捡老卡之前,先查 gfx 代际。

三、决策清单:3 种情况可以买,3 种情况直接 N 卡
可以认真考虑:
预算有限,跑 ComfyUI 画图或单卡文字推理,自己能查资料排错,不追首发新模型;
Linux 主力系统,或者不介意 WSL2 + Docker;
买之前能确认卡在 ROCm 支持名单里,且 gfx 代际够新。
老老实实买 N 卡:
需要多卡张量并行、要对外提供服务;
生产环境,稳定压倒一切;
新模型、新框架发布当天就要跑,不想等社区适配。
补一句价格:A 卡和 N 卡的差价确实大,这是讨论的根本动力。评论区用户提到的蓝宝石 7900 XTX,盖板版 6800 多、超白金版 7500。哔哩哔哩可以和同显存的 N 卡自己比差价——差价要只有一两千,折腾成本就不划算了。
四、三个值得继续盯的信号
ROCm.ai:AMD 在 7 月底的 Advancing AI 2026 峰会上正式发布,定位是 AI 原生开发体验,借助主流 AI 编程助手,在 AMD 平台上完成 AI 工作负载的安装、部署、故障排查与性能优化。知乎连 AMD 自己都下场做安装助手,最大的坑是什么不言而喻;
白名单和 Windows 支持:ROCm 每次版本更新,对着自己心仪的卡型号查一遍更新日志;
框架侧修复的频率:vLLM 那次"12 倍"证明社区能量在上升,下半年能攒出多少修复,决定 A 卡性价比是不是真的成立。

最后一句:买 A 卡省的是钱,花的是时间。下单前问自己一个问题——如果明天想跑的模型今天还不顺,你愿不愿意花两周去折腾?愿意,A 卡可以考虑;不愿意,N 卡多花的钱买的是确定性。