先说结论:2026年8月,手里有一张 RX 7000 系或者 9070 系的 A 卡,想给大模型做 LoRA 微调,这件事第一次从"理论可行"变成了"有现成路可走"。
如果你对这个话题的印象还停留在"A卡训练?别折腾了,ZLUDA 都停更了",那信息确实该更新了。最近一个月连续发生了三件事:
7月22日,微调工具里用户最多的 Unsloth 官宣正式支持 AMD 显卡,而且是和 AMD 团队合作,把自家的自定义 Triton 内核适配到了 ROCm 上。知乎8月13日,Unsloth 又把训练能力做进了三端桌面客户端。就在今天,B站一位长期做 A 卡整合包的作者发布了一条实测视频——用 AI-Toolkit 在 ROCm 上训练 LoRA,从装环境到跑通全流程录了下来。哔哩哔哩
与此同时,知乎上整个8月都在反复出现同一类问题:“A卡到底能不能跑训练?”"ROCm 对比 CUDA 稳定性差多少?"问题密集出现本身就是一个信号:推理跑通的那批 A 卡用户,开始琢磨下一步了。
这篇文章就把"A卡微调"这个刚成立的赛道掰开讲清楚:现在有几条路、显存怎么算、哪些坑是死的、什么样的人现在动手合适。
为什么是"最近一个月"才成立
以前 A 卡训练难,难的不是一张卡、一个驱动,而是整条工具链:PyTorch 能跑起来只是第一步,微调框架依赖的加速内核(Flash Attention、Triton kernel、量化算子)大多只有 CUDA 实现。你要么用裸 PyTorch 硬扛,速度慢一截;要么走 ZLUDA 这类转译层,能不能跑全看运气。
这次不一样的地方在于,Unsloth 和 AMD 团队合作,把自定义 Triton 内核和量化算法直接适配到了 ROCm。官方给的数据是训练速度提升2倍、显存占用减少70%;在 MI300X 上训练 Llama-3.1-8B(LoRA SFT),2.07秒一个 step,对比 TRL + Flash Attention 2 的 2.87秒,快1.39倍,峰值显存从 24.3GB 降到 18.3GB。知乎注意这是数据中心卡上的官方数字,消费级卡上的倍率不会完全一致,但方向是明确的:A 卡训练从"能跑"进入了"有效率可谈"的阶段。
三条路线,服务的不是同一批人
现在 A 卡上做 LoRA,实际有三条路可走。它们不是简单的"谁更好",而是各自绑着不同的用户群。
第一条:Unsloth。 门槛最低,一条命令安装(Windows 上有 PowerShell 脚本,会自动检测 AMD GPU 并装好 ROCm 版 PyTorch、bitsandbytes 等依赖),支持 RX 6000/7000 全系和 Strix Halo 核显。8月中旬,Unsloth 还把训练能力做进了三端桌面客户端——数据集直接拖 PDF、CSV、JSON 进去,零代码训练,训完导出 GGUF 或 safetensors,直接喂给 Ollama、llama.cpp(不过桌面端在 AMD 卡上的训练支持目前还没有官方明确说法,A 卡用户优先走命令行路线更稳)。知乎适合目标是"给 LLM 训个风格/领域 LoRA"的普通玩家。
第二条:ai-toolkit。 今天B站那条实测视频走的就是这条路。它是社区作者维护的通用训练工具,配合 ROCm 启动器使用,和 ComfyUI 生态贴得更近——评论区已经有人在催"打标器也来一个",说明盯着这条路的多是想训图像模型 LoRA(比如给自己常玩的 SD 工作流定制模型)的用户。如果你的"微调"指的是出图而不是对话,看这条。
第三条:LLaMA-Factory。 支持模型最多(100+)、WebUI 零代码、国内教程最密集,但它的默认世界是 CUDA:官方文档、Docker 镜像、教程基本都围着 N 卡转,ROCm 属于"能走但要自己铺路"。适合本来就在用 LLaMA-Factory、且愿意为 ROCm 兼容性自己查文档踩坑的人。
一句话总结:训 LLM 选 Unsloth,训出图模型看 ai-toolkit,非 LLaMA-Factory 不用的做好自助准备。

先把显存账算清楚:训练不是推理
很多推理跑顺了的用户会下意识觉得:"我 24GB 显存能跑 27B 模型,微调一个 8B 还不是绰绰有余?"这笔账不能这么算。
推理时显存里放的是权重文件加 KV Cache;训练时,除了权重,还要放梯度、优化器状态(Adam 的一阶二阶动量)、反向传播的激活值。社区整理过的参考数字:以 8B 模型为例,QLoRA 大约要 12GB,LoRA 大约 28GB,全参数微调约 85GB。知乎
对应到 A 卡的现实:
24GB(7900 XTX/XT、9070 XT 一档):QLoRA 微调 8B~9B 级别模型是当前最舒服的姿势,参数调一调也有机会摸到 14B;LoRA 不量化直接训 8B 会比较紧。
16GB(7800 XT、9060 XT 一档):老老实实 QLoRA 训 7B/8B,batch 和序列长度都要抠着来。
至于"3GB 显存就能微调"的说法:那是极限小模型 + 极限压缩配置下的宣传口径,别按它规划你的预期。
想训 27B 以上?本地单卡这条路暂时不用想了。不过 AMD 给了个不花钱的替代方案:面向开发者的免费云笔记本,用 MI300X(192GB 显存),不用注册。想先验证一遍"我的数据集训出来到底有没有效果",再决定要不要往本地砸硬件的,可以先用它把流程跑通。

两条硬限制,动手前先对照
第一,A 卡多卡训练目前只支持 Linux。 Windows 上的 ROCm 还没有 GPU 集体通信后端。如果你打算"两张 7900 XTX 一起训",系统这关绕不过去。
第二,gfx1030 之前的老卡只有有限支持。 今天那条实测视频的评论区里,还有用户在问"RX 5700 能不能走这条路、ZLUDA 版还更新吗"。哔哩哔哩答案不太乐观,老卡用户的训练路线短期内不会有质变。
另外给多卡机器提个醒:社区8月下旬刚有人踩过坑——llama.cpp 系遵循 HIP_VISIBLE_DEVICES,但 PyTorch ROCm 在某些情况下会忽略这个环境变量,直接看到所有物理卡。知乎训练框架基本都走 PyTorch,多卡机器上指定设备时,别想当然,先小规模验证一下卡号映射。
什么人现在动手,什么人再等等
现在适合动手的:
手里有 RX 7000/9070 系 24GB 卡、Linux 环境、推理已经跑顺,想给常用模型训一个领域或风格 LoRA 的——Unsloth 路线,成本就是一两个晚上。
ComfyUI 重度用户想训图像模型 LoRA 的——跟着 ai-toolkit 的实测流程走,生态在快速补齐。

建议再等等的:
想训 27B 以上、或者必须多卡的——本地硬件条件还没到,先用免费云算力验证想法,别急着加卡。
RX 6000 以前(gfx1030 之前)的老卡用户——支持面有限,投入产出比不高。
对稳定性要求极高、训练中断一次就损失很大的正式项目——ROCm 训练链路的社区踩坑样本还远少于 CUDA,先小规模试跑。
值得持续盯的三个信号:ROCm 后续小版本对训练负载的修复节奏、Unsloth 的 AMD 支持迭代(这条线现在更新很快)、以及 LLaMA-Factory 什么时候把 ROCm 支持抬进官方主线。这三个里任何一个有动作,"A卡微调"的账都会重新算一遍。
推理这条路上的 A 卡用户已经证明了一件事:软件生态的坑再多,也挡不住性价比的吸引力。现在轮到训练了——这一次,门槛是真的降下来了。