这周A卡圈连发两条视频,说的都是同一件事:炼丹。
一条是晓子ya今天发的「AI-Toolkit + AMD显卡|ROCm 实测训练 LoRA」,另一条是机智罗的ROCm-OneTrainer炼丹炉部署教程——后者评论区里,两百多条留言有人在报「整合包版本+显卡型号」,有人直接喊出「AMD,yes!凭一人之力,支撑B站AMD区」。哔哩哔哩哔哩哔哩
推理那边,A卡早就卷完了:Qwen3.8-27B、一键整合包、tok/s对比,答案摆在那里。但「A卡能不能训练」,还处在「有人说能、有人说不行、更多人没听说过」的阶段。今天把这事一次说清:能不能训、选哪个炉子、要多少显存、哪些卡别硬上。

先回答问得最多的:A卡到底能不能训练
能。而且门槛比大多数人想象的低。
关键是一个技术事实:ROCm版PyTorch复用的是torch.cuda这套接口。知乎也就是说,代码层面A卡和N卡几乎没有区别,网上那些N卡LoRA教程,换掉安装源就能直接跟着做。知乎上AMD算力极客社把这个逻辑梳理得很清楚:推理、服务、微调是三件独立的事,先定模型多大、精度多少、batch开多少,再去看硬件。
但边界也很硬。综合各视频评论区的真实反馈,现在的支持情况大致是这样:
RDNA3(7900XTX / 7900XT / 7800XT等):最成熟的一批。OneTrainer报到处里清一色这些卡,出图炼丹都有人跑通;
RDNA4(9070XT / 9070):开始有实测了。有人拿9070XT跑AnimaLora训练器。哔哩哔哩Z-image训练器也明确写了支持9000系;
RDNA2(6000系):官方路线走不通,靠第三方工具自己适配。Z-image训练器标称「支持6000/7000/9000系」,这是工具自己的本事,不是ROCm的官方承诺;
RX 5700这一代(RDNA1):基本放弃。有用户在评论区问「以前用ZLUDA,ROCm支不支持老卡」,得到的回复只有四个字:基本不支持。曾经让老卡在Windows上干活的ZLUDA,也已经退出当下的选择。
所以第一个结论:想在A卡上炼丹,7000系及以上是基本前提。老卡别硬上,热情耗在不支持的环境里不值当。

炉子盘点:你想炼什么丹,决定进哪个炉
现在A卡的炼丹炉其实分两个阵营,看你炼的是什么。
出图、出视频方向:
OneTrainer(机智罗的ROCm整合包):Windows上目前最热闹的A卡炼丹炉,V4整合包解压即用,评论区已经在等2.0。优点是把环境配置降到接近零,缺点是装包要拉大量海外依赖,网络代理没配对直接报错。评论区有人给出过逐行设置全局代理、删掉src重装的手工解法。哔哩哔哩
kohya_ss(晓子ya适配版):训SDXL、Flux.1 LoRA的老牌工具,N卡用户无缝切换;
Z-image训练器:亮点是6000/7000/9000系通吃。哔哩哔哩对6000系用户是目前少数有明确说法的选择;
AnimaLora:Windows-ROCm独立训练器,偏动漫风格LoRA。
大模型微调方向:
AI-Toolkit:晓子ya今天刚发了ROCm实测,面向Flux和视频模型的LoRA训练;
Unsloth:AMD算力极客社8月中旬给过一篇完整教程,notebook可以照抄。<#&!53#&!>哔哩哔哩
PyTorch + LLaMA-Factory或自写脚本:ROCm安装已经跑通的人,换个pip源,N卡教程直接复用。
给个直接的建议:目标是出图LoRA、又不想碰Linux的Windows用户,从OneTrainer整合包这条线入手,社区踩坑记录最全,出了问题最好查;目标是大模型微调的,老老实实上Linux,ROCm 7.14加PyTorch这条线现在是通的。
显存生死线:能跑27B推理,为什么一进炉就爆
这是炼丹圈最常见的误判:以为能推理的显存就能训练。
真不是。推理时显存里放的是模型权重、KV Cache,加一点临时空间;训练时,权重之外还要放梯度、优化器状态(Adam的两份动量)、反向传播留下的激活。AMD算力极客社拿8B参数模型算过一笔账。知乎
QLoRA:约12GB
LoRA:约28GB
全参数微调:约85GB
注意,QLoRA只是把要训练的参数降下来,那个4-bit压缩后的底座,依然整份躺在显存里。

代入A卡的显存档位:
24GB(7900XTX):A卡炼丹的甜点位。SDXL LoRA没压力,Flux LoRA有AI-Toolkit这条实测线在,8B级大模型走QLoRA也进得去;标准LoRA会紧张,得减batch或做offload;
20GB(7900XT):比上不足比下有余,出图LoRA从容,8B级QLoRA可行;
16GB(7800XT、7900GRE、9070XT等):出图LoRA可以干,大模型微调基本只剩QLoRA一条路;
12GB及以下:建议安心推理,别为难自己。
今年涨价潮把二手7900XTX顶到了4600上下。哔哩哔哩如果你是为了炼丹买卡,「24GB显存」这条线的价值反而更清楚了——但先算显存账,再谈买哪张,顺序别反。
炼丹专属的坑:推理时一个都碰不上
从社区实测帖里捞了四个最常栽的:
PyTorch无视HIP_VISIBLE_DEVICES。想把GPU0留给推理、训练绑GPU1,设了环境变量却OOM——llama.cpp系认这个变量,PyTorch ROCm某些情况下直接无视,进程看到的是全部物理卡。知乎多卡环境一律用物理卡号,别用过滤后的编号;
GPU序号是0,不是1。整合包里验证显卡时,本地主卡正常是序号0,选错直接报错或者跑到核显上,评论区已经有人提前踩过;
装包卡在网络。ROCm-OneTrainer的依赖要从海外拉,不开全局代理就中途失败。已验证的解法:cmd里手动设置HTTP_PROXY、HTTPS_PROXY、ALL_PROXY,删掉src文件夹和ROCm-OneTrainer目录,进炼丹器重装;
注意力算子偏弱。7900XTX用户原话:「A卡感觉就是注意力经常不集中」,他试了一圈工作流,只有LTX能持续满血运行。哔哩哔哩机智罗给的方向是sage attention加速。这是生态短板,不是你的设置问题,碰到别先怪自己。

谁该进炉,谁再等等
盘下来,我的判断是三拨人三条路:
已有7900XTX/7800XT、推理跑通、想炼出图LoRA的:直接上。Windows走OneTrainer整合包,Linux走kohya或AI-Toolkit,社区记录够你抄作业;
想微调大模型、但还没买A卡的:别急着掏钱。AMD开发者计划现在有云算力可以白嫖,GitHub上的AMD_YES_Cloud仓库就是白嫖教程。GitHub先验证你的工作流在ROCm上到底跑不跑得通,再决定为硬件付费。这是这次盘点里最容易被忽略、也最省钱的一条路;
想做全参数微调、多卡分布式,或者手里是RDNA1老卡的:劝退。现阶段就是不行,这不是看两篇教程能克服的边界。
往后值得盯的信号:ROCm.ai带起来的官方工具适配会不会扩到训练侧、9070系的炼丹实测能不能再多一些、注意力算子除了sage attention还有没有别的加速方案。A卡这条路,推理端的「能用」正在往训练端的「可用」挪,速度比很多人想的快——但别信信仰,信实测名单。
你已经在A卡上炼丹了吗?评论区报一下卡型号和炉子,这张A卡炼丹地图,靠大家接着补。