最近一周,知乎上"开源项目使 AMD 显卡可跑部分 CUDA 库,将如何改变 GPU 市场格局?“的问题被顶上了显卡话题。 B站也出现了"在Windows上用ZLUDA让AMD显卡跑CUDA程序"的中文字幕教程。 评论区最常见的反应是两种:一种是"老黄的护城河塌了”,另一种是"这玩意儿2024年不是死了吗"。知乎哔哩哔哩
这篇内容就是写给手里有RX 6000/7000/9000系(或者Strix Halo这类A核显)、一直在"给A卡装AI环境"上吃过苦头、现在纠结要不要为CUDA生态换N卡、或者想试试ZLUDA的玩家。一句话剧透:这一波值得跑CUDA的东西确实变多了,但"跑上CUDA"和"用上N卡"仍然是两本账。
先把时间线摆清楚:它死过一次,也换过三次方向
单个帖子讲不清这事,因为信息散在过去14个月的新闻、视频和折腾笔记里,跨源拼起来是这样一条线:
时间 | 节点 | 关键事实 |
|---|---|---|
2020年起 | 波兰开发者Vosen个人启动 | 用Rust重写CUDA运行时,GitHub 14000+ Star,Apache 2.0协议 |
2024年 | 项目濒临关闭 | 遭遇CUDA许可层面的法律压力,更新停滞 |
2025年7月 | 被"神秘方"救活 | Tom’s Hardware报道:获得未知资方支持,扩充团队,重心转向AI |
2025年12月 | 适配ROCm 7 | 让A卡在AMD自家新框架上也能走转译路线 |
2026年6月29日 | v6正式版 | 首个正式版本;Wccftech报道其带来32位PhysX支持 |
2026年9月中旬 | 社区爆点 | Windows教程、知乎热议、ComfyUI整合包跟进,"部分CUDA库"说法出圈 |
所以"2024年不是死了吗"和"现在怎么又能用了"都对——它确实死过,复活后重写了架构规避了当年被卡脖子的实现方式(社区普遍这么解释,官方没有逐条回应专利问题,这里保持存疑),并且把火力从泛兼容集中到了游戏物理和AI负载这两块。IT之家
第一笔账:游戏玩家,206%帧率是真的,但只对一类游戏
快科技给的实测最有画面感:锐龙9 9950X3D + RX 9070 XT跑《四海兄弟2》,不启用ZLUDA时26.2帧,启用后80.2帧,提升206.11%。快科技
这里有个黑色幽默的背景:NVIDIA在RTX 50系上砍掉了32位CUDA,导致大量依赖32位PhysX的老游戏在N卡上反而不能玩了;v6 ZLUDA第一次让A卡支持32位PhysX,等于A卡捡起了N卡扔掉的遗产。IT之家
但账本边界要说清:这206%对比的是"物理计算掉回CPU"的糟糕基线,受益面是PhysX重度依赖的老游戏(GTA系、《地铁》系那类)。你的游戏如果不吃PhysX,这3倍跟你一点关系都没有。它不会让RX 7800 XT在3A新作里突然打赢5070。

第二笔账:出图/AI玩家,"能不能跑"的问题变小了,"跑歪了"的问题还在
对ComfyUI玩家,ZLUDA的真实价值不是比ROCm快,而是快。B站那个"有rocm了,zluda有什么区别"的高赞楼层下面,回答一针见血:一个是能不能跑,一个是跑的快不快。zluda是快速让a卡可以用上cuda支持的节点和插件,效率另说。哔哩哔哩
具体到数字,7800XT的出图对比测试结论是:ZLUDA比ROCm原生慢10%左右,但相对DirectML是"史诗级提升"。 社区也有人反过来说"rocm很多时候效率比转译的ZLUDA差很多"——两派说法都有,实际表现高度依赖显卡型号、驱动版本和具体工作流,现阶段给不出"转译一定更快/更慢"的统一结论,能确认的只有:对CUDA独占的节点和插件,转译路线是目前Windows A卡上最省事的入口。哔哩哔哩

真正的坑不在速度,在数值行为。今年6月知乎上一个159万浏览问题下的排查长文给出了教科书级案例:SageAttention在RDNA3(7900 XTX)上出黑图,根因之一,是Triton后端半精度累加在长序列下溢出产生NaN,VAE解码时把NaN截断成0,最终整张图变黑。 根因之二,是它的block配置(128×64)编译时需要约106KB共享内存,而RDNA3单个workgroup物理上限只有65KB。 解法是拿patientx/ComfyUI-Zluda仓库的补丁文件覆盖、清掉~/.triton/cache重编译。知乎知乎
这段信息量大,翻译成人话:CUDA程序"跑在"A卡上,不等于"按N卡的物理特性"跑。 转译层搬得动API,搬不动张量核心和共享内存规格,精度敏感环节要靠社区逐个打补丁。从手动git clone拉SD WebUI源码、装依赖开始,到给ComfyUI补节点,老玩家曾写下"什么WSL、Ubuntu、ROCm、DirectML、ZLUDA三天三夜挨个试遍、报错红字看得眼睛都花了"的抱怨。 这类抱怨正在被ComfyUI-Zluda整合脚本收敛——530条评论的部署工具视频就是需求量的证明——但没到消失。知乎

第三笔账:训练/多卡玩家,这轮跟你没关系
知乎那个问题下最扎心的高赞回答是"无感"两个字:ROCm一直能翻译迁移CUDA代码,问题从来不在"套壳",而在AMD现役至少三套互不兼容的硬件框架(延续GCN的CDNA、老的RDNA3、新方向的RDNA4/CDNA5),“光能把CUDA套上去根本没啥用”。知乎
不过"跟你没关系"也要拆开看:推理侧的边界其实一直在被往前推。今年8月有人拿Ryzen AI Max+ 395主机用llama.cpp跑Qwen3.8-27B,实测日志显示提示词评估约244 t/s、生成约36.5 t/s——395这类大显存APU用量化方案单机跑中等模型已经能看。但这是单机推理的成绩单,不是多卡训练的入场券。

这个批评对训练场景成立:ZLUDA没有、短期内也不可能有Tensor Core对应物和NCCL等价物,多卡并行、大模型微调这些正儿八经的GPU并行计算负载,该买N卡还是得买N卡,该等CDNA5官方底层库跟进还得等。v6把自己定位成了"首个正式版本"。 知乎问题标题用的也是克制的"部分CUDA库"。 把它读成"任意CUDA程序",就是自己骗自己了。哔哩哔哩知乎
该上车还是该等:按人群给结论
A卡老游戏玩家(PhysX受害者):可以试,v6对32位PhysX的支持方向明确,尤其你如果同时看着RTX 50系那些跑不了老PhysX的游戏,A卡这局是净赚。
Windows上的A卡出图党:值得试,直接用成熟的ComfyUI-Zluda整合/部署脚本,别自己裸搭;遇到黑图先怀疑精度补丁,再怀疑驱动。
Linux + RDNA3/4追求极限出图效率:ROCm原生仍是基准路线,ZLUDA拿来补"只有CUDA版"的插件缺口,两条腿走路。
准备多卡训练/生产环境:观望,这轮转译红利覆盖不到你。
正在纠结要不要赶在涨价潮里上N卡:至少这条新闻改变了一件事——A卡的生态折价在缩小,砍预算换N卡前,先列出你依赖的具体库再决定。
最后给一个继续观察的信号:NVIDIA这边,CUDA 13.4预览版据媒体报道已经提前解锁下一代Rubin架构适配、并首次推出Windows Arm64原生开发套件(单一自媒体来源,先当传闻看)。 护城河的打法从来不是堵住转译,而是把生态往前一代架构和新平台续杯。转译层永远在追,所以判断ZLUDA值不值得上车,别问"能不能跑CUDA",要问"我依赖的那个具体东西,现在谁替它踩过坑了"——补丁仓库的issue区,比发布会诚实。知乎