帧率26飙到80:复活后的ZLUDA让A卡捡回N卡扔掉的PhysX,但这三笔账别算混了

源自29位全网作者

03:34

最近一周,知乎上"开源项目使 AMD 显卡可跑部分 CUDA 库,将如何改变 GPU 市场格局?“的问题被顶上了显卡话题。 B站也出现了"在Windows上用ZLUDA让AMD显卡跑CUDA程序"的中文字幕教程。 评论区最常见的反应是两种:一种是"老黄的护城河塌了”,另一种是"这玩意儿2024年不是死了吗"。知乎哔哩哔哩

这篇内容就是写给手里有RX 6000/7000/9000系(或者Strix Halo这类A核显)、一直在"给A卡装AI环境"上吃过苦头、现在纠结要不要为CUDA生态换N卡、或者想试试ZLUDA的玩家。一句话剧透:这一波值得跑CUDA的东西确实变多了,但"跑上CUDA"和"用上N卡"仍然是两本账。

先把时间线摆清楚:它死过一次,也换过三次方向

单个帖子讲不清这事,因为信息散在过去14个月的新闻、视频和折腾笔记里,跨源拼起来是这样一条线:

时间

节点

关键事实

2020年起

波兰开发者Vosen个人启动

用Rust重写CUDA运行时,GitHub 14000+ Star,Apache 2.0协议

2024年

项目濒临关闭

遭遇CUDA许可层面的法律压力,更新停滞

2025年7月

被"神秘方"救活

Tom’s Hardware报道:获得未知资方支持,扩充团队,重心转向AI

2025年12月

适配ROCm 7

让A卡在AMD自家新框架上也能走转译路线

2026年6月29日

v6正式版

首个正式版本;Wccftech报道其带来32位PhysX支持

2026年9月中旬

社区爆点

Windows教程、知乎热议、ComfyUI整合包跟进,"部分CUDA库"说法出圈

所以"2024年不是死了吗"和"现在怎么又能用了"都对——它确实死过,复活后重写了架构规避了当年被卡脖子的实现方式(社区普遍这么解释,官方没有逐条回应专利问题,这里保持存疑),并且把火力从泛兼容集中到了游戏物理和AI负载这两块。IT之家

第一笔账:游戏玩家,206%帧率是真的,但只对一类游戏

快科技给的实测最有画面感:锐龙9 9950X3D + RX 9070 XT跑《四海兄弟2》,不启用ZLUDA时26.2帧,启用后80.2帧,提升206.11%。快科技

这里有个黑色幽默的背景:NVIDIA在RTX 50系上砍掉了32位CUDA,导致大量依赖32位PhysX的老游戏在N卡上反而不能玩了;v6 ZLUDA第一次让A卡支持32位PhysX,等于A卡捡起了N卡扔掉的遗产。IT之家

但账本边界要说清:这206%对比的是"物理计算掉回CPU"的糟糕基线,受益面是PhysX重度依赖的老游戏(GTA系、《地铁》系那类)。你的游戏如果不吃PhysX,这3倍跟你一点关系都没有。它不会让RX 7800 XT在3A新作里突然打赢5070。

帧率26飙到80:复活后的ZLUDA让A卡捡回N卡扔掉的PhysX,但这三笔账别算混了

第二笔账:出图/AI玩家,"能不能跑"的问题变小了,"跑歪了"的问题还在

对ComfyUI玩家,ZLUDA的真实价值不是比ROCm快,而是。B站那个"有rocm了,zluda有什么区别"的高赞楼层下面,回答一针见血:一个是能不能跑,一个是跑的快不快。zluda是快速让a卡可以用上cuda支持的节点和插件,效率另说。哔哩哔哩

具体到数字,7800XT的出图对比测试结论是:ZLUDA比ROCm原生慢10%左右,但相对DirectML是"史诗级提升"。 社区也有人反过来说"rocm很多时候效率比转译的ZLUDA差很多"——两派说法都有,实际表现高度依赖显卡型号、驱动版本和具体工作流,现阶段给不出"转译一定更快/更慢"的统一结论,能确认的只有:对CUDA独占的节点和插件,转译路线是目前Windows A卡上最省事的入口哔哩哔哩

帧率26飙到80:复活后的ZLUDA让A卡捡回N卡扔掉的PhysX,但这三笔账别算混了

真正的坑不在速度,在数值行为。今年6月知乎上一个159万浏览问题下的排查长文给出了教科书级案例:SageAttention在RDNA3(7900 XTX)上出黑图,根因之一,是Triton后端半精度累加在长序列下溢出产生NaN,VAE解码时把NaN截断成0,最终整张图变黑。 根因之二,是它的block配置(128×64)编译时需要约106KB共享内存,而RDNA3单个workgroup物理上限只有65KB。 解法是拿patientx/ComfyUI-Zluda仓库的补丁文件覆盖、清掉~/.triton/cache重编译。知乎知乎

这段信息量大,翻译成人话:CUDA程序"跑在"A卡上,不等于"按N卡的物理特性"跑。 转译层搬得动API,搬不动张量核心和共享内存规格,精度敏感环节要靠社区逐个打补丁。从手动git clone拉SD WebUI源码、装依赖开始,到给ComfyUI补节点,老玩家曾写下"什么WSL、Ubuntu、ROCm、DirectML、ZLUDA三天三夜挨个试遍、报错红字看得眼睛都花了"的抱怨。 这类抱怨正在被ComfyUI-Zluda整合脚本收敛——530条评论的部署工具视频就是需求量的证明——但没到消失。知乎

帧率26飙到80:复活后的ZLUDA让A卡捡回N卡扔掉的PhysX,但这三笔账别算混了

第三笔账:训练/多卡玩家,这轮跟你没关系

知乎那个问题下最扎心的高赞回答是"无感"两个字:ROCm一直能翻译迁移CUDA代码,问题从来不在"套壳",而在AMD现役至少三套互不兼容的硬件框架(延续GCN的CDNA、老的RDNA3、新方向的RDNA4/CDNA5),“光能把CUDA套上去根本没啥用”。知乎

不过"跟你没关系"也要拆开看:推理侧的边界其实一直在被往前推。今年8月有人拿Ryzen AI Max+ 395主机用llama.cpp跑Qwen3.8-27B,实测日志显示提示词评估约244 t/s、生成约36.5 t/s——395这类大显存APU用量化方案单机跑中等模型已经能看。但这是单机推理的成绩单,不是多卡训练的入场券。

帧率26飙到80:复活后的ZLUDA让A卡捡回N卡扔掉的PhysX,但这三笔账别算混了

这个批评对训练场景成立:ZLUDA没有、短期内也不可能有Tensor Core对应物和NCCL等价物,多卡并行、大模型微调这些正儿八经的GPU并行计算负载,该买N卡还是得买N卡,该等CDNA5官方底层库跟进还得等。v6把自己定位成了"首个正式版本"。 知乎问题标题用的也是克制的"部分CUDA库"。 把它读成"任意CUDA程序",就是自己骗自己了。哔哩哔哩知乎

该上车还是该等:按人群给结论

  • A卡老游戏玩家(PhysX受害者):可以试,v6对32位PhysX的支持方向明确,尤其你如果同时看着RTX 50系那些跑不了老PhysX的游戏,A卡这局是净赚。

  • Windows上的A卡出图党:值得试,直接用成熟的ComfyUI-Zluda整合/部署脚本,别自己裸搭;遇到黑图先怀疑精度补丁,再怀疑驱动。

  • Linux + RDNA3/4追求极限出图效率:ROCm原生仍是基准路线,ZLUDA拿来补"只有CUDA版"的插件缺口,两条腿走路。

  • 准备多卡训练/生产环境:观望,这轮转译红利覆盖不到你。

  • 正在纠结要不要赶在涨价潮里上N卡:至少这条新闻改变了一件事——A卡的生态折价在缩小,砍预算换N卡前,先列出你依赖的具体库再决定。

最后给一个继续观察的信号:NVIDIA这边,CUDA 13.4预览版据媒体报道已经提前解锁下一代Rubin架构适配、并首次推出Windows Arm64原生开发套件(单一自媒体来源,先当传闻看)。 护城河的打法从来不是堵住转译,而是把生态往前一代架构和新平台续杯。转译层永远在追,所以判断ZLUDA值不值得上车,别问"能不能跑CUDA",要问"我依赖的那个具体东西,现在谁替它踩过坑了"——补丁仓库的issue区,比发布会诚实。知乎

内容由AI生成

精选参考来源

1. 开源项目使 AMD 显卡可跑部分 CUDA 库,将如何改变 GPU 市场格局?

2. 在Windows系统中,使用ZLUDA技术在AMD显卡上运行CUDA程序-FahdMirza

3. ZLUDA项目重整旗鼓:在非英伟达显卡上兼容安装和运行CUDA应用

4. 破局英伟达CUDA护城河:ZLUDA适配ROCm7,让A卡读懂N卡代码

5. NVIDIA砍掉的功能AMD显卡用上了:游戏帧率暴涨3倍!

6. 提升206.11%游戏帧率:ZLUDA v6发布,让AMD显卡初步支持英伟达PhysX

7. ZLUDA 6: 让 AMD 显卡跑 CUDA,用 Rust 重写 NVIDIA 的护城河

8. 【省流:史诗级提升】a卡zluda和rocm画图速度对比

9. 为啥AMD的ROCm26年被越来越多的广泛使用,Nvidia的CUDA不是一家独大么?

10. A卡/ROCm-7900XTX跑ComfyUI启用SageAttention出黑图(NaN)修复

11. A卡跑ComfyUI,到底是我不行还是卡不行?

12. 开源项目使 AMD 显卡可跑部分 CUDA 库,将如何改变 GPU 市场格局?(回答)

13. AMD Ryzen AI Max+ 395主机跑Qwen3.8-27B模型30+tok/s

14. CUDA 13.4重磅更新!NVIDIA显卡大换代节奏彻底改写

15. AMD显卡满血Stable Diffusion(SD+Fooocus+ComfyUI)无脑部署笔记(Linux+ROCm 7.2)[长期更新]

16. 全新ZludaComfyUI自动部署工具!零难度部署,AMD显卡用户必看!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章