随便打开一条 ComfyUI 或 PyTorch 的安装教程,评论区大概率长着同一副样子。
最近B站一条 CUDA 13 环境教程下面,是这么一排留言:「CUDA 13.2能用吗」「50系显卡能用吗」「13.0要装Cudnn吗」「安哪个啊up主」「为啥我的cuda不是13.0也能用」哔哩哔哩。五条留言,五个方向,其实问的是同一个问题:2026年,我这张卡到底该装什么,才能跑起来?
这个问题今年格外乱,是因为整套栈正在换代:CUDA 从 12.x 迈进了 13.x,PyTorch 一年里从 2.9 出到了 2.13哔哩哔哩哔哩哔哩。六月的热门 ComfyUI 整合包,甚至已经用上了 torch 2.12 + cu132哔哩哔哩。而网上大多数教程还停留在 CUDA 11/12 时代的思路。如果你是拿着 RTX 显卡想做点本地 AI、或者准备入门 GPU 编程的人,这篇一次给你理清。
先搞懂三个数字,再谈「装哪个」
大部分混乱的根源,是你看到了三个不同的版本号,却以为它们是同一个东西。
第一个:nvidia-smi 里的 CUDA Version。 它表示「当前驱动最高支持的 CUDA 运行时版本」,不是你机器上装了什么知乎知乎。看到 13.2,只说明你的驱动够新,别的什么都说明不了。
第二个:nvcc --version。 这才是机器上真正安装的 CUDA Toolkit 版本,编译 CUDA 代码用的那个东西。很多人压根没装过它。
第三个:torch.version.cuda。 这是 PyTorch 自带的 CUDA 运行时版本,装 wheel 的时候就定了。
三者关系一句话:驱动 ≥ CUDA 运行时 ≥ CUDA Toolkit知乎。驱动定上限,框架运行时不能超过这个上限,而 Toolkit 只有在你自己编译代码时才需要。下面这张真实终端截图,把三个数字一次凑齐了:nvcc -V 是 Toolkit 13.2,nvidia-smi 里 Driver Version 595.84、CUDA Version 13.2,两者各司其职。

由此引出一个反直觉但重要的结论:如果你只是跑 ComfyUI、llama.cpp、PyTorch 这类现成环境,多数情况下根本不需要安装 CUDA Toolkit。 现在 pip 装的 PyTorch wheel 里已经打包了所需的 CUDA 运行时和 cuDNN,你只要装好显卡驱动就行知乎知乎。老教程里「先去官网下载 CUDA、再装 cuDNN」那一大段流程,对今天的预编译环境来说大多是可以跳过的。
一张兼容表:RTX 30 / 40 / 50 各配什么
项目 | RTX 30系(Ampere) | RTX 40系(Ada) | RTX 50系(Blackwell) |
|---|---|---|---|
最低 CUDA 要求 | 11.x 即可 | 11.8+ | 12.8+,硬性要求 |
当前建议 | 12.x 求稳 | 12.8 或 13.x | 13.x |
PyTorch 怎么选 | cu12x 构建 | cu128 / cu130 构建 | cu130 及以上构建 |
需要装 Toolkit 吗 | 跑现成环境不需要 | 跑现成环境不需要 | 跑现成环境不需要 |
表外还有三件事要单独圈出来:
RTX 50系是这次换代的分水岭。 Blackwell(算力标识 sm_120)必须 CUDA 12.8 及以上才能编译和运行它的 kernel,环境还停在老版本的话,会直接撞上「no kernel image is available」这类报错。这也是「50系能用吗」在评论区高频出现的原因——不是整合包歧视新卡,是老环境真带不动。

CUDA 13.x 与老卡无关了。 CUDA 13 砍掉了 Maxwell、Pascal、Volta 架构的支持,也就是 GTX 900/10 系、Titan V 这批老将。这些卡停在 12.x 就是最优解,强行升级只会收获无法识别。
13.x 内部小版本互相兼容。 NVIDIA 的小版本兼容策略意味着,你的环境是 13.0,跑要求 13.2 的预编译软件通常也没问题。所以有人问「为啥我的 cuda 不是 13.0 也能用」——不是玄学,是规则本来就允许。
三个最常见的误区,踩中一个折腾半天
误区一:「nvidia-smi 显示 13.2,那我就去装 13.2 的 Toolkit」。 那个数字是驱动的支持上限,不是安装目标。只跑现成框架的话,它唯一的用途是确认「驱动够新了」。
误区二:版本越新越好。 版本要跟硬件和框架匹配。10系老卡上 CUDA 13 直接不支持;太新的 PyTorch,有些推理框架还没来得及适配。稳妥的做法是跟着框架文档推荐的 CUDA 版本走,而不是追最新。
误区三:三个数字对不上就是环境坏了。 nvidia-smi 显示 13.2、torch.version.cuda 是 12.8,冲突吗?不冲突。只要「驱动 ≥ 运行时」成立就一切正常。真正会挂的是反过来的情况:驱动太旧、运行时太新——那时该做的是更新驱动,而不是重装 CUDA。
顺带一个实用提示:pip 装 PyTorch 或用整合包的时代,cuDNN 一般也不用手动装了,wheel 里自带。手动装 cuDNN 的场景,基本只剩源码编译和某些特定推理引擎。
三类人,三种装法
玩出图、ComfyUI、本地小模型的: 最省心的路线是直接上整合包或官方 wheel,别碰 Toolkit。驱动更新到最新,跑一句 torch.cuda.is_available() 验证。RTX 50系用户额外确认一点:包得是 cu128 及以上构建,今年六月的热门整合包(torch 2.12 / cu132)就是按新卡环境做的。
学 CUDA 编程的: 你是唯一真需要装 Toolkit 的人群。官网下载页如今已经给到 CUDA Toolkit 13.3 Update 1知乎。建议驱动最新 + Toolkit 按卡选(50系直接上 13.x,30/40系可以留在 12.8 求稳)。

用官方 cuda-samples 从向量加法、矩阵乘法写起,再上 Nsight Systems / Nsight Compute 看性能——kernel 的访存、占用率、瓶颈都摆在界面上,优化不再靠猜。

学习阶段,「写得出来、测得明白」比追最新版本重要得多。
跑大模型推理的(llama.cpp、vLLM 一类): 严格按框架官方文档的版本表来,不要为了「说不定更快」自己拔高 CUDA。推理框架对 CUDA 版本敏感,大版本跳太前,往往先撞上没人踩过的坑。
最后,两件值得继续盯着的事
一是 CUDA 13.x 的迭代节奏和 RTX 50 软件栈的成熟度。50系硬件铺开了,它能不能吃满性能,取决于各框架对 sm_120 的适配进度,接下来几个 PyTorch 小版本值得留意。
二是生态层面的变化。TileLang、Triton 这类「不手写 CUDA」的工具已经进入大厂生产线知乎知乎。PyTorch 侧 torch.compile + Triton 动态编译的普及,让本地装 Toolkit 的必要性进一步下降。「装全套 CUDA」这个动作,未来大概率会越来越少见——护城河还在,但入口正在变。
一句话收束:驱动定上限,框架定运行时,Toolkit 只给写代码的人。搞懂这三个数字的分工,2026 年的 CUDA 安装问题,九成不会再让你抓狂。