这个夏天,B站的 CUDA 课程集体爆发了。
光是七八月份:北大未名超算队和 LCPU 的 AI Infra Seminar 开讲。哔哩哔哩英伟达官方《现代 CUDA 编程》全集被搬上 B 站,还配了中英字幕。哔哩哔哩斯坦福 CS149《并行计算》也更新完了全 19 讲。哔哩哔哩国内开源社区 InfiniTensor 的暑期课,则一路更到了训练框架篇。
小红书上收藏很高的"保姆级 CUDA 学习路线"帖,把痛点总结得很一致:资料太老,官方指南太细,新手被劝退。小红书另一篇路线帖说得更直接:市面上的 CUDA 学习资料,要么太老旧,要么就是英伟达官方指南太细节。小红书
一边是课程井喷,一边是路线帖常年霸榜。这个反差说明的事很实在:学 CUDA 的人没有变少,但痛点变了——不再是"没得学",而是"选不过来,还怕选到过时的"。
我替大家把 B 站、知乎、小红书的相关课程和帖子过了一遍,按收藏数据排了个座次。结论先说:2026 年学 CUDA,先选方向,再选课。课程真正值得看的有四类,还有两个坑要避开。
学习区,收藏是最诚实的投票
先看数据。把 B 站近半年的 CUDA 相关课程按收藏排序,站在第一梯队的课程如下(截至 8 月中旬)。
课程 | 收藏 | 播放 | 类型 |
|---|---|---|---|
北大未名超算队×LCPU AI Infra Seminar:CUDA 编程模型 | 868 | 1.1万 | 国内公开课 |
英伟达官方《现代 CUDA 编程:CUDA Tile 到多 GPU》 | 755 | 5.2千 | 官方新课 |
GPU Mode 社区课:PyTorch+Triton+LLM 优化 | 664 | 3.9千 | 社区工程课 |
斯坦福 CS149《并行计算》全 19 讲 | 632 | 3.5千 | 学术课 |
英伟达官方《现代 CUDA 与 C++ 编程》 | 627 | 4.4千 | 官方课 |
面向 NVIDIA H100 的 CUDA 编程综合课 | 532 | 2.6千 | 硬件定向课 |
对比一下:同一批搜索结果里,不少标题带"从入门到精通"的课程,播放几千,收藏只有个位数。
为什么盯着收藏数据看?因为学习类内容里,播放量是标题骗进来的,收藏才是"我真的打算把它学完"的表态。收藏率高的课程,等于先被一批真实学习者用脚筛过一轮。
第一类:官方系统新课,赢在"新"
英伟达官方《现代 CUDA 编程》系列有两门课都进了收藏前六。值得看的不是"官方"这个头衔,而是新——《CUDA Tile 到多 GPU 实战》这一门,已经在讲 CUDA 13 这代开始力推的 tile 编程范式 cuTile。cuTile 是英伟达面向 tile 编程方向的官方框架。知乎这件事为什么重要?现在网上流传的大部分 CUDA 教程停留在 CUDA 12 之前的体系:讲线程块、共享内存、规约,这些没错,但不讲 Tensor Core 时代的写法,更不会碰 cuTile。而 CUDA 13 这一年连更了四个版本,官方编程文档已经写到 13.3。知乎拿三五年前的教程学 CUDA,概念不算错,但上手干活时会发现要重学一遍。
cuTile 本身也值得留意。NVIDIA Labs 六月放出了配套的 Rust 方向研究。知乎中文社区从五月起也有了 cuTile 的 C++ 上手实战,有人把它写成了中文第一份 cuTile C++ 博客。知乎同期还出现了"CUDA vs Triton vs TileLang vs cuTile"的四方横向对比文章。知乎学官方新课,起码能知道这个新范式在解决什么问题。

第二类:社区前沿工程课,AI Infra 方向的加餐
GPU Mode / CUDA Mode 这个社区讲座系列,在 B 站收藏榜前二十里占了三个版本:中英双语版、中配版、合集版。哔哩哔哩收藏最高的是主打"PyTorch+Triton+LLM 优化"的 GPU Mode 课,664 收藏。哔哩哔哩
这类课不教语法,讲的是真实工程问题:FlashAttention 怎么写、Triton 的编译流程、算子怎么融合。门槛不低,生词多,不适合纯新手。但如果你的目标是大模型训练或推理方向,它是目前最快能摸到"业界实际在干什么"的入口。
一个实用建议:这类课不用从第一讲顺着看,挑自己关心的主题先看——GEMM、attention、量化,各来一两个就够回本。
第三类:中文系统课,新手最好的起点
完全没写过 CUDA 的话,我建议第一门课选中文系统课,理由很朴素:听得懂、跟得上、不花钱。
值得看的第一套是 InfiniTensor 的 2026 暑期系列,《并行编程导论与 CUDA 入门》《CUDA 基础入门:向量规约》《训练框架编程基础》一路排下来,全部免费。哔哩哔哩配套的 cuda-graph 章节单独拆开讲优化原理和代码走读,两讲分别拿到 605 和 301 收藏,比很多付费课都高。哔哩哔哩
第二套是北大未名超算队×LCPU 的 AI Infra Seminar,第一讲 CUDA 编程模型拿到 868 收藏,是这次统计里 B 站近半年收藏最高的 CUDA 课。哔哩哔哩
这类课的短板也要说清:更新节奏看作者档期,深度到框架层为止,再往底层走还得配第二类、第四类内容。
第四类:学术打底课,给想补体系的人
在校生,或者想把 GPU 架构彻底搞明白的人,组合还是经典两件套:斯坦福 CS149 全 19 讲,加上 PMPP 教材《Programming Massively Parallel Processors》第四版。
PMPP 的地位可以看数据。知乎"有没有一本讲解 GPU 和 CUDA 编程的经典入门书"这个问题常年有人问,高赞回答收藏 5000+。知乎另一条 51 万播放的回答更直接:只看一本书的话,就是它。知乎学术课的老规矩:只看不练等于白看,课后题一定要动。

两个坑,先避开再出发
坑一:过时教程。判断标准很朴素——整门课不提 Tensor Core、用的 API 在新版文档里已经废弃、评论区全是"新版本编译不过",直接换。学教程省下的时间,会在配环境和改代码时加倍还回去。
坑二:环境配置。CUDA 版本、驱动版本、PyTorch 版本三者的对应关系,几乎每个新手都会栽。这个我们之前专门写过一篇 2026 年驱动、CUDA 13 与 PyTorch 的版本匹配表,装环境前先翻那篇,能省几个小时弯路。
三种人,三个起点
你是 PyTorch 用户,想懂底层或者转 AI Infra:先用 InfiniTensor 暑期课或北大 Seminar 把编程模型建起来(1-2 周),再看 GPU Mode 挑主题补工程感(2-4 周),最后自己动手写一个 reduce 或小 GEMM,用 Nsight 定位瓶颈。最后这一步,才是从"看过"到"会写"的分界线。
在校生补基础:CS149+PMPP,课后题一道道做,别急着追时髦框架,基础是会复利的。
冲 AI Infra 求职:课程只是前半程,面试考的是现场手撕算子和性能分析。之前写过的 CUDA 题库和 Nsight Compute 实操两篇,可以直接接在这条路线后面。

最后,留个观察信号
最后说句泼冷水的话:学习区里收藏最诚实,但也最骗人——收藏不等于学会。收藏第一的课程有 868 人收藏,真正学完的,大概率不到一成。
与其再收藏一篇路线帖,不如先挑一门开学。三个信号可以持续关注:cuTile 生态官方和社区的新动作、InfiniTensor 下一季暑期课的课表、GPU Mode 讲座的中文化进度。课程潮退去之前,先挑一门看完,比什么都值。