这个夏天CUDA课程大爆发:对比全网收藏数据后,只有4类值得看完

源自16位全网作者

09:40

这个夏天,B站的 CUDA 课程集体爆发了。

光是七八月份:北大未名超算队和 LCPU 的 AI Infra Seminar 开讲。哔哩哔哩英伟达官方《现代 CUDA 编程》全集被搬上 B 站,还配了中英字幕。哔哩哔哩斯坦福 CS149《并行计算》也更新完了全 19 讲。哔哩哔哩国内开源社区 InfiniTensor 的暑期课,则一路更到了训练框架篇。

小红书上收藏很高的"保姆级 CUDA 学习路线"帖,把痛点总结得很一致:资料太老,官方指南太细,新手被劝退。小红书另一篇路线帖说得更直接:市面上的 CUDA 学习资料,要么太老旧,要么就是英伟达官方指南太细节。小红书

一边是课程井喷,一边是路线帖常年霸榜。这个反差说明的事很实在:学 CUDA 的人没有变少,但痛点变了——不再是"没得学",而是"选不过来,还怕选到过时的"。

我替大家把 B 站、知乎、小红书的相关课程和帖子过了一遍,按收藏数据排了个座次。结论先说:2026 年学 CUDA,先选方向,再选课。课程真正值得看的有四类,还有两个坑要避开。

学习区,收藏是最诚实的投票

先看数据。把 B 站近半年的 CUDA 相关课程按收藏排序,站在第一梯队的课程如下(截至 8 月中旬)。

课程

收藏

播放

类型

北大未名超算队×LCPU AI Infra Seminar:CUDA 编程模型

868

1.1万

国内公开课

英伟达官方《现代 CUDA 编程:CUDA Tile 到多 GPU》

755

5.2千

官方新课

GPU Mode 社区课:PyTorch+Triton+LLM 优化

664

3.9千

社区工程课

斯坦福 CS149《并行计算》全 19 讲

632

3.5千

学术课

英伟达官方《现代 CUDA 与 C++ 编程》

627

4.4千

官方课

面向 NVIDIA H100 的 CUDA 编程综合课

532

2.6千

硬件定向课

对比一下:同一批搜索结果里,不少标题带"从入门到精通"的课程,播放几千,收藏只有个位数。

为什么盯着收藏数据看?因为学习类内容里,播放量是标题骗进来的,收藏才是"我真的打算把它学完"的表态。收藏率高的课程,等于先被一批真实学习者用脚筛过一轮。

第一类:官方系统新课,赢在"新"

英伟达官方《现代 CUDA 编程》系列有两门课都进了收藏前六。值得看的不是"官方"这个头衔,而是新——《CUDA Tile 到多 GPU 实战》这一门,已经在讲 CUDA 13 这代开始力推的 tile 编程范式 cuTile。cuTile 是英伟达面向 tile 编程方向的官方框架。知乎这件事为什么重要?现在网上流传的大部分 CUDA 教程停留在 CUDA 12 之前的体系:讲线程块、共享内存、规约,这些没错,但不讲 Tensor Core 时代的写法,更不会碰 cuTile。而 CUDA 13 这一年连更了四个版本,官方编程文档已经写到 13.3。知乎拿三五年前的教程学 CUDA,概念不算错,但上手干活时会发现要重学一遍。

cuTile 本身也值得留意。NVIDIA Labs 六月放出了配套的 Rust 方向研究。知乎中文社区从五月起也有了 cuTile 的 C++ 上手实战,有人把它写成了中文第一份 cuTile C++ 博客。知乎同期还出现了"CUDA vs Triton vs TileLang vs cuTile"的四方横向对比文章。知乎学官方新课,起码能知道这个新范式在解决什么问题。

这个夏天CUDA课程大爆发:对比全网收藏数据后,只有4类值得看完

第二类:社区前沿工程课,AI Infra 方向的加餐

GPU Mode / CUDA Mode 这个社区讲座系列,在 B 站收藏榜前二十里占了三个版本:中英双语版、中配版、合集版。哔哩哔哩收藏最高的是主打"PyTorch+Triton+LLM 优化"的 GPU Mode 课,664 收藏。哔哩哔哩

这类课不教语法,讲的是真实工程问题:FlashAttention 怎么写、Triton 的编译流程、算子怎么融合。门槛不低,生词多,不适合纯新手。但如果你的目标是大模型训练或推理方向,它是目前最快能摸到"业界实际在干什么"的入口。

一个实用建议:这类课不用从第一讲顺着看,挑自己关心的主题先看——GEMM、attention、量化,各来一两个就够回本。

第三类:中文系统课,新手最好的起点

完全没写过 CUDA 的话,我建议第一门课选中文系统课,理由很朴素:听得懂、跟得上、不花钱。

值得看的第一套是 InfiniTensor 的 2026 暑期系列,《并行编程导论与 CUDA 入门》《CUDA 基础入门:向量规约》《训练框架编程基础》一路排下来,全部免费。哔哩哔哩配套的 cuda-graph 章节单独拆开讲优化原理和代码走读,两讲分别拿到 605 和 301 收藏,比很多付费课都高。哔哩哔哩

第二套是北大未名超算队×LCPU 的 AI Infra Seminar,第一讲 CUDA 编程模型拿到 868 收藏,是这次统计里 B 站近半年收藏最高的 CUDA 课。哔哩哔哩

这类课的短板也要说清:更新节奏看作者档期,深度到框架层为止,再往底层走还得配第二类、第四类内容。

第四类:学术打底课,给想补体系的人

在校生,或者想把 GPU 架构彻底搞明白的人,组合还是经典两件套:斯坦福 CS149 全 19 讲,加上 PMPP 教材《Programming Massively Parallel Processors》第四版。

PMPP 的地位可以看数据。知乎"有没有一本讲解 GPU 和 CUDA 编程的经典入门书"这个问题常年有人问,高赞回答收藏 5000+。知乎另一条 51 万播放的回答更直接:只看一本书的话,就是它。知乎学术课的老规矩:只看不练等于白看,课后题一定要动。

这个夏天CUDA课程大爆发:对比全网收藏数据后,只有4类值得看完

两个坑,先避开再出发

坑一:过时教程。判断标准很朴素——整门课不提 Tensor Core、用的 API 在新版文档里已经废弃、评论区全是"新版本编译不过",直接换。学教程省下的时间,会在配环境和改代码时加倍还回去。

坑二:环境配置。CUDA 版本、驱动版本、PyTorch 版本三者的对应关系,几乎每个新手都会栽。这个我们之前专门写过一篇 2026 年驱动、CUDA 13 与 PyTorch 的版本匹配表,装环境前先翻那篇,能省几个小时弯路。

三种人,三个起点

  • 你是 PyTorch 用户,想懂底层或者转 AI Infra:先用 InfiniTensor 暑期课或北大 Seminar 把编程模型建起来(1-2 周),再看 GPU Mode 挑主题补工程感(2-4 周),最后自己动手写一个 reduce 或小 GEMM,用 Nsight 定位瓶颈。最后这一步,才是从"看过"到"会写"的分界线。

  • 在校生补基础:CS149+PMPP,课后题一道道做,别急着追时髦框架,基础是会复利的。

  • 冲 AI Infra 求职:课程只是前半程,面试考的是现场手撕算子和性能分析。之前写过的 CUDA 题库和 Nsight Compute 实操两篇,可以直接接在这条路线后面。

这个夏天CUDA课程大爆发:对比全网收藏数据后,只有4类值得看完

最后,留个观察信号

最后说句泼冷水的话:学习区里收藏最诚实,但也最骗人——收藏不等于学会。收藏第一的课程有 868 人收藏,真正学完的,大概率不到一成。

与其再收藏一篇路线帖,不如先挑一门开学。三个信号可以持续关注:cuTile 生态官方和社区的新动作、InfiniTensor 下一季暑期课的课表、GPU Mode 讲座的中文化进度。课程潮退去之前,先挑一门看完,比什么都值。

内容由AI生成

精选参考来源

1. 北京大学未名超算队 × LCPU AI Infra Seminars 系列讲座:1.1-Cuda Programming Model

2. 【全集 英伟达官方课程】现代CUDA编程:CUDA Tile到多GPU实战 中英字幕 1080P

3. 【图形学 | GPU硬件架构专题】斯坦福CS149《并行计算》:从SIMT到CUDA编程(全讲19集)

4. 🧠保姆级 CUDA 学习路线(亲测有效|少走弯

5. 史上最接地气的CUDA学习路线保姆级干货分享

6. NVIDIA cuTile:官方Tile编程框架

7. NVIDIA 驱动和CUDA版本对照

8. NVIDIA Labs 出品,cuTile Rust(cutile-rs)把 Rust 所有权系统扩展到 GPU tile 内核,安全、性能零损失、零成本抽象

9. pegainfer: cuTile C++初尝试

10. 四大框架横向对比:CUDA vs Triton vs TileLang vs cuTile

11. 【极致中配】CUDA MODE系列课程(Lecture 1 - Lecture 98 )

12. 【中英双语】CUDA从入门到硬核实战:PyTorch+Triton+LLM优化全攻略,GPU mode课程

13. 2026夏季-并行编程导论与 CUDA 入门

14. 10.1: cuda-graph优化原理

15. 有没有一本讲解gpu和CUDA编程的经典入门书籍?

16. 如何学习cuda编程?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章