黄仁勋说AGI已实现,AI都开始写CUDA内核了:2026下半年,GPU并行计算还值得学吗?

源自15位全网作者

09-04 08:29

这周的GPU圈,信号是拧着的。

一边是钱在投票:英伟达8月底发布的最新财报继续超市场预期,单日市值暴增近3万亿人民币级别的数字被媒体反复刷屏。36氪华尔街十几家机构集体上调目标价,甚至有机构喊出10万亿美元估值。微博紧接着,英伟达又宣布收购开源模型平台Hugging Face,黄仁勋公开表态“允许自由上传下载模型、不强制用英伟达硬件”。知乎CUDA阵营的护城河,看起来又深挖了一圈。

另一边,是技术圈自己在拆台。知乎上“为什么说CUDA是NVIDIA的护城河”这个问题下有287万阅读的讨论,最高赞的回答引用了DeepSeek梁文锋的一个观点:过去软件生态难被推翻,是因为重写成本是“十年人月”;但现在Coding Agent越来越能接住大型工程,CUDA算子、驱动、编译器说到底都是软件,重写一套生态正从“公司级十年工程”变成“可以持续自动迭代的大任务”。知乎更早一点,“计划经济可以计划出CUDA吗”的问题冲到了354万阅读——连“生态能不能被复制”都成了大众话题。

再加上,黄仁勋前脚刚宣称英伟达已实现AGI。36氪与此同时,字节年初那篇让AI Agent自动写CUDA kernel、自动做性能优化的论文也有34万人在围观。知乎想学GPU并行计算的人,此刻纠结的问题非常具体:AI都会写kernel了,我现在花时间学,会不会学完就被淘汰?

这个问题我替你拆开算过账了。先说结论:值得学,但你学的东西要换——不是学语法,是学闭环。下面把账一笔一笔摆出来。

先看一个反直觉的事实:AI写kernel的声量越大,学CUDA的人反而越多

如果你最近刷B站,会发现一个很有意思的现象:名校GPU课程正在被成建制地搬运。斯坦福CS149《并行计算》的两个搬运版本,播放量分别做到4285和1844。哔哩哔哩佐治亚理工的高性能计算导论2490播放;苏黎世联邦理工的GPU硬件架构专题907播放;就在昨天,约翰霍普金斯大学的GPU编程课又上新了双语版。播放最高的一个讲PyTorch底层算子在GPU上并行逻辑的中文视频,接近1万播放、277个赞。

知乎这边更夸张:写CUDA的入门、避坑、实验类文章几乎每天在更新——有人做CUDA矩阵乘法的naive实验,验证出向量加法GPU只赢一点、矩阵乘法能赢1000倍。知乎有人写CUDA Graph的避坑指南还附H100实测,有人从PyTorch代码一路拆到GPU指令的编译器全栈。连“算子开发指北/CUDA面试刷题指南”这种工业化备考资料都出现了。知乎

黄仁勋说AGI已实现,AI都开始写CUDA内核了:2026下半年,GPU并行计算还值得学吗?

这说明什么?说明在AI喊得最凶的这一年,真实世界里押注GPU并行计算技能的人不是在减少,而是在增加。原因也不难理解:大模型训练推理的军备竞赛还在加速。据报道,OpenAI刚发的旗舰模型是用超10万张GPU预训练出来的。微博国内9月11日还要开算力大会。微博算力需求在涨,会调教GPU的人就是稀缺品。

关键在拆层:AI抢的是哪一层饭碗,你就要躲开哪一层

把“CUDA技能”当成铁板一块去讨论值不值得学,是这个问题最大的坑。它其实分三层,AI对每一层的冲击完全不同:

第三层:调框架、背API。比如会用PyTorch、会查cuBLAS文档、记得住launch配置怎么写。这一层AI Coding Agent替代起来最顺手,因为需求明确、有现成参考代码、验证方式清晰。如果你学CUDA的目标停在这里,那确实危险——不是因为AI来了,而是因为这层本来就不值钱。

第二层:把明确需求翻译成kernel。比如“写一个softmax”、“优化一下这个reduce”。这一层AI正在快速逼近,字节那篇cuda-agent论文、社区里各种“自动优化kernel”的项目都在瞄准它。人类还有优势,但优势在收窄。

第一层:定义问题、找到瓶颈、建立性能闭环。这一层是AI暂时给不了的。有个138万阅读的知乎回答讲得很生动:一位C++工程师接了个活,把Jetson上的3D打印切片软件用CUDA加速到每秒60层。他踩的坑没有一个能用“搜API”解决——设备端动态malloc会把显存分碎、几千个线程做原子加性能直接崩、switch-case在GPU上等于判死刑,得靠把分支逻辑改写成高斯函数的数值计算来绕。知乎这些判断靠的是对硬件行为的心智模型,是“为什么慢”的直觉,而AI目前只能帮你把已经想清楚的方案写出来,没法替你想清楚。

黄仁勋说AGI已实现,AI都开始写CUDA内核了:2026下半年,GPU并行计算还值得学吗?

所以结论很清楚:2026年学GPU并行计算,核心目标不是“会写kernel”,而是“能对一个真实负载做profiling、定位瓶颈、给出优化、并用数据证明快了多少”这个完整闭环。nsys看时间线、ncu拆kernel这些手艺,反而因为AI的存在变得更值钱——AI生成的代码越多,越需要有人能判断它写得对不对、快不快。

三种人,三条不同的路线

如果你是在校学生或准备转方向,值得系统学,但别从背语法开始。性价比最高的顺序是:先过一遍CS149这类课程建立SIMT心智模型(B站搬运都有中英字幕版),然后照着NVIDIA官方的CUDA Samples把向量加、矩阵乘、reduction跑通,重点不是代码本身,而是每写一个就用nsys和ncu看一次自己的kernel长什么样。面试向的同学可以直接对着“算子开发指北”这类刷题指南查漏补缺,这个方向的需求已经制度化到出备考资料了。

如果你是算法工程师,想往AI Infra靠,不建议从头系统学,建议从推理链路切入。知乎上有篇讲得很实在的内容:想入门AI Infra,先自己写一个CUDA算子,比直接读vLLM源码有效得多。知乎目标是能读懂FlashAttention、vLLM这类项目的代码结构,能在推理框架里做局部优化——这是当下招聘市场最认的能力组合。

如果你是纯兴趣自学者,先别为了学CUDA买显卡。云端Colab、租卡平台几块钱就能把入门实验跑完,等确认自己真的享受“把100ms优化到10ms”这种乐趣,再考虑硬件投入,顺序别反了。

黄仁勋说AGI已实现,AI都开始写CUDA内核了:2026下半年,GPU并行计算还值得学吗?

两件别做的事

一是别囤课。名校课程搬运、专栏文章、刷题指南,现在的免费资源密度已经高到过剩,学不动的原因几乎从来不是资料不够,而是没有动手跑过一次真实的profiling。二是别把“学会CUDA”当成一次性投资,这一层硬件每代架构都在变,真正保值的是第一层的闭环能力,具体API五年后再看大概率又换了一轮。

接下来值得盯的三个信号

  1. 9月11日中国算力大会前后,看国产并行计算生态(华为CANN、摩尔线程MUSA等)会不会放出更多算子岗位和开发者激励。知乎如果国产生态开始批量招人,“学CUDA还是学国产栈”就从一个哲学问题变成了具体的择业问题。

  2. AI写kernel工具的进展,比如各家coding agent对CUDA项目的实际支持程度。它们每前进一步,上面说的第二层技能就贬值一分,但第一层的需求会同步上涨。

  3. 英伟达自家开源项目(CUTLASS、Triton Inference Server这些)的更新节奏。知乎收购Hugging Face之后,CUDA生态的开放程度怎么走,直接影响你学的东西能用多久。

GPU这碗饭,AI不是来掀桌子的,是来重新排座位的。坐哪把椅子,取决于你现在学的是哪一层。

你现在是已经入坑的,还是正在观望的?你学CUDA(或者劝退别人学CUDA)的最大理由是什么?评论区聊聊,我看看能不能把大家踩过的坑整理成下一篇的避坑清单。

内容由AI生成

精选参考来源

1. 创历史级单日大涨,英伟达市值一夜暴增近3万亿

2. 转:英伟达财报引爆目标价上调潮 已有机构喊出10万亿美元的目标估值

3. 英伟达同意收购HuggingFace,黄仁勋:允许自由上传、下载模型,不强制使用英伟达硬件

4. 为什么说CUDA是NVIDIA的护城河?

5. 黄仁勋:英伟达已实现AGI

6. 如何评价字节的cudaagent新论文?

7. 【图形学|GPU硬件架构专题】斯坦福CS149《并行计算》:从SIMT到CUDA编程(全讲19集)

8. 向量加法GPU只赢一点,矩阵乘法还能赢1000倍? - CUDA矩阵乘法naive实验

9. [CUDA学习]vitamin-cuda:算子开发指北/cuda面试刷题指南

10. 9.4全球科技要闻:OpenAI正式发布GPT-6 Astra旗舰模型

11. 今日预计大涨的板块!1. AI算力/液冷/CPO板块

12. 写CUDA到底难在哪?

13. 想入门AIInfra,我为什么建议先写一个CUDA算子,而不是直接看vLLM源码?

14. CUDA真是NVIDIA绝对牢不可破的生态吗?

15. NVIDIA|深度源码评测|NVIDIA Triton Inference Server架构全景、分层设计、工程能力与AI推理落地指南

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章