AI算子赢了人类冠军16%,“去CUDA化”争议未平:2026年9月的CUDA还值得学吗?把技能拆成三层看就清楚了

源自193位全网作者

08:34

9月的第一周,GPU圈几乎同时发生了两件事。

9月1日,KDA(Kernel Design Agents)团队发布v0.5:全自动Agent循环生成的kernel,在FlashInfer Kernel Contest里,性能比人类获胜者的方案快16%~69%。知乎而"以后CUDA算子开发是不是都会被AI取代"这个问题,知乎上从今年4月讨论到现在,一直没停过。知乎

9月2日,燧原科技IPO申购,摩尔线程、沐曦、壁仞、燧原这"国产GPU四小龙"就此补齐资本市场的最后一块拼图。知乎此前摩尔线程去年12月登陆科创板首日大涨468.78%,壁仞则在今年1月登陆港交所。知乎

AI算子赢了人类冠军16%,“去CUDA化”争议未平:2026年9月的CUDA还值得学吗?把技能拆成三层看就清楚了

再往前倒,还有两个没凉的争议:4月网传DeepSeek V4提出"去CUDA化",一个问题下拿了954赞。知乎7月"为什么说CUDA是NVIDIA的护城河"下面,高赞回答引用梁文锋的观点:开发者、框架、算子、工具链二十多年积累的生态,“这个判断,可能正在被 AI 改写”。知乎

于是"现在学CUDA还值不值"这个问题,在这个9月,问的人比过去两年任何时候都认真。

我把知乎、B站、GitHub翻了一圈,先说结论:还值得学,但"学"的内容变了。以前学CUDA最值钱的部分,恰恰是现在贬值最快的部分。 把这件事拆成三层看,就清楚了。

第一层:API和语法层——别花时间,这层已经没有前途

thread、block、grid怎么组织,kernel怎么launch,显存怎么拷贝。这一层的东西,AI现在已经写得比大多数教程熟练,把它当学习目标没有任何意义。

知乎那个954赞的回答话说得难听,核心意思其实没错:CUDA本质是软件,软件生态过去靠人月堆出来才难替代,现在AI把写软件变成可以持续自动迭代的大任务,"重写一套生态"正在从十年工程变成一个项目。这个立场有激进的地方,但方向上,API记忆的稀缺价值已经归零,这一点两边阵营没人反对。

第二层:算子实现与调优层——还得练,但练法要换

GEMM、FlashAttention、softmax、sampling,这层是现在算子岗面试的主战场,也恰恰是AI刚刚在竞赛里打赢人类的那一层。

AI算子赢了人类冠军16%,“去CUDA化”争议未平:2026年9月的CUDA还值得学吗?把技能拆成三层看就清楚了

对KDA的成绩要冷静看两点:第一,这是团队自报,开源kernel是"以供验证",第三方复核还没走完;第二,社区对AI写kernel是有前科警惕的——年初字节那篇CUDA Agent的论文,知乎高赞评论直接嘲讽"全是调包pytorch的"。知乎

但即便如此,这层依然值得练。两个原因:

一是就业市场还在考这个。前腾讯优图的算法工程师5月开了个叫vitamin-cuda的项目,自称"算子开发指北/面试刷题指南",170多个kernel按easy、medium、hard排好,全部带PyTorch绑定可以直接跑测试,拿到700多收藏。知乎这个项目的存在本身就说明:备考算子岗的人依然不少,公司也依然在拿手撕kernel筛人。

二是AI会写,但得有人看得懂它写的东西。7月那篇《想入门AI Infra,我为什么建议先写一个CUDA算子》说得很透:没有算子、显存访问、benchmark的基本体感,去看vLLM源码只会"看懂流程,看不懂为什么慢"。知乎

只是练法得变:别再像前两年那样闷头刷题。先自己写一个kernel,再让AI写一个,两个放一起benchmark,用ncu看性能差距出在哪。知乎上还有个叫cuda-optimized-skill的项目,干脆把"AI自动打磨CUDA算子"做成了工具。知乎能把AI当陪练的人,进步速度会比闷头刷题快一大截。

第三层:性能直觉和问题定义层——现在最增值的一层

你的kernel卡在算力还是带宽,Roofline一眼要能看出来;ncu的报告里哪行数字说明occupancy不够;AI生成的kernel快了16%,但正确性、边界条件、shape变化下的稳定性,谁来验收?

AI算子赢了人类冠军16%,“去CUDA化”争议未平:2026年9月的CUDA还值得学吗?把技能拆成三层看就清楚了

这层能力是目前AI最难替代的,也是市场最缺的。vitamin-cuda的作者有句话我印象很深:"CUDA编程非常依赖对硬件的理解,不同代、不同型号的GPU上,相同算子的最优策略可能完全不一样。"这种贴着硬件做判断的能力,正是AI还需要人来掌舵的部分。

AI算子赢了人类冠军16%,“去CUDA化”争议未平:2026年9月的CUDA还值得学吗?把技能拆成三层看就清楚了

有人可能觉得第三层离自己太远——其实不是。第三层是学法,不是阶段。从写第一个kernel就问"它为什么是这个速度",就是第三层的学法;写十个kernel只记十个模板,那还是第一层的学法。知乎"如何学习CUDA编程"下面95赞的回答只推了一本书——PMPP第四版,理由就是这本书"结合实际例子告诉你怎么用,以及为什么"。知乎

还有一个变化:你的下一个雇主,未必是NVIDIA

今年学CUDA的人不能忽视另一件事:需求端在变。

一边是国产生态开始落地。四小龙补齐上市只是资本市场的信号,跟工程师真正相关的是国产GPU的推理业务开始有真收入了。更关键的是,Triton正在变成各家芯片的"普通话":FlagTree这类统一编译器把多后端支持做成核心,各家芯片厂商接入Triton生态,已经是绕不开的架构决策。知乎3月还有人在昇腾910B上用Triton写了个BMM算子,比CANN原生算子快约27%。知乎这意味着什么?你用CUDA学到的算子思维——切分、访存合并、流水线——跨厂商是通用的;反过来,只背CUDA API,可迁移性反而最差。

另一边,NVIDIA自己也在变。8月31日,英伟达宣布认购联发科35亿美元可转债,占这次发行总额的近九成,是它迄今在美国以外地区最大的一笔直接投资,双方要共建从边缘到云的平台。界面新闻

AI算子赢了人类冠军16%,“去CUDA化”争议未平:2026年9月的CUDA还值得学吗?把技能拆成三层看就清楚了

资本市场的反应很直接:9月1日,联发科台股股价暴涨近10%,触及单日涨停限制。界面新闻从卖卡到组生态、定标准,NVIDIA的护城河没有消失,只是换了形状——这反而说明,贴着这套生态的性能工程能力,短期仍然是硬通货。

三类人,三条路线

最后给可执行的路线:

学生或零基础入门:主线是PMPP第四版 + NVIDIA官方cuda-samples + B站刚搬运的约翰霍普金斯大学GPU编程课(中英双语,9月3日更新)。哔哩哔哩目标是手写vector add、reduce、softmax,并和PyTorch的结果做benchmark对比。环境门槛也降了:Ubuntu 26.04 LTS原生集成CUDA,不用再折腾半天驱动。知乎

想转AI Infra的算法工程师:别直接啃vLLM。从最小算子写起,按softmax、layernorm、GEMV、flash attention的顺序,用vitamin-cuda或LeetCUDA当题库。可以先用Triton快速上手出活,再回头补CUDA C++和硬件细节。面试的验收标准很朴素:你写过的每个kernel,能不能一句话说清楚优化了什么。

在国产卡环境工作、公司有适配需求的:主攻Triton,盯目标厂商的后端(昇腾、摩尔线程、燧原都在接),CUDA原理当底座。推理是国产卡现在的主战场,算子优化经验在这里直接决定部署效果。

硬件上别乱花钱

学CUDA不需要5090。vitamin-cuda的作者整套LLM推理算子刷题,跑在一张RTX 5060上,还顺手做了sm120架构特化的优化。零基础入门,一张sm80时代的老卡(二手30系就行)或者直接上云、用PyTorch官方镜像,就够把前两层练完;等真要碰Hopper、Blackwell的特有特性(TMA、wgmma),再考虑更贵的卡。花小几千把刷题链跑通,比一上来三万块买旗舰的性价比高得多。

接下来值得盯的信号

一是KDA v0.5开源kernel的第三方验证结果——如果站得住,第二层的"人类及格线"还会继续上移;二是DeepSeek V4的发布节奏和"去CUDA化"的具体形态,这直接影响国产生态岗位的数量;三是Triton多后端的演进,尤其国产卡后端的成熟度;四是燧原上市后的首份财报,验证国产GPU推理收入这个逻辑。

CUDA没有凉,只是值得学的内容整体上移了一层。对学法对的人来说,2026年9月反而是个不错的入场时机:竞争对手在减少,陪练工具在变强,而路线从来没有现在这么清楚过。

内容由AI生成

精选参考来源

1. 🚀 KDA-v0.5:全自动 Agent Loop 生成匹敌人类 SOTA 的 CUDA 算子

2. CUDA算子开发--与硬件体系深度结合的计算科学

3. 深度|燧原科技IPO在即,国产GPU“四小龙”到底谁最能打?

4. 历史已站在中国GPU这边

5. 如何看待网传DeepSeekV4即将发布并提出「去CUDA化」?

6. 为什么说CUDA是NVIDIA的护城河?

7. 如何评价字节的cudaagent新论文?

8. [CUDA学习]📚vitamin-cuda: 算子开发指北/ cuda 面试刷题指南

9. 想入门 AI Infra,我为什么建议先写一个 CUDA 算子,而不是直接看 vLLM 源码?

10. 告别“人肉调参”与“玄学优化”:CUDA算子自动化打磨利器cuda-optimized-skill

11. 如何学习cuda编程?

12. 各家芯片厂商Triton编译路径选择深度分析

13. 如何在华为昇腾910上开发BMM的Triton算子,性能超过CANN

14. 英伟达35亿美元押注联发科,创下其史上最大海外投资纪录

15. 【中英双语】约翰霍普金斯大学GPU编程①:并发与CUDA入门2023

16. Ubuntu26.04LTS原生集成CUDA,内存要求提至6GB,将如何影响其专业应用?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章