最近这几周,CUDA的舆论场活成了两个平行世界。
一边,是接连不断的"CUDA死刑"新闻:有创业公司用AI Agent,10个小时搭出一套"类CUDA软件";Anthropic的Claude一个周末就在一台全新的AMD MI355X机架上跑通了自家前沿模型,人类工程师一行代码没改;DeepSeek也开源了用TileLang编写、不用大量手写底层CUDA的算子库。知乎上"计划经济可以计划出CUDA吗""CUDA是不是牢不可破"这类问题,动辄几百赞、上百条评论。
另一边,是学习端的持续升温:知乎"如何学习CUDA编程"的回答下攒着251个收藏,被反复推荐的《Programming Massively Parallel Processors》第四版还顶着"圣经"的名号;B站一门面向H100的CUDA综合课,播放两千出头,收藏却有461;从7月底开始,CUDA面试题系列、Triton教程连载、FlashAttention手撕优化记录,几乎每天都有新内容在更新。
哪一边才是真的CUDA?如果你正在犹豫要不要入坑AI Infra,这个问题值得现在花十分钟想清楚——因为它直接决定你接下来几个月学什么、怎么学、避开什么。
一、先给三个"护城河崩塌"事件去去水分
这三件事都是真的,但每一件的真实含义,都和标题差着一截。
先说"10小时事件"。今年8月,前Google Brain研究员Jeremy Nixon创立的AI公司Infinity宣布,他们用自研的AI研究Agent"Ignition",为推理芯片公司d-Matrix搭出了一套类CUDA软件,只花10小时。这家公司随后拿到1500万美元融资,估值1亿美元。听起来很炸,但把CUDA拆开看就冷静了:CUDA分三层,最底下是让芯片干活的内核层(Kernel、编译器、运行时),中间是cuBLAS、cuDNN这些打磨了多年的计算库和调试、性能分析工具,最上面才是PyTorch等框架、企业代码和几百万开发者构成的生态。Ignition攻进的主要是第一层——为新芯片生成和优化推理Kernel。10小时复刻的是"一块芯片的适配代码",不是20年攒下的完整生态。上一家AI芯片软件公司被英伟达收购、今年4月才离开英伟达的Bing Xu说得直接:Agent生成一万行代码很快,但"证明这一万行在各种边界情况下都算得对、跑得稳",验证才是最大的瓶颈。
再看"Claude跑通AMD"。Anthropic联合创始人Tom Brown讲的故事是:AMD送来一台MI355X机架,团队让一名工程师接上Claude去"把这台机器跑起来",一个周末之后,屏幕上是一条持续上涨的性能曲线。这件事的背景是AMD在今年夏天发布了专门给AI Agent用的ROCm.AI工具栈——经过验证的ROCm知识库、Agent可以直接调用的命令行工具、甚至改写成"AI可读"的指令集文档,现场演示的Hyperloom agent把MiniMax M3的输出速度提升了38%。换句话说,这不是Claude无师自通,而是AMD把二十年"人类工程师踩坑经验"提前喂给了Agent。值得注意的后续是商业层面的:Anthropic宣布将在AMD Helios系统中部署最高2GW的Instinct GPU,首批1GW计划2027年上半年启动。生态的裂缝是真的,但它首先出现在商业谈判桌上,不是出现在技术上。
第三件,DeepSeek开源的TileKernels算子库,用清华系开源的TileLang编写。这代表的是另一个趋势:用"写一遍、多处编译"的Tile级语言,减少对单一底层CUDA代码的依赖。
把三件事放在一起,结论其实很清晰:AI压缩的是"写Kernel"这件事的成本,而且主要集中在推理侧。训练侧因为涉及上万卡协同、通信、显存调度和故障恢复,任何效率损失放大到集群上都是真金白银,企业极其保守,CUDA暂时近乎无解。推理侧才是变化发生的地方——用Rebellions首席商务官Marshall Choy的话说,“在推理侧,CUDA不再是决定因素,这将是一场开源软件的竞争”。

二、学习端爆收藏,才是更值得读的信号
如果你觉得"护城河崩了=不用学了",那你需要解释另一组数据:
知乎"如何学习cuda编程"问题下的高赞回答,93个赞配251个收藏——收藏是赞的将近三倍,这是典型的"先码住、准备认真学"的行为;
B站那门H100 CUDA课,播放2234,收藏461,收藏率超过20%;
知乎的CUDA面试题专栏,182个收藏;有人从56 TFLOPS开始优化FlashAttention kernel,每周记录进度,目标是sm103架构上的986 TFLOPS;
8月的第一周,有人发了一篇《学习Triton的最少必要知识》,开头就写明:目标不是学会写Triton,而是"看到一个Triton kernel,5分钟内知道它在优化什么、为什么这么写、瓶颈在哪里";
资源供给端也在放量:vitamin-cuda算子开发指北、CUDA-365博客翻译专栏、AwesomeCUDABooks书单(覆盖2024-2026年新出版的书)、InfiniTensor的暑期训练框架课程,全部在过去几个月密集更新。
这些动作的人不是傻子。他们集体用收藏夹投票的方向,恰恰说明市场真正稀缺的东西变了:不是"会写CUDA语法的人",而是"看得懂性能从哪来、瓶颈在哪、结果对不对的人"。
这和第一部分的结论正好咬合:AI能替你写,但AI写出来的东西要有人能判断。Kernel写得再快,算错了、慢了、在边界条件下崩了,谁来发现?答案是那个懂执行模型、会用nsys看时间线、会用ncu拆kernel的人。社区里有人把这层东西叫"暗知识"——真正难迁移的不是语言本身,而是这些藏在踩坑经验里的判断力。Agent时代,这类人的价值不降反升。
三、结论:值得学,但学的目标要改
直接给判断:2026年,CUDA依然值得学,但学习目标要从"会写"改成"能看懂、能验证、能判断"。
这个判断对不同背景的人,落地方式完全不同:
第一类:Python背景,目标是AI Infra/推理方向。 别一上来啃C++大部头。路线建议是:先花一两周建立执行模型的基本概念(Grid/Block/Warp、显存层级),然后直接上手"入门三件套"——softmax、rms_norm、layer_norm,这是现在社区公认的新手起步算子;每个算子先写朴素版,再做一次优化,用benchmark记录数字。之后转Triton,用Python语法把同样的算子再写一遍,体会两种抽象的差异。有了这层体感,再去看vLLM、SGLang这类推理框架的源码,你才能看懂"为什么慢"“为什么这个优化有效”。知乎上那篇127赞的《想入门AI Infra,我为什么建议先写一个CUDA算子,而不是直接看vLLM源码》,说的就是这个顺序。

第二类:C++背景,目标是算子开发岗。 直接按"手撕算子"路线走:《Programming Massively Parallel Processors》第四版打底(英语四六级水平就能读下来八成),然后从GEMM开始,目标是对标cuBLAS;同时必须把工具链学起来——nsys看整体时间线定位瓶颈,ncu对单个kernel做指标级分析,再用Roofline模型判断你的kernel是算力受限还是带宽受限。面试端,现在社区已经把高频题整理成了系列,从"HBM到TensorCore的数据搬运全路径"这类题入手,比背概念定义有用得多。

第三类:算法/应用工程师,只想用好GPU。 可以不学写kernel,但要学"读"kernel:理解Triton代码的tile结构、能看懂profile报告里的关键指标、知道什么时候该用torch.compile、什么时候算子融合有收益。前面提到的"5分钟看懂一个Triton kernel",就是这个层级的合理目标。
四、四个坑,提前避开
跳过基础直接读大框架源码。 没有算子和显存访问的体感,读vLLM源码只能看懂流程,看不懂为什么慢,时间花了,判断力没涨。
一上来就钻PTX和内联汇编。 这是进阶内容,入门阶段碰它性价比极低,还容易劝退自己。
只看不写。 这个领域所有高质量内容都在强调benchmark和复现,收藏一百篇教程不如把一个softmax优化出数字。
被"CUDA已死"的标题带节奏。 如前所述,AI压缩的是写的成本,训练侧护城河还在,推理侧的竞争也是"谁能验证得更好"的竞争——这恰恰是需要人的地方。
五、接下来值得盯的三个信号
cuTile的进展。 英伟达在CUDA 13世代力推的tile级编程模型,社区已经在讨论它会不会替代Triton,今年已有论文在Hopper和Blackwell上做了实测。它代表英伟达自己的"升维"动作:与其让别人绕过CUDA,不如把CUDA变得更易用。
Agent验证能力的演进。 现在AI写kernel的最大瓶颈是验证。一旦出现成熟的自动化验证方案,入门门槛会再降一次,届时学习重点会进一步向"架构级判断"上移。
国产与多芯片生态的落地情况。 国产GPU通过兼容层宣称可以实现大部分CUDA代码迁移,TileLang这类跨芯片语言也在积累生态。对求职者来说,"CUDA能力+跨平台视野"会是比纯CUDA更稳的组合。

最后说一句实在话:每一轮"CUDA要完"的讨论,最后沉淀下来的都不是恐慌,而是更清楚自己该学什么的人。这一次也一样——AI替你写代码的时代,真正值钱的,是你判断代码的能力。