字节新论文说AI写的内核比torch.compile快2.11倍:先拆清楚数字,再决定CUDA还值不值得学

源自56位全网作者

09:03

这两天知乎冒出来一个新问题:“如何评价字节的 CUDA Agent 新论文?”。知乎小红书上也刷到好几篇,标题一个比一个猛——“AI 写的代码,比编译器还快”、“程序员最后的堡垒被攻破”。小红书评论区真正在纠结的其实是同一件事:AI 都能写 GPU 内核了,我哼哧哼哧学了大半年的 CUDA,还值钱吗?

这个问题值得认真回答。因为这篇论文的数据是真的,但流传的解读一半是夸大其词。今天把它拆开看。

先说论文做了什么

这篇来自字节 Seed 和清华 AIR 的论文(arXiv 2602.24286),核心想法其实不复杂:以前的大模型写 CUDA,靠提示词或者"编译报错就改"的反馈循环,本质还是在修语法。CUDA Agent 换了个老师——不奖励"编译通过",直接奖励 profiler 里测出来的真实 GPU 速度。线程束占用、访存带宽、bank conflict,这些只有在性能分析器里才看得见的东西,成了强化学习的信号。

配套做了三件事:从 PyTorch 和 transformers 里挖算子、用 LLM 组合出融合任务,筛出 6000 条高质量训练样本(CUDA-Agent-Ops-6K 数据集,已开源);搭了一个带 SKILL.md 规范和防作弊机制的沙盒环境,5 组不同输入查正确性,禁止网络检索;然后是分阶段的 RL 训练,128K 上下文,稳住长时序训练不崩。

字节新论文说AI写的内核比torch.compile快2.11倍:先拆清楚数字,再决定CUDA还值不值得学

成绩确实能打。在 KernelBench 上:

  • Pass Rate 98.8%(基本都能写对)

  • Faster Rate 96.8%:96.8% 的任务比 torch.compile 还快。机器之心

  • 整体几何平均加速 2.11 倍

  • Level-2 算子融合任务:100% 跑赢 torch.compile,几何平均加速 2.80 倍

  • 最难的 Level-3(完整模型架构):加速达成率 90%,比 Claude Opus 4.5、Gemini 3 Pro 这些最强专有模型高出约 40 个百分点

字节新论文说AI写的内核比torch.compile快2.11倍:先拆清楚数字,再决定CUDA还值不值得学

注意一个时间线:论文 2 月底就挂上 arXiv 了,代码和数据集当时就开源。这周是二次爆发——但火有火的道理,因为这半年的事态一直在给这篇论文加注脚。

98.8% 没告诉你的事:考题和真实工作是两套卷子

先别急着焦虑,我们看看 KernelBench 到底在考什么。

这个基准一共 250 道题,分三级:Level-1 是 100 个单算子(卷积、矩阵乘、激活、LayerNorm 这些基础积木),Level-2 是 100 个算子序列(多个算子融合成一个 kernel),Level-3 是 50 个完整模型架构(AlexNet、MiniGPT 这类从 GitHub 热门仓库搬来的)。知乎每道题给一个 PyTorch 参考实现,让你写一个更快的替换版本。

字节新论文说AI写的内核比torch.compile快2.11倍:先拆清楚数字,再决定CUDA还值不值得学

判定标准有两点值得注意:

第一,正确性验证只用 5 组随机输入。论文自己都承认,这是"捕捉错误的能力和评估效率之间的权衡"。知乎5 组输入测不出的边界情况,在生产环境里就是事故。

第二,测速环境是单卡、无其他 CUDA 进程干扰、预热后跑 100 次取平均。知乎这是实验室稳态,不是你的推理服务在真实流量下 batch size 乱跳、KV Cache 忽长忽短的样子。

字节新论文说AI写的内核比torch.compile快2.11倍:先拆清楚数字,再决定CUDA还值不值得学

有没有更接近真实工作的考卷?有。ICML 2026 的 FlashInfer-Bench,从 DeepSeek-V3、Llama-3.1-8B、Qwen3-30B-A3B 这些模型的真实推理流量里采了约 1600 个 workload,带 paged KV cache、ragged 输入、采样算子这些生产细节。在这套卷子上的成绩:GPT-5 正确率 83.9%,o3 是 71.3%,Gemini-2.5-Pro 掉到 48.8%。知乎而且 32 个正确性错误里 30 个是编译错误——模型理解了算子的高层逻辑,但搞不定 GPU 编程语言的底层细节。

更扎心的一个实验:研究人员明确提示 GPT-5"请使用 FlashAttention 的分块流水线优化",试了 10 次,没有一次能正确实现。知乎模型能说出"该用什么优化",但把多个底层优化策略协调成一个正确稳定的程序,仍然是另一回事。

所以准确的说法是:在"孤立的、定义良好的 kernel 写作"上,AI 已经做到了 SOTA;从 kernel 到能上生产的 kernel,中间还隔着验证、形状分布、引擎集成这几道没被 benchmark 覆盖的墙。

圈子里也在吵,两边都有硬角色

这波讨论不是单方面狂欢。

看多的一方:8 月初,成立仅一年的 Infinity 用自研 AI Agent “Ignition”,花 10 小时给推理芯片公司 d-Matrix 搭出一套类 CUDA 软件,估值已到 1 亿美元。36氪7 月,KernelBench-Mega 基准上出现了史上第一个"超级内核"——把整套推理流程压进一次 kernel launch,加速 18.7 倍。36氪Anthropic 联创 Jack Clark 直接宣布"递归自我提升(RSI)循环开始了";连英伟达自己都在用 AI Agent 开发 CUDA,还把 CUDA 做成了 Agent Skills 开源。

泼冷水的一方同样有分量。Modular 的 CEO Chris Lattner(Swift 和 LLVM 的作者)认为这波炒作被严重夸大,理由有三:写代码只是软件工程的一小部分,生产级优化才决定芯片性能;芯片软件是小众精英领域,公开代码少,AI 能学的训练数据本来就少;几百万行存量代码的迁移成本是组织问题,不是技术问题。INT21 创始人 Bing Xu(上一家公司 HippoML 被英伟达收购)的判断更值得记下来:Agent 生成一万行代码很快,但"证明这一万行在各种边界情况下都算得对、跑得稳"极慢——验证,才是 CUDA 的下一道护城河。36氪还有知乎上一篇被转得很多的文章提醒:实际工业部署里,99% 的算力不来自手写 kernel,而是来自 cuBLAS、cuDNN、CUTLASS、Triton 这些库和 DSL。知乎AI 写 kernel 冲击的首先是"手写 kernel"这个环节,不是整个 GPU 软件栈。

那你的 CUDA 学习清单该怎么改

结合这些信号,给正在学 CUDA 的同学一个可以直接执行的加减法。

可以降权重的三件事:

  1. 背 API、默写模板算子。向量加、朴素矩阵乘这类题,AI 在 benchmark 上已经是 SOTA 水平,你花在"从无到有写出来"上的时间,性价比在快速下降。

  2. 大量孤立的手写融合练习。可以让 agent 出初稿,你的时间花在分析它为什么快、验证它对不对——练的是更高一阶的能力。

  3. 只追求"写出来能跑"。5 组随机输入都能骗过的 kernel 不是好 kernel,这个标准对人同样成立。

应该加权重的三件事:

  1. 读 profiler 的能力(Nsight Compute、Nsight Systems)。这篇论文的老师就是 profiler——RL 的全部信号来自性能分析数据。以后无论你是驾驭 AI 写 kernel,还是和 AI 竞争,考的都是同一件事:看得懂 roofline,找得到瓶颈。

    字节新论文说AI写的内核比torch.compile快2.11倍:先拆清楚数字,再决定CUDA还值不值得学

  2. 算子验证与测试方法论。形状覆盖、数值误差边界、动态 shape、异常输入。Bing Xu 说验证是下一道护城河,FlashInfer-Bench 的数据也印证:模型最容易栽的地方,正是你的差异化机会。

  3. 和推理引擎集成的能力。vLLM、SGLang、TensorRT-LLM 这些系统怎么调度 kernel、真实流量的形状分布长什么样。benchmark 到生产之间那堵墙,恰恰是岗位需求所在的位置。

不变的:C++ 功底、对显存层次和 warp 调度的理解、围绕真实问题做深一个项目。知乎上那篇被热议的就业讨论说得对:市场上没有岗位叫"CUDA 工程师",CUDA 是乘数,乘在你已有的技术深度上。知乎招人的方向——推理优化、训练框架、HPC——需求还在涨,只是入场券从"会写 kernel"变成了"会判断 kernel"。

不同人,不同的读法

  • 如果你是应用层算法工程师,不碰部署:不必深学 CUDA,学会用 agent 工具帮你生成和筛选 kernel 就够了,这篇论文对你是利好。

  • 如果你是冲着 AI Infra 岗位的学生或转行者:基础还得学,秋招现场手撕算子不会一夜消失,但训练重心要往"写 + 分析 + 验证"挪,纯默写式练习可以砍掉一半。

  • 如果你走 kernel 架构师路线:要更深,不是更浅。Fable 5 那个 18.7 倍的 megakernel 说明天花板还在往上走——新指令、新数据流、端到端融合,这些前沿仍然需要有人(或者有人带着 AI)去推。

接下来值得盯的三个信号

  1. CUDA Agent 的 GitHub 仓库和 6K 数据集会不会引来大规模复现和二次训练——如果社区能用更少资源复现,这套范式就会迅速普及。

  2. FlashInfer-Bench 这类验证框架会不会被主流推理引擎收编——验证一旦标准化,"AI 写的 kernel 进生产"的最后一公里就通了。

  3. 英伟达的回应——它一边用 AI 开发 CUDA,一边握着最深的验证工具链。护城河从"代码存量"迁向"验证生态"的过程中,它不会缺席。

一句话收尾:AI 没有让 CUDA 贬值,它把 kernel 的价值从"写出来"搬到了"判断它能不能进生产"。前者在贬值,后者在涨价——你的时间该往哪边挪,答案应该清楚了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章