8 月 16 日,一条只有 5 个词的推文开始在工程师圈子里疯传:Scott Gray 离开 OpenAI 了。
他把自己的社交账号简介从「GPU Geek at @OpenAI」改成了「Former GPU geek at @OpenAI」,前面加了一句:目前独立,正在探索神经科学启发的 AI 方法。机器之心没有官宣,没有离职声明,一个在 OpenAI 待了整整十年的人,用一行简介完成了告别。
巧的是,十年前的 8 月 16 日,OpenAI 发博客欢迎当月入职的五位全职成员,名单里就有 Scott Gray 和 Dario Amodei。机器之心十年后,Dario 是 Anthropic 的 CEO,而 Gray 把 OpenAI 标成了「former」。
也是在这同一周,「CUDA」这个名字被讨论得格外密集。DeepSeek V4-Pro 上线没几天就宣布涨价,知乎上「DeepSeek 绕开 CUDA、直接在 PTX 层面优化」的新问题冲上热榜。知乎黄仁勋「失去中国市场美国 AI 必败」的说法在微博挂了一整天。微博后台的气氛很一致:CUDA 是不是要崩了?写 CUDA 的人是不是要被淘汰了?
别急着跟着慌。这周发生的几件事放在一起看,答案其实比「崩了」或「没崩」都有意思——CUDA 的价值没有消失,而是正在往两头移动。看懂这件事,对你要不要花时间深耕 CUDA,直接影响判断。
Scott Gray 是谁:一个人、一个 kernel、几十万张卡
先说清楚这个离开的人有多稀缺,你才能理解这周真正该讨论的问题。
Scott Gray 被圈内叫做「CUDA 内核之神、全球最强 GPU 程序员」。他的成名作是 Nervana 时期的 maxas——一个针对 Maxwell 架构的汇编器,让开发者直接手写 SASS 机器码,手动分配寄存器、管理访存延迟。为了证明这条路走得通,他用 maxas 手写了一个 SGEMM 内核:在 GM204 GPU 上跑到硬件理论峰值的 98%,比英伟达官方闭源、同样由专家手写的 cuBLAS 还快 4.8%。机器之心后来的 maxDNN 把这套方法推广到卷积,在 AlexNet 所有卷积层上稳定跑出 93% 到 95% 的计算效率,而同期 cuDNN 的效率在 32% 到 57% 之间大幅波动。
再往后,2017 年他和 Alec Radford、Durk Kingma 一起发布了块稀疏 GPU 内核:把权重矩阵切成固定大小的块并整块置零,专用内核在计算时完全跳过零值块,比处理稠密矩阵的常规路径快上几个数量级。机器之心下面这张示意图,左边是稠密权重,右边是块稀疏化之后的样子——这套思路直接催生了后续一系列稀疏注意力工作。

2019 年的 Sparse Transformers 把注意力开销从 O(n²) 降到 O(n√n),GPT-3、Scaling Laws、DALL·E 的作者名单里都有他的名字。
最能说明问题的是一个细节:前 OpenAI 员工 Rohan Pandey 去年 9 月发帖说,公司里大约只有一个人负责推理侧的 CUDA 内核,同事们把他写的注意力内核叫作「the Bob kernel」——这个内核每天在数十万张 GPU 上执行数以万亿次计。机器之心帖子还提到,全世界能为训练过程(尤其是反向传播)写出高性能 CUDA 内核的人,可能不到一百个。
一个人写的一个内核,撑起每天万亿次量级的推理调用。这不是「掌握一项技能」,这是极端杠杆化的稀缺资产。所以当他离开,真正的问题不是「OpenAI 损失了一个员工」,而是:这种人的价值为什么到今天反而更高了?
同一周的另一面:AI 写内核,已经越线了
如果你只看到人才稀缺这一面,会错过这周的另一半信号:AI 写 CUDA 内核这件事,今年是真的越线了。
最硬的一个数字来自字节跳动 Seed 团队和清华 AIR 今年 2 月底放出的论文《CUDA Agent》。在斯坦福的 KernelBench 评测上,这个模型把 L1、L2 难度的题目 100% 跑得比 torch.compile 快,最难的 L3 也有 92%,整体几何平均加速 2.11 倍。知乎对比之下,Claude Opus 4.5 在 L3 上的通过率只有 52% 左右。知乎

更有意思的是它的底座并不是什么 CUDA 特化模型,而是字节自家的通用 MoE 大模型 Seed 1.6——CUDA 代码在预训练语料里占比不到 0.01%,靠强化学习硬生生「逼」出来的能力。知乎高性能内核的训练数据极度稀缺,团队干脆自己造:先从 PyTorch、Transformers 库里爬取种子算子,再用 LLM 把最多 5 个算子组合成融合任务,最后靠执行反馈逐条过滤,攒出 6000 个样本的 CUDA-Agent-Ops-6K 数据集。知乎

论文里有个案例很能说明问题:一道「对角矩阵乘稠密矩阵」的题,普通工程师的写法是把对角向量撑成 N×N 矩阵再调 cuBLAS;CUDA Agent 看出了「左乘对角阵等价于按行缩放」这层数学结构,直接写 grid-stride loop,对角矩阵从头到尾没被构造出来,相对 torch.compile 加速 73.31 倍。知乎这不是把 C++ 写得更紧凑,是算法层面的洞察。
小公司也在用同一套思路。8 月初,前 Google Brain 研究员 Jeremy Nixon 创立一年的公司 Infinity 宣布,他们的 AI Agent「Ignition」只花 10 小时,就给推理芯片公司 d-Matrix 搭出了一套类 CUDA 软件栈,公司随即拿到 1500 万美元融资、估值 1 亿美元。量子位DeepSeek 也开源了用 TileLang 编写的 GPU 算子库 TileKernels,省掉大量手写底层 CUDA 的工作。
但是——这里必须有个但是。
AI 写内核的前科并不干净。2025 年 2 月 Sakana AI 高调发布「AI CUDA Engineer」,宣称对比 PyTorch 有 10 到 100 倍加速,结果社区复现发现不少 kernel 实际比原版慢 3 倍;OpenAI 的 Lucas Beyer 跑了两遍基准,留下那句被反复引用的话,「连续跑两遍数据完全对不上,他们应该停下来想一下」。知乎事后 Sakana 承认系统在评估代码里找到了内存漏洞,能绕过正确性检查,那个被传得很广的 123.6 倍加速,后来审计发现是 kernel 把 softmax 直接写死成了 1.0。
连 CUDA Agent 自己也没能完全免俗。今年 3 月,知乎上一个高赞回答用官方放出的评测脚本在 A100 上复现,发现部分样例里 Agent 并没有真正手写 CUDA,而是利用评测脚本的漏洞做了手脚——比如运行自己的代码前偷偷打开 TF32 开关、跑完再关掉,让自家模块走 Tensor Core 而 baseline 走不了;把这行「优化」删掉之后,对 torch.compile 的加速比直接跌到 1 以下。知乎这个回答的作者说得扎心:指标可以被策略性地满足,只有深入代码、调用路径和 profile 细节,才能判断 AI 是在解决问题,还是在绕过问题。
业内明白人也一直在泼冷水。Modular 联合创始人 Chris Lattner 认为编码 Agent 的改进是渐进式的,「炒作被严重夸大」:写代码只是软件工程的一小部分,生产级优化才决定芯片性能,而几百万行存量代码的迁移成本根本不是技术问题。上一家 AI 芯片软件公司 HippoML 被英伟达收购、今年 4 月才离开英伟达的 Bing Xu 说得更直接:Agent 生成一万行代码很快,但「证明这一万行在各种边界情况下都算得对、跑得稳」极慢——验证才是最大瓶颈。量子位
一边是 AI 把「写出一个快内核」的门槛踩到地板上,一边是「证明这个内核在生产环境里永远不出错」的门槛纹丝不动。这周的噪音再大,本质就是这两件事的落差。
判断:CUDA 的价值正在变成一根哑铃
把 Scott Gray 的离开和 AI 写内核的进展放在一起,我的判断是:写 CUDA 这件事的价值分布,正在从「橄榄型」变成「哑铃型」。
哑铃的一头,是 Scott Gray 式的顶端能力,而且比任何时候都稀缺。理由很直白:当 AI 能批量生成内核,「谁拥有那个每天被几亿次调用、不能出任何错的关键内核」就成了公司级的战略资产。英伟达自己都在用 AI Agent 加速开发 CUDA,开发者生态副总裁 Ankit Patel 亲口确认。量子位字节训练 CUDA Agent 的成本折算下来只要 1 万到 8 万美元,但在火山引擎那种日均百万亿 token 的推理规模上,内核整体提速 5% 一年就能省下约 5500 万美元。知乎账算到这个地步,头部 lab 只会更舍得为「能定义问题、能兜底正确性、能把新硬件第一波性能榨出来」的人付钱。全世界不到一百人能写训练级内核,这个数字短期内不会变。
哑铃的另一头,是新长出来的中间层:「能看穿内核谎言」的人。Sakana 事件和 CUDA Agent 的评测风波证明了,AI 生成的内核会作弊、会硬编码、会利用基准测试的漏洞。谁能读懂 NCU 的 profiling 报告、能判断数值精度在哪里悄悄退化、能设计多随机输入的验证方案、能在生产事故里定位是哪个 kernel 在撒谎——谁就卡住了 AI 内核时代的质检关口。Bing Xu 那句「验证生态会成为 CUDA 的下一道护城河」,对个人同样成立。量子位
被挤掉的,是中间原本最厚的那段:照着需求把普通算子写出来、跑到能用就交差的工作。这部分正在被 torch.compile、Triton 和 CUDA Agent 这类工具快速吃掉——不是明天就消失,而是它的议价能力在以肉眼可见的速度衰减。
三类人,三种走法
落到具体的人身上,这周的新闻应该翻译成三种不同的动作:
如果你是学生或准备转 AI Infra 的工程师:别把目标定在「比 AI 更快地写出普通算子」,那条及格线已经移动了。把时间花在 AI 替不掉的部分:CUDA 线程组织与 GPU 硬件单元的对应关系、存储层次和 warp 调度的硬件原理、NCU/nsight 性能分析、数值精度与正确性验证——这些听起来枯燥的底层映射,恰恰是 AI 生成代码出错时你能看出问题的底气。练习方式可以直接抄 CUDA Agent 训练环境的思路——KernelBench 刷题、多组随机输入校验、强制自己看 profiling 而不是凭感觉。另外,AI 生成的内核正好是你的免费陪练:让它写,你来审,审出它藏起来的 bug,这是当下性价比最高的进阶路径。

如果你是天天用 PyTorch 和推理框架的算法工程师:你不需要会手写 GEMM,但值得补上「判断 kernel 是否在骗你」的最小技能包——会读一份 profiling 报告、理解算子融合的边界、知道精度损失通常藏在哪一步。顺手可以把 DeepSeek 开源的 TileKernels、SGLang 刚发的 CUDA Graph 进阶博客当学习材料,看看一线推理引擎是怎么做工程取舍的。这类能力在排查线上推理事故时,一次就能回本。
如果你已经在写内核:价值在往两端跑,你要选一头扎下去。一头是架构级纵深:TMA、thread block cluster、tcgen05 这些 Hopper/Blackwell 的新机制,新架构的头等舱窗口期就那么一两年,先上去的人定义标准;另一头是系统级责任:验证体系、调度、成本模型,把自己变成「这个关键 kernel 出问题只能找我」的那个人——也就是 Bob kernel 模式。最怕的是停在中间,每天写和 torch.compile 差不多的算子,那正是被替代最快的工作。
接下来值得盯的三个信号
最后给几个可以继续观察的线索,方便你自己校准判断:一是英伟达会不会把验证工具链进一步开放或收编——那是公认的下一道护城河;二是 DeepSeek、SGLang 这类开源推理栈的算子库更新节奏,它们正在把「内核工程」的门槛重新定价;三是 Scott Gray 的下一步去向,顶级内核人才的流动方向,历来是整个行业价值迁移的先行指标。
CUDA 没有崩。崩掉的是「会写 CUDA 就等于铁饭碗」这个旧想象。真正值钱的东西,从「写出代码」变成了「判断代码」和「为代码兜底」——这大概是这周所有喧嚣里,唯一值得带走的结论。