CUDA护城河出现三条裂缝,AMD兼容、Triton绕道、AI自动翻译代码

源自188位全网作者

10:34

精选参考来源

1
很多朋友都有一个疑问,AI发展了这么多年,英伟达就赚了这么多年,为什么全球就是出不来第二家能跟它掰手腕的AI芯片公司? 因为英伟达卖的根本不是芯片。 很多人还把它当成做GPU的。这个理解十年前对,今天已经完全不对了。英伟达真正在做的,是把AI计算需要的一切打包成一个完整方案,客户买回去插上电就能跑。它卖的不是一张卡,是一个机架。不是一颗芯片,是一整套计算体系。 这套体系有四层。最底下是芯片,Vera Rubin,3纳米,3360亿晶体管。往上是互联,NVLink把72颗GPU连成一个算力域,这是真正的硬件壁垒。再往上是系统,GB300机架出厂就是完整的液冷加电源加计算单元,拿回去联网就能用。最上面是CUDA,400万开发者写了十几年代码,数百万行验证过的库,数万个模型跑在上面。 四层互相加固,形成飞轮。芯片越强,买的人越多。买的人越多,CUDA生态越厚。生态越厚,后来者切换成本越高。 竞争对手可以造出一颗跑分更高的芯片,但造不出一个跑了十几年的软件生态。 过去五年挑战者分四路。云巨头自研芯片,谷歌TPU、亚马逊Trainium、微软Maia,但它们的目的是降低自身成本,不是跟英伟达正面打。谷歌自己也在大量采购英伟达的Vera Rubin,训练还是得用英伟达。 AMD的MI400纸面参数不输,Helios机架扩展带宽甚至比英伟达还高50%。但市场份额只有5%到7%。差距不在硬件,在ROCm生态跟CUDA差了不止一个量级。 初创公司更惨。Graphcore低价卖给软银,Groq被英伟达以非独家许可“收编”。Jon Peddie预测,未来一两年独立AI芯片供应商数量缩减40%。 唯一有实质威胁的是博通领衔的定制ASIC。谷歌TPU、Meta MTIA、OpenAI自研芯片,背后都有博通。推理成本能做得比通用GPU更低。但ASIC只能跑特定任务,训练还是得回到英伟达。而训练才是利润最厚的那块蛋糕。 裂缝在哪?在推理端。CUDA最初为训练设计,但推理任务标准化,模型训完之后负载固定可预测。如果企业能不重写软件就切换芯片,CUDA最大的锁定效应就被削弱了。韩国Rebellions的高管说得直白:CUDA在推理领域已不再是决定性因素,这变成了一场开源比拼。 另一个裂缝是AI编程智能体。有创业公司用AI在10小时内为一家芯片公司开发了一套类似CUDA的软件。如果AI能自动化芯片底层软件开发,CUDA的生态壁垒就从十几年积累的护城河,变成几个月可以追上的差距。 但英伟达的应对是把护城河从CUDA扩展到全栈系统。35亿美元入股联发科,让联发科用NVLink Fusion为客户开发定制芯片,接入英伟达的机架系统。即使你不用我的GPU,你也得用我的互联和网络。 每一个挑战者都在某一个维度上比英伟达强。但没有一个在所有维度上都比英伟达强。而AI芯片市场比的恰恰是所有维度。 这就是为什么全球只有一家英伟达。这个位置只有一个,谁先占住,谁就赢了十几年。
2
AI自我迭代,CUDA护城河正在反噬英伟达自己 英伟达过去二十年最坚固的壁垒,从来不是GPU硬件,而是CUDA软件生态。这套工具链、底层算子库与海量开发者社区,构筑起极高迁移门槛,把全球AI产业牢牢绑定在英伟达硬件之上。但戏剧性的悖论正在上演:依托英伟达GPU训练出来的AI,开启软硬件自主迭代,正在慢慢凿穿CUDA护城河,相当于亲手培养出颠覆自己的力量。 CUDA护城河的底层逻辑,建立在人类开发者的路径依赖之上。过去,想要跑通大模型,工程师必须熟练掌握CUDA语法、算子调优、多卡通信。哪怕竞品芯片硬件性能接近,重写整套底层代码、完成全链路适配,往往要投入数年时间、巨额研发成本,绝大多数企业不愿承担这种沉没成本。人类学习CUDA门槛很高,换生态代价巨大,这就是英伟达的安全壁垒。 而AI自我迭代彻底改变这套游戏规则。如今大模型可以读懂CUDA代码,自动把算子翻译成适配其他硬件的底层指令;AI智能体还能直接根据任务规格,从零设计芯片架构、生成配套编译代码,不需要人类程序员深耕CUDA。Architect Labs的实验已经证明,两名工程师配合AI,两周内就能完成一颗AI加速芯片的设计验证,AI甚至可以持续迭代下一代芯片。OpenAI自研芯片项目更是直指核心:AI直接对接硬件,跳过CUDA中间层,模型、芯片形成自我增强的迭代飞轮。 这个悖论就在于:全世界绝大多数大模型,都是跑在英伟达GPU、依托CUDA训练出来的。黄仁勋用CUDA教会AI看懂并行计算,AI学会这套逻辑之后,转头就能绕开CUDA,给其他硬件写最优底层代码。曾经锁死行业的生态高墙,被AI变成可以自动翻译、自动迁移的通用语言。人类的学习壁垒,在AI面前大幅失效。 当然,短期不能夸大颠覆效果。CUDA二十年沉淀的海量函数库、集群调试经验、生产级稳定性,不是AI短短几年就能完全复刻。英伟达本身也在用AI优化CUDA工具链,主动加固生态。存量海量项目迁移成本依旧很高,大型大模型训练场景,CUDA依然是首选方案。裂痕最先出现在推理场景,推理任务标准化、对成本更敏感,也是各类自研芯片、开源软件栈突破CUDA的主战场。 长远来看,产业底层逻辑已经改变。未来算力比拼,不再是谁拥有最成熟的人类开发工具链,而是谁拥有能自主完成软硬件协同优化的AI迭代体系。CUDA的护城河不是瞬间崩塌,而是被AI一点点消解。英伟达用CUDA点燃AI革命,而这场革命的产物,正在削弱CUDA独有的锁定能力。这不是马上“杀死”英伟达,却是技术演进带来的深刻反噬。 算力赛道的启示很清晰,靠封闭软件锁定的垄断优势,在AI自主迭代时代不再永久稳固。任何科技巨头都要面对:你培育的技术,终有一天会跳出原有框架,开辟全新的技术路线。
全部
来源
内容由AI生成

精选参考来源

1. 很多朋友都有一个疑问,AI发展了这么多年,英伟达就赚了这么多年,为什么全球就是出不来第二家能跟它掰手腕的AI芯片公司? 因为英伟达卖的根本不是芯片。 很多人还把它当成做GPU的。这个理解十年前对,今天已经完全不对了。英伟达真正在做的,是把AI计算需要的一切打包成一个完整方案,客户买回去插上电就能跑。它卖的不是一张卡,是一个机架。不是一颗芯片,是一整套计算体系。 这套体系有四层。最底下是芯片,Vera Rubin,3纳米,3360亿晶体管。往上是互联,NVLink把72颗GPU连成一个算力域,这是真正的硬件壁垒。再往上是系统,GB300机架出厂就是完整的液冷加电源加计算单元,拿回去联网就能用。最上面是CUDA,400万开发者写了十几年代码,数百万行验证过的库,数万个模型跑在上面。 四层互相加固,形成飞轮。芯片越强,买的人越多。买的人越多,CUDA生态越厚。生态越厚,后来者切换成本越高。 竞争对手可以造出一颗跑分更高的芯片,但造不出一个跑了十几年的软件生态。 过去五年挑战者分四路。云巨头自研芯片,谷歌TPU、亚马逊Trainium、微软Maia,但它们的目的是降低自身成本,不是跟英伟达正面打。谷歌自己也在大量采购英伟达的Vera Rubin,训练还是得用英伟达。 AMD的MI400纸面参数不输,Helios机架扩展带宽甚至比英伟达还高50%。但市场份额只有5%到7%。差距不在硬件,在ROCm生态跟CUDA差了不止一个量级。 初创公司更惨。Graphcore低价卖给软银,Groq被英伟达以非独家许可“收编”。Jon Peddie预测,未来一两年独立AI芯片供应商数量缩减40%。 唯一有实质威胁的是博通领衔的定制ASIC。谷歌TPU、Meta MTIA、OpenAI自研芯片,背后都有博通。推理成本能做得比通用GPU更低。但ASIC只能跑特定任务,训练还是得回到英伟达。而训练才是利润最厚的那块蛋糕。 裂缝在哪?在推理端。CUDA最初为训练设计,但推理任务标准化,模型训完之后负载固定可预测。如果企业能不重写软件就切换芯片,CUDA最大的锁定效应就被削弱了。韩国Rebellions的高管说得直白:CUDA在推理领域已不再是决定性因素,这变成了一场开源比拼。 另一个裂缝是AI编程智能体。有创业公司用AI在10小时内为一家芯片公司开发了一套类似CUDA的软件。如果AI能自动化芯片底层软件开发,CUDA的生态壁垒就从十几年积累的护城河,变成几个月可以追上的差距。 但英伟达的应对是把护城河从CUDA扩展到全栈系统。35亿美元入股联发科,让联发科用NVLink Fusion为客户开发定制芯片,接入英伟达的机架系统。即使你不用我的GPU,你也得用我的互联和网络。 每一个挑战者都在某一个维度上比英伟达强。但没有一个在所有维度上都比英伟达强。而AI芯片市场比的恰恰是所有维度。 这就是为什么全球只有一家英伟达。这个位置只有一个,谁先占住,谁就赢了十几年。

2. AI自我迭代,CUDA护城河正在反噬英伟达自己 英伟达过去二十年最坚固的壁垒,从来不是GPU硬件,而是CUDA软件生态。这套工具链、底层算子库与海量开发者社区,构筑起极高迁移门槛,把全球AI产业牢牢绑定在英伟达硬件之上。但戏剧性的悖论正在上演:依托英伟达GPU训练出来的AI,开启软硬件自主迭代,正在慢慢凿穿CUDA护城河,相当于亲手培养出颠覆自己的力量。 CUDA护城河的底层逻辑,建立在人类开发者的路径依赖之上。过去,想要跑通大模型,工程师必须熟练掌握CUDA语法、算子调优、多卡通信。哪怕竞品芯片硬件性能接近,重写整套底层代码、完成全链路适配,往往要投入数年时间、巨额研发成本,绝大多数企业不愿承担这种沉没成本。人类学习CUDA门槛很高,换生态代价巨大,这就是英伟达的安全壁垒。 而AI自我迭代彻底改变这套游戏规则。如今大模型可以读懂CUDA代码,自动把算子翻译成适配其他硬件的底层指令;AI智能体还能直接根据任务规格,从零设计芯片架构、生成配套编译代码,不需要人类程序员深耕CUDA。Architect Labs的实验已经证明,两名工程师配合AI,两周内就能完成一颗AI加速芯片的设计验证,AI甚至可以持续迭代下一代芯片。OpenAI自研芯片项目更是直指核心:AI直接对接硬件,跳过CUDA中间层,模型、芯片形成自我增强的迭代飞轮。 这个悖论就在于:全世界绝大多数大模型,都是跑在英伟达GPU、依托CUDA训练出来的。黄仁勋用CUDA教会AI看懂并行计算,AI学会这套逻辑之后,转头就能绕开CUDA,给其他硬件写最优底层代码。曾经锁死行业的生态高墙,被AI变成可以自动翻译、自动迁移的通用语言。人类的学习壁垒,在AI面前大幅失效。 当然,短期不能夸大颠覆效果。CUDA二十年沉淀的海量函数库、集群调试经验、生产级稳定性,不是AI短短几年就能完全复刻。英伟达本身也在用AI优化CUDA工具链,主动加固生态。存量海量项目迁移成本依旧很高,大型大模型训练场景,CUDA依然是首选方案。裂痕最先出现在推理场景,推理任务标准化、对成本更敏感,也是各类自研芯片、开源软件栈突破CUDA的主战场。 长远来看,产业底层逻辑已经改变。未来算力比拼,不再是谁拥有最成熟的人类开发工具链,而是谁拥有能自主完成软硬件协同优化的AI迭代体系。CUDA的护城河不是瞬间崩塌,而是被AI一点点消解。英伟达用CUDA点燃AI革命,而这场革命的产物,正在削弱CUDA独有的锁定能力。这不是马上“杀死”英伟达,却是技术演进带来的深刻反噬。 算力赛道的启示很清晰,靠封闭软件锁定的垄断优势,在AI自主迭代时代不再永久稳固。任何科技巨头都要面对:你培育的技术,终有一天会跳出原有框架,开辟全新的技术路线。

3. 冲击英伟达CUDA壁垒!AMD显卡Windows可跑通CUDA程序

4. 6 分钟看懂 NVIDIA CUDA:护城河与真正的威胁【中字】

5. 【GPU 编程的范式转移:从 CUDA 霸权到 Rust 觉醒】NVIDIA最近官宣了CUDA Rust的两条原生路径:cuda-oxide(底层SIMT模型)和cutile-rs(高层Tile模型)。这标志着GPU内核开发终于告别了必须依赖C++包装的尴尬期,实现了从编译器后端到前端的全链路Rust化。这件事之所以在技术圈炸锅,是因为它试图用Rust的权属机制(Ownership)暴力破解GPU编程最头疼的内存竞态问题。SIMT模式通过DisjointSlice强制线程间访问隔离,而Tile模式则更进一步,将网格几何形状与张量分区绑定,在编译阶段就掐死了非法别名的可能性。业内对此反应两极:务实派认为CUDA这种“生态霸权”虽然带有强烈的厂商锁死属性,但其提供的开发体验确实是OpenCL等开放标准难以企及的“降维打击”;而理想派则在反思,当NVIDIA开始用AI生成的公关稿(文中那句“Launch is checked rather than trusted”被指带有浓重Claude味)来推广号称“安全”的工具时,开发者是否正从一种代码陷阱跳入另一种由算法和私有协议构筑的黑盒。无论你站哪边,GPU编程的门槛正在坍塌。当编译器能像检查普通代码一样检查GPU显存安全时,算力开发的重心将从“防炸机”转向“堆逻辑”。对开发者来说,这可能意味着以后写内核不再需要战战兢兢,但也意味着你必须接受NVIDIA对底层ISA更深层的掌控。

6. 冲击英伟达护城河:开源项目让AMD RX 9060 XT显卡跑通部分CUDA库

7. AMD想在AI领域引领技术,应自建AI服务器集群,给开发者跑大模型

8. 冲击英伟达护城河:开源项目让AMD RX 9060 XT跑通部分CUDA库

9. AMD显卡成功运行CUDA,NVIDIA护城河或被撬动?

10. AMD RX 9060 XT成功运行部分CUDA库,挑战英伟达技术壁垒

11. NVIDIA护城河被撬开!AMD显卡成功跑CUDA

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章