CUDA护城河正遭开源转译和AI迭代双重凿墙,英伟达转向全栈防线
源自197位全网作者
12:14
精选参考来源
1
智谱说国产AI芯片最大的短板三点:1、显存不足;2、带宽不足;3、算子不足。今天华为发的960,HBM最大支持288GB(是支持,不是说就有,现在要确保HBM足够是个供应链问题),带宽9.6TB/s(还要看集群总体有效带宽),FP8算力2Pflops。960在硬件上在努力解决显存、带宽的问题。算子的问题,则是华为必须要解决的。好在他们说,AI可以帮助写算子。。。真是意想不到的收获。以前CUDA生态,靠300万开发者。现在AI生态,300万个agent帮你写算子一样达到效果。绕过软件生态壁垒了。#华为发布全新AI计算架构#
2
很多朋友都有一个疑问,AI发展了这么多年,英伟达就赚了这么多年,为什么全球就是出不来第二家能跟它掰手腕的AI芯片公司?
因为英伟达卖的根本不是芯片。
很多人还把它当成做GPU的。这个理解十年前对,今天已经完全不对了。英伟达真正在做的,是把AI计算需要的一切打包成一个完整方案,客户买回去插上电就能跑。它卖的不是一张卡,是一个机架。不是一颗芯片,是一整套计算体系。
这套体系有四层。最底下是芯片,Vera Rubin,3纳米,3360亿晶体管。往上是互联,NVLink把72颗GPU连成一个算力域,这是真正的硬件壁垒。再往上是系统,GB300机架出厂就是完整的液冷加电源加计算单元,拿回去联网就能用。最上面是CUDA,400万开发者写了十几年代码,数百万行验证过的库,数万个模型跑在上面。
四层互相加固,形成飞轮。芯片越强,买的人越多。买的人越多,CUDA生态越厚。生态越厚,后来者切换成本越高。
竞争对手可以造出一颗跑分更高的芯片,但造不出一个跑了十几年的软件生态。
过去五年挑战者分四路。云巨头自研芯片,谷歌TPU、亚马逊Trainium、微软Maia,但它们的目的是降低自身成本,不是跟英伟达正面打。谷歌自己也在大量采购英伟达的Vera Rubin,训练还是得用英伟达。
AMD的MI400纸面参数不输,Helios机架扩展带宽甚至比英伟达还高50%。但市场份额只有5%到7%。差距不在硬件,在ROCm生态跟CUDA差了不止一个量级。
初创公司更惨。Graphcore低价卖给软银,Groq被英伟达以非独家许可“收编”。Jon Peddie预测,未来一两年独立AI芯片供应商数量缩减40%。
唯一有实质威胁的是博通领衔的定制ASIC。谷歌TPU、Meta MTIA、OpenAI自研芯片,背后都有博通。推理成本能做得比通用GPU更低。但ASIC只能跑特定任务,训练还是得回到英伟达。而训练才是利润最厚的那块蛋糕。
裂缝在哪?在推理端。CUDA最初为训练设计,但推理任务标准化,模型训完之后负载固定可预测。如果企业能不重写软件就切换芯片,CUDA最大的锁定效应就被削弱了。韩国Rebellions的高管说得直白:CUDA在推理领域已不再是决定性因素,这变成了一场开源比拼。
另一个裂缝是AI编程智能体。有创业公司用AI在10小时内为一家芯片公司开发了一套类似CUDA的软件。如果AI能自动化芯片底层软件开发,CUDA的生态壁垒就从十几年积累的护城河,变成几个月可以追上的差距。
但英伟达的应对是把护城河从CUDA扩展到全栈系统。35亿美元入股联发科,让联发科用NVLink Fusion为客户开发定制芯片,接入英伟达的机架系统。即使你不用我的GPU,你也得用我的互联和网络。
每一个挑战者都在某一个维度上比英伟达强。但没有一个在所有维度上都比英伟达强。而AI芯片市场比的恰恰是所有维度。
这就是为什么全球只有一家英伟达。这个位置只有一个,谁先占住,谁就赢了十几年。
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹