DeepSeek开源昇腾版核心组件,换国产卡无需重写代码
源自182位全网作者
13:01
精选参考来源
1
推上看到一个关于DeepSeek V5的帖子:DeepSeek V5 泄露:传闻已超越 Astra据传 DeepSeek 即将发布 V5。创始人梁文锋称这是公司迄今最大的一笔押注。传闻参数规模约 2 万亿(不是 3 万亿)。据称这是 DeepSeek 首个完全在华为昇腾芯片上训练、不再依赖英伟达的模型。要达到同等训练规模,昇腾卡用量大约是英伟达方案的 4 倍。 同时,DeepSeek 据传仍会继续开源权重。(但真实性存疑,主要是全部在华为芯片上训练,这个时间点有点儿科幻片)
2
现在来看,黄仁勋之前作出的预测,十有八九是可能是对的,黄仁勋此前曾有过相关表述,倘若DeepSeek这类大模型跑在华为芯片之上,对美国而言将会是一个可怕的结果,当时不少人认为这是他为英伟达争取政策所作的表态,如今回头看,他的担忧并非空泛的说辞。
昇腾960超节点已经推出,单节点可搭载4096张卡,FP8算力达到8 EFLOPS,与此同时,DeepSeek V4完成了从CUDA向华为CANN框架的迁移,并非简单的API转译,而是在底层算子层面完成重写。
将这两件事放在一起看,早已不再是简单的谁卡谁脖子的对立叙事。
CUDA的护城河,并不是性能。
英伟达单卡性能确实强悍,但这并非它真正的壁垒,真正的壁垒是CUDA过去十几年积累的庞大生态,数百万开发者沉淀的函数库,完整的工具链,海量调优经验,大量开源项目,全都围绕CUDA搭建而成,一个团队想要迁移到新芯片平台,远不止更换驱动这么简单,需要大规模重写底层代码,重新积累整套调优经验,这份高昂的迁移成本,才是英伟达最核心的护城河。
因此,在很长一段时间里,国产芯片面临的核心难题,并不是单卡性能差距,就算硬件性能追上来,开发者也不愿承担巨大成本完成迁移。
DeepSeek做了那件搬家的苦力活。
DeepSeek V4这次迁移的价值,不只是证明国产芯片可以跑大模型,而是验证了一件更重要的事,只要算法团队愿意投入深度重构的工程精力,高昂的跨平台迁移成本,是可以被攻克的。
V4并不是简单把CUDA代码转译后直接运行,而是基于CANN框架底层重新开发,这代表DeepSeek工程师深度吃透了华为的软件栈,而非被动等待软件栈去适配模型,这种做法过去并不多见,投入巨大,短期收益有限,但一旦跑通,就给出了一条可复制的路径,跨平台迁移成本很高,但会有团队愿意承担这份成本。
昇腾960的逻辑,不拼单卡,拼整机。
昇腾960超节点支持4096卡互联,走了一条和英伟达不一样的路线,英伟达侧重极致单卡跑分,昇腾的思路则是优先提升整套集群的系统效率,单卡性能存在差距,就依靠高速互联带宽与集群调度算法来弥补,这套思路的本质是,当单点硬件难以超越对手,就切换到新的维度展开竞争。
这套思路能否持续跑通,核心要看集群系统效率能否弥补单卡层面的差距,如果可以,行业竞争的评判维度就会发生变化,从单纯比拼单卡算力,转向比拼整套大集群的综合运行效率,在这套新规则下,CUDA的生态优势会被削弱,因为集群调度不完全依赖单个开发者的使用习惯。
卡脖子的,从来不只是芯片。
出口管制限制的是硬件出口,但长期阻碍国产芯片替代的,是开发者的生态惯性,行业早已习惯CUDA,更换平台意味着学习新软件栈,大规模重写代码,承担调试不确定性,这种生态惯性,影响力不亚于硬件出口管制,无需行政命令就能维持。
DeepSeek这次做的,是在这道生态惯性的厚墙上凿开了一道缝,缝隙不大,但透进来的光,足够让后来者看清一件事,这道墙并非不可翻越,只要有人迈出第一步,后面就会有更多团队跟进。
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
最新文章
热门文章
-
电饭煲,涂层材质对比0 0
已收藏
去我的收藏夹