DeepSeek开源昇腾全套组件,同一代码无缝跑通英伟达和华为两套算力

源自169位全网作者

09-30 15:52

精选参考来源

1
现在来看,黄仁勋之前作出的预测,十有八九是可能是对的,黄仁勋此前曾有过相关表述,倘若DeepSeek这类大模型跑在华为芯片之上,对美国而言将会是一个可怕的结果,当时不少人认为这是他为英伟达争取政策所作的表态,如今回头看,他的担忧并非空泛的说辞。 昇腾960超节点已经推出,单节点可搭载4096张卡,FP8算力达到8 EFLOPS,与此同时,DeepSeek V4完成了从CUDA向华为CANN框架的迁移,并非简单的API转译,而是在底层算子层面完成重写。 将这两件事放在一起看,早已不再是简单的谁卡谁脖子的对立叙事。 CUDA的护城河,并不是性能。 英伟达单卡性能确实强悍,但这并非它真正的壁垒,真正的壁垒是CUDA过去十几年积累的庞大生态,数百万开发者沉淀的函数库,完整的工具链,海量调优经验,大量开源项目,全都围绕CUDA搭建而成,一个团队想要迁移到新芯片平台,远不止更换驱动这么简单,需要大规模重写底层代码,重新积累整套调优经验,这份高昂的迁移成本,才是英伟达最核心的护城河。 因此,在很长一段时间里,国产芯片面临的核心难题,并不是单卡性能差距,就算硬件性能追上来,开发者也不愿承担巨大成本完成迁移。 DeepSeek做了那件搬家的苦力活。 DeepSeek V4这次迁移的价值,不只是证明国产芯片可以跑大模型,而是验证了一件更重要的事,只要算法团队愿意投入深度重构的工程精力,高昂的跨平台迁移成本,是可以被攻克的。 V4并不是简单把CUDA代码转译后直接运行,而是基于CANN框架底层重新开发,这代表DeepSeek工程师深度吃透了华为的软件栈,而非被动等待软件栈去适配模型,这种做法过去并不多见,投入巨大,短期收益有限,但一旦跑通,就给出了一条可复制的路径,跨平台迁移成本很高,但会有团队愿意承担这份成本。 昇腾960的逻辑,不拼单卡,拼整机。 昇腾960超节点支持4096卡互联,走了一条和英伟达不一样的路线,英伟达侧重极致单卡跑分,昇腾的思路则是优先提升整套集群的系统效率,单卡性能存在差距,就依靠高速互联带宽与集群调度算法来弥补,这套思路的本质是,当单点硬件难以超越对手,就切换到新的维度展开竞争。 这套思路能否持续跑通,核心要看集群系统效率能否弥补单卡层面的差距,如果可以,行业竞争的评判维度就会发生变化,从单纯比拼单卡算力,转向比拼整套大集群的综合运行效率,在这套新规则下,CUDA的生态优势会被削弱,因为集群调度不完全依赖单个开发者的使用习惯。 卡脖子的,从来不只是芯片。 出口管制限制的是硬件出口,但长期阻碍国产芯片替代的,是开发者的生态惯性,行业早已习惯CUDA,更换平台意味着学习新软件栈,大规模重写代码,承担调试不确定性,这种生态惯性,影响力不亚于硬件出口管制,无需行政命令就能维持。 DeepSeek这次做的,是在这道生态惯性的厚墙上凿开了一道缝,缝隙不大,但透进来的光,足够让后来者看清一件事,这道墙并非不可翻越,只要有人迈出第一步,后面就会有更多团队跟进。
2
DeepSeek适配华为昇腾,国产AI算力生态迎来关键转折点
全部
来源
内容由AI生成

精选参考来源

1. 现在来看,黄仁勋之前作出的预测,十有八九是可能是对的,黄仁勋此前曾有过相关表述,倘若DeepSeek这类大模型跑在华为芯片之上,对美国而言将会是一个可怕的结果,当时不少人认为这是他为英伟达争取政策所作的表态,如今回头看,他的担忧并非空泛的说辞。 昇腾960超节点已经推出,单节点可搭载4096张卡,FP8算力达到8 EFLOPS,与此同时,DeepSeek V4完成了从CUDA向华为CANN框架的迁移,并非简单的API转译,而是在底层算子层面完成重写。 将这两件事放在一起看,早已不再是简单的谁卡谁脖子的对立叙事。 CUDA的护城河,并不是性能。 英伟达单卡性能确实强悍,但这并非它真正的壁垒,真正的壁垒是CUDA过去十几年积累的庞大生态,数百万开发者沉淀的函数库,完整的工具链,海量调优经验,大量开源项目,全都围绕CUDA搭建而成,一个团队想要迁移到新芯片平台,远不止更换驱动这么简单,需要大规模重写底层代码,重新积累整套调优经验,这份高昂的迁移成本,才是英伟达最核心的护城河。 因此,在很长一段时间里,国产芯片面临的核心难题,并不是单卡性能差距,就算硬件性能追上来,开发者也不愿承担巨大成本完成迁移。 DeepSeek做了那件搬家的苦力活。 DeepSeek V4这次迁移的价值,不只是证明国产芯片可以跑大模型,而是验证了一件更重要的事,只要算法团队愿意投入深度重构的工程精力,高昂的跨平台迁移成本,是可以被攻克的。 V4并不是简单把CUDA代码转译后直接运行,而是基于CANN框架底层重新开发,这代表DeepSeek工程师深度吃透了华为的软件栈,而非被动等待软件栈去适配模型,这种做法过去并不多见,投入巨大,短期收益有限,但一旦跑通,就给出了一条可复制的路径,跨平台迁移成本很高,但会有团队愿意承担这份成本。 昇腾960的逻辑,不拼单卡,拼整机。 昇腾960超节点支持4096卡互联,走了一条和英伟达不一样的路线,英伟达侧重极致单卡跑分,昇腾的思路则是优先提升整套集群的系统效率,单卡性能存在差距,就依靠高速互联带宽与集群调度算法来弥补,这套思路的本质是,当单点硬件难以超越对手,就切换到新的维度展开竞争。 这套思路能否持续跑通,核心要看集群系统效率能否弥补单卡层面的差距,如果可以,行业竞争的评判维度就会发生变化,从单纯比拼单卡算力,转向比拼整套大集群的综合运行效率,在这套新规则下,CUDA的生态优势会被削弱,因为集群调度不完全依赖单个开发者的使用习惯。 卡脖子的,从来不只是芯片。 出口管制限制的是硬件出口,但长期阻碍国产芯片替代的,是开发者的生态惯性,行业早已习惯CUDA,更换平台意味着学习新软件栈,大规模重写代码,承担调试不确定性,这种生态惯性,影响力不亚于硬件出口管制,无需行政命令就能维持。 DeepSeek这次做的,是在这道生态惯性的厚墙上凿开了一道缝,缝隙不大,但透进来的光,足够让后来者看清一件事,这道墙并非不可翻越,只要有人迈出第一步,后面就会有更多团队跟进。

2. DeepSeek适配华为昇腾,国产AI算力生态迎来关键转折点

3. 现在来看,黄仁勋早前做出的预判,大概率是成立的。 黄仁勋曾经提到DeepSeek首次运行在华为芯片之上,对美国而言是个棘手的局面。那时候不少人觉得他是在为英伟达争取相关政策。如今再看,他所言发自内心。 DeepSeek选择华为,并非无奈之下的备选方案,而是双方强强协作。 很多人一开始都没看懂黄仁勋这句话背后的分量,只当成商界大佬常规的游说话术。大家猜测,他只是想借着这个说法,劝说美国放宽芯片出口限制,保住英伟达在中国的庞大市场。 直到DeepSeek V4正式亮相,所有人才反应过来,老黄担心的从来不是单一一款芯片性能的高低,而是持续二十年的CUDA生态根基,正在被撕开一道口子。 过去很长一段时间,全球所有前沿大模型,基本都是围绕英伟达CUDA框架开发。模型写代码、做训练、上线推理,全部绑定这套体系。这就形成了无形的行业规则,只要开发者还在CUDA生态里,美国就掌握AI产业的底层话语权。 一旦顶尖大模型从研发阶段,就原生适配华为昇腾,整套代码基于CANN框架重写,事情就完全不一样了。DeepSeek V4实现了Day0适配,模型发布当天,华为昇腾超节点就可以直接承载,从训练到推理实现全链路跑通。 这不是简单把已经做好的模型,挪到国产芯片上勉强运行。是在模型设计之初,就和硬件深度协同打磨,把算子、显存调度、多卡互联全部对齐昇腾架构。 最大的改变,是迁移成本的巨变。以前AI企业想脱离CUDA,重写底层代码往往要耗费数月甚至半年,门槛极高。DeepSeek打通这条路之后,后续其他模型厂商的适配周期会被大幅压缩。等于给整个国内AI行业,趟出一条可复制的脱离海外算力生态的路径。 DeepSeek本身的实力,决定这件事的影响会扩散到全球。V4预览版直接开源,海外开发者也能拿到这套基于昇腾优化的模型。全球的开发者会看到,顶级大模型可以不靠英伟达硬件稳定运行。 这才是黄仁勋口中可怕之处。当全球AI从业者发现,除了CUDA还有成熟稳定的备选方案,多年形成的技术锁定效应会慢慢松动。后续不少国家在建AI算力基础设施的时候,就会多出一个全新选择,不再只能绑定美国的芯片和软件栈。 当然,这个选择不是凭空出现的,外部芯片限制,倒逼国内算力和大模型企业走到一起。DeepSeek作为头部模型公司,不得不提前布局不受外部管控的算力底座。华为昇腾多年持续迭代,也终于具备承载万亿参数大模型的能力。二者相遇,是技术积累叠加现实环境催生出来的组合。 不少国内科技企业已经提前锁定昇腾芯片订单,准备接入这套新生态。国产AI服务器市场份额稳步上涨,产业链上下游开始形成正向循环。芯片出货越多,开发者越多,框架持续优化,反过来吸引更多模型落地。 但也要客观看待,这套新生态还处在成长阶段。对比CUDA数十年积累的工具、插件、开发者社区,昇腾的生态建设还有很长一段路要走。硬件的大规模集群通信、配套工具链,还有持续优化的空间,并不是一步就能追上成熟海外体系。 可行业的底层逻辑已经发生变化。从前大家默认,前沿大模型只能跑在英伟达的硬件上。现在已经证明,国产芯片加国产大模型,可以跑出世界第一梯队的产品。 这件事的意义,早已超出两家企业之间的合作。它给全球AI产业提供了另一条独立发展路线。不再是单一技术标准垄断全球算力市场。 黄仁勋看得很明白,芯片的性能差距还有追赶空间,但生态一旦形成,再想封锁就很难。当开源的顶尖模型,原生支持国产算力,美国靠芯片和软件生态掌握的AI话语权,就会被持续削弱。 现在,DeepSeek已经计划部署十几万颗昇腾芯片搭建大型AI集群,大规模商用落地已经提上日程。后续更多国产大模型,大概率会跟进原生适配昇腾。 英伟达的护城河不是一夜崩塌,但是最关键的那道裂缝,已经实实在在出现。黄仁勋当初那句警告,不是危言耸听,是他站在行业顶端,提前看见了AI产业格局的转向。#上头条 聊热点##MCN微头条伙伴计划#

4. DeepSeek选择华为,对美国是可怕结果,看完终于读懂黄仁勋

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章