DeepSeek开源昇腾版核心组件,换国产卡无需重写代码

源自182位全网作者

13:01

精选参考来源

1
推上看到一个关于DeepSeek V5的帖子:DeepSeek V5 泄露:传闻已超越 Astra据传 DeepSeek 即将发布 V5。创始人梁文锋称这是公司迄今最大的一笔押注。传闻参数规模约 2 万亿(不是 3 万亿)。据称这是 DeepSeek 首个完全在华为昇腾芯片上训练、不再依赖英伟达的模型。要达到同等训练规模,昇腾卡用量大约是英伟达方案的 4 倍。 同时,DeepSeek 据传仍会继续开源权重。(但真实性存疑,主要是全部在华为芯片上训练,这个时间点有点儿科幻片)
2
现在来看,黄仁勋之前作出的预测,十有八九是可能是对的,黄仁勋此前曾有过相关表述,倘若DeepSeek这类大模型跑在华为芯片之上,对美国而言将会是一个可怕的结果,当时不少人认为这是他为英伟达争取政策所作的表态,如今回头看,他的担忧并非空泛的说辞。 昇腾960超节点已经推出,单节点可搭载4096张卡,FP8算力达到8 EFLOPS,与此同时,DeepSeek V4完成了从CUDA向华为CANN框架的迁移,并非简单的API转译,而是在底层算子层面完成重写。 将这两件事放在一起看,早已不再是简单的谁卡谁脖子的对立叙事。 CUDA的护城河,并不是性能。 英伟达单卡性能确实强悍,但这并非它真正的壁垒,真正的壁垒是CUDA过去十几年积累的庞大生态,数百万开发者沉淀的函数库,完整的工具链,海量调优经验,大量开源项目,全都围绕CUDA搭建而成,一个团队想要迁移到新芯片平台,远不止更换驱动这么简单,需要大规模重写底层代码,重新积累整套调优经验,这份高昂的迁移成本,才是英伟达最核心的护城河。 因此,在很长一段时间里,国产芯片面临的核心难题,并不是单卡性能差距,就算硬件性能追上来,开发者也不愿承担巨大成本完成迁移。 DeepSeek做了那件搬家的苦力活。 DeepSeek V4这次迁移的价值,不只是证明国产芯片可以跑大模型,而是验证了一件更重要的事,只要算法团队愿意投入深度重构的工程精力,高昂的跨平台迁移成本,是可以被攻克的。 V4并不是简单把CUDA代码转译后直接运行,而是基于CANN框架底层重新开发,这代表DeepSeek工程师深度吃透了华为的软件栈,而非被动等待软件栈去适配模型,这种做法过去并不多见,投入巨大,短期收益有限,但一旦跑通,就给出了一条可复制的路径,跨平台迁移成本很高,但会有团队愿意承担这份成本。 昇腾960的逻辑,不拼单卡,拼整机。 昇腾960超节点支持4096卡互联,走了一条和英伟达不一样的路线,英伟达侧重极致单卡跑分,昇腾的思路则是优先提升整套集群的系统效率,单卡性能存在差距,就依靠高速互联带宽与集群调度算法来弥补,这套思路的本质是,当单点硬件难以超越对手,就切换到新的维度展开竞争。 这套思路能否持续跑通,核心要看集群系统效率能否弥补单卡层面的差距,如果可以,行业竞争的评判维度就会发生变化,从单纯比拼单卡算力,转向比拼整套大集群的综合运行效率,在这套新规则下,CUDA的生态优势会被削弱,因为集群调度不完全依赖单个开发者的使用习惯。 卡脖子的,从来不只是芯片。 出口管制限制的是硬件出口,但长期阻碍国产芯片替代的,是开发者的生态惯性,行业早已习惯CUDA,更换平台意味着学习新软件栈,大规模重写代码,承担调试不确定性,这种生态惯性,影响力不亚于硬件出口管制,无需行政命令就能维持。 DeepSeek这次做的,是在这道生态惯性的厚墙上凿开了一道缝,缝隙不大,但透进来的光,足够让后来者看清一件事,这道墙并非不可翻越,只要有人迈出第一步,后面就会有更多团队跟进。
全部
来源
内容由AI生成

精选参考来源

1. 推上看到一个关于DeepSeek V5的帖子:DeepSeek V5 泄露:传闻已超越 Astra据传 DeepSeek 即将发布 V5。创始人梁文锋称这是公司迄今最大的一笔押注。传闻参数规模约 2 万亿(不是 3 万亿)。据称这是 DeepSeek 首个完全在华为昇腾芯片上训练、不再依赖英伟达的模型。要达到同等训练规模,昇腾卡用量大约是英伟达方案的 4 倍。 同时,DeepSeek 据传仍会继续开源权重。(但真实性存疑,主要是全部在华为芯片上训练,这个时间点有点儿科幻片)

2. 现在来看,黄仁勋之前作出的预测,十有八九是可能是对的,黄仁勋此前曾有过相关表述,倘若DeepSeek这类大模型跑在华为芯片之上,对美国而言将会是一个可怕的结果,当时不少人认为这是他为英伟达争取政策所作的表态,如今回头看,他的担忧并非空泛的说辞。 昇腾960超节点已经推出,单节点可搭载4096张卡,FP8算力达到8 EFLOPS,与此同时,DeepSeek V4完成了从CUDA向华为CANN框架的迁移,并非简单的API转译,而是在底层算子层面完成重写。 将这两件事放在一起看,早已不再是简单的谁卡谁脖子的对立叙事。 CUDA的护城河,并不是性能。 英伟达单卡性能确实强悍,但这并非它真正的壁垒,真正的壁垒是CUDA过去十几年积累的庞大生态,数百万开发者沉淀的函数库,完整的工具链,海量调优经验,大量开源项目,全都围绕CUDA搭建而成,一个团队想要迁移到新芯片平台,远不止更换驱动这么简单,需要大规模重写底层代码,重新积累整套调优经验,这份高昂的迁移成本,才是英伟达最核心的护城河。 因此,在很长一段时间里,国产芯片面临的核心难题,并不是单卡性能差距,就算硬件性能追上来,开发者也不愿承担巨大成本完成迁移。 DeepSeek做了那件搬家的苦力活。 DeepSeek V4这次迁移的价值,不只是证明国产芯片可以跑大模型,而是验证了一件更重要的事,只要算法团队愿意投入深度重构的工程精力,高昂的跨平台迁移成本,是可以被攻克的。 V4并不是简单把CUDA代码转译后直接运行,而是基于CANN框架底层重新开发,这代表DeepSeek工程师深度吃透了华为的软件栈,而非被动等待软件栈去适配模型,这种做法过去并不多见,投入巨大,短期收益有限,但一旦跑通,就给出了一条可复制的路径,跨平台迁移成本很高,但会有团队愿意承担这份成本。 昇腾960的逻辑,不拼单卡,拼整机。 昇腾960超节点支持4096卡互联,走了一条和英伟达不一样的路线,英伟达侧重极致单卡跑分,昇腾的思路则是优先提升整套集群的系统效率,单卡性能存在差距,就依靠高速互联带宽与集群调度算法来弥补,这套思路的本质是,当单点硬件难以超越对手,就切换到新的维度展开竞争。 这套思路能否持续跑通,核心要看集群系统效率能否弥补单卡层面的差距,如果可以,行业竞争的评判维度就会发生变化,从单纯比拼单卡算力,转向比拼整套大集群的综合运行效率,在这套新规则下,CUDA的生态优势会被削弱,因为集群调度不完全依赖单个开发者的使用习惯。 卡脖子的,从来不只是芯片。 出口管制限制的是硬件出口,但长期阻碍国产芯片替代的,是开发者的生态惯性,行业早已习惯CUDA,更换平台意味着学习新软件栈,大规模重写代码,承担调试不确定性,这种生态惯性,影响力不亚于硬件出口管制,无需行政命令就能维持。 DeepSeek这次做的,是在这道生态惯性的厚墙上凿开了一道缝,缝隙不大,但透进来的光,足够让后来者看清一件事,这道墙并非不可翻越,只要有人迈出第一步,后面就会有更多团队跟进。

3. 没人料到,黄仁勋半年前那句被全网嘲“卖惨要政策”的警告,如今正一步步变成现实。 当初所有人都觉得他是渲染中国AI威胁,帮英伟达游说放松芯片管制,可DeepSeek与华为的深度联手,直接戳破了所有预判——这根本不是退而求其次,是冲着改写全球算力格局来的。 今年4月黄仁勋在播客访谈里说出那句“灾难性的结果”,不少评论都觉得这是英伟达的老套路——当着美国媒体的面渲染中国威胁,本质是为了游说政府放松芯片出口管制,顺便给自己在中国市场的业绩下滑找个台阶。 毕竟在很多人的固有印象里,高端AI离了英伟达的GPU和CUDA生态,根本玩不转。国产芯片顶多做点边缘推理,撑不起顶级大模型。 可现实的进展,比所有人预想的都快。 就在黄仁勋说出这番话的一周后,DeepSeek正式发布新一代旗舰模型V4。几乎是同一时间,华为官方宣布,昇腾超节点全系列产品完成对DeepSeek V4的全栈适配。 不是简单的移植兼容,是从底层算子到训练框架的深度协同——DeepSeek把原本基于CUDA的代码重写到了华为自研的CANN架构上,从模型训练到推理部署,整条链路都能跑在华为昇腾芯片上。 要知道,这在以前是不可想象的。过去全球所有顶级大模型,无一例外都是先基于英伟达硬件做原生优化,其他平台只能后续慢慢移植。 但路透社当时就曝出细节,DeepSeek在V4发布前,根本没给英伟达和AMD提供早期访问权限,反而提前数周就和华为团队联调优化。 也就是说,从一开始,华为就不是“备选方案”,是DeepSeek的核心合作方。 很多人到现在还觉得,DeepSeek选华为是被制裁逼的,是退而求其次的无奈之举。可真看数据就知道,这根本不是凑活。 在8K输入的推理场景下,昇腾950超节点跑DeepSeek V4-Pro,单卡解码吞吐能到4700TPS,延迟控制在20毫秒。 对比英伟达合法销往中国的“阉割版”芯片,华为这套方案的多模态推理效率直接高出60%。 不止是性能够打,成本还更低,还支持万卡级别的集群扩展。对企业来说,这是实打实的最优解,不是妥协。 更重磅的信号还在后面。 近期业内传出消息,DeepSeek正在内蒙古建设大型数据中心,计划部署至少16万颗华为最新的昇腾950DT芯片。如果落地,这会是目前全球最大的国产AI芯片集群之一。 更关键的是,这批芯片不只是用来做推理,DeepSeek的目标是用它来训练下一代两万亿参数的大模型。这意味着,国产算力已经开始从推理端向训练端这个核心阵地渗透了。 这才是黄仁勋真正坐不住的原因。 他怕的从来不是少卖几张芯片,也不是丢了中国市场的几十亿收入。他怕的是CUDA的生态壁垒被撕开一道口子。 过去十几年,英伟达能垄断AI算力,靠的不只是芯片性能,更是整个CUDA软件生态——全球开发者默认用它写代码,所有大模型原生适配它,形成了牢不可破的网络效应。 哪怕你能做出性能差不多的芯片,没有软件生态,没人用也白搭。 可DeepSeek这种级别的开源模型,选择原生适配华为的硬件和框架,等于给全球所有AI开发者指了另一条路。 原来不用英伟达,不用CUDA,也能做出顶级大模型,而且效果还不错。 有第一个就会有第二个,当越来越多的模型开始做双平台适配,甚至原生优先适配国产架构,英伟达的护城河就会一点点被瓦解。 市场的反应已经很诚实了。这两年英伟达在中国AI芯片市场的份额,从巅峰时的95%一路跌到了50%,腾出的空间基本都被华为昇腾等国产厂商拿走。 专为中国市场定制的H20芯片,直接出现了45亿美元的库存减值。黄仁勋自己在8月的访谈里算过一笔账,如果中国市场全面转向国产算力,英伟达可能损失高达500亿美元。 回头看,黄仁勋当时的话哪里是在要政策,分明是站在行业之巅看到了趋势。他是做生态出身的,太清楚一个标杆性模型对硬件生态的拉动作用。 他说“对美国是可怕的结果”,站在他的立场上真不是夸张——一旦中国形成了从芯片、框架到模型的完整自主AI生态,就不再依赖美国的技术,甚至还会靠着开源模型把这套生态输出到全球。 这件事最讽刺的地方在于,美国当初升级芯片制裁,本意是想把中国的AI产业锁死在低端。 结果反倒成了国产算力最好的催化剂,逼着整个产业链拧成一股绳,从硬件到软件硬生生蹚出了一条路。 不是华为突然就超越了英伟达,而是封锁让市场不得不给国产芯片机会,让它有了迭代和成熟的土壤。 现在再看黄仁勋半年前的那句警告,已经不是预言,而是正在发生的事实。 DeepSeek和华为的联手,只是一个开始。 它标志着全球AI算力从一家独大,正式走向双轨并行的格局。黄仁勋的认真,不是因为他悲观,是因为他比大多数人都更清楚,生态的崩塌,往往就是从一个看似不起眼的选择开始的。

4. 黄仁勋怕的不止华为卡,而是DeepSeek改了默认技术栈

5. DeepSeek适配华为昇腾,国产AI算力生态迎来关键转折点

6. DeepSeek绑定华为!美国AI霸权被撕开缺口,终于看懂黄仁勋的预判

7. DeepSeek选华为,真的成为了英伟达的噩梦?

8. 现在来看,黄仁勋之前作出的预测,十有八九是对的。 黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。当时都以为他在帮英伟达要政策。现在看,他是认真的。 DeepSeek选华为,不是退而求其次,是强强联手。 今年4月15日,黄仁勋在一档播客专访里说了句很重的话:“如果DeepSeek先在华为平台上发布,那对我们国家来说将是灾难性的。”当时听着像危言耸听,结果仅仅9天之后,这话就应验了。 4月24日,DeepSeek V4正式发布,华为计算随即宣布昇腾超节点全系列产品全面支持DeepSeek V4。 更关键的是,DeepSeek在V4开发过程中,专门花了好几个月跟华为合作,把底层代码从依赖CUDA的技术路径,转向了华为自研的CANN生态。 这意味着什么?意味着一个中国最顶尖的大模型,至少在推理端,已经可以不依赖英伟达的卡了。 黄仁勋真正怕的不是少卖几块GPU。他自己在访谈里说得很清楚——“假设它是针对华为优化的,针对他们的架构优化了,那就会让我们处于劣势”。 说白了,英伟达的护城河从来不是芯片本身,而是CUDA生态。过去所有大模型都莫认在CUDA上做首发优化,华为也好、AMD也好,性能再接近也只能当备选。因为迁移成本太高,没人愿意重写代码。 但DeepSeek这次直接把优先期给了华为,确保V4在昇腾950上高效运行。 实侧数据也很能打:8K输入场景下,昇腾950超节点跑V4-Pro的单token解码时延约20毫秒,V4-Flash约10毫秒。适配的昇腾950PR推理芯片,单卡算力比英伟达对华特供的H20提升了2.87倍,采购价却只有四分之一。 所以DeepSeek选华为,真不是退而求其次,是强强联手。这件事戳破的,是“开源模型必须以CUDA为首要优化目标”这条默认规则。一旦这条规则被打破,就会有更多工程师、更多优化经验沉淀到非CUDA路径上。 黄仁勋自己都承认,英伟达在中国市场的份额已经从2024年的70%降到了2025年的55%。 说到底,黄仁勋的焦虑不是没有道理。他看到的不是一款芯片被替换,而是一整个生态开始有了第二条路可走。 #英伟达黄仁黄#

9. 现在来看,黄仁勋早前做出的预判,大概率是成立的。 黄仁勋曾经提到DeepSeek首次运行在华为芯片之上,对美国而言是个棘手的局面。那时候不少人觉得他是在为英伟达争取相关政策。如今再看,他所言发自内心。 DeepSeek选择华为,并非无奈之下的备选方案,而是双方强强协作。 很多人一开始都没看懂黄仁勋这句话背后的分量,只当成商界大佬常规的游说话术。大家猜测,他只是想借着这个说法,劝说美国放宽芯片出口限制,保住英伟达在中国的庞大市场。 直到DeepSeek V4正式亮相,所有人才反应过来,老黄担心的从来不是单一一款芯片性能的高低,而是持续二十年的CUDA生态根基,正在被撕开一道口子。 过去很长一段时间,全球所有前沿大模型,基本都是围绕英伟达CUDA框架开发。模型写代码、做训练、上线推理,全部绑定这套体系。这就形成了无形的行业规则,只要开发者还在CUDA生态里,美国就掌握AI产业的底层话语权。 一旦顶尖大模型从研发阶段,就原生适配华为昇腾,整套代码基于CANN框架重写,事情就完全不一样了。DeepSeek V4实现了Day0适配,模型发布当天,华为昇腾超节点就可以直接承载,从训练到推理实现全链路跑通。 这不是简单把已经做好的模型,挪到国产芯片上勉强运行。是在模型设计之初,就和硬件深度协同打磨,把算子、显存调度、多卡互联全部对齐昇腾架构。 最大的改变,是迁移成本的巨变。以前AI企业想脱离CUDA,重写底层代码往往要耗费数月甚至半年,门槛极高。DeepSeek打通这条路之后,后续其他模型厂商的适配周期会被大幅压缩。等于给整个国内AI行业,趟出一条可复制的脱离海外算力生态的路径。 DeepSeek本身的实力,决定这件事的影响会扩散到全球。V4预览版直接开源,海外开发者也能拿到这套基于昇腾优化的模型。全球的开发者会看到,顶级大模型可以不靠英伟达硬件稳定运行。 这才是黄仁勋口中可怕之处。当全球AI从业者发现,除了CUDA还有成熟稳定的备选方案,多年形成的技术锁定效应会慢慢松动。后续不少国家在建AI算力基础设施的时候,就会多出一个全新选择,不再只能绑定美国的芯片和软件栈。 当然,这个选择不是凭空出现的,外部芯片限制,倒逼国内算力和大模型企业走到一起。DeepSeek作为头部模型公司,不得不提前布局不受外部管控的算力底座。华为昇腾多年持续迭代,也终于具备承载万亿参数大模型的能力。二者相遇,是技术积累叠加现实环境催生出来的组合。 不少国内科技企业已经提前锁定昇腾芯片订单,准备接入这套新生态。国产AI服务器市场份额稳步上涨,产业链上下游开始形成正向循环。芯片出货越多,开发者越多,框架持续优化,反过来吸引更多模型落地。 但也要客观看待,这套新生态还处在成长阶段。对比CUDA数十年积累的工具、插件、开发者社区,昇腾的生态建设还有很长一段路要走。硬件的大规模集群通信、配套工具链,还有持续优化的空间,并不是一步就能追上成熟海外体系。 可行业的底层逻辑已经发生变化。从前大家默认,前沿大模型只能跑在英伟达的硬件上。现在已经证明,国产芯片加国产大模型,可以跑出世界第一梯队的产品。 这件事的意义,早已超出两家企业之间的合作。它给全球AI产业提供了另一条独立发展路线。不再是单一技术标准垄断全球算力市场。 黄仁勋看得很明白,芯片的性能差距还有追赶空间,但生态一旦形成,再想封锁就很难。当开源的顶尖模型,原生支持国产算力,美国靠芯片和软件生态掌握的AI话语权,就会被持续削弱。 现在,DeepSeek已经计划部署十几万颗昇腾芯片搭建大型AI集群,大规模商用落地已经提上日程。后续更多国产大模型,大概率会跟进原生适配昇腾。 英伟达的护城河不是一夜崩塌,但是最关键的那道裂缝,已经实实在在出现。黄仁勋当初那句警告,不是危言耸听,是他站在行业顶端,提前看见了AI产业格局的转向。#上头条 聊热点##MCN微头条伙伴计划#

10. 黄仁勋当年的预警正在兑现:DeepSeek牵手昇腾,比拼的早已不是单卡性能 黄仁勋此前有个判断,DeepSeek大模型成功在华为芯片上跑通,对美国而言是一个可怕的结果。在当时,不少人解读认为,这只是黄仁勋为英伟达争取政策、制造外部压力的说辞。但随着后续技术落地,回过头再看,会发现这并不是一句营销话术,而是对行业格局的真实预警。 很多人容易陷入一个误区:DeepSeek选择华为昇腾芯片,是在没有英伟达GPU情况下的退而求其次。实际上这是一次优势互补的强强联手。两家的核心能力刚好形成互补:DeepSeek的核心优势在于算法层,具备极高的算力利用率,可以把硬件的每一份算力潜力充分挖掘出来;华为的强项,则是底层集群系统能力,能够实现上万张芯片的互联调度,把海量的算力节点整合为统一的算力池。简单概括就是,一方擅长精打细算、榨干算力,一方擅长大规模集群组网、堆叠算力,二者结合,目标就是实现有效算力最大化。 不可否认,英伟达单卡的硬件性能依旧很强,单卡跑分具备明显优势。但DeepSeek搭配昇腾这套方案,比拼的维度早就跳出了单卡性能的赛道。 单卡性能对比,好比单兵武器比拼;而大模型训练,考验的是大规模集团军协同作战。哪怕对方一张卡性能抵得上我方三张,但是如果集群调度、算法优化到位,十张卡协同完成的任务,完全有可能对标对方三张高性能卡的产出。最终的胜负,不是单卡参数决定,而是整套软硬件体系综合效率的比拼。 黄仁勋真正担心的,从来不是某一款国产芯片的性能追赶,而是一套脱离CUDA生态的完整技术闭环被成功跑通。一旦国内形成“算法团队开发模型、本土芯片制造、国产系统搭建集群”的完整链条,就意味着原有生态壁垒被打破。过去依靠软件生态形成的“卡脖子”优势,效力会大幅下降。 这次合作本质上是双向奔赴、各取所需:DeepSeek需要稳定、大规模的算力资源作为训练“子弹”;华为昇腾生态,需要头部大模型企业落地验证,拿到真实场景的大规模商用案例,也就是需要一块检验技术能力的“靶场”。这不是弱势企业抱团取暖,而是供需匹配下的协同共赢。 昇腾960超节点,单节点可容纳4096张芯片,这个硬件组网能力不是概念口号,是实实在在落地的工程能力。美国的限制手段,聚焦在高端芯片出口层面;而国内产业的破局思路,重心放在整套软硬件系统的重构。限制的是单颗芯片,而我们在探索全新的集群与算法协同路径,这正是黄仁勋当年预警背后的核心逻辑。 强强联合带来的价值,远不是简单的一加一等于二。DeepSeek擅长算法攻坚,相当于前线的攻坚力量;华为擅长搭建稳定庞大的算力底座,相当于后方稳固的后勤与阵地。大模型赛道竞争走到更深阶段,比拼的不只是短期技术爆发力,更是长期的产业家底、持续迭代能力和完整产业链韧性。 当然也要客观看待:国产算力生态还处在持续完善阶段,大规模集群长期稳定运行、软件工具链丰富度,距离成熟的CUDA生态依然还有不小差距。技术突破不是一蹴而就,产业闭环仍需要大量项目持续打磨验证。但不可否认,这条独立于海外体系之外的技术路线,已经完成关键的落地验证。 黄仁勋当初的预警,不是刻意的恐吓,而是基于行业视角做出的理性判断。如今,这个预警正在一步步变成现实。算力赛道的竞争,已经从单芯片硬件竞赛,升级为全栈体系的长期博弈。 本文仅为行业技术动态客观解读,不构成任何投资建议,科技行业技术迭代快,存在不确定性风险。 #AI算力 #昇腾芯片 #DeepSeek #英伟达 #科技观察

11. DeepSeek选择华为,对美国是可怕结果,看完终于读懂黄仁勋

12. 现在来看,黄仁勋之前作出的预测,十有八九是对的。 黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。当时都以为他在帮英伟达要政策。现在看,他是认真的。黄仁勋上了一档播客。主持人拿浓缩铀打比方,说算力卖给中国等于帮对手。老黄直接怼了回去。 紧接着他说了一句话——如果DeepSeek先在华为平台上跑起来,对美国来说将是灾难性的。九天之后,DeepSeek V4发布。华为昇腾超节点全系列同步支持。技术报告里第一次把华为昇腾和英伟达的GPU写进了同一份硬件验证清单。 事情就这么发生了。过去十多年,全球大模型的开发有一个默认习惯:新东西先在英伟达的CUDA上跑通,其他硬件平台只能排队等适配。这不是英伟达GPU本身有多强,是所有人已经习惯了以CUDA为起点。 换平台意味着重写代码、重做精度校准、重新调参数,工程代价按月算。久而久之,CUDA就成了行业里不用明说的一条规矩。 DeepSeek V4把这条规矩破了。开发过程中花了几个月跟华为协作,重写底层代码,从CUDA路径迁到华为的CANN框架。 技术报告里写得清楚:细粒度专家并行方案在英伟达GPU和华为昇腾NPU两个平台上都做了验证。 跑出来的数据也不含糊。昇腾950超节点上,V4-Pro单token解码时延约20毫秒,V4-Flash约10毫秒。 之前深圳河套的团队用昇腾910C集群完成了1.6万亿参数V4-Pro的监督微调,算力利用率超过30%。这个数字放在国产芯片的大模型训练场景里,以前很少见。 成本方面,适配的昇腾推理芯片采购价只有英伟达的四分之一,单卡算力比英伟达对华特供版高出2.87倍。 再看英伟达那边的数据。黄仁勋自己在2025年10月说过,英伟达在中国先进芯片市场的份额已经从95%降到了0%。英伟达CFO在财报电话会上确认,当季中国区数据中心计算收入为零,而去年同期是46亿美元。 黄仁勋真正在意的,不是某一款芯片被换掉。他在意的是“大模型默认以CUDA为首要优化起点”这条规矩,第一次被一个顶级开源模型公开打破了。一旦这条路径被更多开发者走通,英伟达在AI算力领域的位置就会慢慢松动。#上头条 聊热点##MCN微头条伙伴计划#

13. 如今回头看,黄仁勋早前作出的预判,十有八九是准的。 黄仁勋此前称DeepSeek首次跑通华为芯片,对美国是个糟糕的结果。当时都觉得他在替英伟达要政策支持。现在看来,他是当真的。 今年4月DeepSeek发布V4系列大模型,同步宣布完成华为昇腾芯片的原生适配,不是后期简单的兼容移植,是从模型研发阶段就针对昇腾的硬件架构做了底层代码优化。 华为方面也公开了实测数据,在8K输入的场景下,昇腾950超节点运行对应模型,首字输出的延迟能控制在二十毫秒左右,这个表现已经能满足绝大多数商用场景的需求。 放在以前,国产大模型的开发路线都是先适配英伟达芯片,等模型稳定了再慢慢做国产芯片的适配工作,优先级差了好几个等级。 这次DeepSeek把国产芯片的适配放到了首发位置,说明国产算力的成熟度已经跨过了关键门槛,不再是只能凑合用的备胎,而是能支撑旗舰级大模型的主力选项。 更关键的是,模型厂商愿意投入人力物力做原生优化,意味着开发者群体开始向国产芯片生态流动,这才是英伟达最在意的地方。 英伟达能垄断全球AI芯片市场,靠的不只是芯片性能,更是CUDA软件生态积累了三十年的开发者资源,大家都基于这个体系做开发,换平台的成本极高,形成了很强的锁定效应。 一旦有越来越多的开发者习惯在国产算力平台上做研发,这层壁垒就会慢慢松动,而且一旦松动就很难再恢复。 顺着技术的信号往下看,整个产业的采购逻辑也在悄悄转向。 华尔街日报此前的报道也提到,国内头部云厂商和大模型公司的高管,采购思路已经发生了根本变化。 前几年采购算力,英伟达芯片是毫无疑问的首选,国产芯片最多放在备选清单里应急。 现在不一样了,国产芯片直接进入了顶层算力集群的评估名单,很多新项目都会同时做两套方案,一套用英伟达,一套用国产芯片,甚至有些场景直接就用国产方案。 出现这种转变不只是因为供应链安全的考虑,更是因为国产芯片的实际表现已经能打。 除了华为昇腾,寒武纪、海光等多家厂商的产品都完成了主流大模型的适配,在推理等特定场景下,性价比甚至比进口芯片更高。 企业算的是实在账,既能满足业务需求,又不用担心中途断供,价格还更划算,自然愿意转向国产算力。 黄仁勋担心的也正是这点,当市场上出现了第二个可行的算力体系,客户就有了选择权,英伟达的定价权和市场份额都会受到冲击。 当然,黄仁勋公开说这番话,也不全是出于焦虑,背后也有他自己的商业考量。 一方面是借中国的技术进展向美国政府施压,告诉管制派一味限制只会适得其反,不如放开更多产品出口,英伟达还能保住中国市场的份额。 毕竟中国是全球最大的AI算力市场之一,每年给英伟达贡献不少收入,真的完全丢掉,对英伟达的业绩影响很大。 另一方面,他也是在向行业传递一个信号,承认华为等中国企业的技术实力,不做极端的对抗,保留未来合作的空间。 英伟达在中国发展了三十年,和很多中国企业都有合作基础,他很清楚中国市场的潜力和中国企业的执行力,真的逼到完全脱钩,对谁都没好处。 顺着这个趋势往下走,接下来的行业格局会出现几个明显的变化。 首先是国产算力生态的完善速度会越来越快,现在已经有头部大模型带头适配,后面会有更多的应用厂商、软件开发者跟进,形成芯片越做越好、适配的软件越来越多、用户越来越愿意用的正向循环。 其次是美国的对华芯片政策可能会出现摇摆,美国科技产业界反对极端管制的声音会越来越多,英伟达这类企业会加大游说力度,争取让更多中高端芯片进入中国市场,政策可能会在收紧和放松之间来回调整。 最后是全球AI算力市场会慢慢从一家独大走向双轨并行,中国的算力体系不光能满足国内需求,还可能逐步向其他国家输出,给全球市场多一个选择,不再是英伟达说了算。 对国内的AI产业来说,这当然是实打实的利好。 整个产业链的自主可控程度更高了,从底层芯片到上层模型再到下游应用,慢慢都能实现闭环,不会因为外部的制裁就停摆。 随着国产算力的规模起来,成本还会逐步下降,各行各业落地AI的门槛会更低,不管是工厂、医院还是普通中小企业,都能用得起AI工具,带动整体的效率提升。 但也要清醒看到,我们还有不少短板要补。 高端芯片的制造工艺和国际最先进水平还有差距,生态的完善也不是一朝一夕的事,需要更多企业参与进来,持续投入研发。 同时还要警惕美国出台更极端的管制措施,比如从限制硬件转向限制算法、软件和技术交流,我们得提前做好应对预案,把核心技术牢牢掌握在自己手里,才能走得更稳更远。 #上头条 聊热点##锐领航权益升级#

14. 黄仁勋当初的预判,如今一步步兑现,DeepSeek加华为不是简单搭配 现在来看,黄仁勋之前作出的预判,十有八九是对的。 黄仁勋此前在播客里提到,如果DeepSeek下一代模型率先在华为芯片平台发布,对美国会是可怕的结果。当时不少人认为,他只是借着这个说法推动相关政策诉求。结合后续落地情况再看,他的判断具备现实依据。 DeepSeek选择华为算力底座,并不是硬件受限之下的被动妥协,而是双方基于各自优势开展的协同。 DeepSeek的核心优势集中在算法层面,能够充分挖掘硬件算力资源,把可用算力的利用率做到更高。华为的强项在于整套算力集群系统,可以完成大规模卡组的协同调度,把数千张NPU整合为统一的计算资源。一边擅长算法优化,一边深耕集群系统搭建。两套能力叠加,目标就是把整体有效算力做到最大化。 英伟达单卡硬件性能确实处于行业第一梯队。但DeepSeek搭配华为昇腾这套组合,比拼的并不是单卡跑分数据,而是完整系统的运行效率。单卡性能差距,可以依靠集群规模与算法调优去弥补,大规模集群场景下,最终的产出结果还有很大变数。 黄仁勋真正担心的,不是单颗昇腾芯片本身,而是一套脱离CUDA生态的完整技术路径。模型算法有团队持续迭代,国产芯片实现量产落地,大规模算力集群系统可以完成搭建。这条技术链路一旦稳定跑通,外部技术限制带来的影响就会被持续削弱。 DeepSeek需要稳定充足的算力资源支撑模型迭代,华为需要前沿大模型完成算力平台的验证。一方需要算力载体,一方需要真实的业务场景做验证。这不是简单抱团取暖,双方各有诉求,也各有可以给到对方的价值。 昇腾960超节点,架构最大可扩展至4096张NPU。参数规格来自华为官方发布,不是口头宣传。 外部限制手段聚焦在芯片硬件层面,国内产业探索的突破口落在整套算力系统。黄仁勋当初的表态,不属于刻意制造恐慌,而是对产业趋势做出的预判。 如今这份预判已经逐步兑现。 强强协同,效果不会局限于简单的能力叠加。一方打磨模型能力,一方筑牢算力底座。长期竞争,比拼的还是产业持续投入与技术积累的厚度。

15. 现在来看,黄仁勋之前作出的预测,十有八九是对的。 黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。当时都以为他在帮英伟达要政策。现在看,他是认真的。 DeepSeek选华为,不是退而求其次,是强强联手。 DeepSeek强在算法,能把每一分算力榨出油。华为强在系统,能把一万张卡拧成一股绳。一个会省,一个能堆。凑在一起,就是有效算力最大化。 英伟达单卡确实强。但DeepSeek加华为,拼的不是单卡跑分,是系统效率。你一张卡顶我三张,我十张卡干你三张卡的活,最后谁赢不一定。 黄仁勋怕的不是一张华为芯片,是一套不依赖CUDA的活法。算法有人做,芯片有人造,系统有人搭。这个闭环一旦跑通,卡脖子就卡不住了。 DeepSeek需要算力,华为需要证明自己。一个要子弹,一个要靶场。这不是抱团取暖,是各取所需。 昇腾960超节点,单节点4096张卡。数字摆在这,不是喊口号。 美国卡的是芯片,中国绕的是系统。黄仁勋那句警告,不是恐吓,是预警。 现在预警成真了。 强强联手,不是一加一等于二。是一个会打,一个能扛。打到最后,拼的是谁家底厚。

16. 彭博社报道(真假难辨),DeepSeek据称已向华为订购16万颗昇腾950DT芯片,每颗昇腾950DT芯片的售价约为11.1万元人民币,用于其位于内蒙古的新建1GW数据中心。阿里巴巴、字节跳动和腾讯已对华晶片下达大规模订单,总量达数十万枚。 昇腾依托达芬奇架构、灵衢互联与CANN全栈体系,在国内大规模AI推理集群具备显著优势。 短板集中在CANN生态成熟度不足,先进制程、HBM产能存在供给约束。 当前国内格局:昇腾主打推理算力替代,与英伟达形成训推混合部署,领先国内其他AI芯片厂商。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章