DeepSeek开源昇腾全套组件,代码无需重写直接平替英伟达

源自177位全网作者

09-30 20:56

精选参考来源

1
DeepSeek豪掷180亿买华为芯片,这账算得比谁都清醒。在美国把算力当“断头台”用的背景下,这25.6亿美元的订单不仅是买硬件,更是买一张不被随意收割的入场券。16万颗昇腾950DT,哪怕要等一年以上交付,DeepSeek也认了。这种“死磕”背后,是对全球零和博弈最冷静的回应。很多人觉得国产芯片不行,但DeepSeek选择用推理侧先扛起来。训练可以靠囤积的英伟达,但日常庞大的API调用必须有自己的基本盘。乌兰察布的吉瓦级数据中心一旦转起来,就是从“试探性适配”到“规模化押注”的质变。这世界上的事,凡是想垄断的,往往是想收智商税的。当所有人都被英伟达的生态绑架时,愿意花时间去陪国产供应链爬坡,才是真正具备独立人格的商业决策。别被那些唱衰国产算力的节奏带偏,保持清醒,才能在技术突围里守住那点不被卡脖子的自由。#彭博报道DeepSeek国产算力集群#
2
现在来看,黄仁勋之前作出的预测,十有八九是对的。 黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。当时都以为他在帮英伟达要政策。现在看,他是认真的。 DeepSeek选华为,不是退而求其次,是强强联手。 今年4月15日,黄仁勋在一档播客专访里说了句很重的话:“如果DeepSeek先在华为平台上发布,那对我们国家来说将是灾难性的。”当时听着像危言耸听,结果仅仅9天之后,这话就应验了。 4月24日,DeepSeek V4正式发布,华为计算随即宣布昇腾超节点全系列产品全面支持DeepSeek V4。 更关键的是,DeepSeek在V4开发过程中,专门花了好几个月跟华为合作,把底层代码从依赖CUDA的技术路径,转向了华为自研的CANN生态。 这意味着什么?意味着一个中国最顶尖的大模型,至少在推理端,已经可以不依赖英伟达的卡了。 黄仁勋真正怕的不是少卖几块GPU。他自己在访谈里说得很清楚——“假设它是针对华为优化的,针对他们的架构优化了,那就会让我们处于劣势”。 说白了,英伟达的护城河从来不是芯片本身,而是CUDA生态。过去所有大模型都莫认在CUDA上做首发优化,华为也好、AMD也好,性能再接近也只能当备选。因为迁移成本太高,没人愿意重写代码。 但DeepSeek这次直接把优先期给了华为,确保V4在昇腾950上高效运行。 实侧数据也很能打:8K输入场景下,昇腾950超节点跑V4-Pro的单token解码时延约20毫秒,V4-Flash约10毫秒。适配的昇腾950PR推理芯片,单卡算力比英伟达对华特供的H20提升了2.87倍,采购价却只有四分之一。 所以DeepSeek选华为,真不是退而求其次,是强强联手。这件事戳破的,是“开源模型必须以CUDA为首要优化目标”这条默认规则。一旦这条规则被打破,就会有更多工程师、更多优化经验沉淀到非CUDA路径上。 黄仁勋自己都承认,英伟达在中国市场的份额已经从2024年的70%降到了2025年的55%。 说到底,黄仁勋的焦虑不是没有道理。他看到的不是一款芯片被替换,而是一整个生态开始有了第二条路可走。 #英伟达黄仁黄#
全部
来源
内容由AI生成

精选参考来源

1. DeepSeek豪掷180亿买华为芯片,这账算得比谁都清醒。在美国把算力当“断头台”用的背景下,这25.6亿美元的订单不仅是买硬件,更是买一张不被随意收割的入场券。16万颗昇腾950DT,哪怕要等一年以上交付,DeepSeek也认了。这种“死磕”背后,是对全球零和博弈最冷静的回应。很多人觉得国产芯片不行,但DeepSeek选择用推理侧先扛起来。训练可以靠囤积的英伟达,但日常庞大的API调用必须有自己的基本盘。乌兰察布的吉瓦级数据中心一旦转起来,就是从“试探性适配”到“规模化押注”的质变。这世界上的事,凡是想垄断的,往往是想收智商税的。当所有人都被英伟达的生态绑架时,愿意花时间去陪国产供应链爬坡,才是真正具备独立人格的商业决策。别被那些唱衰国产算力的节奏带偏,保持清醒,才能在技术突围里守住那点不被卡脖子的自由。#彭博报道DeepSeek国产算力集群#

2. 现在来看,黄仁勋之前作出的预测,十有八九是对的。 黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。当时都以为他在帮英伟达要政策。现在看,他是认真的。 DeepSeek选华为,不是退而求其次,是强强联手。 今年4月15日,黄仁勋在一档播客专访里说了句很重的话:“如果DeepSeek先在华为平台上发布,那对我们国家来说将是灾难性的。”当时听着像危言耸听,结果仅仅9天之后,这话就应验了。 4月24日,DeepSeek V4正式发布,华为计算随即宣布昇腾超节点全系列产品全面支持DeepSeek V4。 更关键的是,DeepSeek在V4开发过程中,专门花了好几个月跟华为合作,把底层代码从依赖CUDA的技术路径,转向了华为自研的CANN生态。 这意味着什么?意味着一个中国最顶尖的大模型,至少在推理端,已经可以不依赖英伟达的卡了。 黄仁勋真正怕的不是少卖几块GPU。他自己在访谈里说得很清楚——“假设它是针对华为优化的,针对他们的架构优化了,那就会让我们处于劣势”。 说白了,英伟达的护城河从来不是芯片本身,而是CUDA生态。过去所有大模型都莫认在CUDA上做首发优化,华为也好、AMD也好,性能再接近也只能当备选。因为迁移成本太高,没人愿意重写代码。 但DeepSeek这次直接把优先期给了华为,确保V4在昇腾950上高效运行。 实侧数据也很能打:8K输入场景下,昇腾950超节点跑V4-Pro的单token解码时延约20毫秒,V4-Flash约10毫秒。适配的昇腾950PR推理芯片,单卡算力比英伟达对华特供的H20提升了2.87倍,采购价却只有四分之一。 所以DeepSeek选华为,真不是退而求其次,是强强联手。这件事戳破的,是“开源模型必须以CUDA为首要优化目标”这条默认规则。一旦这条规则被打破,就会有更多工程师、更多优化经验沉淀到非CUDA路径上。 黄仁勋自己都承认,英伟达在中国市场的份额已经从2024年的70%降到了2025年的55%。 说到底,黄仁勋的焦虑不是没有道理。他看到的不是一款芯片被替换,而是一整个生态开始有了第二条路可走。 #英伟达黄仁黄#

3. 现在来看,黄仁勋之前作出的预测,十有八九是对的。 黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。当时都以为他在帮英伟达要政策。现在看,他是认真的。黄仁勋上了一档播客。主持人拿浓缩铀打比方,说算力卖给中国等于帮对手。老黄直接怼了回去。 紧接着他说了一句话——如果DeepSeek先在华为平台上跑起来,对美国来说将是灾难性的。九天之后,DeepSeek V4发布。华为昇腾超节点全系列同步支持。技术报告里第一次把华为昇腾和英伟达的GPU写进了同一份硬件验证清单。 事情就这么发生了。过去十多年,全球大模型的开发有一个默认习惯:新东西先在英伟达的CUDA上跑通,其他硬件平台只能排队等适配。这不是英伟达GPU本身有多强,是所有人已经习惯了以CUDA为起点。 换平台意味着重写代码、重做精度校准、重新调参数,工程代价按月算。久而久之,CUDA就成了行业里不用明说的一条规矩。 DeepSeek V4把这条规矩破了。开发过程中花了几个月跟华为协作,重写底层代码,从CUDA路径迁到华为的CANN框架。 技术报告里写得清楚:细粒度专家并行方案在英伟达GPU和华为昇腾NPU两个平台上都做了验证。 跑出来的数据也不含糊。昇腾950超节点上,V4-Pro单token解码时延约20毫秒,V4-Flash约10毫秒。 之前深圳河套的团队用昇腾910C集群完成了1.6万亿参数V4-Pro的监督微调,算力利用率超过30%。这个数字放在国产芯片的大模型训练场景里,以前很少见。 成本方面,适配的昇腾推理芯片采购价只有英伟达的四分之一,单卡算力比英伟达对华特供版高出2.87倍。 再看英伟达那边的数据。黄仁勋自己在2025年10月说过,英伟达在中国先进芯片市场的份额已经从95%降到了0%。英伟达CFO在财报电话会上确认,当季中国区数据中心计算收入为零,而去年同期是46亿美元。 黄仁勋真正在意的,不是某一款芯片被换掉。他在意的是“大模型默认以CUDA为首要优化起点”这条规矩,第一次被一个顶级开源模型公开打破了。一旦这条路径被更多开发者走通,英伟达在AI算力领域的位置就会慢慢松动。#上头条 聊热点##MCN微头条伙伴计划#

4. 没人料到,黄仁勋半年前那句被全网嘲“卖惨要政策”的警告,如今正一步步变成现实。 当初所有人都觉得他是渲染中国AI威胁,帮英伟达游说放松芯片管制,可DeepSeek与华为的深度联手,直接戳破了所有预判——这根本不是退而求其次,是冲着改写全球算力格局来的。 今年4月黄仁勋在播客访谈里说出那句“灾难性的结果”,不少评论都觉得这是英伟达的老套路——当着美国媒体的面渲染中国威胁,本质是为了游说政府放松芯片出口管制,顺便给自己在中国市场的业绩下滑找个台阶。 毕竟在很多人的固有印象里,高端AI离了英伟达的GPU和CUDA生态,根本玩不转。国产芯片顶多做点边缘推理,撑不起顶级大模型。 可现实的进展,比所有人预想的都快。 就在黄仁勋说出这番话的一周后,DeepSeek正式发布新一代旗舰模型V4。几乎是同一时间,华为官方宣布,昇腾超节点全系列产品完成对DeepSeek V4的全栈适配。 不是简单的移植兼容,是从底层算子到训练框架的深度协同——DeepSeek把原本基于CUDA的代码重写到了华为自研的CANN架构上,从模型训练到推理部署,整条链路都能跑在华为昇腾芯片上。 要知道,这在以前是不可想象的。过去全球所有顶级大模型,无一例外都是先基于英伟达硬件做原生优化,其他平台只能后续慢慢移植。 但路透社当时就曝出细节,DeepSeek在V4发布前,根本没给英伟达和AMD提供早期访问权限,反而提前数周就和华为团队联调优化。 也就是说,从一开始,华为就不是“备选方案”,是DeepSeek的核心合作方。 很多人到现在还觉得,DeepSeek选华为是被制裁逼的,是退而求其次的无奈之举。可真看数据就知道,这根本不是凑活。 在8K输入的推理场景下,昇腾950超节点跑DeepSeek V4-Pro,单卡解码吞吐能到4700TPS,延迟控制在20毫秒。 对比英伟达合法销往中国的“阉割版”芯片,华为这套方案的多模态推理效率直接高出60%。 不止是性能够打,成本还更低,还支持万卡级别的集群扩展。对企业来说,这是实打实的最优解,不是妥协。 更重磅的信号还在后面。 近期业内传出消息,DeepSeek正在内蒙古建设大型数据中心,计划部署至少16万颗华为最新的昇腾950DT芯片。如果落地,这会是目前全球最大的国产AI芯片集群之一。 更关键的是,这批芯片不只是用来做推理,DeepSeek的目标是用它来训练下一代两万亿参数的大模型。这意味着,国产算力已经开始从推理端向训练端这个核心阵地渗透了。 这才是黄仁勋真正坐不住的原因。 他怕的从来不是少卖几张芯片,也不是丢了中国市场的几十亿收入。他怕的是CUDA的生态壁垒被撕开一道口子。 过去十几年,英伟达能垄断AI算力,靠的不只是芯片性能,更是整个CUDA软件生态——全球开发者默认用它写代码,所有大模型原生适配它,形成了牢不可破的网络效应。 哪怕你能做出性能差不多的芯片,没有软件生态,没人用也白搭。 可DeepSeek这种级别的开源模型,选择原生适配华为的硬件和框架,等于给全球所有AI开发者指了另一条路。 原来不用英伟达,不用CUDA,也能做出顶级大模型,而且效果还不错。 有第一个就会有第二个,当越来越多的模型开始做双平台适配,甚至原生优先适配国产架构,英伟达的护城河就会一点点被瓦解。 市场的反应已经很诚实了。这两年英伟达在中国AI芯片市场的份额,从巅峰时的95%一路跌到了50%,腾出的空间基本都被华为昇腾等国产厂商拿走。 专为中国市场定制的H20芯片,直接出现了45亿美元的库存减值。黄仁勋自己在8月的访谈里算过一笔账,如果中国市场全面转向国产算力,英伟达可能损失高达500亿美元。 回头看,黄仁勋当时的话哪里是在要政策,分明是站在行业之巅看到了趋势。他是做生态出身的,太清楚一个标杆性模型对硬件生态的拉动作用。 他说“对美国是可怕的结果”,站在他的立场上真不是夸张——一旦中国形成了从芯片、框架到模型的完整自主AI生态,就不再依赖美国的技术,甚至还会靠着开源模型把这套生态输出到全球。 这件事最讽刺的地方在于,美国当初升级芯片制裁,本意是想把中国的AI产业锁死在低端。 结果反倒成了国产算力最好的催化剂,逼着整个产业链拧成一股绳,从硬件到软件硬生生蹚出了一条路。 不是华为突然就超越了英伟达,而是封锁让市场不得不给国产芯片机会,让它有了迭代和成熟的土壤。 现在再看黄仁勋半年前的那句警告,已经不是预言,而是正在发生的事实。 DeepSeek和华为的联手,只是一个开始。 它标志着全球AI算力从一家独大,正式走向双轨并行的格局。黄仁勋的认真,不是因为他悲观,是因为他比大多数人都更清楚,生态的崩塌,往往就是从一个看似不起眼的选择开始的。

5. 现在来看,黄仁勋之前作出的预测,十有八九是对的。 他说DeepSeek首次跑在华为芯片上对美国是个可怕的结果,很多人第一反应是这老哥又在帮英伟达要政策,想借着渲染中国威胁让美国政府松松出口管制的口子。 但我认为,黄仁勋说那番话的时候,是认真的,他看到的是一盘正在落子的棋局。 黄仁勋的原话分量很重,他说如果DeepSeek的新一代模型率先在华为芯片平台发布,对美国而言将是灾难性的后果。 这话乍一听像在替英伟达叫苦,但仔细琢磨,他真正怕的从来不是某一块芯片被替代,而是“开源模型必须以英伟达CUDA为首要优化目标”这条默认规则被撕开一个口子。 过去这么多年,全球主流大模型基本上都是先在CUDA生态里调通跑顺,其他硬件平台哪怕纸面性能不差,也只能当备胎,因为迁移意味着重写算子、重新调参,工程代价太大。 这个逻辑一旦被打破,英伟达真正的护城河,也就是CUDA作为事实标准的生态位,就会开始松动。 后来的事情发展,几乎把黄仁勋的担忧一条一条验证了。DeepSeek-V4上线的时候,技术报告封面上印了两行字,英伟达GPU和华为昇腾NPU并列写进了硬件验证清单。更关键的是,底层代码从CUDA重写到了华为自研的CANN框架。 这意味着DeepSeek不是随便找个国产芯片来凑合跑一下,而是从头到尾针对华为的架构做了深度优化。 在我看来,这就是黄仁勋嘴里那个“灾难性后果”的真正含义,一款顶尖的开源大模型,在一个非美国技术栈上跑出了最优表现,那么其他开发者再选硬件的时候,CUDA就不再是唯一答案了。 有人可能会说,华为单卡性能不是还差着英伟达好几倍吗,这有什么好怕的。单卡算力确实还有差距,华为昇腾910C的单卡FP16算力大约800TFLOPS,跟英伟达Blackwell旗舰比确实不在一个量级。 但我觉得,黄仁勋自己早就把这个问题想明白了,他公开讲过人工智能是一个并行问题,如果每台计算机性能不够强,那就用更多的计算机。 华为走的就是这条路,用系统工程层面的群体战术来弥补单卡差距。实际数据也说明问题,在DeepSeek-R1模型的评估中,华为CloudMatrix384超级节点上的昇腾910C,计算效率超过了英伟达H800。 而且华为昇腾950PR芯片的单卡算力达到了英伟达对华特供版H20的近三倍,采购价格却只有四分之一。性能和成本两头都占优,这才是让对手真正难受的地方。 我觉得最值得玩味的是,这件事发生的时间节点恰好卡在美国对华为芯片出口管制不断加码的背景下。美国商务部之前发过指引,说在全球任何地方使用华为昇腾芯片都可能违反出口管制规定。 这种打压的力度不可谓不大,但结果呢,DeepSeek照样把华为芯片写进了首发验证清单。ITIF的报告说得很直白,美国滥用出口管制反而帮华为变成了更强大的竞争对手,2021年到2024年美国公司因为对华为的限制至少损失了330亿美元的销售额。 我认为这就是典型的搬起石头砸自己的脚,你想卡住别人的脖子,别人反而被逼出了替代方案,而且这个替代方案一旦跑通,就再也回不去了。 黄仁勋自己后来也说了大实话,他承认英伟达在中国先进芯片市场的份额从95%跌到了零,中国已经不想要美国的芯片了。一个全球市值最高的芯片公司掌门人,亲口说出这种话,足以说明问题的严重性。 他还批评过美国针对中国的极端芯片出口管制十分幼稚,认为人为割裂出两套AI生态系统极其愚蠢。 这些话放在当时听,像是替中国市场说话,现在回头看,他其实是在替英伟达自己算账,因为一旦中国顶尖大模型和国产算力基座完成绑定,美国长期推行的芯片封锁就失去了最关键的抓手。 在我看来,DeepSeek选华为,压根就不是什么退而求其次的备胎方案,而是两个各自领域顶尖的选手主动走到了一起。字节跳动、腾讯、阿里巴巴在DeepSeek-V4发布后开始抢购华为国产芯片,国产芯片在中国AI加速服务器市场的份额已经攀升到了约41%。 这组数字背后是整个产业链在动,不是个别企业的临时选择。我觉得黄仁勋当初说那番话的时候,心里已经看到了今天这个局面,只不过当时大多数人以为他在帮英伟达要政策,现在才发现,他是在认真地预警一个正在到来的事实。#MCN微头条伙伴计划#

6. 现在来看,黄仁勋早前做出的预判,大概率是成立的。 黄仁勋曾经提到DeepSeek首次运行在华为芯片之上,对美国而言是个棘手的局面。那时候不少人觉得他是在为英伟达争取相关政策。如今再看,他所言发自内心。 DeepSeek选择华为,并非无奈之下的备选方案,而是双方强强协作。 很多人一开始都没看懂黄仁勋这句话背后的分量,只当成商界大佬常规的游说话术。大家猜测,他只是想借着这个说法,劝说美国放宽芯片出口限制,保住英伟达在中国的庞大市场。 直到DeepSeek V4正式亮相,所有人才反应过来,老黄担心的从来不是单一一款芯片性能的高低,而是持续二十年的CUDA生态根基,正在被撕开一道口子。 过去很长一段时间,全球所有前沿大模型,基本都是围绕英伟达CUDA框架开发。模型写代码、做训练、上线推理,全部绑定这套体系。这就形成了无形的行业规则,只要开发者还在CUDA生态里,美国就掌握AI产业的底层话语权。 一旦顶尖大模型从研发阶段,就原生适配华为昇腾,整套代码基于CANN框架重写,事情就完全不一样了。DeepSeek V4实现了Day0适配,模型发布当天,华为昇腾超节点就可以直接承载,从训练到推理实现全链路跑通。 这不是简单把已经做好的模型,挪到国产芯片上勉强运行。是在模型设计之初,就和硬件深度协同打磨,把算子、显存调度、多卡互联全部对齐昇腾架构。 最大的改变,是迁移成本的巨变。以前AI企业想脱离CUDA,重写底层代码往往要耗费数月甚至半年,门槛极高。DeepSeek打通这条路之后,后续其他模型厂商的适配周期会被大幅压缩。等于给整个国内AI行业,趟出一条可复制的脱离海外算力生态的路径。 DeepSeek本身的实力,决定这件事的影响会扩散到全球。V4预览版直接开源,海外开发者也能拿到这套基于昇腾优化的模型。全球的开发者会看到,顶级大模型可以不靠英伟达硬件稳定运行。 这才是黄仁勋口中可怕之处。当全球AI从业者发现,除了CUDA还有成熟稳定的备选方案,多年形成的技术锁定效应会慢慢松动。后续不少国家在建AI算力基础设施的时候,就会多出一个全新选择,不再只能绑定美国的芯片和软件栈。 当然,这个选择不是凭空出现的,外部芯片限制,倒逼国内算力和大模型企业走到一起。DeepSeek作为头部模型公司,不得不提前布局不受外部管控的算力底座。华为昇腾多年持续迭代,也终于具备承载万亿参数大模型的能力。二者相遇,是技术积累叠加现实环境催生出来的组合。 不少国内科技企业已经提前锁定昇腾芯片订单,准备接入这套新生态。国产AI服务器市场份额稳步上涨,产业链上下游开始形成正向循环。芯片出货越多,开发者越多,框架持续优化,反过来吸引更多模型落地。 但也要客观看待,这套新生态还处在成长阶段。对比CUDA数十年积累的工具、插件、开发者社区,昇腾的生态建设还有很长一段路要走。硬件的大规模集群通信、配套工具链,还有持续优化的空间,并不是一步就能追上成熟海外体系。 可行业的底层逻辑已经发生变化。从前大家默认,前沿大模型只能跑在英伟达的硬件上。现在已经证明,国产芯片加国产大模型,可以跑出世界第一梯队的产品。 这件事的意义,早已超出两家企业之间的合作。它给全球AI产业提供了另一条独立发展路线。不再是单一技术标准垄断全球算力市场。 黄仁勋看得很明白,芯片的性能差距还有追赶空间,但生态一旦形成,再想封锁就很难。当开源的顶尖模型,原生支持国产算力,美国靠芯片和软件生态掌握的AI话语权,就会被持续削弱。 现在,DeepSeek已经计划部署十几万颗昇腾芯片搭建大型AI集群,大规模商用落地已经提上日程。后续更多国产大模型,大概率会跟进原生适配昇腾。 英伟达的护城河不是一夜崩塌,但是最关键的那道裂缝,已经实实在在出现。黄仁勋当初那句警告,不是危言耸听,是他站在行业顶端,提前看见了AI产业格局的转向。#上头条 聊热点##MCN微头条伙伴计划#

7. 封锁你、制裁你,到头来却发现自己成了孤家寡人。美科技党黄仁勋如此毒辣,黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。 今年4月,黄仁勋在Dwarkesh播客说了这么一段话:如果DeepSeek把模型优化到跑在华为芯片上,对美国来说是"horrible outcome",字面意思就是可怕的结果。 那段时间网上的风评基本一边倒——这人在给英伟达要政策,嘴上说国家安全,心里打的是股价的算盘。说实话,我当时也没当回事,觉得他多少有点夸张。 结果呢? DeepSeek V4在2026年4月24日正式发布了,跑的是华为昇腾950PR芯片,底层代码从英伟达那套CUDA框架,整体迁移到了华为自研的CANN体系。 更绝的是,DeepSeek在V4测试阶段直接拒了英伟达的早期访问请求,优先把模型开放给华为和寒武纪做适配。 这个动作在AI圈不寻常,以往发新模型,常规操作是先伺候好英伟达,让他们早点调优,国产芯片排在后面。 DeepSeek这次反着来,信号再直白不过:我们要离开你的生态,往后用自己人的。 那黄仁勋当时怕的是什么?不是华为某一块芯片性能超过了英伟达,是这件事背后的生态逻辑。 我来说直白点,英伟达真正的护城河不是GPU有多强,是CUDA——一套把全球AI开发者锁定在英伟达硬件上的软件生态。 你写AI代码、训练大模型,绕不开CUDA那一套东西,想换别家芯片?代码要重写,工程师要重新上手,迁移成本高得吓人,这才是英伟达凭什么贵、凭什么别家便宜了也没人用的根本原因。 要我说,黄仁勋真正在怕的,是CANN能不能长成另一套能与CUDA分庭抗礼的标准。 先看几个数字。昇腾950PR今年3月量产,定价7万人民币,英伟达H200在国内的报价是25万。 三分之一的价格,推理性能跑到了H20的将近三倍,阿里、字节、腾讯已经提前下了数十万颗的订单,需求太旺,芯片直接涨价了20%,企业用脚投票,这一单说明了他们心里的判断。 DeepSeek的成本曲线放在这里也很能说明问题:V3训练花了556万美元,R1大约600万,同期OpenAI同级别模型的训练成本在数亿美元量级。 成本每压一级,国内的调用量就爆一级,今年初,中国每周AI模型调用量已经突破12.96万亿Token,是美国的1.6倍,这么大的规模一直依赖英伟达芯片,供应链就是悬在头顶的刀。 我个人感觉这里有个被低估的类比。安卓出现之前,手机生意是诺基亚的天下。 安卓不是靠一部手机的性能碾压了诺基亚,是一套开放的生态标准把开发者吸引进来,开发者多了就有应用,有应用用户就留下来了,用户多了硬件再差也能迭代出来。 AI芯片这场戏,正在重演同样的剧本,只不过主角换成了软件栈。 当然,最有分量的反驳也该说清楚,华为芯片目前技术差距是实打实的,美国芯片综合性能大约是中国同类的5倍,有预测说到2027年这个差距可能拉到17倍。 昇腾的年产能上限也摆在那里,2026年全年计划出货约160万片,放在全球AI需求里远远不够。现在就说CANN能取代CUDA,确实言过其实。 这个反驳,我觉得是对的。 在我眼里,问题不在谁差距多少倍,而在生态战从哪一刻算正式开始。答案是:从第一个顶级玩家把赌注全押进去的那一刻。 DeepSeek V4专为国产芯片量身定制,这是信号,不是终点,接下来有没有更多顶流模型跟进,CANN生态能不能在更多场景里站住脚——这个进程,才是真正值得盯着看的变量。 这件事跟普通人有没有关系?我觉得有,你手机里的AI应用,背后跑的是谁家的芯片,未来两年会开始有答案。 国产大模型用国产算力跑通,供应链自己握着,服务才稳得住,成本才有机会降下来,普通用户才能享受到更便宜的AI。 黄仁勋说的那个节点,到了,后面的路还长,CANN这条路走不走得通,现在没人知道答案。 你觉得这场生态之战,最终会怎么收场?评论区聊聊,我来看。

8. DeepSeek选华为,真的成为了英伟达的噩梦?

9. 现在来看,黄仁勋之前作出的预测,十有八九是可能是对的,黄仁勋此前曾有过相关表述,倘若DeepSeek这类大模型跑在华为芯片之上,对美国而言将会是一个可怕的结果,当时不少人认为这是他为英伟达争取政策所作的表态,如今回头看,他的担忧并非空泛的说辞。 昇腾960超节点已经推出,单节点可搭载4096张卡,FP8算力达到8 EFLOPS,与此同时,DeepSeek V4完成了从CUDA向华为CANN框架的迁移,并非简单的API转译,而是在底层算子层面完成重写。 将这两件事放在一起看,早已不再是简单的谁卡谁脖子的对立叙事。 CUDA的护城河,并不是性能。 英伟达单卡性能确实强悍,但这并非它真正的壁垒,真正的壁垒是CUDA过去十几年积累的庞大生态,数百万开发者沉淀的函数库,完整的工具链,海量调优经验,大量开源项目,全都围绕CUDA搭建而成,一个团队想要迁移到新芯片平台,远不止更换驱动这么简单,需要大规模重写底层代码,重新积累整套调优经验,这份高昂的迁移成本,才是英伟达最核心的护城河。 因此,在很长一段时间里,国产芯片面临的核心难题,并不是单卡性能差距,就算硬件性能追上来,开发者也不愿承担巨大成本完成迁移。 DeepSeek做了那件搬家的苦力活。 DeepSeek V4这次迁移的价值,不只是证明国产芯片可以跑大模型,而是验证了一件更重要的事,只要算法团队愿意投入深度重构的工程精力,高昂的跨平台迁移成本,是可以被攻克的。 V4并不是简单把CUDA代码转译后直接运行,而是基于CANN框架底层重新开发,这代表DeepSeek工程师深度吃透了华为的软件栈,而非被动等待软件栈去适配模型,这种做法过去并不多见,投入巨大,短期收益有限,但一旦跑通,就给出了一条可复制的路径,跨平台迁移成本很高,但会有团队愿意承担这份成本。 昇腾960的逻辑,不拼单卡,拼整机。 昇腾960超节点支持4096卡互联,走了一条和英伟达不一样的路线,英伟达侧重极致单卡跑分,昇腾的思路则是优先提升整套集群的系统效率,单卡性能存在差距,就依靠高速互联带宽与集群调度算法来弥补,这套思路的本质是,当单点硬件难以超越对手,就切换到新的维度展开竞争。 这套思路能否持续跑通,核心要看集群系统效率能否弥补单卡层面的差距,如果可以,行业竞争的评判维度就会发生变化,从单纯比拼单卡算力,转向比拼整套大集群的综合运行效率,在这套新规则下,CUDA的生态优势会被削弱,因为集群调度不完全依赖单个开发者的使用习惯。 卡脖子的,从来不只是芯片。 出口管制限制的是硬件出口,但长期阻碍国产芯片替代的,是开发者的生态惯性,行业早已习惯CUDA,更换平台意味着学习新软件栈,大规模重写代码,承担调试不确定性,这种生态惯性,影响力不亚于硬件出口管制,无需行政命令就能维持。 DeepSeek这次做的,是在这道生态惯性的厚墙上凿开了一道缝,缝隙不大,但透进来的光,足够让后来者看清一件事,这道墙并非不可翻越,只要有人迈出第一步,后面就会有更多团队跟进。

10. DeepSeek绑定华为!美国AI霸权被撕开缺口,终于看懂黄仁勋的预判

11. 现在来看,黄仁勋之前作出的预测,还真让他说中了。   几个月前,他在一档播客里放话:要是DeepSeek头一回跑在华为的芯片上,对美国来说就是个糟糕透顶的结果。这话一出,不少人当他是替英伟达向美国政府讨政策、博同情。可眼下V4真在昇腾上跑起来了,大家才回过味来——老黄不是吓唬人,他是真瞧见了门道。   DeepSeek挑中华为,哪是什么将就凑合,分明是棋逢对手。DeepSeek的绝活是算法,能把一毛钱算力掰成两半花;华为的本事在系统,上万张卡能攥成一个拳头。一个精打细算,一个家大业大,凑到一块儿,有效算力直接拉满。   英伟达的单卡确实能打。可DeepSeek加华为,比的压根不是单卡跑分,是整体效率。你一张卡顶我三张,我十张卡干你三张卡的活,谁输谁赢,还真不好说。   老黄真正忌惮的,不是某一张华为芯片,而是一套不靠CUDA也能活下去的打法。算法有人写,芯片有人造,系统有人搭,这个圈子一旦转起来,卡脖子就卡了个寂寞。   DeepSeek缺算力,华为缺证明,一个要子弹,一个要靶场,这不是抱团取暖,是各取所需。   昇腾960超节点,一个节点4096张卡,白纸黑字的数字,可不是喊口号。   美国卡的是芯片,中国绕的是系统。黄仁勋那句警告,不是恐吓,是预警。如今,预警成真了。   这事儿得从今年4月说起。黄仁勋上了科技博主德瓦克什的播客,聊着聊着抛出一句重话:DeepSeek要是头一个跑在华为芯片上,对美国来说就是个大麻烦。他说这话那阵子,路透社刚曝出消息——DeepSeek的新旗舰V4,正跟华为做底层适配,代码要从英伟达的CUDA搬到华为自研的CANN上来,连"提前给美国芯片商看模型"的老规矩都改了,反倒更早向国内芯片厂开放。风向,就是从这儿变的。   当时大家都当他又在替自家生意喊冤——那阵子英伟达正被禁令折腾,H20说禁就禁,老黄一年到头往华盛顿跑,翻来覆去一句话:不卖芯片给中国,人家就会自己造。   直到4月24日,DeepSeek V4正式发布,华为当天就宣布:昇腾超节点全系列产品全面支持V4。更扎眼的是,V4的技术报告里,华为昇腾和英伟达,齐刷刷并排写在硬件验证清单上。当初那番"预言",就这么成了事实。   这背后哪有天上掉馅饼的好事。DeepSeek那帮工程师,为了把代码从CUDA搬到华为的CANN框架上,忙活了好几个月。刚上手时又慢又别扭,跟换了件不趁手的家伙事儿一样。可人家没撂挑子,一点一点磨,V4在昇腾950上的推理速度,比刚迁移那会儿整整快了35倍。这效率,谁还敢说国产芯片不行?   市场用脚投票,比啥都诚实。V4还没发布,就有消息说阿里、字节、腾讯这些大厂已提前向华为下单,要几十万颗昇腾芯片。以前大家买卡只认英伟达,如今国产卡排着队等货,变化可不小。   光靠软磨不够,硬家伙也得跟上。9月17日,华为在全联接大会上亮出昇腾960超节点——全球头一个用上NPO光引擎的超节点,单节点能连4096张卡,算力8 EFLOPS,内存足足1PB,10万亿参数的大模型,它都扛得动。   紧接着,DeepSeek也表了态:往后会更积极地用华为这些国产算力。按外媒的说法,四季度华为新一批加速器就会送到DeepSeek手上,拿去训练下一代模型。路,是越走越宽了。   说到这儿,就明白老黄到底怕什么了。他怕的压根不是哪一张华为芯片。单卡性能,英伟达如今还是老大。可老黄心里明镜似的:芯片再好,也得靠CUDA这套软件生态撑着,这玩意儿他磨了20年,才是英伟达真正的护城河。现在DeepSeek带头把代码迁走,等于在护城河上架了座桥,整条链子都是自家的,美国想卡脖子,还卡得住吗?   说白了,美国卡的是芯片,中国绕的是系统。你堵我的门,我就开一扇窗,窗外的天地反而更宽。黄仁勋那句警告,不是恐吓,是预警。如今预警成了真,也不知该夸他眼光毒,还是该叹他拦不住。反正DeepSeek和华为这手牌,是越打越顺了。        #上头条 聊热点#

12. 黄仁勋警告:如果DeepSeek跑在华为芯片上,我们丢掉的不只是市场

13. DeepSeek适配华为昇腾,国产AI算力生态迎来关键转折点

14. 黄仁勋当年的预警正在兑现:DeepSeek牵手昇腾,比拼的早已不是单卡性能 黄仁勋此前有个判断,DeepSeek大模型成功在华为芯片上跑通,对美国而言是一个可怕的结果。在当时,不少人解读认为,这只是黄仁勋为英伟达争取政策、制造外部压力的说辞。但随着后续技术落地,回过头再看,会发现这并不是一句营销话术,而是对行业格局的真实预警。 很多人容易陷入一个误区:DeepSeek选择华为昇腾芯片,是在没有英伟达GPU情况下的退而求其次。实际上这是一次优势互补的强强联手。两家的核心能力刚好形成互补:DeepSeek的核心优势在于算法层,具备极高的算力利用率,可以把硬件的每一份算力潜力充分挖掘出来;华为的强项,则是底层集群系统能力,能够实现上万张芯片的互联调度,把海量的算力节点整合为统一的算力池。简单概括就是,一方擅长精打细算、榨干算力,一方擅长大规模集群组网、堆叠算力,二者结合,目标就是实现有效算力最大化。 不可否认,英伟达单卡的硬件性能依旧很强,单卡跑分具备明显优势。但DeepSeek搭配昇腾这套方案,比拼的维度早就跳出了单卡性能的赛道。 单卡性能对比,好比单兵武器比拼;而大模型训练,考验的是大规模集团军协同作战。哪怕对方一张卡性能抵得上我方三张,但是如果集群调度、算法优化到位,十张卡协同完成的任务,完全有可能对标对方三张高性能卡的产出。最终的胜负,不是单卡参数决定,而是整套软硬件体系综合效率的比拼。 黄仁勋真正担心的,从来不是某一款国产芯片的性能追赶,而是一套脱离CUDA生态的完整技术闭环被成功跑通。一旦国内形成“算法团队开发模型、本土芯片制造、国产系统搭建集群”的完整链条,就意味着原有生态壁垒被打破。过去依靠软件生态形成的“卡脖子”优势,效力会大幅下降。 这次合作本质上是双向奔赴、各取所需:DeepSeek需要稳定、大规模的算力资源作为训练“子弹”;华为昇腾生态,需要头部大模型企业落地验证,拿到真实场景的大规模商用案例,也就是需要一块检验技术能力的“靶场”。这不是弱势企业抱团取暖,而是供需匹配下的协同共赢。 昇腾960超节点,单节点可容纳4096张芯片,这个硬件组网能力不是概念口号,是实实在在落地的工程能力。美国的限制手段,聚焦在高端芯片出口层面;而国内产业的破局思路,重心放在整套软硬件系统的重构。限制的是单颗芯片,而我们在探索全新的集群与算法协同路径,这正是黄仁勋当年预警背后的核心逻辑。 强强联合带来的价值,远不是简单的一加一等于二。DeepSeek擅长算法攻坚,相当于前线的攻坚力量;华为擅长搭建稳定庞大的算力底座,相当于后方稳固的后勤与阵地。大模型赛道竞争走到更深阶段,比拼的不只是短期技术爆发力,更是长期的产业家底、持续迭代能力和完整产业链韧性。 当然也要客观看待:国产算力生态还处在持续完善阶段,大规模集群长期稳定运行、软件工具链丰富度,距离成熟的CUDA生态依然还有不小差距。技术突破不是一蹴而就,产业闭环仍需要大量项目持续打磨验证。但不可否认,这条独立于海外体系之外的技术路线,已经完成关键的落地验证。 黄仁勋当初的预警,不是刻意的恐吓,而是基于行业视角做出的理性判断。如今,这个预警正在一步步变成现实。算力赛道的竞争,已经从单芯片硬件竞赛,升级为全栈体系的长期博弈。 本文仅为行业技术动态客观解读,不构成任何投资建议,科技行业技术迭代快,存在不确定性风险。 #AI算力 #昇腾芯片 #DeepSeek #英伟达 #科技观察

15. 现在来看,黄仁勋之前作出的预测,十有八九是对的。 黄仁勋此前说DeepSeek首次跑在华为芯片上,对美国是个可怕的结果。当时都以为他在帮英伟达要政策。现在看,他是认真的。 DeepSeek选华为,不是退而求其次,是强强联手。 DeepSeek强在算法,能把每一分算力榨出油。华为强在系统,能把一万张卡拧成一股绳。一个会省,一个能堆。凑在一起,就是有效算力最大化。 英伟达单卡确实强。但DeepSeek加华为,拼的不是单卡跑分,是系统效率。你一张卡顶我三张,我十张卡干你三张卡的活,最后谁赢不一定。 黄仁勋怕的不是一张华为芯片,是一套不依赖CUDA的活法。算法有人做,芯片有人造,系统有人搭。这个闭环一旦跑通,卡脖子就卡不住了。 DeepSeek需要算力,华为需要证明自己。一个要子弹,一个要靶场。这不是抱团取暖,是各取所需。 昇腾960超节点,单节点4096张卡。数字摆在这,不是喊口号。 美国卡的是芯片,中国绕的是系统。黄仁勋那句警告,不是恐吓,是预警。 现在预警成真了。 强强联手,不是一加一等于二。是一个会打,一个能扛。打到最后,拼的是谁家底厚。

16. DeepSeek选华为 高通官宣与苹果续签 - 哔哩哔哩

17. 谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

18. 谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章