当前位置:
AIGC文章详情

DeepSeek被传买下1.6万张昇腾950,等效算力却只有4000张N卡:先算账,再欢呼

源自44位全网作者

03:01

DeepSeek和智谱声明下半年大规模使用华为昇腾950超节点,是这周末AI行业最值得拆的事。这不是突发新闻,而是兑现的开始:6月底两家双双表态,知乎上相关问题近期仍有新回答不断涌入。知乎7月中旬,华为把Atlas 950真机搬进WAIC公开首秀;8月23日夜里,按微博财经博主的说法,DeepSeek的采购单落定为1.6万张昇腾950。微博很多人看到新闻的第一反应是"国产替代崛起"。先别急着欢呼,建议把账算一遍——一共三笔,每一笔都比口号有意思。

DeepSeek被传买下1.6万张昇腾950,等效算力却只有4000张N卡:先算账,再欢呼

第一笔账:1.6万张卡,听着多,其实不多

流传的换算是这样的:1.6万张昇腾950,等效算力大约相当于4000张英伟达B系列卡。微博这个比例不是孤证,知乎上也有人按另一个口径算过,32000张B系列的活得用约13万颗950来干,同样落在1:4附近。1:4是什么概念?这1.6万张卡全砸进去,也不够从头训练下一代旗舰大模型——参照物就是DeepSeek V4自己:4月24日发布并开源、华为云首发适配的1.6万亿总参数MoE。界面新闻那这批卡拿来干什么?答案是推理。硬件侧能佐证,昇腾950DT最关键的三个数字是144GB片上HiZQ 2.0内存、4TB/s带宽、2TB/s片间互联。知乎144GB片上内存对MoE推理是决定性的——V4-Pro的全部专家权重可以常驻单卡,推理时只需搬运激活参数,这是"全部专家常驻"和"专家换入换出"的本质区别。

DeepSeek被传买下1.6万张昇腾950,等效算力却只有4000张N卡:先算账,再欢呼

性能口径方面,华为公布的数字是:V4-Pro在950DT上单卡decode约4700 tokens/秒,首字延迟约20ms,FP4算力是H20的2.87倍。知乎需要诚实标注:这是厂商口径、离线基准的数据;产业追踪机构SemiAnalysis给出的独立估算更克制一些,950DT的decode性能摸到H100的85%-90%,成本约为其四分之一。两个口径放在一起看,结论一致:推理性能已经够用,差距主要在训练侧和软件生态。

还有一个细节最能说明这颗芯片和这个模型的关系:V4四月发布当天,全球能完整跑起来的推理栈只有英伟达CUDA和华为CANN两套,AMD的ROCm只能跑出1-2 tokens/秒。知乎6月SemiAnalysis对950DT的指令级拆解进一步印证:V4的稀疏矩阵乘、专家路由指令、FP4/FP8混合精度,全都是照着昇腾硬件的特长设计的。这意味着国产算力第一次摸到了"生态定义权":最有分量的开源模型,把架构写成了昇腾原生。所以第一笔账的结论是:这1.6万张卡不是拿来训练下一代模型的,而是拿来扩推理产能、顺便让头部玩家给昇腾软件栈做压力测试。用那位微博博主的话说,昇腾最缺的从来不是性能,是愿意把真实负载跑上去的头部玩家。微博

第二笔账:瓶颈不是技术,是产能

如果以为"钱到位,芯片就到",那就低估了现在国产算力供给的紧张程度。路透、彭博等媒体转引的供应链数字很直白:中芯N+2工艺年产能约260万颗,2026年国内AI芯片需求约420万颗,缺口40%,华为一家独占中芯43%的产能。知乎换句话说,就算订单谈妥,产能也是硬约束。

昇腾950本身的排产同样紧张:2026年出货计划约75万颗,字节跳动一家就锁走了一半。知乎梁文锋7月在内部会上的那句话被业内反复引用:"华为的问题是产能,不是技术。"更硬的瓶颈还在HBM:国产HBM3要等长鑫存储2028年才可能规模化,这也是为什么有消息称,原本计划四季度上市的950DT提前到了8月——早一颗芯片出来都是珍贵的。知乎第二笔账的结论:这笔买卖不是"愿不愿意卖"的问题,是"造不造得出来"的问题,国产算力正在从性能叙事切换到产能叙事。

DeepSeek被传买下1.6万张昇腾950,等效算力却只有4000张N卡:先算账,再欢呼

第三笔账:那个"降价承诺"还算数吗?

这是API用户最关心的一笔。DeepSeek V4四月发布时,带着一个明确预期:下半年昇腾950上市后价格将下调。36氪知乎上至今挂着一个45万浏览的问题,标题直接问这个预计还算数吗。知乎眼下的现实是:不但没降,还涨了。8月13日V4-Pro正式版上线,8月17日起改用峰谷分时定价,输出价从每百万tokens 6元涨到27元,涨了4.5倍,能把任务放到空闲时段的用户价格减半。知乎所谓"最高涨价11倍",其实只对应缓存命中输入的高峰价,并非所有项目统一上涨。

社区明显分成了两派。质疑派的高赞回答很直白:用昇腾的卡,“使用相同的电量算力只有nv的30%”,不涨价撑不住。知乎有人拿手机打比方:麒麟9030 Pro性能没打过同期骁龙,价格也没便宜——国产从来不等于低价。知乎乐观派则认为,推理成本随规模降下来之后,降价窗口自然会开。我的判断是:降不降价,不取决于"芯片变便宜",而取决于"推理变便宜"——昇腾超节点能不能把每百万tokens的推理成本真正打到四分之一。这条因果链的前半段已经有工程证据:深圳河套学院的SLAI T-Rex报告,在昇腾SuperPOD集群上跑通了V4的全参数后训练,MFU(模型算力利用率)从开源基线的11.67%提升到34.22%,优化前的原始流程里通信操作占了52.2%的设备执行时间——一半以上的时间在等数据交换,而不是在计算。知乎但因果链的后半段——商用之后成本到底能降多少——要等超节点批量落地才能验证。

三种人,三种带走方式

  • 如果你是API开发者:别等降价天降,眼下的峰谷价差本身就是确定的折扣。可延后的批处理、数据整理、离线生成任务,挪到空闲时段立刻省一半;未来推理价格若真下调,闲时调用也会最先受益。知乎

  • 如果你是行业观察者:盯三个数字——超节点批量上市的时间表(官方口径是四季度)、950DT上线华为云后的独立实测数据(验证单卡4700 tokens/秒是否真实)、以及是否有更多模型复制"模型-芯片协同设计"的打法。8月3日MiniMax H3已经复制了同样的Day 0适配,这不是孤例。知乎

  • 如果你盯算力产业链:方向确定,节奏受产能约束。DeepSeek、智谱双双入场,字节的订单已锁定,昇腾订单的确定性高于市场感知;但40%的产能缺口和HBM瓶颈,意味着兑现节奏会慢于情绪。昇腾384超节点已经商用落地750多套,10个月翻了一倍多——这个品类正在从"发布叙事"走进"部署叙事"。知乎

DeepSeek被传买下1.6万张昇腾950,等效算力却只有4000张N卡:先算账,再欢呼

9月到四季度的观察清单

  1. 昇腾950超节点是否按期商用放量,第一批客户是谁;

  2. DeepSeek V4推理价格是否下调——四月那句承诺的兑现情况;

  3. 950DT上线华为云后,有没有第三方独立实测;

  4. DeepSeek乌兰察布1GW智算中心的芯片方案是否落定。

最后是乌兰察布这条线索值得多说一句:彭博7月底报道,DeepSeek计划在内蒙古乌兰察布建设1GW级智算中心,投资约350亿美元,采用自建加租赁的混合模式。知乎但最关键的芯片方案至今未被证实——报道原文说"尚不清楚用谁的芯片",双方也都未承诺建设。这条线索的答案,可能比订单本身更能说明国产算力的真实位置。

一句话收尾:1.6万张昇腾950,撑不起下一代DeepSeek的训练,但足以证明国产推理这条路是通的。国产替代的叙事,终于从发布会开进了物料清单——接下来真正决定节奏的,不是公告,是中芯和长鑫的产能。

精选参考来源

1
如何评价DeepSeek与智谱均声明将在下半年大规模使用华为昇腾950超节点?
2
华为昇腾加DeepSeek,终于从传闻走到了官宣。DeepSeek采购了1.6万张昇腾950芯片。消息一出,很多人激动了。但冷静算一笔账:1.6万张昇腾950,等效算力只相当于4000张英伟达B系列芯片。换句话说,这堆卡加在一起,连训练下一代旗舰大模型都够呛。所以这笔交易真正的价值,不是算力,是"态度"。DeepSeek是中国AI模型赛道里技术口碑最硬的玩家之一。它选择把真实负载跑在昇腾上,意味着昇腾的软件栈、算子库、分布式框架终于迎来了一次"头部玩家的压力测试"。跑通了,说明国产算力从"能用"迈向了"好用";跑不顺,那就继续磨。华为昇腾最憋屈的事,不是性能比英伟达差,是头部AI公司不愿意用。英伟达的护城河是全球最顶尖的玩家都在用它的卡,这是信任状,比任何技术指标都管用。DeepSeek这次大规模采购,等于在说"我信你"。这比一万张卡本身值钱得多。对英伟达来说,这笔采购短期内连水花都算不上。但长期看,真正该担心的不是这1.6万张卡,而是"中国AI算力正在形成一条不依赖英伟达的替代路径"这个事实本身。一旦这条路被证明可行,哪怕性能只有英伟达的几分之一,它也会慢慢吃掉英伟达在中国市场的份额。2026年英伟达中国市场份额预计从40%跌到8%,就是这个趋势的映射。英伟达的护城河是CUDA生态,但CUDA最怕的不是性能被超越,是替代选项被验证可用。当然差距还在。昇腾950的单卡性能和集群效率,离英伟达B系列还有距离。软件生态的差距更不是一天能补上的。但关键的变化在于:中国AI产业开始接受"性能差一点,但生态可以慢慢磨"的现实了。过去大家觉得不用英伟达就没法做AI,现在DeepSeek用行动证明了昇腾能用。这就是最大的变化。美国想用芯片卡中国AI的脖子,但DeepSeek和华为的合作说明了一件事——卡得住性能,卡不住路径。国产算力正在从"依赖英伟达"转向"昇腾+海光+寒武纪"的组合。昇腾950只是开始。
全部
来源
内容由AI生成

精选参考来源

1. 如何评价DeepSeek与智谱均声明将在下半年大规模使用华为昇腾950超节点?

2. 华为昇腾加DeepSeek,终于从传闻走到了官宣。DeepSeek采购了1.6万张昇腾950芯片。消息一出,很多人激动了。但冷静算一笔账:1.6万张昇腾950,等效算力只相当于4000张英伟达B系列芯片。换句话说,这堆卡加在一起,连训练下一代旗舰大模型都够呛。所以这笔交易真正的价值,不是算力,是"态度"。DeepSeek是中国AI模型赛道里技术口碑最硬的玩家之一。它选择把真实负载跑在昇腾上,意味着昇腾的软件栈、算子库、分布式框架终于迎来了一次"头部玩家的压力测试"。跑通了,说明国产算力从"能用"迈向了"好用";跑不顺,那就继续磨。华为昇腾最憋屈的事,不是性能比英伟达差,是头部AI公司不愿意用。英伟达的护城河是全球最顶尖的玩家都在用它的卡,这是信任状,比任何技术指标都管用。DeepSeek这次大规模采购,等于在说"我信你"。这比一万张卡本身值钱得多。对英伟达来说,这笔采购短期内连水花都算不上。但长期看,真正该担心的不是这1.6万张卡,而是"中国AI算力正在形成一条不依赖英伟达的替代路径"这个事实本身。一旦这条路被证明可行,哪怕性能只有英伟达的几分之一,它也会慢慢吃掉英伟达在中国市场的份额。2026年英伟达中国市场份额预计从40%跌到8%,就是这个趋势的映射。英伟达的护城河是CUDA生态,但CUDA最怕的不是性能被超越,是替代选项被验证可用。当然差距还在。昇腾950的单卡性能和集群效率,离英伟达B系列还有距离。软件生态的差距更不是一天能补上的。但关键的变化在于:中国AI产业开始接受"性能差一点,但生态可以慢慢磨"的现实了。过去大家觉得不用英伟达就没法做AI,现在DeepSeek用行动证明了昇腾能用。这就是最大的变化。美国想用芯片卡中国AI的脖子,但DeepSeek和华为的合作说明了一件事——卡得住性能,卡不住路径。国产算力正在从"依赖英伟达"转向"昇腾+海光+寒武纪"的组合。昇腾950只是开始。

3. DeepSeek-V4-Flash上线华为云

4. 深度 | 模型为芯片而生:DeepSeek V4 与昇腾 950 的共谋改变了什么

5. 华为把昇腾卖到拉美了:国产算力这回不是"能用",是想"出海抢地盘"

6. DeepSeek-V4明确支持华为昇腾950芯片

7. 四月时,说预计下半年昇腾950超节点批量上市后,deepseek的价格会大幅下调,这个预计还算数吗?

8. DeepSeek最高涨价11倍:低价不是商业模式,只是获客方式

9. 四月时,说预计下半年昇腾950超节点批量上市后,deepseek的价格会大幅下调,这个预计还算数吗?

10. 大家为什么会觉得使用昇腾芯片之后deepseek会便宜?

11. 昇腾超节点上的DeepSeek V4全参数后训练实践来了!

12. 世界人工智能大会|华为 1024 卡真机、中兴 Matrix、曦智光交换:首日 9 台国产超节点,一张表看清

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章