DeepSeek和智谱声明下半年大规模使用华为昇腾950超节点,是这周末AI行业最值得拆的事。这不是突发新闻,而是兑现的开始:6月底两家双双表态,知乎上相关问题近期仍有新回答不断涌入。知乎7月中旬,华为把Atlas 950真机搬进WAIC公开首秀;8月23日夜里,按微博财经博主的说法,DeepSeek的采购单落定为1.6万张昇腾950。微博很多人看到新闻的第一反应是"国产替代崛起"。先别急着欢呼,建议把账算一遍——一共三笔,每一笔都比口号有意思。

第一笔账:1.6万张卡,听着多,其实不多
流传的换算是这样的:1.6万张昇腾950,等效算力大约相当于4000张英伟达B系列卡。微博这个比例不是孤证,知乎上也有人按另一个口径算过,32000张B系列的活得用约13万颗950来干,同样落在1:4附近。1:4是什么概念?这1.6万张卡全砸进去,也不够从头训练下一代旗舰大模型——参照物就是DeepSeek V4自己:4月24日发布并开源、华为云首发适配的1.6万亿总参数MoE。界面新闻那这批卡拿来干什么?答案是推理。硬件侧能佐证,昇腾950DT最关键的三个数字是144GB片上HiZQ 2.0内存、4TB/s带宽、2TB/s片间互联。知乎144GB片上内存对MoE推理是决定性的——V4-Pro的全部专家权重可以常驻单卡,推理时只需搬运激活参数,这是"全部专家常驻"和"专家换入换出"的本质区别。

性能口径方面,华为公布的数字是:V4-Pro在950DT上单卡decode约4700 tokens/秒,首字延迟约20ms,FP4算力是H20的2.87倍。知乎需要诚实标注:这是厂商口径、离线基准的数据;产业追踪机构SemiAnalysis给出的独立估算更克制一些,950DT的decode性能摸到H100的85%-90%,成本约为其四分之一。两个口径放在一起看,结论一致:推理性能已经够用,差距主要在训练侧和软件生态。
还有一个细节最能说明这颗芯片和这个模型的关系:V4四月发布当天,全球能完整跑起来的推理栈只有英伟达CUDA和华为CANN两套,AMD的ROCm只能跑出1-2 tokens/秒。知乎6月SemiAnalysis对950DT的指令级拆解进一步印证:V4的稀疏矩阵乘、专家路由指令、FP4/FP8混合精度,全都是照着昇腾硬件的特长设计的。这意味着国产算力第一次摸到了"生态定义权":最有分量的开源模型,把架构写成了昇腾原生。所以第一笔账的结论是:这1.6万张卡不是拿来训练下一代模型的,而是拿来扩推理产能、顺便让头部玩家给昇腾软件栈做压力测试。用那位微博博主的话说,昇腾最缺的从来不是性能,是愿意把真实负载跑上去的头部玩家。微博
第二笔账:瓶颈不是技术,是产能
如果以为"钱到位,芯片就到",那就低估了现在国产算力供给的紧张程度。路透、彭博等媒体转引的供应链数字很直白:中芯N+2工艺年产能约260万颗,2026年国内AI芯片需求约420万颗,缺口40%,华为一家独占中芯43%的产能。知乎换句话说,就算订单谈妥,产能也是硬约束。
昇腾950本身的排产同样紧张:2026年出货计划约75万颗,字节跳动一家就锁走了一半。知乎梁文锋7月在内部会上的那句话被业内反复引用:"华为的问题是产能,不是技术。"更硬的瓶颈还在HBM:国产HBM3要等长鑫存储2028年才可能规模化,这也是为什么有消息称,原本计划四季度上市的950DT提前到了8月——早一颗芯片出来都是珍贵的。知乎第二笔账的结论:这笔买卖不是"愿不愿意卖"的问题,是"造不造得出来"的问题,国产算力正在从性能叙事切换到产能叙事。

第三笔账:那个"降价承诺"还算数吗?
这是API用户最关心的一笔。DeepSeek V4四月发布时,带着一个明确预期:下半年昇腾950上市后价格将下调。36氪知乎上至今挂着一个45万浏览的问题,标题直接问这个预计还算数吗。知乎眼下的现实是:不但没降,还涨了。8月13日V4-Pro正式版上线,8月17日起改用峰谷分时定价,输出价从每百万tokens 6元涨到27元,涨了4.5倍,能把任务放到空闲时段的用户价格减半。知乎所谓"最高涨价11倍",其实只对应缓存命中输入的高峰价,并非所有项目统一上涨。
社区明显分成了两派。质疑派的高赞回答很直白:用昇腾的卡,“使用相同的电量算力只有nv的30%”,不涨价撑不住。知乎有人拿手机打比方:麒麟9030 Pro性能没打过同期骁龙,价格也没便宜——国产从来不等于低价。知乎乐观派则认为,推理成本随规模降下来之后,降价窗口自然会开。我的判断是:降不降价,不取决于"芯片变便宜",而取决于"推理变便宜"——昇腾超节点能不能把每百万tokens的推理成本真正打到四分之一。这条因果链的前半段已经有工程证据:深圳河套学院的SLAI T-Rex报告,在昇腾SuperPOD集群上跑通了V4的全参数后训练,MFU(模型算力利用率)从开源基线的11.67%提升到34.22%,优化前的原始流程里通信操作占了52.2%的设备执行时间——一半以上的时间在等数据交换,而不是在计算。知乎但因果链的后半段——商用之后成本到底能降多少——要等超节点批量落地才能验证。
三种人,三种带走方式
如果你是API开发者:别等降价天降,眼下的峰谷价差本身就是确定的折扣。可延后的批处理、数据整理、离线生成任务,挪到空闲时段立刻省一半;未来推理价格若真下调,闲时调用也会最先受益。知乎
如果你是行业观察者:盯三个数字——超节点批量上市的时间表(官方口径是四季度)、950DT上线华为云后的独立实测数据(验证单卡4700 tokens/秒是否真实)、以及是否有更多模型复制"模型-芯片协同设计"的打法。8月3日MiniMax H3已经复制了同样的Day 0适配,这不是孤例。知乎
如果你盯算力产业链:方向确定,节奏受产能约束。DeepSeek、智谱双双入场,字节的订单已锁定,昇腾订单的确定性高于市场感知;但40%的产能缺口和HBM瓶颈,意味着兑现节奏会慢于情绪。昇腾384超节点已经商用落地750多套,10个月翻了一倍多——这个品类正在从"发布叙事"走进"部署叙事"。知乎

9月到四季度的观察清单
昇腾950超节点是否按期商用放量,第一批客户是谁;
DeepSeek V4推理价格是否下调——四月那句承诺的兑现情况;
950DT上线华为云后,有没有第三方独立实测;
DeepSeek乌兰察布1GW智算中心的芯片方案是否落定。
最后是乌兰察布这条线索值得多说一句:彭博7月底报道,DeepSeek计划在内蒙古乌兰察布建设1GW级智算中心,投资约350亿美元,采用自建加租赁的混合模式。知乎但最关键的芯片方案至今未被证实——报道原文说"尚不清楚用谁的芯片",双方也都未承诺建设。这条线索的答案,可能比订单本身更能说明国产算力的真实位置。
一句话收尾:1.6万张昇腾950,撑不起下一代DeepSeek的训练,但足以证明国产推理这条路是通的。国产替代的叙事,终于从发布会开进了物料清单——接下来真正决定节奏的,不是公告,是中芯和长鑫的产能。