DeepSeek和智谱声明下半年大规模使用华为昇腾950超节点,是这周末AI行业最值得拆的事。这不是突发新闻,而是兑现的开始:6月底两家双双表态,知乎上相关问题近期仍有新回答不断涌入。知乎7月中旬,华为把Atlas 950真机搬进WAIC公开首秀;8月23日夜里,按微博财经博主的说法,DeepSeek的采购单落定为1.6万张昇腾950。新浪微博很多人看到新闻的第一反应是"国产替代崛起"。先别急着欢呼,建议把账算一遍——一共三笔,每一笔都比口号有意思。

第一笔账:1.6万张卡,听着多,其实不多
流传的换算是这样的:1.6万张昇腾950,等效算力大约相当于4000张英伟达B系列卡。新浪微博这个比例不是孤证,知乎上也有人按另一个口径算过,32000张B系列的活得用约13万颗950来干,同样落在1:4附近。1:4是什么概念?这1.6万张卡全砸进去,也不够从头训练下一代旗舰大模型——参照物就是DeepSeek V4自己:4月24日发布并开源、华为云首发适配的1.6万亿总参数MoE。界面新闻那这批卡拿来干什么?答案是推理。硬件侧能佐证,昇腾950DT最关键的三个数字是144GB片上HiZQ 2.0内存、4TB/s带宽、2TB/s片间互联。知乎144GB片上内存对MoE推理是决定性的——V4-Pro的全部专家权重可以常驻单卡,推理时只需搬运激活参数,这是"全部专家常驻"和"专家换入换出"的本质区别。

性能口径方面,华为公布的数字是:V4-Pro在950DT上单卡decode约4700 tokens/秒,首字延迟约20ms,FP4算力是H20的2.87倍。知乎需要诚实标注:这是厂商口径、离线基准的数据;产业追踪机构SemiAnalysis给出的独立估算更克制一些,950DT的decode性能摸到H100的85%-90%,成本约为其四分之一。两个口径放在一起看,结论一致:推理性能已经够用,差距主要在训练侧和软件生态。
还有一个细节最能说明这颗芯片和这个模型的关系:V4四月发布当天,全球能完整跑起来的推理栈只有英伟达CUDA和华为CANN两套,AMD的ROCm只能跑出1-2 tokens/秒。知乎6月SemiAnalysis对950DT的指令级拆解进一步印证:V4的稀疏矩阵乘、专家路由指令、FP4/FP8混合精度,全都是照着昇腾硬件的特长设计的。这意味着国产算力第一次摸到了"生态定义权":最有分量的开源模型,把架构写成了昇腾原生。所以第一笔账的结论是:这1.6万张卡不是拿来训练下一代模型的,而是拿来扩推理产能、顺便让头部玩家给昇腾软件栈做压力测试。用那位微博博主的话说,昇腾最缺的从来不是性能,是愿意把真实负载跑上去的头部玩家。新浪微博
第二笔账:瓶颈不是技术,是产能
如果以为"钱到位,芯片就到",那就低估了现在国产算力供给的紧张程度。路透、彭博等媒体转引的供应链数字很直白:中芯N+2工艺年产能约260万颗,2026年国内AI芯片需求约420万颗,缺口40%,华为一家独占中芯43%的产能。知乎换句话说,就算订单谈妥,产能也是硬约束。
昇腾950本身的排产同样紧张:2026年出货计划约75万颗,字节跳动一家就锁走了一半。知乎梁文锋7月在内部会上的那句话被业内反复引用:"华为的问题是产能,不是技术。"更硬的瓶颈还在HBM:国产HBM3要等长鑫存储2028年才可能规模化,这也是为什么有消息称,原本计划四季度上市的950DT提前到了8月——早一颗芯片出来都是珍贵的。知乎第二笔账的结论:这笔买卖不是"愿不愿意卖"的问题,是"造不造得出来"的问题,国产算力正在从性能叙事切换到产能叙事。

第三笔账:那个"降价承诺"还算数吗?
这是API用户最关心的一笔。DeepSeek V4四月发布时,带着一个明确预期:下半年昇腾950上市后价格将下调。36氪知乎上至今挂着一个45万浏览的问题,标题直接问这个预计还算数吗。知乎眼下的现实是:不但没降,还涨了。8月13日V4-Pro正式版上线,8月17日起改用峰谷分时定价,输出价从每百万tokens 6元涨到27元,涨了4.5倍,能把任务放到空闲时段的用户价格减半。知乎所谓"最高涨价11倍",其实只对应缓存命中输入的高峰价,并非所有项目统一上涨。
社区明显分成了两派。质疑派的高赞回答很直白:用昇腾的卡,“使用相同的电量算力只有nv的30%”,不涨价撑不住。知乎有人拿手机打比方:麒麟9030 Pro性能没打过同期骁龙,价格也没便宜——国产从来不等于低价。知乎乐观派则认为,推理成本随规模降下来之后,降价窗口自然会开。我的判断是:降不降价,不取决于"芯片变便宜",而取决于"推理变便宜"——昇腾超节点能不能把每百万tokens的推理成本真正打到四分之一。这条因果链的前半段已经有工程证据:深圳河套学院的SLAI T-Rex报告,在昇腾SuperPOD集群上跑通了V4的全参数后训练,MFU(模型算力利用率)从开源基线的11.67%提升到34.22%,优化前的原始流程里通信操作占了52.2%的设备执行时间——一半以上的时间在等数据交换,而不是在计算。知乎但因果链的后半段——商用之后成本到底能降多少——要等超节点批量落地才能验证。
三种人,三种带走方式
如果你是API开发者:别等降价天降,眼下的峰谷价差本身就是确定的折扣。可延后的批处理、数据整理、离线生成任务,挪到空闲时段立刻省一半;未来推理价格若真下调,闲时调用也会最先受益。知乎
如果你是行业观察者:盯三个数字——超节点批量上市的时间表(官方口径是四季度)、950DT上线华为云后的独立实测数据(验证单卡4700 tokens/秒是否真实)、以及是否有更多模型复制"模型-芯片协同设计"的打法。8月3日MiniMax H3已经复制了同样的Day 0适配,这不是孤例。知乎
如果你盯算力产业链:方向确定,节奏受产能约束。DeepSeek、智谱双双入场,字节的订单已锁定,昇腾订单的确定性高于市场感知;但40%的产能缺口和HBM瓶颈,意味着兑现节奏会慢于情绪。昇腾384超节点已经商用落地750多套,10个月翻了一倍多——这个品类正在从"发布叙事"走进"部署叙事"。知乎

9月到四季度的观察清单
昇腾950超节点是否按期商用放量,第一批客户是谁;
DeepSeek V4推理价格是否下调——四月那句承诺的兑现情况;
950DT上线华为云后,有没有第三方独立实测;
DeepSeek乌兰察布1GW智算中心的芯片方案是否落定。
最后是乌兰察布这条线索值得多说一句:彭博7月底报道,DeepSeek计划在内蒙古乌兰察布建设1GW级智算中心,投资约350亿美元,采用自建加租赁的混合模式。知乎但最关键的芯片方案至今未被证实——报道原文说"尚不清楚用谁的芯片",双方也都未承诺建设。这条线索的答案,可能比订单本身更能说明国产算力的真实位置。
一句话收尾:1.6万张昇腾950,撑不起下一代DeepSeek的训练,但足以证明国产推理这条路是通的。国产替代的叙事,终于从发布会开进了物料清单——接下来真正决定节奏的,不是公告,是中芯和长鑫的产能。
方大聖
校验提示文案
左手剁右手
校验提示文案
obobi
校验提示文案
值友3558541151
校验提示文案
在银河系边缘甩尾
校验提示文案
magickori
校验提示文案
phoenixduo
校验提示文案
生活品质
校验提示文案
索美雅88
校验提示文案
豌豆尖
校验提示文案
心无旁骛的韭菜
校验提示文案
秋人艺方
校验提示文案
值友6592308112
校验提示文案
值友6274244676
校验提示文案
值友6592308112
校验提示文案
秋人艺方
校验提示文案
值友3558541151
校验提示文案
心无旁骛的韭菜
校验提示文案
豌豆尖
校验提示文案
索美雅88
校验提示文案
magickori
校验提示文案
在银河系边缘甩尾
校验提示文案
生活品质
校验提示文案
方大聖
校验提示文案
左手剁右手
校验提示文案
obobi
校验提示文案
phoenixduo
校验提示文案
值友6274244676
校验提示文案