9月30日,国庆前一天,DeepSeek官号发了条长公告。不发新模型、不降价,开头一句话却比这两件事都重:“正式开源面向华为昇腾算力平台的基础设施组件……所有组件与此前面向英伟达平台的开源组件一一对应”。每日经济新闻
“一一对应"这四个字,当天就被全网翻译成了好几种版本:微博博主喊"英伟达、CUDA不可替代?笑话”。 小红书有人总结"Deepseek:随手帮昇腾写了套cuda,免费自取"。 知乎专栏干脆把稿子起名《中国CUDA》。一针见车小红书知乎专栏
另一边,微博评论区最高赞的泼冷水是:“毫无保留,指价格贵一倍”。微博评论区
如果你今天被这条新闻刷屏、又在"该不该为国产算力兴奋"和"又是一波自嗨"之间来回摇摆,先别站队。我把公告、六个开源仓库的文档和全网几个平台的讨论对完账,把三件事摆清楚。
第一本账:到底开源了什么——是六块地基,不是一整套CUDA
这次放出来的不是产品,是给大模型工程师用的底层组件,六个,各管一段:TileLang管"写"(用接近Python的方式写高性能算子,昇腾版把Ascend C底层指令包了一层,官方称不损失硬件性能)、DeepGEMM管"算"(矩阵乘法)、DeepEP管"通信"(专家并行时几千张卡之间搬数据)、TileKernels管基础操作、FlashMLA管注意力计算、DeepSelect管数据筛选。知乎专栏

值得注意的工程细节在"一一对应"怎么落地的:六个项目里,四个是原有跨平台项目新增昇腾后端,两个是新建仓库但接口与英伟达版完全对齐。 TileKernels仓库写得最直白——同一套Python接口,分别走英伟达GPU和华为昇腾NPU的后端,上层调用几乎不用改。三虫君知乎
所以它和CUDA的真实关系是:把大模型训练最吃紧的那几段路(算、通信、注意力)在昇腾上重新铺了一遍,而不是把CUDA二十年积累的框架、教程、算子库整体搬过来。"国产版CUDA"当谈资可以,当结论不行。
第二本账:性能数字哪些是真的、哪些带着小字
这次公告最容易被截图传播的是两类数字,各自都附带了官方自己写上的限制条件:
“达到硬件理论上限的99.8%”:出自DeepGEMM-Ascend的测试表,环境是昇腾950DT + CANN 9.2.0、特定矩阵形状的BF16稠密矩阵乘法。 它是真实成绩,但推不出"昇腾跑所有大模型都有99.8%利用率",更推不出"迁移已经没有难题"。知乎
“专家并行带宽超过物理上限九成”:限定在EP≤32的场景。三虫君
而且项目说明明确标注:数据采自提供给DeepSeek的PoC开发套件、经过额外人工配置,对应的商用硬件版本尚未公开发布。 想拿去生产的团队,这个"90%"目前还不能当成你的到手性能。知乎
兼容性名单同样要念全:仓库列出的昇腾环境是昇腾950和CANN 9.2.0及以上,这不是对所有昇腾芯片、所有软件版本的兼容承诺;FlashMLA里部分融合算子和稠密注意力算子,文档写明仍只支持CUDA。知乎
再补两个仓库之外的坐标。往前看,生态差距不写在参数表里:今年5月有工程师切身实测,昇腾跑Qwen3推理、对比H20速度慢6-10倍。 这还只是上一代芯片上的个人实测,不能直接外推到950一代;9月流传的分析师估算则认为,华为的芯片可能还会落后英伟达三到四年。 往后看,迁移成本包括文档查不查得到、报错谁来接、升级后旧程序会不会坏——每一条都是开发团队每天在付的钱。知乎知乎专栏
梁文锋自己今年6月的说法其实是全场最冷静的版本:“技术没有秘密,但重置需要时间和成本”。 这次开源,就是把"重建"两字从口号变成代码。知乎问答

第三本账:跟你有什么关系——分三种人对号入座
做大模型训练、推理部署的工程团队:这条新闻真跟你有关。去年有科技博主记过一桩旧事——华为昇腾生态团队当时在DeepSeek的跨卡通信库项目下提了正式提议,希望在DeepSeek组织名下共建昇腾版仓库,被婉拒;今年DeepSeek自己动手把六个仓库全建了。 同一个提案从"别人家的适配"变成"自己的第二条腿",路线也从AMD式的自建生态、社区托养,换成了第三条:让头部模型团队在实际训练里用脚投票写出来的代码直接开源,两套硬件共享同一套接口。对想试国产算力的团队,社区里比较一致的建议是:先读文档再动手,等商用工具链齐了做小规模验证,别一上来押生产环境。三虫君知乎
打游戏、装机、本地跑大模型的普通用户:直接关系——短期没有。这六个仓库的目标用户是训练和部署大模型的团队,不服务普通开发者。 你的RTX显卡、游戏生态、llama.cpp和ComfyUI在国庆、双11乃至往后几年里都照常运转,不必因为"CUDA完了"的标题改变任何购买决策。但也别反过来因为"又是自嗨"的反弹就划走:真正在松动的是"新模型默认只在英伟达上做优化"这个起点位置,这才是英伟达(以及习惯它定价权的每一分显卡预算)中期要面对的事。知乎专栏
国产替代观察党:与其今天兴奋,不如把国庆后的四个信号盯住:①昇腾950商用版什么时候放量、到手价多少——9月17日华为全联接大会上官方已宣布昇腾超节点部署超过1000套、昇腾950超节点开始规模商用。 9月30日官宣开源的同一天,昇腾950超节点和Atlas 850E风冷超节点正式上市。 ②除了DeepSeek,第二家大模型公司会不会直接复用这套仓库——6月已和DeepSeek一起声明下半年大规模使用昇腾950超节点的智谱,就是一个值得盯的候选。;③DeepSeek的API价格会不会随算力成本下降——8月它刚完成一轮涨价;④9月21日昇腾搬进PyTorch官网之后,官方文档和教程的补齐速度——那件事被社区解读为"迁移成本从换房子降级成装家具"。这四条凑齐那天,"CUDA护城河破了"才有实锤。财联社华为计算知乎

微博评论区有条高赞说得最到位:英伟达怕的从来不是中国能做出好的大模型,怕的是好的大模型不再以CUDA生态作为默认的优化起点。 9月30日这天,DeepSeek往起点上凿了六下。响不响,要看后面敢不敢有人顺着这条路走。微博评论区
如果你的工作涉及大模型部署,昇腾这套地基你会去试吗——算子缺失、文档难找、还是出问题没人接,哪个最让你犹豫?