DeepSeek给昇腾开源了六个组件:99.8%是真的,「部分算子仍只支持CUDA」也是真的

源自60位全网作者

16:52

9月30日上午,DeepSeek官宣开源面向华为昇腾算力平台的基础设施组件。当天知乎问题区刷屏的词是"中国CUDA",彭博社的标题更直接——DeepSeek发布华为AI芯片工具,或将取代英伟达。但作为天天对着kernel算账的人,我做的第一件事不是站队,而是把官宣通稿、六个仓库的README和华为侧的性能口径对了一遍。结论只有一句:今天流传的两种说法都成立,而数字背后的条件,比数字本身更值得记。机器之心彭博社

一、今天到底发布了什么:六个组件,一一对应

按官宣,这次开源覆盖 TileLang(昇腾版编译工具)、DeepGEMM(矩阵运算)、DeepEP(跨设备通信)、TileKernels(向量计算与访存)、FlashMLA(稀疏注意力)、DeepSelect(数据筛选)——官方口径是与此前面向英伟达平台开源的组件"一一对应"。也就是说,DeepSeek在N卡上吃饭的那套算子层,理论上每一块都有了昇腾版本。

两条信息含金量最高:TileLang昇腾版对Ascend C底层指令做了封装,提供高级语言编程方式同时不损失硬件性能;官方称这条路线已经在英伟达平台验证过,承载了DeepSeek V4系列模型训练中大部分算子的实现——现在,它第一次被整体搬到非CUDA平台上。机器之心

DeepSeek给昇腾开源了六个组件:99.8%是真的,「部分算子仍只支持CUDA」也是真的

华为侧同日在CANN社区开源双方围绕昇腾950及超节点的联合创新成果,覆盖模型部署、大规模训练、超长文本KV Cache池化与Agentic RL,并披露了DeepSeek-V4.1-Flash的部分离线推理性能数据。机器之心

二、三个关键数字,各自藏在什么条件下

社区里传播最广的是三个数字,但它们的测量环境完全不是一回事,我把口径逐条对了一遍:

99.8%:出自DeepGEMM-Ascend仓库的测试表,是在昇腾950DT、CANN 9.20环境下,特定矩阵形状的BF16稠密矩阵乘法达到对应硬件理论上限的比例。它成立,但只覆盖这一类算子、这组形状。工程师卓寿杰的提醒很到位:这个数字不能被偷换成"昇腾跑所有大模型都有99.8%利用率",更不能推出"模型迁移已经没有难题"。知乎

375 GB/s / 347 GB/s:UBL128超节点方案下Dispatch/Combine的通信带宽,华为披露口径为"接近硬件上限"。注意DeepEP-Ascend仓库里那行容易被跳过的注释:测试数据采自提供给DeepSeek的PoC硬件开发套件,并经过额外人工配置,不是尚未公开的商用版本跑出来的成绩。商用机出来之前,这组数只能当上限参考。机器之心知乎

EP32推理数据:华为披露的DeepSeek-V4.1-Flash离线推理测试结果,条件包括ContextLength 128K、DSpark投机接受率0.85、允许更长TPOT换更高每卡吞吐——机器之心写得很清楚,这是不带Serving调度和框架负载均衡的纯模型Offline性能。它适合当复现模板,不适合直接当生产预期。机器之心

三、真正被移植的是什么:四层,通到哪、没通到哪

把这次事件拆开看,它其实是分四层落地的,每一层的成色不一样:

编程模型层(TileLang):接近Python的高级算子语言,编译基础设施建立在TVM之上,9月30日宣布正式支持昇腾950后端。B站快讯视频评论区有个高赞纠偏很关键:“不算抛弃吧,TileLang是个通用的中间层,可以基于它适配多个计算框架,例如OpenCL、Metal、CUDA、Ascend C。”——这一层不是跟CUDA翻脸,是修了座桥。哔哩哔哩

算子层(DeepGEMM/TileKernels/FlashMLA/DeepSelect):官方称"DeepSeek训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现"。但边界也白纸黑字写着:TileKernels仓库列出的昇腾环境只有昇腾950 + CANN 9.2.0及以上,不是对所有昇腾芯片、所有软件版本的兼容承诺;FlashMLA仓库写明,部分融合算子和稠密注意力算子目前仍只支持CUDA。知乎

通信层(DeepEP):覆盖EP、CP、PP、FSDP四种并行模式下的通信算子,华为同时开放了ASC-COMM自定义通信编程库。这是大模型集群最容易"单卡再快、整卡等通信"的环节,也是此前国产芯片最缺公开参照实现的一层。

DeepSeek给昇腾开源了六个组件:99.8%是真的,「部分算子仍只支持CUDA」也是真的

实践层(CANN):单卡到大规模部署的PyTorch原生预训练、低精度量化训练、LoRA微调、Agentic RL、超长文本KV Cache池化。知乎那个114收藏的高赞答案把意义说透了:“TileLang@Ascend可以被记录在历史中——就像Triton之于OpenAI,TileLang之于DeepSeek和北京大学,走出来一条不同于CUDA之于NV GPU的路线”。知乎

DeepSeek给昇腾开源了六个组件:99.8%是真的,「部分算子仍只支持CUDA」也是真的

四、放回这90天的CUDA叙事里

过去90天,“填护城河"的新闻一茬接一茬:高通买走Mojo是厂商层的,AMD喊话是竞品层的,GPU编程分轨之争是开发者层的。而今天这个事件的差异化在于:第一次是一家前沿模型公司,把自己真实训练和推理栈的底层,成套搬上国产芯片并开源出来。彭博社"或将取代英伟达"的标题是外部视角的放大;仓库注释提醒我们,实际状态仍是"移植进行中”,不是"替代完成时"。

DeepSeek给昇腾开源了六个组件:99.8%是真的,「部分算子仍只支持CUDA」也是真的

五、三类人分别怎么消化今天

CUDA算子/AI infra开发者:值得花一个周末读代码。同一套Python接口分别走NVIDIA和昇腾后端,是这类高级算子语言第一次被前沿模型的训练需求在双平台上验证;如果你已经在跟Triton,TileLang的编程模型是低迁移成本的外延。

推理部署工程师:EP32那组数不能直接搬到生产,但"离线纯模型+128K上下文+投机接受率0.85"的条件标注本身就是值得收藏的复现模板。近期在评估国产算力方案的,拿这套条件去要求供应商给同口径数字,而不是看通稿大数。

DeepSeek给昇腾开源了六个组件:99.8%是真的,「部分算子仍只支持CUDA」也是真的

采购/预算决策者:迁移成本清单这次可以照着开源仓库列——950DT商用版本尚未发布(PoC成绩≠商用成绩)、CANN版本下限9.2.0、FlashMLA部分算子仍缺昇腾后端、文档完备度和报错响应能力待商用验证。用卓寿杰的原话收尾最诚实:“一条路修好了没有,不看剪彩那天有多热闹,要看后来的人敢不敢从这条路上过”。知乎

六、接下来盯什么

  1. 昇腾950DT商用版本的发布时间与供货节奏;

  2. DeepGEMM/DeepEP仓库是否随商用硬件更新实测数据(PoC数字→商用数字的差值才是真账);

  3. FlashMLA稠密/融合算子的昇腾后端补齐进度;

  4. 是否有第三方团队按README复现出EP32推理数据;

  5. CANN开源社区对外部PR和issue的接受度与响应速度。

今天的真实增量,不是"国产算力又能跑模型了"的新闻复读,而是一家前沿模型公司第一次把训练推理栈的底层整套摆上非CUDA平台、连哪里还不行都标注给你看。99.8%和"仍只支持CUDA"出现在同一批仓库里,这比任何单一数字都更接近国产算力栈该有的成熟姿势。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章