今天早上的 GPU 并行计算圈,基本被同一件事刷屏了:DeepSeek 于 9 月 30 日正式开源面向华为昇腾算力平台的基础设施组件,一共六个——TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect。配套的标题满天飞:“中国CUDA”“护城河一夜崩塌”“把芯片榨到极限的99.8%”。每日经济新闻
但公告里真正重的那句话,其实只有五个字:“所有组件与此前面向英伟达平台的开源组件一一对应”。知乎上有条 237 赞的回答说得很准:开头这句平淡冷静的白描,比"原子弹爆炸"式的修辞更震撼。这篇文章就想把这五个字拆开:对应了什么、没对应什么、不同位置的人今天该干嘛。知乎

先把「一一对应」的表摊开:六个组件各补哪块
TileLang 负责"写":写算子用的高级语言。DeepSeek 的说法是,这条路线已在英伟达平台验证,承载了 DeepSeek V4 系列模型训练中大部分算子的实现;这次昇腾版进一步封装 Ascend C 底层指令,华为同时开放 Ascend C 编程接口与 PTO ISA 底层指令做编译对接。
DeepGEMM 负责矩阵计算,TileKernels 负责基础向量与数据搬运,FlashMLA 负责稀疏注意力(长上下文场景),DeepSelect 负责数据筛选。
DeepEP 负责多卡通信,覆盖 EP、CP、PP、FSDP 四类并行模式下的通信算子——专家并行、上下文并行、流水线并行、全分片数据并行。
华为侧配合披露:基于昇腾950的128卡超节点方案,组网采用 SuperPoD Flex 与 UBL128 全互联设计,并同步开放 ASC-COMM 高性能自定义通信编程库。机器之心
数字方面,华为披露相关测试中 DeepEP 的 Dispatch 带宽 375 GB/s、Combine 带宽 347 GB/s;官方的表述是,在多项关键测试用例中这些组件的计算和通信性能已经接近硬件上限。同时放出的还有基于 EP32 策略的 DeepSeek-V4.1-Flash 离线推理数据(ContextLength 128K、DSpark 投机接受率 0.85,统计 TPOT 与每卡输出吞吐,5ms 档每卡输出 2469 tokens/s、10ms 档 5102 tokens/s);但要注意,这些数据均来自 Offline 推理模式,统计的是不带框架的纯模型性能,不包含 Serving 调度和框架负载均衡的影响。所以"接近上限"是官方原话,"99.8%"是自媒体的转述口径,引用时请分得清。深科技机器之心
「一一对应」的本质:被搬过去的是算子,不是人
知乎一堆"生态赢了"的解读,都绕开了一个更值钱的技术事实。知乎"乱序摸鱼"的回答把这轮工程的难度讲透了:昇腾950和N卡的差异根本不是"SIMT vs SIMD"一句话——Cube/Vector 两条计算流水、L1/L0A/L0B/L0C/UB 各司其职的存储层级、MTE 搬运引擎、进 Cube 必须满足的 fractal layout,都是和 CUDA 线程层次完全不同的世界观;而在 Ascend C 上写算子,最折磨人的也从来是同步,MTE、Cube、Vector 各自独立流水,程序员脑子里要一直维护一张时间表,哪个 Wait 放早了性能掉、放晚了结果错。知乎

TileLang 昇腾版的选择很克制:它没有假装两套架构一样,反而把昇腾特有的东西暴露到前端(T.alloc_l1、T.alloc_l0a/l0b/l0c、T.SimtVF、T.dual_copy 这些接口),然后在编译器里把最难的活接走——AutoSchedule 用微软开源的 Z3 求解器给软件流水排时间表(迭代间隔、multi-buffer 开几份、latency 和 issue interval 分开算),InsertSync 再把方案落成机器真正执行的 Set/Wait,真正想拿掉的正是人肉维护同步这张时间表。官方仓库那个 GEMM+ReLU 例子,性能和主线 Ascend C 已经打得有来有回,代码行数却差了好几倍。知乎
这才是"一一对应"的真实含义:DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现——对应的是算子层。把 CUDA 世界观和昇腾世界观之间那道墙凿穿的活,是编译器团队干的,不是你迁移时要干的。机器之心
这四件事没「对应」,别顺嘴替它官宣
生态没对应。把 TileLang 通俗地称为"国产版CUDA"方便理解,但严格来说,它目前还不能等同于 CUDA 完整的软件生态——CUDA 的墙是二十年攒下的算子库、调试器、Profiler、第三方框架和文档,昇腾这边对应工具链的成熟度,不在今天这条公告里。深科技
供给没对应。微博9月流传的爆料称,过去三个月昇腾950DT建议售价上涨约60%、单颗报价达到25万元、定价对标英伟达B200。另有彭博社被转述的报道:DeepSeek向华为订购了16万颗昇腾950DT芯片、主要用于AI推理,且因产能问题暂时无法全部满足。这些都还是媒体/传闻口径——但它们说明一件事:迁移的物理瓶颈在存储和产能侧,代码开源解决不了下单排产。微博微博
第三方模型没对应。这整套组件是从 DeepSeek 自家训练需求里长出来的,其他模型团队会不会真用、维护成本落在谁头上,还没答案。
"划算"没对应。能跑、跑得快、跑得省,是三件事。知乎也有回答提醒:首先意味着国产LAB与国产GPU深度耦合,一段时间内国产模型探索智能上限的努力会减弱,而为国产卡定制便宜能用的高效模型成为主要任务——那是产业叙事,不是你这台机器上的事。知乎
关于供给,那篇专讲灵衢2.0与超节点的知乎技术专栏还仿真过一笔账:规模越大,"只是路过"的流量占比越高——16×16 环面时已达 77.8%,而没有片上转发时,中转流量要进芯片、落 DRAM/L2 再发出,每个字节在 DRAM 上留下入、出两次痕迹。超节点的故事讲到最后,拼的还是存储。知乎

按位置给你一句话
CUDA kernel 老手:别慌"技能清零",但也别装看不见——PTX、TMA、warp specialization 这类绑死N卡硬件的经验确实在贬值;tile 化思维、计算与通信重叠、存储层级建模这些恰恰在升值,TileLang@Ascend 今天证明的就是后者能跨架构搬。
准备入学的:7月社区还在"TileLang弃坑指南"和"第二大kernel DSL"之间吵,今天又多一个后端。语言不是门票,GEMM 和通信的底层账才是,先把矩阵乘从1%利用率优化到跑不满再挑方言。
评估国产算力的团队:盯三个信号——PyTorch 与 CANN 的官方适配进度;DeepSeek 之外的模型团队是否开始复用这套组件;能否复现出带 Serving 调度的在线数字(官方给的是 Offline 纯模型)。
刷到"一夜换天"标题的:官方原话是"多项关键测试用例中接近硬件性能上限"。证据覆盖到哪,结论就说到哪。
"一一对应"这五个字,标志着算子层的进度,不是生态层的完稿。要不要动、什么时候动,用上面三个信号量,别用情绪量。