DeepSeek把吃饭的家伙整个搬上了昇腾:六大组件与英伟达那套一一对应——喊"手撕CUDA"之前,先分清实锤、官方口径和还没发生的

源自19位全网作者

08:18

假期前最后一个工作日的上午,DeepSeek官微挂出了新公告。微博上#DeepSeek官宣开源昇腾基础组件#挂起投票,知乎"如何评价"类问题一天内开出好几个,有人刷"梁圣的恩情还不完",也有人直接开炮"手撕CUDA绑定"。每日经济新闻

但把公告原文、各家解读和昇腾社区过去一年的动作摆在一起看,这件事既没有吹的那么"一夜变天",也没有无感的人想的那么"又一篇公关稿"。它真正改变的东西很具体,没改变的东西也很具体——这篇帮你把两边都数清楚。

开源的不是模型,是DeepSeek自己训练用的"工具箱"

这次放出来的不是新权重、不是API、也不是价格战,而是六件东西:TileLang高级语言编译工具,加上DeepGEMM(矩阵运算加速)、DeepEP(跨设备通信)、TileKernels(向量计算与访存)、FlashMLA(稀疏注意力)、DeepSelect(注意力索引与Top-K采样)五个计算/通信库,官方称这批组件与此前面向英伟达平台的开源组件一一对应。机器之心

含金量最高的是TileLang。按DeepSeek自己的介绍,这套算子编程语言已经承载了V4系列模型训练中大部分算子的实现——也就是说,这不是给昇腾写的演示工程,而是DeepSeek内部天天在用的那套。昇腾版直接封装底层AscendC指令,官方称"目前训练中使用的每一个TileLang算子,在昇腾上都有对应的高性能实现"。TileKernels甚至做到同一套Python接口,英伟达GPU和华为NPU两头跑,底层实现按硬件自动选择。腾讯科技

过去一年半,国产卡真正的门槛从来不是芯片参数表,而是软件栈——流传很广的一个解读口径说得直白:一张几万元的AI芯片,可能只发挥出20%的理论性能。梁文锋本人在近期会议录音里也讲过同样的判断:国产卡适配有个难题,叫生态不好——买了卡用不起来,因为没有英伟达那个生态。这次等于模型公司亲手把跑动的那套工具补齐了。知乎知乎

实锤、官方口径、还没发生:这笔账要分三档算

实锤档:六组件开源、与英伟达侧一一对应、双方共同推进基于昇腾950的128卡超节点方案、TileLang承载V4训练大部分算子——这些是公告原文和腾讯科技、机器之心报道确认的。腾讯科技

官方口径档:DeepSeek称多项关键测试用例的性能已接近硬件上限,但同时承认成绩属于特定测试条件下的结果。自媒体版本写成"芯片还没开卖就被榨到硬件极限的99.8%",这个99.8%在公告里找不到出处。另一端"只发挥20%"也是解读口径,不是官方实测。两头都别照单全收。腾讯科技

还没发生档:DeepEP昇腾版的清单里仍列着开发中的功能,公告也没有披露V4已在昇腾上完成全流程大规模训练。接口能复用不等于性能打磨完——知乎上有开发者提醒得很到位,你的应用能不能迁,要分开核四件事:函数还能不能调用、数据能不能被正确读取、依赖的功能有没有实现、请求能不能完整返回,开源文档只回答了其中一部分。腾讯科技知乎

把时间线拉长了看,这是一条铺了一年半的跑道

单看9月30日像一颗炸弹,串起来看是一条走了快一年半的接力。

2025年8月,DeepSeek发布V3.1时就把FP8格式设计"面向下一代国产芯片"写进了说明,同月华为宣布CANN全面开源开放。同年9月29日,V3.2-Exp发布引入稀疏注意力,TileLang-Ascend在同一天开源。2026年4月24日,V4预览版发布,昇腾适配延伸到推理和训练侧,开放原子开源基金会披露的实践已经包括AscendC融合算子和续训练优化。36氪腾讯科技

9月28日,B站开发者放出实测:昇腾950PR单卡跑V4-Flash推理,高达208 token/s,推理代码全部开源。一天之后,六组件成套开源,叠加950 128卡超节点联合优化。从"芯片发布没人会用"到"软件栈修到模型训练层",节奏是每半年推进一格。华为那条路线图也在同步往前赶——昇腾960和Atlas 960 SuperPoD原指向2027年四季度,现在960DT提前到了2027年一季度。等的不就是这条软件跑道铺完?哔哩哔哩知乎

DeepSeek图什么:70%的算力问题

梁文锋近期在投资者会议上的说法被The Information捅了出来:DeepSeek超过70%的算力用于训练,留给推理的不足30%。钱能买卡,但新硬件能不能变成有效算力,取决于软件适配和运行效率。腾讯科技

而另一头,腾讯科技9月24日报道其规模500亿元的第二轮融资接近结束,路透社的说法是已聘请中信证券筹备潜在科创板IPO。昇腾上的工具越完善,DeepSeek未来扩训练算力时工程重投的成本就越低。公告里那句"希望TileLang昇腾版能为更多AI芯片建立高可用软件生态起到示范作用",则是把格局明说了:这是要修一条所有国产卡都能上的路。腾讯科技

现在该动的人,和不该动的人

手上已有昇腾卡做推理的开发者:本周就能动。对照六组件清单查你的依赖项,TileLang算子和TileKernels双接口先试;DeepEP有依赖的,看清哪些功能还在开发列表里,别按"已完成"排期。

想把训练整体搬上国产卡的团队:再等。等"V4全流程在昇腾上完成大规模训练"这种实锤披露,或第三方长周期跑分。工信部9月上旬印发的规划给2030年定了9800EFLOPS的智能算力规模目标,而截至2026年7月底的存量只有2185EFLOPS——缺口是真的;同一篇文章还点出了另一面:约三成算力闲置,错配也是真的,别用情绪排产。知乎

白嫖API的个人用户:你的账单这周没有任何变化。值得留个心眼的是:国产卡承接开源模型的能力每上一个台阶,国内厂商V4类开源模型的API报价就有下探空间——降价比发新品更值得你收藏这篇的理由。

看板块的人:9月30日节前最后一天国产算力链的情绪,定价的是"软件栈补齐"这六个字。假期后接着看的是交付和利用率,不是概念——昇腾950系列下半年才正式上市开卖,硬件的代差和"超节点掀桌"的体系打法,是同一场戏的两面。

节后盯三个信号

  1. DeepSeek是否官宣V4在昇腾上完成全流程大规模训练——训练侧"能用"和"好用"的分水岭;

  2. DeepEP昇腾版开发中的功能是否补齐、什么时候;

  3. 是否出现第二家模型公司直接复用这套组件(而不只是华为自家适配)——"示范作用"成立与否,就看这一步。

三条里哪怕只兑现第一条,"国产卡历史性机遇"这句话就不再是会议录音里的愿景,而是你排期表上可以改的那一行。在那之前,把99.8%和20%都先放下,对表干活。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章