DeepSeek开源昇腾全家桶,和英伟达版一一对应:CUDA没被绕开,但5090党、租卡的、写代码的,各有一本账要先对完

源自23位全网作者

12:17

9月30日上午,DeepSeek发文,正式开源面向华为昇腾算力平台的基础设施组件:TileLang高级语言编译工具,外加DeepGEMM、DeepEP等计算库和通信库。微博话题#DeepSeek开源昇腾组件意味着什么#当天刷屏,“去英伟达化”"英伟达危机"的标题跟着就上来了。观察者网

但翻完官方原文和开发者社区的实时反应,真正该对账的不是英伟达的股价,而是你手里的三本账:在等的5090会不会变便宜、租的卡要不要换、写的CUDA是不是白学。三本账分开算,一本都不能用情绪对。

一、先把官方原文里"发生了什么"读完——就四件事

1. 清单。 这次开源的是六个组件:TileLang(高级语言编译工具,封装昇腾Ascend C底层指令)、DeepGEMM(通用矩阵运算)、DeepEP(大规模跨设备通信)、TileKernels(常规向量与访存算子)、FlashMLA(稀疏注意力,长上下文用)、DeepSelect(数据筛选)。所有组件与此前面向英伟达平台的开源组件一一对应。观察者网

2. 口径。 官方说多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。注意,这句说的是接近昇腾自己的硬件上限——原文里没有任何一个与英伟达对比的性能数字,"接近上限"和"追上英伟达"是两个不能互换的说法。观察者网

3. 顺序。 容易被标题吃掉的一句是官方原话,TileLang路线首先在英伟达成熟平台上得到了验证,如今已承载了DeepSeek V4系列模型训练中大部分算子的实现。也就是说,这套工具是在N卡上先磨熟的,再搬到昇腾上开源,而且DeepSeek训练里用到的每一个TileLang算子现在昇腾上都有了实现——这是"给昇腾补里子",不是"从CUDA掀桌子"。观察者网

4. 体量。 DeepSeek与华为合作推进的是基于昇腾950的128卡超节点方案。单卡正面硬刚打不过也是公开讨论的一部分:有视频直接摆出单颗算力仅有B300的三分之一这个说法,靠超节点互联抹代差。这是数据中心训练基建的叙事,和你桌面上的显卡隔着一个物种。观察者网哔哩哔哩

二、刷屏标题混在一起的三件事,拆开

“英伟达份额归零” ≠ “英伟达完了”。 那是国内数据中心新增采购口径的极端说法,跟你手里的50系卡没有直接关系;连做这期"英伟达份额归零"视频的账号,上一期标题都还是"华为昇腾单挑依然打不过英伟达"。

“生态被绕开” ≠ “CUDA过气了”。 这次开源给昇腾补的恰恰是生态这块里子,开发者@袁国庆点得很明白:真正难复制的,从来不只是GPU,而是围绕GPU建立起来的编译器、算子、通信库、开发工具和开发者生态。@蘑菇的二姐补了一句:英伟达真正难追的从来不是那块硅片,是CUDA二十年攒下的开发者习惯。反过来说,绕开CUDA这件事DeepSeek自己也没做——它做的是把工具层做薄,让两套硬件都能跑。微博微博

“国产卡春天” ≠ “你能买到”。 B站UP主"白菜工厂1145号员工"9月28日的自测显示昇腾950pr单卡推理ds-v4-flash高达208tps,推理代码已开源,视频拿了570赞、184条评论。但热评前排是另一回事:“昇腾950pr哪买啊?”“告诉我这一张多少钱,让我死心”“一张卡相当于一辆问界M7"“一百万一台8卡都买不到”“华子卡也要被炒家抬价了吗”。代码开源是真,零售渠道不存在也是真。还有更冷的一笔账:有用户吐槽手里的昇腾310P"买来好久了,适配还有问题”——生态不是发布会开的,是踩坑趟出来的。哔哩哔哩

三、三本账,对号入座

账一:准备买显卡的(5090党/50系等等党)。 这条新闻不改你的卡价逻辑,卡价在涨是供给的事:9月29日的显卡日报标题是"中低端显卡全线突破历史新高",播了29.9万、评论4497条。9月30日日报的口风变成"10月份显卡供应或将增加"——注意"或将"两个字,猜测不是公告。双11前盯供应落地,比盯这条热搜有用得多。真要看N卡推理需求会不会松动,看的是DeepSeek后续模型权重是否继续CUDA优先——目前的答案反而在另一边:人家的算子体系本来就先在英伟达平台上跑熟的。哔哩哔哩哔哩哔哩

账二:租卡/攒小算力的。 昇腾线路从"没得买"变成"代码可以自己跑",这是今天消息里对算力用户唯一实质的增量:实测出自个人UP主、渠道价混乱到评论区都在问"哪买",所谓"昇腾也要被炒"目前只是情绪,不是成本。Q4租卡的继续盯N卡侧价格信号(H200级租金近期单月涨了近两成),昇腾侧至少等出现明码标价的租赁报价再重算。

账三:写CUDA的开发者。 先别急着换技术栈,这次开源反而给你的护城河做了个背书——生态难绕是现场共识。TileLang值得跟的点是入门成本:华为全联接大会2025开发者日上,团队介绍了TileLang实现FlashAttention算子开发,代码量从500+行减少至80行,并保持了与官方版本持平的性能。但判断标准听@壹小寒的:模型到处都是,卡上写不动、跑不满才是真事。仓库里那些kernel能不能直接用,看commit、看issue、看有没有人拿真实业务趟,别看热搜。观察者网微博

四、接下来一周,盯四个信号

  1. 英伟达官方在CUDA工具链层面是否回应TileLang昇腾版——截至目前没有回应,真急了会先发开发者文档,不是新闻稿;

  2. DeepSeek V4系列权重发布时是否保持CUDA/昇腾双端同步——"一一对应"能不能扛住新版本迭代;

  3. 10月显卡供应是否如期增加——那是装机党唯一需要设闹钟的事;

  4. 950PR什么时候变成"可下单、可开票、可售后"——在那之前,208 tok/s是实测,不是行情。

顺便一提,DeepSeek正处于IPO前夕、年化营收已经翻倍——这个时点给昇腾开源工具链,商业动机后面会有人继续解读出更多版本。但今天能确定的只有一件事:"CUDA危机"这出戏,目前只是个吓唬。先把卡、租、代码三本账对完,再谈动不动。36氪

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章