外媒爆料:DeepSeek V4将选择华为芯片作为原生运行平台

2026-04-04 15:31:39 0点赞 0收藏 0评论

导语: 据 The Information 与路透社报道,DeepSeek 即将发布的 V4 模型将原生运行在华为芯片上,且打破了行业惯例,未提前向英伟达或 AMD 开放软硬件优化权限。这一决定的背后,不仅是商业算力的转移,更是 AI 底层软件栈与硬件通信拓扑的一次重大重构。

外媒爆料:DeepSeek V4将选择华为芯片作为原生运行平台

1. 跨越 CUDA 护城河:底层算子与异构计算的重构

英伟达在 AI 领域的绝对统治力不仅来源于 GPU 的单卡算力,更源于其深耕多年的 CUDA 软件生态。绝大多数大模型厂商高度依赖 CUDA 提供的底层算子库(如 cuBLAS、cuDNN)来实现高效的矩阵运算。

DeepSeek V4 转向华为昇腾芯片,意味着其研发团队必须跨越异构计算的壁垒:

  • 弃用高度封装的 CUDA: 团队需要深入华为的 CANN(Compute Architecture for Neural Networks,异构计算架构)

  • 自定义算子级优化: DeepSeek 历来以极致的工程优化著称(如 V3 时期的 PTX 汇编级优化)。在 V4 上,他们极有可能直接针对昇腾架构的张量核心(Da Vinci 架构的 Cube 单元)重写了核心算子。

  • 通信与计算重叠(Compute-Communication Overlap): 为了弥补不同硬件在算力分配上的差异,模型需要通过深度修改底层调度逻辑,隐藏数据在芯片间传输的延迟。

2. 架构适配:MoE 与 MLA 机制的显存与带宽挑战

DeepSeek 模型的核心架构特性是 MoE(混合专家模型)MLA(多头潜在注意力机制),这两者对硬件的显存容量、显存带宽(HBM)以及片间互联(Interconnect)提出了严苛要求。

  • 互联带宽的适配: 英伟达的护城河在于 NVLink 和 NVSwitch,能提供极高的单节点内通信带宽。昇腾芯片使用的是华为自研的 HCCS(Huawei Cache Coherent System) 协议。DeepSeek V4 必须针对 HCCS 的拓扑结构(如 Ring 或 Mesh)重新设计 MoE 的专家路由(Expert Routing)策略,以减少跨卡、跨节点的通信开销(All-to-All 通信瓶颈)。

  • 显存墙的突破: MLA 架构的初衷就是大幅压缩 KV Cache 的显存占用。在适配华为芯片时,这种架构优势被进一步放大,使得同等参数规模的模型可以在单卡显存有限或显存带宽稍弱的集群上实现高效的端到端推理。

3. 训练与推理的工程解耦

外媒报道中强调了 V4 将“运行(Run)”在华为芯片上,这在工程实践中通常涉及训练(Training)与推理(Inference)的解耦:

  • 超大规模分布式训练的容错率: 训练万亿参数的 MoE 模型,集群规模动辄上万张卡。训练阶段最大的挑战是集群的稳定性(如频繁的节点宕机导致的 Checkpoint 恢复)。英伟达在集群纠错和网络架构(InfiniBand)上优势明显。如果 DeepSeek V4 实现了在昇腾集群上的完全原生训练,这表明华为集群的软硬件协同稳定性和 RoCE v2 网络的高可用性已达到极高水准。

  • 推理成本的指数级压缩: 推理阶段是真正产生算力消耗(烧钱)的环节。DeepSeek 将 V4 的推理负载全面向华为昇腾转移,这意味着在 FP8/INT8 量化部署下,昇腾芯片的整数/低精度浮点运算性能已经能够完全满足实际业务需求,从而大幅降低了模型的 TCO(总体拥有成本)。

4. 对行业技术演进的影响

DeepSeek 拒绝提前向英伟达提供底层优化权限,这意味着它不再将自身模型的性能上限绑定在英伟达未来一代的硬件(如 Blackwell 架构)上。

这也标志着大模型开发范式的转变:从“模型适配硬件生态”转变为“硬件生态必须去适配顶尖模型”。 一旦 DeepSeek 证明了基于开源/国产软件栈(如基于 Triton 编译器或直接调用 CANN)能够达到甚至超越高度封闭的 CUDA 体系的效率,这将极大削弱底层硬件厂商的话语权。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松