近年来,以DeepSeek为代表的国产大模型正在与国产芯片进行一场深刻的“双向奔赴”,其核心目标是构建一套独立自主、摆脱对海外技术依赖的AI算力体系。这不仅是一次简单的硬件替换,更是一场涵盖模型设计、软件生态到产业协同的系统性工程。
战略驱动:为何要适配国产芯片?
这一趋势的根本驱动力源于两方面:一是外部环境变化带来的供应链安全考量。长期以来,国内大模型产业的训练与推理几乎完全构建于英伟达GPU及其CUDA软件生态之上。随着外部限制收紧,依赖单一技术路线的风险日益凸显。因此,将顶尖大模型迁移至国产算力平台,实现“自主可控”,成为保障产业长远发展的战略必选项。
二是商业成本与效率的内在需求。DeepSeek系列模型以其高性价比著称,而要进一步降低API调用价格、实现大规模商业化,推理成本是关键。DeepSeek官方已明确表示,其旗舰模型Pro版本的价格,预计在华为昇腾950超节点等国产算力基础设施批量上市后会大幅下调。这清晰地表明,国产算力规模化部署带来的成本优势,已成为其商业模式和定价策略的重要一环。
技术路径:如何实现高效适配?
DeepSeek与国产芯片的适配并非简单的“移植”,而是通过多层次的深度协同优化来达成的。
首先是软硬件协同设计。不同于传统“模型发布后再由芯片厂商被动适配”的模式,DeepSeek等模型厂商在研发阶段就与华为、寒武纪等芯片企业展开合作。例如,在芯片设计阶段就参与优化,确保硬件原生支持模型所需的关键特性,如摩尔线程芯片对FP8低精度格式的原生支持。这种从源头开始的协同,有效解决了底层指令集兼容性和性能瓶셔颈等问题。
其次是底层软件栈的重构与迁移。这场适配的核心战役之一,便是“去CUDA化”。英伟达的护城河不仅在于硬件,更在于其经营多年的CUDA软件生态。为了在国产芯片上跑出效率,DeepSeek投入大量精力,将其部分核心代码从英伟达的CUDA架构重写,迁移至华为的CANN等异构计算框架上。这是一个复杂且艰难的系统工程,需要重构算子库、通信协议、并行框架等多个核心模块。
再次是模型架构与算法的创新。为了更好地适应国产芯片的特性,DeepSeek在模型设计层面也进行了前瞻性考量。通过采用MoE(混合专家)架构,模型在拥有庞大总参数的同时,每次推理仅激活一小部分,从而降低了单次计算的负载。同时,其自研的DSA稀疏注意力等技术,在处理百万级长上下文时,能大幅降低对显存和计算资源的需求。这些算法层面的创新,本质上是为国产算力“减负”,使其在现有硬件条件下也能承载更复杂的AI任务。
最后是生态工具的辅助。以智源研究院的FlagOS为代表的中间层系统软件,在加速适配中扮演了关键角色。FlagOS通过构建统一的算子库、编译器和框架,致力于打破不同芯片架构间的生态壁垒。它能够将DeepSeek V4-Flash这类模型快速适配到包括华为昇腾、海光DCU、寒武纪MLU、摩尔线程MTT等在内的多款国产芯片上,通过实现全算子替代、精度路径转换等技术,将原本需要数周的适配周期缩短至数天,极大地推动了“国模+国芯”的落地效率。
产业协同:从单点突破到生态共建
DeepSeek对国产芯片的适配已超越单一企业行为,演变为一场全产业链的协同行动。
华为昇腾是这场协同中的核心伙伴。DeepSeek V4在其技术报告中,首次将华为昇腾NPU与英伟达GPU并列写入硬件验证清单,这被视为国产AI芯片获得顶级模型“官方认定”的标志性事件。双方不仅在单卡性能上进行优化,如利用昇腾芯片的低精度计算能力提升推理速度,更通过“超节点架构”进行集群层面的创新。华为的超节点方案通过高速互联将大量芯片整合成一个算力整体,以集群优势弥补单卡性能的不足,为万亿参数级别模型的训练和高并发推理提供了可能。
除华为外,寒武纪、海光信息、摩尔线程、天数智芯等众多国产芯片厂商也积极参与其中。例如,寒武纪基于自研的NeuWare软件生态和vLLM框架,连续多次在DeepSeek新模型发布当日(Day 0)便完成适配并开源代码,通过编写高性能融合算子,充分释放其硬件潜力。这种“模型发布即有多芯支持”的局面,标志着国产AI芯片的软件生态成熟度正在持续提升。
挑战与展望:从“可用”迈向“好用”
尽管DeepSeek与国产芯片的适配取得了显著进展,但仍需客观看待其中的挑战。在绝对性能上,国产芯片集群的整体训练效率与英伟达顶级方案相比仍存在差距。CUDA拥有数百万开发者的庞大生态,而国产平台的开发者生态建设仍处于起步阶段,工具链的完善度和易用性有待持续提升。此外,先进制程芯片的产能问题也是限制国产算力规模化供给的关键因素。
DeepSeek适配国产芯片的探索,是中国AI产业走向成熟和独立的关键一步。它证明了通过模型与芯片的深度协同、算法与工程的极致优化,即使在非最优的硬件条件下,也能打造出世界一流的大模型。这不仅是一次技术路线的选择,更是对整个产业链自主可控能力的战略构建。未来,随着国产算力生态的不断完善和应用场景的逐步落地,这场“双向奔赴”将深刻重塑中国乃至全球的AI产业格局。