张大妈

FlashMLA:DeepSeek 如何用一个 CUDA 内核逼近 GPU 理论极限

源自今日头条:AI不止语

02-10 12:18

面对大模型推理中因 KV Cache 过大导致的“内存墙”瓶颈,DeepSeek 开源了核心引擎 FlashMLA。这一高效 CUDA 内核不仅展示了如何将 MLA 算法逼近 GPU 理论性能极限,更通过开源引发了全球硬件厂商的适配潮,揭示了底层工程优化对 AI 发展的关键价值。

FlashMLA:DeepSeek 如何用一个 CUDA 内核逼近 GPU 理论极限智能速览

  • DeepSeek 开源 FlashMLA,一个专为 Hopper 架构优化的 MLA 解码内核。

  • MLA 算法通过低秩压缩,将 KV Cache 大缩减 93.3%,吞吐量反增 5.76 倍。

  • FlashMLA 内核实测可达 660 TFLOPS,接近 H800 理论峰值的 67%。

  • 该内核已获 NVIDIA 官方适配,并被移植至 AMD 及多家国产 GPU 平台。

  • FlashMLA 的成功标志着 AI 竞争从算法创新延伸至工程实现的深度较量。

FlashMLA:DeepSeek 如何用一个 CUDA 内核逼近 GPU 理论极限精华内容

从理论到产品的鸿沟,往往比想象中更宽。DeepSeek 不仅提出了 MLA 算法,更将其实现为逼近硬件极限的 FlashMLA 内核,揭示了顶尖工程实现的关键价值。

推理的内存墙

大模型推理的核心瓶颈在于 KV Cache。在自回归解码过程中,模型需回顾所有历史 token,导致 KV Cache 占用显存随对话长度急剧增长。对于一个 70B 参数的模型,处理 128K 上下文时,单个用户就可能消耗超过 40GB 显存,迫使一张 80GB 的 H100 仅能服务于 1-2 个用户,GPU 计算资源远未饱和。

业界此前的方案如 MQA 和 GQA,均以牺牲模型质量为代价换取空间,并非理想解。

MLA 的压缩艺术

DeepSeek 提出的 MLA 架构另辟蹊径:不减少信息,而是压缩信息存储方式。其核心是低秩压缩,先将输入压缩为一个低维潜在向量并缓存,需要时再解压回完整的 Key 和 Value 向量。

实测数据显示,MLA 将 KV Cache 大小缩减至原来的 6.7%,压缩率高达 93.3%。在此架构下,模型最大生成吞吐量提升了 5.76 倍,且模型质量基准测试反而优于传统方案,颠覆了“压缩必然损失质量”的认知。

内核的极限优化

MLA 算法的高效落地离不开 FlashMLA 内核。标准实现会产生多次 GPU kernel 调用,数据在高速缓存和全局显存间反复搬运,效率低下。FlashMLA 将整个注意力计算融合成一个单一内核,数据只需读写一次。

它针对 NVIDIA Hopper 架构深度优化,利用 TMA 实现异步数据预取,并采用 WGMMA 指令加速矩阵运算。实测在 H800 上,其稠密解码内核计算吞吐高达 660 TFLOPS,实现了约 67% 的理论峰值利用率,远超未优化的 20-30% 水平。

开源的生态涟漪

FlashMLA 的开源迅速引发了全球硬件厂商的“移植”热潮。NVIDIA 官方在 2025 年 8 月为其贡献了 Blackwell 架构的内核代码,AMD 以及沐曦、摩尔线程等多家国产 GPU 厂商也纷纷跟进适配。

这或许是首次有中国 AI 公司的核心基础设施代码被全球生态主动接纳和共建。通过开源底层技术,DeepSeek 正在构建自己的技术标准和生态,这与 Meta 开源 Llama 的战略如出一辙,当技术成为事实标准,商业价值将随之而来。

FlashMLA 的故事清晰地表明,从算法创新到产生实际价值,工程实现是决定性的一步。DeepSeek 不仅贡献了 MLA 这一巧妙算法,更将其打磨至接近硬件极限并开源,为整个社区解决了真实的性能痛点。当底层设施被持续普惠,下一个颠覆性的 AI 应用将从何处萌芽?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章