面对大模型推理中因 KV Cache 过大导致的“内存墙”瓶颈,DeepSeek 开源了核心引擎 FlashMLA。这一高效 CUDA 内核不仅展示了如何将 MLA 算法逼近 GPU 理论性能极限,更通过开源引发了全球硬件厂商的适配潮,揭示了底层工程优化对 AI 发展的关键价值。
智能速览
DeepSeek 开源 FlashMLA,一个专为 Hopper 架构优化的 MLA 解码内核。
MLA 算法通过低秩压缩,将 KV Cache 大缩减 93.3%,吞吐量反增 5.76 倍。
FlashMLA 内核实测可达 660 TFLOPS,接近 H800 理论峰值的 67%。
该内核已获 NVIDIA 官方适配,并被移植至 AMD 及多家国产 GPU 平台。
FlashMLA 的成功标志着 AI 竞争从算法创新延伸至工程实现的深度较量。
精华内容
从理论到产品的鸿沟,往往比想象中更宽。DeepSeek 不仅提出了 MLA 算法,更将其实现为逼近硬件极限的 FlashMLA 内核,揭示了顶尖工程实现的关键价值。
推理的内存墙
大模型推理的核心瓶颈在于 KV Cache。在自回归解码过程中,模型需回顾所有历史 token,导致 KV Cache 占用显存随对话长度急剧增长。对于一个 70B 参数的模型,处理 128K 上下文时,单个用户就可能消耗超过 40GB 显存,迫使一张 80GB 的 H100 仅能服务于 1-2 个用户,GPU 计算资源远未饱和。
业界此前的方案如 MQA 和 GQA,均以牺牲模型质量为代价换取空间,并非理想解。
MLA 的压缩艺术
DeepSeek 提出的 MLA 架构另辟蹊径:不减少信息,而是压缩信息存储方式。其核心是低秩压缩,先将输入压缩为一个低维潜在向量并缓存,需要时再解压回完整的 Key 和 Value 向量。
实测数据显示,MLA 将 KV Cache 大小缩减至原来的 6.7%,压缩率高达 93.3%。在此架构下,模型最大生成吞吐量提升了 5.76 倍,且模型质量基准测试反而优于传统方案,颠覆了“压缩必然损失质量”的认知。
内核的极限优化
MLA 算法的高效落地离不开 FlashMLA 内核。标准实现会产生多次 GPU kernel 调用,数据在高速缓存和全局显存间反复搬运,效率低下。FlashMLA 将整个注意力计算融合成一个单一内核,数据只需读写一次。
它针对 NVIDIA Hopper 架构深度优化,利用 TMA 实现异步数据预取,并采用 WGMMA 指令加速矩阵运算。实测在 H800 上,其稠密解码内核计算吞吐高达 660 TFLOPS,实现了约 67% 的理论峰值利用率,远超未优化的 20-30% 水平。
开源的生态涟漪
FlashMLA 的开源迅速引发了全球硬件厂商的“移植”热潮。NVIDIA 官方在 2025 年 8 月为其贡献了 Blackwell 架构的内核代码,AMD 以及沐曦、摩尔线程等多家国产 GPU 厂商也纷纷跟进适配。
这或许是首次有中国 AI 公司的核心基础设施代码被全球生态主动接纳和共建。通过开源底层技术,DeepSeek 正在构建自己的技术标准和生态,这与 Meta 开源 Llama 的战略如出一辙,当技术成为事实标准,商业价值将随之而来。
FlashMLA 的故事清晰地表明,从算法创新到产生实际价值,工程实现是决定性的一步。DeepSeek 不仅贡献了 MLA 这一巧妙算法,更将其打磨至接近硬件极限并开源,为整个社区解决了真实的性能痛点。当底层设施被持续普惠,下一个颠覆性的 AI 应用将从何处萌芽?