面对新一代 RTX 5090 强大的 FP4 算力,如何高效利用成为关键。清华大学的 SageAttention3 提供了一套解决方案,通过创新的 Microscaling 技术,实现了推理速度的数倍提升与训练精度的保持,为下一代显卡的性能优化指明了方向。
智能速览
SageAttention3 是首个支持 FP4 的 Attention 库。
在 RTX 5090 上比 FlashAttention 快 5 倍。
推理吞吐量突破 1000 TOPS。
支持全链路 8-bit 训练且微调几乎无损。
专为 NVIDIA Blackwell 架构设计,面向未来。
精华内容
这套技术的核心在于 Microscaling,它让 FP4 的低精度优势得以真正释放。
FP4 算力释放
NVIDIA Blackwell 架构引入的 FP4 Tensor Cores 是一次算力跃进,但其应用挑战也随之而来。SageAttention3 作为首个支持 FP4 精度的 Attention 库,通过引入 Microscaling(微缩放)技术,成功解决了低精度计算中的精度损失问题。这使得开发者能够首次在保持模型表现的同时,充分调动 RTX 5090 的 FP4 硬件单元,实现了理论算力到实际性能的有效转化。
性能实测飞跃
真实性能表现是衡量技术价值的硬指标。在 RTX 5090 上的测试数据显示,SageAttention3 的推理速度达到了现有最快方案 FlashAttention 的 5 倍。其硬件吞吐量更是成功突破了 1000 TOPS 大关。这一数据不仅是数字上的增长,更意味着在同等时间内,能够处理更复杂的模型或更大规模的数据集,直接提升了研发效率。
8-bit 训练支持
除了推理加速,SageAttention3 还将优化延伸至模型训练环节。该技术探索了全链路的 8-bit 训练方案。实验结果表明,在进行模型微调任务时,采用该方案几乎不会造成性能损失。这为研究者和开发者提供了一条兼顾效率与精度的训练路径,尤其是在硬件资源有限的情况下,其价值尤为突出。
SageAttention3 为 RTX 5090 等下一代显卡的性能优化树立了新标杆。它不仅是 FP4 时代的高效工具,更展示了软硬件协同设计的巨大潜力。未来的 AI 计算是否会全面转向更低精度?