张大妈

INT8 vs FP8:低比特量化下谁更胜一筹?

源自知乎:简枫

01-29 20:00

当前AI硬件正大力支持FP8等低精度浮点格式,但一项严谨的研究指出,在细粒度量化下,INT8格式可能才是更优解。它通过理论模型和实验,挑战了主流认知,为未来的AI加速器设计提供了新视角,值得深入探讨。

INT8 vs FP8:低比特量化下谁更胜一筹?智能速览

  • 论文建立QSNR理论模型,从数据分布特性对比INT与FP格式。

  • 在细粒度量化下,INT8有效精度可超越FP8,因局部数据无需大动态范围。

  • 通过Hadamard变换,4bit的INT性能也能反超FP4格式。

  • 提出对称裁剪技术,解决了INT8训练难题,实现近乎无损的训练效果。

  • 硬件层面,INT算力单元相比FP更具成本效益,呼吁业界重新审视。

INT8 vs FP8:低比特量化下谁更胜一筹?精华内容

主流硬件倾向于FP8,但这篇研究从理论层面提出了不同见解,深入探讨了量化精度与数据分布的内在联系。

理论模型对比

研究的核心是建立一个基于量化信噪比(QSNR)的理论模型。该模型通过计算数据的峰值因子来衡量离群点的严重程度。

对于INT格式,其精度与峰值因子成反比,离群点越严重,为了覆盖最大值,量化步长就越大,导致整体噪声增加。

而对于FP格式,精度主要受尾数位数限制,对离群点不那么敏感,因为指数位可以自动调整数值范围。

INT8反超FP8

关键发现在于,当量化粒度细化到Block级别(如Block size=32)时,局部数据分布的峰值因子会显著降低。

在这种场景下,FP格式将大量比特位用于指数以换取宽动态范围,成为了一种“浪费”。

相比之下,INT格式因不需要那么大的动态范围,可以将比特位更充分地用于表示精度,从而在QSNR表现上反超FP8。

4bit与训练突破

在4bit量化的对比中,直接使用INT4表现不如FP4。但论文引入了随机Hadamard变换进行预处理,使数据分布更均匀。

实验证明,经过变换后,NVINT4的信噪比显著提升,超越了NVFP4。

此外,针对INT8训练中Loss不降的问题,研究提出对称裁剪技术,将量化范围从[-128, 127]强制限定为[-127, 127],保证了零点对称,使训练效果几乎与BF16无异。

硬件设计启示

这项研究的结论对AI芯片设计具有直接指导意义。尽管细粒度格式需要处理共享指数,但INT的算术逻辑单元(MAC)在硬件成本和功耗上通常比FP单元更便宜。

既然在细粒度场景下INT能提供更高的有效精度,未来的AI加速器设计者或许应该重新评估,而不是一味地增加对FP8/FP4等浮点单元的支持,从而在能效和性能上找到更好的平衡点。

这项研究通过严谨的分析,为低比特量化领域带来了重要启示。它挑战了当前对FP格式的依赖,并证明在特定条件下INT格式更具优势。未来AI芯片的设计方向是否会因此调整,值得业界深思。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章