张大妈

论文解读:三星4nm端侧NPU架构解析

源自知乎:芯际漫游

03-03 15:37

移动端AI对能效和算力要求日益严苛。三星电子发表于IEEE JSSC的论文,详细解析了其4nm NPU架构如何通过硬件创新,显著提升计算资源利用率并实现多模式动态能效,为业界应对端侧AI推理挑战提供了重要的技术参考。

论文解读:三星4nm端侧NPU架构解析智能速览

  • 支持INT4/8/16与FP16的统一多精度数据通路

  • 利用特征图稀疏性实现零值跳过,硬件利用率提升4倍

  • 创新采用Scatter-Gather技术,有效优化深度卷积等场景

  • 提供低延迟与Always-On双模式,灵活适配不同应用需求

  • 实测INT8能效达11.59 TOPS/W,面积效率为3.45 TOPS/mm²

论文解读:三星4nm端侧NPU架构解析精华内容

为应对移动端AI的多样化需求,三星的新一代NPU架构在多精度计算与硬件利用率上实现了关键突破。其核心在于如何通过重构计算流和动态调整运行模式,将有限的硬件资源发挥到极致

统一多精度设计

为支持INT4、INT8、INT16及FP16等多种计算精度,同时避免为每种精度独立设计数据通路造成的面积浪费,该NPU采用了统一的乘法器阵列。该阵列通过将输入数据智能映射到低位宽乘法器组,实现了计算单元的高度复用。这种设计在满足混合精度计算需求的同时,也保证了MAC阵列的规模化,为高算力奠定了基础。

突破利用率瓶颈

针对深度卷积等场景硬件利用率低的问题,该架构引入了特征图稀疏感知的零值跳过技术。通过利用ReLU激活函数产生的大量零值,在推理InceptionV3时,卷积层的MAC利用率提升了36%。

此外,Scatter-Gather技术通过派遣单元将稀疏向量合并为密集向量,最大化地喂饱计算单元。实测显示,该技术能将深度卷积等操作的延迟降低25%,有效解决了浅层网络和深度可分离卷积的效率难题。

双模式灵活适配

为覆盖差异化的端侧应用场景,NPU设计了两种动态运行模式。Always-On(AON)模式专为语音唤醒等低功耗场景设计,通过无DRAM交互运行,功耗降低89%。

低延迟模式则面向人脸检测、图像分割等实时性要求高的任务。该模式下,双NPU核心协同工作,并通过硬件级Gathering单元实现跨核的Halo数据直传,全程无需软件干预,显著降低了多核通信的开销与延迟。

实测能效与性能

三星内部实测数据显示,在1196MHz频率下,该NPU峰值INT8算力可达19.3TOPS。在运行主流网络时,其能效与面积效率表现突出:运行MobileNetEdgeTPU(INT8)时,能效高达11.59 TOPS/W,面积效率为3.45 TOPS/mm²;运行DeepLabV3(FP16)时,能效为4.26 TFLOPS/W,面积效率为1.72 TFLOPS/mm²。

三星的NPU架构设计为移动端AI加速器的发展指明了方向,其通过软硬件协同优化,在能效、性能与灵活性间取得了出色平衡。未来,随着端侧AI模型愈发复杂,如何在更严苛的功耗限制下进一步提升算力,将是所有芯片设计者需要共同面对的课题。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章