移动端AI对能效和算力要求日益严苛。三星电子发表于IEEE JSSC的论文,详细解析了其4nm NPU架构如何通过硬件创新,显著提升计算资源利用率并实现多模式动态能效,为业界应对端侧AI推理挑战提供了重要的技术参考。
智能速览
支持INT4/8/16与FP16的统一多精度数据通路
利用特征图稀疏性实现零值跳过,硬件利用率提升4倍
创新采用Scatter-Gather技术,有效优化深度卷积等场景
提供低延迟与Always-On双模式,灵活适配不同应用需求
实测INT8能效达11.59 TOPS/W,面积效率为3.45 TOPS/mm²
精华内容
为应对移动端AI的多样化需求,三星的新一代NPU架构在多精度计算与硬件利用率上实现了关键突破。其核心在于如何通过重构计算流和动态调整运行模式,将有限的硬件资源发挥到极致。
统一多精度设计
为支持INT4、INT8、INT16及FP16等多种计算精度,同时避免为每种精度独立设计数据通路造成的面积浪费,该NPU采用了统一的乘法器阵列。该阵列通过将输入数据智能映射到低位宽乘法器组,实现了计算单元的高度复用。这种设计在满足混合精度计算需求的同时,也保证了MAC阵列的规模化,为高算力奠定了基础。
突破利用率瓶颈
针对深度卷积等场景硬件利用率低的问题,该架构引入了特征图稀疏感知的零值跳过技术。通过利用ReLU激活函数产生的大量零值,在推理InceptionV3时,卷积层的MAC利用率提升了36%。
此外,Scatter-Gather技术通过派遣单元将稀疏向量合并为密集向量,最大化地喂饱计算单元。实测显示,该技术能将深度卷积等操作的延迟降低25%,有效解决了浅层网络和深度可分离卷积的效率难题。
双模式灵活适配
为覆盖差异化的端侧应用场景,NPU设计了两种动态运行模式。Always-On(AON)模式专为语音唤醒等低功耗场景设计,通过无DRAM交互运行,功耗降低89%。
低延迟模式则面向人脸检测、图像分割等实时性要求高的任务。该模式下,双NPU核心协同工作,并通过硬件级Gathering单元实现跨核的Halo数据直传,全程无需软件干预,显著降低了多核通信的开销与延迟。
实测能效与性能
三星内部实测数据显示,在1196MHz频率下,该NPU峰值INT8算力可达19.3TOPS。在运行主流网络时,其能效与面积效率表现突出:运行MobileNetEdgeTPU(INT8)时,能效高达11.59 TOPS/W,面积效率为3.45 TOPS/mm²;运行DeepLabV3(FP16)时,能效为4.26 TFLOPS/W,面积效率为1.72 TFLOPS/mm²。
三星的NPU架构设计为移动端AI加速器的发展指明了方向,其通过软硬件协同优化,在能效、性能与灵活性间取得了出色平衡。未来,随着端侧AI模型愈发复杂,如何在更严苛的功耗限制下进一步提升算力,将是所有芯片设计者需要共同面对的课题。