张大妈

突破内存与存储瓶颈:NVIDIA重构AI时代的数据基础设施

源自公众号:杰尼龟的半导体之家

01-22 19:37

生成式AI的爆发正引发数据中心“内存饥荒”,传统架构难以应对。NVIDIA发布深度报告,提出通过重构数据接口与软件栈,让GPU主导数据处理,从而突破瓶颈,为实时AI应用奠定基础。

突破内存与存储瓶颈:NVIDIA重构AI时代的数据基础设施智能速览

  • AI正推动数据中心支出从传统处理转向GPU加速计算,预计2028年达4500亿美元。

  • 生成式AI与预测类应用对高带宽内存和低延迟存储提出极致要求,传统分层架构功耗比已难支撑。

  • NVIDIA主张将数据控制权从CPU转移给GPU,实现计算与数据管道的独立扩展。

  • BaM与SCADA技术通过优化软件栈和I/O队列,显著提升了GPU与存储的交互效率。

  • 实测显示,SCADA能近乎饱和PCIe带宽,性能远超传统CPU方案,可线性扩展至PB级数据访问。

  • NVIDIA正联合美光、三星等厂商,推动从介质到软件的全栈优化,目标实现毫秒级延迟访问PB级数据。

突破内存与存储瓶颈:NVIDIA重构AI时代的数据基础设施精华内容

面对GPU算力被存储严重浪费的困境,NVIDIA的破局点在于软件架构的革命性创新

AI内存饥荒

生成式AI与大模型的崛起,正引发数据中心一场“计算反转”。数据显示,全球数据中心在极端处理(GPU/加速器)上的支出预计从2019年的100亿美元飙升至2028年的4500亿美元,增速远超传统处理。这一变化的根源在于AI工作负载对内存与存储的极度“饥渴”。

生成式AI依赖大规模模型权重,需要高带宽内存;而推荐系统等预测应用则要求高频访问向量数据,对存储IOPS与低延迟提出严苛挑战。传统“内存-存储”分层架构的容量与功耗比已无法满足Post-GenAI时代的需求,导致GPU算力因数据供应不足而被大量浪费。

GPU主导新范式

在传统数据中心模式中,CPU主导控制路径,GPU仅作为协处理器,通过分块加载数据,效率低下。尽管GPU承担了90%以上的计算任务,却严重依赖CPU串行化的数据调度,导致存储带宽与IOPS利用率低下。

NVIDIA提出“视图访问+无限内存池”的新范式,核心是将控制权向GPU转移,让GPU按需实时获取数据。然而,这一愿景面临巨大挑战:当前软件栈与SSD的性能瓶颈,使其无法匹配GPU的海量并行请求能力。例如,PCIe Gen6的理论IOPS可达2.08亿次,但实际因软件序列化与SSD延迟,队列深度远低于GPU的并行潜力。

破局关键技术

为破解困局,NVIDIA研发了BaM与SCADA两项核心技术。BaM作为早期原型,通过GPU原生NVMe I/O队列绕过CPU,直接与存储池交互,在图计算与分析任务中实现了1.0至5.3倍的性能提升。

SCADA则是更为成熟的集大成者,构建了“用户空间加速、可信GPU内核服务”的软件架构。其核心在于通过客户端库、GPU驱动服务器和uNVMe驱动,消除不必要的数据传输。实测中,基于Gen5系统的SCADA在GNN训练中,性能仅比主机内存慢1.14倍,且完全不使用CPU内存。H100 GPU搭配4块Gen5 SSD时可饱和96%的PCIe带宽,并在Gen6 SSD测试中展现出完美的线性扩展能力。

未来展望与生态

NVIDIA强调,这场变革是“马拉松而非冲刺”。随着Gen6平台的推进和H200等新一代GPU的落地,其“存储-Next”架构旨在实现“毫秒级延迟访问PB级数据”,以支撑RAG、实时推荐等动态AI应用。

为推动这一目标,NVIDIA已联合美光、三星、戴尔、HPE等产业链巨头,通过GTC、OCP等行业会议同步进展,共同推动从介质控制器到软件栈的全栈式优化,为实时AI时代的到来构建一条“高速数据通道”。

NVIDIA通过BaM与SCADA等技术,正在从根本上重塑AI时代的数据基础设施。这不仅解决了眼前的瓶颈问题,更为实时AI、大规模推荐等未来应用构建了高速公路,这场由GPU引领的数据革命,将如何改变AI的边界?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章