AI 的“超级粮仓”:存储设备如何喂饱算力巨兽?
在 AI 飞速发展的进程中,人们通常关注算力强大的 GPU 芯片,却容易忽视一个关键问题:这些算力核心经常处于数据供应不足的状态。

就像自助餐厅里食客众多而后厨出餐速度滞后一样,当前 AI 领域中,存储系统的性能直接决定了 AI 能否高效运行。西部数据近期公布的 MLPerf 测试结果,清晰地展示了 AI 存储系统的实际性能水平。
什么是MLPerf 测试
MLPerf 由全球顶尖高校、企业和研究机构共同制定,是行业公认的权威 AI 性能基准测试。

它通过模拟真实的 AI 训练和推理场景,对硬件(如 GPU、存储)和软件(如算法、调度系统)的综合表现进行测试。
测试结果公开发布,便于企业和用户直观对比不同方案的性能。此次西部数据公布的 MLPerf 结果,体现了其存储方案在 AI 性能测试中的良好表现。
AI 面临的存储瓶颈问题
AI 的核心过程是 “训练”,即利用海量数据让模型掌握识别图像、理解语言或预测结果等能力。

在这一过程中,数据是基础,GPU 是处理数据的核心。但目前存在明显的供需失衡:以主流的 H100 GPU 为例,其算力需求每年增长 10 倍;而传统的 SSD 等存储设备,传输速度每年仅能提升 20%。
这种差距导致 30% 的 GPU 时间因等待数据而被浪费,形成了 AI 发展的 “存储瓶颈”,并非算力不足,而是数据传输无法满足需求。
西部数据的智能存储解决方案
为解决 AI 的存储难题,西部数据推出了由 OpenFlex Data24 存储柜、铠侠 CM7-V SSD 硬盘和 PEAK:AIO 智能软件组成的 “智能厨房系统” 解决方案,构建了全新的存储架构。


该方案的核心是实现存储与计算分离,建立高效的集中式存储资源池。与传统存储方案相比,其优势显著:传统方案中每个 GPU 绑定本地 SSD,数据传输路径长,扩容需整体更换设备;而西部数据方案通过 NVMe-oF 协议实现直连,存储设备集中成资源池,可单独添加存储柜或 GPU 节点进行扩容。

这使得计算和存储能按需独立扩展,数据传输延迟降至微秒级,成本降低 40% 以上。其中,NVMe-oF 协议大幅提升了以太网传输速度,使其可与本地硬盘媲美,有效解决了数据传输慢的问题。
MLPerf 测试中的典型场景
MLPerf 测试在两种典型场景中对西部数据的方案进行了验证,结果如下:
场景一:医学影像分析(3D-UNet 模型)
医学影像多为三维海量数据,AI 分析需连续读取这些大文件。在该场景下,西部数据的纯硬件方案成功支撑 36 个 H100 GPU 运行,数据吞吐量达到 106.5GB/s;软硬结合方案中,单个存储节点可支撑 22 个 GPU 同时工作,效率大幅提高。
场景二:图像识别(ResNet-50 模型)
图像识别需快速读取大量小文件,对存储的灵活调度能力要求较高。西部数据的方案在此场景下支撑了 186 个模拟 GPU 同时训练,单个节点能满足 52 个 GPU 的需求。其关键突破在于通过智能数据调度,实现了存储设备与 GPU 的最优配比,避免了资源闲置。
基于 MLPerf 测试结果,企业在选择 AI 存储时,可关注西部数据方案的三大核心价值:

一是空间革命,1 个存储柜可替代数十台服务器里的本地 SSD,大幅节省空间;
二是成本控制,能够根据实际需求按需扩容,避免因短期算力需求而过度采购存储设备造成浪费;
三是无缝扩展,存储系统可从支撑 1 个 GPU 平滑扩展至支撑数百个 GPU,适应不同规模的需求。
西部数据的方案揭示了 AI 存储领域的三大发展趋势:

一是协议革命,NVMe-oF 协议正逐步取代传统的存储网络(SAN),成为 AI 存储的新标准;
二是软件定义,PEAK:AIO 等智能软件可实现冷热数据自动调度,将常用数据置于高速存储区域,不常用数据放入储备区域,提升存储效率;
三是解耦架构,计算与存储的独立扩展成为超大规模 AI 集群的标配,就像从各家自备发电机升级到智能电网,显著提高了整体系统的效率和可靠性。

随着 AI 模型参数突破万亿级,存储系统在 AI 领域的地位日益凸显。数据作为智能时代的 “新石油”,其传输依赖于高效的存储系统。西部数据的实践表明,打破 “存算一体” 的传统模式,构建弹性、智能的数据供应链,是让 AI 高效运行的关键。只有确保充足的数据供应,才能支撑 AI 持续发展。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
