AI发展面临存储墙挑战,GPU常因数据传输慢而闲置。计算型存储技术通过将计算能力下沉到存储设备,实现"数据不动计算动",有效解决传统架构的性能瓶颈。
智能速览
GPU因数据传输慢而闲置70%时间,存储已成为AI系统主要瓶颈
计算型存储将计算功能与存储耦合,实现"买容量送算力"模式
英伟达推出ICMSP技术,华为发布三款AI SSD产品布局计算型存储
三星模型参数卸载技术让176B模型推理GPU数量从8个减至1个
数据搬运功耗占比高达63.7%,远超计算本身功耗
计算型存储通过减少数据搬移,实现算力随存储容量线性扩展
精华内容
当AI训练数据从PB级增长到EB级,传统存储架构已无法满足GPU对数据供给的需求。计算型存储技术的崛起,正在重新定义存储设备的使命。
技术瓶颈
在7nm工艺下,数据搬运的功耗占比达到63.7%,远大于数据计算本身的功耗。AI运算需要的存算通道速率是1PB/s,而现有SRAM的10-100TB/s、DRAM的40GB-1TB/s都远达不到要求。存储设备与处理器之间的数据传输速度,已成为制约AI性能的关键因素。
架构革新
计算型存储是一种将计算功能与存储耦合以卸载主机处理或减少数据搬移的架构。通过在SSD控制器中集成专用硬件引擎,实现算力随存储容量线性扩展。这种架构目标在于实现并行计算,或减轻对现有的计算、内存、存储和I/O的限制。
行业实践
英伟达在2026年CES推出Vera Rubin计算平台,通过BlueField-4数据处理器集成Grace CPU,吞吐量高达800Gbps。华为2025年8月发布三款AI SSD产品,其中OceanDisk EX 560极致性能盘随机写性能达1500K IOPS,时延低于7μs。
降本增效
三星采用模型参数卸载技术,让Bloom-176B模型推理所需GPU数量从8个减少至1个,硬件成本降低87.5%。在DeepSeek-7B模型测试中,FastPersist技术使总训练时间减少了66.6%。MinIO打造1 EiB容量的机架级本地存储模块,将AI数据存储扩展至ZB级别。
软件生态
openEuler提供智能存储优化方法论,采用"感知→决策→执行"的闭环策略。oeAware框架实现低负载采集—感知—调优的闭环机制,包括减少内核拷贝与上下文切换、按场景动态调整内存页和缓存策略等智能优化路径。
计算型存储技术正在突破传统架构的存储墙,通过算力下沉实现数据本地处理。随着技术成熟,存储设备将从被动仓库转型为智能计算节点,为AI发展提供更高效的解决方案。未来存储与计算的边界将如何重新定义?