闪存抢HBM的活?铠侠GP1:GPU直连闪存新突破

2026-08-11 18:56:25 0点赞 0收藏 0评论

2026年8月11日

一、事件

2026年8月3日,铠侠在FMS 2026全球闪存峰会上发布KIOXIA GP1系列PCIe 6.0 NVMe固态硬盘——业界首款专为GPU直接访问优化的"超高IOPS SSD"。核心参数:随机读取1000万IOPS(512字节粒度),耐久度50 DWPD,基于第二代XL-FLASH存储级内存(SCM),评估样品2026年底交付。产品随即斩获FMS 2026"最佳展品奖"。

闪存抢HBM的活?铠侠GP1:GPU直连闪存新突破

二、技术原理

2.1 介质层:第二代XL-FLASH

GP1的核心是铠侠自研的XL-FLASH——定位在DRAM与传统NAND之间的存储级内存(SCM),英特尔傲腾退役后,它是全球唯一仍在持续推进的SCM商业化路线。

其关键技术特征:

- 16平面架构(传统NAND仅2-4平面),并行度大幅提升;

- 短字线/位线设计,读取延迟低于5微秒(传统TLC约50-100微秒);

- 4KB小页大小(传统NAND为16KB),大幅降低读写放大;

- 第二代支持MLC模式,每单元存储2bit,在性能与成本间取得平衡。

2.2 架构层:GPU直连闪存——SCADA

传统架构下,GPU访问存储数据必须经CPU中转:GPU请求→CPU构造NVMe命令→提交队列→SSD处理→CPU拷贝数据到GPU显存。当每秒需处理数百万次512字节小请求时,CPU成为瓶颈。

英伟达SCADA架构将存储控制路径也转移到GPU上——GPU自己构造命令、管理队列深度、处理完成中断。其理论基础是ASPLOS 2023发表的BaM研究:GPU直管NVMe驱动,数据分析速度快5.3倍,图计算硬件成本降低21.7倍。FMS 2026上美光演示:3颗H100驱动44块PCIe Gen6 SSD,实现2.3亿次512字节随机读取IOPS,CPU几乎空闲。

2.3 协议层:cuFile开源与Storage-Next

英伟达同场将cuFile API及完整存储软件栈开源(GitHub XIO-SIG组织,创始维护者包括英伟达、谷歌、Meta、英特尔),并联合40余家厂商成立Storage-Next联盟,核心目标:推动SSD从4KB扇区向512字节扇区演进,从硬件层面适配GPU原生I/O。GP1是该框架下的首款商用产品。

2.4 512字节粒度的关键意义

传统SSD围绕4KB优化,但AI推理场景中KV缓存条目、嵌入向量往往只有几百字节——用4KB的"框"装512字节的"货",导致8倍读取放大。GP1原生支持512字节粒度访问,从硬件层消除这一浪费。

三、价格分析

铠侠未公布GP1具体定价,但可根据存储层级做合理估算:

- HBM3e:约15-25美元/GB(2026年现货价较半年前暴涨超300%,有价无市);

- XL-FLASH(SCM级):估算0.5-1.5美元/GB;

- 企业级TLC SSD:约0.1-0.3美元/GB。

即用XL-FLASH替代HBM做内存扩展,每GB成本降低约10-50倍。但性能差距同样巨大——HBM带宽为TB/s级,GP1走PCIe 6.0 x4理论带宽约16GB/s。GP1的定位不是替代HBM,而是与其形成"HBM(热数据)+ XL-FLASH(温数据)+ TLC/QLC SSD(冷数据)"的三级内存-存储体系,使AI系统能以远低于全HBM方案的成本访问更大规模数据集。

四、优缺点

优点:

1. 成本优势显著:相比HBM,每GB成本降低1-2个数量级,为大规模AI部署提供经济可行的内存扩展路径;

2. 512字节原生优化:消除传统SSD的8倍读取放大,精准匹配AI推理场景的I/O模式;

3. 极高耐久度:50 DWPD,远超企业级SSD平均水平(1-3 DWPD),为高强度AI负载留足安全边际;

4. 生态卡位精准:与英伟达Storage-Next深度绑定,cuFile已开源,SCADA架构获40余家厂商支持,英特尔加入维护;

5. SCM赛道独占:英特尔傲腾退役后,XL-FLASH是全球唯一持续推进的SCM商业化方案,竞品短期内难以追赶。

缺点:

1. 生态尚未成熟:GP1样品2026年底才交付,SCADA仍处框架阶段,STX商用系统预计2026下半年才有,早期适配成本高;

2. 与HBM带宽差距悬殊:2-3个数量级的带宽差距意味着延迟敏感型训练任务仍需HBM,GP1仅适用于推理和内存扩展场景;

3. 竞争存在变数:美光9650已在SCADA演示中展现强可扩展性,三星、美光可能通过固件优化在传统NAND上逼近XL-FLASH性能;SK海力士联合闪迪推出的HBF标准在带宽上更具优势;

4. 标准碎片化风险:Storage-Next虽有40余家成员,但512字节扇区、GPU原生命令集等标准落地仍需时间,不同厂商方案可能互不兼容;

5. HBM价格下行风险:若HBM产能大幅扩张导致价格下降,闪存扩展的成本优势将被削弱。

五、对存储行业的影响

5.1 存储层级重构

GP1标志着闪存正式进入"内存时代"。传统存储金字塔(缓存→DRAM→NAND→HDD)正在AI服务器中演变为:HBM(数十GB,TB/s)→XL-FLASH闪存层(数十TB,百万IOPS)→传统TLC/QLC SSD(数百TB,GB/s)。每层成本相差约10倍,形成经济高效的"内存-存储连续体"。

5.2 SSD主控设计范式变革

当GPU取代CPU成为存储访问主体,SSD主控需彻底重构:从4KB扇区优化→512字节优化;从小队列深度(32-128)→大队列深度(数万);从峰值带宽优先→功耗与尾延迟优先。Marvell等厂商已按Storage-Next路线图设计下一代控制器,目标PCIe Gen7时代单盘1亿IOPS。

5.3 AI推理成本结构改变

KV缓存溢出到闪存意味着单个GPU可支持更长上下文和更多并发用户,直接影响AI Agent、RAG等场景的"每用户服务成本"。GP1让"用闪存放KV缓存"从理论走向工程落地,有望推动AI推理从"奢侈品"走向"日用品"。

5.4 竞争格局重塑

三星、SK海力士、美光三大巨头聚焦HBM,铠侠在"闪存上移"方向凭借XL-FLASH独占鳌头,形成错位竞争。但如果Storage-Next生态成功,整个NAND行业都将受益——闪存的总可寻址市场(TAM)将从"存储"扩展至"内存"领域,市场空间数倍放大。

5.5 一个判断

GP1的发布不是一个产品迭代事件,而是一个品类诞生事件。"GPU原生闪存"正在成为AI基础设施中一个独立的新层级——它不抢HBM的活,它抢的是"那些原本因买不起足够HBM而无法规模化部署的AI应用"的活。当AI产业从训练转向推理放量,这一层级的战略价值将持续放大。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松