闪存抢HBM的活?铠侠GP1:GPU直连闪存新突破
2026年8月11日
一、事件
2026年8月3日,铠侠在FMS 2026全球闪存峰会上发布KIOXIA GP1系列PCIe 6.0 NVMe固态硬盘——业界首款专为GPU直接访问优化的"超高IOPS SSD"。核心参数:随机读取1000万IOPS(512字节粒度),耐久度50 DWPD,基于第二代XL-FLASH存储级内存(SCM),评估样品2026年底交付。产品随即斩获FMS 2026"最佳展品奖"。

二、技术原理
2.1 介质层:第二代XL-FLASH
GP1的核心是铠侠自研的XL-FLASH——定位在DRAM与传统NAND之间的存储级内存(SCM),英特尔傲腾退役后,它是全球唯一仍在持续推进的SCM商业化路线。
其关键技术特征:
- 16平面架构(传统NAND仅2-4平面),并行度大幅提升;
- 短字线/位线设计,读取延迟低于5微秒(传统TLC约50-100微秒);
- 4KB小页大小(传统NAND为16KB),大幅降低读写放大;
- 第二代支持MLC模式,每单元存储2bit,在性能与成本间取得平衡。
2.2 架构层:GPU直连闪存——SCADA
传统架构下,GPU访问存储数据必须经CPU中转:GPU请求→CPU构造NVMe命令→提交队列→SSD处理→CPU拷贝数据到GPU显存。当每秒需处理数百万次512字节小请求时,CPU成为瓶颈。
英伟达SCADA架构将存储控制路径也转移到GPU上——GPU自己构造命令、管理队列深度、处理完成中断。其理论基础是ASPLOS 2023发表的BaM研究:GPU直管NVMe驱动,数据分析速度快5.3倍,图计算硬件成本降低21.7倍。FMS 2026上美光演示:3颗H100驱动44块PCIe Gen6 SSD,实现2.3亿次512字节随机读取IOPS,CPU几乎空闲。
2.3 协议层:cuFile开源与Storage-Next
英伟达同场将cuFile API及完整存储软件栈开源(GitHub XIO-SIG组织,创始维护者包括英伟达、谷歌、Meta、英特尔),并联合40余家厂商成立Storage-Next联盟,核心目标:推动SSD从4KB扇区向512字节扇区演进,从硬件层面适配GPU原生I/O。GP1是该框架下的首款商用产品。
2.4 512字节粒度的关键意义
传统SSD围绕4KB优化,但AI推理场景中KV缓存条目、嵌入向量往往只有几百字节——用4KB的"框"装512字节的"货",导致8倍读取放大。GP1原生支持512字节粒度访问,从硬件层消除这一浪费。
三、价格分析
铠侠未公布GP1具体定价,但可根据存储层级做合理估算:
- HBM3e:约15-25美元/GB(2026年现货价较半年前暴涨超300%,有价无市);
- XL-FLASH(SCM级):估算0.5-1.5美元/GB;
- 企业级TLC SSD:约0.1-0.3美元/GB。
即用XL-FLASH替代HBM做内存扩展,每GB成本降低约10-50倍。但性能差距同样巨大——HBM带宽为TB/s级,GP1走PCIe 6.0 x4理论带宽约16GB/s。GP1的定位不是替代HBM,而是与其形成"HBM(热数据)+ XL-FLASH(温数据)+ TLC/QLC SSD(冷数据)"的三级内存-存储体系,使AI系统能以远低于全HBM方案的成本访问更大规模数据集。
四、优缺点
优点:
1. 成本优势显著:相比HBM,每GB成本降低1-2个数量级,为大规模AI部署提供经济可行的内存扩展路径;
2. 512字节原生优化:消除传统SSD的8倍读取放大,精准匹配AI推理场景的I/O模式;
3. 极高耐久度:50 DWPD,远超企业级SSD平均水平(1-3 DWPD),为高强度AI负载留足安全边际;
4. 生态卡位精准:与英伟达Storage-Next深度绑定,cuFile已开源,SCADA架构获40余家厂商支持,英特尔加入维护;
5. SCM赛道独占:英特尔傲腾退役后,XL-FLASH是全球唯一持续推进的SCM商业化方案,竞品短期内难以追赶。
缺点:
1. 生态尚未成熟:GP1样品2026年底才交付,SCADA仍处框架阶段,STX商用系统预计2026下半年才有,早期适配成本高;
2. 与HBM带宽差距悬殊:2-3个数量级的带宽差距意味着延迟敏感型训练任务仍需HBM,GP1仅适用于推理和内存扩展场景;
3. 竞争存在变数:美光9650已在SCADA演示中展现强可扩展性,三星、美光可能通过固件优化在传统NAND上逼近XL-FLASH性能;SK海力士联合闪迪推出的HBF标准在带宽上更具优势;
4. 标准碎片化风险:Storage-Next虽有40余家成员,但512字节扇区、GPU原生命令集等标准落地仍需时间,不同厂商方案可能互不兼容;
5. HBM价格下行风险:若HBM产能大幅扩张导致价格下降,闪存扩展的成本优势将被削弱。
五、对存储行业的影响
5.1 存储层级重构
GP1标志着闪存正式进入"内存时代"。传统存储金字塔(缓存→DRAM→NAND→HDD)正在AI服务器中演变为:HBM(数十GB,TB/s)→XL-FLASH闪存层(数十TB,百万IOPS)→传统TLC/QLC SSD(数百TB,GB/s)。每层成本相差约10倍,形成经济高效的"内存-存储连续体"。
5.2 SSD主控设计范式变革
当GPU取代CPU成为存储访问主体,SSD主控需彻底重构:从4KB扇区优化→512字节优化;从小队列深度(32-128)→大队列深度(数万);从峰值带宽优先→功耗与尾延迟优先。Marvell等厂商已按Storage-Next路线图设计下一代控制器,目标PCIe Gen7时代单盘1亿IOPS。
5.3 AI推理成本结构改变
KV缓存溢出到闪存意味着单个GPU可支持更长上下文和更多并发用户,直接影响AI Agent、RAG等场景的"每用户服务成本"。GP1让"用闪存放KV缓存"从理论走向工程落地,有望推动AI推理从"奢侈品"走向"日用品"。
5.4 竞争格局重塑
三星、SK海力士、美光三大巨头聚焦HBM,铠侠在"闪存上移"方向凭借XL-FLASH独占鳌头,形成错位竞争。但如果Storage-Next生态成功,整个NAND行业都将受益——闪存的总可寻址市场(TAM)将从"存储"扩展至"内存"领域,市场空间数倍放大。
5.5 一个判断
GP1的发布不是一个产品迭代事件,而是一个品类诞生事件。"GPU原生闪存"正在成为AI基础设施中一个独立的新层级——它不抢HBM的活,它抢的是"那些原本因买不起足够HBM而无法规模化部署的AI应用"的活。当AI产业从训练转向推理放量,这一层级的战略价值将持续放大。
