DeepSeek的新架构及KV缓存的三层设计,正在推动AI落地成本从算力向存储转移,这一变化将重塑硬件供应链。
智能速览
大模型推理成本结构正由算力主导转向存储主导
三层缓存架构将KV Cache分流至HBM、DRAM与SSD
冷数据通过哈希嵌入算法存储,大幅降低对昂贵HBM的依赖
长记忆与复杂推理场景将极大激发存储颗粒需求
精华内容
随着大模型参数增长放缓与推理架构升级,AI基础设施的成本中心正发生根本性偏移。
三层缓存架构
针对大规模复杂推理所需的KV缓存,三层缓存架构提供了高效的解决方案。热数据保留在HBM中以保障极速访问,温数据下沉至DRAM,而极少使用的冷数据则通过哈希嵌入算法压缩存储于SSD中。这种分级存储策略,有效利用了哈希表将二进制固定长度的字段映射存储,实现了对海量冷KV Cache的低成本管理。
存力即成本
随着模型能力增速变缓,算力需求增长也随之减速,但长记忆场景下的数据存储需求却在激增。在新药发现、材料科学等复杂科研领域,大模型推理涉及的知识与数据量巨大,转化为KV Cache后需要庞大的存储空间。硬件解决方案的主要成本,已从单纯的算力成本转向“存力”成本,存储颗粒的供应成为关键。
产业链新机遇
这一趋势已引起国际大厂及国内如海光、华为等厂商的重视,并在H100等算力卡中有所体现。未来的AI部署将不再仅仅追求算力堆叠,而是对存储密度和带宽提出更高要求。对于相关硬件与软件从业者而言,这意味着围绕存储芯片、颗粒制造及工厂产能的竞争才刚刚开始。
AI算力时代正逐渐向“存力”时代过渡,存储芯片厂商有望迎来新的增长点,行业投资逻辑或将重写。