随着大模型参数迈向万亿级,存储系统成为训练与推理的关键瓶颈。DeepSeek 开源的 3FS 系统通过创新架构设计,有效解决了高并发读写、Checkpoint 加速及长上下文推理等痛点,为 AI 场景下的存储优化提供了极具参考价值的技术范本。
智能速览
DeepSeek 开源 3FS,在 180 节点实现 6.6TiB/s 吞吐量
采用 CRAQ 协议优化读写,解决了传统复制的性能瓶颈
设计 FFRecord 格式合并小文件,提升海量数据集加载效率
KV Cache 外置方案释放 30% 显存,优化长上下文推理
基于 FoundationDB 构建无状态元数据服务,保障系统扩展性
Checkpoint 并行写入结合硬件加速,将延迟降至秒级
精华内容
AI 存储面临海量小文件、高频 Checkpoint 及长上下文计算等多重挑战,3FS 通过定制化架构逐一击破。
核心架构设计
3FS 采用了基于 CRAQ 协议的链式复制架构,区别于传统星型复制或仅能读尾节点的链式复制。CRAQ 允许客户端读取任意副本,既保证了写吞吐量,又大幅提升了读性能。
系统将数据分摊式打散在多个节点组成链条,避免单点故障导致读瓶颈。元数据服务层基于 FoundationDB 构建,具备强 ACID 语义和无状态特性,实现了计算与存储的独立扩展,简化了元数据管理的复杂度。
数据集优化
针对 AI 训练中常见的海量小文件难题,3FS 设计了 FFRecord 文件格式。该格式将预处理并 Shuffle 后的小文件聚合为大文件,利用大 IO 读写能力提升性能。
配合预取技术,系统能够有效降低元数据查询压力和随机 IO 开销。这种设计规避了直接存取小文件带来的性能损耗,确保 GPU 能高效获取训练样本,避免 I/O 等待。
Checkpoint加速
在大规模集群中,Checkpoint 写入量大且对延迟敏感。3FS 采用分片并行写入策略,突破单节点 I/O 瓶颈,使吞吐效率随节点数量线性扩展。
结合 RDMA 网络与 NVMe SSD 硬件加速,传输与存储延迟显著降低。配合 CRAQ 协议进行分布式副本同步,3FS 成功将单次 Checkpoint 写入延迟降低至秒级,保障了训练任务的连续性。
长上下文推理
为解决长上下文推理中的重复计算问题,3FS 将 KV Cache 外置至全局存储资源池。高频数据驻留在本地 NVMe SSD,低频片段存入全局池,通过 RDMA 直连读取。
这一方案释放了 30% 以上的 GPU 显存,支持更长上下文或更大批次推理。与部分大厂方案不同,3FS 结合 MLA 技术,虽目前场景单一且存在压缩精度损失,但为系统级优化提供了新思路。
DeepSeek 3FS 证明了针对 AI 场景定制化存储的必要性。尽管通用存储在成本上看似占优,但在万亿参数时代,专用架构带来的全局收益更为可观。这一开源方案不仅是技术突破,更为行业解决存储瓶颈提供了重要的实践参考。