当前AI智能体推理正面临存储带宽瓶颈,导致算力浪费。DeepSeek联合清华北大提出的DualPath系统,通过创新的双路径KV-Cache加载机制,有效解决了这一难题,在多项测试中将推理吞吐量平均提升196%,为大规模AI应用提供了更高效的底层支持。
智能速览
AI智能体推理性能受限于KV-Cache存储I/O而非计算。
DualPath系统引入双路径KV-Cache加载设计,平衡引擎负载。
利用计算网络空闲带宽传输KV缓存,避免网络拥塞。
配备全局调度器,动态平衡预填充与解码引擎负载。
DualPath将在线服务平均吞吐量提升1.96倍。
精华内容
面对AI智能体推理中日益凸显的存储瓶颈,DeepSeek与清华北大团队并未局限于传统优化思路,而是从系统架构层面提出革命性方案。
瓶颈根源
AI智能体推理的性能瓶颈已从算力转向存储。这类工作负载具有长上下文、短追加和多轮次的特点,导致KV缓存命中率高达98.7%。现有的解耦架构中,加载海量KV缓存的压力完全集中在预填充引擎的存储网卡上,而解码引擎的网卡则处于空闲状态。这种严重的网络利用率不均衡,加上I/O与计算比率随硬件发展下降了14.4倍,使得GPU算力无法被充分利用。
双路径设计
DualPath的核心创新在于其数据路径重构。它设计了一条新颖的存储到解码路径,首先将KV-Cache加载到空闲的解码引擎,再通过高速计算网络(RDMA)将其传输至预填充引擎。这种设计巧妙利用了计算网络远大于存储网络的聚合带宽,将KV缓存流量与延迟敏感的模型推理通信隔离开来,从根本上解决了单点网络拥塞问题。
动态调度
为确保系统高效运行,DualPath配备了一个全局调度器,负责在预填充和解码引擎间动态平衡计算与网络负载。评估结果显示,在典型的Agent推理场景中,DualPath将离线推理的端到端吞吐量提升了1.87倍,在线服务的平均吞吐量更是提高了1.96倍。这一成果显著提升了首个标记的响应速度,同时维持了稳定的标记间延迟。
产学研结合
此项研究是DeepSeek首次与清华大学、北京大学联合发布的科研成果。论文第一作者为北京大学博士生、DeepSeek系统组的吴永彤,其导师为北京大学的金鑫助理教授。这种顶尖AI企业与国内顶尖高校的深度合作,展现了在AI基础设施领域通过产学研结合解决前沿技术难题的有效模式,为后续的技术突破奠定了基础。
DualPath系统的出现,为解决AI智能体大规模落地的底层瓶颈提供了新的思路。它不仅是技术上的突破,更体现了系统架构优化的巨大价值。随着AI应用日益复杂,这类针对核心痛点的创新将如何重塑未来的算力基础设施?