随着智能体成为主流AI开发范式,其“长上下文、短追加”的特性带来了全新的存储带宽瓶颈。DeepSeek联合清华、北大提出了一种名为“DualPath”的创新推理系统,通过双路径加载机制有效解决了预填充-解码分离架构下的KV-Cache读取负载不均问题,为大规模智能体应用提供了关键的性能优化方案。
智能速览
智能体工作负载下,存储带宽成为LLM推理的新瓶颈。
DualPath系统通过双路径加载机制,聚合了集群所有引擎的存储带宽。
系统采用以CNIC为中心的流量管理和自适应请求调度,确保推理性能稳定。
在1152个GPU集群评估中,离线推理吞吐量最高提升1.87倍。
在线服务场景下,DualPath实现了1.96倍的服务吞吐量增长。
精华内容
DualPath如何从根本上解决存储带宽瓶颈?其核心在于重新设计数据加载路径,通过引入一条新的“Storage-to-Decode”路径,并结合精巧的调度与流量管理技术,将分散的存储资源整合为高效的统一池。
瓶颈成因
智能体范式下,多轮对话导致上下文迅速累积,呈现出“长上下文、短追加”的特点。这类负载的KV-Cache命中率通常高于95%,使得性能瓶颈从算力转移到了存储带宽上。
在现有的预填充-解码分离架构中,所有的KV-Cache读取请求都集中在预填充引擎的存储网卡上,导致其成为系统单点瓶颈,而解码引擎的存储带宽则完全闲置,资源利用极不均衡。
双路径架构
DualPath的核心创新是引入了双路径KV-Cache加载机制。除了传统的“存储到预填充”路径外,新增了“存储到解码”路径。
在该路径下,KV-Cache可以先被加载到解码引擎的缓冲区,再通过高带宽的RDMA计算网络传输至预填充引擎。这种设计使得系统能够同时利用集群中所有引擎的存储带宽,将其池化为一个全局资源,从而打破了单节点的I/O限制。
性能保障
为确保新增的数据传输不影响对延迟敏感的推理任务,DualPath采用了两项关键技术。一是以计算网卡为中心的流量管理,利用QoS机制将推理通信设为高优先级,确保KV-Cache加载仅使用闲置带宽。
二是自适应请求调度,调度器会实时监控各引擎的存储队列和计算负载,动态决定每个请求的最优路径,并通过计算配额优化引擎内调度,最大限度减少GPU执行气泡。
性能实测
研究团队在包含1152个GPU的大规模生产集群上对DualPath进行了全面评估。在模拟RL rollout的离线批量推理场景中,该系统在DS 660B模型上相比基线实现了最高1.87倍的吞吐量提升。
在模拟真实生产环境的在线服务场景下,DualPath显著提高了系统可承载的请求到达率,在DS 660B模型上实现了最高2.25倍的提升,同时端到端延迟(TTFT和TPOT)与基线持平,验证了其在高负载下保持性能稳定的能力。
DeepSeek的DualPath系统精准地捕捉并解决了智能体时代LLM推理的关键痛点,其系统级创新思路为后续研究开辟了新方向。随着AI智能体向着更复杂、更大规模的方向发展,如何持续优化基础设施性能,将是决定应用落地体验的核心。