独家!DeepSeek联合清华北大发布DualPath系统,AI推理Infra吞吐量平均提升196%

源自知乎:智能纪元AGI

02-27 10:09

当前AI智能体推理正面临存储带宽瓶颈,导致算力浪费。DeepSeek联合清华北大提出的DualPath系统,通过创新的双路径KV-Cache加载机制,有效解决了这一难题,在多项测试中将推理吞吐量平均提升196%,为大规模AI应用提供了更高效的底层支持。

独家!DeepSeek联合清华北大发布DualPath系统,AI推理Infra吞吐量平均提升196%智能速览

  • AI智能体推理性能受限于KV-Cache存储I/O而非计算。

  • DualPath系统引入双路径KV-Cache加载设计,平衡引擎负载。

  • 利用计算网络空闲带宽传输KV缓存,避免网络拥塞。

  • 配备全局调度器,动态平衡预填充与解码引擎负载。

  • DualPath将在线服务平均吞吐量提升1.96倍。

独家!DeepSeek联合清华北大发布DualPath系统,AI推理Infra吞吐量平均提升196%精华内容

面对AI智能体推理中日益凸显的存储瓶颈,DeepSeek与清华北大团队并未局限于传统优化思路,而是从系统架构层面提出革命性方案。

瓶颈根源

AI智能体推理的性能瓶颈已从算力转向存储。这类工作负载具有长上下文、短追加和多轮次的特点,导致KV缓存命中率高达98.7%。现有的解耦架构中,加载海量KV缓存的压力完全集中在预填充引擎的存储网卡上,而解码引擎的网卡则处于空闲状态。这种严重的网络利用率不均衡,加上I/O与计算比率随硬件发展下降了14.4倍,使得GPU算力无法被充分利用。

双路径设计

DualPath的核心创新在于其数据路径重构。它设计了一条新颖的存储到解码路径,首先将KV-Cache加载到空闲的解码引擎,再通过高速计算网络(RDMA)将其传输至预填充引擎。这种设计巧妙利用了计算网络远大于存储网络的聚合带宽,将KV缓存流量与延迟敏感的模型推理通信隔离开来,从根本上解决了单点网络拥塞问题。

动态调度

为确保系统高效运行,DualPath配备了一个全局调度器,负责在预填充和解码引擎间动态平衡计算与网络负载。评估结果显示,在典型的Agent推理场景中,DualPath将离线推理的端到端吞吐量提升了1.87倍,在线服务的平均吞吐量更是提高了1.96倍。这一成果显著提升了首个标记的响应速度,同时维持了稳定的标记间延迟。

产学研结合

此项研究是DeepSeek首次与清华大学、北京大学联合发布的科研成果。论文第一作者为北京大学博士生、DeepSeek系统组的吴永彤,其导师为北京大学的金鑫助理教授。这种顶尖AI企业与国内顶尖高校的深度合作,展现了在AI基础设施领域通过产学研结合解决前沿技术难题的有效模式,为后续的技术突破奠定了基础。

DualPath系统的出现,为解决AI智能体大规模落地的底层瓶颈提供了新的思路。它不仅是技术上的突破,更体现了系统架构优化的巨大价值。随着AI应用日益复杂,这类针对核心痛点的创新将如何重塑未来的算力基础设施?

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章