张大妈

DeepSeek新系统DualPath攻克Agent推理瓶颈

源自新浪微博:大A剑客

03-04 14:55

大模型向Agent进化时,算力瓶颈已从GPU转为存储I/O。DeepSeek联合清华、北大提出全新推理系统DualPath,通过创新的双路径加载机制,有效解决了长期上下文交互中的KV-Cache读取瓶颈,为Agent的规模化应用扫清了关键障碍。

DeepSeek新系统DualPath攻克Agent推理瓶颈智能速览

  • 大模型Agent化后,算力瓶颈从GPU转向存储I/O带宽。

  • Agent场景中KV-Cache命中率极高,常超95%。

  • DualPath系统创新采用“存储→解码→预填充”双路径。

  • 该机制利用了解码节点闲置的存储带宽。

  • 离线推理吞吐最高提升1.87倍,在线平均提升1.96倍。

  • 研究成果已在1152张GPU的集群上完成验证。

DeepSeek新系统DualPath攻克Agent推理瓶颈精华内容

DualPath系统究竟如何突破I/O瓶颈?其核心在于创造性地开辟了一条数据加载新路,让闲置资源活了起来。

瓶颈的转移

随着大模型从简单的对话机器人进化为能自主规划、调用工具的Agent,一场底层架构的变革正在发生。在动辄几十上百轮的长期交互中,计算的瓶颈不再是GPU的算力,而是存储I/O带宽。因为每次交互仅生成极少新Token,但需要加载海量历史KV-Cache数据,导致GPU大部分时间都在等待数据传输,算力被严重浪费。

双路径机制

为打破僵局,DualPath系统应运而生。它创新性地开辟了“存储→解码→预填充”这条全新的加载路径。传统路径下,I/O和计算是串行的。DualPath则巧妙利用了生成新Token的解码节点上闲置的存储带宽,提前预取下一轮推理所需的KV-Cache数据,将数据加载与计算过程并行化,极大地提升了资源利用率。

性能的飞跃

这一底层架构创新带来了显著的性能提升。在实际测试中,针对典型的Agentic大模型负载,DualPath系统将离线批量处理的推理吞吐量最高提升了1.87倍。对于需要低延迟响应的在线服务,其吞吐量平均提升了1.96倍,实现了近翻倍的增长,直接降低了Agent应用的运行成本。

大规模验证

这项技术的可行性经过了严格的大规模验证。研究团队在多达1152张GPU的超大规模集群上成功运行了DualPath系统,并稳定支持了DeepSeek-V3(2660B)等参数量巨大的顶尖模型。这证明了该方案不仅在理论上先进,更具备在真实复杂生产环境中部署的成熟度和稳健性。

DeepSeek与顶尖学府的合作,为AI基础设施的演进提供了新思路。DualPath不仅是一个技术方案,更指明了当算力焦点转移时,优化资源利用的重要性。随着Agent应用日益复杂,这类底层创新将成为推动其发展的核心动力,未来还将涌现哪些突破?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章