针对AI智能体推理中GPU因等待数据而大量空转的痛点,DeepSeek联合清华北大发布了DualPath推理框架。该框架通过并行化处理数据加载与计算,将算力资源利用率提升至新高度,为构建高效的AI基础设施铺平了道路。
智能速览
GPU在AI智能体任务中因等待KV-Cache加载而严重空转。
DeepSeek发布DualPath框架,实现数据加载与计算的并行处理。
引入「双路径KV-Cache加载」,将传统串行架构改为并行。
实测显示,该框架将智能体运行效率提升近2倍。
技术优化标志着AI竞赛从“算力为王”转向“带宽决胜”。
精华内容
面对AI智能体时代日益严峻的I/O瓶颈,DeepSeek提出了一种颠覆性的解决思路,重新定义了推理效率的边界。
GPU空转困境
在需要长时间运行的AI智能体场景中,一个核心瓶颈是KV-Cache。这相当于AI的“草稿纸”,随着上下文增长,会占据大量昂贵的GPU显存(HBM)。研究数据显示,智能体编码任务的平均交互轮数高达157次,KV缓存命中率98.7%,导致缓存-计算比率高达22GB/PFLOP。传统的串行推理架构中,GPU计算单元必须等待数据从外部存储通过有限的PCIe总线加载进来,造成严重的资源闲置,网络带宽与HBM容量的增长已远落后于算力增长。
双路径架构
DualPath架构的核心创新在于将数据加载与计算这两个步骤解耦,实现了并行处理。它设计了两条独立流水线:预填充引擎(PE)和解码引擎(DE)。类比“边下载边播放”,当PE在处理当前数据块时,DE已预先将下一块数据从SSD或主存加载到GPU服务器的DRAM缓冲区。这种“双路径KV-Cache加载”机制,充分利用了所有存储网络带宽,避免了单一节点的性能瓶颈,让GPU告别“干等”。
近两倍性能跃升
在标准的智能体推理基准测试中,DualPath带来了惊人的性能提升。在离线场景(如强化学习rollout)下,作业完成时间(JCT)最高缩短了1.87倍。在线服务场景下,每秒智能体运行次数(APS)提升高达1.96倍。这意味着,在同等硬件成本下,AI智能体的反应速度可以提升一倍,或者说维持相同体验的推理成本直接减半。即使在追加token长度增加的情况下,DualPath仍能实现1.82至1.99倍的加速。
带宽决胜未来
DualPath的发布不仅是技术上的突破,更预示着AI基础设施构建思维的转变——从“算力为王”的时代迈向“带宽决胜”的时代。当硬件性能逼近物理极限,极致的软件架构优化成为解锁算力的关键。该系统已在1152块GPU的集群上支持4.8万个并发智能体,展现出卓越的线性扩展能力,为实现像水电一样无处不在的AI服务愿景,迈出了坚实一步。
DualPath框架不仅是技术上的精妙优化,更预示着AI基础设施构建思维的转变。当算力增长遭遇物理瓶颈,软件架构的创新将成为决胜关键。未来的AI服务,将如何更高效地利用每一分带宽?