大模型推理正面临新的瓶颈:数据搬运效率远低于计算速度。DeepSeek联合高校提出的DualPath方案,巧妙利用闲置网络资源,在不增加硬件成本的前提下,将大模型在智能体任务下的吞吐量提升近两倍,为降本增效提供了新思路。
智能速览
大模型智能体任务的核心瓶颈在于数据搬运,而非算力本身。
DualPath方案通过“双路径加载”技术,借用解码引擎的闲置带宽搬运数据。
采用虚拟通道技术隔离推理与缓存搬运流量,确保核心任务不受干扰。
在千卡GPU集群实测中,系统吞吐量平均提升约1.9倍,请求承载能力提升2.25倍。
此举标志着大模型优化的焦点正从单纯的算力比拼转向系统级的数据效率。
精华内容
当算力不再是唯一瓶颈,如何从数据搬运中榨取性能?DeepSeek的DualPath给出了一个巧妙的答案。
真正的瓶颈
当前大模型执行多轮对话等智能体任务时,GPU算力并非瓶颈。数据显示,KV缓存命中率高达95%以上,意味着GPU大部分时间在等待从硬盘读取历史对话数据。更严峻的是,主流的预填充-解码分离架构中,负责读数据的预填充引擎网络带宽被占满,而负责生成的解码引擎网络却处于空闲状态,算力资源被严重浪费。
双路径加载
DualPath的思路直击痛点:既然解码引擎的网络空闲,就让它参与数据搬运。它开辟了一条“双路径加载”通道,将缓存数据先从存储读取到解码引擎的内存,再通过高速计算网络(RDMA)传输给预填充引擎。这相当于将集群内所有闲置的存储带宽资源池化,彻底解决了数据拥堵问题。
流量隔离术
新路径也带来了新挑战:缓存搬运的数据流是否会与模型自身的推理通信冲突?DualPath的解法是在InfiniBand网络中实施流量隔离。它会为模型推理通信预留99%带宽的“快车道”,确保其绝对优先级;而缓存搬运数据则只能在网络空闲时段的“慢车道”通行,两者互不干扰。
近两倍提升
实测数据证明了该方案的有效性。在由1152张GPU组成的集群上运行DeepSeek-V3模型,离线推理吞吐量最高提升了1.87倍,在线服务吞吐量平均提升了1.96倍。更重要的是,在保证首字延迟低于4秒的前提下,系统的请求承载能力提升了2.25倍,且Token生成速度几乎不受影响。
DualPath方案未增加一块硬件,仅通过重构软件流程就实现了吞吐量翻倍,这充分展示了系统级优化的巨大潜力。它揭示了算力竞赛的新战场:数据搬运效率。未来,这种“软功夫”是否会成为决定大模型成本和性能的关键?