大模型推理服务的Storage-to-Prefill瓶颈问题一直困扰着业界。DeepSeek提出的DualPath创新系统,通过巧妙利用闲置资源,在不增加硬件成本的前提下实现存储带宽池化,在660B规模模型上获得近2倍吞吐提升,展现了出色的工程思维和系统设计能力。
智能速览
DualPath通过利用Decode节点闲置的存储网卡带宽解决KV Cache搬运瓶颈
在660B规模生产级模型上实现近2倍吞吐提升
动态负载均衡确保不干扰正常token生成,避免延迟抖动
专门针对Agent场景的长上下文+高并发+突发请求问题优化
体现了DeepSeek优先挖掘现有硬件潜能的工程理念
精华内容
面对大模型推理服务的性能瓶颈,多数团队的第一反应是加机器或等下一代硬件。DeepSeek却另辟蹊径,从系统架构层面找到了突破口。
核心瓶颈
传统Prefill-Decode分离部署架构中,只有Prefill节点访问外部存储,存在Storage-to-Prefill单路径瓶颈。当并发请求量增加时,存储网卡带宽很快被打满,GPU利用率下降。Agent场景下动辄几十K到上百K的上下文长度,使得这个问题更加突出。
创新方案
DualPath的思路很简单:利用Decode节点闲置的存储网卡带宽,开辟Storage-to-Decode第二条数据通路。这样整个集群的存储读取带宽从"只有Prefill节点"扩展为"所有节点总和",实现存储带宽池化,无需增加新硬件。
动态调度
系统根据每个Decode节点的实时状态动态分配存储读取任务,考虑SNIC可用带宽和节点负载。这种精细化管理确保额外任务不干扰正常的token生成,避免Token-to-Token延迟抖动。论文显示在高负载下TTFT显著优化,TBT无明显退化。
场景适配
DualPath专门针对Agent推理场景优化。普通对话上下文通常在几K以内,而Agent执行复杂任务时可能经历几十轮工具调用,上下文膨胀到128K甚至更长。突发性请求模式进一步放大了存储瓶颈,这正是DualPath的价值所在。
实测效果
论文使用660B规模的生产级模型(很可能是DeepSeek-V3)测试,获得近2倍吞吐提升。这种大规模模型上的优化含金量远超小模型实验。与北大、清华的联合发表也显示了DeepSeek在基础设施研究上的学术溢出效应。
DualPath的技术创新或许不算复杂,但背后展现的工程思维和系统理念值得深思。在不增加硬件成本的前提下提升性能,这种"先榨干每一寸闲置能力"的思路,或许正是未来AI基础设施演进的重要方向。推理效率的提升与模型能力增强,最终都是为了让AI服务更普惠。