在Agentic LLM时代,AI推理的瓶颈已从算力转向存储I/O。DeepSeek提出的DualPath架构,通过创新的“存储-解码-预填充”双路径加载机制,巧妙地利用闲置资源,在不增加硬件成本的前提下,显著提升了推理性能。此方案为解决当前AI基础设施的核心矛盾提供了全新思路,具有极高的工程价值。
智能速览
当前AI推理的瓶颈已从GPU算力转向KV-Cache的存储I/O。
传统架构下Prefill节点网卡满载而Decode节点网卡闲置,资源利用率严重不均。
DualPath通过高速计算网将KV-Cache数据中转,聚合了全局的存储带宽。
系统通过QoS隔离、全局调度和分层预填充三大技术保障了双路径的稳定高效。
实测显示,DualPath能将离线吞吐量提升1.87倍,在线服务能力提升1.96倍。
该架构在千卡集群上展现了极佳的扩展性与稳定性,具备工业级落地潜力。
精华内容
传统推理架构的资源失衡如何被打破?DualPath并非简单增加带宽,而是通过巧妙的系统级设计,将闲置资源转化为性能增益。
瓶颈的转移
从2020到2024年,GPU算力(FLOPS)暴涨了28.8倍,而存储与网络带宽仅增长2.0倍,巨大的剪刀差导致瓶颈转移。
在Agentic应用场景下,上下文长度常超3万个token,KV-Cache命中率高达95%以上,数据搬运成为新的性能枷锁。
传统的Prefill/Decode分离架构中,Prefill节点存储网卡100%满载,但GPU利用率仅40%;而Decode节点GPU利用率高达80%,存储网卡却完全闲置,造成严重的资源浪费。
双路径加载
DualPath的核心是引入一条新的数据加载路径。Path1仍是传统的“存储到Prefill节点”路线,而Path2则是一条巧妙的“弯路”。
在Path2中,数据先从存储发送至Decode节点的网卡,存入其内存,再利用集群中已有的高速计算网络(如400Gbps的NCCL)和RDMA技术,近乎零损耗地中转给Prefill节点。
这一设计将原本仅由Prefill节点使用的存储带宽,池化为整个集群共享的资源,理论上将硬件利用率推向了极限。
技术挑战
网络冲突:为避免KV-Cache数据冲击模型通信,系统引入了QoS隔离机制。99%的带宽保障高优先级的微秒级通信,1%的“防饥饿”通道则利用通信间隙见缝插针传输数据。
动态路由:全局视野调度器实时监控磁盘队列和GPU负载,智能决策数据走向最优节点,避免拥塞从一侧转移到另一侧。
同步气泡:通过分层预填充技术,将大任务切分为300毫秒的计算配额进行分块处理,彻底消除了因请求长短不一造成的GPU等待时间。
性能飞跃
在一个由1152张NVIDIA Hopper GPU组成的千卡集群上,DualPath的测试结果极为亮眼。
其离线推理吞吐量提升了1.87倍,几乎触及了理论性能极限。在更为严苛的在线服务场景下,并发请求处理能力提升了1.96倍,极端情况下可达2.25倍,同时严格遵守了服务等级协议。
更重要的是,当并发请求数从2000扩展至48000时,系统处理时间波动小于1%,证明了其卓越的工业级扩展稳定性。
DualPath通过软硬件协同,以极低的成本撬动了巨大的性能提升,为AI基础设施的演进提供了宝贵范例。当摩尔定律放缓,这种挖掘系统潜力的思路是否会成为主流?