DeepSeek携手北大清华推出DualPath推理框架,直击Agent长文本推理I/O痛点。通过架构创新优化KV-Cache加载,在660B模型实测中实现吞吐量翻倍,为AI算力效率提升提供新思路。
智能速览
DeepSeek联合高校发布DualPath推理框架
核心在于解决Agent长文本推理I/O瓶颈
创新引入双路径加载模式替代传统单路径
实现集群存储带宽的全局池化与负载均衡
660B模型实测离线吞吐量提升1.87倍
精华内容
在算力竞争日益激烈的当下,如何挖掘现有硬件潜力成为关键。DeepSeek提出的DualPath框架,从底层架构入手,给出了针对性的解决方案。
直击I/O瓶颈
智能体在处理长文本推理时,往往受限于数据读取速度。传统的Storage-to-Prefill模式在从外部存储加载KV-Cache时,容易造成计算资源闲置。DeepSeek发现,这种存储读取的延迟正在拖累整体推理效率,成为提升算力利用率的关键阻碍。
双路径架构创新
DualPath框架打破了传统单路径加载的限制,创新性地引入了Storage-to-Decode的第二条路径。该设计利用了解码引擎闲置的存储网卡(SNIC)带宽来读取缓存,并配合高速计算网络(RDMA)将数据传输至预填充引擎,有效激活了闲置资源。
吞吐量实测翻倍
架构的优化直接带来了性能的飞跃。在规模高达660B的生产级模型实测中,DualPath表现优异。数据显示,离线推理吞吐量提升了1.87倍,在线服务吞吐量平均提升1.96倍。这种近两倍的效率提升,对于降低大模型推理成本具有极高的实用价值。
DualPath框架的出现,为解决大规模模型推理中的存储瓶颈提供了极具参考价值的范式。通过软件与硬件协同优化释放算力潜力,或许会成为未来AI基础设施演进的重要方向。这一突破能否加速AGI时代的到来?