面对AI智能体应用日益增长带来的推理性能瓶颈,DeepSeek联合顶尖高校发布了一篇关于底层系统优化的论文。其提出的DualPath系统,直指数据读取的核心症结,通过创新的资源调度机制,实现了推理吞吐量近两倍的显著提升,为复杂AI任务的实际落地扫清了障碍。
智能速览
DeepSeek发布新论文,聚焦AI智能体推理速度优化。
提出DualPath系统,旨在解决KV-Cache读取的带宽瓶颈。
通过双路径机制,有效利用了系统闲置的网络资源。
实测显示,离线推理吞吐量最高提升1.87倍。
在线服务下,每秒智能体运行数平均提升1.96倍。
有观点认为这是工程层面的极致优化,更期待模型创新。
精华内容
随着AI从对话机器人向能自主规划、调用工具的智能体演进,多轮交互带来的巨大上下文,正让模型推理的速度瓶颈从计算转向了数据读取。DeepSeek的新研究直面这一挑战。
智能体的速度之困
大语言模型的应用范式正在经历一场深刻变革,从传统的单轮问答机器人,快速演进为能够自主规划、调用工具并通过数十甚至数百轮交互解决复杂任务的智能体系统。这种转变带来了新的挑战:上下文长度会跨轮次累积至极值。在这种工作负载下,模型性能的瓶颈不再是计算能力,而是频繁地从存储中读取历史上下文,即KV-Cache的I/O效率。
现有系统的短板
在当前主流的推理架构中,系统资源分配存在严重失衡。只有负责预处理的引擎会从外部存储读取KV-Cache,这导致其存储网络带宽被迅速占满,达到饱和状态。与此同时,负责生成文本内容的解码引擎,其网络带宽却基本处于闲置状态。这种“一忙一闲”的局面,如同单车道拥堵,严重拖慢了整个系统的处理速度。
DualPath的破局之道
DualPath系统的核心创新在于引入了“双路径KV-Cache加载”机制。它没有停留在传统的“存储到预处理”单一路径,而是开辟了一条全新的“存储到解码”数据通道。KV-Cache被直接加载到拥有闲置带宽的解码引擎中,再通过高速计算网络(RDMA)高效地传输给预处理引擎。这相当于给数据读取修建了一条并行的高速公路,彻底打破了原有的带宽瓶颈。
性能提升的实证
通过在三种模型的实际智能体工作负载下进行评估,DualPath的性能优势得到了数据验证。结果显示,该系统能将离线推理的吞吐量最高提升1.87倍。在在线服务场景下,每秒能够运行的智能体数量平均提升了1.96倍,且没有违反服务等级目标(SLO)。这些数据证实了其在释放系统潜力、提升推理效率方面的显著成效。
DeepSeek的DualPath研究再次展现了其在工程优化上的深厚实力,通过巧妙的系统设计解决了AI落地过程中的关键性能问题。虽然有人更关注模型层面的原始创新,但这种高效的底层优化同样是推动AI应用走向复杂和现实世界的坚实基石。在追求AGI的道路上,极致的工程与前沿的算法,究竟谁才是更关键的驱动力?