张大妈

DeepSeek新系统DualPath,AI推理速度近翻倍

源自新浪微博:每日经济新闻

03-05 13:49

面对AI智能体应用日益增长带来的推理性能瓶颈,DeepSeek联合顶尖高校发布了一篇关于底层系统优化的论文。其提出的DualPath系统,直指数据读取的核心症结,通过创新的资源调度机制,实现了推理吞吐量近两倍的显著提升,为复杂AI任务的实际落地扫清了障碍。

DeepSeek新系统DualPath,AI推理速度近翻倍智能速览

  • DeepSeek发布新论文,聚焦AI智能体推理速度优化。

  • 提出DualPath系统,旨在解决KV-Cache读取的带宽瓶颈。

  • 通过双路径机制,有效利用了系统闲置的网络资源。

  • 实测显示,离线推理吞吐量最高提升1.87倍。

  • 在线服务下,每秒智能体运行数平均提升1.96倍。

  • 有观点认为这是工程层面的极致优化,更期待模型创新。

DeepSeek新系统DualPath,AI推理速度近翻倍精华内容

随着AI从对话机器人向能自主规划、调用工具的智能体演进,多轮交互带来的巨大上下文,正让模型推理的速度瓶颈从计算转向了数据读取。DeepSeek的新研究直面这一挑战。

智能体的速度之困

大语言模型的应用范式正在经历一场深刻变革,从传统的单轮问答机器人,快速演进为能够自主规划、调用工具并通过数十甚至数百轮交互解决复杂任务的智能体系统。这种转变带来了新的挑战:上下文长度会跨轮次累积至极值。在这种工作负载下,模型性能的瓶颈不再是计算能力,而是频繁地从存储中读取历史上下文,即KV-Cache的I/O效率。

现有系统的短板

在当前主流的推理架构中,系统资源分配存在严重失衡。只有负责预处理的引擎会从外部存储读取KV-Cache,这导致其存储网络带宽被迅速占满,达到饱和状态。与此同时,负责生成文本内容的解码引擎,其网络带宽却基本处于闲置状态。这种“一忙一闲”的局面,如同单车道拥堵,严重拖慢了整个系统的处理速度。

DualPath的破局之道

DualPath系统的核心创新在于引入了“双路径KV-Cache加载”机制。它没有停留在传统的“存储到预处理”单一路径,而是开辟了一条全新的“存储到解码”数据通道。KV-Cache被直接加载到拥有闲置带宽的解码引擎中,再通过高速计算网络(RDMA)高效地传输给预处理引擎。这相当于给数据读取修建了一条并行的高速公路,彻底打破了原有的带宽瓶颈。

性能提升的实证

通过在三种模型的实际智能体工作负载下进行评估,DualPath的性能优势得到了数据验证。结果显示,该系统能将离线推理的吞吐量最高提升1.87倍。在在线服务场景下,每秒能够运行的智能体数量平均提升了1.96倍,且没有违反服务等级目标(SLO)。这些数据证实了其在释放系统潜力、提升推理效率方面的显著成效。

DeepSeek的DualPath研究再次展现了其在工程优化上的深厚实力,通过巧妙的系统设计解决了AI落地过程中的关键性能问题。虽然有人更关注模型层面的原始创新,但这种高效的底层优化同样是推动AI应用走向复杂和现实世界的坚实基石。在追求AGI的道路上,极致的工程与前沿的算法,究竟谁才是更关键的驱动力?

精选参考来源

#DeepSeek称有新突破# 【DeepSeek,有新消息!】据媒体2月27日报道,在业界对新一代旗舰模型DeepSeek V4的翘首期盼中,DeepSeek团队却悄然放出了一篇新的学术论文。这篇论文由DeepSeek联合北大、清华共同撰写,将研究方向投向了决定大模型实际应用落地的关键一环——推理速度,为日益复杂的AI智能体,提供一套高效的底层系统解决方案。具体来说,新论文介绍了一个名为DualPath的创新推理系统,专门针对智能体工作负载下的大模型(LLM)推理性能进行优化。通过引入“双路径读取KV-Cache(类似记忆缓存)”机制,重新分配存储网络负载,将离线推理吞吐量最高提升 1.87 倍,在线服务的每秒智能体运行数平均提升 1.96 倍。论文在引言部分提到,大模型正从单轮对话机器人和独立推理模型,快速演进为智能体系统 ——能够自主规划、调用工具,并通过多轮交互解决实际任务。这种应用范式的转变,推动大模型推理工作负载发生重大变革:从传统的人类-大模型交互,转向人类-大模型-环境交互,交互轮次可达数十甚至数百轮。上下文会跨轮次累积,最终长度可能达到极值。此时模型不需要大量计算,反而需要频繁从硬盘读取历史上下文的 KV-Cache;现有系统中,只有负责预处理的引擎会读取KV-Cache,它的网卡带宽被占满,而负责生成内容的解码引擎,网卡带宽基本闲置,导致整个系统速度被卡脖子。因此,论文提出的DualPath,针对智能体工作负载、重新设计现代推理架构中 KV-Cache加载逻辑,解决大模型做智能体任务时,速度被 “数据读取”拖慢的核心问题,重要的是把闲置的带宽资源利用起来,相当于给数据读取 “多开了一条高速路”,实现速度的大幅提升。这一论文成果延续了DeepSeek一贯的风格,在工程化层面将性能优化推向极致。有从业者认为,DeepSeek做这类优化属于缺显卡的无奈之举,属于“脏活儿累活儿”,大家更期待团队在模型上做创新。DeepSeek,有新消息!(每日经济新闻综合,泽塔)
内容由AI生成

精选参考来源

#DeepSeek称有新突破# 【DeepSeek,有新消息!】据媒体2月27日报道,在业界对新一代旗舰模型DeepSeek V4的翘首期盼中,DeepSeek团队却悄然放出了一篇新的学术论文。这篇论文由DeepSeek联合北大、清华共同撰写,将研究方向投向了决定大模型实际应用落地的关键一环——推理速度,为日益复杂的AI智能体,提供一套高效的底层系统解决方案。具体来说,新论文介绍了一个名为DualPath的创新推理系统,专门针对智能体工作负载下的大模型(LLM)推理性能进行优化。通过引入“双路径读取KV-Cache(类似记忆缓存)”机制,重新分配存储网络负载,将离线推理吞吐量最高提升 1.87 倍,在线服务的每秒智能体运行数平均提升 1.96 倍。论文在引言部分提到,大模型正从单轮对话机器人和独立推理模型,快速演进为智能体系统 ——能够自主规划、调用工具,并通过多轮交互解决实际任务。这种应用范式的转变,推动大模型推理工作负载发生重大变革:从传统的人类-大模型交互,转向人类-大模型-环境交互,交互轮次可达数十甚至数百轮。上下文会跨轮次累积,最终长度可能达到极值。此时模型不需要大量计算,反而需要频繁从硬盘读取历史上下文的 KV-Cache;现有系统中,只有负责预处理的引擎会读取KV-Cache,它的网卡带宽被占满,而负责生成内容的解码引擎,网卡带宽基本闲置,导致整个系统速度被卡脖子。因此,论文提出的DualPath,针对智能体工作负载、重新设计现代推理架构中 KV-Cache加载逻辑,解决大模型做智能体任务时,速度被 “数据读取”拖慢的核心问题,重要的是把闲置的带宽资源利用起来,相当于给数据读取 “多开了一条高速路”,实现速度的大幅提升。这一论文成果延续了DeepSeek一贯的风格,在工程化层面将性能优化推向极致。有从业者认为,DeepSeek做这类优化属于缺显卡的无奈之举,属于“脏活儿累活儿”,大家更期待团队在模型上做创新。DeepSeek,有新消息!(每日经济新闻综合,泽塔)

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章