AI推理的性能瓶颈正在从算力转向数据带宽。DeepSeek联手顶尖高校发布的新论文,提出名为DualPath的创新架构,在智能体场景下实现了近翻倍的吞吐量提升。这不仅是一次技术优化,更可能预示着其下一代模型V4的底层设计思路,以及AI硬件竞争的新方向。
智能速览
DeepSeek研究发现AI智能体的真正瓶颈是存储带宽,而非算力。
提出的DualPath架构通过双路径并行传输数据,显著提升了吞吐量。
该技术在660B模型上实现了近翻倍的吞吐量提升。
论文透露的技术细节与DeepSeek V4模型的核心特征高度吻合。
AI竞争正从算力决胜转向带宽和系统调度效率决胜。
精华内容
当AI智能体面临海量数据搬运时,传统算力瓶颈已让位于存储带宽。DeepSeek的DualPath架构正是针对这一核心痛点提出的突破性方案,揭示了下一代模型优化的新方向。
瓶颈的真相
业界普遍认为,AI模型的推理速度受限于GPU算力。然而,DeepSeek在研究AI智能体应用时发现了一个被忽视的关键问题:真正的瓶颈是存储带宽。在执行写代码、查资料这类多轮任务时,AI智能体平均会产生超过3万token的超长上下文,但每轮新增的token仅有几百个。这意味着模型必须反复读取海量的历史记录,即KV Cache。
DeepSeek的数据显示,在这种场景下,KV Cache的命中率高达98.7%。这导致GPU的大部分时间并非用于计算,而是在等待数据从硬盘加载到显存,如同一位顶级大厨空有一身厨艺,却要等待食材从十公里外的仓库运来,算力被严重浪费。
双路径解法
为了解决数据搬运的拥堵问题,DeepSeek提出了DualPath架构。传统方案中,KV Cache数据只有一条路:从存储系统直接读取到预填充引擎,这导致该节点的网络带宽被占满,而负责内容生成的解码引擎却处于闲置状态。
DualPath的核心创新是开辟了第二条路径。它允许KV Cache数据先并行传输到解码引擎,再通过高速的RDMA网络转送给预填充引擎。这种双路并行的设计,充分利用了系统中所有节点的存储带宽,相当于给数据修建了一条多车道高速公路,彻底改变了单点拥堵的局面。
实测的性能
这一架构创新带来的性能提升是立竿见影的。在DeepSeek V3.2 660B参数规模的模型上进行实测,结果显示,DualPath架构的优化效果极为惊人。在离线处理场景下,系统的吞吐量提升了1.87倍;而在需要实时响应的在线服务场景中,吞吐量提升了1.96倍,几乎翻倍。
这组数据有力地证明,当性能瓶颈转向数据IO效率时,通过精巧的软件架构设计,即便不增加硬件成本,也能释放出巨大的性能潜力,尤其是在需要处理超长上下文的智能体应用中。
V4的剧透
这篇论文被外界视为DeepSeek V4模型架构的“剧透”,主要有三重信号。首先,论文的测试对象是DeepSeek V3.2模型,而V3.2正是即将发布的V4的前置版本。其次,论文特别强调该架构是为百万级上下文和原生多模态设计的,这与近期曝光的V4核心特性完全吻合。
最后,DeepSeek已被曝向华为等国内芯片厂商提前开放了V4的适配权限,而此篇论文恰好展示了如何在不同的异构硬件上实现高效推理。这些线索串联起来,清晰地描绘出V4并非简单的参数扩容,而是一次从底层架构到硬件协同的全面重构。
DeepSeek通过DualPath架构展示了AI竞争的新范式:从算力竞赛转向带宽与系统效率的比拼。这种以软件创新弥补硬件差距的思路,在当前环境下具有重要的战略意义,也为国产AI生态的突围提供了新路径。随着AI进入带宽决胜时代,未来的竞争将更加多维和精彩。
关键评论
从单线战场变成多线战场,顺便又把内存给拔高了,感觉这波挺容易外溢到消费级存储市场。
DS培养人,某企业从DS挖人。
别信,别信,D指导相关的小道消息可信度都相当低,大部分都是给自己引流的。这个新论文的内容则是让计算机部件更多的干活别偷懒,和V4关系没大到哪去。
可不可以理解为中国ai把除算卡算力(也在进行)外所有ai基建都建好了,就等美国算力到边际