张大妈

传说中LPU方案出炉

源自小红薯:AlienIdiot

02-28 13:09

英伟达斥资200亿美金布局AI推理算力,其核心是通过引入Groq的LPU架构,与此前发布的CPX架构形成高效协同。这套方案旨在通过’PD分离’策略,同时解决推理的低延迟与Prefill的高算力需求,为AI算力发展描绘出一条新的技术路径。

传说中LPU方案出炉智能速览

  • 英伟达斥资200亿美金获取Groq的LPU技术许可并吸纳其核心团队。

  • 新战略核心是实现’PD分离’,即Prefill与Decode阶段的计算架构分离。

  • LPU作为专用推理单元,凭借片上SRAM和确定性执行实现极致低延迟。

  • CPX架构则专注于Prefill阶段,拥有高达30 PFLOPS的FP4算力。

  • 新一代AI机柜或延续无缆化设计,并重视LPU带来的PCB架构变革。

传说中LPU方案出炉精华内容

英伟达此次布局并非简单的技术叠加,而是一套针对AI计算全流程的精密组合拳。其核心逻辑在于将不同阶段的计算任务分配给最擅长的硬件,从而实现整体效率的最大化。

LPU:解码神器

LPU,即语言处理单元,是专为AI推理阶段设计的ASIC芯片。其核心优势在于极致的低延迟和高吞吐量。为实现这一点,LPU采用大容量片上SRAM架构,将数据存储单元与计算单元紧密集成,大幅缩短了数据访问延迟,如同将仓库直接建在生产线旁。

此外,其确定性执行架构将计算步骤和通信时序精确规划到时钟周期,形成一条高效运转的’静态时序’传送带,确保了在任何负载下都能提供稳定可预测的性能表现,这对于需要实时响应的AI应用至关重要。

CPX:预填先锋

与LPU搭档的是此前发布的CPX架构,它专注于处理AI模型推理前的Prefill阶段。Prefill是一个计算密集型任务,对内存带宽要求相对较低。CPX的设计思路正是’对症下药’:它在内存和互联等传统GPU的强需求部分做减法,而在Prefill所需的纯粹算力上做加法。

单卡配备128GB GDDR7显存,在FP4精度下能提供高达30 PFLOPS的惊人算力。通过这种极致的优化,CPX能够快速完成处理提示词(Prompt)的初始计算,为后续LPU的高效推理铺平道路。

协同与未来

英伟达的’PD分离’战略,本质上是将Prefill和Decode两个特性迥异的计算任务,分别交给CPX和LPU这两个’专家’来处理,实现了1+1>2的效果。这种异构计算方案,比让单一硬件强行兼顾所有场景更为高效和灵活。

展望未来,这套新方案也将影响硬件设计。参考NVL144 CPX版本的思路,新一代AI机柜或将延续无缆化的核心设计语言,以提升部署效率和稳定性。同时,LPU架构的引入,也必将对服务器的PCB板卡设计提出新的要求和变革。

英伟达通过LPU与CPX的组合,为AI算力瓶颈提供了创新的解决方案。这不仅展现了其技术布局的深远考量,也可能成为未来AI芯片设计的新范式。这种分而治之的策略,是否会引领新一轮的AI硬件架构变革,值得持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章