当前位置:
AIGC文章详情

Hot Chips 2026收官:推理正在被越切越细,从PD分离一路切到Attention,做多卡部署的人该怎么办

源自65位全网作者

10:45

Hot Chips 2026刚在8月23日至25日收官,地点在美国加州。知乎今天凌晨英伟达又发了财报,第二财季营收962.21亿美元,同比增长106%。知乎财报归财报,对盯GPU并行计算的人来说,这周信息量最大的是会议第二天摆到台面上的一场路线之争:

推理,到底该切多细?

一边是英伟达:去年用200亿美元现金收购了Groq的核心资产,这也是它成立32年以来金额最高的收购案。知乎这次它首次系统展示GPU+LPU异构推理架构,把分拆从Prefill/Decode推进到了Attention/FFN。另一边是OpenAI,在同一场会上亮出自研推理芯片Jalapeño,公开质疑这种"分拆"思路,反过来押注一颗"均衡型"芯片。

这场争论跟你我有关的地方在于:做推理部署的人这两年折腾的PD分离架构(Prefill和Decode分开上卡),只是"推理被越切越细"这个梯子上的一级。如果梯子继续往上搭,你规划集群的方式、要学的接口、甚至买卡的逻辑,都会跟着变。

为什么要切?一张卡同时干不了两种活

先花30秒对齐背景:一次大模型推理请求分两段。Prefill把整段提示词一次吃进去,是计算密集;Decode一个字一个字往外吐,每轮都要反复读权重和KV cache,是访存带宽密集。两件事挤在同一张卡上,就只能轮流空转。把它们拆到不同的卡上跑,就是PD分离。最近一个月,光知乎上讲vLLM的PD分离KV连接器、Mooncake的Transfer Engine、Decode抢占恢复的实战文章就有十几篇——这件事已经从论文概念变成了日常工程。

但这次Hot Chips把话往前推了一步:既然拆了有效,为什么不拆得更细?

分拆粒度的梯子,已经搭到第四级

第一级,训练和推理分开。谷歌首次在同一代里同时设计两颗芯片:TPU 8t做训练,TPU 8i做推理。最反直觉的细节是,推理芯片反而更大——8i有8个HBM栈,训练芯片8t只有6个。知乎谷歌现场的解释很直接:推理越来越不是算力问题,而是存储容量、带宽和延迟问题。训练大户家的推理芯片比训练芯片还大,这个信号足够说明风向。

Hot Chips 2026收官:推理正在被越切越细,从PD分离一路切到Attention,做多卡部署的人该怎么办

第二级,PD分离,已经是工程现实。有意思的是,连SambaNova这种做自研数据流芯片的厂商,都演示了H200做Prefill+SN50做Decode的异构分离推理。它们展示的DeepSeek V3负载里,约97%的时间花在Decode,只有约3%在Prefill。知乎这个比例是特定负载下的数字,别直接泛化,但负载的重心偏在哪一侧是真实的——这正是把Decode甩给专用硬件的动机。

第三级,是英伟达这次端出来的新东西:Attention和FFN分开。按他们在会上给出的分工:GPU负责Prefill和Attention,LPU负责FFN和部分Decode,甚至能通过推测式解码让不同设备分别承担起草和验证。知乎承接这套分工的,就是收购完成后正式发布的Groq 3 LPX机柜。知乎

Hot Chips 2026收官:推理正在被越切越细,从PD分离一路切到Attention,做多卡部署的人该怎么办

这套机柜的定位很明确:Vera Rubin GPU处理大规模上下文,Groq 3 LPX专门负责最延迟敏感的Token生成,把Prefill和Decode进一步拆开,一套系统最多部署256个LP30加速器,与GPU协同处理Agent的多步骤任务。知乎为什么GPU+LPU的组合成立?因为LPU的设计哲学和GPU几乎相反:大量片上SRAM、完全确定性执行、没有复杂的动态硬件调度,计算和网络都由编译器提前排好。反复复用的FFN权重、"算得不重但绝不能卡"的逐token生成,恰好是SRAM带宽最擅长的活。而且因为一切确定,连未来几毫秒的功耗变化都能预测,电源系统可以提前准备电流——这是确定性执行带来的意外红利。从公开的协同吞吐曲线看,加上LPX机柜后,Token生成吞吐被抬升了一个数量级,"吞吐越高响应越慢"的老矛盾被直接绕开。

第四级,起草和验证分开。OpenAI在介绍Jalapeño时把这层拆得最透:Prefill之后的Decode,其实还包括网络延迟敏感的Draft(推测式解码起草)阶段,和带宽敏感、偶尔伴随MoE突发通信的Verify(验证)阶段。知乎你看,切分粒度的梯子就是这么一级一级搭上去的:训练/推理→Prefill/Decode→Attention/FFN→Draft/Verify。

OpenAI的反驳:不拆了,在芯片内部调

如果只有上面这些,这只是又一次"英伟达秀新品"。这场会值得写,是因为OpenAI当场反驳了。

先看Jalapeño是什么:OpenAI与博通合作的首颗推理ASIC,216GiB HBM4、15.4TB/s存储带宽、13.4 PFLOPS MXFP4、额定700W。知乎单看参数它压不过GB300,但能效是另一回事:单位能耗算力约19.1 FLOPS/W,接近GB300的2倍;单位能耗带宽约22 GB/s/W,约是后者的4倍。知乎

OpenAI的反驳第一刀砍在"闲置"上:如果把推理的三个阶段分别交给三种专用芯片,而三种负载的占比会随场景不断变化,那么固定配比的硬件池里,总会有一部分芯片处于闲置或低利用率状态。知乎更麻烦的是,这些闲置芯片的HBM、封装、网络基础功耗照样在烧。

第二刀砍在数据搬动上。数据一旦跨硬件移动,就会带来额外的带宽消耗、同步、排队和故障域;上下文越长,KV缓存越大,这笔成本越高——通信开销反而会吃掉高效解码节省的时间。知乎所以Jalapeño的选择是不拆:不搬数据,让算力适应数据。KV cache留在本地,芯片内部用门控动态调整计算、存储、网络资源的活跃比例,暂时不用的功能单元直接关供电。用他们自己的概括,叫"本地为王"——128颗芯片组成本地互连域,再扩到2048颗的全域。

Hot Chips 2026收官:推理正在被越切越细,从PD分离一路切到Attention,做多卡部署的人该怎么办

效果如何?按OpenAI自己给出的数字:Jalapeño运行GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T时,相比英伟达对照系统,每瓦吞吐量实现约1.5-1.9倍峰值,端到端延迟低1.7-3.6倍,高交互负载下性能提高2.1-4.1倍。知乎

OpenAI计划2026年底开始部署Jalapeño,第二代已在深入开发,第三代开始成形。知乎但公允地说,这些数字目前仍主要来自OpenAI自己的报告,需要独立验证;OpenAI也承认,长上下文、复杂智能体工作流,才是Jalapeño真正的压力测试。

两派的边界,其实是一道判断题

把两派剥开,回答的是同一个问题:是搬数据,还是让算力迁就数据?分拆派把请求送到最擅长它的芯片上,换来确定性执行和极致效率;均衡派把数据钉在原地,让芯片自己变形,换来负载漂移时的灵活性。

于是判断边界就清楚了:规模大、负载画像稳定、对延迟SLO要求极端,分拆划算;规模小、负载比例经常漂移、上下文特别长,分拆亏——KV搬运的成本会反过来吃掉收益。

顺带说一个国产厂商的第三种用法:分拆不只是分工,还可以是混硬件的手段。摩尔线程和硅基流动上周联合发布了PD分离异构混部白皮书,让MTT S5000与国际高端GPU协同,经真实生产级集群验证,在Prefill阶段以2:1部署比例实现国产GPU对国际高端GPU的算力等效替代。知乎对卡预算有限的团队,这可能是"分拆"最现实的一个落点。

Hot Chips 2026收官:推理正在被越切越细,从PD分离一路切到Attention,做多卡部署的人该怎么办

落到你自己头上,现在该做什么

如果你还在单机vLLM阶段:别急着上PD分离。先把chunked prefill、量化、KV cache管理这些卡内手段吃干净。PD分离的收益要在一定并发和长上下文规模之后才看得见,而它引入的KV传输、双端排队、权重副本和运维复杂度,是实打实的成本——这也是最近那些部署实战文章反复强调的事。

如果你已经有集群、长上下文高并发正在痛:值得做。但钱要花在KV传输层(vLLM的NIXL连接器、Mooncake的Transfer Engine)和P/D配比调优上,而不是加卡。同时盯住vLLM/SGLang里KV连接器接口的演进——接口标准化程度,决定了你的分离部署会不会被锁死在某一家方案上。

如果你在担心Attention/FFN级分拆会不会让你的技能过时:先不用焦虑。Groq 3 LPX是系统级产品,按整机柜与Vera Rubin NVL72协同部署,不是普通团队能自己攒的。你的CUDA、TP/PP、NCCL照样有用。但如果你们明年要评估新一代推理硬件,把"异构推理机柜"放进选型清单,不吃亏。

值得继续盯的信号有三个:一是Jalapeño年底部署后的第三方实测,长上下文是它的生死题;二是Hot Chips的PPT大约三个月后会在官网公开,届时把LPU和Jalapeño那几场下载下来细看;三是内存这条暗线——美光在会上给出判断,计算能力大约每两年增长3倍,而内存带宽的增长速度不到2倍。知乎这才是分拆越切越细的根因,也是推理芯片比训练芯片更需要HBM的原因。知乎

最后收个尾。过去十年,GPU并行计算的主题是"把一个大活拆给很多张同样的卡";这届Hot Chips释放的信号是,下一个主题可能是"给每一种活找最合适的卡"。哪一派会赢,现在没人能下结论,但这套判断框架,值得你先收藏。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章