CPX复活改投HBM4,LPX只押SRAM:一周之内,三张推理卡的分工互相打脸了

源自206位全网作者

05:26

学GPU并行计算的人,这个九月应该把最近三周的发布会和研报按时间线排一遍——不是因为信息多,而是因为它们互相矛盾:8月26日Hot Chips上,NVIDIA官宣Groq 3 LPX机柜全面量产,说它"专注推理解码";9月1日,郭明錤放出调查,说一度被外界认为已经胎死腹中的Rubin CPX(预填充专用卡)重启了,但规格大改;9月16日,MLPerf Inference v6.1放榜,Vera Rubin NVL72首秀;9月20日,知乎上出现新问题:"GPU、CPX、LPU的定位到底是什么?“一个高赞回答直言现在的分工"挺反直觉的”。

过去两年,做推理优化的都默认一本账:Prefill是算力瓶颈,用便宜内存的卡跑;Decode是带宽瓶颈,用昂贵HBM的卡跑。这条账现在被两头同时掀翻——预填充卡反而改上了HBM4,解码卡干脆不碰HBM只用SRAM。这篇内容给准备明年排集群、选型或者决定学什么的并行计算玩家,把三张卡的账拆开算清楚。需要先把丑话说在前面:这条线路上官方确认、分析师调查和社区推演是三种不同置信度的信息,下面逐条标注。

一、先把时间线钉住:哪些是官方,哪些是分析师口径

  • 8月24-26日 Hot Chips(官方):NVIDIA宣布交互式AI推理加速器Groq 3 LPX全面量产。单个MGX机柜256颗Groq 3 LPU、片上SRAM合计128GB、互联带宽640TB/s、全液冷。 Artificial Analysis实测:Gemma 4 31B模型在10万Token超长上下文下输出中位数约3400 Token/秒,NVIDIA把它定位成Vera Rubin NVL72平台的"解码搭档"。知乎知乎

  • 9月1日(郭明錤产业调查,非官方):Rubin CPX项目重启,预计2027年第一季度投产。知乎

  • 9月1日的规格口径:关键变化:内存从2025年公布的128GB GDDR7改为168GB HBM4,算力接近标准Rubin GPU,单卡最高功耗2300W;放弃与Rubin共享机架,改用独立MGX ETL机架,按64/128/192/256卡模块化扩容;每卡NVLink带宽1-1.5TB/s(标准Rubin为3.6TB/s),托盘间走Spectrum-6全铜以太网;推荐CPX与NVL72按1:1部署——CPX做预填充并生成KV Cache,经以太网RDMA传给Rubin GPU完成解码。知乎

  • 9月10日(媒体报道):《纽约时报》披露美国司法部正在调查NVIDIA去年12月与Groq的170亿美元交易——形式是"非独占技术授权+吸纳创始团队",Groq公司实体仍独立存续。 这笔交易的定性,直接决定LPX这条路线在法律上走不走得稳。知乎

  • 9月16-17日(MLCommons/NVIDIA,注意是预览提交):MLPerf v6.1,Rubin NVL72首秀成绩单。

  • 9月20日(NVIDIA副总裁Ian Buck公开演讲):把评价指标定调为"每兆瓦Token吞吐"。

CPX复活改投HBM4,LPX只押SRAM:一周之内,三张推理卡的分工互相打脸了

这一串事件里真正的新变量只有一个:推理被拆成了独立硬件品类,而且拆法不止一种。

二、第一处矛盾:预填充卡为什么改上了HBM4

原CPX的卖点写得很清楚:Context Processing,为长上下文而生,用GDDR7换掉HBM4省钱。重启版直接换回168GB HBM4——砍成本的故事讲不下去了?知乎

先看需求侧。郭明錤口径里有个数字值得记住:目前超过50%的AI推理工作负载来自输入上下文处理和KV Cache构建。 Agent任务不是"一问一答",而是几十上百轮自我追问、工具调用、子智能体展开,输入序列从当年MLPerf基准的1K量级一路卷到100K、400K。预填充卡的需求排序变了:容量和FP4/Attention算力排在带宽前面。知乎"柒维思考"9月17日的架构拆解给了一个配比视角:CPX单Die做到30 PFLOPS(标准Rubin靠双Die做到50 PFLOPS),它的峰值算力/本地内存带宽比约为标准Rubin的6.6倍——不是"缩水Rubin",而是删掉Prefill用不上的资源、把面积和功耗押在FP4与Attention上的专用Context GPU。知乎知乎

所以这处矛盾可以这么解:CPX贵的不是内存,省的是"不需要的通用性"。 等CPX想压推理成本的人要改预期:你买的是专用硅片按阶段计价,不是打折的通用卡。当然,郭明錤的规格毕竟不是NVIDIA官方文档,168GB HBM4这个数在量产前都还有变数。

三、第二处矛盾:解码到底归谁

NVIDIA官方在8月讲的版本:Rubin负责"读"(大规模上下文),LPX用SRAM负责"写"(极速出Token),一个机柜256颗LPU当NVL72的解码补强。

社区9月20日的版本却不一样。知乎"Frost"的回答提出AFD(Attention-FFN Disaggregation)读法:Vera Rubin NVL72处理Prefill生成KV Cache并负责Attention计算,Groq 3 LPX负责FFN/MoE部分,中间走CX9的1.6T以太网,LPX托盘是16颗Groq 3 LPU加2颗Altera FPGA加BlueField-4的组合。 他特别点了一句"挺反直觉的"——按常识,读KV Cache这种带宽活儿才该给大SRAM的LPU,现在KV在HBM卡上,LPU碰的是MoE专家计算。知乎

两个版本至今没有官方仲裁。为什么要同时留两套叙事?可以回到9月10日那条新闻:Groq那笔170亿美元的"授权"被司法部盯上了,一旦交易结构被认定需要剥离或重谈,LPX这条腿就是瘸的——CPX(自己Rubin架构的衍生)+传统NVL72的组合是备胎,反之亦然。对观察者来说,"解码分工未定"本身就是这轮信息里最该记住的结论,在此之前把任何一套分工当定论去规划采购,都是在替别人的法律风险买单。

四、MLPerf成绩单:瓶颈到底从什么变成了什么

首份Rubin榜单成绩:Qwen3-VL上最高吞吐达GB300 NVL72的3.7倍(offline/server/interactive三档),DeepSeek-R1用TensorRT-LLM达2.5倍。知乎

CPX复活改投HBM4,LPX只押SRAM:一周之内,三张推理卡的分工互相打脸了

但对做并行的人来说,这张榜里更有分量的两个数是:

  1. 99%扩展效率——GB300 NVL72把DeepSeek-R1从单机架72卡扩到四机架288卡,offline吞吐近乎线性。 "加卡是否还划算"这道多卡时代最难的选择题,第一次有了接近满分的实测答案。这也是SemiAnalysis AgentX预览里Rubin对GB300做到每兆瓦30倍吞吐的底层条件:拆阶段、堆规模之后,损耗主要发生在通信和调度上,谁把它吃干净,谁的账才算得过。知乎

  2. 软件值1.6倍——不改一行硬件,仅v6.0到v6.1的优化(更低KV Cache精度、更多kernel fusion、解耦式服务)就让GB300在Qwen3-VL上最高再提1.6倍。

CPX复活改投HBM4,LPX只押SRAM:一周之内,三张推理卡的分工互相打脸了

Ian Buck 9月20日的定调把这三组数收进了一个指标:评价每一代算力产品,唯一关键是每兆瓦Token吞吐。 Agent负载在纯数值层面被推高100倍;配合MaxLPS动态功耗管理,同样的电力包络内可以多部署40%机架。路线图他也摊开了:当前Rubin、下一步Rubin Ultra、之后Feynman。知乎

CPX复活改投HBM4,LPX只押SRAM:一周之内,三张推理卡的分工互相打脸了

翻译一下:算力的时代在让位,数据搬运(KV、通信、调度)的时代开始定价。 榜单也别忘了限定词——这是预览提交、各档取最高值,不是量产配置。

五、三类人,三件事

  • 准备明年排推理集群的人:2027Q1 CPX投产、规格官宣之前,任何"CPX方案报价"都只能当意向书看;今年下半年到明年的降本窗口在软件侧——PD分离服务(Dynamo/vLLM)、KV精度、kernel fusion这些才是MLPerf实证的1.6倍来源。

  • 还在学CUDA/并行的人:升值技能——多卡通信与调度、KV Cache内存管理、低精度算子、跨阶段流水线设计;贬值技能——只会对着单卡调峰值。本周三张卡的分工拆分,等于硬件端给这个判断盖了章。

  • 盯国产路线的人:华为昇腾950PR/950DT走的是另一条折中——同一颗AI Die派生两张卡(PR最高32个Cube Core、DT可启用36个),也做Prefill/Decode分工但共die同源,省的是软件栈成本。 分层硬件是共识,国产下一轮拼的是调度层能不能把这盘异构卡喂饱。知乎

六、接下来盯什么信号

  1. CPX规格官宣:HBM4还是GDDR7、2027Q1投产是否兑现;

  2. 解码分工定论:官方参考设计站CPX+Rubin(1:1)还是NVL72+LPX(AFD)叙事;

  3. DOJ对Groq交易的裁决——LPX路线的法律前提;

  4. MLPerf Endpoints落地——智能体推理有了标准尺子,这轮"各取最高值"的口径才有人管;

  5. Rubin Ultra/Feynman的拆解动作——分工还在继续往下切。

一台全能机器通吃的时代结束了。接下来买什么、学什么、信哪份参数表,都先问一句:这张卡,负责推理的哪一段?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章