这个周末,GPU并行计算的圈子基本被HotChips 2026刷屏了。英伟达扔出两颗大雷:一颗关于性能,一颗关于涨价。表面看是两条不相干的新闻,放在一起读,说的其实是同一件事——GPU并行计算的主角,正在从"算力"换成"数据搬运"。今天这篇,把它一次拆清楚。
一、先读首测:30倍吞吐很炸,但先看基准
英伟达这次史上首次公布了下一代旗舰机柜Vera Rubin NVL72的片上实测数据:跑1.6万亿参数的DeepSeek-V4-Pro,在智能体工作负载基准AgentX下,每兆瓦吞吐量比现役主力GB300 NVL72最高提升30倍,每百万Token的生产成本最高降到1/35。36氪

关键词是AgentX。它不是传统的固定长度问答跑分,而是SemiAnalysis做的、回放真实智能体编码会话的基准:上下文持续增长、不断调用工具、还会派生子智能体。英伟达援引OpenRouter的数据称,真实世界里一个Agent任务消耗的Token,是普通聊天对话的15倍,所以固定短上下文的旧基准,已经量不出智能体时代的真实性能。这个30倍要读出两层:一层是硬件确实强了一代,同口径下GB300对H200已经有15倍;另一层是尺子换了,把尺子换成智能体工作负载,差距才会被拉得这么开。以后看到有人引用这组数字,先问一句"什么基准",能省掉很多鸡同鸭讲。
二、再看30倍从哪来:不堆算力,拆"墙"
做并行计算的朋友对这套逻辑不陌生。大模型推理的解码阶段,算术强度只有1-2 FLOPs/byte,远低于Roofline屋脊点,是典型的memory-bound任务,解码吞吐大致等于内存带宽除以模型大小。知乎模型大小不变、带宽不变,吞吐就有硬地板,算力峰值堆得再高也吃不到。英伟达这次的动作,几乎每一刀都砍在这堵"墙"上:

NVFP4量化,把权重压到4位精度,要搬的数据直接变少;
分布式KV缓存、KV感知路由、MegaMoE,上下文不重复存、不重复搬,按专家网络就近调度;
第六代NVLink,互联比现成以太网快10倍、延迟低3倍,让72颗GPU之间的专家调用不再卡脖子;
Groq 3 LPX,去年12月英伟达花200亿美元收购Groq后落地的推理加速器,这次同步进入全面量产:Rubin GPU负责处理大规模上下文这个"读",LP30加速器负责极速生成Token这个"写",一柜最多塞256颗,跑Gemma 4 31B的10万上下文能到3400 Token/秒;
Vera CPU,首款专为智能体设计的CPU:88颗自研Olympus核心、1.2TB/s带宽的LPDDR5X,专职给Agent做调度喂数据,SpaceX AI已经连夜部署,还计划2027年底把太空优化版机架送上卫星。
一句话:这30倍的本质,不是单颗GPU算得更快,而是英伟达把整机柜的工程力气,全押在"搬数据"这件事上。花旗在HotChips大会的总结里说得直白:能效已成首要设计约束,内存带宽与数据移动取代纯计算成为新瓶颈。微博
三、最后读涨价单:这次的账单,是内存开的
性能数据刷屏的同时,另一条消息在产业链里炸开了。多家英伟达大客户已收到通知:搭载英伟达AI芯片的服务器,明年初发货的机型普遍涨价,很多配置涨幅直接超过15%,旗舰Vera Rubin和Grace Blackwell都没躲掉。36氪耐人寻味的是,发涨价通知的不是英伟达,而是替微软、谷歌组装机柜的代工厂——定价权已经不在装机的人手里了。
美光这次在HotChips上把话挑明了:AI算力的第一瓶颈不在GPU本身,而在内存墙。美光的口径是,算力约每2年翻3倍,内存带宽同期增长不到2倍,剪刀差越拉越大。知乎这同一把剪刀,一边剪出了性能叙事——谁解决数据搬运谁赢;另一边剪出了成本叙事——稀缺的东西涨价。
内存到底涨疯了到什么程度?TrendForce的数据:今年一季度,传统DRAM合同价环比上涨93%到98%,一个季度接近翻倍。36氪二季度预测还要再涨58%到63%。三星、SK海力士、美光三家握住近九成市场份额,供应商库存已经低到不能再低,增量产能优先供给AI服务器,新无尘车间从动土到量产要两三年,远水解不了近渴。

瑞银拆的Vera Rubin物料清单,把账单结构的变化算得更直白:内存在整机成本中的占比,从上一代Grace Blackwell的53%飙到62%,已经是整套平台里最贵的部件。微博硬件自己也越吃越多:单颗Rubin GPU要挂288GB HBM4,比Blackwell多出一半,带宽冲到22TB/s;一个NVL72机柜装20.7TB内存。英伟达官方技术博客自己也承认:推理的解码阶段,本质上受制于内存子系统——Token不是算力堆出来的,是内存喂出来的。
下游已经顶不住了。全球最大的AI服务器代工厂广达,二季度营收首次破万亿新台币、同比翻倍,毛利率却从去年同期的7.05%掉到5.02%。36氪广达已经把采购模式从"买断转卖"改成"客供料":内存你们客户自己买、自己谈价,代工厂只赚组装的钱,价格风险不扛了。毛利不到5%的公司,没有空间替上游买单,账单只能继续往下传。
盯着消费端的朋友也注意一下,这把火已经烧到入门级了。索泰、万丽母公司PC Partner警告:2026年下半年显卡成本和供应压力可能进一步加剧,入门级产品面临更明显的涨价和缺货风险。微博
四、落到你自己身上:三类人,三种看法
做推理优化、写kernel的人:英伟达等于用整机柜产品给你指了优化方向——从"榨算力"转向"榨搬运"。KV缓存工程(分块、分布式、卸载)、FP4/FP8量化、MoE专家路由、通信与计算重叠,这些过去算进阶加分项,现在正在变成主赛道。以前写kernel盯着FLOPS,现在更该盯着带宽利用率,这个思路切换比任何单点技巧都值钱。
买算力、租算力的人:三个判断。第一,明年初发货的Vera Rubin整机柜,总价水涨船高几乎是定局——按Bernstein测算,一座1GW数据中心,光机柜预算就要多掏近50亿美元——相对看,Blackwell一代的GB300反而是成本更可控的窗口,广达财报也印证GB300机柜出货量单季翻倍。第二,合同价涨价传导到云上租价通常有滞后,做长周期规划的话,趁现在摸一遍当前租价行情、尽早锁定资源更稳。第三,英伟达自己已经用1450亿美元的供应承诺锁定了2026-2027年的HBM。36氪巨头抢的是配额,不是现货,中小玩家更要提前量。
纯围观、攒认知的人:盯住三个信号就够了。Vera Rubin的量产爬坡节奏,决定30倍什么时候变成你真正能用上的供给;HBM4良率和CoWoS先进封装产能,决定"墙"的供给侧松不松;2027年一季度的实际报价,验证这轮涨价是真传导还是喊话。
一句话收尾:只看TFLOPS判断代际的时代结束了。往后看GPU并行计算,看带宽、看能效、看账单。