国产卡集体涨50%、机柜内存成本暴涨435%:GPU的瓶颈,从计算核搬到了内存端

源自427位全网作者

05:35

同一天发生的两件事,放在一起看最有意思。

9月10日,路透社援引消息人士报道:华为、寒武纪、沐曦、天数智芯集体上调AI芯片报价,最高涨幅50%。知乎寒武纪官方回应"未发布涨价公告",但报价单已经改了。

也是9月10日,DeepSeek正式发布V4.1-Flash:552B参数的MoE主干,外加196B参数的Engram"条件记忆",实测生成速度300~440 tokens/s,综合表现全面反超自家刚被路由下架的旗舰V4 Pro。知乎知乎

一边说"卡更贵了",一边说"模型不用把那么多东西塞进显存了"——看似矛盾,共同点只有一行字:算力的定价权和瓶颈,正在从计算核心转移到内存端。还在跑模型、看卡市、学GPU并行编程的人,这三本账值得按顺序算完。

第一本账:算力的钱,换地方流了

旗舰这一代硬件里,GPU已经不是最贵的那部分。摩根士丹利的BOM拆解报告显示,一台Vera Rubin VR200 NVL72机柜(72颗GPU)从ODM处的采购价约780万美元、约合人民币5300万元,上一代GB300 NVL72约400万美元。知乎 Bernstein的测算则显示:由于HBM4和LPDDR5X价格持续上涨,单柜造价已从780万美元拉高至910万美元、约6100万人民币。

拆开看更刺眼:机柜里存储部分的成本较GB300时代暴涨435%,从约37.4万美元飙到200万美元以上,占整机BOM比重从9%升到26%;GPU在全机成本中的占比,则从GB200时代的约65%降到51%。知乎英伟达已向微软、谷歌、甲骨文等核心客户发出调价通知:2027年初出货起,搭载AI芯片的服务器价格普遍上涨超15%。微博

国产卡集体涨50%、机柜内存成本暴涨435%:GPU的瓶颈,从计算核搬到了内存端

涨价的钱最终花在哪?先看物理约束:NVL72已进入单柜200kW级功耗区间、满载约190–230kW,Rubin单芯片约1800–2300W,直接进入45°C温水单相直液冷时代——供电、散热、存储这些"周边",正在吃掉过去属于计算芯片的预算。知乎

国产卡集体涨50%、机柜内存成本暴涨435%:GPU的瓶颈,从计算核搬到了内存端

国产卡这边的传导更直接。华为半导体首席科学家廖恒在公开访谈里给过一个比例:HBM占AI芯片成本约80%,逻辑芯片仅占约10%。知乎 全球能量产HBM的只有SK海力士、三星、美光三家;海力士CEO在7月表示,2027年可能成为存储芯片行业供应最紧张的一年,需求超过产能的情况甚至可能持续到2030年以后。TrendForce的报道显示:三星截至2031年的内存生产能力约70%已分配给英伟达、微软、谷歌等客户的长期供应协议。微博 HBM4良率承压、长协锁产挤压现货,有平台统计其现货价飙至长协5倍。财联社 一张卡的价格上限,不再由流片决定,而由几叠内存堆栈决定。

消费端的体感同步:站内价签上,耕升RTX 5070到手价6979元,金邦DDR5 32G内存到了1429元档。知乎上"内存条什么时候降价"的问题浏览量冲到数百万级——"按显存收钱"这件事,连装机党都感知到了。

第二本账:性能的天花板,从"算得出"搬到"搬得动"

为什么内存敢卡算力的脖子?被称作"HBM之父"的金正浩在专访里给过一个狠判断:“GPU装100万台,真正工作的时间只有10%”,他的解释是:大模型每输出一个词,系统都要从HBM读数、计算、写回,读写几乎占满时间,GPU在旁边干等;即便算法优化,利用率也很难突破30%。知乎数字是他的单方判断,不必全信——但方向,任何跑过推理的人都摸得到:LLM的decode阶段是教科书式的memory-bound,每生成一个token都要把主干权重完整过一遍,算力涨得越快,等数据的时间占比越高。

架构层面也在印证这一点:新型HBM方案把逻辑基片(Base Die)与存储堆栈的布局重新设计,就是为了在同样高的算力下把"搬运通道"加宽——瓶颈已经公认在数据移动,而不是矩阵乘法本身。

国产卡集体涨50%、机柜内存成本暴涨435%:GPU的瓶颈,从计算核搬到了内存端

英伟达自己的数据讲了故事的另一半:单颗Rubin搭载8组12-Hi HBM4堆栈,288GB容量、22TB/s带宽;整机72颗GPU合计20.7TB HBM4,加54TB LPDDR5X,总计74.7TB内存。知乎

CoreWeave基于DeepSeek R1的实测显示,Vera Rubin NVL72相比GB200 NVL72每兆瓦Token吞吐量提升约10倍。知乎 官方基于AgentX工作负载的测试则称,相比GB300 NVL72吞吐量最高提升30倍、Token成本降低35倍——性能倍数,是用内存成本涨435%买回来的。

比带宽更狠的约束是容量。一个700亿参数模型处理100万token上下文,仅加载模型就需要约140GB显存,保存对话历史还要再占用约130GB。知乎 Agent时代多路推理、工具调用状态再往上叠——KV Cache随上下文翻上百倍。2026年,"装不下"第一次比"算不动"更常见。

第三本账:翻墙的三条路,每条都有代价

第一条:堆。 美光放出消息,计划年内翻倍扩产HBM。微博 国产这边,长鑫存储已小批量量产HBM3E,但自给率仍极低、绝大部分依赖进口。知乎 而三家大厂2027年的产能基本售罄——这是一条赌产能的慢路。

国产卡集体涨50%、机柜内存成本暴涨435%:GPU的瓶颈,从计算核搬到了内存端

第二条:砍。 英伟达自己开始精算:Rubin Ultra被讨论的HBM方案包括192GB HBM4、256GB HBM4E和384GB HBM4E。知乎 市场传闻其拟将HBM由12层改为8层、单卡显存从288GB降至192GB,总带宽不降。微博 专为百万级token长上下文预填充设计的RubinCPX,8月中旬一度被传搁置,9月1日郭明錤的最新产业调查又称其已重启、预计2027年Q1开始生产。微博 当最强的算力公司开始按层砍内存,"堆叠层数竞赛"就算到头了。砍的代价也直白:容量缩水,长上下文上限被压,等于逼所有人把"上下文外移"变成必修课。

国产卡集体涨50%、机柜内存成本暴涨435%:GPU的瓶颈,从计算核搬到了内存端

第三条:换架构。 DeepSeek V4.1-Flash给出了样本:那张196B参数的Engram条件记忆表,像一本巨大词典,每个token只读取几十行、地址还能提前算出——所以它不必常驻显存。技术报告明确提到,Engram可以从主机内存通过后台RDMA预取,让数据传输和计算同时进行。知乎

社区已经在相似结构的Qwen3.8-Flash-Next上实测:约75.9GB计算权重常驻统一内存、约47.7GB n-gram表通过NVMe提供,最终跑到了约33 token/s,每token从SSD只读约73KB、约2ms。知乎

更反直觉的是:缓存比例从1.3%提高到79%、重大缺页次数减少约六倍,decode速度也只从21.05提高到22.40 token/s。知乎

SSD路线证明了"内存可以慢",但真正限速的依然是主干权重读取和内存带宽。

英伟达也在同方向动手:CMX(Context Memory Storage)由BlueField 4 STX存储机架支持、通过Spectrum-X交换机连接NVL72计算机架,存储机架最高配置约1.2PB高速eSSD,专门承接KV Cache。知乎 华为走的是系统级路线:灵衢全光协议把数千颗芯片用光纤连成一台机器,再加自研HiBL/HiZQ替代HBM现货。知乎 名字不同,逻辑一致:别再让存储迁就算力,让架构迁就存储。

国产卡集体涨50%、机柜内存成本暴涨435%:GPU的瓶颈,从计算核搬到了内存端

三本账算完,各拨各的下一步

跑模型、准备买卡的:这轮涨价的底层驱动是内存端的结构性缺口,不是往年那种"英伟达提价"周期,别指望价格三个月回到2025年。选卡优先级要重排:显存容量与带宽 > 核心算力。Engram、n-gram查表类稀疏结构会把本地部署门槛明显拉低,但"SSD放表"路线目前只在社区实测里跑通,官方精度的复现(逐token logits对比)还没交卷,别拿量化版成绩对标官方榜单。

学GPU并行编程的:技能重心该换层了——从"写算得快一点"的kernel,转向"让数据少动、动得早"的调度:HBM/DRAM/SSD分层、异步预取与计算重叠、KV Cache管理、稀疏与量化取舍。roofline里算术强度那条曲线描述的墙,如今是按HBM堆数和现货价格收费的墙;AI能生成kernel,但生成不了你机器里缺的那几TB/s带宽。

继续观察的:盯四个信号——Rubin Ultra Q4流片版本最终砍不砍HBM层数;三星、海力士、美光2027长约的履约和扩产节奏;长鑫HBM良率能否跨过量产线;以及Engram/SSD方案的社区复现能否保住官方精度。这四个里任何一个转向,"等、买、换"的答案都会重写。

一句话收束:存储墙不是哪家厂商使坏,而是算力增速与内存增速的剪刀差终于被标出了价格。墙立在那,但堆、砍、换三条路同时开工——下一轮GPU并行计算的主战场,已经不在计算核心上,而在数据流向计算核心的路上。

内容由AI生成

精选参考来源

1. HBM告急,国产AI芯片集体涨价:存储墙才是算力的真天花板

2. 500GB的DeepSeek-V4.1-Flash,四台DGX Spark真的没法跑吗?

3. DeepSeekV4.1:三种稀疏和Encoder的回归之旅

4. 一台机柜5300万,明年还要涨价:Vera Rubin NVL72发生了什么?

5. 英伟达服务器传出涨价消息,多数情况涨幅超15%算力行业传来重要消息,英伟达面向大客户通知AI服务器调价,很多机型涨幅超过15%。涨价背后主要源于上游HBM显存、存储芯片供应紧张,硬件成本持续上行,倒逼下游服务器终端提价。叠加此前美光披露存储

6. 存储来利好了Trendforce:三星据报道已将截至2031年的内存生产能力的约70%分配给与主要客户(包括NVIDIA、Microsoft和Google)的长期供应协议。短缺正在推动现货价格急剧上涨:• HBM3E 36GB 现货:约$2

7. #DRAM产品价格飙升#【#HBM现货价格飙至长协5倍#:HBM4良率承压,长协锁产挤压现货供给】财联社8月31日讯,近期,用于AI加速器的高带宽内存(HBM)等DRAM产品价格持续飙升。业内近日指出,作为合计占据全球存储芯片市场约70%份

8. HBM之父金正浩:AI的本质是内存,GPU真正工作的时间只有10%

9. 英伟达Rubin和Rubin Ultra最新进展、版本、价格

10. 利好,美光计划年内翻倍扩产HBM。评:芯片电感,需求再次提升。

11. 【显存砍三分之一、带宽不降反升:#英伟达Rubin Ultra改换HBM的精算哲学#】#英伟达##Rubin Ultra# 英伟达下一代Rubin Ultra拟将HBM由12层改为8层,单卡显存从288GB降至192GB,总带宽不降、单位容

12. #英伟达据称重启RubinCPX项目# 【郭明錤:英伟达重启推理预填充优化芯片Rubin CPX项目】《科创板日报》1日讯,分析师郭明錤表示,其最新产业调查显示英伟达已重启人工智能推理预填充加速GPU "Rubin CPX" 项目,不过其设

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章