当前位置:
AIGC文章详情

英伟达同月放出「降本35倍」和「涨价15%」两个数:算力红利什么时候轮到你账单上?

源自25位全网作者

01:55

8月下旬到9月初的英伟达资讯流里,有两个数字特别拧巴。

一个在8月25日前后的Hot Chips 2026上:下一代Vera Rubin NVL72机柜首次公布实测,每兆瓦吞吐量最高达到上一代GB300的30倍,每百万Token成本最高降35倍。知乎 另一个在8月底:英伟达部分大客户被告知,搭载其AI芯片的服务器价格将在许多情况下上调超过15%,涉及Vera Rubin和Grace Blackwell平台,2027年初出货生效。36氪

同期还有一条容易被划过去的消息:8月21日,OpenAI基础设施负责人在X上官宣首批Vera Rubin机架到货、已跑起训练栈,英伟达官方账号随即转发。知乎 没有发布会,就一句话。

也就是说:史上能效最高的一代AI机柜真的在路上了,但你的AI账单(API费用、租卡价格、甚至那台准备用来跑模型的PC)大概率还要再贵一阵子。如果你正在"继续用API、租卡、还是干脆买张5090自建"之间纠结,这轮Rubin发布恰恰是最容易把账算反的一次。先把两个数字各自拆开。

英伟达同月放出「降本35倍」和「涨价15%」两个数:算力红利什么时候轮到你账单上?

「35倍」是个什么口径的35倍

先说结论:35倍降的是机柜老板的电费和折旧,不是你调API的单价。

英伟达同月放出「降本35倍」和「涨价15%」两个数:算力红利什么时候轮到你账单上?

这组数据的测试背景是SemiAnalysis的AgentX基准、跑DeepSeek V4 Pro、回放真实智能体编码会话——注意,是"最高可达"的厂商口径,图表还明确标注了"非正式结果,待SemiAnalysis复核",且未计入Vera CPU对工具调用环节的加速。知乎 它的真正意义在分母:衡量指标从峰值算力变成了"每兆瓦能产出多少Token"。这背后是负载变了——智能体任务上下文从8K/1K的旧基准一路涨到100K甚至400K,英伟达援引OpenRouter数据称一个Agent任务消耗的Token可以是简单聊天的15倍。能效口径的迁移是真实的,但它是数据中心TCO层面的叙事。

TCO叙事到你的手,中间隔着两跳:云厂商先按机架买,再按Token卖给你。而这一轮,第一跳上挂着一个反向变量。

为什么你的账单反而先涨:62%的BOM不归英伟达说了算

一套Rubin NVL72机柜整机估价约800万到910万美元,是GB300(300-400万)的2倍往上,这是英伟达史上最贵的AI服务器。知乎 但涨价的锅大头不在GPU——根据机构的BOM拆解,内存加存储约占整机物料的62%,GPU本身只占约26%。摩根士丹利的报告称存储芯片价格在过去一年上涨六倍,美光也已经表示2026年HBM供应全部售罄。36氪 DRAM在2026年Q1环比涨90-95%、Q2再涨60%以上,HBM供需缺口50-60%。

这解释了一个看似分裂的局面:能效涨30倍,售价还能涨15%。传导也是已验证的——CoreWeave租赁价格上调25%,H100租赁合约价年内涨了约40%,金山云AI算力上调15-50%。知乎 至于英伟达自己,Q4毛利率指引71-72%,下个财年稳在72-73%。36氪 翻译一下:省下来的能效红利,短期内优先被用来填内存涨价的坑和维持毛利,不是拿来回馈终端价格的。

还有个细节值得记住:15%调价涉及的是2027年初出货的系统。Rubin的第一批产能,OpenAI们已经订走了。

红利什么时候下来:盯这三个信号,别盯发布会

  1. Rubin产能爬坡(观察期2026Q4-2027Q1)。鸿海Q2财报确认:VR机架Q3进入量产准备、Q4开始出货、2027年成为主力,Q4计划出货25-30万颗GPU。知乎 头部客户吃饱之后,二线云厂商和租赁市场什么时候能拿到货,才是你的价格拐点。

  2. Rubin CPX落地(2027Q1开始生产)。郭明錤9月1日的调查显示,英伟达已重新启动AI推理预填充加速GPU项目Rubin CPX,改用168GB HBM4、与标准Rubin按1:1配套。知乎 原因很实际:超过50%的推理负载花在输入处理和KV Cache构建上——也就是你为"超长上下文+RAG"付的那部分钱。CPX是这轮里第一个明确冲着"降低你的Token单价"去的产品。

  3. ASIC抢单。这轮真正可能把API价格打下来的不是英伟达的善意:谷歌TPU在其内部占比已达70%,OpenAI自研芯片Jalapeño的工程样片已经运行、计划年底前初步部署,博通联合资本给Anthropic做超1GW的定制方案。36氪 机构预计定制AI芯片占比到2030年会从38%升至49%,英伟达份额或回落至40%。上一轮"降价换量"式的Token价格战,恰恰发生在云厂商算力供给多元化的阶段。

英伟达同月放出「降本35倍」和「涨价15%」两个数:算力红利什么时候轮到你账单上?

顺带一提,英伟达CFO口径是"每部署1吉瓦Rubin算力对应约400亿美元营收机会"——这是转述、待核,但它说明了另一件事:Rubin短期内是卖方市场,卖方市场的关键词是"稀缺",不是"降价"。微博

三类人,三笔账

重度用API/智能体的:短期别看Rubin等降价,长上下文才是你的成本大头。现在能做的:能缓存的上下文别重发、长文件喂给模型前先压缩筛选。降价信号看金山云们下一轮调价公告和云厂商Token价目表,而不是黄仁勋的PPT。

租卡炼丹的:同代B300云上租赁价差已达6倍+(按需$7-18/GPU·时 vs spot $2.6-3.3),你的优化空间在错峰和比价,不在等新一代。知乎 VR实例挂上主流云平台之前,内存wave还会继续推租赁合约价——Q4盯云厂商对下一年的报价指引。

在攒本地AI主机的:别被"算力要白菜价了所以不装机"或者"API要降价了别买5090"两头晃。你的成本是一次性的硬件+电费,不跟租赁行情走;但恰恰因为Rubin这代机柜62%的钱花在内存上,你的50系显卡和DDR内存短期内也便宜不了——这条涨价链上游是同一批原厂。本地跑的价值(隐私、离线、无限调用)不随数据中心降价而消失,等降价不如按原计划把机器装完。

一句话收尾:这轮Rubin最大的信息量,不是35倍或15%哪个更响,而是算力的计价单位已经换成了"每兆瓦Token"和"每任务成本"——你的账单跟着这个新单位重排,只比厂商慢,不比厂商缺席。把上面三个时间窗记下来,比收藏任何一篇"AI马上免费"的推文有用。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章