当前位置:
AIGC文章详情

英伟达首测Vera Rubin,吞吐30倍、Token成本1/35:我把数字拆成三档——哪部分能信、哪部分是期货、今晚财报电话会该盯什么

源自14位全网作者

00:49

两天前(8月24日),英伟达史上首次公布了下一代旗舰机架 Vera Rubin NVL72 的片上实测数据,而且直接拉来开源大模型 DeepSeek-V4-Pro,跑的不是固定问答,是最真实的智能体编码任务。新智元结果很快刷屏:在同样的电力预算下,每兆瓦吞吐量最高达到当前主力 GB300 NVL72 的30倍,每百万 Token 的成本降到后者的约1/35。NVIDIA官方博客这个数字一出来,评论区反应相当分裂。有人惊呼:“我连骗投资人的PPT都不敢这么写!”也有人感慨:“以前嫌H200三万美元一张贵,现在回头一看,H200居然连丐版都算不上了”。36氪欢呼或者质疑之前,我先把这个数字拆开算一算。

一、30倍不是“快了30倍”,是“同样的电能干30倍的活”

先看测试方法。这次用的是 SemiAnalysis 的 AgentX 基准:回放真实录制下来的智能体编程会话,上下文逐轮增长、中间穿插工具调用、还会并行派出子智能体,而不是传统那种固定长度的“8K输入、1K输出”考题。NVIDIA官方博客对比方式也不一样:把功耗固定在1兆瓦,把交互体验固定在每用户约160 Token/秒的相近水平,然后比整机机架能承载多少真实的智能体工作。知乎所以比的根本不是单卡峰值,而是 GPU、NVLink、推理软件、缓存调度作为一个整体,在固定电力下的服务能力。

而30倍,是帕累托曲线最极端那个点上的比值。交互速度要求低的时候,两代差距其实没那么大;一旦每用户速度要求拉高,GB300 的小批量吞吐下滑得明显更快,Vera Rubin 靠分离式服务、分布式 KV 缓存、KV 感知路由这些优化还能撑住。翻译成人话:智能体任务越忙、越碎,Rubin 的优势越大;只跑普通聊天的话,差距远没有30倍。

英伟达首测Vera Rubin,吞吐30倍、Token成本1/35:我把数字拆成三档——哪部分能信、哪部分是期货、今晚财报电话会该盯什么

二、这个数字能信几分?按证据强度分三档

英伟达同一天还放出了好几组数字,混在一起传播很容易变成一笔糊涂账。我按可信度把它们分成三档。

第一档,实测了但还没审计:NVL72 跑 DeepSeek V4 Pro 的30倍吞吐、1/35成本。英伟达自己在原文里说得很清楚,这是早期结果,正在等 SemiAnalysis 审核,而且没有计入 Vera CPU 处理工具调用时的表现。NVIDIA官方博客可以引用,但要记住这是学霸自己报的分数。

第二档,官方预测。Groq 3 LPX 这款推理加速器,来自英伟达去年12月豪掷200亿美元收购的初创公司 Groq。36氪官方技术资料给出的预测是:Vera Rubin NVL72 与 Groq 3 LPX 共同运行约2万亿参数 MoE 模型,在400K输入上下文、每用户约400 Token/秒的高交互场景下,每兆瓦吞吐量相对 GB200 NVL72 最高可提升35倍。知乎注意,这是期货规格表,不是当天的实测。

第三档,已经发生的。Vera Rubin 已全面投产,印度 AI 基础设施公司 AM Intelligence 宣布订购9000台,成为亚洲首批采购方之一,机架系统明年在印度南部投入运营。哔哩哔哩华尔街见闻

英伟达首测Vera Rubin,吞吐30倍、Token成本1/35:我把数字拆成三档——哪部分能信、哪部分是期货、今晚财报电话会该盯什么

还有一笔账很少有人算:吞吐跃升的同时,机架价格也在涨。按英伟达官方数据,GB300 NVL72 在同一模型上的每兆瓦吞吐已经最高达到上一代 Hopper 架构的15倍。NVIDIA官方博客而 Vera Rubin 在 GB300 的肩膀上再来30倍,整机架价格大致再翻倍。36氪两年两代,价格4倍,每兆瓦吞吐累计提升数百倍。哪怕把30倍打个对折,每 Token 成本的下行曲线也不会变——这才是“AI工厂”对存量算力真正的杀伤力。

三、英伟达为什么要换标尺

这次真正的信号,其实不是数字,而是标尺变了。英伟达援引 OpenRouter 的数据:单次智能体请求消耗的 Token 最高可达普通聊天请求的15倍,真实 AI 流量里的平均 Prompt 长度已经增长约4倍。机器之心当智能体开始连续工作几个小时,传统那种测“每秒生成多少 Token”的基准,就回答不了真正值钱的问题了。英伟达官方挑明:性能测量必须进化,不能再测单一推理请求,而要捕捉完整的智能体工作流。NVIDIA官方博客1兆瓦电到底能同时养多少个智能体、每百万 Token 到底花多少钱,才是新的计分方式。

如果成本真降到1/35,最先改变的不会只是聊天速度,而是那些“技术上能做、账上算不过来”的任务:让智能体长期盯代码、盯流程,多个智能体全天协作。这就是英伟达说的“按 AI 工厂重组算力”——不再卖单卡,而是卖整座工厂:Rubin GPU 负责大规模并行计算和大容量 KV Cache,Groq 3 LPX 负责低延迟 Token 生成,Vera CPU 处理工具执行这类串行工作,Dynamo 软件栈负责编排。知乎

英伟达首测Vera Rubin,吞吐30倍、Token成本1/35:我把数字拆成三档——哪部分能信、哪部分是期货、今晚财报电话会该盯什么

对普通消费者来说这事看似很远,但涟漪已经到家门口:英伟达已经通知客户,AI 服务器内存暴涨涨价超过15%。36氪HBM 等高端存储的产能正在被这些机架吃掉,这一轮内存、显卡的涨价,和这场发布会就是同一条根。

四、今晚的财报,有三件事值得听

再过几个小时(美东8月26日盘后、北京时间27日凌晨),英伟达将发布2027财年第二季度财报。上一季度营收816.15亿美元、同比增85%,数据中心收入752.35亿美元、同比增92%。知乎本季官方指引910亿美元上下浮动2%,而 FactSet 的市场一致预期已经喊到922亿美元。微博有人复盘过,过去四个季度英伟达次次超预期,但财报发布后股价无一例外回落。知乎在“超预期”已被定价的当下,Rubin 是少数还能拉动预期的新变量。电话会上值得听三件事:

一是 Rubin 量产爬坡的交付数字。会不会给出具体爬坡节奏、哪些大客户率先部署,这是对上面“第三档事实”最直接的验证。

二是存储和供应成本。内存涨价、服务器提价之后,毛利率是否被挤压,提价会不会影响订单能见度。

三是明年的收入能见度里,Rubin 占多大比例。资本开支能不能追上 AI 收入,这个问题要靠它回答。

五、写在最后

30倍这个数字,你可以保守一点——英伟达自己都说要等第三方审核。但方向不必保守:AI 算力的竞争轴心,已经从“谁的单卡更快”换成了“谁的一兆瓦电能跑出更多智能体”。留两个验证信号:一是未来三个月,看 SemiAnalysis 的独立审核能不能复现这个量级;二是明早的电话会上,Rubin 的交付给的是具体数字,还是一串形容词。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章