当前位置:
AIGC文章详情

英伟达财报前夕公布Vera Rubin首测:DeepSeek跑出30倍吞吐、token成本"降35倍",但等AI降价前,先看懂这三层

源自24位全网作者

01:47

今天早上,英伟达公布了下一代 Vera Rubin NVL72 整机架的首次真机实测数据。36氪在针对 Agent 工作负载的测试里,按每位用户 160 tokens/s 的交互目标,Vera Rubin 相比上一代 GB300 NVL72,最高实现 30 倍更高的「每兆瓦吞吐量」,token 成本最高降低 35 倍。知乎首测选用的模型是 DeepSeek V4 Pro——8 月 13 日刚发正式版、1.6T 总参数、49B 激活参数、原生 1M 上下文的 MoE 大模型。知乎

本周三(美国时间 26 日)英伟达发季度财报,周一美股科技股已经先跌了一轮。老黄在财报前夜甩出这样一份成绩单,时间点本身就值得咂摸。顺带一提,这台机架也不是 PPT 产品:Rubin 平台已经进入全液冷量产阶段。36氪

英伟达财报前夕公布Vera Rubin首测:DeepSeek跑出30倍吞吐、token成本

测的不是跑分,是「真实 Agent 会话」

先说清楚这次测的是什么。不是常见的「固定 Prompt 长度、跑输出速度」,而是用 SemiAnalysis 的 AgentX 基准回放真实的 Agent 编码会话:上下文不断增长、工具调用不断、还有子 Agent 随时插入。英伟达展示的一条 Agent 轨迹里,主 Agent 的上下文从约 6 万 token 一路涨到接近 40 万。

为什么要这么测?英伟达引用了 OpenRouter 的数据:真实流量里的平均 Prompt 长度已经拉长到过去的约 4 倍,单次 Agent 型请求消耗的 token 最高能到普通聊天的 15 倍。知乎Agent 时代,推理系统的瓶颈不再是 GPU 算得慢,而是几十万 token 的上下文(KV Cache)存不下、复用不了、交换不快。

30 倍和 35 倍,是整个机架的成绩单

把 30 倍、35 倍全记在 GPU 头上,会把这件事看小。这是一个整机架的结果:

  • Rubin 单 GPU 配 288GB HBM4,内存带宽 22TB/s;NVLink 6 给每颗 GPU 提供 3.6TB/s 的 scale-up 双向带宽,72 颗 GPU 像一颗巨型 GPU 一样工作,MoE 专家并行和分布式 KV Cache 直接在整个机架里跑起来;

  • 软件层是 Prefill/Decode 分离、分布式 KV Cache、KV-aware routing 的组合。最后这项很具体:同一个 Agent 的请求再来,系统优先把它路由到已经缓存了这段上下文的 GPU 上,不重算旧 token;

  • 还有全新的 Vera CPU:88 个自研 Olympus 核心、最高 1.2TB/s 内存带宽,被英伟达称为「首款为 AI Agent 打造的 CPU」,负责任务调度、代码执行、数据处理这些模型之外的活;

  • Groq 3 LPX 也全面量产并入了这套平台,专管低延迟 decode。第三方 Artificial Analysis 实测 Gemma 4 31B、100K 上下文跑出 3431 output tokens/s。

一句话翻译:老黄卖的不是一颗 GPU,是一整套「token 工厂」,每个环节都有专门的芯片负责。算力叙事还讲到了太空:SpaceX 与英伟达已经设计了一套针对太空环境优化的 Vera Rubin NVL72 系统,计划明年第四季度发射进入轨道,2028 年实现更大规模部署。知乎

先别急着欢呼,有三件事要想清楚

第一:「最高」两个字。这是英伟达自己的基准测试,按特定交互目标测的,不是第三方复测。社区里也有更保守的口径在讨论每兆瓦吞吐的实际倍数,和官方「最高 30 倍」差距不小。「最高」和「典型」之间的差距,从来不会小。而且它恰好发布在财报前夜——历史上哪个版本更乐观,大家心里有数。

第二:硬件变便宜,不等于你的 token 变便宜。中间至少隔着三层传导:英伟达把机架卖给云厂商,云厂商把算力卖给模型厂商,模型厂商才把 token 卖给你。而上游现在恰恰在涨价周期里:就在 Vera Rubin 发布的同一时间,英伟达 AI 服务器因内存价格暴涨将涨价超 15%,1GW 数据中心的成本直接多出 50 亿美元。36氪

英伟达财报前夕公布Vera Rubin首测:DeepSeek跑出30倍吞吐、token成本

而且这波涨价的定价权还不在英伟达手里。内存价格一年暴涨 500%,二十年的降价红利没了,定价权握在三家内存厂商手里。36氪36氪模型厂商那边,国产大模型 API 也刚经历过一波涨价,DeepSeek 本月就把部分档位涨出了十倍以上。成本曲线和价格曲线从来不是一条线,中间的差价是议价能力和竞争格局。

英伟达财报前夕公布Vera Rubin首测:DeepSeek跑出30倍吞吐、token成本

第三:就算价格不降,这个数字也有意义——意义是「同样的钱买到更多」。每兆瓦吞吐量 30 倍的真正杀伤力在于,同样的电费预算能多跑 30 倍的 Agent 任务。所以未来一两年更可能出现的路径,不是「会员费降价」,而是「同样的价格给更长的上下文、更多的调用次数、更快的响应」,加量不加价。这比降价更值得等。

接下来值得盯的四个信号

  1. 周三财报电话会:Rubin 的量产和交付节奏会不会再确认,token 成本口径会不会被再次强调;

  2. 第三方复测。这次 Groq 3 LPX 的数据就出自 Artificial Analysis,SemiAnalysis 这些机构对整机架的独立测试值得等;

  3. 云厂商下一代实例的报价。那是真正的传导率,涨还是降,一两个季度就见分晓;

  4. 国产模型 API 的下一个调价窗口。国产价格战比海外凶,成本若真降下来,它们最有动力先动。

最后一个判断:token 变便宜的方向是真的,Vera Rubin 的数字也不是凭空编的;但这次降价的路径和节奏,要看内存价格、看 Rubin 量产进度,更要看模型厂商之间卷得狠不狠。别现在就做「等 AI 降价再用」的决定——今天的价格能干的事,已经超过大多数人的想象。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章