昨晚(美东时间周一),英伟达官宣了一件事:Groq 3 LPX 全面投产。知乎
如果你只刷到了"每秒3400个token""比对手快4倍"这类标题,先别急着喊牛。这条消息值得看,但里面的数字各有口径,我帮你把整件事拆成四段:这东西是什么、为什么英伟达要做它、哪些数字能信、什么时候能轮到你用上。
先补个前情:Groq 本来是英伟达在推理芯片领域最扎手的对手之一,自研的 LPU(语言处理单元)架构主打一个"快"字。去年英伟达直接掏了约200亿美元,跟 Groq 的投资人签了授权协议,把创始人 Jonathan Ross 和核心团队整体收编。36氪Groq 公司本身则转型做推理云,估值从69亿美元一路谈到35亿美元,这个月刚又融了3.5亿美元。知乎所以这次投产的 Groq 3 LPX,本质是英伟达把买来的 LPU 技术线做成了自家产品——不是新的 GPU,而是塞进 Vera Rubin 机架里的专用"token 加速器"。

它解决的是一个很具体的痛点。现在的 AI 智能体(Agent)干一件事,往往要串几十上百次模型调用,每一步都在等生成延迟,上下文还会一路滚到几十万 token。而生成过程分两段:prefill(读题)和 decode(写答案)。36氪GPU 擅长读题这种大吞吐的活,但逐字往外蹦答案恰恰不是它的最优解——英伟达自己在 GTC 主题演讲里也承认:优化高吞吐和优化低延迟,本质上是互相矛盾的。所以英伟达的分工是:Rubin GPU 负责长上下文处理,LPX 专门负责低延迟吐字,两块芯片在同一个机架里配合,还能玩 prefill-decode 解耦,号称能撑住 2T 以上参数的多智能体系统。
然后是大家最关心的数字,这里必须把口径说清楚:
第一,每秒 3431 个 token。这是独立基准测试机构 Artificial Analysis 的实测,但注意条件:Gemma 4 31B 模型 + 10 万 token 上下文。小红书英伟达新闻稿四舍五入成"约3400"。这个速度什么概念?生成 5000 字大约 1.5 秒,而现在主流服务普遍 60-100 token/秒,同样的内容要等差不多一分钟。而且从 10 万 token 缩到 1 万 token,速度基本不掉(3382),长短上下文几乎零衰减,这一点确实是硬货。

第二,“比最快的竞争平台快近4倍”。知乎官方没点名,业内普遍对照的是 Cerebras 的公开端点,大约 882 token/秒——3431 除以 882,约等于 3.9。小红书数字本身对得上,但记住这是特定模型、特定上下文下的对照,不是所有场景的通杀。
第三,“每兆瓦吞吐量是上一代 GB300 的 30 倍、每 token 成本最多降 35 倍”。这组来自 SemiAnalysis 的 AgentX 工作负载测试(跑的是 DeepSeek V4 Pro)。知乎英伟达自己标注了是 projection 口径,也就是预测值,不是已经跑出来的量产实测。小红书
一句话总结:前两个数字有第三方实测背书,可以看齐;第三个是厂商预期,听一半留一半。真正成色如何,要等第一批落地的云厂商交出生产环境数据。
那谁会先用上?名单已经出来了。Nebius 的推理平台 Token Factory 首家接入。NVIDIA Newsroom转型做云的 Groq 自己也是早期采用者。SpaceX 那边,SpaceXAI 将用 Vera CPU 加速智能体,连星脑卫星都安排上了。微博对普通人来说,LPX 是 Vera Rubin NVL72 机架的一部分,跟着 VR200 整机柜的交付节奏走,明年年初才开始批量交付——而且别忘了一个背景:因为内存成本暴涨,Vera Rubin 整机柜刚传出要涨价约 17%。36氪所以大概率是云厂商和企业客户先吃到红利,个人用户得等它通过云端 AI 产品传导过来,明年的 coding 智能体和各类 Agent 工具会最先变快。

顺带说一句国内相关的:8月23日有传闻说英伟达要用 Groq 技术做面向中国市场的特供芯片,英伟达官方已经否认。微博这次的 LPX 是面向全球市场的正规产品线,跟"特供"没关系。
最后说说怎么看这件事的分量。推理这块市场长期比训练更大,而英伟达在推理上并不是没有对手:Cerebras、AMD、还有各大云厂商的自研芯片都在抢。英伟达的解法很直接——把跑得最快的对手买下来,变成自己机架里的一块板卡,把"推理体验"这一层也锁进自家生态。这周三(美东8月26日盘后)英伟达就发财报。知乎这次投产等于在 Rubin 周期的故事里又补了一块拼图,电话会上管理层怎么讲 LPX 的出货节奏,值得留意。

给想持续跟踪的朋友留个观察清单:
Nebius Token Factory 的生产环境实测,验证 3400 token/秒在真实负载下还剩几成;
VR200/LPX 机架的实际出货节奏和最终定价(内存涨价还在发酵);
Cerebras、AMD 接下来怎么接招;
周三财报电话会对推理业务的表述有没有变化。
AI 工具"秒回"的时代确实在靠近,只是第一站是智能体和企业客户。普通用户不用抢什么,记住这条时间线,明年你手里的 AI 产品提速时,你能知道原因在哪。