已吓哭!Groq第三代LPU加速器发布,计算阵列推理性能狂飙35倍!
此时还在等待GB交货的公司:……
在今日举行的 GTC 2026 上,英伟达首席执行官黄仁勋正式揭开了一项足以改变 AI 算力格局的重磅合作:英伟达将与推理芯片黑马 Groq 达成深度战略协议,共同推出集成 Groq3 LPX 单元的 Vera Rubin混合计算阵列。
图片这一举动标志着英伟达正以前所未有的姿态,杀入其此前从未占据绝对统治地位的极致推理领域。
图片
图片长期以来,尽管英伟达在 AI 训练市场只手遮天,但在追求极低延迟和超高吞吐的推理环节,却面临着来自 Cerebras 等初创公司的强力挑战。此次亮相的 VR+Groq3 混合计算阵列,单机柜便集成了多达 256 个 LPU 单元,拥有 128GB 的片上 SRAM 以及惊人的 640 TB/s 扩展带宽。
通过将 Rubin GPU 与 Groq 的 LPU 推理加速器单元进行协同,英伟达实现了一项工程壮举:让 GPU 负责推理初期的预填任务,而让专为速度而生的 LPU 负责后期的解码输出。实测数据显示,这种混合架构在每兆瓦推理吞吐量上实现了 35 倍的跨越式增长。
图片黄仁勋在演讲中强调,随着万亿级参数模型和百万级 Token 上下文成为行业标准,传统的单一算力结构已难以为继。Groq 在英伟达生态中的角色,将类似于此前收购的 Mellanox 在网络领域的作用——通过提供极致的低延迟表现,为即将到来的“智能体 AI ”爆发铺平道路。
对于那些对延迟极其敏感、需要实时交互的超大规模 AI 供应商来说,这套联手打造的 LPX 架构无疑是目前市面上最强大的“推理怪兽”。
针对万亿参数模型和百万词元上下文进行了优化,联合设计的LPX架构与Vera Rubin配合,最大化功耗、内存和计算效率。每瓦的额外吞吐量和词元性能为所有AI提供商开启了超高端、万亿参数、百万上下文推理的新层次,扩大了收入机会。
这被视为英伟达作为 AI 公司的一个新拐点。当英伟达能够同时提供最强的训练架构(Blackwell/Rubin)与最快的推理方案(Groq Hybrid)时,竞争对手的生存空间将被进一步压缩。随着下半年首批 Vera Rubin 计算阵列的交付,AI 推理市场将迎来一场大变革。
