已吓哭!Groq第三代LPU加速器发布,计算阵列推理性能狂飙35倍!

2026-03-17 07:36:16 0点赞 0收藏 0评论

此时还在等待GB交货的公司:……

在今日举行的 GTC 2026 上,英伟达首席执行官黄仁勋正式揭开了一项足以改变 AI 算力格局的重磅合作:英伟达将与推理芯片黑马 Groq 达成深度战略协议,共同推出集成 Groq3 LPX 单元的 Vera Rubin混合计算阵列

图片图片

这一举动标志着英伟达正以前所未有的姿态,杀入其此前从未占据绝对统治地位的极致推理领域。

图片图片图片图片

长期以来,尽管英伟达在 AI 训练市场只手遮天,但在追求极低延迟和超高吞吐的推理环节,却面临着来自 Cerebras 等初创公司的强力挑战。此次亮相的 VR+Groq3 混合计算阵列,单机柜便集成了多达 256 个 LPU 单元,拥有 128GB 的片上 SRAM 以及惊人的 640 TB/s 扩展带宽。

通过将 Rubin GPU 与 Groq 的 LPU 推理加速器单元进行协同,英伟达实现了一项工程壮举:让 GPU 负责推理初期的预填任务,而让专为速度而生的 LPU 负责后期的解码输出。实测数据显示,这种混合架构在每兆瓦推理吞吐量上实现了 35 倍的跨越式增长。

图片图片

黄仁勋在演讲中强调,随着万亿级参数模型和百万级 Token 上下文成为行业标准,传统的单一算力结构已难以为继。Groq 在英伟达生态中的角色,将类似于此前收购的 Mellanox 在网络领域的作用——通过提供极致的低延迟表现,为即将到来的“智能体 AI ”爆发铺平道路。

对于那些对延迟极其敏感、需要实时交互的超大规模 AI 供应商来说,这套联手打造的 LPX 架构无疑是目前市面上最强大的“推理怪兽”。

针对万亿参数模型和百万词元上下文进行了优化,联合设计的LPX架构与Vera Rubin配合,最大化功耗、内存和计算效率。每瓦的额外吞吐量和词元性能为所有AI提供商开启了超高端、万亿参数、百万上下文推理的新层次,扩大了收入机会。

这被视为英伟达作为 AI 公司的一个新拐点。当英伟达能够同时提供最强的训练架构(Blackwell/Rubin)与最快的推理方案(Groq Hybrid)时,竞争对手的生存空间将被进一步压缩。随着下半年首批 Vera Rubin 计算阵列的交付,AI 推理市场将迎来一场大变革。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松