NVIDIA Rubin:六种芯片协同的计算架构

源自公众号:渡江客涂鸦板

01-21 12:55

AI算力焦点正从训练转向推理,NVIDIA Rubin平台为此而来。它并非简单升级,而是通过GPU、CPU、网络等六大芯片的深度协同,系统性解决单位算力成本与推理效率的挑战,为下一代智能体AI与超大规模模型奠定基石。

NVIDIA Rubin:六种芯片协同的计算架构智能速览

  • Rubin架构专为推理主导的AI时代设计,目标是系统性降低算力与Token成本。

  • 平台由Rubin GPU、Vera CPU等六种芯片构成,实现从计算到网络的全链路优化。

  • Rubin GPU的NVFP4推理性能达50PFLOPS,相较前代提升5倍。

  • NVLink 6交换机提供260TB/s的机柜级总带宽,保障多GPU高效协同。

  • 训练MoE模型所需GPU数量可减至Blackwell的1/4,推理成本降幅最高达10倍。

  • 平台提供NVL72机柜、HGX NVL8服务器等多种部署形态,满足不同规模需求。

NVIDIA Rubin:六种芯片协同的计算架构精华内容

Rubin的突破并非来自单一芯片,而是源于其系统级的协同设计哲学。下面将深入其核心构成,剖析这一变革背后的技术细节。

专用推理CPU

Vera CPU并非通用处理器,而是专为AI推理阶段的数据调度与逻辑控制设计。其搭载88颗自研Olympus架构Arm核心,通过1.8TB/s带宽的NVLink-C2C与GPU直连,专门承担数据流转与上下文调度任务。这种分工让GPU能更专注于高密度计算,从而在系统层面提升整体推理效率。

核心计算引擎

Rubin GPU是平台的核心计算单元,配备8个HBM4内存堆栈,提供288GB容量与22TB/s带宽。其NVFP4推理性能高达50PFLOPS,相较Blackwell提升约5倍。第三代Transformer引擎引入硬件级自适应压缩,专为长上下文及大规模混合专家模型优化,旨在大幅降低单位Token的计算成本。

高速互联总线

在Rubin架构中,GPU间通信与计算同等重要。NVLink 6交换机是实现这一目标的关键,它为单GPU提供6TB/s的双向互联带宽。在一台Vera Rubin NVL72机柜中,9台交换机可构建出高达260TB/s的纵向扩展总带宽,让72颗GPU如同一个“超级GPU”般协同,为大规模MoE模型提供低延迟通信保障。

系统级创新

BlueField-4 DPU构建了推理上下文内存存储平台,在GPU内存和存储间形成“第三内存层”,特定场景下可将Token吞吐量提升5倍。结合Spectrum-X以太网的横向扩展能力与机柜级第三代机密计算技术,Rubin平台在扩展性、效率与安全性上实现了系统性重构。

NVIDIA Rubin平台通过端到端的协同设计,将AI超算的性能、能效与成本效益推向新高度。它不仅是一次硬件的迭代,更是为智能体AI、超大规模模型普及铺平了道路。随着2026年的正式部署,AI技术的应用边界将被进一步拓宽。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章