NVIDIA Rubin:六种芯片协同的计算架构

源自公众号:智猩猩芯算

01-20 17:05

NVIDIA Rubin平台的发布标志着AI超算进入新阶段。它通过CPU、GPU、网络等六类核心芯片的深度协同设计,专为推理主导的AI时代打造,旨在系统性地降低单位算力成本,为长上下文、智能体AI等下一代应用的普及奠定基础。

NVIDIA Rubin:六种芯片协同的计算架构

NVIDIA Rubin:六种芯片协同的计算架构智能速览

  • Rubin平台采用CPU、GPU、网络等六类芯片深度协同的全新架构。

  • 其推理性能相较前代提升高达5倍,训练性能提升3.5倍。

  • 核心Rubin GPU配备8个HBM4内存堆栈,提供288GB内存容量。

  • NVLink 6实现单GPU 6TB/s互联带宽,保障多GPU高效协同。

  • 该平台可将训练MoE模型的GPU数量降至1/4,单位Token成本降幅可达10倍。

NVIDIA Rubin:六种芯片协同的计算架构精华内容

从Blackwell的渐进升级到Rubin的架构重构,NVIDIA的技术路径正转向系统级协同优化。其核心在于围绕AI推理的全新挑战,对各组件进行针对性革新。

Vera CPU定位

Vera CPU并非通用处理器,而是专为智能体推理设计的调度核心。它搭载88颗自研Olympus架构Arm核心,支持176线程,并配备1.5TB LPDDR5X内存,带宽高达1.2TB/s。

其核心任务是处理数据流转与上下文调度逻辑,让GPU能专注于高密度计算,从系统层面提升整体推理效率,并非要取代GPU的计算地位。

Rubin GPU跃升

Rubin GPU是架构的计算核心,实现了跨越式性能提升。在NVFP4数据类型下,其推理性能高达50PFLOPS,是前代的5倍;训练性能也达到35PFLOPS,提升3.5倍。

该GPU配备8个HBM4内存堆栈,单卡内存容量达288GB,带宽为22TB/s。第三代Transformer引擎针对长上下文与混合专家模型进行了专项优化,是大幅降低单位Token成本的关键。

NVLink 6互联

在Rubin架构中,GPU间通信与计算同等重要。NVLink 6为此而生,采用400G SerDes技术,实现单GPU 6TB/s的双向互联带宽。

单台NVL72机柜通过9台NVLink 6交换机可构建260TB/s的纵向总带宽,让72颗GPU如同一个“超级GPU”般协同工作,为大规模混合专家模型的低延迟通信提供了基础保障。

系统级创新

除了核心计算与互联,Rubin平台还包含多项系统级创新。基于BlueField-4 DPU的推理上下文内存存储平台,可在GPU内存与存储间构建“第三内存层”,优化KV cache管理,特定场景下Token吞吐量可提升5倍。

同时,平台首次在机柜级实现第三代机密计算,并结合液冷散热与模块化设计,能效与部署维护效率均显著提升。

NVIDIA Rubin通过从芯片到机柜的全链路协同,将AI算力成本与能效推向新高度。它不仅为当前AI应用提供动力,更通过大幅降低推理成本,为智能体AI和多模态技术的规模化落地扫清障碍,AI的下一个时代,算力基石已然焕新。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章