NVIDIA Rubin平台的发布标志着AI超算进入新阶段。它通过CPU、GPU、网络等六类核心芯片的深度协同设计,专为推理主导的AI时代打造,旨在系统性地降低单位算力成本,为长上下文、智能体AI等下一代应用的普及奠定基础。

智能速览
Rubin平台采用CPU、GPU、网络等六类芯片深度协同的全新架构。
其推理性能相较前代提升高达5倍,训练性能提升3.5倍。
核心Rubin GPU配备8个HBM4内存堆栈,提供288GB内存容量。
NVLink 6实现单GPU 6TB/s互联带宽,保障多GPU高效协同。
该平台可将训练MoE模型的GPU数量降至1/4,单位Token成本降幅可达10倍。
精华内容
从Blackwell的渐进升级到Rubin的架构重构,NVIDIA的技术路径正转向系统级协同优化。其核心在于围绕AI推理的全新挑战,对各组件进行针对性革新。
Vera CPU定位
Vera CPU并非通用处理器,而是专为智能体推理设计的调度核心。它搭载88颗自研Olympus架构Arm核心,支持176线程,并配备1.5TB LPDDR5X内存,带宽高达1.2TB/s。
其核心任务是处理数据流转与上下文调度逻辑,让GPU能专注于高密度计算,从系统层面提升整体推理效率,并非要取代GPU的计算地位。
Rubin GPU跃升
Rubin GPU是架构的计算核心,实现了跨越式性能提升。在NVFP4数据类型下,其推理性能高达50PFLOPS,是前代的5倍;训练性能也达到35PFLOPS,提升3.5倍。
该GPU配备8个HBM4内存堆栈,单卡内存容量达288GB,带宽为22TB/s。第三代Transformer引擎针对长上下文与混合专家模型进行了专项优化,是大幅降低单位Token成本的关键。
NVLink 6互联
在Rubin架构中,GPU间通信与计算同等重要。NVLink 6为此而生,采用400G SerDes技术,实现单GPU 6TB/s的双向互联带宽。
单台NVL72机柜通过9台NVLink 6交换机可构建260TB/s的纵向总带宽,让72颗GPU如同一个“超级GPU”般协同工作,为大规模混合专家模型的低延迟通信提供了基础保障。
系统级创新
除了核心计算与互联,Rubin平台还包含多项系统级创新。基于BlueField-4 DPU的推理上下文内存存储平台,可在GPU内存与存储间构建“第三内存层”,优化KV cache管理,特定场景下Token吞吐量可提升5倍。
同时,平台首次在机柜级实现第三代机密计算,并结合液冷散热与模块化设计,能效与部署维护效率均显著提升。
NVIDIA Rubin通过从芯片到机柜的全链路协同,将AI算力成本与能效推向新高度。它不仅为当前AI应用提供动力,更通过大幅降低推理成本,为智能体AI和多模态技术的规模化落地扫清障碍,AI的下一个时代,算力基石已然焕新。