英伟达发布的Rubin平台,不仅在推理性能上实现了对前代Blackwell架构5倍的超越,更在成本和能效上带来了颠覆性提升。这一系列突破将加速AI在自动驾驶、机器人等领域的渗透,为行业提供了应对大规模AI应用挑战的新路径。
智能速览
Rubin AI平台已全面量产,计划于2026年下半年开始交付。
其推理性能是Blackwell架构的5倍,训练性能快3.5倍。
成本效益大幅提升,同等效果下所需GPU数量仅为Blackwell的1/4。
能效表现卓越,每瓦特推理算力较前代提升8倍。
同步发布面向机器人的Jetson T4000模组,能效提升4倍。
首批客户涵盖微软、AWS、Google Cloud等主要云服务商。
精华内容
Rubin平台的强大并非单一环节的胜利,而是六大芯片协同设计带来的全栈式飞跃。其性能、成本与能效的突破,将重新定义未来AI基础设施的构建标准。
性能跃升
Rubin平台在性能上实现了巨大飞跃。其训练性能高达35 PFLOPS,相比Blackwell架构提升了3.5倍。更为关键的是,推理性能达到了惊人的50 PFLOPS,是Blackwell的5倍,这使其在处理“代理式AI”这类多步推理任务时优势明显。
成本与能效
成本与能效是Rubin的另一大亮点。在达到同等效果的前提下,部署Rubin所需的GPU数量仅为Blackwell的1/4,这直接降低了硬件投入成本。同时,单token的推理成本最高可降至Blackwell的1/10。
能效方面,每瓦特推理算力提升了8倍,为大规模AI应用提供了更具可持续性的解决方案。
技术内功
强大的性能背后是硬件技术的全面升级。Rubin GPU封装了8堆HBM4,总容量达288GB,带宽高达22TB/s。Vera CPU拥有88颗定制Arm核心,内存带宽为1.2TB/s。
互连方面,NVLink 6为单GPU提供3.6TB/s的带宽。而BlueField-4 DPU则专为管理AI上下文内存设计,提升了响应速度与能效。
应用拓展
Rubin平台的应用前景广阔。在AI工厂方面,微软、AWS、Google Cloud等云巨头已成为首批客户。在自动驾驶领域,英伟达发布了开源模型Alpamayo,并计划在2027年试运营L4级无人出租车。
机器人方面,推出了基于Blackwell架构的Jetson T4000模组,能效提升4倍,面向人形机器人和工业自动化场景。
英伟达通过Rubin平台,再次巩固了其在AI硬件领域的领导地位。其对推理成本和能效的极致优化,精准回应了市场的核心关切。随着AI从数字世界走向物理世界,这类强大的算力底座将成为开启新时代的关键钥匙,万亿级基础设施的变革浪潮或许已近在眼前。