张大妈

英伟达Rubin架构:软硬协同应对推理市场挑战

源自UP主:pop0121

01-15 15:25

英伟达新一代Rubin架构仅用1.6倍的晶体管增长,就实现了推理性能5倍、训练性能3.5倍的飞跃,并将Token成本降低10倍。这并非简单的硬件堆砌,而是通过六款芯片的协同设计、创新的推理上下文内存以及专有的NVFP4格式实现的软硬结合。这一系列革新是英伟达面对专用芯片竞争,稳固其在AI计算领域主导地位的关键布局。

英伟达Rubin架构:软硬协同应对推理市场挑战智能速览

  • Rubin架构升级为包含GPU、CPU、DPU等六款芯片的协同计算平台。

  • BlueField-4 DPU引入独立推理上下文内存,释放GPU HBM压力。

  • 满血版NVFP4格式通过双级微块缩放,实现低成本高精度计算。

  • 推理性能提升5倍,训练性能提升3.5倍,晶体管仅增1.6倍。

  • 英伟达通过开放NVLink和收购Grog,应对ASIC芯片的市场蚕食。

英伟达Rubin架构:软硬协同应对推理市场挑战精华内容

英伟达的算力提升并非源于单纯的制程红利,而是三大魔法共同作用的结果。这些设计精准地解决了当前AI计算的核心痛点,尤其是日益增长的推理需求。

软硬协同平台

从核心的Rubin GPU到配套的Vera CPU、NVLink交换芯片等,英伟达首次将六款芯片同步设计、深度匹配。Rubin GPU采用3nm制程,晶体管达3360亿,HBM4内存带宽飙升至22TB/s。Vera CPU则升级为88个自定义Olympus核心。这种整体平台的思路,确保了从计算到互联再到数据处理的每一个环节都为AI负载优化,实现了远超单一芯片的性能增幅。

KV缓存革新

大模型推理时,KV缓存会大量占用GPU宝贵的HBM内存,限制模型规模。Rubin架构的BlueField-4 DPU首次引入Inference Context Memory功能,将KV缓存从昂贵的HBM迁移到更大容量的外部存储中。此举使GPU能专注于模型权重和活跃计算,显著提升了单系统可支持的推理任务规模,直接回应了推理市场的爆发式增长需求。

低精度高效计算

Rubin架构的第三大魔法是满血版的NVFP4。这是一种4位浮点格式,通过硬件加速的双级微块缩放机制,在数据存储时极致压缩,在计算时动态解压恢复精度。配合第六代Tensor Core和第三代Transformer Engine,它在保持接近FP8精度的同时,将推理性能提升5倍。这意味着AI服务的Token成本得以大幅降低。

两条腿走路

面对谷歌TPU等ASIC芯片在推理市场的蚕食,英伟达采取双轨策略。一方面,继续压榨GPU潜力,打造原生AI平台;另一方面,推出NVLink Fusion平台,允许第三方ASIC芯片接入其算力池,并收购AI芯片公司Grok。这既是技术上的妥协,也是商业上的布局,旨在维护其在未来AI计算生态中的核心地位。

英伟达Rubin的算力魔法揭示了AI计算的演进方向:从单一硬件的军备竞赛转向系统级软硬协同创新。虽然专用芯片来势汹汹,但英伟达正试图通过开放生态与深化技术壁垒,稳固其基座地位。未来的AI芯片市场,是GPU继续独领风骚,还是多元架构分庭抗礼?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章