Rubin不是为训练更大模型而生,而是为推理更便宜更稳而造
源自10位全网作者
05-21 10:09
精选参考来源
1
英伟达GTC 2026 大会,昨天(3月16日)刚开幕,此前放话说要推出世界从未见过的芯片(We've prepared several new chips the world has never seen before),今天它来了。。Vera Rubin全家桶,号称七剑下天山,它来了。。Vera Rubin 平台由七款芯片组成——Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 网卡、BlueField-4 DPU、Spectrum-6 以太网交换机,以及新整合的 Groq 3 LPU,这七款芯片目前已全面量产 。黄仁勋把它形容为"七款突破性芯片、五个机架、一台巨型超级计算机"【详见评论区证据1】。相比x86+Hopper的组合,Vera Rubin 可以实现每秒7亿个token的处理能力,而前者只有200万。老黄这个全家桶方案,微软Azure已经率先上线(首个Vera Rubin NVL72系统)【详见评论区证据2】英伟达发布了 Groq 3 语言处理单元(LPU),这是去年底花200亿美元收购Groq技术后推出的首款芯片,预计第三季度出货。这款芯片专门用来解决推理延迟问题:GPU擅长高吞吐量的预填充(prefill),而LPU擅长低延迟的解码(decode),两者组合形成"分离式推理"架构。256颗LPU组成一个LPX机架,可以与Vera Rubin NVL72搭配使用,专门服务万亿参数模型和百万级上下文窗口的推理需求 。另外还吹了下下一代架构,2028年推出。再下一代架构叫Feynman,将搭配全新的Rosa CPU(以发现DNA结构的罗莎琳德·富兰克林命名)、LP40下一代LPU、BlueField-5和NVLink 8 。也都是全家桶系统集成方案,主打一个开箱即用,利润满满。老黄挣到钱了,能整活,比我这个普人挣钱能力高不知道那里去了,我的一些金银细软放一些在老黄头上,还是踏实的。。
2
Rubin 是首代大规模搭载 HBM4 的架构。在技术层面,训练主要是 Compute-bound(计算受限),Batch比较大,而推理,尤其是长文本和高并发,是极度 Memory-bound(带宽受限) 的,Batch小,延迟要求高,毕竟是服务大量群众的。Rubin 把带宽拉到 20TB/s 以上,本质上就是为了解决推理时的吞吐瓶颈。
Rubin 当然能训练,英伟达的卡从来不偏科。但为什么要强调推理?因为 HBM4。训练吃算力,推理吃带宽。Rubin 把内存带宽拉到 Blackwell 的两倍多,摆明了是要在推理端降维打击,能训练是保底,推理成本降一个数量级才是 Rubin 让大厂掏钱的主要原因。。
现在大厂手里囤了那么多 H100 还没跑满,为什么还要盯着还没出的 Rubin?就是因为推理太贵。训练是研发投入,咬牙也就过了;但推理是日活开支,那是每天都在烧的钱。Rubin 的 HBM4 就是避免长期烧钱,没有谷歌的TPU也就算了,现在有个魔鬼TPU在边上,TPU 推理每 Token 成本比 H100 低 4 倍,不求变是不行的,不买是不行的。。
我厂有很多V100,也有H100,AMD 的MI250,300X 等,现在GB200还太贵,TPU要用谷歌云不方便,Rubin还没发布,我作为厂长,当然要了解和学习这里面的名堂。。当然我肯定没写过实际代码,就像老黄也没写过,不妨碍我们吹牛啊,对不对。
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
最新文章
热门文章
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!269 80 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400195 360 -
iPhone 16 Pro 只要 2550 元,太离谱了!110 302
已收藏
去我的收藏夹