当前位置:
AIGC文章详情

英伟达Blackwell炸场:推理性能翻4倍成本暴降90%,AMD们怎么追

源自14位全网作者

06-27 20:34

内容由AI生成

精选参考来源

1. MLPerf测试结果公布:英伟达B200推理性能达MI300X的4倍_新闻

2. NVIDIA Blackwell架构与H200 GPU在AI推理中的性能突破

3. 英伟达H200、英特尔Gaudi3、AMD MI300X实测:推理成本横向比拼

4. Tensordyne Napier流片:AI推理吞吐13倍于Blackwell系统

5. 英伟达Blackwell GPU技术特点性能优势及行业应用

6. 英伟达Blackwell架构深度解析:FP4精度、HBM3e内存与NVLink 5.0互联技术 - CSDN文库

7. 朋友买股票问我AMD怎么看? 上次聊完英伟达之后,朋友隔了两周又来找我。这次他明显做了一点功课,上来就说:“我看了下,AMD 好像也有 AI 芯片?叫 MI 什么的东西。那它能不能跟英伟达掰掰手腕?” 我说:“能,但是得看你怎么定义‘掰手腕’。” 他问什么意思。我说:“你想象一下,英伟达像个富二代——要钱有钱,要资源有资源,周围所有人都捧着他。AMD 呢,像个创业公司,东西做得不差,但就是缺人缺生态缺信仰。你要说硬件能不能打——能打。但你要说‘我买回来插上就能跟英伟达一样爽’——那可能还要再等等。” 他皱着眉头说:“那不就等于不能打吗?” 我说:“别急,故事没这么简单。” 先讲硬件。 AMD 这几年在 AI 加速卡上确实不是吃素的。MI250、MI300 系列,尤其 MI300X,规格堆得非常狠。192GB 的 HBM3 显存,什么概念?英伟达 H100 是 80GB,H200 才提到 141GB。单看显存容量,AMD 甚至反超了。对于大模型推理来说,显存大就意味着你能塞下更大的模型、更长的上下文,或者同样的模型你用更少的卡跑——这直接省钱。 我有个朋友在某个超算中心干活,他们那边部署了一套 MI300X 的集群。他跟我说,跑 Llama 2 70B 推理的时候,单卡就能塞下,批处理吞吐量很漂亮。相比之下,H100 得用两张卡才能舒服地跑同样规模。所以如果你主要是做推理,尤其做大模型部署,AMD 的性价比是真的香。 训练呢?也不差。FP16 算力、BF16、FP8 这些关键指标,MI300X 基本追平甚至略超 H100。而且 AMD 走的是“CPU+GPU”融合路线,他们家的 Epyc 处理器配上 Instinct 加速卡,在机群通信上可以做很多优化。这在 HPC(高性能计算)领域——比如气象模拟、流体力学、分子动力学——是实打实的优势。 但问题来了。 “纸面数据”漂亮,不代表你上手就舒服。有朋友做过一个特别蠢的实验:去年有个小项目,想在 AMD 上跑一遍对比结果。她花了一整个下午装驱动、配 ROCm(AMD 的 CUDA 替代品)、编译 PyTorch。结果跑第一个 demo 的时候,报错说某个算子不支持。后面查了一下,那个算子在 CUDA 上早就优化好了,在 ROCm 上得用另一个写法。又花了半天改代码。 最后跑通了,速度还不错,但时间没了。 朋友听到这里笑了:“那她这不等于帮 AMD 打工吗?” 我说:“对。所以普通用户或者小团队,不会这么折腾。大家要的是‘啪一下就能跑’。这就是英伟达最狠的地方——不是算力,是省心。” 这就引出了那个绕不开的话题:软件生态。 CUDA 这个东西,做 AI 的人都知道。你装好驱动,torch.cuda.is_available() 返回 True,然后你就可以把模型.to(‘cuda’),剩下的事它帮你搞定。所有主流框架——PyTorch、TensorFlow、JAX——底层全是 CUDA。你要写自定义算子?CUDA C++ 写起来繁琐,但文档齐全,社区问答多,Stack Overflow 上什么坑都有人踩过。 AMD 的 ROCm 呢?这几年进步确实大。从 ROCm 5.x 到 6.x,支持的范围越来越广,PyTorch 官方也提供了 ROCm 版本。但你要说“无缝体验”,还差一截。 举个例子。你跑一个 Hugging Face 上的 Transformer 模型,用 CUDA 基本上直接跑。用 ROCm,大概率也能跑——但如果是比较新、比较冷门的模型,或者用到了一些特殊的融合算子,就可能出问题。你去看 GitHub issues,经常见到“ROCm 上这个 kernel 编译失败”“某个 attention 实现在 ROCm 上比 CUDA 慢 30%”之类的帖子。 然后你怎么办?要么等社区修,要么自己改。自己改的话,你要懂 HIP(AMD 的 CUDA 转译层),那又是一个学习成本。 所以目前 AMD 的生态状态,总结一下:能用,但不爽;在进步,但不快;社区活跃,但规模差了一个数量级。 我朋友问:“那有没有可能有一天 AMD 追上?” 我说:“理论上可能。但你要知道,CUDA 发展了快二十年,积累了无数闭源和开源代码、工具、库、习惯、教程。这玩意儿不是光靠砸钱就能超的——它更像一种语言。你说英语难学吗?对中国人来说不简单,但全世界都在说,你绕不开。你非要发明一门新语言,语法更优美,发音更规则,但没人说,那有什么用?” 他沉默了一下,说:“那 AMD 不就是个备胎?” 我想了想,说:“备胎这个词不太对。应该叫‘另一个选项’。而且这个选项在某些场景下,其实更合适。” 什么地方更合适? 第一,HPC 和科学计算。很多超级计算机用的是 AMD CPU,配上 AMD GPU 可以做到极致的内存一致性优化。这类用户不追求“最新 AI 模型秒级部署”,他们追求的是长期稳定的运行、可预测的性能、以及预算友好。AMD 在这块确实有优势。 第二,预算敏感的大规模推理。如果你要部署一个服务,每天处理百万级请求,卡的数量直接决定成本。MI300X 单卡显存大,意味着你可以用更少的卡跑更大的 batch,单位 token 的成本更低。AWS、Azure 上现在都有 MI300 实例,一些做 AI 推理服务的创业公司已经开始切一部分流量过去了。 第三,开源社区驱动的用户。有些人就是不想被锁死在英伟达生态里——可能是出于技术理想,可能是为了供应链安全,也可能就是喜欢折腾。ROCm 是开源的,你甚至可以自己编译、自己改 kernel。这种自由度,英伟达给不了。 我朋友说:“那听起来也不是一无是处。” 我说:“当然不是。你要把 AMD 说得一文不值,那它市值两千多亿美金是天上掉下来的?问题是,你得接受它目前的不完美。” 说到这里,我想起上次聊英伟达时提到的一个观点:他们搞算法的人,其实一直在做“降低单位智能所需算力成本”这件事。这个逻辑对 AMD 来说同样适用,甚至更关键。 为什么?因为 AMD 目前的处境是:算力不差,软件生态稍弱。那如果你能用算法层面的优化,减少对软件生态的依赖,AMD 的劣势就会被缩小。 比如,你做模型量化——把 FP16 压到 INT4。很多算子优化其实是在编译层完成的,不一定要依赖 CUDA 特有的库。AMD 的 ROCm 里也有类似的推理优化工具,比如 MIGraphX。如果你把模型量化的足够轻量,算子的复杂度足够低,那 CUDA 和 ROCm 的差距就没那么大了。 再比如,你做算子融合。把好几个小操作合并成一个大的 kernel,减少 kernel launch 开销。这种优化很多时候是在框架层(比如 PyTorch 的 inductor)或者编译层(比如 TVM、MLIR)完成的。只要 AMD 的硬件支持这些指令,你写出来的优化代码两边都能跑。 看过一篇论文,讲的是在固定推理延迟下,用 AMD MI250 跑优化过的量化模型,和用 H100 跑原始精度模型,前者的能效比居然更高。说明算法优化可以在一定程度上“抹平”硬件和生态的差距。#AMD#苏姿丰#英伟达#CPU #美股

8. 英伟达Blackwell架构推理成本降90%_新浪新闻

9. 暴降 90%!英伟达 Blackwell 架构将 AI 推理成本压缩至十分之一

10. 暴降 90%!英伟达 Blackwell 压缩 AI 推理成本至1/10

11. 放弃H100转头用RTX 6000 Blackwell?AI推理效率狂升1.63倍

12. 英伟达向客户赔款!

13. NVIDIA GB200 NVL72

14. 单块2700W!NVIDIA GB200完整硬件参数与冷却要点详解

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章