ROCm跳过8和9直接发10.0,官方喊推理暴涨3.3倍:A卡跑本地大模型党,先看社区实测再决定

源自20位全网作者

02:26

这周硬件圈最热闹的角落,可能不是显卡涨价,而是一条软件新闻:AMD正式发布了ROCm 10。微博没有8,也没有9,直接从7月推送的7.14,跳到了10.0.0。

快科技的标题很有冲击力——“推理性能暴涨3.3倍”。微博知乎上紧接着问题来了:AMD发布ROCm10.0.0,其在AI推理方面有哪些性能提升?知乎B站相关视频下面的评论区,第一条就是在玩梗:准备版本号追上CUDA吗?哔哩哔哩

对我们A卡用户来说,真正值得问的只有一个问题:这次跑大模型,A卡是不是终于能用了?我把官方发布、媒体报道和社区实测翻了一遍,今天说说哪些是真的,哪些还得再等等。

版本号不是性能,这次跳版本首先是改名

先说结论:别把7.14→10.0理解成"性能跳了三代"。

B站评论区有了解内情的用户给出了解释:rocm版本和hip版本解藕,新的命名规则重置到10.0.0,否则下游项目做版本检测调的接口过于混乱。哔哩哔哩翻译一下:以前ROCm主版本和HIP兼容层版本缠在一起,llama.cpp、PyTorch这些工具接ROCm,得对着兼容矩阵配版本;现在解耦了,版本号本身不再等于性能代际。

所以"版本号追上CUDA 13.4"只是个玩笑。哔哩哔哩但AMD选择在这个时间点改版本规则,本身是个信号:它想把ROCm做成一个能长期维护的统一栈,而不是每代一换的散装组件。

那么,ROCm 10实际改了什么?

把官方发布和各家报道捋一遍,实质变化集中在四件事上:

第一件,SDK统一。Windows平台采用与Linux平台定义完全一致的ROCm Core SDK。微博A卡长期以来"Linux一等公民、Windows试验田",这次把两个平台的开发底座拉平了。

第二件,部署简化。实测社区说得最直接:在AMD硬件上部署AI,不再需要查复杂的匹配矩阵。微博以前装什么模型、什么框架、哪张卡,先查表;现在这一步省了。

第三件,ROCm.AI。简单说就是让AI帮你写GPU代码、帮你调优的工具。哔哩哔哩AMD自己也在用"用AI补软件短板"的思路。

ROCm跳过8和9直接发10.0,官方喊推理暴涨3.3倍:A卡跑本地大模型党,先看社区实测再决定

第四件,Radeon Cloud GPU官方文档同步上线,注册AMD开发者计划就能申请云端算力白嫖。哔哩哔哩不想折腾本地环境的,可以先在云上玩起来。

官方口径 vs 社区实测,差距在这里

官方口径里最抓眼的是快科技那句"推理性能暴涨3.3倍"。但截至目前,具体测试模型、测试硬件口径都没公布,这个数字,我建议先让它带着问号。

社区实测更有意思,分成两派:

一派已经上手。一位微博科技博主在发布后第一时间装了ROCm 10(Ubuntu 26.04),在Strix Halo(也就是锐龙AI Max 395的平台)上编译llama.cpp,“零错误、零警告干净通过”。而且ROCm的推理性能明显超过了Vulkan后端——以前消费级卡上ROCm经常连Vulkan都打不过,这次是体验层面的质变。微博

另一派还在观望。那条B站视频评论区,不少老用户拿7.x时代的数据说话:AI Max 395上"从6.4到7.14几乎0提升",“ROCm和Vulkan没测出多大区别”,“Windows上整体其实不行,Linux上好一点”。哔哩哔哩微博上还有数码博主花了一下午处理ROCm的"两个巨坑"。微博他感慨这种巨坑,“手动编译那得把人气死”。微博

两派合起来看:ROCm 10在"好装"这件事上,已经有实锤;但"能跑多快",目前的正面样本只有单个,还得等更多模型、更多卡的第三方对照测试。

你能不能上车?看你手里是什么卡

ROCm 10的变化对不同人意义不一样,按卡分一下就好理解了:

RDNA4(RX 9070系列):ROCm 10扩大了GPU支持范围,但社区里它跑AI的实测还很少,具体表现等实测。

RDNA3(7900XTX / 7800XT等):gfx1100是社区llama.cpp跑本地AI的"热门型号",连知乎《CUDA到ROCm》移植实战都拿它当验证平台,生态最厚。知乎早在2025年初,AMD官方就晒过7900XTX部署DeepSeek蒸馏模型的成绩:大幅领先4080 SUPER、除32B模型外小幅领先4090。微博

ROCm跳过8和9直接发10.0,官方喊推理暴涨3.3倍:A卡跑本地大模型党,先看社区实测再决定

Strix Halo(锐龙AI Max 395):这个平台最大的差异化是统一内存可以大量分配给显存。本地跑27B级别的模型对显存要求很高,AI Max的大内存能直接瞄准更大的模型,ROCm 10在它上面已经能零错误编译。天钡NEX395这类迷你主机已经重新上线,64GB内存版无硬盘定价11999元,性能释放可达140W,接口也够折腾。微博

ROCm跳过8和9直接发10.0,官方喊推理暴涨3.3倍:A卡跑本地大模型党,先看社区实测再决定

不过要泼点冷水:实测新MoE模型在它上面目前只有20 toks/s上下,还得等llama.cpp进一步优化。微博

核显780M:7.1起就能用,ollama的ROCm版默认开,但HIP Graph之类还不算稳——能玩,别抱太高期待。哔哩哔哩

老卡(5700XT等):Windows下ROCm 7以上直接提示找不到设备,这波和你关系不大。哔哩哔哩

三类人,三个判断

第一类:已有A卡、想试试本地AI。值得花一个下午玩。入门路线按成本排:ollama(ROCm版)→ llama.cpp → ComfyUI;完全不想碰驱动的,Radeon Cloud免费算力是官方白嫖路线。哔哩哔哩这次门槛确实降了,兼容矩阵没了。

第二类:想为跑大模型专门买硬件。先记住一句话:本地大模型,显存为王——8G显存跑9B已经在边缘,16G能舒服跑9B;27B需要17-20GB显存,24G才能舒服跑27B,这才是进阶级的真正门槛。知乎在这个框架里,AI Max 395的统一内存路线确实是AMD能打的一张差异化牌,华硕创13这类笔记本形态也已经上市。微博但CUDA的生态壁垒还在,英伟达刚宣布以129亿美元收购Hugging Face。微博工作、生产环境求稳选N卡;个人折腾、图性价比,A卡这条线这次真的值得算一算。

ROCm跳过8和9直接发10.0,官方喊推理暴涨3.3倍:A卡跑本地大模型党,先看社区实测再决定

第三类:纯游戏党。ROCm不影响你打游戏帧数,不用跟。但ROCm变好对A卡长期价值是加分项——至少"A卡不只是打游戏"这个故事,又多了一个证据。

接下来值得盯的三个信号

最后给一个观察清单,这三件事兑现与否,决定ROCm 10是不是真的"转折点":

  1. 第三方对照测试能不能复现"3.3倍"的推理提升,并且说清楚模型和硬件口径;

  2. Windows端SDK统一后,有没有真实用户的实测反馈冒出来(目前的实测几乎都在Linux上);

  3. llama.cpp、ComfyUI、ollama这些主流工具,会不会官方声明适配ROCm 10,适配后性能提升多少。

ROCm被喊了十年"软件拉胯",这次AMD至少把门开大了、门槛降低了。能不能留住人,看接下来几个月。

内容由AI生成

精选参考来源

1. 直接跳两个大版本!AMD ROCm 10正式发布:推理性能暴涨3.3倍

2. AMD 发布 ROCm10.0.0,其在 AI 推理方面有哪些性能提升?

3. AMD 从 ROCm 7.14跳跃至 ROCm 10.0并推出ROCm.AI

4. AMD 发布 ROCM 10: 十年磨一剑,AMD在软件生态方面取得重大进展

5. ROCm满十岁直接跳到10.0:AMD把优化GPU这活也交给Agent了

6. AMD发布ROCm.AI,让AI自己写代码调显卡!

7. 【AMD官方资源】Radeon Cloud GPU官方文档发布了

8. 刚用了一下午,处理好了ROCm的两个巨坑

9. 其实我啥都没干,只是用AI抽AI让AI跑起来而已

10. CUDA 到 ROCm(2):从源码移植到 gfx1100 构建验证实战

11. AMD非常兴奋的发布了旗下RX7900XTX消费级显卡在部署DeepSeek蒸馏小模型上和英伟达同级别显卡的速度差异

12. 天钡 NEX 395 迷你主机“重新上线”:降级至 64GB 内存,无硬盘 11999 元

13. 本地部署大模型需要什么配置?2026年

14. 华硕创 13 2026:锐龙 AI Max+ 395 + 64G + 1T

15. 英伟达已同意以129亿美元收购开源AI平台HuggingFace

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章