AMD 的软件栈,今年夏天给自己过了个"十周年"。
8 月 27 日,ROCm 10.0.0 发布,版本号从上代的 7.14 直接跳到 10,跳过 8 和 9。知乎 官方的叙事是"标志着 AMD 软件栈迈入第十个年头",同时 ROCm.AI 这套 AI 原生开发套件从预览转正为 GA。知乎
评论区照例热闹:为了凑一个十周年直接跳到 10、本质是 ROCm 1.00、下次该叫 ROCm 2026——三条高赞热评差不多概括了社区对这版本号的态度。哔哩哔哩哔哩哔哩
但玩笑归玩笑,B 站两条 ROCm 10 解读视频加起来约 2.3 万播放、130 多条评论,底下确实是两种情绪并行:一部分人觉得 AMD 终于开始认真做开发体验了,另一部分人直接说:这提升和桌面端游戏卡没有任何关系。哔哩哔哩 后半句比版本号玩笑更接近真实的分歧。
我把官方发布材料、9 月 9 日—10 日的两篇最新实测、三组 B 站评论区和对老帖的追问翻完,结论一句话:ROCm 10 对拿 A 卡玩 AI 的人是真升级,但三个新工具的覆盖面各有各的小;官方宣传的 3.3 倍,从测试口径那天起就不属于你手里那张卡。
一、先把 3.3 倍说清楚:它测的不是你的卡
官方材料里的说法是:采用 ROCm.AI 配置的系统,相比 ROCm 7,推理性能平均提升 3.3 倍、训练平均提升 2.4 倍。知乎 但把发布材料里的脚注测试条件摊开看,是另一幅画面:
硬件:8 张 MI355X 的服务器系统;
对比:ROCm 7.0 vs ROCm.AI 预览版(标注 ROCm 7.2.2);
时间:2026 年 7 月 7 日,AMD Performance Labs 实测;
口径:GLM-5、Kimi-K2.5、DeepSeek-R1 三个模型的 TPS 综合平均。
数据中心旗舰卡、三个模型取平均、对比上一代软件栈——这套条件决定了 3.3 倍不可能在桌面 Radeon 上复现。所以首批实测反馈几乎清一色是这三个字:没感觉。7900XTX 用户在 Ubuntu 26 上跑 Qwen3.8-27B,反馈是用上没感觉啥提升。哔哩哔哩 AI Max 395 用户的版本跨度更大,从 6.4 一路升到 7.14,结论是好像几乎 0 提升。哔哩哔哩 还有个更细的细节:把官方发布材料译成中文的那位作者自己都指出,原文标题写的 ROCm.ai 版本是 7.2.2,但 MI350-82 的具体软件配置写的是 ROCm 7.2.1 + Primus v26.3。知乎 这种数字的表达空间有多大,各位自己品。
二、三个新工具:给谁的、不给谁的
ROCm.AI 一共三个组件,我把"官方口径 + 仓库现状"整理成一张覆盖面表:
组件 | 状态 | 干什么 | 现在覆盖谁 | 不覆盖谁 |
|---|---|---|---|---|
ROCm CLI | Tech Preview(v0.1.0-preview.1) | 单个二进制文件,不用预装 Python/Rust/ROCm;15 类已知故障 diagnose;多版本运行时切换/回滚;存储清理;Console 实时监控 | Windows + Linux 双平台预编译,从 ROCm 7.13 起可用 | 15 类故障里只有 4 类修复能自动执行;对 ROCm 10 的正式支持还"即将推出" |
AMD Skills | GA,共 8 个 | 把验证过的官方操作知识打包成技能,喂给 Claude Code/Cursor/Codex 等编程 Agent | 本地推理(Lemonade 系 3 个)+ Instinct/EPYC 服务器 vLLM 部署 + 性能优化 3 个 | Cursor/Claude Code/Codex 的 marketplace 只上架了 5 个,3 个要手动装;服务器方向暂未覆盖 SGLang |
Hyperloom | v1.0.0 | Agent 自主跑"找瓶颈→改代码→基准测试→不达标回滚"优化循环,带准确率门 | MI300X/MI325X/MI355X,vLLM/SGLang,要求 ROCm 7.2.x | 验证矩阵明确不含 Radeon 和 Ryzen |
三个对号入座的判断:
如果你的卡是 Radeon/Ryzen,今天能吃到的主要是 CLI。 很多人被"装环境"烧伤过:B 站那条《实测AMD显卡ROCm7.2vsROCm7.1.1对ComfyUI生图生视频性能和稳定性的影响》的实测视频有 2.1 万播放,讲的就是版本一升级反而回退的惨案。哔哩哔哩 B 站评论区里也有人原话抱怨:rocm 对于 vllm 还有各种轮子的版本进度总是落后,时不时因为更新太慢掉出官方支援,然后得去 amd 的仓库找镜像、自己打包。哔哩哔哩 这类用户,正是 CLI 的靶心。
CLI 的 multi-runtime + rollback + 存储清理就冲着这个痛点来:rocm runtimes 可以同时保留多个 ROCm 版本,activate 切换、rollback 回上一个,装几次版本也不再轻易塞满磁盘。知乎
`diagnose` 一侧则内置了 15 类 AMD 环境已知故障检查,每种故障带评分、证据链和对应修复方案,但 15 个修复里现阶段只有 4 类能自动执行,其余是打印步骤让你自己来。知乎
9 月 9 日做实测的开发者反馈很诚实:diagnose 扫出了他系统里一条真实存在的 blacklist amdgpu 配置,说明检查逻辑确实在工作,但同一台机器 amdgpu 明明正常加载、rocminfo 也能跑,这条诊断就属于误报——骨架搭好了,诊断逻辑还在打磨。它毕竟目前依然是 preview 状态,GitHub 上明确标着 Tech Preview,别拿生产机第一个试。知乎
如果你用 Claude Code/Cursor 写 AMD 相关的代码,Skills 值得先装。 它解决的正是社区吐槽了半年的老问题:Agent 写 ROCm 代码老答不对。原因不玄学——一直以来公网上 AMD 的资料就是比 CUDA 少太多,不管是 AI 还是人,能查到的好内容都有限。知乎 搜索工具再强也救不了数据缺失,所以 AMD 干脆把经过整理的专业知识和验证过的工作流程打包,融入 Claude Code、Cursor 和 Codex 这些受支持的 AI 编程 Agent。知乎
最直接的例子是 serving-llms-on-instinct 这个 Skill:让 Agent 先查你的 GPU 型号,再估算模型装不装得进显存,接着选对应的 serving 配置,启动完最后还要跑一次测试。知乎
本地方向的三个 Skill 都围绕 Lemonade 展开:AMD 官方开发的本地推理框架,底层是 llama.cpp 和 whisper.cpp,在其上封装为 OpenAI 兼容格式的 API。知乎 对拿 A 卡跑本地模型的人,这可能比"半野生日志"的手搭脚本体面得多。
但也有两个注意:正式目录目前有 8 个 Skill,Cursor、Claude Code 和 Codex 的 marketplace 里只上架了其中 5 个,剩下 3 个要手动从仓库装;现有步骤也主要为 Claude Code 适配,其他 Agent 可能要自己调。知乎
如果你是 A 卡用户还惦记 Hyperloom,先等。 官方这次最有野心的模块——自动改服务参数、改框架源码、重写 GPU kernel,每步跑 benchmark,改坏自动回滚,还可以挂 GSM8K 之类的准确率门,12 小时预设的目标收益已经从 30% 提到了 50%。但实测文章里写得明明白白:GPU 方面目前验证过的是三款 AMD 数据中心 GPU——MI300X、MI325X 和 MI355X,Radeon 和 Ryzen 不在验证矩阵里。知乎 最猛的模块,头一年是给服务器的人用的;评论区那句"跟桌面游戏卡没关系",就是这套发布节奏的真实边界。
三、ROCm 10 本体里,桌面党真正有关的那几行
发布材料一笔带过的底层变化,恰恰是桌面用户该看的:构建体系换成了 TheRock,Windows 和 Linux 也第一次统一到同一套 SDK。知乎
还有一行也别漏:vLLM 和 SGLang 的官方验证容器、Ryzen AI MAX 上的本地微调支持、Roofline 分析第一次覆盖到 RDNA3、通信库 RCCL 也拿到了这个版本里最大的单项投入,而这套套件的三个组件仓库全部在 GitHub 上以 MIT 协议开源。知乎 海光的人给 rocm 修了不少 bug,开源这条路算是开始滚动起来了。哔哩哔哩
但"SDK 统一"不等于"老卡自动升天"。9 月 9—10 日的最新实测,就是老卡用户的现状答案:
RX 6950XT(RDNA2):走 Win11 WSL2 + Adrenalin 26.8.1 带的 ROCm 7.14.1 跑 ComfyUI,能跑,代价是版本必须锁死——必须使用 v0.34.0,master 版本会有 RuntimeError,启动还要额外加参数。知乎
680M 核显(gfx1035):有用户实测 ROCm 10.0.0 下模型训练计算正常,但按照文档安装 vllm 有问题,无论是 conda 下安装还是 docker 安装。哔哩哔哩
原生 Windows 也仍有暗坑:7900XTX + Win11 25H2,按官网指南安装 pytorch 测试全部通过,但是在训练的时候 tqdm 一直显示 0,没有报错,代码在 CUDA 上正常运行。哔哩哔哩 对 RDNA2、gfx90a 这些老卡来说,官方支持矩阵从来没把它们当主角,十周年也不改变这一点——评论区已经在排队问"gfx90a 提升大吗"“7900XTX 能升 ROCm 10 吗”,而官方材料对这些问题没有答案。
四、现在该动手的人、再等等的人,和该盯的信号
按你的状态对号入座:
现有环境稳定、只想跑图跑模型:先别折腾。第一批升级用户的反馈大体是两句话:我已经升级到了 ROCM10,但好像提升不明显;9070 的 rocm7 速度不如 vulkan,功耗还虚高。哔哩哔哩哔哩哔哩 重装环境的收益,等一个月让第一批帖子沉淀完再评估。
装过好几个 ROCm 版本、磁盘吃紧、环境经常崩:可以试 CLI,版本管理和清理是今天最实在的消费者福利;记住它是预览版,用独立机器或虚拟机先跑。
用 Agent 写 AMD 相关代码:marketplace 里上架的 5 个 Skill 五分钟装完,这是官方第一次把"喂给 AI 的正确知识"当作产品发布。
395/APU 用户:等。翻仓库还能看到几个开发中的 Skills,比如 rocm-doctor 和 apu-memory-tuner,在 GitHub 上已经能看到有初步代码,但都没发布。知乎 加上 395 本地微调的落地细节,值得盯。
服务器跑 vLLM/SGLang 的:Hyperloom v1.0 才是这次的主角,按官方预设跑 3 小时到 12 小时的优化循环就行。
四个继续观察的信号。CLI 对 ROCm 10 的正式支持是否如期兑现——官方口径是从 ROCm 7.13 软件版本开始支持,ROCm 10 的正式支持即将推出。知乎 另外三个:Hyperloom 的验证矩阵会不会扩到 Radeon/Ryzen;SGLang 方向的 Skills 何时补上;"装了没提升"的实测帖会不会在两周内被官方回应解释掉。这四个信号,才是 ROCm 10 这个"十周年"真正的验收标准。
社区老哥有句话总结得挺公道:rocm 不走开源路线,根本竞争不过 cuda。哔哩哔哩 这次 ROCm 10 的发布,是近几年 AMD 软件栈里最像"认真修开发体验"的一次——它第一次把 A 卡玩家"装环境、修环境、问环境"的每一类坑,都当成要修的产品问题。但你的卡能涨多少 token/s,答案不在发布会的 3.3 倍里,在后面几个月的实测帖里。