8 月 28 日,AMD 把 ROCm 从 7.14 一步跳到了 10.0,顺手推出了全新品牌 ROCm.AI,宣传页上最醒目的数字是「推理性能平均提升 3.3 倍」。知乎专栏哔哩哔哩 公告发出不到三天,B 站和知乎的评论区已经吵成两派:一派喊「A 卡翻身了」,一派晒出实测——「没感觉啥提升」。
如果你手里正好有一张 7900 XTX、9070 这类 A 卡,或者正在纠结「4000 块的二手 A 卡还是 1 万块的 4090」,这篇是写给你们的:3.3× 到底在测什么、消费级首周实测是什么分布、以及按你的卡该怎么决定升不升、买不买。
一、先把 3.3× 拆干净:这个数真,但测的不是你的卡
拆开 AMD 公告附的脚注,测试条件写得明明白白:
平台:8 张 Instinct MI355X 的数据中心整机,AMD Performance Labs 于 2026 年 7 月 7 日测得;
对照:ROCm 7.0 对 ROCm.AI 预览版(ROCm 7.2.2)——不是「ROCm 10 对 ROCm 7」;
模型:GLM-5、Kimi-K2.5、DeepSeek-R1-0528 三个模型的 TPS 综合平均;训练 2.4× 是另一组 Megatron-LM 小模型;
提升来源:一套叫 Hyperloom 的自主 Agentic 系统,替你分析负载、找瓶颈、改 Kernel、重跑基准,优化的是内核、内存管理和调度。
也就是说,3.3× 是「AI 优化器在八卡旗舰上帮你逐模型调优」的性能,而且公告原文里 Hyperloom 这次扩展支持的对象是 AMD Instinct GPU——消费卡不在这个口径里。知乎专栏

二、消费端首周实测:一份跨平台的声音分布
把知乎、B 站视频评论区里带硬件型号和数字的反馈收集到一起,消费级这一侧的首周图景是这样的:
场景 | 声音 | 出处 |
|---|---|---|
7900 XTX 24G + Ollama/ROCm 跑 Qwen3.8-27B | 50 tokens/s,「4000 大洋二手卡跟 4090 吐字速度一样」 | 知乎 8/31 回答(单例自报) |
7900 XTX + Ubuntu 跑 ROCm 10 | 「30-40t/s,和 ROCm 7.2.1 没区别」「没感觉啥提升」 | B 站评论区,5 赞、17 条回复 |
RX 9070 | 「ROCm 速度不如 Vulkan,功耗还虚高」;另一用户 Windows 实测「Vulkan 居然比 ROCm 强一点」 | B 站评论区 |
Ryzen AI Max+ 395(128G 核显平台) | 正声:ROCm 7.2+ 跑 Qwen3.8-27B 30+ tok/s;杂音:「从 6.4 到 7.14 几乎 0 提升」 | 知乎实测文 + B 站评论区 |
Windows 用户 | 「啥时候支持 Windows 呀」仍钉在评论区 | B 站评论区 |

为什么升级感知这么弱?因为日常体感的「吐字速度」是解码(Decode)阶段,逐 token 自回归,瓶颈是显存带宽,属于 memory-bound——这是卡死了的物理上限。7900 XTX 理论带宽 960 GB/s,RTX 4090 约 1008 GB/s,只差 5% 左右,所以两边跑同一个量化模型吐字差不多快,完全符合物理规律,也再次提醒:单点自报数据(50t/s 还是 30-40t/s)取决于量化档位和配置,别拿一条当均值。知乎问答哔哩哔哩
驱动栈的更新真正能动的是另外几件事:Prefill(读长 prompt)速度、崩溃率、新模型的「能不能跑」、以及装环境的折腾度。版本号从 6.x 到 7.x 到 10,这三项在进步;但显存带宽,AMD 救不了你。
三、ROCm 10 里对 A 卡玩家真正有用的,其实不是性能数字
通读官方公告,对消费级用户有意义的其实是一条:ROCm CLI(技术预览)——Windows 和 Linux 的预编译二进制、不需要预装 ROCm 就能跑,统一完成环境安装、模型部署、诊断、运行时激活与回滚,还内置 ROCm Console 实时看系统状态;客户端平台走 Lemonade 适配器。换句话说,这次最大的变化不是「快了」,而是「装环境这件事,官方终于开始管了」。注意两个限定:它仍是 Technology Preview,公告原话是「ROCm 10 的正式支持即将推出」;从 7.13 起可用,不是只有 10 才行。知乎专栏

第二条是给被移植折磨过的开发者的:AMD Skills 正式上线 Claude Code、Cursor、Codex 的 Marketplace,把 ROCm/HIP 移植的坑喂给编程 Agent,你不用换编辑器。此外整个栈转向模块化的 ROCm Core SDK,这是「长期变好维护」的地基工程,和今天的体感速度无关。知乎专栏

四、分人群决定清单:升不升、换不换、买不买
已有稳定环境的老用户(RDNA3 单卡,Ollama/LM Studio 跑量化模型):不动。你的瓶颈是带宽,升级收益集中在稳定性和支持面,且新栈首周有崩溃率的玄学风险(「RoCM 更容易崩溃」这类声音还热着)。先备份环境,等两周后的集中实测潮。
准备在 Ubuntu 上认真用 vLLM/SGLang 跑 MoE 中度玩家:可以上 ROCm 10。模块化 SDK、新模型支持和内核效率是主要收益——它改善的是「能不能跑、跑得顺不顺」,请把它记进行为预期,别记成 3.3 倍。
Windows 日常党:不用折腾换栈,Vulkan 路线当前够用;盯 ROCm CLI + Lemonade 转正的节点再动手。
正在做购买决策的人:纯为跑模型的话,4000 元级二手 7900 XTX 的带宽和 4090 同量级,吐字速度可以打平,这是真便宜;但你要用「折腾时间 × 生态完整度」来付差价——功能支持、社区教程、崩溃率都算成本。能接受「同速但更费劲」就上,追求到手即用就另算。低显存卡(9060 XT 级)不在本次讨论受益范围内:你缺的是显存,不是驱动栈,别指望官方加速改变这件事。
想靠它吃训练/炼丹饭的:继续持币观望。评论区那句「本质是 ROCm 1.00」是玩笑,也是现状注脚——生产押注等生态验证,别等版本号。
五、接下来盯什么
三个观察信号:ROCm CLI 何时从「技术预览」转正;Hyperloom 是否下放 RDNA 消费卡(现在支持列表里只有 Instinct);Windows 原生支持的具体范围。9 月初这波「48 小时/一周实测」潮出来后,值得回来对照这篇的口径核一遍——如果到时候出现消费卡 Prefill 大幅提升或崩溃率改善的集中反馈,第 2 类人的答案会提前变成「现在就升」。
这轮 ROCm 10 的真实定位:数据中心拿到了一个认真的 AI 原生工具链,消费卡用户拿到的是一个终于开始认真修的入场流程。3.3× 留在 MI355X 的脚注里,你的 7900 XTX 该不该动,看第四节。