ROCm 10 正式 GA,AMD 把护城河赌注押给 AI:3.3x 提速是服务器卡的小字,A 卡用户的真实利好是这几条

源自17位全网作者

04:17

8月下旬,AMD把ROCm版本号直接从7.x跳到了10。同一周,B站一个39秒的视频在本地AI圈炸了:有人用7900 XTX首跑了Qwen3.8-122B这个量级的MoE模型。哔哩哔哩开源工程moe4all公开可查,评论区刷了240条。群里两天里吵了两轮——前一天喊"现在不换A卡就是大冤种",后一天搬出另一张截图:“AMD官方说推理快3.3倍,CUDA药丸。”

吵归吵,把ROCm 10的发布说明、性能附注和这几周真实上手的折腾帖全部读一遍之后,我的结论先放这儿:3.3x是真的,但它大概率不是给你的;不过这一版里确实有几样东西,是给普通A卡用户的。

一、先把3.3x的小字拆开:是数据中心卡的利好

海报上那句"相同硬件上,推理性能平均提升3.3倍、训练平均提升2.4倍"。知乎附注编号MI350-81/82,测试条件写得很细:

  • 硬件:Supermicro 8× AMD Instinct MI355X——数据中心卡,单卡288G HBM。小红书你的7900 XTX、9070 XT、9060 XT都不在这个名单里。

  • 对比对象:ROCm 7.0 vs “ROCm.ai预览版(ROCm 7.2.2)”,模型是GLM-5、Kimi-K2.5、DeepSeek-R1-0528三个,取TPS综合平均。

  • 测试方:AMD Performance Labs自己,2026年7月7日测的,单方面宣称,还没有第三方复现。微信

ROCm 10 正式 GA,AMD 把护城河赌注押给 AI:3.3x 提速是服务器卡的小字,A 卡用户的真实利好是这几条

最容易被忽略的一点:这组对比里,“新堆栈"不只加了AI优化——vLLM从0.16升到0.22、SGLang从0.5.8升到0.5.13、PyTorch从2.8换到2.10,GLM-5还换上了新的ATOM后端。微信也就是说,3.3x是"一年前的旧基线"对着"新框架版本+AI优化"的总变化量,目前没法拆出来智能体优化本身占多少。对管8卡集群的人是重大利好;对单卡个人玩家,这个数字正确的读法是"AI正在进入软件栈”,而不是"我的卡白涨3倍"。

还有一条硬边界:负责自动优化的那个Agent Hyperloom,当前支持范围是MI300X、MI325X、MI355X三张服务器卡,pip装上就能用——但门票不是驱动,是卡。微信

二、那为什么个人玩家也值得读完:AMD在赌一条新路线

N卡这轮涨价咱们前面拆过,不重复。这里要说的是CUDA护城河到底是什么。压缩到两条:几万个被手调到极致的算子,以及"任何报错搜出来都有人解过"的社区经验。后者才是个人玩家真正的痛点,知乎那篇传得很广的硬件避坑帖把话说得很直白:A卡一旦报错,“教程里98%的报错解决方案都是N卡的,A卡遇到问题基本就废炮了”。知乎

靠人肉堆生态,AMD十年没追上,这条共识没人怀疑。所以ROCm 10干的事,是第一次把"用AI把护城河填了"写成了产品,三件套正好对着上面两条:

1)让AI写算子、调算子。Hyperloom是一套自主优化智能体,五个组件分工:TraceLens自动识别瓶颈、Magpie做基准评估、IntelliKit对话式性能分析、GEAK是核心优化器、Arbor用树状搜索不断自我演化,整个流程是"分析→规划→优化→验证"的循环。值得圈里人注意的是GEAK的后端列表:HIP、Triton、CK、FlyDSL、TileLang全都吃。微信官方口径是把过去需要数周的手动优化工作,缩短到几个小时。今日头条还记得这半年"AI算子赢了人类""CUDA护城河被AI撬开"那几轮争议吗?AMD的赌法就是:既然人肉算子追不平,那就让Agent替我追——这是"去CUDA化"争论第一次从观点变成了一家有出货能力的厂商的产品路线。

ROCm 10 正式 GA,AMD 把护城河赌注押给 AI:3.3x 提速是服务器卡的小字,A 卡用户的真实利好是这几条

2)让AI替你背报错。AMD Skills把官方验证过的ROCm知识和工作流打包成技能,直接进Claude Code、Cursor、Codex这些你已经在用的编程Agent。这些技能从Codex插件目录、Cursor应用市场里的AMD页面,或者Claude插件中搜索amd-skills都能安装。微信具体条目也够硬核:rocm-doctor做环境诊断、serving-llms-on-instinct一键在Instinct上起vLLM服务、tracelens把PyTorch profiler数据转成性能报告。以前A卡最贵的"没人替你解bug",AMD自己的答法是:把答案库喂给Agent。

3)一条命令装完环境。ROCm CLI是个单二进制,不要求预装Python、Rust或ROCm,`rocm serve`起模型服务、`rocm doctor`诊断、内置ROCm Console能看GPU利用率、HBM占用、每瓦token数。注意身份:它目前是技术预览,官方写的是从ROCm 7.13软件版本开始支持,ROCm 10的正式支持即将推出。知乎但它瞄的正是那个痛点——有人为了跑通27B,装环境装了六天。

ROCm 10 正式 GA,AMD 把护城河赌注押给 AI:3.3x 提速是服务器卡的小字,A 卡用户的真实利好是这几条

三、对个人A卡用户,真正有关的是这张清单

从发布说明里把消费级相关的条目单独捋出来:

  • 支持面:RX 9050(含4GB版)首次进入官方支持。微信

  • 工具下放:性能天花板分析(Roofline)首次扩展到RDNA3(GFX11xx),以前这类深度性能工具只服务Instinct;统一可视化分析环境ROCm Optiq 1.0同步发布。

  • 出图路径:ComfyUI针对Wan2.2、FLUX.2 KLEIN、SD3.5 Medium、SD2.1、SDXL五个热门模型做了性能优化,官方还给出了注意力算法和后端的选择建议。

  • 微调下放:Ryzen AI MAX平台新增Unsloth支持,本地LoRA/QLoRA微调不用再依赖云端——对128G统一内存的APU来说,"能跑"和"能练"从此是两件事。

  • Windows:HIP SDK正式退役,由ROCm Core SDK接替,Windows和Linux从此同一套SDK定义、同一发布节奏。但泼一盆冷水:ROCm 10在Windows上以tarball形式发布,原生安装程序预计2026年晚些时候才上线。Win党要的全家桶,还差最后一块。

  • 工程治理:TheRock构建系统接管全部包的出包,hipBLAS和rocBLAS合并、软件包统一加amdrocm-前缀、安装目录换成/opt/rocm/core-10.0。翻译成人话:过去"装完少三件套、路径东一个西一个"的问题,结构上被解决了。

  • 节奏:后续版本大约每六周一发。

数据中心的更新也在:RCCL上游对齐到NCCL 2.30.4、虚拟化支持扩到MI355X/MI350X等,这里不展开。

四、已经有人在替所有人试错了:速度和坑,一起报

官方的话说到这,看最近几周真实上手的人怎么说。

速度这一侧,现在能核到的民间数字大致是:RX 7900 XT 20GB,Ubuntu 26.04预览版+ROCm 7.14+源码编译llama.cpp,Qwen3.8-27B的IQ4_XS量化、开MTP,稳定45~46 tok/s、峰值冲到50。今日头条这位老哥买卡花三千出头,“比同档N卡便宜快一半”。双7900 XTX跑27B能到36+ t/s,出图出视频全靠ComfyUI,作者的原话是:这套配置如果用N卡要多花不止一倍的钱。知乎小红书8月那篇高互动的科普帖给的判断也是"Ollama、LM Studio、llama.cpp目前支持ROCm,16G覆盖7B~14B、32G可以更大"。知乎一个47万浏览的回答里还有一组数据:ComfyUI在ROCm 7.2上实测速度比ROCm 6.4提升39%。知乎

ROCm 10 正式 GA,AMD 把护城河赌注押给 AI:3.3x 提速是服务器卡的小字,A 卡用户的真实利好是这几条

坑这一侧,还是那批人:7900 XT那位折腾了六天,HIP_PLATFORM报错卡两天,最后救命的workaround藏在GitHub上一个2024年的老issue里。双7900 XTX那位的避坑清单同样具体:llama.cpp/Ollama认`HIP_VISIBLE_DEVICES`,但PyTorch ROCm版某些情况下无视这个变量,ComfyUI直接绑错卡OOM;核显接管显示后Xorg照样枚举独显、白占300MB显存;升级Linux内核先撞amdgpu DKMS编译失败,再被Secure Boot拒启。B站那个122B视频也冷静看:39秒、没有完整环境说明、作者还打了AI创作声明——当"能跑"的证据可以,当"好用"的证据不行。至于观望派,知乎相关提问下的原话还摆在那:ROCm做得是真垃圾,bug一堆,性能还比不上社区魔改版。知乎

两拨声音放一起,能看清一件事:A卡的硬件性能早就不是主要矛盾了——带宽才是天花板,7900 XTX的960GB/s对5090的1792GB/s,物理账谁也改不了。真正在变化的,是环境搭建和报错解决的成本曲线,而这恰恰是ROCm 10对准的地方。

五、分人的结论:谁先动手,谁再等等

  • 管8卡MI300系、或在评估AMD集群的人:这是实打实的版本。第一步就是拿自己模型跑一次Hyperloom——官方的3.3x是三模型平均,你的负载可能2x也可能1.1x,报告自动生成,试错成本低。

  • 已经A卡在手的:别急着升级现有稳定环境。CLI是技术预览、Windows安装器没落地,按六周节奏等新版本和第三方复现贴,让子弹飞两周。

  • 涨价周期里犹豫要不要换A卡跑模型的人:先答三个问题——肯不肯用Linux(训练和多卡仍以Linux成熟);主力是不是出图、量化推理、vLLM这三条路(社区验证最充分);报错时肯不肯让Agent替你翻issue。三个都是"肯",现在上车换A卡的成本比三个月前低了一档;有一个"不肯",N卡的溢价买的还是省心。预算上限够不着32G的话,Radeon AI Pro R9700那种32G单卡去年曾被曝在零售渠道标价1220美元上下,和16G的9070XT一起,是两个被讨论最多的档位。今日头条

  • 看"去CUDA化"热闹的人:这一版是个分水岭。以前争论的是"AI会不会抢CUDA工程师的活",ROCm 10把问题升级成了"生态差距会不会被Agent直接抹平"——CUDA 13.3和ROCm 10,其实在同一条赛道上抢答同一道题。

最后留三个观察信号:Hyperloom的支持范围会不会下放到消费级卡;Windows原生安装程序落地那天,装机贴的真实翻车率是多少;以及两周后,个人用户的第一批ROCm 10实测贴发出来的数字,比任何海报都值钱。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章