前几天B站一条CUDA对比ROCm的深度视频下面,点赞最高的评论只有十几个字:AMD不是不能用,就是折腾点。哔哩哔哩这条评论下面攒着各种糟心实录:有人买了两张9060 XT,结果普通游戏主板上,vLLM就是没法做张量并行,对个人玩家来说这些都是灾难。与此同时,也有老玩家在评论区说,很多框架和项目没有ROCm版本时,让AI自己修改编译出来也不是不行。最后一件事,AMD官方做了。7月底的Advancing AI 2026大会上,AMD正式发布ROCm.ai——一句话:把ROCm的安装、部署、排错和调优,交给AI智能体。知乎
ROCm.ai不是新驱动,是一套四件套
先澄清一个常见误会:ROCm.ai不是ROCm的版本升级,而是盖在ROCm软件栈上的「AI原生开发体验」,把AI辅助开发、智能部署和AI驱动的软件优化合到一起,覆盖从云端Instinct集群到Radeon桌面卡的全系AMD平台。知乎

拆开看,一共四件,每件对着一种不同的痛点。AMD Skills:把ROCm的「经验」装进你的AI编程助手。这是离普通用户最近的入口:AMD把官方验证过的ROCm知识——硬件支持、版本匹配、安装部署路径——打包成Skills,装进Claude、Cursor、Codex这些主流编程助手,指导方案会针对你的显卡型号和ROCm版本来给。知乎以后问「9070 XT装PyTorch报gfx错误怎么办」,回来的不再是泛泛建议,而是针对你这张卡、这个版本验证过的路径。
ROCm CLI:一条命令行,管安装、部署和诊断。以前装ROCm靠包管理器加官方文档加论坛帖子,现在收敛成一条CLI:安装ROCm软件、检查环境、部署模型、更新组件、生成诊断信息,确定性执行,脚本和CI都能调。知乎它对着的,正是「装了一下午,倒在环境变量」这类最常见的抱怨。
ROCm Console:遥测与诊断面板。GPU的实时状态、日志、运行时上下文,都能直接看到。以前卡掉了、黑屏了只能靠猜——有玩家因为显卡反复黑屏掉驱动,认定750W电源带不动7900 XT,1299元的1000W电源都加进了购物车,盯了一整晚监控才发现12V、功耗、线温全部正常,硬件全程无辜,凶手是软件冲突。哔哩哔哩有了诊断面板,至少能先看清「发生了什么」,再决定要不要花电源的钱。
Hyperloom:开源的调优智能体。四件里最硬核的一件:自动分析推理负载、定位瓶颈、对宿主机代码和GPU内核做针对性优化,再验证性能与正确性,从分析到优化到验证全程闭环。知乎AMD官方给的说法是,同一硬件上,最新版ROCm相比ROCm 7平均推理提升3.3倍、训练提升2.4倍——注意,这是AMD自己的测试口径,目前还没有第三方复现。知乎

它能解决什么,不能解决什么
对着社区最近真实抱怨过的痛点映射一遍,边界其实很清楚。装环境的折腾,是AMD Skills和ROCm CLI的主攻方向,也是眼下最接近能用的部分;「不知道为什么慢」,是Hyperloom对着的,但它面向的是端到端推理负载优化,更适合部署服务的团队,个人玩家上手门槛不低。至于生态缺口——有些框架没有ROCm版本、部分硬件特性要等更新的架构补齐——ROCm.ai本身解决不了,得靠AMD的软件迭代速度。
这个速度有迹可循:DeepSeek V4发布仅两周,ROCm就通过纯软件优化把推理吞吐提升了75倍,虽然距英伟达B200仍有5倍差距,但追赶的节奏是能看见的。微博更有标志性的案例是Anthropic:一边官宣2GW的AMD Helios算力部署计划,一边有工程师让Claude在周末自行运转,完成了Instinct MI355芯片与ROCm平台的全套适配和性能调优——用AI补齐AMD的软件适配,这条路连Anthropic自己都在走。微博AMD自己也把这条路径的实操样板放了出来:官方ROCm博客在8月17日发布了完整教程,用SGLang在Instinct GPU上部署开源模型,再接给Claude Code当本地编程智能体,全程可以在内网环境完成。AMD ROCm官方博客

但也要说实话:ROCm.ai发布才三周多,社区的真实反馈还很薄,B站相关视频目前还停留在新闻转发层面。哔哩哔哩它到底好不好用,还需要更多实测,现在下结论太早。
现在能摸到什么,谁适合先摸
想上手的话,当前门槛最低的路线是AMD Skills:在Claude插件里搜索amd-skills安装,Cursor应用市场里有AMD官方页面,Codex插件目录也已上架,官方仓库是github.com/amd/skills和github.com/rocm/rocm-cli。{{{CUSTOM_HTML_TAG_12}}}两类人适合先试:准备搭ROCm环境的人,让AI助手带着走一遍安装和环境检查,经典坑能避开大半;已有环境但老是报错的人,拿官方Skills对照排查,比盲搜论坛帖子靠谱。如果你的推理环境已经很稳,不急着动,等社区实测跑出来再决定也不迟。
两件预期管理的事。第一,AMD Skills目前还是技术预览版,官方明确说Skill的名称、范围和可用性可能随着新工作流的验证而调整,当工具用可以,当依赖还早。知乎第二,3.3倍、2.4倍是AMD内部测试数据,不必当真,看个方向就好。
为什么它比一次驱动更新更值得关注
这次发布的意义,不在于多出了四个工具,而在于AMD补软件短板的方式变了:以前是发文档、修驱动,靠资深玩家口口相传;现在是把那些「折腾出来的经验」直接塞进每个人每天都在用的AI助手。如果这条路走得通,A卡本地AI的入门门槛会系统性下降——对还在犹豫「要不要买张A卡跑大模型」的人来说,这是比任何单次版本更新都更值得盯的信号。
三个信号值得继续盯:AMD Skills结束预览后的社区真实反馈,Hyperloom优化效果的独立复现,以及「新模型发布两周就有优化跟上」的节奏,ROCm还能保持多久。