AMD正式发布ROCm.ai,AI开发效率从此起飞!
上个月在旧金山举办的Advancing AI 2026峰会上,AMD“最强机架级AI基础设施”Helios、“最强智能体CPU”第六代EPYC Venice、“最强AI芯片”Instinct MI400系列GPU、面向机器人的锐龙AI嵌入式X100处理器和Kria AI系统模块(SOM)等全场景AI硬件新品悉数登场。
覆盖云端、企业、端侧的全栈AI计算方案,让全世界看到了AMD在前沿模型、智能体和物理AI三大方向的强悍实力。

软件侧同样值得关注,AMD正式发布了ROCm.ai,这是一套面向AMD平台AI开发的AI原生软件体验,支持开发者借助自然语言和主流AI编程助手,在AMD平台上完成AI工作负载的安装、部署、故障排查与性能优化,极大加速了AMD平台上的AI开发效率。
在聊ROCm.ai之前,得先说说现在AMD面向GPU计算的基础软件平台——ROCm到底处于什么阶段。
作为AMD对标CUDA的开放软件栈,不少人对ROCm的印象还停留在早年生态残缺、上手费劲的阶段,实际上走到今天,它已经是一套非常成熟的生产级软件栈,曾经阻碍开发者上手的诸多问题,如今已不复存在。
当前,在全球应用最广的开源深度学习框架PyTorch里,ROCm支持代码已经完全合入主分支,不用再编译特殊分支,ROCm已经是一等公民后端。vLLM、SGLang、llama.cpp、Ollama、ONNX Runtime、ComfyUI这些开发者日常用的推理工具,也全部实现了原生适配,基本都能开箱即用。
此外,开源生态的跨硬件适配,极低的CUDA迁移成本,稳定的发布节奏和企业级验证也都是它的核心优势。

所以,现在AMD要解决的问题,是让ROCm从可用变成好用。ROCm.ai 就是冲着这个问题来的。
按官方的定义,ROCm.ai是一套面向AI开发的原生开发体验,可以看作是架在ROCm核心栈之上的一套AI开发提效工具助手集合,把ROCm CLI命令行工具、AMD Skills官方技术能力、AI驱动的软件优化能力整合为统一的软件体验,简化了从安装、部署到调试和性能优化的整个AI开发流程,帮开发者更快地把想法落地成生产应用。

据官方介绍,整个ROCm.ai体系可以分三大模块。
首先是ROCm CLI,这是一款可用于在AMD平台安装、验证、部署和管理AI工作负载的全新命令行工具。
ROCm CLI自带硬件感知工作流,能自动识别环境完成配置,还支持安全隔离(Air-gapped)部署,既省了重复劳动,也能保证不同机器上的部署一致性。
其次是AMD Skills,这块普通开发者感知会最明显。
现在做开发没人离得开Claude、Cursor、Codex这类AI编程助手,但问到ROCm相关的问题,通用助手给出的答案经常太笼统,放到实际环境里用不了,最后还是得自己翻文档找答案。
AMD Skills的主要作用就是把官方的技术知识库直接注入这些编程助手。以后在这些AI变成工具里问ROCm的安装、迁移、调试、性能优化问题,得到的都是针对AMD平台的官方方案,不仅更精准权威,效率也变高了。

第三个是Hyperloom,专门解决性能优化的耗时问题。
这是一套开源的智能优化系统,能自己跑完推理负载的全流程优化,从性能分析、找瓶颈,到改计算内核、验证结果,整套闭环自动完成。
比如,过去资深工程师要花几周做的深度调优,Hyperloom几个小时就能做完。
借助包括Hyperloom在内的AI驱动软件优化能力,ROCm.ai可持续优化ROCm软件栈,包括并行化与任务调度、内存管理以及计算内核优化等多个方面。
这些软件优化可进一步提升现有AMD硬件上的推理和训练性能,并持续改善开发效率及工作负载性能,相当于持续给ROCm软件栈做性能迭代。
总结一下,ROCm是底层基础软件栈,是所有计算负载运行的根基,决定了AMD硬件能跑什么。ROCm.ai是上层的开发增强体系,必须依附ROCm运行,决定了开发效率有多高、硬件性能能挖出来多少。

具体性能如何呢?AMD性能实验室用8卡Instinct MI355X平台做了对照测试,完全相同的硬件,分别跑ROCm 7.0和带ROCm.ai优化的新版ROCm。
结果显示,GLM-5、Kimi-K2.5、DeepSeek-R1-0528三个模型的推理测试,平均性能提升3.3倍。

DeepSeek-V2-Lite、DeepSeek-V3-16B、Qwen3-30B-A3B三个模型的训练测试,平均性能提升2.4倍。

以上提升都来自软件层面的调整,覆盖计算内核、内存管理、并行化和调度机制。对已经在用AMD硬件的用户来说,等于不用换硬件设备,性能就有2-3倍的提升。
现在AI开发早就不是纯手写代码了,越来越多工作靠智能体辅助完成,开发者用自然语言加AI助手就能搞定大部分开发部署工作。但通用助手的专业深度不够,落到具体硬件平台上经常水土不服。
ROCm.ai的好处是,不要求开发者换硬件、换流程,直接嵌进开发者已经在用的工具链里,润物细无声地降低门槛,提升开发效率。
前些年ROCm的核心工作是补生态,现在生态底座已经搭稳,竞争的重心自然就从 “可用” 转向了 “开发体验” 和 “性能上限”。

“AMD致力于帮助开发者以前所未有的效率开展开发工作。ROCm.ai将Agentic AI开发体验引入AMD平台,这些AI Agent不仅能够回答问题,还能够分析性能、调试应用,并推动工作负载在AMD硬件上充分释放性能。”
正如AMD AI软件副总裁 Anush Elangovan所说,这标志着AMD AI软件栈迈出了新的发展阶段,进一步缩短了开发构想到实际运行之间的距离,使开发者能够更快完成开发与迭代。
无论是搭建开发环境、部署模型,还是进一步优化性能,ROCm.ai都能够在开发者日常使用的AI编程助手中完成这些关键工作。

在过去,AI计算市场长期被单一厂商的生态锁定,开发者选择空间很小。ROCm靠开源路线打破了这一局面,给市场提供了第二选项。
ROCm.ai的到来,不仅拉低了开发者上手ROCm的门槛,也在缩小不同平台之间的开发体验差距,让选AMD平台的团队,不用再为生态付出额外的时间成本。
按官方计划,ROCm.ai会在2026年8月正式开放使用。
ROCm最终能带来多大的改变,又会给AI计算市场的格局带来多少影响,未来很快就能见分晓。
