AAI 2026:AMD推出ROCm.ai,加速AMD平台上的AI开发

2026-07-29 18:16:17 0点赞 0收藏 0评论

全新AI原生开发体验支持开发者借助自然语言和主流AI编程助手,在AMD平台上完成 AI 工作负载的安装、部署、故障排查与性能优化。

AAI 2026:AMD推出ROCm.ai,加速AMD平台上的AI开发

核心亮点:

  • AMD在Advancing AI 2026 峰会上发布ROCm.ai,这是一套面向 AMD平台AI开发的AI原生软件体验。

  • ROCm.ai将ROCm CLI、AMD Skills以及AI驱动的软件优化能力整合为统一的开发者体验。

  • 该平台支持开发者借助自然语言和AI编程助手完成AI工作负载的安装、部署、故障排查和性能优化。

  • 通过对计算内核、内存管理、并行化和调度机制进行AI驱动优化,ROCm.ai可进一步优化ROCm软件栈,并提升开发效率。

  • 在相同硬件平台上,相较于ROCm 7,最新版ROCm借助 ROCm.ai 在测试中可实现平均3.3倍推理性能提升和2.4倍训练性能提升。1,2

内容概要:

AMD在Advancing AI 2026峰会上发布ROCm.ai,这是一套AI原生开发体验,将ROCm CLI、AMD Skills以及AI驱动的软件优化能力相结合,帮助开发者在AMD平台上构建、部署和优化AI工作负载。该平台将AMD专业知识集成至Claude、Codex和Cursor等主流AI编程助手中,并在相同硬件平台上,相较于ROCm 7,最新版ROCm在测试中可实现平均3.3倍推理性能提升和2.4倍训练性能提升。1,2

常见问题解答:

什么是ROCm.ai

ROCm.ai是AMD面向AI开发打造的AI原生开发体验,帮助开发者在AMD平台上构建、部署和优化AI工作负载。

ROCm.ai由哪些组件组成?

ROCm.ai将ROCm CLI、AMD Skills以及包括Hyperloom在内的AI 驱动软件优化能力整合为统一的软件体验。

AMD为什么推出ROCm.ai

AMD推出ROCm.ai,旨在帮助开发者借助自然语言和AI编程助手,更快速地将开发构想转化为实际生产应用。

ROCm.ai如何提升性能?

ROCm.ai通过AI驱动的优化技术,对计算内核、内存管理、并行化和调度机制进行优化,从而提升AI推理和训练性能。

AMD公布的性能提升数据是什么?

AMD 表示,与相同硬件平台上的AMD ROCm 7相比,最新版 ROCm借助ROCm.ai在测试中可实现平均3.3倍推理性能提升和2.4 倍训练性能提升。1,2

有哪些值得关注的新动态?AMD正式发布ROCm.ai,这是一套面向AMD平台的AI原生软件开发体验。ROCm.ai将AI辅助开发、智能部署和AI驱动的软件优化整合为统一的软件体验,帮助开发者更快地将开发构想转化为生产部署。ROCm.ai于Advancing AI 2026 峰会上正式亮相,其中包括ROCm CLI:一款用于安装、验证、部署和管理AI 工作负载的全新命令行工具;AMD Skills:将AMD官方技术知识集成至 Claude、Cursor 和 Codex 等主流 AI 编程助手;以及Hyperloom:一款全新的开源Agentic AI系统,旨在自动完成端到端推理工作负载优化这一耗时的工程任务。通过统一的软件体验,ROCm.ai帮助开发者在AMD平台上完成AI工作负载的安装、部署、故障排查和性能优化。

为什么这项进展值得关注?AI开发正逐渐迈向Agent驱动模式,越来越多开发者开始借助自然语言和AI编程助手构建、部署和优化软件。ROCm.ai将AMD的技术能力直接融入这些开发流程,为开发者提供针对AMD平台的专业指导,而非通用建议,帮助其更高效地构建和优化 AI 工作负载。AMD Skills的推出进一步降低了开发者采用ROCm的门槛,并减少了配置环境过程中查阅文档所需的时间。ROCm.ai同时利用AI持续优化 AMD ROCm软件栈。通过对计算内核、内存管理和调度机制进行AI驱动优化,在相同硬件平台上,相较于 ROCm 7,最新版ROCm在测试中推理性能方面平均提升3.3倍,训练性能平均提升2.4倍。1,2

AMD在其中发挥了怎样的作用?

“AMD致力于帮助开发者以前所未有的效率开展开发工作。ROCm.ai将Agentic AI开发体验引入AMD平台,这些AI Agent不仅能够回答问题,还能够分析性能、调试应用,并推动工作负载在AMD 硬件上充分释放性能。这标志着AMD AI软件栈迈出了新的发展阶段,进一步缩短了开发构想到实际运行之间的距离,使开发者能够更快完成开发与迭代。无论是搭建开发环境、部署模型,还是进一步优化性能,ROCm.ai都能够在开发者日常使用的AI编程助手中完成这些关键工作。”

— AMD AI软件副总裁 Anush Elangovan

ROCm.ai 是什么?ROCm.ai是AMD面向AI开发打造的AI原生开发体验,旨在帮助开发者在AMD平台上更快完成AI应用的开发、部署与优化。它将ROCm CLI、AMD Skills以及AI驱动的软件优化能力 整合为统一的软件体验,简化了从安装、部署到调试和性能优化的整个 AI 开发流程。

• ROCm CLI提供统一的命令行体验,可用于在AMD平台上安装、验证、部署、更新和排查AI工作负载。其具备硬件感知工作流程、自动化环境配置以及对安全隔离(Air-gapped)部署的支持,有助于简化软件安装流程,并实现跨环境的一致性部署。

• AMD Skills将AMD官方技术知识集成至Claude、Cursor和 Codex等主流AI编程助手。开发者无需依赖通用建议,即可获得针对 AMD AI软件栈的安装、迁移、调试和性能优化指导。

• Hyperloom可自动完成端到端AI推理工作负载优化,覆盖从性能分析、瓶颈诊断到计算内核优化和结果验证的完整流程,帮助开发者在数小时内完成过去通常需要数周专业工程投入才能完成的优化工作。

• 借助包括Hyperloom在内的AI驱动软件优化能力,ROCm.ai可持续优化ROCm软件栈,包括并行化与任务调度、内存管理以及计算内核优化等多个方面。这些软件优化可进一步提升现有AMD硬件上的推理和训练性能,并持续改善开发效率及工作负载性能。

ROCm.ai将于2026年8月开始投入使用。

免责声明:

本文可能包含涉及 Advanced Micro Devices, Inc.(AMD) 的前瞻性声明,该等声明依据《1995 年美国私人证券诉讼改革法案》(Private Securities Litigation Reform Act of 1995)的安全港条款作出。前瞻性声明通常通过“将会(would)”,“可能(may)”,“预计(expects)”,“认为(believes)”,“计划(plans)”,“旨在(intends)”,“预计(projects)”以及其他具有类似含义的词语进行识别。投资者需注意,本文中的任何前瞻性声明均基于 AMD 当前的观点、假设和预期,仅代表本文发布之日的情况,并涉及可能导致实际结果与当前预期产生重大差异的风险和不确定性。上述声明受到诸多已知和未知风险及不确定性因素的影响,其中许多因素难以预测,且通常超出 AMD 的控制范围。这些因素可能导致实际结果以及未来事件与前瞻性信息和声明中所表达、暗示或预测的内容产生重大差异。投资者应仔细阅读 AMD 向美国证券交易委员会(SEC)提交的文件中详细披露的相关风险和不确定性,包括但不限于 AMD 最新提交的 10-K 表年度报告 和 10-Q 表季度报告。

除法律要求外,AMD 不承担、亦明确声明不承担任何更新本文中前瞻性声明的义务。

(MI350-81) AMD Performance Labs 于2026年7月7日进行了测试,用于测量系统推理性能,测试指标为每秒生成Token数(Tokens Per Second,TPS)。测试对比了搭载 AMD Instinct MI355X 8× GPU 平台并运行 AMD ROCm 7.0 软件的系统,与配置相近且运行 AMD ROCm.ai 预览版本的系统(ROCm 7.2.2,包含优化计算内核、并行化和调度等优化),测试模型包括 GLM-5、Kimi-K2.5 和 DeepSeek-R1-0528。

文中所述性能提升数据为所测试3个模型的综合平均TPS提升表现。

硬件配置

Supermicro AS-4126GS-NMR-LCC(主板 H14DSG-OD)

8× AMD Instinct MI355X。BIOS AMI v1.4a(2025-04-16),GPU 固件 SMC 04.86.11.02,TA RAS 27.69.00.10,TA XGMI 32.00.00.20,RLC43,MEC36,SDMA12,Ubuntu 22.04.2 LTS,内核 5.15.0-70-generic,amdgpu 驱动 6.16.6,主机端 ROCm 7.1.0。

软件配置

GLM-5 ROCm Docker 镜像:
rocm/sgl-dev:
v0.5.8.post1-rocm700-mi35x-20260219

PyTorch 版本 2.8.0,SGLang v0.5.8

Kimi ROCm Docker 镜像:
vllm/vllm-openai-rocm:v0.16.0,vLLM 版本 0.16.0

DeepSeek-R1 Docker 镜像:rocm/7.0:…
sgl-dev-v0.5.2-rocm7.0-mi35x-20250915, SGLang 版本 V0.5.13

对比

GLM-5 ROCm Docker 镜像:
rocm/atom:rocm7.2.2_ubuntu24.04_py3.12_pytorch_release_2.10.0_
atom0.1.2.post, ATOM v0.1.2.post

Kimi ROCm Docker 镜像:
vllm/vllm-openai-rocm:v0.22.0,vLLM 版本 V0.22.0

DeepSeek-R1 Docker 镜像:
lmsysorg/sglang-rocm:v0.5.13-rocm720-mi35x-20260612,SGLang 版本 V0.5.13

服务器厂商可能采用不同配置,因此测试结果可能有所差异。实际性能表现可能因配置、软件环境、vLLM版本以及所使用的最新驱动程序和优化方案而有所不同。(MI350-81)

2 (MI350-82) AMD Performance Labs于2026年7月7日进行了测试,用于测量训练性能,测试指标为每秒生成Token数(Tokens Per Second,TPS)。测试基于搭载 8× AMD Instinct MI355X GPU平台的系统,使用DeepSeek-V2-Lite、DeepSeek-V3-16B和Qwen3-30B-A3B模型,通过Megatron-LM对AMD ROCm 7.0软件与 AMD ROCm.ai预览版本(ROCm 7.2.2,包含优化计算内核、并行化和调度等优化)的训练性能进行对比。

文中所述性能提升数据为所测试 3个模型的综合平均TPS提升表现。

硬件配置

Supermicro AS-4126GS-NMR-LCC(主板H14DSG-OD)

8× AMD Instinct MI355X。BIOS AMI v1.4a(2025-04-16),GPU 固件 SMC 04.86.11.02,TA RAS 27.69.00.10,TA XGMI 32.00.00.20,RLC 43,MEC 36,SDMA 12,Ubuntu 22.04.2 LTS,内核 5.15.0-70-generic,amdgpu驱动 6.16.6,主机端 ROCm 7.1.0。

软件配置

DeepSeek-V2-Lite,ROCm 7.2.1 + Primus v26.3

DeepSeek-V3-16B,ROCm 7.2.1 + Primus v26.3

Qwen3-30B-A3B,ROCm 7.2.1 + Primus v26.3

服务器厂商可能采用不同配置,因此测试结果可能有所差异。实际性能表现可能因配置、软件环境以及所使用的最新驱动程序和优化方案而有所不同。(MI350-82)

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松