张大妈

AI 30分钟攻破CUDA,英伟达护城河告急?

源自新浪微博:新智元

01-24 15:10

一项惊人的技术突破正在挑战GPU编程的现有格局。开发者利用Claude Code,仅用30分钟便将完整的CUDA后端代码成功移植到AMD的ROCm平台,全程无需手写一行代码,也不依赖传统翻译工具。这一高效自动化的移植过程,预示着AI智能体有能力填平不同GPU生态间的鸿沟,可能深刻影响英伟达CUDA的生态壁垒。

AI 30分钟攻破CUDA,英伟达护城河告急?

AI 30分钟攻破CUDA,英伟达护城河告急?智能速览

  • Claude Code仅用30分钟完成CUDA到AMD ROCm的代码移植

  • 整个过程全自动化,无需手写代码或Hipify等中间翻译层

  • AI自主理解代码逻辑,解决了棘手的数据布局差异问题

  • 此举可能降低开发者迁移至AMD GPU的门槛,冲击CUDA生态

  • 当前技术更擅长处理中低复杂度内核,极致优化仍是挑战

  • AMD软件副总裁预测,GPU编程的未来将属于AI智能体

AI 30分钟攻破CUDA,英伟达护城河告急?精华内容

这次30分钟的代码移植,不仅是一次技术炫技,更揭示了一个可能性:AI智能体或许能成为跨GPU生态的通用翻译官,从根本上改变开发者的工作方式和行业竞争格局。

30分钟移植奇迹

一位开发者在Reddit上展示,使用Claude Code在30分钟内,将一个完整的CUDA后端代码库成功移植到了AMD的ROCm平台。令人瞩目的是,整个过程完全自动化,开发者无需手动编写任何代码,也没有使用Hipify这类传统的翻译中间件。

Claude Code作为AI智能体,其工作方式并非机械的关键词替换。它能够真正理解代码,特别是核函数的底层逻辑,并自主解决了移植过程中最棘手的数据布局差异问题,确保了计算核心的一致性。这标志着AI在代码理解和跨平台迁移上迈出了重要一步。

技术实现细节

根据开发者在GitHub上发布的信息,这次为AMD GPU实现的ROCm后端,重点支持了基于注意力机制的现代国际象棋网络。在技术上,它使用了rocBLAS进行GEMM运算,并调用MIOpen处理卷积操作,后者是类似于CUDA cuDNN的必选依赖。

该实现针对AMD的RDNA 3.5架构进行了FP16性能优化,并提供了rocm (FP32)、rocm-fp16 (FP16)和rocm-auto (自动检测)三种后端变体。性能数据显示,在Strix Halo (Radeon 8060S)上,FP16性能超过2000 nps(每秒节点数),并实现了自动的Batch Size调优。

冲击CUDA护城河

英伟达在AI领域的霸主地位,很大程度上建立在CUDA这个几乎成为行业标准的编程生态之上。大量的AI框架、深度学习库和科学计算工具都深度依赖CUDA,形成了强大的网络效应和迁移壁垒。相比之下,AMD的ROCm虽然功能强大,但一直因生态兼容性问题和较高的开发者迁移成本而难以追赶。

Claude Code的演示,展示了大幅降低CUDA代码向AMD平台迁移成本的潜力。如果这种AI驱动的移植方式变得成熟可靠,将可能吸引更多开发者和应用转向AMD GPU,从而有效削弱CUDA的护城河。

未来展望与局限

尽管这次事件意义非凡,但仍需看到其当前局限性。Claude Code在处理简单或中等复杂度的内核时表现出色,但对于那些针对特定硬件缓存层级和内存访问模式做过极致优化的复杂内核,AI目前还难以完全取代人类专家的经验和判断。

即便如此,这一事件释放的信号依然强烈。相较于ZLUDA等项目依赖规则映射的有限尝试,Claude Code代表的智能体式编程展现了“理解+自主决策”的更高阶能力。正如AMD软件副总裁所言,GPU编程的未来,正朝着AI智能体主导的方向发展。

Claude Code的这次实践,无疑为GPU编程的未来投下了一颗石子,激起了关于生态壁垒与AI能力的广泛讨论。它展示了AI在解决复杂软件工程问题上的巨大潜力,虽然无法立即颠覆格局,但预示着一个更开放、更多元竞争时代的来临。AI会成为打破垄断的终极力量,还是会催生新的技术霸主?

精选参考来源

一夜之间,CUDA护城河被AI终结了?这几天,一位开发者johnnytshi在Reddit上分享了一个令人震惊的操作:Claude Code仅用了30分钟,便将一段完整的CUDA后端代码,成功移植到AMD的ROCm上。整个过程,没有手写一行代码。这架势,简直是要填平这两个生态系统之间的鸿沟。更关键的是,这次移植完全没有依赖传统的「中间转换工具」,如Hipify翻译层,而是一键通过CLI完成。就连AMD软件副总Anush E.为之震惊,GPU编程的未来,是AI智能体的。消息一出,整个科技圈瞬间沸腾,很多人直呼:英伟达CUDA护城河要守不住了.....这究竟是怎么回事?Claude手撕CUDA,仅30分钟Claude Code是在一个智能体框架运行的,这意味着它可以自己「动脑子」。在执行过程中,他不会机械地转换关键词,而去真正理解代码,即特定核函数的底层逻辑。开发者johnnytshi介绍,这次移植中,最棘手的数据布局差异问题也被AI解决了,确保了内核核心计算逻辑保持一致。令人惊叹的是,johnnytshi在短短30分钟内,就把整个CUDA后端移植到了AMD ROCm上,而且中间没用任何翻译层。另外一个好处当然是,不用费劲去搭像Hipify这种复杂的翻译环境了;直接在命令行(CLI)里就能干活。如今,全网都被CUDA护城河被攻破呼声淹没了。毕竟,英伟达霸主地位,很大程度上建立在CUDA这个几乎成为行业标准的编程生态上。无数AI框架、深度学习库、科学计算工具都深度依赖它。AMD的ROCm虽然功能强大,却一直面临生态兼容性,以及开发者迁移成本高的痛点。现在,一个Claude却用极短时间踢碎了门槛,说不定未来更多CUDA代码可能轻松在AMD GPU跑起来了。实现细节GitHub中,johnnytshi本人也更新了日志和说明。为AMD GPU实现了完整的ROCm后端,从而在RDNA 3.5及其他AMD架构上支持基于注意力机制的现代国际象棋网络。GitHub:网页链接在src/neural/backends/rocm/中添加了完整的ROCm后端实现了注意力网络架构(多头自注意力、FFN、嵌入层)使用rocBLAS进行GEMM运算,使用MIOpen进行卷积运算针对RDNA 3.5上的FP16性能优化了NCHW布局提供三种后端变体:rocm (FP32)、rocm-fp16 (FP16)、rocm-auto (自动检测)MIOpen是必选依赖(类似于CUDA的cuDNN)通过rocm_agent_enumerator自动检测AMD GPU架构编译选项:-Drocm=true -Damd_gfx=gfx1151(或使用自动检测)性能说明:FP16性能:在Strix Halo (Radeon 8060S, gfx1151) 上 >2000 nps自动Batch Size调优(RDNA 3.5上min_batch=64)测试过rocWMMA,但rocBLAS性能更好验证情况(Strix Halo - Radeon 8060S, gfx1151):测试模型:768x15x24h-t82-swa-7464000.pb.gz 和 maia-1900.pb.gz后端:rocm-fp16功能正常,能生成正确的走法环境:ROCm 7.2.53150, MIOpen 3.5.1注:仅在RDNA 3.5上进行了测试;其他AMD架构暂未验证GPU未来,是AI智能体主场当然,这次演示也有局限性。对于简单或中等复杂度的内核,Claude Code表现得非常出色。更重要的是,写核函数的核心就在于搞定「深度硬件」优化。不过,一部分觉得Claude Code在这方面还是差点火候——如果遇到那些针对特定硬件缓存层级,内存访问模式做过极致优化的复杂内核,AI目前还难以完全取代人类专家。即便如此,这一事件释放出的信号已经足够强烈。过去几个月,ZLUDA项目、还有微软内部的尝试,都想要打破CUDA的垄断。但它们大多依赖规则映射或中间层,自动化程度和智能水平有限。Claude Code代表的智能体式编程,直接跳过了这些环节,用「理解+自主决策」的方式填平生态鸿沟。正如AMD软件副总所言,GPU编程的未来,是AI智能体主场。
内容由AI生成

精选参考来源

一夜之间,CUDA护城河被AI终结了?这几天,一位开发者johnnytshi在Reddit上分享了一个令人震惊的操作:Claude Code仅用了30分钟,便将一段完整的CUDA后端代码,成功移植到AMD的ROCm上。整个过程,没有手写一行代码。这架势,简直是要填平这两个生态系统之间的鸿沟。更关键的是,这次移植完全没有依赖传统的「中间转换工具」,如Hipify翻译层,而是一键通过CLI完成。就连AMD软件副总Anush E.为之震惊,GPU编程的未来,是AI智能体的。消息一出,整个科技圈瞬间沸腾,很多人直呼:英伟达CUDA护城河要守不住了.....这究竟是怎么回事?Claude手撕CUDA,仅30分钟Claude Code是在一个智能体框架运行的,这意味着它可以自己「动脑子」。在执行过程中,他不会机械地转换关键词,而去真正理解代码,即特定核函数的底层逻辑。开发者johnnytshi介绍,这次移植中,最棘手的数据布局差异问题也被AI解决了,确保了内核核心计算逻辑保持一致。令人惊叹的是,johnnytshi在短短30分钟内,就把整个CUDA后端移植到了AMD ROCm上,而且中间没用任何翻译层。另外一个好处当然是,不用费劲去搭像Hipify这种复杂的翻译环境了;直接在命令行(CLI)里就能干活。如今,全网都被CUDA护城河被攻破呼声淹没了。毕竟,英伟达霸主地位,很大程度上建立在CUDA这个几乎成为行业标准的编程生态上。无数AI框架、深度学习库、科学计算工具都深度依赖它。AMD的ROCm虽然功能强大,却一直面临生态兼容性,以及开发者迁移成本高的痛点。现在,一个Claude却用极短时间踢碎了门槛,说不定未来更多CUDA代码可能轻松在AMD GPU跑起来了。实现细节GitHub中,johnnytshi本人也更新了日志和说明。为AMD GPU实现了完整的ROCm后端,从而在RDNA 3.5及其他AMD架构上支持基于注意力机制的现代国际象棋网络。GitHub:网页链接在src/neural/backends/rocm/中添加了完整的ROCm后端实现了注意力网络架构(多头自注意力、FFN、嵌入层)使用rocBLAS进行GEMM运算,使用MIOpen进行卷积运算针对RDNA 3.5上的FP16性能优化了NCHW布局提供三种后端变体:rocm (FP32)、rocm-fp16 (FP16)、rocm-auto (自动检测)MIOpen是必选依赖(类似于CUDA的cuDNN)通过rocm_agent_enumerator自动检测AMD GPU架构编译选项:-Drocm=true -Damd_gfx=gfx1151(或使用自动检测)性能说明:FP16性能:在Strix Halo (Radeon 8060S, gfx1151) 上 >2000 nps自动Batch Size调优(RDNA 3.5上min_batch=64)测试过rocWMMA,但rocBLAS性能更好验证情况(Strix Halo - Radeon 8060S, gfx1151):测试模型:768x15x24h-t82-swa-7464000.pb.gz 和 maia-1900.pb.gz后端:rocm-fp16功能正常,能生成正确的走法环境:ROCm 7.2.53150, MIOpen 3.5.1注:仅在RDNA 3.5上进行了测试;其他AMD架构暂未验证GPU未来,是AI智能体主场当然,这次演示也有局限性。对于简单或中等复杂度的内核,Claude Code表现得非常出色。更重要的是,写核函数的核心就在于搞定「深度硬件」优化。不过,一部分觉得Claude Code在这方面还是差点火候——如果遇到那些针对特定硬件缓存层级,内存访问模式做过极致优化的复杂内核,AI目前还难以完全取代人类专家。即便如此,这一事件释放出的信号已经足够强烈。过去几个月,ZLUDA项目、还有微软内部的尝试,都想要打破CUDA的垄断。但它们大多依赖规则映射或中间层,自动化程度和智能水平有限。Claude Code代表的智能体式编程,直接跳过了这些环节,用「理解+自主决策」的方式填平生态鸿沟。正如AMD软件副总所言,GPU编程的未来,是AI智能体主场。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章