张大妈

CUDA 13.1发布:英伟达20年最大编程革新

源自公众号:人工智能产业链union

01-14 18:00

NVIDIA发布CUDA Toolkit 13.1,这是CUDA平台20年来最重大的更新。核心推出CUDA Tile编程模型,让开发者能在更高抽象层级编写GPU代码,自动适配Tensor Core等专用硬件,显著提升开发效率和代码可移植性。

CUDA 13.1发布:英伟达20年最大编程革新智能速览

  • CUDA Tile引入基于tile的编程模型,抽象化硬件细节

  • Green Context实现细粒度GPU资源划分与调度

  • cuBLAS通过FP模拟实现双精度矩阵乘法性能提升

  • CCCL 3.1提供更便捷的单相API和确定性浮点选项

  • 开发者工具增强,支持Tile核函数性能分析

CUDA 13.1发布:英伟达20年最大编程革新精华内容

CUDA Tile重新定义GPU编程范式,从逐线程控制转向数据块操作,让编译器自动优化硬件映射,为AI开发带来革命性便利。

编程模型革新

CUDA Tile是本次更新的核心,它将GPU编程从SIMT(单指令多线程)提升到Tile(数据块)层级。开发者不再需要细粒度控制每个线程,只需指定数据块(Tile)和数学运算,编译器自动处理线程分配。这种方式特别适合AI算法开发,能够充分利用Tensor Core性能。

当前版本支持Blackwell架构(计算能力10.x和12.x),未来将扩展更多架构。主要包含CUDA Tile IR虚拟指令集和cuTile Python领域特定语言,后续将推出C++实现。

资源管理优化

Green Context是轻量级GPU上下文,提供比传统CUDA上下文更细粒度的资源控制。开发者可将特定数量的SM分配给某个Green Context,确保延迟敏感任务优先执行。新增的split() API减少了不同Context间的伪依赖,提升资源利用效率。

MPS(多进程服务)新增内存局部性优化分区(MLOPart)功能,在Blackwell GPU上可将一块物理GPU呈现为多个独立设备,每个设备拥有专属计算资源和内存。静态SM分区则为Ampere及以上架构提供确定性资源分配方案。

数学库增强

cuBLAS新增实验性分组GEMM API,支持Blackwell GPU的FP8和BF16/FP16数据类型,通过设备端形状实现比多流GEMM最高4倍的加速。双精度矩阵乘法通过在Tensor Core上进行FP模拟实现性能提升。

cuSPARSE新稀疏矩阵向量乘法(SpMVOp)API性能优于传统CsrMV。cuFFT推出设备API,专为cuFFTDx库设计,可通过查询生成性能优化的代码块。

开发者工具升级

Nsight Compute新增Tile核函数性能分析,摘要页区分Tile与SIMT核函数类型,详情页显示Tile统计和管线利用率。Nsight Systems 2025.6.1支持系统级CUDA追踪和主机函数追踪,默认使用硬件追踪模式提升准确性。

Compute Sanitizer新增编译时修补功能,通过-fdevice-sanitize=memcheck标志增强内存错误检测,运行速度更快且能捕捉更隐蔽的内存问题。

核心库改进

CCCL 3.1简化了CUB API使用,新增内存资源重载,跳过繁琐的临时存储查询分配过程。提供三种确定性浮点选项:不保证(最快)、GPU间(位相同)和传统(两遍算法),开发者可在性能和确定性间灵活选择。

这些改进让CUDA编程更加高效便捷,特别是对AI开发者而言,Tile模型大幅降低了专用硬件的使用门槛。

CUDA 13.1的Tile编程模型标志着GPU开发的重大转折,将复杂硬件抽象化,让开发者专注于算法本身。随着C++支持的加入和架构兼容性扩展,这种新范式或将重塑AI编程生态。未来GPU编程会否全面转向Tile模型?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章