当前位置:
AIGC文章详情

神经动态全局光照及其AI推理加速初探

源自公众号:MagicDawn

02-02 20:43

神经动态全局光照(NDGI)是一项突破性的实时渲染技术,通过在计算性能、包体大小和视觉效果三者间实现平衡,为游戏画面带来质的飞跃。这项技术利用闲置的AI硬件单元,显著提升了光照渲染效率,让中高端GPU也能实现实时动态全局光照效果。

神经动态全局光照及其AI推理加速初探智能速览

  • NDGI技术在视觉效果与性能间实现了良好平衡

  • 利用Tensor Core等AI硬件单元加速神经网络推理

  • Vulkan Cooperative Matrix可实现4-8倍性能提升

  • D3D12 Cooperative Vector对小型MLP推理优化效果显著

  • 硬件加速方案让RTX 4060也能实现每帧64个Tiles推理

神经动态全局光照及其AI推理加速初探精华内容

随着AI硬件在GPU上的普及,图形渲染管线正迎来革命性变革。NDGI技术通过巧妙利用闲置的Tensor Core算力,为实时渲染开辟了新的可能性。

技术背景

神经动态全局光照(NDGI)是MagicDawn团队研发的高质量全天候动态GI方案。该方案通过将Lightmaps切割成128×128小块,每块对应4张Feature纹理和一个小型MLP,实现了仅7.5 Bytes/Texel的数据存储量。

相较于英伟达的NTC方法,NDGI在视觉效果不打折的前提下大幅降低存储开销,同时支持GI的连续动态变化与开关灯功能。

推理机制

NDGI的推理过程采用增量流送方式,每帧只推理新看见的Tiles,并缓存近期推理过的Tiles。每帧推理Tiles上限设为64个,确保实时性。

推理时,系统采样4张Feature纹理,计算Time Encoding,形成16×16384的Input矩阵,通过两层隐藏层的MLP计算,最终输出Lightmap颜色。整个过程对引擎渲染管线的数据耦合性较高。

性能瓶颈

使用UE5原生NNE推理引擎作为基准测试,在RTX 3090显卡上每帧仅能推理13个128×128图块,远达不到实时性要求。主要瓶颈在于通用计算方案未能充分利用GPU的专用AI硬件单元。

基础优化通过融合算子的Compute Shader,将多层计算合并,减少了中间数据存储开销,但仍使用通用流处理器进行标量计算。

Vulkan加速

Vulkan Cooperative Matrix作为开放标准,允许在子线程组内部协同执行矩阵乘加操作,与Tensor Core计算模式高度契合。测试显示,使用Cooperative Matrix在各种含有Tensor Core的设备上均获得4×~8×的性能提升。

针对NDGI的小型MLP推理特性,通过分块N维度并融合整个推理过程,最终实现了比基准快8倍的加速效果。

D3D12优化

D3D12 Cooperative Vector采用更高层的API设计,开发者只需定义矩阵向量计算,驱动自动处理底层优化。这种’自动挡’方案对小型MLP推理具有专门优化,在UE管线集成后实现了比基准快8~10倍的性能提升。

虽然D3D12路径目前仍处于预览状态,但其与Windows生态的深度集成为未来发展提供了想象空间。

技术前景

性能对比显示,硬件加速方案在RTX 4060等中端GPU上也能达到每帧64个Tiles的实时推理目标。Vulkan路径因开放标准和多厂商支持更为成熟,而D3D12路径凭借生态集成优势潜力巨大。

这项技术体现了’神经网络着色器’的演进方向,未来在神经BRDF、神经纹理等领域将有更广泛应用,图形API对AI硬件的支持将成为核心能力。

NDGI技术通过巧妙利用闲置AI算力,为实时渲染开辟了新路径。随着图形API与AI硬件的深度整合,神经网络计算正从附加功能转变为渲染管线的核心组件,这预示着实时图形技术将迎来更多突破性进展。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章