英特尔推出自研纹理集神经压缩SDK:纹理体积最高缩小18倍
在GDC 2026大会上,英特尔图形工程师Marissa du Bois登台展示了英特尔的神经纹理压缩技术版本。该技术与NVIDIA的NTC非常相似,两者都采用确定性方案。此次演讲是2025年GDC上展示的原型研发项目的后续跟进,关键消息是英特尔现已将该研究产品化为独立的SDK。

纹理集神经压缩(TSNC)本质上是一种更智能的游戏纹理存储方式。传统的GPU块压缩格式(BC1至BC7)使用固定数学规则来减小纹理大小,虽然速度快且 universally supported(普遍支持),但留下了巨大的压缩潜力。TSNC采用根本不同的方法:它使用随机梯度下降训练一个小型神经网络,学习对特定纹理集中的纹理进行编码和解码。结果是得到一个紧凑的潜在空间表示,一个微小的多层感知器可在运行时将其重建为原始的漫反射、法线、粗糙度、金属度、环境光遮蔽和自发光数据。

关键在于,一个纹理集(单个材质的所有PBR贴图)在其通道之间存在大量冗余结构。TSNC以通用块压缩根本无法实现的方式利用这种共享结构。

TSNC压缩方案的核心是特征金字塔,一组跨不同分辨率配置的4个BC1编码潜在空间纹理。英特尔目前提供两种变体,具有不同的质量/压缩权衡:
变体A使用两个全分辨率潜在图像和两个半分辨率潜在图像。对于4K输入纹理,这意味着两个4K和两个2K潜在图像,总计约26.8 MB,而原始未压缩位图为256 MB。这实现了超过9倍压缩,几乎是标准BC块压缩单独实现的4.8倍的两倍。通过NVIDIA的FLIP分析工具测量的感知质量损失约为5%,在实际应用中主要表现为法线贴图的轻微精度损失,其他方面影响不大。

变体B是激进选项。它将潜在图像级联降至原始分辨率的1/2、1/4和1/8,实现超过17倍压缩,是变体A的两倍以上。然而,质量损失更为明显:BC1块效应开始出现在法线贴图和AO/粗糙度通道中,FLIP测得的感知误差约为6-7%。从绝对数值上看这可能很小,但英特尔承认这"足以被观察者注意到"。因此,变体B可能最适合用于远景或次要材质,这些地方的画质损失不太可能被仔细审视。
自去年基于PyTorch的原型研发以来,整个纹理集神经压缩压缩器已使用Slang计算着色器完全重写。此外,无论开发者是在Unreal引擎、自研引擎中工作,还是在CPU上运行解压缩,相同的解压缩器代码都可以针对正确的后端。
在GPU方面,英特尔现在支持微软DirectX 12 Cooperative Vectors API,利用Intel Arc XMX矩阵核心(A系列和B系列GPU均配备)进行硬件加速矩阵推理。对于没有XMX支持的硬件,标准的FMA(融合乘加)回退方案可在CPU和非英特尔GPU上运行。
英特尔的Marissa du Bois详细分析了4种不同的部署策略,每种策略在磁盘空间节省和内存使用之间有不同的权衡:
安装时:以压缩形式分发,安装期间在本地解压缩,纹理以未压缩形式存储在用户驱动器上,节省主要体现在分发带宽上。
加载时:纹理在磁盘上保持压缩,游戏加载时解压缩到显存,减少安装大小和加载期间的显存压力。
流送时:结合纹理流送,纹理按需解压缩,对磁盘和内存都是最佳方案,但增加了运行时推理负载。
采样时:纹理在显存中永久保持压缩,并在着色器中按像素解码,这是显存缩减最激进的选项,具有持续的推理成本。
开发者必须根据其特定用例和底层引擎选择其中一种策略。

英特尔在一台配备B390集成显卡的Panther Lake笔记本电脑上进行了基准测试,测试负载为完整的1080p计算着色器工作负载。结果如下:
lFMA路径:每像素0.661纳秒;
lXMX线性代数路径:每像素0.194纳秒。
硬件加速矩阵运算带来了3.4倍加速,而这些数字在集成显卡上依然成立,使得逐像素采样时部署方案看起来比预想的更具可行性。对于独立显卡,开销会更低。
英特尔计划今年晚些时候发布纹理集神经压缩SDK的Alpha版本,随后推出Beta版和公开发布版,不过这些日期尚未最终确定。
