NVIDIA DLSS 4的显存小测试:占用可能不会更低,但帧率一定会变高
显存,一个近乎于永恒的问题。随着分辨率的上升,游戏材质的越发精细,显存的消失速度来得前所未有的快,以至于在很多游戏需求测试和显卡评测(特别是8GB显存的显卡)中,我们多少都会提一嘴显存的事情。而在帧率不甚令人满意的同时,“建议开DLSS超分辨率和帧生成”也是我们经常说的一句话,毕竟启用这些开关带来的帧率提升多半比你千调万试画面选项来得大。
当然,就算有着“无中生有”的意味,但DLSS肯定不是什么第一魔法,而是需要依靠硬件的发挥。除了大家所熟知的用于运算的Tensor Cores之外,DLSS的AI模型也要占用一定的显存。于是,问题就来了,DLSS所占用的显存又会对游戏产生什么影响呢?
先看看官方说明
虽然统称DLSS,但超分辨率、帧生成和光线重建这三个独立开关的功能其实是三个独立的模型。我们可以从各自的编程指南里面知道这一点,先说DLSS超分辨率的,不同的显卡,不同的模型乃至不同的显示分辨率,显存的占用都有所差异。以最新的DLSS 4.5模型M为例,支持FP8运算的RTX 50/40系显卡占用的显存普遍比RTX 30/20系低,而4K分辨率所占的显存是显著高于2K和1080P的。模型之间比较的话,第二代Transformer模型(L,M)要的显存比第一代(J,K)要高,CNN模型(E,F,A-D已经在最近几个版本的SDK里被删了)则和它们有显著的差距。

需要注明的是,编程指南里的这个表虽然精确到了小数点后两位,但并不是一个恒常不变的值,这是NVIDIA通过CLI跑出来的一个估算值,用于给开发者参考。

然后我们再看看帧生成的编程指南,由于这是RTX 40系之后才有的功能,所以表格倒是没那么复杂。同样是3个分辨率,1080P仅占用218MB,而4K来到了598MB,半G有多了。编程指南里面还指出,单帧和多帧生成不会对显存造成明显的影响,只是执行时间会延长。

而光线重建是独立的模型没错,但它和超分辨率模型是互相代替的关系——如果你启用了光线重建,那么超分辨率选项上也是用光线重建的模型(D,E)。因此你能看见光线重建的模型显存占用对于不同显卡、不同分辨率也是有影响的。附带一提,在RTX 30/20显卡中,4K分辨率的模型显存占用真的很大。不过拥有光线重建的游戏实在不多,这次我们还是主要讨论超分辨率和帧生成。

测试平台

这次的测试平台由锐龙9 9950X、微星MPG B850M EDGE TI MAX WIFI和32GB的DDR5-6000 C30内存组成,我最近几个月的测试基本都是在这套平台上完成的。被测的显卡包括GeForce RTX 5080 FE,以及两张同属iGame Ultra系列的RTX 5070和RTX 5060——它们的设计风格很统一对吧。16GB的RTX 5080会承担前半部分的测试,而12GB的RTX 5070和8GB的5060则负责后半部分。

GeForce RTX 5080 FE

iGame GeForce RTX 5070 Ultra W OC

iGame RTX 5060 Ultra W DUO OC
从简单的加减法开始
因为DLSS常用的几个档位对应着不同的渲染分辨率,所以我们只好选择DLAA这一个平时大家不会用的,100%渲染分辨率的模式来看看DLSS的几个模型对显存的影响。说白了就是简单的加减法:DLAA/帧生成的显存占用减去原生分辨率的。这法子有点粗暴,但是以玩家这一侧去看其实没什么问题——那实际确实用了那么多显存,不是吗?
附带一提,对于开发者来说,NVIDIA提供的SDK里面有获取DLSS分配显存的函数。
CapFrameX的GPU Memory Dedicated Game指的就是游戏实际吃掉的显存;GPU Memory Shared Game则是占用的系统内存,由于测试用的是16GB的RTX 5080,几乎没有爆显存的可能,所以这个数值一般会在600MB以下。当然,Windows也要占用显存,这个数值普遍在2GB左右,跟分辨率无关。


好了,让我们直接看数据吧。毫无疑问,随着分辨率的上升,超分辨率和帧生成占的显存也越来越高。超分辨率和帧生成双开时来到最高。和《赛博朋克2077》不一样的是,《DOOM:黑暗时代》不能单独开帧生成。虽然实际游玩中不会有多少人开DLAA这个加压而不是减负的档位,但是从这个显存消耗中你会发现16GB有点多,12GB确实很够用,而8GB也真的有点危险——把被测的数据加个2,就是总共的显存消耗。
接下来的图表是用简单的加减法算出来的超分辨率和帧生成消耗。老实说,这差距不仅和编程指南差距很大,同时游戏和游戏的差距也很大。估计除了DLSS模型所占用的显存之外,不同游戏引擎的工作方式也会引起显存占用的不同,甚至说每一次测试都会一点点变化。如果要进一步探究的话,恐怕用的就不是CapFrameX这些软件了。


那么不同倍率的帧生成会有什么区别吗?这方面倒和编程指南里面说的差不多,基本不会产生什么变化。就算在NVIDIA App里面把倍率拉到最高的6倍,游戏的整体显存占用也是11.9GB左右。相反,帧率和延迟的变化会更加剧烈一点,我们在更早前的测试里面已经试过了。

实际情况测试
最后来看一下实际的情况。考虑到RTX 5080拥有充裕的16GB显存,属于开了DLAA也用不完的那种,所以这部分我们把目光集中到12GB的RTX 5070和8GB的RTX 5060身上。在这里我们测试的游戏稍微多一点。考虑到RTX 5060的显存一直是个热门话题,所以RTX 5060这边我会多测一个DLSS性能模式。至于帧生成就全是4倍了,因为上面的结果显示,2x的显存占用和4x相比没变化,那还不如直接开到最高。




RTX 5070 12GB - 2K分辨率
可以看到,原生分辨率占用的显存和DLSS 4质量模式加帧生成的并无多大差距,都在5%以内。倒不会因为说渲染分辨率低了,所以显存占用也会低很多。不过因为开了帧生成,所以帧率的暴涨也是意料之中。如果按总消耗的显存来看,算上系统占用的2GB,对于12GB的RTX 5070来说还是游刃有余的。



RTX 5060 8GB - 1080P分辨率
而RTX 5060就是另一个画风了,虽然原生分辨率和DLSS 4质量模式占用的显存仍然是差不多,但按总消耗来说,其实已经非常接近耗尽的边缘,像《刺客信条:影》甚至占到了将近7GB。因此我多加了个性能模式的测试,这时候占用虽然有所下降,但幅度也并不算大。只能说现在的3A游戏的高精度材质就是要占那么多位置,要想降低占用只能把预设降低。至于帧率这块就没什么好说的,毕竟有帧生成打底,直接就起飞了。
总结
游戏消耗了太多显存是游戏卡顿的原因之一,当帧率过低时,通过不同的图形设置去发现并解决显存占用的问题,这很好。然而当游戏运行一切正常之时,再回去看看显存怎么样似乎有点不太必要,如果DLSS、FSR或者XeSS甚至是虚幻引擎的TSR确实提升了帧率,让游戏玩起来很正常,那就是没问题的。归根结底,显存这个参数并不能类比汽车的油表或者剩余电量,你也不需要一边玩一边盯着,卡顿的时候再找问题也不迟。

而具体到DLSS这种技术来说,个人觉得,与其担心显存占用,还不如把关注点聚焦到超分辨率的画面表现和帧生成的延迟上来。当然,我不是说现在的入门卡8GB显存是完完全全足够的,毕竟RTX 5060在面对全高光追画质的3A大作时仍然处于一种用量发红的状态。但相比MB和GB,FPS这个单位才是直接影响体验的状态就是了,在规格已经锁定的当下,如何活用这些增强技术去玩得流畅可能才是比较重要的一件事。
本文涉及的游戏测试等非标准体验测试,由超能网基于本次软硬件平台完成,不代表在其他未测试平台上的表现,实际使用中,平台不同存在一定合理误差属于正常现象。
