张大妈

浙大&VIVO:一跳扩散让前向式3DGS画质质变

源自小红薯:每日ComputerScience

02-04 13:33

前向式3D Gaussian Splatting虽快,但在稀疏视角下常面临细节模糊、跨视角不一致的难题。浙江大学与VIVO联合提出的一次扩散增强框架,通过结构感知的单步Stable Diffusion,在保持高效率推理的同时,显著提升了高频细节与感知质量,为3D重建的画质带来了质的飞跃。

浙大&VIVO:一跳扩散让前向式3DGS画质质变智能速览

  • 针对前向式3DGS画质模糊问题,浙大与VIVO提出一次扩散增强框架。

  • 通过双域模块和特征增强,弥补了ViT模型的细节提取短板。

  • 特征引导的单步扩散,在保留几何一致性的同时显著增强纹理细节。

  • 采用端到端联合训练,让扩散模型真正服从3D结构约束。

  • 该方法无需额外训练即可输出1024x1024高分辨率结果。

浙大&VIVO:一跳扩散让前向式3DGS画质质变精华内容

这项技术突破的核心在于,它巧妙地将3D重建与2D扩散生成结合,在不牺牲效率的前提下,实现了画质质的飞跃,解决了长期存在的画质与效率难以兼顾的矛盾。

双域感知 补全细节

为解决ViT模型难以处理高分辨率细节的短板,研究设计了双域细节感知模块(DD-DPM)。该模块在不增加ViT主干显存负担的前提下,巧妙地从空间域通过CNN提取纹理信息,并从频率域利用傅里叶变换捕捉高频细节。

这种双管齐下的方式,有效弥补了单一视觉Transformer在细节捕捉上的不足,为后续渲染提供了更丰富的基础信息。

特征注入 渲染升级

传统3D高斯通常仅表达颜色与几何信息。该方法创新性地为每个高斯显式附加了高维特征向量。这使得在渲染阶段,系统不仅能输出常规的RGB图像,还能同步生成一张与3D结构完全对齐的特征图。

这张特征图作为关键的条件信息,为后续的2D增强步骤提供了坚实的3D一致性保障。

一步扩散 质效兼得

研究将Gaussian渲染出的特征图直接注入Stable Diffusion的UNet网络,并改造了其自注意力机制,引入参考视角交互。通过这种方式,仅需单步去噪即可完成图像增强,避免了传统扩散模型的多步采样耗时问题。

更重要的是,整个过程严格遵循3D几何约束,在显著增强纹理与高频细节的同时,确保了不同视角下生成结果的一致性。

统一训练 3D一致

为避免“先重建、后修图”的割裂流程,研究提出了端到端的联合训练范式。该框架将ViT几何重建、Gaussian渲染与Diffusion增强三个模块整合为一个统一的训练系统。

这使得扩散模型在学习增强效果的同时,能够真正理解和服从3D结构,从根本上保证了生成内容的几何准确性和视角一致性。

高分辨率 自由扩展

该框架展现出出色的高分辨率可扩展性。实验证明,即使在模型训练完成后,它也能直接支持从512×512到1024×1024的更高分辨率输出,且无需进行额外的模型微调或训练。

在这种高分辨率场景下,其感知质量依然显著优于现有的其他方法,证明了该方案强大的泛化能力和实用潜力。

这项研究为前向式3DGS的画质瓶颈提供了优雅的解决方案,巧妙地平衡了效率与质量。通过端到端的统一框架,它让3D重建与2D生成技术实现了真正的融合。未来,此类方法能否推动实时、高保真的三维内容创作进入新的阶段?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章