单目深度估计是计算机视觉的关键任务,但传统自监督方法常因依赖重投影损失而导致结果模糊、细节缺失。Jasmine框架的出现打破了这一僵局,它作为首个成功将Stable Diffusion引入自监督微调的方案,巧妙地保护了大模型的视觉先验,在各种复杂场景中实现了精细且准确的深度估计,为无标注数据学习开辟了新路径。
智能速览
Jasmine是首个成功将Stable Diffusion引入自监督单目深度估计的框架。
提出的MIR机制通过图像重建任务保护SD的视觉先验免受污染。
SSG模块有效对齐了不同分布的输出,并过滤了异常梯度。
在KITTI基准上取得了新的SOTA,并展现出强大的零样本泛化能力。
捕捉到了传统方法无法想象的细节,如水面倒影和纤细栏杆。
其MIR范式具有通用性,可拓展至多种密集预测任务。
精华内容
如何在不破坏Stable Diffusion宝贵先验的前提下,将其强大的生成能力注入自监督学习框架?Jasmine通过精巧的设计给出了答案,核心在于解耦结构学习与细节保持。
自监督的困境
自监督单目深度估计(SSMDE)潜力巨大,因为它无需昂贵的LiDAR标注,仅从视频序列中学习。然而,它有一个致命弱点:依赖的重投影损失在处理遮挡、弱纹理和光照变化时,会产生错误的监督信号。这直接导致预测结果模糊、细节丢失、边缘退化。若直接用这种充满噪声的“脏”监督信号去微调拥有强大视觉先验的Stable Diffusion(SD),只会迅速污染并破坏其宝贵的预训练知识,导致模型在训练早期就崩溃。这是将SD引入SSMDE的核心挑战。
解耦学习:守护先验
为解决重投影损失污染SD先验的核心矛盾,研究者提出了Mutual Image Reconstruction(MIR)机制。其核心思想是让SD模型在训练中“一心二用”。在每个训练批次中,模型不仅要预测深度图(主任务),还要交替地去重建输入图像(旁路任务)。通过混合真实数据帧与高质量图像,让SD在“重建图像”的任务上守住自身先验的清晰纹理;与此同时,主任务仍用自监督重投影损失优化几何一致性。这种设计巧妙地将结构学习和细节保持解耦,成功保住了SD的“金身不坏”。
分布对齐:过滤噪声
研究还发现,SD系方法的输出分布与自监督几何优化的分布天然存在错位。这个分布上的鸿沟使得两者无法直接融合。为此,团队设计了Scale-Shift Gate(SSG)模块。该模块在GRU中集成一个Scale-Shift Transformer(SST),用于显式迭代估计scale/shift参数,实现两个分布的对齐。同时,GRU的reset gate在反向传播时相当于一个“梯度滤波器”,其门控机制能有效阻挡重投影损失中的异常梯度,从而保护了从SD输出的精细纹理细节。
效果惊艳:超越SOTA
实验结果证明了Jasmine的有效性。在竞争激烈的KITTI benchmark上,Jasmine在所有指标上均超越了现有的自监督方法,取得了新的SOTA。更令人惊叹的是其零样本泛化能力:仅在KITTI上训练后,直接拿到CityScape、DrivingStereo等全新场景下测试,Jasmine不仅远超其他自监督方法,甚至在多个场景下超越了过往需要有监督微调Stable Diffusion的模型。得益于SD的先验和精心设计,Jasmine能够捕捉到前所未有的细节,如水面倒影、纤细的栏杆和清晰的人物轮廓。
未来展望:潜力无限
Jasmine作为首个成功的自监督SD微调框架,仅仅是一个开始。研究者认为,其提出的MIR无监督微调范式是通用的,它不仅限于深度估计任务。任何需要从缺少高质量标签数据中学习的图像预测任务,例如语义分割、法线估计、光流估计、图像去噪、图像超分等,都可以尝试用这种方式引入大模型的先验,以提升结果的细节和鲁棒性。这个新范式的价值已经得到验证,为社区开辟了一个激动人心的研究方向。
Jasmine框架不仅是自监督深度估计领域的一项重要突破,更重要的是它提出了一种通用的无监督微调范式。它巧妙地融合了大模型的先验知识与几何学习的约束,为解决更多缺乏高质量标注的视觉任务提供了全新思路。当强大的生成模型与自监督学习结合,还能解锁哪些前所未有的可能性?