把图像重建当锚点来稳住扩散模型的先验,这招确实聪明。就像老手艺人修复古画,一边对照原迹校准笔触,一边凭经验补全细节,既不盲从数据噪声,也没丢掉模型本身的“手艺”
全文概述
Jasmine是首个将Stable Diffusion(SD)引入自监督单目深度估计(SSMDE)的框架,通过Mix-batch Image Reconstruction(MIR)和Scale-Shift GRU(SSG)两大创新模块,在无需高精度深度标注的情况下,显著提升了深度估计的清晰度和泛化能力,刷新了KITTI基准测试的SOTA成绩。
自监督遇到的问题
传统自监督方法依赖重投影损失,容易在处理遮挡、弱纹理和光照变化时产生错误信号,导致预测结果模糊、细节丢失。而直接用噪声梯度微调SD会导致模型崩溃。
Jasmine的核心创新
Jasmine通过MIR让SD在重建图像时保持视觉先验,并通过SSG对齐尺度和位移分布,确保几何一致性的同时保留精细纹理。这使得Jasmine能在无高精标签情况下取得优异表现。
实验效果展示
Jasmine在KITTI基准测试中刷新了SOTA成绩,并展示了强大的零样本泛化能力,甚至在多个场景下超越了监督模型。其细节捕捉能力尤为突出,能准确识别水面倒影、纤细栏杆等复杂结构。
未来展望
Jasmine提出的MIR范式不仅限于深度估计,还可应用于语义分割、法线估计等多种任务。该框架为社区开辟了一个新方向,期待更多基于Jasmine的工作出现。
已收藏
去我的收藏夹