真实世界的雨雾和噪声严重影响了红外与可见光图像融合的效果。ControlFusion提出了一种创新方案,利用语言指令作为“遥控器”,不仅能自动感知环境退化,还能让用户手动调节融合效果。该方法结合物理模型,解决了传统算法在复杂场景下的性能退化问题,实现了更精准、可控的图像融合,为实际应用带来了新的可能性。
智能速览
真实场景中的复合退化(如雨雾叠加噪点)是传统融合算法的主要瓶颈。
ControlFusion引入语言-视觉提示,实现了对融合过程的精确控制。
通过物理模型生成更真实的数据,并设计空间-频率协同适配器感知退化。
用户可通过调整文本指令等级,像调音量一样连续调节去雾强度和细节恢复。
在多个数据集上超越主流算法,并显著提升了下游目标检测任务的性能。
精华内容
ControlFusion的突破在于,它让图像融合从一个静态的“黑盒”过程,转变为一个可听懂人话、能感知环境、并按需调整的动态系统。其核心是如何将抽象的语言指令转化为具体的图像处理操作。
攻克融合三重瓶颈
现有融合算法在真实场景中面临三大挑战。首先是难以应对的“复合退化”,即低光、雨雾、噪点同时出现,单一去噪或去雨模型会顾此失彼,产生大量伪影。其次是“域差距”,由于缺乏真实配对数据,模型在简化的合成数据上训练,却在真实环境中表现不佳。最后是“可控性”缺失,传统网络如同黑盒,无法响应用户的具体需求,也难以实现自动化部署。
物理模型筑基
为弥合真实与模拟场景的鸿沟,ControlFusion基于Retinex理论与大气散射模型,构建了一个物理驱动的退化成像模型。该模型能模拟可见光模态的低光、雨雾,以及红外模态的条纹噪声等12种退化类型,并设置了4个锚点等级,生成了更贴近真实世界的DDL-12数据集,为模型训练提供了高质量基础。
语言提示的魔力
ControlFusion的核心是一个两阶段训练的统一可控框架。第一阶段训练一个“翻译官”——空间-频率协同视觉适配器(SFVA),它能从图像的空间域和频率域中提取退化特征,并将其“翻译”成与文本语义对齐的提示。第二阶段训练“执行官”——提示调制网络(PMM),该网络根据输入的提示动态生成参数,对特征进行自适应调制,实现“对症下药”的融合与复原。
实测效果领先
在MSRS、LLVIP等主流数据集上,ControlFusion在EN、SD、VIF等多项定量指标上均优于7种SOTA方法。在面对“可见光雨雾+红外强噪点”的复合退化场景时,传统方法要么去雾不彻底,要么过度去噪丢失目标,而ControlFusion能有效清除干扰,并清晰保留红外目标。在下游任务中,经ControlFusion处理的图像助力YOLOv8在LLVIP数据集上取得了0.609的mAP@0.5:0.95,位居榜首。
ControlFusion不仅提升了图像融合的鲁棒性和精度,更开创了人机交互的新范式,将控制权交还给用户。这种将物理先验与深度网络结合的思路,为构建“认知型”视觉模型指明了方向。未来的图像处理技术,是否会都变得如此善解人意?