针对图像复原任务中单一架构的局限,一种融合CNN、Mamba与Transformer的混合方案RestorMixer应运而生。它旨在结合三者优势,在速度、全局建模与局部细节处理间取得平衡,为解决复杂图像退化问题提供了新思路。
智能速览
单一架构在图像复原中存在固有局限。
RestorMixer融合CNN、Mamba与Transformer,实现优势互补。
RDCNN负责速度,EMVM负责全局,MWSA负责细节。
在去雨任务上,PSNR指标达到35.47dB,超越SOTA模型。
模型在保持高精度的同时,推理效率依然出色。
精华内容
RestorMixer如何将三大架构巧妙结合?其核心在于针对不同特征需求,动态分配最合适的处理模块,实现效能最大化。
单一架构之困
在图像复原领域,主流的单一架构各有短板。CNN模型虽然推理速度快,擅长捕捉局部纹理,但感受野有限,难以理解图像的全局结构,导致处理结果可能在宏观一致性上有所欠缺。
Transformer凭借强大的自注意力机制,能够建模长距离依赖,拥有全局视野,但其计算和内存开销巨大,对硬件要求高,限制了实际应用。
新兴的Mamba架构以线性复杂度著称,高效处理长序列,但在提取精细的局部纹理细节时,其表现有时不如卷积操作细腻。
混合异构设计
RestorMixer的核心创新在于“混合异构”思想,它不再固守于单一架构,而是根据图像复原不同阶段的需求,智能地分配任务。
对于需要快速处理和提取基础特征(如边缘、纹理)的场景,系统会调用CNN模块,利用其高效性保证整体速度。
当需要建立图像元素间的长距离关联、理解整体布局时,则交由Mamba模块处理,发挥其全局建模的优势。
而对于需要动态调整像素间关系的复杂修复任务,Transformer的注意力机制则负责精细化建模,确保细节的准确性。
速度担当RDCNN
为确保整个网络的推理效率,RestorMixer设计了残差深度CNN模块(RDCNN)。该模块在传统CNN的基础上引入了动态卷积技术,使其能够根据输入内容自适应地调整卷积核参数。
这种设计像一个高效的过滤器,能快速且准确地提取图像中的基础低级特征,为后续处理打下坚实基础。由于其计算量相对较小,RDCNN有效保证了整个混合模型的推理速度,避免因引入复杂模块而变得臃肿缓慢。
视野与细节担当
在全局和细节处理上,RestorMixer通过EMVM和MWSA两个模块协同工作。增强记忆视觉Mamba模块(EMVM)利用Mamba的线性扫描特性,高效捕捉全图上下文信息,解决了长距离依赖的难题。
多尺度窗口自注意力模块(MWSA)则在局部的小窗口内运行Transformer的注意力机制,专注于修复微小的纹理和结构细节。
这种“Mamba看大局,Transformer扣细节”的配合,实现了全局一致性与局部真实感的兼顾,复原效果更为干净自然。
实测性能霸榜
在公开数据集上的实验结果充分验证了RestorMixer的有效性。以图像去雨任务为例,RestorMixer取得了平均35.47 dB的峰值信噪比(PSNR),显著优于经典的Restormer模型(31.46 dB)和MPRNet。
从视觉效果上看,其他模型处理后的图像往往仍残留雨痕或出现背景模糊,而RestorMixer复原的图像背景纹理清晰,细节保留完整。
更重要的是,这种性能提升并未以牺牲效率为代价,模型在保持最高精度的同时,推理效率依然具备很强的竞争力。
RestorMixer的成功验证了多架构融合的巨大潜力,为底层视觉任务提供了新的设计范式。这种取长补短的思路,是否会成为未来模型设计的主流方向?