
原文链接[2606.26812] Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interactionauthor{Li, Xilai and Li, Xiaosong and Tan, Haishu and Ye, Tao and Li, Huafeng and Wang, Hongbin}Abstract多通道图像融合(MMIF)通过利用来自不同通道的互补线索来增强场景表示。然而不利的天气会导致严重的图像退化扰乱特征表达并需要同时进行特征恢复和跨模式互补。现有的方法往往难以在这样的条件下进行有效的表征学习从而限制了它们的实际性能。为了应对这些挑战我们提出了一种基于模板的MMIF方法该方法集成了特征恢复和交互。我们首先引入“伪地面真实”来简化训练促进更快、更有效的特征学习。然后根据融合结果与源图像之间的映射关系设计了一种模板生成机制量化了融合过程中各通道的相对贡献。通过引入所提出的掩蔽引导的跨通道交叉注意机制鼓励网络在通道交互过程中选择性地关注信息特征从而降低了过度适应静态分布的“伪地面真相”的风险。此外我们还提出了掩码引导的学习策略和任务耦合的退化感知学习策略来平衡特征恢复和交互。在合成数据集和真实世界数据集上的广泛实验表明我们的方法在视觉质量、量化度量和下游任务方面都优于最先进的方法。Introduction图1clean-source-image和“Pseudo Ground Truth”监督下的优化行为比较。多通道图像融合(MMIF)[8、22、23、36、44、45]结合了来自多个通道的互补信息以产生更丰富的场景表示。例如在红外和可见光图像融合(IVIF)中可见光图像捕捉对语义解释至关重要的纹理细节而红外图像通过热辐射突出突出目标[46]。通过集成这些模式IVIF增强了下游任务如对象检测[34]、语义分割[25]和深度估计[27]。现有的研究[121347]对IVIF架构进行了广泛的研究主要集中在理想场景上。给定一对配准的红外(IR)和可见光(VI)图像融合任务通常通过最小化基于L1范数的损失函数来生成融合输出。常规IVIF的优化目标可以表示为这里f(·)表示融合网络θ表示网络参数并且λ1、λ2是平衡两种模式的贡献的权重。这一目标使网络能够有效地从多个通道中提取有意义的信息。一些方法[1246]增加了额外的损失函数以进一步优化融合性能。然而现实世界的复杂性如噪音[614]、恶劣天气[18]和运动模糊[2]对IVIF的适应性构成了巨大的挑战。最近关于这些情况的著作[183143]可以分为两类。第一种模式采用“恢复融合”模式每种模式首先由恢复网络处理然后输入到融合网络中。然而这种两阶段设计引入了几个问题(1)恢复侧重于模式内恢复而融合目标是模式间的互补性导致不稳定的优化。(2)误差累积恢复阶段的伪影可能会传播到融合过程中放大退化的特征并损害重建。为了解决这些问题一些研究[926303840]采取了第二种策略使用“Pseudo Ground Truth”作为监督。具体地说伪地面真实是指现有方法以干净的VI和IR图像作为监督目标所获得的融合结果。第二种策略的优化目标可以表述如下其中GTPse表示“伪地面真理”。如图1所示源图像监督使网络在联合特征提取和退化去除方面苦苦挣扎经常会留下雨纹和颜色失真。相比之下“伪地面真相”监管简化了优化并有助于保存全局结构和精细细节。图2在干净的场景中“伪地面真实”监督导致的通道偏差的可视化。然而虽然这种方法降低了优化的复杂性但它不能完全解决复杂场景下的融合挑战因为现有方法从干净的图像生成的伪地面真实仍然存在信息损失和通道偏差。此外用“伪地面真相”训练的网络可能会忽视互补的多模式线索从而削弱了概括性。如图2所示这种模型在干净的场景中未充分利用红外热信息导致关键目标区域的损失。这突出了一个关键的局限性该策略适合伪目标的静态分布而不是学习IVIF的动态机制。这提出了一个关键问题我们能否利用“伪地面真相”的优势同时使网络能够动态挖掘跨模式信息并保持对降级的感知针对这些问题我们提出了一种基于面罩引导的恶劣天气图像融合框架(AMG-FUSE)。我们首先分析源图像和融合结果之间的关系并推导出一种掩模表示来解耦融合图像中的特定于模态的分量。该掩码将多模式特征分离在“伪地面真相”中并作为训练过程中显式跨模式交互建模的外部先验鼓励网络学习动态融合过程。在此基础上设计了掩码制导的特征提取模块利用掩码恢复退化特征增强跨模式交互。在训练过程中掩码引导学习策略(MGLS)和任务耦合退化感知学习策略(TDAS)协同监督融合网络促进学习更清晰和更互补的特征表示。我们的主要贡献如下-我们提出了一种适用于复杂场景的统一的多通道图像融合方法可以在统一的网络中同时进行特征恢复和通道交互。-我们提出了一种掩码引导的特征提取模块有效地重建了融合特征。此外我们设计了一种掩码引导的网络学习策略来解决动态跨通道交互建模的不足。-我们提出了一种任务耦合的退化感知学习策略该策略利用恢复任务作为有意义的监督信号来增强退化感知并指导特征融合过程。-我们在三种恶劣天气条件下进行了广泛的实验以验证所提出的方法的有效性并通过下游任务展示了其在现实世界中应用的潜力。2 Related Works2.1 Learning based IVIF Methods深度学习的最新进展极大地促进了IVIF算法的发展[32848]。现有的理想条件下的研究主要集中在跨通道信息交互[12212846]统一融合框架设计[4193749]以及任务驱动优化[120323539]。跨通道交互通常使用特征提取程序例如卷积或自我注意以区分共享和特定通道的提示以实现有效的融合。例如赵等人。[46]设计了一种相关性驱动的双分支变压器-CNN以分离全局和局部特征并保留显著细节。随着数据集的增加和计算能力的增强统一的面向下游的融合框架受到了越来越多的关注如Wu等人。[35]将细分任何模型提取到融合网络中。2.2 IVIF Methods for Complex Scenes现实环境的复杂性给IVIF算法在实际应用中带来了巨大的挑战。除了理想条件下的融合任务研究人员还将他们的重点转移到复杂条件下的图像融合上如噪声、过度曝光和不利天气。复杂场景中的首要挑战不仅是实现跨模式交互而且要准确区分有用的特征和退化特征并确保有效的恢复。例如Yi等人。[41]提出了一种以语义文本为导向的退化感知交互融合算法利用文本信息作为外部先验帮助网络聚焦于已有的退化。Li等人。[18]结合物理模型提出了一种全天候IVIF算法通过精馏学习将各种先验知识融入到学生模型中。虽然上述方法[183141]在复杂场景下的融合研究取得了很大进展但它们主要侧重于特征恢复没有充分探索复杂融合与理想融合之间的范式差距。3 Proposed Method该算法的工作流程如图3所示。首先使用卷积和残差块来增强输入图像的特征表示。然后对提取的多模式特征进行组合以生成初始融合特征。随后残差块进一步提炼特定于通道的特征而融合后的特征由直方图变换器块(HTB)[29]处理以提取显著信息。HTB根据像素强度分割空间特征并将自我关注应用到不同的强度范围使其能够在长空间距离上捕获类似的退化模式[29]。最后利用MCCA模块对多模式特征和融合特征进行联合细化得到最终的融合图像。图3提出的方法的流程图。3.1 Mask Construction from Fusion Formulation虽然“伪地面真实”的引入可以简化训练过程但它也可能导致网络直接复制其特征而不是学习其所传达的底层通道分配知识。为了克服这一限制我们通过引入面具来将其解耦。IVIF任务的核心目标是抑制跨通道冗余有效地提取互补信息。在不考虑特征增强和减少的情况下融合结果(FUSE)可以表示为这里M表示用于特定于通道的权重分配的掩码而ε表示误差和噪声项。在已知熔丝、VI和IR的情况下M的卷积RSB卷积RSB RSB HTB RSB MfeM Sigmoid Gap RSB Sigmoid Conv Relu Conv表达式可推导为在现实世界中直接从可见光图像中减去红外图像可能会导致误导或不稳定的行为。在雾霾或下雪的情况下可见光图像通常表现出过度或局部过度曝光的亮度而红外图像则表现出对比度降低和像素值较低。经过网络优化和退化去除后融合后的输出增强了来自红外分量的结构和目标信息从而产生更稳定的(FUSE−IR)分布更好地反映真实场景亮度。然而由于公式4的分母中的亮度偏差是由来自可见图像而不是语义内容的退化因素驱动的所以退化信息主导了加权违反了掩模的去耦合原则并且阻止了它捕捉实际的模式分布。相反在夜间场景中由于光照不足可见图像包含的有效纹理最少而红外图像保持相对稳定可能会呈现更强的亮度提示。这会导致(VI−IR)在大范围内为负或接近于零使得公式4在生成掩模时在数值上不稳定。为了解决这个问题我们重写M的表达式如下所示图4通道贡献模板和特征分解的可视化。将Fuse信息引入分母中有效地防止了可见光图像的亮度偏差错误地放大了掩模避免了分母中的极端数值不稳定性。最后利用M我们可以获得不同融合算法对不同模式信息的表示。如图4所示我们可视化了构造的掩码和分离的多模式特征。该方法通过引导网络学习多通道信息在“伪地面真实”中的分布模式动态地对各通道的贡献进行建模避免了对整体场景的表面拟合。3.2 Mask Guided Feature Extraction Module直接对伪目标进行训练可能会导致网络复制其固有的偏见强调表面特征复制而不是有效的跨模式交互。为了解决这一问题我们提出了掩码引导的特征提取模块。首先将多模特征输入残差块(RSB)然后将融合后的特征传递给直方图变换块(HTB)进行优化。然后将得到的输出用于计算掩码M。MCCA模块的提出是为了使网络能够学习“伪地面真相”的多模式交互模式。MCCA采用交叉注意机制其中多通道特征作为掩码引导的查询而融合的特征作为关键字和值。为了改进局部信息建模在查询分支和键值分支中都引入了深度可分离卷积以扩展局部接受域。然后掩码被用来对查询QVI和QIR进行加权引导网络将重点放在每个通道中的重要特征上。这使得融合空间内的多模式特征能够解耦和重新组合。3.3 Mask Guided Learning Strategy为了更好地利用“伪地面真实”来学习多通道交互特征我们提出了一种掩蔽引导学习策略(MGLS)。具体地说如公式5所示掩码MPSE是基于“伪地真值”(GTPse)和干净的多通道源图像VIC和IRC来计算的。然后该掩码用于在“伪地真值”中去耦合多通道特征FVI和FIR。这里F_{VI}和F_{IR}是GT_{\mathm{pse}}中的通道分配图。然后我们计算相应的多模式特征的L1损失以约束网络学习“伪地面真实”中的多模式信息分布模式。给定网络输出的多峰特征为HAT{F}_{VI}和\HAT{F}_{IR}建议的MGLS损失(数学上的{L}_{MGLS})计算如下其中H和W分别表示图像的高度和宽度。3.4 Task-Coupled Degradation-Aware Learning Strategy图5可见特征重加权中掩码引导的退化抑制的可视化。公式3定义了传统图像融合的合成范例。因此在确定掩码后可以间接获得现有方法针对不同模式信息的分配策略。在复杂场景中两个输入图像(Videg和IRDeg)经常会降级。在这一点上融合网络的目标是输出包含互补的多模特征的清晰的融合结果。这一过程可以使用公式3进行类似的建模。由于FUSE是非退化图像因此公式8中的MDeg×Videg所获得的可见模式信息应该是无退化的。因此该掩模可以有效地捕捉退化区域的分布。这如图5所示它显示大多数雨带已被成功抑制或移除。基于以上观察结果我们提出了任务耦合的退化感知学习策略(TDAS)旨在引导融合网络将处理的优先级划分得更清晰、更突出。对于恢复任务当输入图像是无退化的时恢复网络倾向于生成与原始图像非常相似的输出。因此我们将TDAS损失定义如下其中R(·)表示恢复模型[42]并且。当VIF与恢复网络的输出R(VIF)足够相似时意味着融合网络已经有效地恢复了清晰的特征。3.5 Loss Functions在训练过程中除了MGLS和TDAS之外还进一步引入了源图像监督通过对融合输出施加约束来增强模型捕获多峰分布的能力。具体地说我们采用梯度损失和颜色一致性损失来分别保持结构细节和颜色分布的一致性。梯度损耗定义如下颜色一致性损失[41]表示如下其中FCbCr表示将图像空间转换到CBCR颜色空间的函数。总损失函数表示如下其中λ是衰减系数随着训练周期数的增加而逐渐减小。除LMGLS外的所有损失项的权重都被指定为1确保了来自渐变和颜色一致性约束的平衡贡献而不需要仔细的超参数调整。