MINIMA:通用图像匹配
0. 论文信息标题MINIMA: Modality Invariant Image Matching作者Xingyu Jiang, Jiangwei Ren, Zizhuo Li, Xin Zhou, Dingkang Liang, Xiang Bai机构Huazhong University of Science and Technology, Wuhan University原文链接https://arxiv.org/abs/2412.19412代码链接https://github.com/LSXI7/MINIMA1. 导读跨视图和跨模态的图像匹配在多模态感知中起着至关重要的作用。在实践中不同成像系统/风格导致的模态差距对匹配任务提出了巨大挑战。现有的工作试图提取特定模态的不变特征并在有限的数据集上进行训练表现出较差的泛化能力。在本文中我们提出了极小值一个统一的图像匹配框架多跨模态的情况。不追求花哨的模块我们的MINIMA旨在从数据扩展的角度增强通用性能。为此我们提出了一个简单而有效的数据引擎它可以自由地产生包含多种模态、丰富场景和精确匹配标签的大型数据集。具体来说我们通过生成模型从廉价但丰富的仅RGB匹配数据中放大模态。在这种设置下RGB数据集的匹配标签和丰富多样性被生成的多模态数据很好地继承。受益于此我们构建了MD-syn一个新的综合数据集填补了一般多模态图像匹配的数据空白。使用MD-syn我们可以在随机选择的通道对上直接训练任何高级匹配管道以获得跨通道能力。对域内和零触发匹配任务的大量实验包括19跨模态案例表明我们的最小值可以明显优于基线甚至超过特定模态的方法。2. 效果展示在六个真实跨模态图像对数据集上的整体图像匹配准确性和效率。使用姿态误差 (10°) 或复制误差 (10px) 的AUC进行准确度评估使用每秒钟对数进行效率测试左图报告了代表性方法在每个数据集上的AUC。右图总结了平均性能其中不同颜色表示稀疏、半密集和密集匹配的匹配管道我们的MINIMA标记为大只有通过我们的数据引擎创建的合成多模态数据MINIMA才能泛化到真正的跨模态场景并带来大幅改进。真实跨模像对的定性结果。我们的方法 MINIMALG稀疏和 MINIMARoMa密集与稀疏匹配管道 ReDFeat 和 OmniGlue 以及半密集匹配器 XOFTR 进行了比较。ReDFeat 和 XoFTR 是跨模态方法而 OmniGlue 以其泛化能力而闻名。每种方法生成的匹配被绘制出来红线表示超出5x10-4或3个像素的极线误差姿态或投影误差仿射变换。详细信息记录在每对图像的左上角包括默认 RANSAC 估计产生的几何误差和正确匹配数/总匹配数。3. 方法在构建MD-syn之后我们的模态不变图像匹配 (MINIMA) 的训练过程就变得简单明了。如图3所示它包含以下两个阶段阶段1在多视角RGB数据上预训练先进的匹配模型直至其收敛。阶段2以较小的学习率对随机选择的跨模态图像对收敛进行。微调相比之下在RGB数据集上训练更加容易。RGB我们数据集采用上进行先训练预则训练较为多后容易微调。的策略预训练原因模型如下可以为。诸如首先由于不同模态之间的高差异性在MD-syn上从头开始训练具有挑战性这需要大量的迭代才能模态匹配等困难任务提供良好的匹配先验从而使其快速收敛如图5所示。此外RGB数据集的训练已被广泛研究其官方训练的模型可以直接支持我们的微调过程。由于MegaDepth已经产生了众多按照稀疏、半密集和密集匹配分类的匹配方法我们从中选用了三个代表性模型作为我们的基础模型即 LightGlue (LG)、LoFTR 和 RoMa。我们将对这些模型进行微调并发布我们的三个模型分别命名为 MINIMALG、MINIMALoFTR 和 MINIMARoMa。这些模型将在合成和真实跨模态数据集上进行域内和零样本匹配的评估。4. 实验结果5. 总结本文提出了一个名为MINIMA的统一匹配框架适用于任何跨模态情况。这是通过使用有效的数据引擎填补数据鸿沟来实现的该引擎可以自由地将廉价的RGB数据扩展到大型多模态数据。构建的MD-syn数据集包含了丰富的场景和精确的匹配标签并支持任何先进匹配模型的训练显著提高了在未见跨模态情况下的跨模态性能和零样本能力。参考文献简单但有效精度暴涨98%华科开源MINIMA通用图像匹配兼容稀疏、半稠密、稠密