发布时间:2026/8/22 12:40:36
MINIMA:通用图像匹配 0. 论文信息标题MINIMA: Modality Invariant Image Matching作者Xingyu Jiang, Jiangwei Ren, Zizhuo Li, Xin Zhou, Dingkang Liang, Xiang Bai机构Huazhong University of Science and Technology, Wuhan University原文链接https://arxiv.org/abs/2412.19412代码链接https://github.com/LSXI7/MINIMA1. 导读跨视图和跨模态的图像匹配在多模态感知中起着至关重要的作用。在实践中不同成像系统/风格导致的模态差距对匹配任务提出了巨大挑战。现有的工作试图提取特定模态的不变特征并在有限的数据集上进行训练表现出较差的泛化能力。在本文中我们提出了极小值一个统一的图像匹配框架多跨模态的情况。不追求花哨的模块我们的MINIMA旨在从数据扩展的角度增强通用性能。为此我们提出了一个简单而有效的数据引擎它可以自由地产生包含多种模态、丰富场景和精确匹配标签的大型数据集。具体来说我们通过生成模型从廉价但丰富的仅RGB匹配数据中放大模态。在这种设置下RGB数据集的匹配标签和丰富多样性被生成的多模态数据很好地继承。受益于此我们构建了MD-syn一个新的综合数据集填补了一般多模态图像匹配的数据空白。使用MD-syn我们可以在随机选择的通道对上直接训练任何高级匹配管道以获得跨通道能力。对域内和零触发匹配任务的大量实验包括19跨模态案例表明我们的最小值可以明显优于基线甚至超过特定模态的方法。2. 效果展示在六个真实跨模态图像对数据集上的整体图像匹配准确性和效率。使用姿态误差 (10°) 或复制误差 (10px) 的AUC进行准确度评估使用每秒钟对数进行效率测试左图报告了代表性方法在每个数据集上的AUC。右图总结了平均性能其中不同颜色表示稀疏、半密集和密集匹配的匹配管道我们的MINIMA标记为大只有通过我们的数据引擎创建的合成多模态数据MINIMA才能泛化到真正的跨模态场景并带来大幅改进。真实跨模像对的定性结果。我们的方法 MINIMALG稀疏和 MINIMARoMa密集与稀疏匹配管道 ReDFeat 和 OmniGlue 以及半密集匹配器 XOFTR 进行了比较。ReDFeat 和 XoFTR 是跨模态方法而 OmniGlue 以其泛化能力而闻名。每种方法生成的匹配被绘制出来红线表示超出5x10-4或3个像素的极线误差姿态或投影误差仿射变换。详细信息记录在每对图像的左上角包括默认 RANSAC 估计产生的几何误差和正确匹配数/总匹配数。3. 方法在构建MD-syn之后我们的模态不变图像匹配 (MINIMA) 的训练过程就变得简单明了。如图3所示它包含以下两个阶段阶段1在多视角RGB数据上预训练先进的匹配模型直至其收敛。阶段2以较小的学习率对随机选择的跨模态图像对收敛进行。微调相比之下在RGB数据集上训练更加容易。RGB我们数据集采用上进行先训练预则训练较为多后容易微调。的策略预训练原因模型如下可以为。诸如首先由于不同模态之间的高差异性在MD-syn上从头开始训练具有挑战性这需要大量的迭代才能模态匹配等困难任务提供良好的匹配先验从而使其快速收敛如图5所示。此外RGB数据集的训练已被广泛研究其官方训练的模型可以直接支持我们的微调过程。由于MegaDepth已经产生了众多按照稀疏、半密集和密集匹配分类的匹配方法我们从中选用了三个代表性模型作为我们的基础模型即 LightGlue (LG)、LoFTR 和 RoMa。我们将对这些模型进行微调并发布我们的三个模型分别命名为 MINIMALG、MINIMALoFTR 和 MINIMARoMa。这些模型将在合成和真实跨模态数据集上进行域内和零样本匹配的评估。4. 实验结果5. 总结本文提出了一个名为MINIMA的统一匹配框架适用于任何跨模态情况。这是通过使用有效的数据引擎填补数据鸿沟来实现的该引擎可以自由地将廉价的RGB数据扩展到大型多模态数据。构建的MD-syn数据集包含了丰富的场景和精确的匹配标签并支持任何先进匹配模型的训练显著提高了在未见跨模态情况下的跨模态性能和零样本能力。参考文献简单但有效精度暴涨98%华科开源MINIMA通用图像匹配兼容稀疏、半稠密、稠密

相关新闻

2026/8/22 12:40:36

基于大语言模型的AI猜词游戏Dartwords:从Agent设计到工程部署

你还在玩传统的“你画我猜”或“猜词游戏”吗?是不是觉得玩法单一,或者AI对手太“笨”,要么秒杀全场,要么答非所问?今天要聊的 Dartwords ,可能会颠覆你对AI猜词游戏的认知。它不是一个简单的“AI出题&am…

2026/8/22 12:40:36

Transformer在计算机视觉中的核心原理与实战应用:从ViT到Swin

如果你在2020年之前学习计算机视觉,你的知识图谱里大概率不会有“Transformer”这个词。那时,CNN(卷积神经网络)是绝对的王者,从图像分类到目标检测,再到语义分割,几乎所有的SOTA模型都建立在卷…

2026/8/22 14:05:40

免费QQ空间备份工具GetQzonehistory:扫码导出你的全部历史说说

免费QQ空间备份工具GetQzonehistory:扫码导出你的全部历史说说 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 去年整理旧照片时,你想从QQ空间里翻出大学时期的几…

2026/8/21 13:13:49

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 20:14:07

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/21 15:40:01

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/21 15:40:01

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/22 1:39:53

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…