ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

LiftFeat:3D 几何感知的局部特征匹配新颖网络 (ICRA‘25)

LiftFeat:3D 几何感知的局部特征匹配新颖网络 (ICRA‘25) 1. 极端条件的匹配图像间的局部特征匹配是许多机器人核心任务的关键例如运动恢复结构 (SfM)、同步定位与建图 (SLAM) 和视觉定位。然而在实际应用中某些场景存在极端条件例如光照剧烈变化、低纹理区域或重复纹理模式。在这些情况下实现可靠的特征匹配仍然是一个具有挑战性的任务。传统的局部特征匹配方法通常包含三个步骤关键点检测、描述符提取和特征匹配。早期的SIFT和SURF等方法提出了精心设计的手工描述符并在匹配阶段采用最近邻搜索来获取匹配结果。近年来基于深度学习的特征匹配方法显著提升了性能。一些研究联合训练关键点预测和描述符提取不仅提高了处理速度还进一步优化了匹配性能。此外其他研究引入了图神经网络 (GNN)将特征匹配任务建模为最优传输问题从而有效提高了匹配精度。尽管现有方法在大多数场景中表现优异但在极端条件下如光照剧烈变化、低纹理或重复纹理仅依赖2D视觉线索可能导致特征匹配的混淆。例如在低纹理场景中视觉信息缺乏足够的区分性。一个直观的思路是利用3D数据提供的额外信息来增强特征匹配的鲁棒性。然而3D数据的精度和计算成本带来了新的挑战特别是在计算资源受限的机器人应用中。本文介绍一种轻量级模型LiftFeat[1]融合2D和3D信息进行局部特征匹配。深度图是最易获取的3D信息之一但由于其尺度模糊性直接用于局部特征匹配并不合适。相比之下表面法线 (Surface Normal) 具有平移和尺度不变性更适合特征匹配。因此我们在网络中引入了一个表面法线估计头用于学习3D几何知识。值得注意的是伪表面法线标签由Depth Anything v2预测的深度图生成无需额外的标注成本。随后我们提出3D几何感知的特征增强模块 (3D-GFL)将原始2D描述符与3D法线特征融合从而提升2D描述符在挑战性场景中的区分能力。实验结果表明我们的方法LiftFeat在多个任务相对位姿估计、单应性估计和视觉定位上均达到了最先进的性能。项目链接https://github.com/lyp-deeplearning/LiftFeat主要贡献提出了一种轻量级网络LiftFeat创新性地引入3D几何信息进行局部特征匹配。设计了3D-GFL模块融合2D描述符与3D法线特征显著提升了2D描述符在极端条件下的区分能力。实验证明我们的方法在多种任务和场景下均具有高精度和鲁棒性并且在边缘设备上的推理延迟仅为7.4毫秒。2. 具体方法为了克服极端场景下图像特征匹配的局限性我们提出了一种利用深度图提取的表面法线信息来增强描述符匹配的新方法。本节首先介绍所提出的LiftFeat网络架构然后阐述如何利用单目深度估计模型的先验知识监督表面法线学习接着详细介绍融合表面法线信息与原始2D描述符的3D几何感知特征增强模块 (3D-GFL)最后说明网络训练细节。2.1. 网络架构如图2所示为了在精度和速度之间取得更好平衡我们设计了一个包含共享特征编码模块和多个任务专用头的网络架构。2.1.1. 特征编码设输入图像其中W和H分别表示图像的宽度和高度。在特征编码模块中我们采用5个块进行特征提取。所有块均由3×3卷积层和步长为2的最大池化层组成。Block5输出的特征图空间分辨率为。各块输出的特征图深度逐级增加5个块的输出深度分别为{4,8,16,32,64}。随后融合块对低级特征进行多尺度特征融合。我们使用1×1卷积和双线性插值对齐并求和Block3、Block4和Block5的特征得到尺寸为的融合特征图。2.1.2. 多任务头我们的多任务头用于预测关键点、描述符和表面法线。关键点分支采用类似SuperPoint的策略应用1×1卷积生成尺寸为的关键点图然后进行通道级softmax操作得到原始图像分辨率的关键点分数分布。描述符分支使用双线性插值和L2归一化操作获得尺寸为的描述符图。同样法线头使用双线性插值获得与原始图像相同分辨率的3通道图。2.1.3. 3D几何感知特征增强模块基于关键点信息我们对描述符和法线特征进行采样然后输入3D-GFL模块以增强提取的特征。假设关键点分支通过非极大值抑制 (NMS) 预测关键点。我们执行网格采样操作提取对应的描述符和法线向量特征。接着我们通过添加多层感知机 (MLP) 层对齐它们的特征维度然后对对齐后的特征求和。最后我们应用堆叠的自注意力层获得增强后的描述符。2.2. 3D几何知识监督表面法线描述了表面上点的朝向是一种具有平移和尺度不变性的3D信号。在训练阶段我们使用单目深度估计模型 Depth Anything v2 生成表面法线的监督标签。虽然单目深度估计本身存在尺度模糊性问题但将深度信息转换为表面法线可以有效缓解这个问题。这种转换通过提供对尺度和平移具有不变性的鲁棒几何线索提升了特征匹配性能。给定输入图像1使用深度估计模型生成对应的深度图。对于图像中的像素 P(u,v)其法线向量可以基于局部梯度信息估计。设为该点的深度值u和v方向的深度梯度可通过有限差分近似计算利用这些深度梯度我们可以估计点 P(u, v) 的法线向量。假设该点的3D坐标为则法线向量可计算为其中分母表示向量的大小确保法线向量被归一化。法线向量提供了点 P(u, v) 处局部表面朝向的信息反映了物体的3D几何结构。2.3. 3D几何感知特征增强我们使用特征聚合模块将关键点的2D描述符与3D表面法线信息融合。具体来说对于坐标为的每个关键点我们使用网格采样操作提取对应的局部特征描述符和预测的表面法线向量。由于描述符和法线向量的维度不同我们使用独立的多层感知机 (MLP) 层对齐特征维度并执行加法运算。然后我们使用位置编码 (PE) 将关键点位置信息整合到描述符特征中得到混合信息。计算过程如下我们使用堆叠的自注意力模块实现不同点之间特征信息的交互和聚合。我们使用线性transformer层构建自注意力模块这也能提升模型的推理速度。对于第 (n1) 层第 i 个关键点对应的特征由第 n 层的原始特征和集合P中所有其他关键点的特征聚合得到其中表示集合P中某点的特征、和表示线性映射层。实验中我们使用3个自注意力层。2.4. 网络训练我们使用来自合成数据或Megadepth数据集的成对图像的像素级匹配标签来监督网络训练。给定输入图像对我们计算三种损失关键点预测损失、表面法线估计损失和描述符损失。关键点损失对于关键点监督我们采用与SuperPoint相同的策略。关键点logits图的原始输出尺寸为其中最后一个通道表示无关键点。我们使用ALIKE检测器的输出作为真实关键点标签。关键点损失通过对关键点logits图应用负对数似然 (NLL) 损失计算得到。法线损失法线向量估计损失用于确保准确的表面朝向预测。对于每个预测的法线向量我们使用余弦相似度将其与真实法线向量进行比较确保预测法线与真实表面法线对齐。法线损失定义为其中和分别是预测和真实的法线向量。描述符损失给定从图像和采样的描述符我们将其输入特征融合模块得到描述符。接着计算相似度得分矩阵。真实匹配矩阵记为。我们最小化预测匹配得分矩阵S相对于真实匹配矩阵的负对数似然总损失训练的总损失是这三个分量的加权和其中和是平衡关键点损失、法线损失和描述符损失贡献的权重因子。本实验中我们经验性地设,。3. 实验效果4. 总结一下LiftFeat是一种新颖的轻量级网络用于3D几何感知的局部特征匹配。我们通过学习表面法线来编码3D几何特征利用Depth Anything模型估计深度图并从中推导伪表面法线作为监督信号。所提出的LiftFeat方法将学习到的表面法线3D几何特征与原始2D描述符有效聚合从而提升了视觉特征的区分能力尤其在光照变化显著、低纹理或重复纹理等极端场景中表现优异。通过在三个任务相对位姿估计、单应性估计和视觉定位上的验证LiftFeat的性能优于部分轻量级前沿方法。参考文献LiftFeat: 3D Geometry-Aware Local Feature Matching
返回列表