《武汉工程大学学报》  2026年04期 449-457   出版日期:2026-08-30   ISSN:1674-2869   CN:42-1779/TQ
基于局部特征变换器的多尺度自适应特征图像匹配算法




计算机视觉领域中,图像特征匹配是用于确定多幅图像场景之间位置关系的重要技术,如何提高图像匹配在不同场景中的准确度,一直是计算机视觉领域的关键。图像匹配一般由特征提取、特征描述、特征匹配3个步骤组成。特征提取是从图像中识别出显著的特征点;特征描述阶段,对每个特征点生成局部特征描述符;特征匹配则通过比较特征描述符之间的相似性,计算不同图像中特征点的匹配关系。其中特征的提取和描述,对匹配结果的优劣有直接影响。
传统的图像特征匹配方法依赖于手工设计的特征提取技术。罗凯等[1-2]使用尺度不变特征 (scale-invariant features, SIFT)对无人机图像进行特征提取以及描述。Rublee等[3]提出定向快速和旋转二进制描述符,通过结合加速分割测试特征(features from accelerated segment test,FAST)[4]的特征点检测技术与二进制鲁棒独立基本特征(binary robust independent elementary features, BRIEF)[5],大幅提升了运算效率。在传统方法应用上,罗云昊等[6]设计了一种二进制描述子,通过计算关键点协方差矩阵特征向量,构建局部坐标系,将关键点投影到局部坐标系的3个平面,从而构建描述子。
随着神经网络的发展,更多的深度学习技术被应用在图像匹配领域,如纯卷积网络系列(ConvNeXt)[7]。自监督兴趣点检测与描述(self-supervised interest point detection and description,SP)[8]算法是一种自监督网络框架,通过单应性适应策略提升了特征点的复检率。Sarlin等[9]进一步结合图神经网络提出了SuperGlue算法,用于匹配SP生成的描述子。Lindenberger 等[10]进一步提出光速局部特征匹配算法,对网络进行轻量化的同时,实现了匹配精度的提高。Sun等[11]提出了一种端到端的图像特征匹配算法:局部特征变换器(local feature transformer,LoFTR),类似双分辨率对应网络(dual-resolution correspondence networks,DRC-Net)[12] 的特征提取,LoFTR采用残差网络(residual network,ResNet)和特征金字塔网络(feature pyramid networks,FPN)[13]作为骨干网络,用于提取不同尺度的特征,并在特征重构模块中使用Transformer[14]架构进行自注意力与交叉注意力计算。通过双归一化指数函数(dual-softmax)和互相最近邻(mutual nearest neighbor, MNN)准则计算匹配对,并将不同层级特征图的匹配结果进行融合,模型性能以及匹配效果显著提升。
Wang等[15]提出轴向位置编码器,将位置编码视为沿行列维度的双关键点编码任务,将关键点坐标解耦为两个独立一维向量,并设计并行网络分支,显式编码关键点间的几何关联结构,从而实现可靠位置编码。Zong等[16]使用边缘化样本一致性(marginalizing sample consensus, MAGSAC++)算法[23]估计基本矩阵,减少误匹配用以提高匹配精度,但存在剔除正常点的情况。Gao等[17]引入跨空间多尺度注意力机制,以提升在低纹理、高噪声图像中应对不同临床任务的鲁棒性。Bian等[18]通过整合局部与全局信息并设计E2Conv主干网络增加鲁棒性。Zhao等[19]、Potje等[20]则在提取关键点时,将不同尺度的特征图直接拼接或直接取和。Qu等[21]则在特征提取阶段以及特征注意力计算阶段分别使用窗口划分以及多尺度卷积核获取局部以及全局信息,优化方法都属于跨尺度信息融合,或对特征进行不同尺度的提取。
神经网络的特征匹配本质上仍是对以某种方式提取的描述符进行匹配。Zheng等[22]则是使用多尺度高斯侧窗滤波检测关键点并使用二阶梯度确定主方向,在边缘目标上取得了好的效果,但其对齐方式仍不具备足够的鲁棒性。
为保证匹配精度的同时增加点对数量,设计多尺度环形卷积(multi-scale ring convolution,MRC),使用环形掩膜卷积操作,在以关键点为中心的圆环上,将所提取特征向量的不同通道,与圆环上处于不同角度的区域进行对应,对提取到的特征进行通道循环移位操作,从而对齐特征主方向,最后进行尺度归一化,将特征映射到同尺度区间,得到对应点相似度最大特征;设计自适应权重(adaptive feature weighting, AFW)融合方法,将MRC提取的特征与具有全局位置信息的特征,在同尺度的特征图上进行权重计算,根据权重加权融合;引入MAGSAC++算法进一步筛选匹配点集,形成基于局部特征变换器的多尺度自适应特征图像匹配算法(multiscale adaptive feature image matching algorithm based on local feature transformer, MA-LoFTR)。改进后的算法,与基于LoFTR进行匹配优化的TopicFM模型[24]和Efficient LoFTR算法[25]比较,在保持匹配精度的条件下,增加了匹配点对数量,取得了具有竞争性的效果。
1 MA-LoFTR
MA-LoFTR架构如图1所示。其中,Nc和Nf分别表示处理粗粒度特征图阶段和处理细粒度特征图阶段,LoFTR模块内注意力堆叠层数;E表示对输入的特征图进行期望计算操作。
LoFTR作为一种端到端的密集匹配算法,对于输入的图像直接给出匹配结果,该过程主要通过主干网络来提取整体特征,未针对特征点进行描述。
MA-LoFTR对输入的图像使用ResNet和FPN提取粗粒度特征图(1/8大小特征图)和细粒度特征图(1/2大小特征图),并分别采用4个尺度的环形卷积核进行环形特征提取,对每个卷积核提取到的环形特征,按照从小尺度到大尺度的顺序,在通道维度进行拼接,得到环形卷积特征图,并使用Relu激活函数激活,对环形卷积特征与原特征使用AFW计算各自权重,根据权重分别与对应尺度的原特征图相加,得到1/8大小和1/2大小融合特征图。对在原始1/8大小特征图上得到的融合特征进行Transformer位置编码,再输入LoFTR模块进行粗粒度特征重构,重构后的特征经过可微匹配层,先通过阈值筛选筛除外点,再使用MNN计算出粗粒度的匹配点对集,对匹配的点对,使用MAGSAC++算法进行筛选,删除错误点对。在1/2大小融合特征图的对应区域,进行细粒度的匹配,计算匹配区域的热度图,将热度图和像素坐标进行乘积,得到更精确的期望坐标。
1.1 特征提取
网络以两张图像为一组输入,使用 ResNet_18 作为骨干网络,对图像进行特征下采样,得到不同尺度的特征图,再使用FPN 结构将图像特征上采样至1/2原尺度。在 FPN 结构中,高层特征通过双线性插值算法进行上采样,再与ResNet_18中同尺度特征图融合,最终输出 1/8 和 1/2 两种尺度的特征图。每个基础模块由两个3×3的卷积层、两个批归一化层、两个Relu激活函数和一个下采样层组成。
残差特征金字塔网络特征提取如图2所示。
1.2 MRC特征描述
特征描述为后续匹配阶段的每个关键点,提供能表示自身特征的特征向量,在实际应用场景中,表示同一空间点的特征关键点,由于拍摄视角的不同,存在不同程度的旋转,导致提取到差异较大的特征向量。
为使正确点对特征相似度最大,设计环形卷积特征描述方法。通过MRC对残差特征金字塔网络提取到的特征向量进行进一步描述,减少关键点旋转的影响,从而最小化匹配误差。对于某一点对[(P,P)]([P]和[P]分别表示原特征点以及变换后特征点),设其处理后的特征向量分别表示为[[p1,p2,p3,…,pn]]、[[p′1,p′2,p′3,…,][p′n]],由此特征点对误差可表示为:
[e=argmini=1nL(pi ,p′i)] (1)
其中:L为特征之间的误差计算方式,如欧氏距离等。
为了最小化点对[(P,P)]之间的误差[e],进行了如下步骤:
(1)使用环形卷积建立以关键点为中心的环形区域与提取的向量特征通道的对应关系。不同的通道对应环形区域不同的位置。
(2)对提取的环形特征进行通道循环移位操作,对齐环形区域特征主方向,从而修正图像旋转所带来的影响。
(3)对主方向对齐后的特征进行归一化,将特征映射到同一数值尺度区间。
环形卷积操作如式(2)所示:
[X=CMX] (2)
其中:X是输入的特征图,C表示卷积操作,M表示环形卷积中的掩膜操作。根据设定的半径,创建一个与卷积核同尺寸的掩膜,并设定不同尺度的环形区域,若矩阵元素处于圆环的内径和外径之间,则置为1,否则置为0。
对于向量[M=[m1,m2,m3,…,mn]],其对齐主方向后的特征向量为[M=[m′1,m′2,m′3,…,m′n]],每个元素对应的真实权重向量为[K=[k1,k2,k3,…,kn]]。为进行主方向估计,将[M]对齐到特征向量[M],将式(3)和式(4)约束下的[K]作为最终的真实权重向量,从而根据[K]确定主方向。
[k*=argmaxki=1nm′iki] (3)
[i=1nmiki≤i=1nm′iki] (4)
其中:[k*]为对齐后关键点各方向加权和最大值。通过估计通道维度上每个元素在对齐后各个通道上的分量,拟合真实权重向量[K]的值。对获取的权重进行L1正则化,与通道索引相乘,计算主方向期望值,并进行循环移位操作,从而对齐主方向。最后对进行循环位移的特征进行归一化操作,将对齐后的特征统一在同一数值区间。
完整MRC如图3所示。
将骨干网络提取的原特征作为环形卷积模块的输入,使用4个不同的掩膜,对特征图每个特征点进行特征重构。以特征点为圆心,将1个圆形划分为3个等宽的环形区域以及中心圆形区域,对4个区域分别进行卷积,然后对卷积结果进行主方向对齐化以及尺度归一化,最后从圆心由内至外拼接。经过Relu激活函数,输出提取到的环形卷积特征。
环形卷积模块内部不同尺度的环形卷积,共同使用一个共享卷积核,通过不同尺度的环形掩膜,来单独使用某一尺度的权重。在计算某一个尺度的环形卷积时,冻结卷积核其他环形区域的权重,防止未参与计算的区域影响到卷积核权重更新。
1.3 自适应权重融合
对于提取到的环状卷积特征,其更关注于局部小范围的特征,缺少对于全局位置信息的感知,直接引入全局位置信息,会影响局部特征信息结构。将最终特征分为具有局部空间信息的环形卷积特征部分,和引入全局位置编码的原特征金字塔提取的特征图,经过LoFTR粗粒度重构模块使用自注意力与交叉注意力计算的部分。对两部分特征进行加权融合,以增强特征描述能力,使得最终特征可以关注到局部空间信息,以及全局位置信息,生成更稳健的关键点描述信息。使用自适应空间特征进行融合,通过不同的权重比例,生成最终的关键点特征描述。
自适应空间特征融合,先对两个特征图分别进行卷积,得到两张通道数为8的特征图,然后将得到的特征图进行拼接,拼接后的特征经过一个二维卷积层,生成二通道权重特征图,在通道维度,使用归一化指数函数(Softmax)对两个特征图权重进行归一化。AFW模块结构如图4所示。
对特征图使用AFW模块产生的权重进行加权计算,计算公式如式(5)。
[y=xAij?α+xBij?β] (5)
其中:[y]为融合后特征图;[xAij]、[xBij]分别为输入的左图像和右图像特征图元素;[α]、[β]分别为左右特征图对应的权重,由AFW模块的1×1卷积层给出后,进行归一化操作得到,过程如式(6)所示。
[[α,β]=[eαeα+eβ,eβeα+eβ]] (6)
1.4 粗粒度匹配改进
粗粒度匹配通过对两个图片生成的关键点集进行互相关计算,点对之间的互相关概率最大,则为正确匹配。但这种方法完全依赖于关键点特征的提取质量,神经网络所提取的关键点特征并不稳定,存在各种噪声影响,可通过引入MAGSAC++算法,剔除噪声外点。
完成对两张图片的特征转化后,得到两个图像重构后的特征[FAtr(i)]和[FBtr(j)],并计算两个特征图每个元素之间的得分矩阵:
[S(i,j)=1τ?(FAtr(i),FBtr(j))] (7)
其中:[τ]为预先设定的超参数。在得分矩阵[S]的两个维度上分别应用Softmax操作,即双归一化操作,获得概率意义上的MNN匹配[Pc],如式(8)所示。
[Pc(i,j)=f(S(i,?))j?f(S(?,j))i] (8)
其中:[f]表示Softmax函数。
根据阈值[θc]筛选得到粗粒度匹配结果[Mc]:
[Mc=(i,j)|?(i,j)∈N(Pc),Pc(i,j)≥θc] (9)
其中:[N]表示MNN算法;[i,j]表示匹配的坐标位置。以[Mc]点对集中的每个点为中心,将窗口大小设置为5,进行窗口分割,MAGSAC++算法的噪声尺度设置为4,进行外点筛除,进一步提高点对集合质量。粗粒度匹配结果损失函数表示为:
[LC=-1Mgtc(i,j)∈MgtclnPc(i,j)] (10)
其中:[Mgtc]为1/8分辨率特征图的MNN匹配的结果点集。
1.5 细粒度匹配
在两个1/2 细粒度特征图[FA]、[FB]中定位[(i,j)]点对,根据预先设置的窗口大小进行窗口划分,再将窗口使用细粒度LoFTR进行特征计算,得到新局部特征图[FAtr(i)]、[FBtr(j)]。
计算每个点与其中心点之间的内积,从而生成关于中心点的概率热度图。再对热度图计算期望[E(?)],获得最终的实际匹配位置[Mf]。细粒度匹配的损失函数[Lf]定义为:
[Lf=1Mf(i,j)∈Mf1σ2(i)j-j′gt2] (11)
其中:[σ2(i)]表示热度图的总方差,[j]为点[i]在[FBtr(j)]上匹配的点,[j′gt] 为 [FAtr(i)]上的点[i]在[FBtr(j)]上的真实投影点。
最终损失可表示为:
[L=LC+Lf] (12)
2 实验部分
实验在公开数据集上进行训练以及测试,在本地猪只养殖场采集到的猪只图像数据集以及道路红外数据集上进行匹配。对猪只目标生长情况进行检测,根据双目相机内外参数,计算猪只体长、体宽、腹围等各项生长数据指标,以及为红外道路测距提供精准匹配结果,展示了模型在实际应用中的泛化能力。
2.1 实验设置
2.1.1 数据集 从公开的MegaDepth户外数据集中选取部分数据进行训练和测试。MegaDepth 数据集中的图像来自不同场景,涉及多个视角、背景和光照变化,MegaDepth 数据集包含了 196 个不同的户外场景图像,提供了来自 COLMAP 软件的稀疏重建数据和通过双目多视图计算得到的深度图。每次训练从数据集里随机抽取20个子数据集,共40 GB。使用训练好的模型,在猪只数据集上进行可视化实验比对。
在Hpatches数据集上进行单应性估计,Hpatches包含了52个照明条件变化的图片序列和56个视角变化的图片序列,每个序列包含1张参考图像和5张经过单应性变化后的图像以及对应的单应性矩阵。对于超出2 048像素的图像,统一调整至1 024像素。
2.1.2 实验环境 本实验基于Ubuntu系统, 软件平台为Pycharm,使用python编程语言以及pytorch2.4.1 + cu118开发库,在一张显存为12 GB的NVIDA GeForce RTX 4070显卡上训练。初始学习率设置为0.008, 权重衰减设置为0.1,使用多步学习衰减策略,每个数据批次设置为64,每次训练30轮。
2.2 结果与分析
2.2.1 相对位姿估计对比 先计算旋转和平移中最大角度误差,根据阈值计算不同的精确度和召回率,然后计算精确率-召回率曲线下面积(the area under the precision-recall curve,AUPRC)。AUPRC值越大表示模型在多种误差阈值下能够更好地估计位姿,具有更高的准确性和鲁棒性。
表1展示了不同模型的姿态估计结果。本地训练的LoFTR算法在5°、10°、20°位姿误差阈值下的姿态估计AUPRC值分别为36.3、51.9、64.7,改进后的算法在5°、10°、20°阈值下的姿态估计AUPRC值分别为37.1、53.1、66.0,相较于原算法的性能提升幅度逐渐增加,分别达到0.8、1.2和1.3,证明改进的算法具有更好的效果。
表1 不同位姿误差阈值下的姿态估计结果
Table 1 Pose estimation under different pose error
thresholds
[算法 不同位姿误差阈值下的姿态估计AUPRC 5° 10° 20° SP+SuperGlue
DRC-Net
LoFTR
MA-LoFTR 29.1
20.6
36.3
37.1 45.9
32.4
51.9
53.1 61.1
48.3
64.7
66.0 ]
2.2.2 消融实验 为验证MRC模块、AFW模块以及MAGSAC++算法的有效性,在MegaDepth子数据集上进行了消融实验。分别使用环形拼接卷积、自适应融合模块以及MAGSAC++算法,匹配效果均有不同程度的提升。
只使用MAGSAC++算法,在5°、10°和20°阈值下,姿态估计AUPRC值分别提升了0.2、0.1、0.1。只使用AFW,在10°和20°阈值下的姿态估计PR曲线的AUPRC值分别提升了0.1,只使用MRC,在5°、10°和20°阈值下,分别提升了0.2、0.3、0.5。同时使用3个模块时,效果达到最优,说明了相比于原特征,强化后的特征具有更好的效果,提高了网络的匹配表现,且MAGSAC++算法也成功筛选出了部分依旧存在的噪声。实验结果见表2。
由消融实验结果可知,MRC配合AFW使用时,效果达到最优,单独使用时提升效果有限,说明重构后的特征对原特征进行了有效的补充,表明了AFW模块的有效性。加入MAGSAC++算法后有一定的提升效果,说明MAGSAC++算法有效筛除了仍存在的部分错误匹配。
2.2.3 损失下降与匹配率 在训练过程中,MA-LoFTR算法的损失下降速度快于LoFTR,在相同的训练条件下,随着训练的进行,MA-LoFTR的平均损失曲线始终位于原LoFTR算法的下方,说明改进后的算法,损失下降得更快。不同算法损失变化曲线如图5所示。
<G:\武汉工程大学\2026\第3期\陈礼航-5.tif>[0 4 8 12 16 20 24
迭代次数 / 轮][2.0
1.6
1.2
0.8
0.4][LoFTR
MA-LoFTR]
图5 不同算法损失变化曲线
Fig. 5 Loss variation curves of different algorithms
本文以室外MegaDepth数据集作为验证集,计算SP+SuperGlue、DRC-Net、LoFTR、MA-LoFTR的平均匹配率,分别为80.32%、53.42%、85.84%和87.62%,说明了MA-LoFTR算法具有更好的匹配效果。
LoFTR的可训练参数为11.6 MB,MA-LoFTR可训练参数量增加了6.3 MB,为17.9 MB。图像对的平均推理时间由260 ms增加至290 ms,增加了30 ms,MA-LoFTR在实现性能显著提升的同时,其内存占用与时间开销依然保持在原水平。
2.2.4 单应性估计对比 通过使用模型预测的匹配点对估计单应性矩阵,对图片进行单应性变换,将目标图像重投影至源图像,与真实单应性矩阵变换的图像比较,进行单应性估计对比。表3为在Hpatches数据集上,3 px、5 px、10 px像素误差阈值下的关键点误差累积分布函数曲线下面积(area under the cumulative distribution function curve,AUCDFC)。
表3 不同像素误差阈值下的平均单应性估计结果
Table 3 Results of homography estimation under different pixel error thresholds
[算法 单应性估计AUCDFC 3 px 5 px 10 px SP+SuperGlue
DRC-Net
LoFTR
Efficient LoFTR
MA-LoFTR 45.3
43.1
56.7
58.7
58.9 61.7
52.4
74.6
76.2
76.1 78.1
64.2
85.4
86.5
86.9 ]
采用在MegaDepth数据集上训练的模型来提取匹配点集,并估计单应性矩阵H。在Haptches数据集上的单应性估计结果均有不同程度的提升,说明增强后的特征具有更好的匹配效果,估计的单应性矩阵能更好地表示图像对之间的变换关系。
表4为在不同视角变化程度以及不同阈值条件下,单应性估计AUCDFC值结果。相较于其他特征匹配算法,增强后的特征在各个阈值下的匹配表现均有不同程度的提升,同时匹配的点对数量明显增加,说明该算法在保证匹配精度的情况下,有效提升了匹配数量,证明了特征增强的有效性。
2.2.5 可视化对比 在本地猪只数据集和红外道路数据集上进行可视化分析,结果分别如图6和图7所示。通过可视化对比可以明显观察到,改进后的算法匹配到的正确点对数量以及密度明显增加,在LoFTR没有捕捉到点对的空白区域,捕捉到了一定数量的正确点对。
3 结 论
为提高特征描述的质量,对模型特征进行重构,使得特征具有更好的描述效果,对匹配结果进行优化筛选,提高最终匹配效果。通过对LoFTR算法进行改进,提出了MA-LoFTR。使用MRC对初步提取的特征进行计算,得到不同尺度下的环形特征并进行主方向对齐,将对齐主方向的环状特征进行数值区间的尺度统一,按照环形卷积核的尺度由小到大,在通道维度上进行拼接,对拼接的环形卷积特征,与引入了全局位置信息的特征使用AFW进行融合,平衡最终特征在全局位置与局部小范围纹理的权重,提取的特征对齐了原本的方向,同时可以观察到全局的位置信息。进行位姿估计、消融实验、单应性估计对比,并进行可视化分析,在猪只匹配以及道路匹配得到了更多的点对,有效提高了猪只目标以及道路目标测量精度,表明了本文设计的有效性,证明了改进后的算法所提取到的特征具有更好的描述效果,为增强特征描述优化匹配提供了新的方法,为猪只养殖等生产活动提供更精确的测量技术支持,有效解决了部分场景中匹配点对数过少的问题。