期刊: Pattern Recognition
时间: 2024年
代码:https://github.com/chanchanchan97/ICAFusion
在这里插入图片描述

1 摘要&&相关工作

1.1 摘要

多光谱图像的有效特征融合在多光谱目标检测中具有关键作用。现有研究虽已证明卷积神经网络在特征融合中的有效性,但这些方法因局部特征交互的固有缺陷,容易因图像错位导致性能下降。为解决这一问题,我们提出了一种新型双交叉注意力变换器框架,通过建模全局特征交互并同步捕获跨模态互补信息,显著提升了目标特征的区分度。该框架通过查询引导的交叉注意力机制增强特征增强效果,但堆叠多个变换器模块会导致参数量激增和空间复杂度升高。为此,我们借鉴人类知识梳理过程,提出迭代交互机制,通过模块化多模态变换器间的参数共享,有效降低了模型复杂度和计算成本。所提出的方法具有通用性和有效性,可以集成到不同的检测框架中,并与不同的骨干网络一起使用。

1.2相关工作

  • 基于卷积的特征融合技术
    开创性研究探索了多种基于卷积神经网络(CNN)的融合架构,并证明半融合策略能够带来理想的效果。张等人编码不同模态间的交互作用并自适应地融合特征。Zhang等引入辅助行人掩码以引导模态间与模态内的特征表示。Fu等人引入注意力模块,从空间和通道维度进行像素级特征融合。然而,基于卷积的特征融合仅关注局部特征信息,由于卷积神经网络(CNN)感受野的局限性,其难以建模长距离特征关系

1.3 贡献

综上所述,我们的主要贡献如下:

  • 针对多光谱目标检测问题,提出了一种新颖的双交叉注意力特征融合方法,该方法能够同时整合RGB图像与热成像图像的互补信息。
  • 提出一种专为高效的多光谱特征融合而设计迭代学习策略,可在不增加可学习参数的情况下进一步提升模型性能。
  • 所提出的特征融合方法兼具通用性和有效性,可适配不同骨干网络并支持多种检测框架。
  • 所提出的 CFE / ICFE 模块可以与不同的输入图像模态一起工作,当其中一种模态缺失或图像质量较差时,这提供了一个可行的解决方案。
  • 该方法在 KAIST 、 FLIR和 VEDAI数据集,上可以达到最先进的结果,同时获得非常快的推理速度。

2 模型构建

2.1 模型综述

模型架构图
如图所示,所提出的方法是一种双分支骨干网络,专门用于从RGB-热图像对中提取特征。我们的方法主要包含三个阶段:单模态特征提取、双模态特征融合以及检测颈部和头部。
单模态特征提取:
单模态特征提取首先分别用于RGB和热图像,这可以表述为等式:

F R i = Ψ b a c k b o n e ( I R ; θ R ) , F T i = Ψ b a c k b o n e ( I T ; θ T ) \bm{F}^{i}_{R} = \Psi_{backbone}(\bm{I}_{R};\bm{\theta}_{R}), \quad \bm{F}^{i}_{T} = \Psi_{backbone}(\bm{I}_{T};\bm{\theta}_{T}) FRi=Ψbackbone(IR;θR),FTi=Ψbackbone(IT;θT)
其中:

  • F R i \bm{F}^{i}_{R} FRi F T i \bm{F}^{i}_{T} FTi分别表示RGB分支和热分支第i层(i=3,4,5)的特征图
  • Ψ b a c k b o n e \Psi_{backbone} Ψbackbone特征提取函数, θ R \bm{\theta}_{R} θR θ T \bm{\theta}_{T} θT分别分别对应RGB分支和热成像分支参数。在通用目标检测中,VGG、ResNet 和CSPDarkNet是常用的 Ψ b a c k b o n e \Psi_{backbone} Ψbackbone骨干网络。在特征提取阶段,通常利用多尺度特征来捕捉不同尺寸的目标。
  • I R \bm{I}_{R} IR I T \bm{I}_{T} IT是输入的RGB和热图像
    双模态特征融合:
    给定 F R i \bm{F}^{i}_{R} FRi F T i \bm{F}^{i}_{T} FTi的特征图,需要进行跨模态特征融合以聚合多光谱目标检测中不同分支的特征,这可以在以下等式中定义:
    F R + T i = Φ f u s i o n ( F R i ; F T i ; θ f ) \bm{F}_{R+T}^{i} = \Phi_{fusion}(\bm{F}_{R}^{i};\bm{F}_{T}^{i};\bm{\theta}_{\bm{f}}) FR+Ti=Φfusion(FRi;FTi;θf)
    其中:
  • F R i \bm{F}^{i}_{R} FRi F T i \bm{F}^{i}_{T} FTi表示第i层的RGB和热成像特征。
  • F R + T i \bm{F}_{R+T}^{i} FR+Ti表示第 i i i层的融合特征
  • Φ f u s i o n \Phi_{fusion} Φfusion表示参数为 θ f \bm{\theta}_{\bm{f}} θf的特征融合函数。鉴于先前研究,已探索了不同融合架构并验证了中段融合优于其他融合方法,我们采用中段融合作为默认设置,如图 所示,将卷积层C3~C5的多模态特征进行融合。通常,加法运算或NIN融合被用作特征融合函数 Φ f u s i o n \Phi_{fusion} Φfusion。本文提出一种双交叉注意力特征融合变换器来建模 Φ f u s i o n \Phi_{fusion} Φfusion
    检测颈部和头部:
    多尺度融合特征 { F R + T i } i = 1 L \{\bm{F}_{R+T}^{i}\}_{i=1}^{L} {FR+Ti}i=1L传递到检测器头部进行后续分类和回归,该过程由等式 给出
    [ D c l s , D b b o x ] = ϕ h e a d ( ϕ n e c k ( { F R + T i } i = 1 L ) ; θ h ) [\bm{D}_{cls},\bm{D}_{bbox}] = \phi_{head}(\phi_{neck}(\{\bm{F}_{R+T}^{i}\}_{i=1}^{L});\bm{\theta}_{\bm{h}}) [Dcls,Dbbox]=ϕhead(ϕneck({FR+Ti}i=1L);θh)
    其中
  • ϕ n e c k \phi_{neck} ϕneck ϕ h e a d \phi_{head} ϕhead代表多尺度特征聚合和检测头功能,FPN和PA Net是常用的函数, ϕ n e c k \phi_{neck} ϕneck以增强特征的语义表达和定位能力,其中 ϕ h e a d \phi_{head} ϕhead通过参数 θ h \bm{\theta}_{\bm{h}} θh执行分类和边界框回归任务,例如YOLO的检测头和FCOS。为确保公平性,我们沿用了原论文中检测颈部和头部的默认配置。

2.2 双模态特征融合(DMFF)

图展示了我们的双模态特征融合(DMFF)模块的结构,主要包含三个组件:空间特征收缩(SFS)模块、迭代跨模态特征增强(ICFE)模块以及具有NIN融合的双模态特征融合模块。
在这里插入图片描述

2.2.1 空间特征收缩(SFS)

尽管融合过程中使用的初始特征图通过主干网络进行了降采样,但模型的参数和内存开销仍然可能远超标准处理器的运行需求。为了降低我们模块后续的计算成本,同时减少特征图中的信息损失,我们在 CFE 模块前应用了一个SFS 模块来压缩特征图。在这个模块中,我们尝试了两种不同的方法,包括卷积和池化操作,具体细节如下:
卷积运算我们首先设计了一种基于卷积运算的降维方法,如公式所示。具体来说,我们通过重塑特征图的维度,将特征的空间信息转换为通道维度,然后使用1 × 1卷积运算来压缩通道维度。
F c o n v = c o n v 1 × 1 ( R e s h a p e ( F ) ) \mathbf{F}_{conv} = conv_{1\times 1}(Reshape(\mathbf{F})) Fconv=conv1×1(Reshape(F))
其中F表示输入特征图,Fconv表示通过1 × 1卷积得到的压缩特征图。
池化操作:
均值池化和最大池化是两种传统池化方法,通常用于在不增加额外参数的情况下降低特征图的空间维度。均值池化计算池化区域内所有元素的平均值,保留图像中的背景信息;而最大池化则考虑池化区域内最大元素,主要保留物体的纹理特征。因此,我们采用了一种自适应融合均值池化和最大池化的混合池化方法 ,如等式所示。
F a = AvgPooling ( F , S ) , F m = MaxPooling ( F , S ) \mathbf{F_a} = \text{AvgPooling}(\mathbf{F}, S), \quad\mathbf{F_m} = \text{MaxPooling}(\mathbf{F}, S) Fa=AvgPooling(F,S),Fm=MaxPooling(F,S)
F o = λ ⋅ F a + ( 1 − λ ) ⋅ F m \mathbf{F_o} = \lambda \cdot \mathbf{F_a} + (1 - \lambda) \cdot \mathbf{F_m} Fo=λFa+(1λ)Fm
其中F表示输入特征图,S表示特征图缩放因子, F a \mathbf{F_a} Fa F m \mathbf{F_m} Fm分别表示通过平均池化和最大池化得到的压缩特征图,λ 表示0到1之间的权重,是本文中可学习的参数。与原始特征图的维度H×W×C相比,压缩后的特征图维度变为(H×W)/S×C,使得标记维度从HW×C降至HW/S×C。因此, CFE 模块中的键、查询和值
维度分别调整为K、Q、V∈ HW/S×C。

2.2.2 跨模态特征增强(CFE)

输入:RGB特征图 F R \mathbf{F}_R FR 和热成像特征图 F T \mathbf{F}_T FT,维度均为 H × W × C H \times W \times C H×W×C

操作

  • 将每个特征图展平为标记序列: T R , T T ∈ R H W × C \mathbf{T}_R, \mathbf{T}_T \in \mathbb{R}^{HW \times C} TR,TTRHW×C
  • 添加可学习的位置嵌入(维度不变)

维度变化 ( H , W , C ) → ( H W , C ) (H,W,C) \rightarrow (HW,C) (H,W,C)(HW,C)


投影操作

  • 热成像标记 T T \mathbf{T}_T TT 投影为值 V T \mathbf{V}_T VT 和键 K T \mathbf{K}_T KT
    V T = T T W V , K T = T T W K \mathbf{V}_T = \mathbf{T}_T \mathbf{W}^V, \quad \mathbf{K}_T = \mathbf{T}_T \mathbf{W}^K VT=TTWV,KT=TTWK
  • RGB标记 T R \mathbf{T}_R TR 投影为查询 Q R \mathbf{Q}_R QR
    Q R = T R W Q \mathbf{Q}_R = \mathbf{T}_R \mathbf{W}^Q QR=TRWQ
    其中 W V , W K , W Q ∈ R C × C \mathbf{W}^V, \mathbf{W}^K, \mathbf{W}^Q \in \mathbb{R}^{C \times C} WV,WK,WQRC×C

维度变化:保持 ( H W , C ) (HW,C) (HW,C)


注意力计算操作

  1. 计算相关性矩阵: A = softmax ( Q R K T T D K ) \mathbf{A} = \text{softmax}\left( \frac{\mathbf{Q}_R \mathbf{K}_T^T}{\sqrt{D_K}} \right) A=softmax(DK QRKTT)

    • 维度变化: A ∈ R H W × H W \mathbf{A} \in \mathbb{R}^{HW \times HW} ARHW×HW
  2. 加权融合: Z T = A ⋅ V T \mathbf{Z}_T = \mathbf{A} \cdot \mathbf{V}_T ZT=AVT

    • 维度变化: Z T ∈ R H W × C \mathbf{Z}_T \in \mathbb{R}^{HW \times C} ZTRHW×C

交叉注意力操作
T T ′ = α ⋅ ( Z T W O ) + β ⋅ T T \mathbf{T}_T' = \alpha \cdot (\mathbf{Z}_T \mathbf{W}^O) + \beta \cdot \mathbf{T}_T TT=α(ZTWO)+βTT
其中:

  • W O ∈ R C × C \mathbf{W}^O \in \mathbb{R}^{C \times C} WORC×C为输出权重矩阵
  • α , β \alpha, \beta α,β 为可学习残差系数(初始为1)

维度变化:保持 ((HW,C))


前馈网络(FFN)细化

前馈网络(FFN)细化操作

  1. 通过两层全连接网络:
    FFN ( T T ′ ) = FC 2 ( ReLU ( FC 1 ( T T ′ ) ) ) \text{FFN}(\mathbf{T}_T') = \text{FC}_2(\text{ReLU}(\text{FC}_1(\mathbf{T}_T'))) FFN(TT)=FC2(ReLU(FC1(TT)))
    内部维度: C → 4 C → C C \rightarrow 4C \rightarrow C C4CC

  2. 残差融合:
    T ^ T = γ ⋅ T T ′ + δ ⋅ FFN ( T T ′ ) \hat{\mathbf{T}}_T = \gamma \cdot \mathbf{T}_T' + \delta \cdot \text{FFN}(\mathbf{T}_T') T^T=γTT+δFFN(TT)
    其中 γ , δ \gamma, \delta γ,δ 为可学习系数

维度变化:保持 ( H W , C ) (HW,C) (HW,C)

输出

  • 增强后的热成像特征: T ^ T ∈ R H W × C \hat{\mathbf{T}}_T \in \mathbb{R}^{HW \times C} T^TRHW×C
  • 增强后的RGB特征: T ^ R ∈ R H W × C \hat{\mathbf{T}}_R \in \mathbb{R}^{HW \times C} T^RRHW×C(通过对称操作获得)

可选项:将输出重新整形为空间特征图: ( H W , C ) → ( H , W , C ) (HW,C) \rightarrow (H,W,C) (HW,C)(H,W,C)

2.2.3 迭代跨模态特征增强(ICFE)

为了增强跨模态和内模态特征互补信息的记忆,从而进一步提升模型性能,我们引入了一种基于 CFE 模块的迭代学习策略,称为 ICFE 模块。如图所示,
在这里插入图片描述

传统方法通常通过堆叠多个模块来提高性能,但这种大幅增加模型深度的策略不仅会显著增加参数量,还可能导致过拟合。相反,我们提出的迭代学习策略通过共享参数在多次迭代中加深网络深度,并逐步优化跨模态的互补信息,而无需增加参数数量,如图 (b)所示。以n次迭代为例,其简化表达式如下:
{ T ^ R n , T ^ T n } = F I C F E ( { T R , T T } , n ) = F C F E ( ⋯ F C F E ( { T R , T T } ) ) ⏟ n \{\hat{\bm{T}}_{R}^{n},\hat{\bm{T}}_{T}^{n}\} = \mathcal{F}_{ICFE}(\{\bm{T}_{R},\bm{T}_{T}\}, n) = \underbrace{\mathcal{F}_{CFE}(\cdots\mathcal{F}_{CFE}(\{\bm{T}_{R},\bm{T}_{T}\}))}_{n} {T^Rn,T^Tn}=FICFE({TR,TT},n)=n FCFE(FCFE({TR,TT}))
其中 T ^ R n , T ^ T n {\hat{\bm{T}}_{R}^{n},\hat{\bm{T}}_{T}^{n}} T^Rn,T^Tn表示经过n次迭代运算后的输出序列, { T R , T T } \{\bm{T}_{R},\bm{T}_{T}\} {TR,TT}表示ICFE 模块的输入序列。 F I C F E \mathcal{F}_{ICFE} FICFE表示我们提出的 ICFE 模块,该模块分别整合了RGB分支和热分支的两个 CFE 模块。每次迭代运算的输出将作为下一次迭代的输入,且各次迭代之间共享参数。此外, ICFE 模块输出的序列 T ^ R n , T ^ T n {\hat{\bm{T}}_{R}^{n},\hat{\bm{T}}_{T}^{n}} T^Rn,T^Tn需先转换为特征图,再通过双线性插值校准至原始特征图尺寸。

2.2.4 探测头的融合模式

图展示了我们提出的 CFE 模块如何与不同输入模态协同工作。如图5所示,我们通过四种融合模式验证了 CFE 模块的有效性。在图5(a)和(b)中,系统仅输出单一模态特征,这迫使 CFE -R和 CFE -T模块分别从热成像与RGB图像特征中提取互补信息。此外,我们还探索了双 CFE 模块的两种工作模式——共享参数与非共享参数,如图5©和(d)所示。图5(e)则展示了采用NIN融合方法的基准特征融合方案。最终,所有融合后的特征图(Fi、Fi′、i={R,T,fused})将被输入检测头,如图5(f)所示。值得注意的是,我们的方法天然支持双模态和单模态图像输入。得益于交叉注意力机制,即使某个输入模态缺失或图像质量较差,该方法仍能输出令人满意的结果。
在这里插入图片描述

2.2.5 fusion

核心功能:NIN(Network In Network)Fusion 是论文中作为基线(Baseline)的双模态特征融合方法。它通过简单的拼接(Concatenation)和 1x1 卷积操作,实现RGB与热成像(Thermal)特征的局部融合。

  • RGB分支特征图: F R ∈ R H × W × C \mathbf{F}_R \in \mathbb{R}^{H \times W \times C} FRRH×W×C
  • 热成像分支特征图: F T ∈ R H × W × C \mathbf{F}_T \in \mathbb{R}^{H \times W \times C} FTRH×W×C

前提:两个特征图在空间尺寸 H , W H, W H,W 和通道数 C C C上一致。

  1. 特征拼接
    沿通道维度拼接两个特征图:
    F c a t = [ F R , F T ] \mathbf{F}_{cat} = [\mathbf{F}_R, \mathbf{F}_T] Fcat=[FR,FT]

    维度变化
    ( H , W , C ) + ( H , W , C ) → ( H , W , 2 C ) (H, W, C) + (H, W, C) \rightarrow (H, W, 2C) (H,W,C)+(H,W,C)(H,W,2C)

  2. 1x1 卷积融合
    使用一个 1 × 1 1 \times 1 1×1 的卷积核作用于拼接后的特征图,将通道数融合并映射回原始维度:
    F f u s e d = conv 1 × 1 ( F c a t ) \mathbf{F}_{fused} = \text{conv}_{1\times1}(\mathbf{F}_{cat}) Ffused=conv1×1(Fcat)
    其中,$\text{conv}_{1\times1}$的输入通道为 2 C 2C 2C,输出通道为 C C C

    维度变化
    ( H , W , 2 C ) → ( H , W , C ) (H, W, 2C) \rightarrow (H, W, C) (H,W,2C)(H,W,C)

输出特征

  • 融合后的特征图: F f u s e d ∈ R H × W × C \mathbf{F}_{fused} \in \mathbb{R}^{H \times W \times C} FfusedRH×W×C

统一公式
论文(第9页脚注1)将整个NIN Fusion过程定义为特征融合函数 Φ f u s i o n ( ⋅ ) \Phi_{fusion}(\cdot) Φfusion()
Φ f u s i o n = conv 1 × 1 ( [ F R , F T ] ) \Phi_{fusion} = \text{conv}_{1\times1}([\mathbf{F}_R, \mathbf{F}_T]) Φfusion=conv1×1([FR,FT])
该函数输出即为 F f u s e d \mathbf{F}_{fused} Ffused

3 实验

3.1 数据集与评估指标

KAIST 数据集
KAIST[12]是多光谱行人检测领域的经典基准数据集,包含多种光照条件下的场景。该数据集包含8,963对弱对齐图像(训练集分辨率×640)和2,252对弱对齐图像(测试集[15])。 KAIST 数据集的性能评估通常采
用对数平均漏检率(log-AMMR)这一指标[42]。为确保标注精度,我们采用经过清洗处理的标注数据进行训练[20]和测试[5]。
FLIR 数据集
FLIR[13]是一个包含日间与夜间场景的多光谱目标检测挑战性数据集。该数据集包含5,142对对齐的多光谱图像,其中4,129对用于训练,1,013对用于测试。数据集包含三类目标,即“人”、“汽车”和“自行车”。由于原始数据集中的图像存在错位问题,我们在实验中选取了 FLIR 对齐版本[16]进行对比分析。
VEDAI 数据集
VEDAI[14]是航空影像小目标检测的公开数据集,包含1268组RGB-红外图像对中的3700余个标注目标。该数据集涵盖9类车辆类型。我们采用1024 × 1024分辨率的图像进行训练和测试,并将标注格式转换为水平
框格式,以[43]作为参考标准,因为原始标注采用的是四角坐标旋转框格式。
对数平均漏报率
对数平均漏报率(Mr−2)[42]用于 KAIST 数据集的评估,表示在对数区间[10−2,1]内均匀采样的9个 FPPI 值下的平均漏报率,Mr−2值越低,性能越好。
平均精度(AP是物体检测中常用的评估指标。正负样本的划分需根据分类正确率和交并比(IoU)阈值来确定,通常采用0.5作为IoU阈值。总体而言,平均精度指标能够有效反映模型的检测性能。

3.2 实施细节

本研究采用PyTorch 1.7.1框架在Ubuntu 18.04服务器上实现,该服务器配置为i7-9700处理器、64GB内存及Nvidia RTX 3090 24GB显卡。训练阶段设置60个周期,批量大小为8。使用随机梯度下降(SGD)优化器,初始学习率×10⁻²,动量值为0.937,权重衰减因子设为0.0005,学习率衰减采用余弦退火法。训练集图像尺寸为640 × 640,测试集为640 × 512,数据增强采用图像拼接和随机翻转技术。损失函数沿用YOLOv5和原始论文中 FCOS 检测器的设置。消融实验中,以YOLOv5结合NIN融合 ]作为默认基线进行对比。

3.3 消融实验

3.3.1可学习参数在残差连接中的应用

鉴于Shen等人的研究已经证明在两个分支上应用学习参数比在单个分支上稍好,我们评估了在残差连接的两个分支上应用可学习参数在我们提出的CFE 模块中的有效性。实验结果见表 。与没有可学习参数的 CFE 模块相比,在两个分支上添加可学习参数将 KAIST 数据集上的Mr从7.86%降低到7.63%,并将 FLIR 数据集上的mAP50从77.1%提高到77.5%。因此,在残差连接的两个分支上应用可学习参数可以有效提升性能,而不会显著增加我们 CFE 模块中的计算成本。
在这里插入图片描述

3.3.2 CFE 模块对单模态和双模态的影响

在表3中给出了在 KAIST 和 FLIR 数据集上单模态 CFE 模块的实验结果,该结果分为三组根据输出模式的不同。在第一组(第一行)中,我们应用 CFE 模块来增强RGB特征,利用热图像中的补偿信息,并仅输出增强后的RGB特征用于后续检测,如图 (a)所示。我们的双分支方法结合 CFE 模块在 KAIST 和 FLIR 数据集上的表现分别比仅使用RGB的单分支方法提高了0.65%和0.90%。同样地,在第二组(第二行)中,图 (b)中使用 CFE 模块增强的热特征在 KAIST 和 FLIR 数据集上的表现分别比仅使用热特征的检测器提高了0.59%和1.20%。表 的前两行表明,在 KAIST 数据集上RGB特征的质量优于热特征,而在 FLIR 数据集上热特征的质量优于RGB特征。这可能是由于数据集的特性、相机模型和其他因素造成的。因此,双 CFE 模块应用于RGB和热分支,以收集彼此的互补信息,并利用增强的RGB和热模态融合特征进行后续检测(最后一组,最后一行),在KAIST 和 FLIR 数据集上分别比基线方法提高了0.70%和1.00%。上述实验结果表明,我们提出的 CFE 模块有效促进了基于RGB和热的全局特征融合。
在这里插入图片描述

3.3.3 堆叠模块数量的影响

在本节中,我们提供了 FLIR 数据集上不同数量堆叠 CFE 模块的mAP值。表4显示,随着堆叠数量的增加当模块数量增至10时,参数量和GPU内存消耗增加四倍以上 ,运行频率却从40.5赫兹骤降至17.3赫兹,平均精度(mAP)仅获得0.70%的微小提升。 ,]先前研究发现,视觉变换器相邻层的注意力图呈现高度相似性。如图(右)所示,通过可视化不同堆叠层数的特征图,我们在实验中也观察到这一现象。我们认为特征图的高度相似性会导致性能提升幅度有限,因此串联堆叠模块并非实现特征融合的有效方案。
在这里插入图片描述

3.3.4 不同迭代次数的影响

表5中展示了在 KAIST 和 FLIR 数据集上不同迭代次数的实验结果。仅进行一次迭代时,迭代学习方法将 KAIST 数据集上的 Mr 从 7.63% 降低到 7.17%,并将 FLIR 数据集上的 mAP50 从 77.50% 提高到 79.20%。有趣的是,我们发现额外的迭代次数并不会提升性能,在我们的实验中,一次迭代就能达到最佳效果。如图6(中间)所示,我们还可视化了 ICFE 模块的特征图。随着迭代次数的增加,我们发现不同模态特征之间的相互作用产生了负面影响,而背景信息逐渐增强。我们认为,背景噪声干扰的增强可能导致性能下降。此外,由于迭代学习技术使用共享参数,更多的迭代不会带来额外的参数或内存开销。通过对比表4和表5的实验结果可知,交互式学习在跨模态特征交互方面效果更佳,且优于堆叠方法。此外,本方法的推理速度达到36.7帧/秒,较堆叠方法快得多。
在这里插入图片描述

3.3.5 不同空间特征压缩方法的效果

我们评估了多种现有方法,以寻找一种在特征信息损失较少的情况下可靠的降采样方法,表6显示了各苏尔特的结果。与其他下采样方法相比,混合池化产生了最佳结果,在 KAIST 和 FLIR 数据集上分别达到了7.17%的平均精度和79.20%的mAP50。因此,本文采用混合池化来压缩特征图并降低计算复杂度。
在这里插入图片描述

3.3.6 不同投入方式的探讨

在本节中,我们还进行了四组实验以验证使用不同输入模态进行 CFE 的有效性,实验结果如表 所示。第一组(第1-2行)展示了YOLOv5检测器在 KAIST 和 FLIR 数据集上使用单一输入图像模态(RGB或热成像)的实验结果。第二组(第3-5行)提供了YOLOv5+NIN方法在一种或两种输入图像模态(RGB或RGB+热成像)下的结果。可以明显观察到,YOLOv5+NIN方法在两种不同输入模态下的表现(第3行)远优于YOLOv5方法(第1和2行)。然而,YOLOv5+NIN方法会带来较大的使用相同的两种模态(第4行)作为输入时性能下降。此外,我们在第三组(第6~9行)中也进行了实验,使用我们提出的方法(YOLOv5+ ICFE)。令人惊讶的是,使用相同的两种模态图像仍能与同时使用RGB和热图像的结果相媲美。这表明我们的方法可以为后续检测阶段提供具有区分性的单模态特征,尽管如第7行和第9行所示,在 KAIST 和 FLIR 数据集上性能略有下降。这对于输入模态缺失或图像质量较差的情况是有益的。在最后一组(第10-12行),我们还观察到由于在双 CFE 模块输出中添加了NIN模块,我们提出的方法
YOLOv5+ ICFE +NIN)的检测性能显著下降。从第45行和第1112行的观察可以看出,当只有一个输入模态可用时,NIN对YOLOv5+NIN和我们提出的方法都有负面影响。
在这里插入图片描述

3.3.7 与不同骨架和头部的比较

为了评估我们提出的 DMFF 模块的有效性和通用性,我们首先在YOLOv5检测器上进行了实验,使用了三种不同的后置:VGG16、ResNet50和CSPDarkNet53。如表所示。8,在 KAIST 数据集上的结果显示,我们的方法在VGG16、ResNet50和CSPDarknet53上分别比基线方法提高了0.66%、0.97%和1.16%。在 FLIR数据集上的结果表明,我们的方法在VGG16、ResNet50和CSPDarknet53上分别比基线方法提高了0.50%、1.50%和2.70%。因此,我们得出结论,所提出的 DMFF 模块适用于多种骨干网络,并且在不同的评估指标下都有效。8我们还在 FCOS 检测器上进行了评估,以进一步检验所提出的 DMFF 模块的有效性和通用性。实验结果见表 。与基线方法相比,使用 DMFF 模块的FCOS 在 KAIST 数据集上的Mr从14.03%降至12.96%,增益为1.07%;在 FLIR数据集上,mAP50从69.80%提升至71.70%,增益为1.90%。上述结果表明,我们提出的 DMFF 模块在锚基和无锚检测器中均表现良好。最后,可以明显看出,YOLOv5检测器结合CSPDarknet53骨干网络,在参数数量适中时,与其他骨干网络和检测器相比,取得了最佳性能。
在这里插入图片描述

3.3.8 与最新方法的比较

KAIST 数据集。表 9展示了本方法与现有方法在 KAIST 数据集上的对比结果。可以看出,在合理设置下,我们的方法超越了大多数现有最先进方法,并在白天子集上取得了最低漏检率。此外,表 还显示,本方法在 RTX 3090平台上运行频率为38.46赫兹。因此,该方法特别适用于对检测速度要求较高的目标检测场景。
在这里插入图片描述

FLIR 数据集。表10展示了本方法与现有方法在 FLIR 数据集上的对比结果。可以明显看出,我们的方法在所有指标上均优于现有方法,达到了当前最先进的性能水平。具体而言,本方法在mAP50、mAP75和mAP指标上分别达到79.20%、36.9%和41.4%。此外,在自行车、汽车和人物类别中,本方法分别取得66.90%、89.00%和81.60%的准确率。为确保公平比较,我们还使用了采用本方法模块(Ours*)的 CFT 基线模型。从所有mAP50、mAP75和mAP指标来看,本方法在各项性能上均优于Ours*。
在这里插入图片描述

VEDAI 数据集。表11中展示了在 VEDAI 数据集上的实验对比结果。尽管我们未采用小目标检测的特殊技术,但本方法在平均精度(mAP)上仍比基线方法提升1.96%,在现有方法中以76.62%的mAP表现优异。不过在更严格的平均精度评估指标下,本方法相较于输入融合法和中间融合法分别下降了0.28%和1.37%。
在这里插入图片描述

4 结论

在本文中,我们提出了一种新的跨模态特征融合框架用于多光谱目标检测,该框架解决了现有方法主要关注不同模态间局部特征相关性的问题。具体而言,我们提出了跨模态特征增强模块,通过利用互补模态的全局信息来增强单模态的特征表示。此外,我们引入了迭代学习策略来优化互补信息,从而在不增加额外参数的情况下提高模型性能。在检测精度和运行速度方面,我们的方法在 KAIST 、 FLIR 和 VEDAI 数据集上优于其他最先进方法。未来,我们计划进一步探索高效轻量级的跨模态特征融合框架,并将我们的方法扩展到其
他多模态任务。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐