PinwheelConv风车状卷积:用于红外小目标检测

博客 包括 PinwheelConv风车状卷积论文 - 论文解析部分

文章末尾部分 包含 YOLO11、YOLOv8、YOLOv10、RT-DETR、YOLOv7、YOLOv5 等模型 结合+ PinwheelConv 风车状卷积 原创改进核心内容


该论文提出了一种Pinwheel-shaped Conv风车状卷积和基于尺度的动态损失用于 红外小目标检测。
在这里插入图片描述

论文信息:Pinwheel-shaped Convolution and Scale-based Dynamic Loss for Infrared Small Target Detection
论文链接:https://arxiv.org/abs/2412.16986v1
请添加图片描述

本文提出了一种即插即用的 PinwheelConv风车状卷积,利用IRST的高斯分布特征,以最小的参数实现了高效、更大的感受野。还引入了一种简单而有效的SD损失函数,解决了标签的IoU波动问题。通过与现有卷积模块和损失函数的广泛比较,本文方法始终优于最先进的方法,展示了卓越的准确性和鲁棒性。在多个模型上验证了该方法的有效性和强大的泛化能力,凸显了其在推进IRSTDS领域的潜力。此外,还引入了SIRST - UAVB数据集,这是一个大规模且具有挑战性的基准数据集,带有详细注释。


1. PinwheelConv论文理论部分解析


一、研究背景

红外小目标检测与分割(IRSTDS)在军事和民用领域有着广泛应用,如飞机和鸟类预警系统、导弹制导系统以及海上救援行动等。由于需要中远程目标观测,目标成像往往较小,且随着距离增加,红外辐射减弱,目标呈现出暗淡、信噪比(SNR)和信杂比(SCR)低、缺乏纹理信息的特点。此外,不同距离会改变目标大小和形状,复杂背景如建筑物、云层或植被等也会进一步遮挡目标。

IRSTDS技术主要分为模型驱动的传统方法和数据驱动的深度学习方法。传统方法需要基于先验知识手动调整参数,对IRSTDS中多样复杂的场景适应性较差,鲁棒性不佳。而基于深度学习的数据驱动方法,利用大量多样的IRSTDS数据,通过损失函数的梯度下降自动更新参数,表现出更强的鲁棒性。基于卷积神经网络(CNN)的IRSTDS方法主要分为基于检测和基于分割的方法,目前大多数研究通过新颖的网络架构来改进IRSTDS,而本文则从卷积模块本身入手提升性能。

通过对红外小目标(IRST)的3D灰度分布分析发现其具有高斯特征,因此提出一种新的即插即用的风车状卷积(PConv)模块,该模块更符合IRST的成像特征,相比标准卷积(Conv),能增强底层特征提取并扩大感受野。同时,由于IRST的弱小特性和手动标注的主观性,边界框(BBox)和掩模标签都存在显著的交并比(IoU)波动误差。现有的基于IoU的损失函数,如距离IoU(DIoU)损失、完全IoU(CIoU)损失以及尺度和位置敏感(SLS)损失等,虽在IoU损失基础上强调了位置信息,但都忽略了IoU波动以及不同目标大小对尺度和位置的不同敏感性。为解决这些问题,本文引入基于目标大小的尺度(S)和位置(L)损失系数的动态调整机制,并将其集成到DIoU和SLS损失中,以提高深度学习方法在不同目标尺度上的回归性能和检测性能。此外,现有的真实拍摄IRSTDS数据集存在小目标比例低、背景简单、数据规模小等问题,阻碍了检测器在复杂现实场景中的性能提升,因此本文开发了一个新的单帧IRSTDS数据集SIRST - UAVB。

在这里插入图片描述

二、相关工作

2.1 IRST检测和分割网络

数据驱动的深度学习方法已成为主流,许多基于CNN的IRST检测和分割网络被提出。在IRST检测方面,Dai等人提出了单阶段级联精炼网络OSCAR,Yang等人引入了EFLNet来解决目标 - 背景不平衡问题。在IRST分割方面,ACM模块将低级细节嵌入到高级特征中,DNANet通过融合利用上下文信息,Liu等人设计的MSHNet为U - Net配备了多尺度头部。然而,这些基于CNN的网络都侧重于构建特征提取网络,忽视了通过卷积模块提升IRSTDS性能的潜力。虽然ISNet结合了可变形卷积提高了性能,但增加了训练时间和网络参数。本文旨在通过引入更符合IRST高斯分布的卷积模块来增强模型提取底层特征的能力。

2.2 IRSTDS的损失函数

损失函数指导模型最小化预测标签与真实标签之间的差异,直接影响深度学习模型的性能。基于BBox的损失函数,如广义IoU(GIoU)和CIoU,结合了重叠区域、中心点距离和纵横比来提高模型收敛性和准确性,但CIoU没有考虑IoU波动误差和小尺度目标(尤其是弱小目标)的敏感性。归一化高斯瓦瑟斯坦距离(NWD)和尺度自适应适应度(SAFit)虽然解决了一些问题,但依赖指数运算,引入了复杂性和不稳定性。基于掩模的IoU损失和Dice损失没有考虑目标尺度和位置信息,Liu等人提出的SLS损失也忽略了不同尺度目标在掩模标注下IoU和中心点位置的不同贡献,限制了模型性能。本文提出基于尺度的动态(SD)损失,根据目标大小改变尺度损失(SLoss)和位置损失(LLoss)的影响,减少IoU波动,稳定提升性能。

2.3 IRSTDS的数据集

现有的IRSTDS数据集在大小、多样性和检测难度方面存在限制,阻碍了研究进展。如SIRST包含高质量图像但缺乏复杂性,只有427张图像;IRSTD - 1K提供了更高质量的图像,但小目标较少,挑战简单;NUDT - SIRST生成的是模拟目标,限制了其在现实场景中的适用性。因此,本文开发了SIRST - UAVB数据集,这是目前最大的公开可用数据集,包含弱目标、复杂背景和具有挑战性的单帧IRSTDS数据。

三、核心工作

在这里插入图片描述

3.1 风车状卷积(PConv)

PConv模块的架构如图3所示,与标准卷积不同,它使用非对称填充为图像的不同区域创建水平和垂直卷积核,卷积核向外扩散。设输入张量 X ( h 1 , w 1 , c 1 ) X^{(h_{1}, w_{1}, c_{1})} X(h1,w1,c1),其中 h 1 h_{1} h1 w 1 w_{1} w1 c 1 c_{1} c1分别表示其高度、宽度和通道大小。为增强训练稳定性和速度,在每次卷积后应用批归一化(BN)和sigmoid线性单元(SiLU)。

PConv的第一层进行并行卷积,计算公式如下:
X 1 ( h ′ , w ′ , c ′ ) = S i L U ( B N ( X P ( 0 , 1 , 0 , 3 ) ( h 1 , w 1 , c 1 ) ⊗ W 1 ( 1 , 3 , c ′ ) ) ) , X 2 ( h ′ , w ′ , c ′ ) = S i L U ( B N ( X P ( 0 , 3 , 0 , 1 ) ( h 1 , w 1 , c 1 ) ⊗ W 2 ( 3 , 1 , c ′ ) ) ) , X 3 ( h ′ , w ′ , c ′ ) = S i L U ( B N ( X P ( 0 , 1 , 3 , 0 ) ( h 1 , w 1 , c 1 ) ⊗ W 3 ( 1 , 3 , c ′ ) ) ) , X 4 ( h ′ , w ′ , c ′ ) = S i L U ( B N ( X P ( 3 , 0 , 1 , 0 ) ( h 1 , w 1 , c 1 ) ⊗ W 4 ( 3 , 1 , c ′ ) ) ) . \begin{align*} &X_{1}^{(h', w', c')}=SiLU(BN(X_{P(0,1,0,3)}^{(h_{1}, w_{1}, c_{1})} \otimes W_{1}^{(1,3, c')})),\\ &X_{2}^{(h', w', c')}=SiLU(BN(X_{P(0,3,0,1)}^{(h_{1}, w_{1}, c_{1})} \otimes W_{2}^{(3,1, c')})),\\ &X_{3}^{(h', w', c')}=SiLU(BN(X_{P(0,1,3,0)}^{(h_{1}, w_{1}, c_{1})} \otimes W_{3}^{(1,3, c')})),\\ &X_{4}^{(h', w', c')}=SiLU(BN(X_{P(3,0,1,0)}^{(h_{1}, w_{1}, c_{1})} \otimes W_{4}^{(3,1, c')})). \end{align*} X1(h,w,c)=SiLU(BN(XP(0,1,0,3)(h1,w1,c1)W1(1,3,c))),X2(h,w,c)=SiLU(BN(XP(0,3,0,1)(h1,w1,c1)W2(3,1,c))),X3(h,w,c)=SiLU(BN(XP(0,1,3,0)(h1,w1,c1)W3(1,3,c))),X4(h,w,c)=SiLU(BN(XP(3,0,1,0)(h1,w1,c1)W4(3,1,c))).
其中, ⊗ \otimes 是卷积运算符, W 1 ( 1 , 3 , c ′ ) W_{1}^{(1,3, c')} W1(1,3,c)是一个 1 × 3 1\times3 1×3的卷积核,输出通道为 c ′ c' c。填充参数 P ( 1 , 0 , 0 , 3 ) P(1,0,0,3) P(1,0,0,3)分别表示在左、右、上、下方向的填充像素数。

第一层交错卷积后输出特征图的高度( h ′ h' h)、宽度( w ′ w' w)和通道数( c ′ c' c)与输入特征图的关系为:
h ′ = h 1 s + 1 , w ′ = w 1 s + 1 , c ′ = c 2 4 h'=\frac{h_{1}}{s}+1, w'=\frac{w_{1}}{s}+1, c'=\frac{c_{2}}{4} h=sh1+1,w=sw1+1,c=4c2
其中 c 2 c_{2} c2是PConv模块最终输出特征图的通道数, s s s是卷积步长。

第一层交错卷积的结果进行拼接( C a t ( . , . ) Cat(.,.) Cat(.,.)),输出计算为:
X ′ ( h ′ , w ′ , 4 c ′ ) = C a t ( X 1 ( h ′ , w ′ , c ′ ) , . . . , X 4 ( h ′ , w ′ , c ′ ) ) X^{\prime(h', w', 4c')}=Cat(X_{1}^{(h', w', c')},..., X_{4}^{(h', w', c')}) X(h,w,4c)=Cat(X1(h,w,c),...,X4(h,w,c))

最后,拼接后的张量通过卷积核 W ( 2 , 2 , c 2 ) W^{(2,2, c_{2})} W(2,2,c2)进行归一化,不进行填充。输出特征图的高度和宽度调整为预设值 h 2 h_{2} h2 w 2 w_{2} w2,使PConv可与Conv层互换,并作为一种通道注意力机制分析不同卷积方向的贡献。最终输出 Y ( h 2 , w 2 , c 2 ) Y^{(h_{2}, w_{2}, c_{2})} Y(h2,w2,c2)计算如下:
h 2 = h ′ − 1 = h 1 s , w 2 = w ′ − 1 = w 1 s h_{2}=h'-1=\frac{h_{1}}{s}, w_{2}=w'-1=\frac{w_{1}}{s} h2=h1=sh1,w2=w1=sw1
Y ( h 2 , w 2 , c 2 ) = S i L U ( B N ( X ′ ( h ′ , w ′ , 4 c ′ ) ⊗ W ( 2 , 2 , c 2 ) ) ) Y^{(h_{2}, w_{2}, c_{2})}=SiLU(BN(X^{\prime(h', w', 4c')} \otimes W^{(2,2, c_{2})})) Y(h2,w2,c2)=SiLU(BN(X(h,w,4c)W(2,2,c2)))

感受野的有效性向外逐渐减弱,类似于高斯分布,且目标越小,其特征越集中,突出了中心特征的重要性。图3右上角显示PConv( k = 3 k = 3 k=3)的感受野为25,卷积次数从中心向外减少,类似高斯分布。PConv利用分组卷积,在显著增加感受野的同时最小化参数数量。标准卷积(Conv)的参数数量计算公式为:
C o n v p a r a m s = c 2 × c 1 × k , ( b i a s = F a l s e ) Conv_{params}=c_{2}×c_{1}×k, (bias = False) Convparams=c2×c1×k,(bias=False)
若输出通道数( c 2 c_{2} c2)等于输入通道数( c 1 c_{1} c1), 3 × 3 3\times3 3×3的Conv参数为 9 c 1 2 9c_{1}^{2} 9c12。PConv的参数计算如下:
P C o n v p a r a m s = 4 × ( ( c 2 / 4 ) × c 1 × 3 × 1 ) + 4 c 2 c 1 = 7 c 2 c 1 = 7 c 1 2 \begin{align*} PConv_{params}&=4\times((c_{2}/4)×c_{1}×3×1)+4c_{2}c_{1}\\ &=7c_{2}c_{1}=7c_{1}^{2} \end{align*} PConvparams=4×((c2/4)×c1×3×1)+4c2c1=7c2c1=7c12
9 c 1 2 9c_{1}^{2} 9c12 3 × 3 3\times3 3×3 Conv相比,PConv参数减少了22.2%,感受野增加了177%。在用于提取IRST底层特征时,PConv替换YOLO系列等网络的前两个Conv层,此时 c 2 = 4 c 1 c_{2}=4c_{1} c2=4c1,Conv需要 36 c 1 2 36c_{1}^{2} 36c12参数,而PConv需要 72 c 1 2 72c_{1}^{2} 72c12。因此,PConv( k = 3 k = 3 k=3)相比 3 × 3 3\times3 3×3 Conv,感受野增加了178%,参数仅增加111%。类似地,PConv( k = 4 k = 4 k=4)感受野增加444%,参数仅增加122%,表明PConv能以最小的参数增加实现高效的感受野扩展。

通过计算PConv和Conv输出结果多个通道的平均值得到可视化结果(图4),结果表明PConv增强了IRST目标与背景之间的对比度,同时抑制了杂波样信号。

3.2 基于尺度的动态损失(SD Loss)

从图2右上角可知,基于IoU的损失(Sloss)波动可达86%,较小目标的IoU损失稳定性更差,对模型稳定性和回归产生负面影响。但观察发现,无论BBox大小如何,质心坐标与目标重心的偏差不超过1像素。因此,基于目标尺度动态调整Sloss和Lloss的影响系数,减少标签不准确对损失函数稳定性的影响。

在这里插入图片描述

对于BBox标签,较小目标的Sloss获得较低的注意力权重(图5(a))。掩模标签可提高检测精度,尤其是对于小或不规则形状的目标,但IRST模糊的边界(图2左下角)导致Sloss波动达62%,较小目标进一步加剧了这种不稳定性。此外,掩模标签的Lloss考虑图像中所有物体的平均位置,当遗漏一个物体时难以收敛,导致更多误报。因此,对于掩模标签,增强Sloss的影响以确保模型更关注Sloss(图5(b))。

定义BBox的尺度损失( L B S \mathcal{L}_{BS} LBS)和位置损失( L B L \mathcal{L}_{BL} LBL)如下:
L B S = 1 − I o U + α v , L B L = ρ 2 ( b p , b g t ) c 2 \mathcal{L}_{BS}=1 - IoU+\alpha v, \mathcal{L}_{BL}=\frac{\rho^{2}(b_{p}, b_{gt})}{c^{2}} LBS=1IoU+αv,LBL=c2ρ2(bp,bgt)
其中, I o U IoU IoU表示预测BBox与真实BBox的交并比, α v \alpha v αv衡量BBox的纵横比一致性, ρ ( . ) \rho(.) ρ(.)是欧几里得距离, b p b_{p} bp b g t b_{gt} bgt分别是预测BBox B p B_{p} Bp和目标BBox B g t B_{gt} Bgt的质心, c c c是两个BBox的对角线长度。

对于掩模的分割损失函数,参考SLS损失,定义掩模尺度损失( L M S L_{MS} LMS)和掩模位置损失( L M L L_{ML} LML)如下:
L M S = 1 − ω ∣ M p ⋂ M g t ∣ ∣ M p ⋃ M g t ∣ \mathcal{L}_{MS}=1-\omega \frac{|M_{p} \bigcap M_{gt}|}{|M_{p} \bigcup M_{gt}|} LMS=1ωMpMgtMpMgt
L M L = 1 − m i n ( d p , d g t ) m a x ( d p , d g t ) + 4 π 2 ( θ p − θ g t ) 2 \mathcal{L}_{ML}=1-\frac{min(d_{p}, d_{gt})}{max(d_{p}, d_{gt})}+\frac{4}{\pi^{2}}(\theta_{p}-\theta_{gt})^{2} LML=1max(dp,dgt)min(dp,dgt)+π24(θpθgt)2
其中, M p M_{p} Mp M g t M_{gt} Mgt是目标的预测像素集和真实像素集, d p d_{p} dp d g t d_{gt} dgt是预测和目标平均像素在极坐标中到原点的距离, θ p \theta_{p} θp θ g t \theta_{gt} θgt是预测和目标像素在极坐标中的平均角度, ω \omega ω描述 M p M_{p} Mp M g t M_{gt} Mgt之间的差异。

当模型对图像进行缩放或对特征图进行下采样时,目标大小会发生变化。为确定真实目标大小,计算原始图像与当前特征图的比例:
R O C = w o × h o w c × h c R_{OC}=\frac{w_{o}×h_{o}}{w_{c}×h_{c}} ROC=wc×hcwo×ho
其中, w o w_{o} wo h 0 h_{0} h0是原始图像的宽度和高度, w c w_{c} wc h c h_{c} hc是当前特征图的宽度和高度。

BBox( β B \beta_{B} βB)和掩模( β M \beta_{M} βM)的影响系数计算如下:
β B = m i n ( B g t B g t m a x × R O C × δ , δ ) \beta_{B}=min(\frac{B_{gt}}{B_{gtmax}}×R_{OC}×\delta, \delta) βB=min(BgtmaxBgt×ROC×δ,δ)
β M = m i n ( M g t M g t m a x × R O C × δ , δ ) \beta_{M}=min(\frac{M_{gt}}{M_{gtmax}}×R_{OC}×\delta, \delta) βM=min(MgtmaxMgt×ROC×δ,δ)
其中, B g t m a x = M g t m a x = 81 B_{gtmax}=M_{gtmax}=81 Bgtmax=Mgtmax=81是光电仪器工程师协会定义的IRST最大尺寸, δ \delta δ是可调节的,损失的影响系数基于当前目标框的面积,范围限制在 δ \delta δ内。

最终,BBox的基于尺度的动态损失(SDB损失)为:
β L B S = 1 − δ + β B , β L B L = 1 + δ − β B \beta_{\mathcal{L}_{BS}}=1-\delta+\beta_{B}, \beta_{\mathcal{L}_{BL}}=1+\delta-\beta_{B} βLBS=1δ+βB,βLBL=1+δβB
L S D B = β L B S × L B S + β L B L × L B L \mathcal{L}_{SDB}=\beta_{\mathcal{L}_{BS}}×\mathcal{L}_{BS}+\beta_{\mathcal{L}_{BL}}×\mathcal{L}_{BL} LSDB=βLBS×LBS+βLBL×LBL
其中, β L B S \beta_{L_{BS}} βLBS β L B L \beta_{L_{BL}} βLBL分别是 L B S \mathcal{L}_{BS} LBS L B L \mathcal{L}_{BL} LBL的影响因子。当目标BBox面积大于81时, L S D B \mathcal{L}_{SDB} LSDB退化为CIoU损失。

掩模的基于尺度的动态损失(SDM损失)计算如下:
β L M S = 1 + β M , β L M L = 1 − β M \beta_{\mathcal{L}_{MS}}=1+\beta_{M}, \beta_{\mathcal{L}_{ML}}=1-\beta_{M} βLMS=1+βM,βLML=1βM
L S D M = β L M S × L M S + β L M L × L M L \mathcal{L}_{SDM}=\beta_{\mathcal{L}_{MS}}×\mathcal{L}_{MS}+\beta_{\mathcal{L}_{ML}}×\mathcal{L}_{ML} LSDM=βLMS×LMS+βLML×LML
其中, β L M S \beta_{L_{MS}} βLMS β L M L \beta_{L_{ML}} βLML分别是 L M S \mathcal{L}_{MS} LMS L M L \mathcal{L}_{ML} LML的影响因子。

3.3 SIRST - UAVB数据集

创建了名为SIRST - UAVB的基准数据集,包含3000张针对无人机和鸟类的红外图像,这些图像在一年中不同季节、天气条件和复杂背景下收集。该数据集存在目标方向、尺度和遮挡多样的挑战,小目标比例高,许多小目标肉眼几乎不可见。通过轨迹手动标注目标,并经过反复检查确保准确性。数据集包括1742个鸟类和2955个无人机的BBox标签,由于难以准确标注模糊鸟类目标,因此在掩模标注中排除了它们。总体而言,SIRST - UAVB非常适合复杂现实场景中的深度学习检测。

四、实验

4.1 实验设置

4.1.1 数据集

为评估PConv和SD损失在不同超参数下对不同尺度目标的影响,使用了两个数据集:IRSTD - 1K和SIRST - UAVB。IRSTD - 1K包含1000张真实红外图像,平均目标尺度较大,分辨率为 512 × 512 512×512 512×512像素;SIRST - UAVB的目标则较小。两个数据集均按4:1的比例划分为训练集和测试集。

4.1.2 评估指标

对于BBox标签,使用精度( P P P)、召回率( R R R)和平均精度均值50( m A P 50 mAP50 mAP50)评估模型检测和分类的准确性。精度 P P P表示预测为真的样本中实际为真的比例,召回率 R R R表示实际为真的样本中被检测到的比例, m A P 50 mAP50 mAP50用于评估目标定位准确性的指标,计算公式如下:
P = T P T P + F P , R = T P T P + F N , m A P 50 = 1 C ∑ i = 1 C A P i , 50 P=\frac{TP}{TP + FP}, R=\frac{TP}{TP + FN}, mAP50=\frac{1}{C}\sum_{i = 1}^{C}AP_{i,50} P=TP+FPTP,R=TP+FNTP,mAP50=C1i=1CAPi,50
其中, T P TP TP是预测正样本中IoU大于0.45阈值的真阳性样本, F P FP FP是预测正样本中的假阳性样本, F N FN FN是预测负样本中的假阴性样本。

对于掩模标签,使用IoU评估模型的像素级形状描述能力,使用误报率( F a F_{a} Fa)和检测概率( P d P_{d} Pd)评估定位性能,计算公式如下:
I o U = ∣ A p ⋂ A g t ∣ ∣ A p ⋃ A g t ∣ , F a = P f a l s e P a l l , P d = T p r e d T a l l IoU=\frac{|A_{p} \bigcap A_{gt}|}{|A_{p} \bigcup A_{gt}|}, F_{a}=\frac{P_{false}}{P_{all}}, P_{d}=\frac{T_{pred}}{T_{all}} IoU=ApAgtApAgt,Fa=PallPfalse,Pd=TallTpred
其中, P f a l s e P_{false} Pfalse是假阳性像素, P a l l P_{all} Pall是总像素, T p r e d T_{pred} Tpred是正确预测的目标, T a l l T_{all} Tall是总目标。

4.1.3 实现细节

在IRST检测和分割模型上进行消融实验,使用PyTorch框架,在RTX3090 GPU上进行训练。对于检测模型,输入图像大小设置为640,批量大小为64,训练轮数为700,耐心值为70,学习率为0.01;对于分割模型,输入图像大小设置为256,批量大小为4,训练轮数为400,学习率为0.05 。

4.2 与其他方法的比较

4.2.1 卷积模块的比较

将PConv与多种卷积模块进行比较,包括分组卷积(GConv)、深度可分离卷积(DSConv)、动态区域感知卷积(DRConv)、大选择性核卷积(LSKConv)、扩张卷积(DConv)、MixConv和AKConv等。GConv和DSConv侧重于减少参数,而DRConv、LSKConv、DConv、MixConv和AKConv旨在扩大感受野。

在YOLOv8n - p2检测模型中,除MixConv外,大多数替代模块未能持续提升性能。MixConv虽然需要更多参数,但仍未超过本文提出的PConv。对于IRSTD - 1K数据集,带有PConv(4,4)的YOLOv8n - p2模型在整体性能上最佳,各项评估指标均值最高;而PConv(4,3)配置则展现出最平衡的性能提升,多项评估指标排名靠前。对于SIRST - UAVB数据集,PConv(4,3)提供了最佳且最平衡的性能增强。这表明对于IRSTD - 1K数据集中的较大目标,更大的PConv核长度有益;而对于SIRST - UAVB数据集中的较小目标,增加PConv核长度并不能带来额外的性能提升。

在MSHNet分割模型中,PConv显著优于其他卷积模块。结果表明,第一层PConv核长度为4时能提供更有效的感受野,这对于捕捉小目标特征至关重要。在特征图和目标尺寸在降采样过程中减小后,后续层核长度为3就足以在保持性能的同时降低计算开销。

这些实验表明,与其他卷积模块相比,PConv因其设计符合IRST灰度的高斯分布特征,能有效扩大卷积感受野,在仅少量增加参数的情况下,增强了网络对IRST底层特征的提取能力。

4.2.2 损失函数的比较

比较了多种基于BBox的损失函数,包括CIoU、DIoU、GIoU、IoU、NWD、SAFit和本文提出的SDB(δ)损失。SAFit在SIRST - UAVB数据集上表现良好,但在IRSTD - 1K数据集上性能大幅下降。相比之下,SDB损失在两个数据集上均提供了一致且平衡的性能提升,这对于具有不同目标大小和分布的实际应用至关重要。此外,NWD和SAFit损失涉及指数运算,增加了计算复杂性和时间,而SDB损失更简单高效。

在基于掩模的损失函数比较中,包括SLS、IoU和Dice损失,以及本文的SDM(δ)损失。SDM(δ = 0.5)损失不仅在整体性能上最佳,而且在不同数据集上保持了较强的平衡性。

通过消融实验发现,在检测模型中,较小的δ值在IRSTD - 1K上性能更好,而较大的δ值在SIRST - UAVB上表现更优。这可能是由于BBox的IoU波动比掩模更大,对δ变化更敏感。较大的δ值拓宽了动态影响系数β的波动范围,对小目标(如SIRST - UAVB中的目标)特别有益,可减少Sloss波动并提高准确性。因此,在检测模型中应根据目标大小选择δ值,而在分割模型中,δ = 0.5始终能提供最佳平衡。

4.3 多模型消融实验

在多个检测和分割网络上进行消融实验,包括EFLNet、YOLOv5n、YOLOv8n - p2、DNANet、ISNet和MSHNet等。结果表明,本文提出的PConv和SDB损失在所有检测模型中均能持续提升性能,组合使用时在所有检测模型中均获得最高的mAP50分数,展现出卓越的检测能力。在精度和召回率方面,尤其是在EFLNet中,有显著提升,进一步验证了该方法克服传统卷积层和损失函数局限性的有效性。总体而言,PConv和SDB损失在提高检测精度、稳定性和泛化性方面具有明显优势,是提升检测网络性能的有力工具。

在分割模型中,PConv与SDM损失的组合也持续带来显著改进,特别是在DNANet中,在ISNet和MSHNet中也有明显提升。虽然MSHNet在采用组合方法时比基线表现更好,但仍未超过单独使用PConv与SDM损失的性能,这表明可能需要根据特定架构定制最优配置。总体而言,该方法在不同模型中表现出强大的鲁棒性和高效性。

通过对PConv和SD损失的定性结果分析(图6和图7)可知,PConv减少了漏检情况,SD损失增强了对弱信号的检测能力,两者结合减少了误报并提高了模型的鲁棒性。

4.4 补充实验

对SIRST - UAVB数据集按目标尺度进行划分,在YOLOv8n - p2框架下对PConv和SDB损失进行全面的消融实验。结果表明,PConv和SDB损失在各种目标尺度上都增强了检测能力,特别是对于框面积小于16的小目标,有效提升了多个评估指标。将两个PConv层的卷积核分别设置为4和3时,能提供稳定且显著的性能提升。有趣的是,PConv核大小的组合越大,对小目标的检测精度性能越好;反之,对大目标的检测性能则下降。将SDB损失参数设置为δ = 0.5时,能增强对小目标的检测性能。此外,PConv与SDB损失的结合显著提高了检测精度。

五、芒果YOLO系列改进:基于 PinwheelConv 原创改进内容🚀🚀🚀


5.1 将 PinwheelConv 改进到 YOLO11 中 - 基于 PinwheelConv 原创改进核心内容

详情改进内容点击:🚀🚀🚀芒果YOLOv11改进174:PinwheelConv风车状卷积,即插即用:更好地与弱小目标的像素高斯空间分布对齐,增强了特征提取,显著增加了感受野,并且只引入了最小的参数增加。


5.2 将 PinwheelConv 改进到 YOLOv8 中 - 基于 PinwheelConv 原创改进核心内容

详情改进内容点击:🚀🚀🚀芒果YOLOv8改进185:PinwheelConv风车状卷积,即插即用:更好地与弱小目标的像素高斯空间分布对齐,增强了特征提取,显著增加了感受野,并且只引入了最小的参数增加。


5.3 将 PinwheelConv 改进到 YOLOv10 中 - 基于 PinwheelConv 原创改进核心内容

详情改进内容点击:🚀🚀🚀芒果YOLOv10改进139:PinwheelConv风车状卷积,即插即用:更好地与弱小目标的像素高斯空间分布对齐,增强了特征提取,显著增加了感受野,并且只引入了最小的参数增加。


5.4 将 PinwheelConv 改进到 RT-DETR 中 - 基于 PinwheelConv 原创改进核心内容

详情改进内容点击:🚀🚀🚀芒果RT-DETR改进:PinwheelConv风车状卷积,即插即用:更好地与弱小目标的像素高斯空间分布对齐,增强了特征提取,显著增加了感受野,并且只引入了最小的参数增加。 适用于 ultralytics 版本的 RT-DETR


5.5 将 PinwheelConv 改进到 YOLOv7 中 - 基于 PinwheelConv 原创改进核心内容

详情改进内容点击:🚀🚀🚀芒果YOLOv7改进109:PinwheelConv风车状卷积,即插即用:更好地与弱小目标的像素高斯空间分布对齐,增强了特征提取,显著增加了感受野,并且只引入了最小的参数增加。


5.6 将 PinwheelConv 改进到 YOLOv5 中 - 基于 PinwheelConv 原创改进核心内容

详情改进内容点击:🚀🚀🚀芒果YOLOv5改进108:PinwheelConv风车状卷积,即插即用:更好地与弱小目标的像素高斯空间分布对齐,增强了特征提取,显著增加了感受野,并且只引入了最小的参数增加。


参考:https://arxiv.org/abs/2412.16986v1

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐