摘要
本文提出了一种用于目标检测的集中式特征金字塔(CFP),通过全局显式特征调节提升检测性能。CFP结合轻量级MLP与可学习视觉中心,捕捉全局长程依赖并聚合局部边角区域特征,弥补现有方法忽略层内特征调节的不足。实验表明,CFP在YOLOv5和YOLOX等基线模型上显著提升平均精度(mAP),同时保持较低计算开销。文章详细解析了CFP的架构设计、空间显式视觉中心(EVC)及全局集中式调节(GCR)机制,并通过消融实验验证其有效性。最后,与主流检测器对比显示,CFP在精度和速度上均优于现有方法。

关键词:特征金字塔;视觉中心;目标检测;注意力机制;长程依赖


1. 引言

目标检测是计算机视觉的核心任务之一,旨在定位并分类图像中的目标实例。随着卷积神经网络(CNN)的发展,基于特征金字塔的方法(如FPN、PANet)在多尺度目标检测中表现出色。然而,现有方法多关注层间特征交互,忽视了层内特征调节的重要性。尽管Transformer通过自注意力机制增强全局建模能力,但其计算复杂度高且易忽略局部边角区域。

本文提出集中式特征金字塔(CFP),结合轻量级MLP与可学习视觉中心(LVC),实现全局与局部特征的协同调节。CFP通过以下创新提升检测性能:

  1. 空间显式视觉中心(EVC):并行MLP与LVC模块,分别捕捉长程依赖与局部关键区域;
  2. 全局集中式调节(GCR):利用深层特征显式调节浅层特征,增强金字塔各层的判别力;
  3. 高效计算设计:轻量化MLP替代复杂Transformer,平衡精度与速度。

实验表明,CFP在MS-COCO数据集上将YOLOv5和YOLOX的mAP最高提升1.6%,推理速度优于主流检测器。


2. 相关工作

2.1 特征金字塔

特征金字塔通过多尺度特征融合解决目标尺寸多样性问题。FPN通过自上而下路径融合深层语义与浅层细节;PANet增加自下而上路径强化特征共享;NAS-FPN通过架构搜索优化跨层连接。然而,这些方法未充分挖掘层内特征潜力。

2.2 视觉注意力机制

注意力机制(如Non-local、GCNet)通过权重分配增强关键区域表示。Transformer通过多头注意力建模全局关系,但计算复杂度高。MLP-Mixer等研究证明,纯MLP结构也能捕捉长程依赖,且更轻量。

2.3 目标检测框架

单阶段检测器(YOLO、SSD)直接预测边界框,速度快;两阶段检测器(Faster R-CNN)通过区域提议提升精度。本文选择YOLOv5和YOLOX为基线,结合CFP优化特征表示能力。


3. 方法设计

3.1 集中式特征金字塔(CFP)

CFP架构如图1所示,包含以下模块:

  1. CNN骨干网络:提取五级特征金字塔 { x 0 , x 1 , x 2 , x 3 , x 4 } \{x_0, x_1, x_2, x_3, x_4\} {x0,x1,x2,x3,x4}
  2. 显式视觉中心(EVC):在顶层特征 x 4 x_4 x4上实现,融合MLP与LVC输出;
  3. 全局集中式调节(GCR):将 x 4 x_4 x4的视觉中心信息上采样并融合至浅层特征。

在这里插入图片描述
图1:CFP整体架构

3.2 显式视觉中心(EVC)

EVC由轻量级MLP和LVC模块并行组成,结构如图2所示:

在这里插入图片描述

图2:EVC模块结构

MLP模块

  • 输入特征经Stem块(7×7卷积+BN+ReLU)平滑处理;
  • 深度卷积(DConv)与通道MLP(CMLP)串联,增强特征泛化能力:
    X ~ i n = D C o n v ( G N ( X i n ) ) + X i n \tilde{X}_{in} = DConv(GN(X_{in})) + X_{in} X~in=DConv(GN(Xin))+Xin
    M L P ( X i n ) = C M L P ( G N ( X ~ i n ) ) + X ~ i n MLP(X_{in}) = CMLP(GN(\tilde{X}_{in})) + \tilde{X}_{in} MLP(Xin)=CMLP(GN(X~in))+X~in

LVC模块

  • 可学习码本 B B B与缩放因子 S S S编码局部特征:
    e k = ∑ i = 1 N e − s k ∥ x ˇ i − b k ∥ 2 ∑ j = 1 K e − s k ∥ x ˇ i − b k ∥ 2 ( x ˇ i − b k ) e_k = \sum_{i=1}^N \frac{e^{-s_k \|\check{x}_i - b_k\|^2}}{\sum_{j=1}^K e^{-s_k \|\check{x}_i - b_k\|^2}} (\check{x}_i - b_k) ek=i=1Nj=1Keskxˇibk2eskxˇibk2(xˇibk)
  • 融合码本信息并通过逐通道乘法增强特征:
    Z = X i n ⊗ ( δ ( C o n v 1 × 1 ( e ) ) ) Z = X_{in} \otimes (\delta(Conv_{1×1}(e))) Z=Xin(δ(Conv1×1(e)))
    L V C ( X i n ) = X i n ⊕ Z LVC(X_{in}) = X_{in} \oplus Z LVC(Xin)=XinZ

3.3 全局集中式调节(GCR)

GCR将顶层特征 x 4 x_4 x4的视觉中心信息逐层传递至浅层:

  1. 上采样至与浅层特征相同尺寸;
  2. 通道拼接后经1×1卷积压缩通道数;
  3. 加权融合增强浅层特征的全局表示能力。

4. 实验与结果

4.1 实验设置

  • 数据集:MS-COCO,训练集118k,验证集5k,测试集20k;
  • 基线模型:YOLOv5(DarkNet53)、YOLOX(CSPNet v5);
  • 评估指标:mAP、GFLOPs、FPS、参数量。

4.2 消融实验

表1:EVC模块对YOLOv5/YOLOX的性能提升

模块YOLOv5-L mAPYOLOX-L mAPParams (M)GFLOPs
Baseline46.2%47.8%47.0109.5
+LVC+1.0%+1.3%+0.8+3.2
+MLP+0.6%+1.3%+1.2+4.1
+EVC+1.4%+1.4%+2.0+7.3

表2:MLP与注意力变体对比(YOLOX-L)

变体mAP延迟 (ms)
PoolFormer47.8%12.3
CSPM47.7%13.1
MLP(Ours)49.1%11.9
DWA49.2%14.7

4.3 与SOTA方法对比

表3:MS-COCO验证集性能对比

方法mAPFPSParams (M)
YOLOv5-L46.2%9847.0
YOLOX-L47.8%9554.8
CFP_YOLOv5-L47.6%9249.0
CFP_YOLOX-L49.4%9056.8
EfficientDet-D347.5%5259.2

5. 结论与展望

CFP通过全局显式调节与局部特征增强,显著提升目标检测性能。未来工作将探索CFP在语义分割、实例分割等任务的扩展,并进一步优化计算效率。

可视化结果示例

在这里插入图片描述

图3:CFP_YOLOX-L在小目标与遮挡场景下的检测效果提升


参考文献与代码

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐