用于目标检测的集中式特征金字塔
摘要
本文提出了一种用于目标检测的集中式特征金字塔(CFP),通过全局显式特征调节提升检测性能。CFP结合轻量级MLP与可学习视觉中心,捕捉全局长程依赖并聚合局部边角区域特征,弥补现有方法忽略层内特征调节的不足。实验表明,CFP在YOLOv5和YOLOX等基线模型上显著提升平均精度(mAP),同时保持较低计算开销。文章详细解析了CFP的架构设计、空间显式视觉中心(EVC)及全局集中式调节(GCR)机制,并通过消融实验验证其有效性。最后,与主流检测器对比显示,CFP在精度和速度上均优于现有方法。
关键词:特征金字塔;视觉中心;目标检测;注意力机制;长程依赖
1. 引言
目标检测是计算机视觉的核心任务之一,旨在定位并分类图像中的目标实例。随着卷积神经网络(CNN)的发展,基于特征金字塔的方法(如FPN、PANet)在多尺度目标检测中表现出色。然而,现有方法多关注层间特征交互,忽视了层内特征调节的重要性。尽管Transformer通过自注意力机制增强全局建模能力,但其计算复杂度高且易忽略局部边角区域。
本文提出集中式特征金字塔(CFP),结合轻量级MLP与可学习视觉中心(LVC),实现全局与局部特征的协同调节。CFP通过以下创新提升检测性能:
- 空间显式视觉中心(EVC):并行MLP与LVC模块,分别捕捉长程依赖与局部关键区域;
- 全局集中式调节(GCR):利用深层特征显式调节浅层特征,增强金字塔各层的判别力;
- 高效计算设计:轻量化MLP替代复杂Transformer,平衡精度与速度。
实验表明,CFP在MS-COCO数据集上将YOLOv5和YOLOX的mAP最高提升1.6%,推理速度优于主流检测器。
2. 相关工作
2.1 特征金字塔
特征金字塔通过多尺度特征融合解决目标尺寸多样性问题。FPN通过自上而下路径融合深层语义与浅层细节;PANet增加自下而上路径强化特征共享;NAS-FPN通过架构搜索优化跨层连接。然而,这些方法未充分挖掘层内特征潜力。
2.2 视觉注意力机制
注意力机制(如Non-local、GCNet)通过权重分配增强关键区域表示。Transformer通过多头注意力建模全局关系,但计算复杂度高。MLP-Mixer等研究证明,纯MLP结构也能捕捉长程依赖,且更轻量。
2.3 目标检测框架
单阶段检测器(YOLO、SSD)直接预测边界框,速度快;两阶段检测器(Faster R-CNN)通过区域提议提升精度。本文选择YOLOv5和YOLOX为基线,结合CFP优化特征表示能力。
3. 方法设计
3.1 集中式特征金字塔(CFP)
CFP架构如图1所示,包含以下模块:
- CNN骨干网络:提取五级特征金字塔 { x 0 , x 1 , x 2 , x 3 , x 4 } \{x_0, x_1, x_2, x_3, x_4\} {x0,x1,x2,x3,x4};
- 显式视觉中心(EVC):在顶层特征 x 4 x_4 x4上实现,融合MLP与LVC输出;
- 全局集中式调节(GCR):将 x 4 x_4 x4的视觉中心信息上采样并融合至浅层特征。

图1:CFP整体架构
3.2 显式视觉中心(EVC)
EVC由轻量级MLP和LVC模块并行组成,结构如图2所示:

图2:EVC模块结构
MLP模块:
- 输入特征经Stem块(7×7卷积+BN+ReLU)平滑处理;
- 深度卷积(DConv)与通道MLP(CMLP)串联,增强特征泛化能力:
X ~ i n = D C o n v ( G N ( X i n ) ) + X i n \tilde{X}_{in} = DConv(GN(X_{in})) + X_{in} X~in=DConv(GN(Xin))+Xin
M L P ( X i n ) = C M L P ( G N ( X ~ i n ) ) + X ~ i n MLP(X_{in}) = CMLP(GN(\tilde{X}_{in})) + \tilde{X}_{in} MLP(Xin)=CMLP(GN(X~in))+X~in
LVC模块:
- 可学习码本
B
B
B与缩放因子
S
S
S编码局部特征:
e k = ∑ i = 1 N e − s k ∥ x ˇ i − b k ∥ 2 ∑ j = 1 K e − s k ∥ x ˇ i − b k ∥ 2 ( x ˇ i − b k ) e_k = \sum_{i=1}^N \frac{e^{-s_k \|\check{x}_i - b_k\|^2}}{\sum_{j=1}^K e^{-s_k \|\check{x}_i - b_k\|^2}} (\check{x}_i - b_k) ek=i=1∑N∑j=1Ke−sk∥xˇi−bk∥2e−sk∥xˇi−bk∥2(xˇi−bk) - 融合码本信息并通过逐通道乘法增强特征:
Z = X i n ⊗ ( δ ( C o n v 1 × 1 ( e ) ) ) Z = X_{in} \otimes (\delta(Conv_{1×1}(e))) Z=Xin⊗(δ(Conv1×1(e)))
L V C ( X i n ) = X i n ⊕ Z LVC(X_{in}) = X_{in} \oplus Z LVC(Xin)=Xin⊕Z
3.3 全局集中式调节(GCR)
GCR将顶层特征 x 4 x_4 x4的视觉中心信息逐层传递至浅层:
- 上采样至与浅层特征相同尺寸;
- 通道拼接后经1×1卷积压缩通道数;
- 加权融合增强浅层特征的全局表示能力。
4. 实验与结果
4.1 实验设置
- 数据集:MS-COCO,训练集118k,验证集5k,测试集20k;
- 基线模型:YOLOv5(DarkNet53)、YOLOX(CSPNet v5);
- 评估指标:mAP、GFLOPs、FPS、参数量。
4.2 消融实验
表1:EVC模块对YOLOv5/YOLOX的性能提升
| 模块 | YOLOv5-L mAP | YOLOX-L mAP | Params (M) | GFLOPs |
|---|---|---|---|---|
| Baseline | 46.2% | 47.8% | 47.0 | 109.5 |
| +LVC | +1.0% | +1.3% | +0.8 | +3.2 |
| +MLP | +0.6% | +1.3% | +1.2 | +4.1 |
| +EVC | +1.4% | +1.4% | +2.0 | +7.3 |
表2:MLP与注意力变体对比(YOLOX-L)
| 变体 | mAP | 延迟 (ms) |
|---|---|---|
| PoolFormer | 47.8% | 12.3 |
| CSPM | 47.7% | 13.1 |
| MLP(Ours) | 49.1% | 11.9 |
| DWA | 49.2% | 14.7 |
4.3 与SOTA方法对比
表3:MS-COCO验证集性能对比
| 方法 | mAP | FPS | Params (M) |
|---|---|---|---|
| YOLOv5-L | 46.2% | 98 | 47.0 |
| YOLOX-L | 47.8% | 95 | 54.8 |
| CFP_YOLOv5-L | 47.6% | 92 | 49.0 |
| CFP_YOLOX-L | 49.4% | 90 | 56.8 |
| EfficientDet-D3 | 47.5% | 52 | 59.2 |
5. 结论与展望
CFP通过全局显式调节与局部特征增强,显著提升目标检测性能。未来工作将探索CFP在语义分割、实例分割等任务的扩展,并进一步优化计算效率。
可视化结果示例

图3:CFP_YOLOX-L在小目标与遮挡场景下的检测效果提升
参考文献与代码
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)