一、目标检测核心任务与挑战

  1. 核心任务:识别图像中物体的类别,并定位物体的位置,属于 “位置 + 类别” 的多任务学习。
  2. 主要挑战
    • 目标种类与数量繁多,检测难度随目标多样性提升;
    • 目标尺度不均,不同大小的目标需统一适配检测逻辑;
    • 受遮挡、图像噪声等外部环境干扰,易影响检测准确性。

二、目标检测常用数据集

重点介绍了两类主流公开数据集,为检测模型训练与验证提供数据支撑:

数据集核心信息
VOC 数据集源于 PASCAL VOC 挑战赛,含 4 大类、20 小类;VOC 2007 含 9963 张图片 / 24640 个目标,VOC 2012 含 23080 张图片 / 54900 个目标。
COCO 数据集2014 年由微软出资标注,含 20 万张图像、80 个类别、超 50 万个目标标注,平均每张图像含 7.2 个目标。

三、Ground Truth(真值标注)格式

Ground Truth 是模型训练的 “标准答案”,包含物体类别与边界框坐标,PPT 介绍了三类主流格式:

  1. YOLO(TXT)格式:坐标为归一化结果,记录(x,y,w,h),分别代表物体中心点的 x/y 坐标、宽 / 高。
  2. VOC(XML)格式:记录(Xmin,Ymin,Xmax,Ymax),分别代表物体边界框左上角、右下角的坐标。
  3. COCO(JSON)格式:坐标非归一化,记录(Xmin,Ymin,W,H),分别代表物体边界框左上角坐标、宽 / 高。

四、目标检测评估指标体系

评估指标用于衡量模型检测效果,PPT 系统梳理了关键指标与计算逻辑:

  1. 基础指标:IoU

    • 全称 “交并比”,计算公式为 “边界框交集面积 / 并集面积”,用于判断预测框与真值框的重合度,是边界框正确性的核心度量。
    • 计算前需先过滤低类别置信度的预测结果,仅保留高置信度候选框。
  2. 样本分类指标:TP/FP/TN/FN

    • TP(真阳性):真值为正样本、预测为正样本,且 IoU > 阈值;
    • FP(假阳性):真值为负样本、预测为正样本,且 IoU < 阈值;
    • TN(真阴性):真值为负样本、预测为负样本;
    • FN(假阴性):真值为正样本、预测为负样本,即 “漏检目标”。
  3. 核心评估指标

    • Precision(精确率 / 查准率):衡量预测为正样本的结果中,实际为正样本的比例;
    • Recall(召回率 / 查全率):衡量所有真值正样本中,被成功预测为正样本的比例;
    • P-R 曲线:以 Recall 为横轴、Precision 为纵轴绘制的曲线,直观反映模型在不同阈值下的性能;
    • AP(Average Precision,平均精度):通过 “11 点法”(取 Recall 为 0-1 间隔 0.1 的 11 个点,计算对应 Precision 的平均值)或 “近似面积法” 计算,衡量单类别检测效果;
    • mean AP:所有类别的 AP 的算术平均值,衡量模型对多类别目标的综合检测能力。
  4. mean 与 average 的区别

    • mean:仅指 “算术平均数”,计算逻辑简单;
    • average:包含算术平均在内的多种度量规则,需先设计均衡逻辑(如 AP 计算);
    • 因此 “mean AP” 是对已均衡的 AP 直接取算术平均,而 “Average P” 需先对 P 值做均衡处理。

五、目标检测方法分类

PPT 对比了传统方法与深度学习方法,重点突出深度学习的技术路线:

  1. 传统方法:滑动窗口法

    • 核心逻辑:人工设计固定尺寸的窗口,在图像上滑动遍历以检测目标;
    • 缺点:需人工设计窗口尺寸、存在大量冗余计算、定位准确性低。
  2. 深度学习方法

    • anchor 相关分类
      • anchor-base(自顶向下):类似滑动窗口法,先穷举大量预设 anchor 框,再按置信度筛选;
      • anchor-free(自底向上):无需预设 anchor,自动生成目标候选框,简化检测流程。
    • 检测流程分类
      • two stage(两阶段):先生成目标候选区域(proposal),再对候选区域做类别预测与位置回归;代表算法有 R-CNN、SPP-Net、Fast R-CNN、Faster R-CNN、Cascade R-CNN 等;
      • one stage(单阶段):直接对图像做类别预测与位置回归,无需候选区域生成;代表算法有 YOLO 系列(v1-v5)、SSD 系列(SSD、DSSD、FSSD)、RefineDet 等。

六、关键技术:非极大值抑制(NMS)

NMS 用于去除重复的候选框,保留最优预测结果,步骤如下:

  1. 设定目标框置信度阈值(常用 0.5 左右),过滤低置信度候选框;
  2. 按置信度从高到低排序候选框列表;
  3. 选取置信度最高的框 A 加入输出列表,并将其从候选框列表中删除;
  4. 计算候选框列表中所有框与 A 的 IoU,删除 IoU 大于阈值的候选框;
  5. 重复步骤 3-4,直至候选框列表为空,最终输出列表即为去重后的检测结果。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐