目标检测项目
·
一、目标检测核心任务与挑战
- 核心任务:识别图像中物体的类别,并定位物体的位置,属于 “位置 + 类别” 的多任务学习。
- 主要挑战:
- 目标种类与数量繁多,检测难度随目标多样性提升;
- 目标尺度不均,不同大小的目标需统一适配检测逻辑;
- 受遮挡、图像噪声等外部环境干扰,易影响检测准确性。
二、目标检测常用数据集
重点介绍了两类主流公开数据集,为检测模型训练与验证提供数据支撑:
| 数据集 | 核心信息 |
|---|---|
| VOC 数据集 | 源于 PASCAL VOC 挑战赛,含 4 大类、20 小类;VOC 2007 含 9963 张图片 / 24640 个目标,VOC 2012 含 23080 张图片 / 54900 个目标。 |
| COCO 数据集 | 2014 年由微软出资标注,含 20 万张图像、80 个类别、超 50 万个目标标注,平均每张图像含 7.2 个目标。 |
三、Ground Truth(真值标注)格式
Ground Truth 是模型训练的 “标准答案”,包含物体类别与边界框坐标,PPT 介绍了三类主流格式:
- YOLO(TXT)格式:坐标为归一化结果,记录(x,y,w,h),分别代表物体中心点的 x/y 坐标、宽 / 高。
- VOC(XML)格式:记录(Xmin,Ymin,Xmax,Ymax),分别代表物体边界框左上角、右下角的坐标。
- COCO(JSON)格式:坐标非归一化,记录(Xmin,Ymin,W,H),分别代表物体边界框左上角坐标、宽 / 高。
四、目标检测评估指标体系
评估指标用于衡量模型检测效果,PPT 系统梳理了关键指标与计算逻辑:
-
基础指标:IoU
- 全称 “交并比”,计算公式为 “边界框交集面积 / 并集面积”,用于判断预测框与真值框的重合度,是边界框正确性的核心度量。
- 计算前需先过滤低类别置信度的预测结果,仅保留高置信度候选框。
-
样本分类指标:TP/FP/TN/FN
- TP(真阳性):真值为正样本、预测为正样本,且 IoU > 阈值;
- FP(假阳性):真值为负样本、预测为正样本,且 IoU < 阈值;
- TN(真阴性):真值为负样本、预测为负样本;
- FN(假阴性):真值为正样本、预测为负样本,即 “漏检目标”。
-
核心评估指标
- Precision(精确率 / 查准率):衡量预测为正样本的结果中,实际为正样本的比例;
- Recall(召回率 / 查全率):衡量所有真值正样本中,被成功预测为正样本的比例;
- P-R 曲线:以 Recall 为横轴、Precision 为纵轴绘制的曲线,直观反映模型在不同阈值下的性能;
- AP(Average Precision,平均精度):通过 “11 点法”(取 Recall 为 0-1 间隔 0.1 的 11 个点,计算对应 Precision 的平均值)或 “近似面积法” 计算,衡量单类别检测效果;
- mean AP:所有类别的 AP 的算术平均值,衡量模型对多类别目标的综合检测能力。
-
mean 与 average 的区别
- mean:仅指 “算术平均数”,计算逻辑简单;
- average:包含算术平均在内的多种度量规则,需先设计均衡逻辑(如 AP 计算);
- 因此 “mean AP” 是对已均衡的 AP 直接取算术平均,而 “Average P” 需先对 P 值做均衡处理。
五、目标检测方法分类
PPT 对比了传统方法与深度学习方法,重点突出深度学习的技术路线:
-
传统方法:滑动窗口法
- 核心逻辑:人工设计固定尺寸的窗口,在图像上滑动遍历以检测目标;
- 缺点:需人工设计窗口尺寸、存在大量冗余计算、定位准确性低。
-
深度学习方法
- anchor 相关分类:
- anchor-base(自顶向下):类似滑动窗口法,先穷举大量预设 anchor 框,再按置信度筛选;
- anchor-free(自底向上):无需预设 anchor,自动生成目标候选框,简化检测流程。
- 检测流程分类:
- two stage(两阶段):先生成目标候选区域(proposal),再对候选区域做类别预测与位置回归;代表算法有 R-CNN、SPP-Net、Fast R-CNN、Faster R-CNN、Cascade R-CNN 等;
- one stage(单阶段):直接对图像做类别预测与位置回归,无需候选区域生成;代表算法有 YOLO 系列(v1-v5)、SSD 系列(SSD、DSSD、FSSD)、RefineDet 等。
- anchor 相关分类:
六、关键技术:非极大值抑制(NMS)
NMS 用于去除重复的候选框,保留最优预测结果,步骤如下:
- 设定目标框置信度阈值(常用 0.5 左右),过滤低置信度候选框;
- 按置信度从高到低排序候选框列表;
- 选取置信度最高的框 A 加入输出列表,并将其从候选框列表中删除;
- 计算候选框列表中所有框与 A 的 IoU,删除 IoU 大于阈值的候选框;
- 重复步骤 3-4,直至候选框列表为空,最终输出列表即为去重后的检测结果。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)