1. PASCAL VOC (Visual Object Classes)

  • 概述:PASCAL VOC 是目标检测领域的经典基准数据集,常用于算法性能对比。

  • 版本:常用版本为 VOC2007 和 VOC2012。

  • 数据量

    • VOC2007:9,963 张图像,标注了 24,640 个物体。

    • VOC2012:11,530 张图像,标注了 27,450 个物体。

  • 类别:共 20 类(如人、车、狗、猫、飞机等)。

  • 标注信息:边界框(Bounding Box)、类别标签、物体是否被遮挡等属性。

  • 特点

    • 图像分辨率较低(约 500×300 像素)。

    • 标注简单清晰,适合初学者入门。

  • 应用场景:通用物体检测,适合验证算法的基础性能。

  • 下载链接The PASCAL Visual Object Classes Homepage


2. COCO (Common Objects in Context)

  • 概述:COCO 是当前最流行的目标检测数据集之一,覆盖复杂场景和密集小物体。

  • 版本:常用版本为 COCO2017。

  • 数据量

    • 训练集:118,287 张图像。

    • 验证集:5,000 张图像。

    • 标注了超过 860,000 个物体。

  • 类别:80 类(比 PASCAL VOC 更丰富,如大象、牙刷、交通灯等)。

  • 标注信息

    • 边界框、类别标签。

    • 实例分割(像素级掩码)。

    • 关键点检测(部分类别)。

  • 特点

    • 图像场景复杂,物体尺寸多样(包含大量小物体)。

    • 标注密度高(单张图像可能包含数十个物体)。

  • 应用场景:算法研究、复杂场景检测(如人群、交通场景)。

  • 下载链接COCO - Common Objects in Context


3. ImageNet

  • 概述:ImageNet 最初以图像分类任务闻名,但也包含目标检测子集。

  • 版本:常用目标检测子集为 ILSVRC2017。

  • 数据量

    • 训练集:约 1.2 万张图像(检测任务专用)。

    • 标注了 100,000 个物体。

  • 类别:200 类(覆盖广泛的物体类别)。

  • 标注信息:边界框、类别标签。

  • 特点

    • 图像质量高,物体尺寸较大。

    • 类别多样性丰富。

  • 应用场景:分类与检测联合任务、大规模模型训练。

  • 下载链接ImageNet


4. KITTI

  • 概述:面向自动驾驶场景的数据集,包含多传感器数据(如摄像头、激光雷达)。

  • 版本:常用目标检测子集为 2D 物体检测。

  • 数据量

    • 7,481 张训练图像。

    • 标注了 80,256 个物体。

  • 类别:9 类(如汽车、行人、自行车等)。

  • 标注信息

    • 2D 边界框、3D 边界框(带深度信息)。

    • 物体朝向、遮挡状态。

  • 特点

    • 真实道路场景,适合自动驾驶研究。

    • 标注包含 3D 信息,可扩展至立体视觉任务。

  • 应用场景:自动驾驶、3D 目标检测。

  • 下载链接The KITTI Vision Benchmark Suite


5. Open Images Dataset

  • 概述:谷歌发布的大规模数据集,涵盖多样化的物体和场景。

  • 版本:常用版本为 V7。

  • 数据量

    • 训练集:1,743,042 张图像,标注了 14,610,229 个物体。

    • 验证集:41,620 张图像。

  • 类别:600 类(涵盖日常物品到抽象概念)。

  • 标注信息

    • 边界框、类别标签。

    • 图像级标签(描述图像整体内容)。

  • 特点

    • 数据规模极大,类别极多。

    • 适合训练大规模模型(如工业级应用)。

  • 应用场景:多类别检测、迁移学习。

  • 下载链接Open Images V7


6. **其他补充数据集

  • Cityscapes:专注于城市街景的语义分割和实例分割,但也可用于车辆和行人检测。

  • Waymo Open Dataset:自动驾驶领域的高质量数据集,包含激光雷达和摄像头数据。

  • DOTA:遥感图像数据集,用于检测飞机、船舶等大尺度物体。


如何选择数据集?

  1. 初学者建议:从 PASCAL VOC 开始,因其标注简单、数据量小,适合快速验证模型。

  2. 进阶研究:使用 COCO 或 Open Images,挑战复杂场景和多类别检测。

  3. 垂直领域:自动驾驶选 KITTI,工业检测可自定义数据集。


数据集格式

  • PASCAL VOC:XML 文件存储标注(每张图像对应一个 XML)。

  • COCO:JSON 文件统一存储所有标注(包含图像信息、类别、边界框等)。

  • KITTI:TXT 文件存储标注(每行对应一个物体,包含位置和类别)。


工具推荐

  • 标注工具:LabelImg(VOC 格式)、CVAT(支持 COCO 格式)。

  • 数据处理库:PyTorch 的 torchvision.datasets、TensorFlow 的 TFDS

通过实践这些数据集,你可以逐步掌握目标检测的核心技术(如 YOLO、Faster R-CNN 等),并理解不同场景下的算法优化方向。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐