一、图像分割基础认知

1. 定义

图像分割是预测目标轮廓的技术,核心是将图像中不同像素划分到不同类别,属于细粒度的像素级分类任务。

2. 应用场景

覆盖多领域实用需求,包括但不限于:

  • 人像抠图
  • 医学组织提取
  • 遥感图像分析
  • 自动驾驶场景感知
  • 材料图像分析

3. 前景与背景分类

根据目标属性,将图像内容分为两类:

  • 物体(Things):可数的前景目标,如行人、车辆等;
  • 事物(Stuff):不可数的背景区域,如天空、草地、路面等。

二、图像分割的 “三层境界”

按分割精度和目标维度,图像分割分为三个层级,核心差异在于像素的类别与实例 ID 分配规则:

分割类型核心特点
语义分割(Semantic Segmentation)每个像素仅属于一个类别,输出结果为 “类别掩膜”(仅区分类别,不区分同一类别的不同个体)。
实例分割(Instance Segmentation)仅关注前景目标,需预测目标的类别属性、边框、个体 ID,单个像素可属于多个实例 ID(如重叠前景)。
全景分割(Panoptic Segmentation)融合语义与实例分割能力,每个像素需同时分配 “语义类别” 和 “唯一实例 ID”(覆盖前景实例与背景类别)。

三、核心数据集(图像分割的 “训练素材”)

PPT 重点介绍了 3 个主流数据集,均支持语义分割或实例分割任务,各有侧重:

1. VOC 数据集

  • 背景:源于 PASCAL VOC 世界级计算机视觉挑战赛,2007 年起引入语义分割与实例分割标注;
  • 类别:4 大类(如车辆、动物),下属 20 小类;
  • 数据规模
    • VOC 2007:9963 张图片,含 24640 个目标;
    • VOC 2012:23080 张图片,含 54900 个目标;
    • 专用分割标注图:共 2913 张(1464 张训练图、1449 张验证图)。

2. Cityscape 数据集

  • 特点:聚焦城市街景,涵盖 50 个城市在春 / 夏 / 秋三季、不同时间段的场景;
  • 类别:30 个类别(如道路、行人、车辆、建筑、天空等);
  • 数据规模
    • 精细标注图:5000 张(2975 张训练图、500 张验证图、1525 张测试图);
    • 粗略标注图:20000 张;
  • 支持任务:语义分割、实例分割。

3. COCO 数据集

  • 特点:以 “场景理解” 为目标,专门选取复杂日常场景图像;
  • 类别:共 91 类,以 “人类 4 岁小孩可辨识” 为标准,其中 82 类包含超过 5000 个实例(Instance)。

四、语义分割的评估指标

用于衡量分割结果的准确性,核心指标包括 5 个:

  1. Pixel Accuracy(逐像素分类精度):整体图像中分类正确的像素占总像素的比例;
  2. Mean Pixel Accuracy(平均像素精度):对每个类别单独计算 “正确分类像素比例”,再取所有类别的平均值;
  3. IoU(交并比):针对前景目标,计算 “预测目标区域与真实目标区域的交集” 与 “两者并集” 的比值;
  4. mIoU(平均交并比):对每个类别单独计算 IoU,再取所有类别的平均值(分割任务中最常用指标);
  5. FWIoU(加权平均交并比):根据每个类别在图像中出现的概率(像素占比)为 mIoU 赋予权重,更贴合实际数据分布。

五、图像分割网络的核心结构

1. 两大核心模块

图像分割网络的本质是 “先压缩特征、再恢复尺度”,依赖两个模块:

  • 卷积模块(编码器):通过卷积和池化(Max Pooling)操作提取图像特征,同时逐步缩小特征图尺寸;
  • 反卷积模块(解码器):通过反卷积(转置卷积)和上采样(Unpooling)操作,将缩小的特征图恢复到原图尺寸,最终输出像素级分类结果。

2. 关键技术:转置卷积(反卷积)

转置卷积是实现 “上采样” 的核心技术,与普通卷积呈 “转置关系”,具体对比如下:

  • 普通卷积:输入 4×4 特征图,经 3×3 卷积核处理后,输出 2×2 特征图(尺寸缩小);
  • 转置卷积(反卷积):输入 2×2 特征图,经 3×3 卷积核处理后,输出 4×4 特征图(尺寸放大);
  • 实现逻辑:两者均通过 “稀疏矩阵乘法” 实现,转置卷积的稀疏矩阵为普通卷积稀疏矩阵的转置(CT),确保尺度恢复的合理性。

3. 典型网络结构

以 “224×224 输入图像” 为例,网络流程为:

  • 编码器(卷积网络):224×224 → 112×112 → 56×56 → 28×28(每步通过 Max Pooling 缩小尺寸,提取高层特征);
  • 解码器(反卷积网络):28×28 → 56×56 → 112×112 → 224×224(每步通过 Unpooling 和反卷积放大尺寸,恢复像素类别信息)。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐