一文吃透图像分割
在计算机视觉领域,图像分类能告诉我们 “这张图里有什么”,目标检测能定位 “目标在哪里”,而图像分割则更进一步 —— 它要精确到像素级别,回答 “每个像素属于哪个目标或类别”。无论是手机修图的人像抠图、医院的医学影像分析,还是自动驾驶的路况识别,图像分割都是背后的核心技术。今天,我们就从基础概念到实战细节,带大家全面掌握图像分割的核心知识。
一、先搞懂:什么是图像分割?
简单来说,图像分割是对图像像素的 “细粒度分类”—— 它会遍历图像中的每一个像素,将其划分到对应的类别中,最终生成一幅 “像素级标签图”(也叫掩膜,Mask),清晰勾勒出目标的轮廓。
举个直观的例子:在一张包含 “行人 + 汽车 + 天空” 的图片中,图像分割会把 “行人” 的所有像素标为类别 A,“汽车” 的像素标为类别 B,“天空” 的像素标为类别 C,让每个目标的边界都精确到像素。
二、图像分割能做什么?5 大核心应用场景
图像分割的应用早已渗透到各行各业,以下是最典型的 5 个场景:
人像抠图:我们常用的修图软件(如 PS、醒图)中的 “一键抠图” 功能,本质就是对 “人像” 和 “背景” 进行二分类分割,精准分离人物轮廓。
医学组织提取:在 CT、MRI 影像中,分割技术能快速定位肿瘤、血管、器官等区域,帮助医生判断病变范围(比如分割肺癌患者的肿瘤区域,辅助制定手术方案)。
遥感图像分析:通过分割卫星拍摄的遥感图,可识别耕地、建筑、森林、水体等区域,用于农业估产、城市规划、灾害监测(如洪涝后统计被淹农田面积)。
自动驾驶:自动驾驶汽车的 “视觉大脑” 需要通过分割技术识别路面、行人、其他车辆、交通信号灯、护栏等,确保行驶安全(比如区分 “可行驶的路面” 和 “不可通行的护栏”)。
材料图像分析:在材料科学中,分割技术可分析材料的微观结构(如金属的晶粒分布、复合材料的成分区域),辅助优化材料性能。
三、图像分割的 “前景与背景”:Things vs Stuff
在图像分割中,我们通常将场景分为两类元素,这是理解后续技术的基础:
Things(前景目标):指 “可数的、有明确轮廓的物体”,比如行人、汽车、猫、狗。这类目标的特点是 “每个个体都是独立的”(比如图中有 3 个行人,就是 3 个独立的 Things)。
Stuff(背景区域):指 “不可数的、无明确个体边界的区域”,比如天空、草地、路面、墙壁。这类区域的特点是 “整体是一个类别,没有独立个体”(比如 “天空” 是一个整体,不会说 “一个天空”)。
简单总结:Things 是 “一个个独立的物体”,Stuff 是 “一片一片的区域”。
四、图像分割的 “三层境界”:从简单到复杂
根据分割精度和目标的不同,图像分割可分为三个层次,难度依次递增,应用场景也各有侧重:
1. 语义分割(Semantic Segmentation):“只分类别,不分个体”
语义分割的核心是 “给每个像素贴类别标签,但不区分同一类别的不同个体”。比如在一张有 3 只猫的图片中,语义分割会把所有猫的像素都标为 “猫”,但不会区分 “猫 1”“猫 2”“猫 3”。
关键特点:每个像素只能属于一个类别(无重叠),输出的是 “类别掩膜”。应用场景:只需知道 “区域类别” 的场景,比如遥感图像的 “耕地 / 建筑” 分类、医学影像的 “器官 / 非器官” 分割。
2. 实例分割(Instance Segmentation):“既分类别,又分个体”
实例分割在语义分割的基础上更进一步 —— 不仅要区分类别,还要区分同一类别的不同个体。比如在 3 只猫的图片中,实例分割会把 3 只猫分别标为 “猫 - 1”“猫 - 2”“猫 - 3”,同时给出每个猫的边界框(BBox)。
关键特点:只关注 “前景目标(Things)”,不分割背景(Stuff);同一类别的不同个体有独立 ID,每一个像素可以属于多个ID。应用场景:需要区分个体的场景,比如计数(统计商场内的行人数量)、目标跟踪(跟踪视频中某一个特定行人)。
3. 全景分割(Panoptic Segmentation):“前景 + 背景,全部分割”
全景分割是 “语义分割 + 实例分割” 的结合体 —— 既分割前景目标(Things,区分个体),也分割背景区域(Stuff,只分类别),实现 “图像中所有像素的完整分割”。
关键特点:每个像素点分配一个语义类别和一个唯一的实例ID。
每个像素都有 “语义类别 + 实例 ID”(背景区域的实例 ID 可设为 “无”)。比如一张包含 “2 个行人 + 1 辆汽车 + 天空 + 路面” 的图片,全景分割会:
行人 1:类别 = 行人,ID=1;
行人 2:类别 = 行人,ID=2;
汽车:类别 = 汽车,ID=3;
天空:类别 = 天空,ID = 无;
路面:类别 = 路面,ID = 无。
应用场景:需要完整场景理解的场景,比如自动驾驶(同时识别行人、车辆、路面、天空)、机器人导航(识别障碍物、可通行区域、目标物体)。
五、图像分割的 “弹药库”:3 大经典数据集
做深度学习离不开数据,图像分割领域有 3 个 “标杆级” 数据集,几乎所有分割模型的性能都需要在这些数据集上验证:
| 数据集 | 核心特点 | 类别数量 | 数据规模 | 适用场景 |
|---|---|---|---|---|
| VOC 数据集 | 世界级计算机视觉挑战赛数据集,标注规范 | 4 大类、20 小类 | VOC2007:9963 张图 / 24640 个目标;VOC2012:23080 张图 / 54900 个目标;分割标注图共 2913 张(1464 张训练 + 1449 张验证) | 语义分割、实例分割的入门实验 |
| Cityscape | 专注于 “城市街景”,场景多样性强 | 30 个类别 | 5000 张精细标注图(2975 训练 + 500 验证 + 1525 测试);20000 张粗略标注图 | 自动驾驶、街景分析 |
| COCO 数据集 | 以 “复杂日常场景” 为目标,贴近真实世界 | 91 类(82 类有超 5000 个实例) | 百万级图像,分割标注覆盖多场景(家居、户外、交通等) | 实例分割、全景分割的进阶实验 |
简单来说:新手入门用 VOC,研究自动驾驶用 Cityscape,做真实场景复杂分割用 COCO。
六、怎么评价分割效果?4 个核心评估指标
分割模型的 “好坏” 不能凭肉眼判断,需要量化指标。常用的 4 个指标如下:
1. 逐像素精度(Pixel Accuracy, PA)
最直观的指标:正确分类的像素数 / 总像素数。优点:计算简单;缺点:容易被 “样本不均衡” 影响(比如背景像素占 90%,即使只对背景分类正确,PA 也能达到 90%,但前景分割效果很差)。
2. 平均像素精度(Mean Pixel Accuracy, MPA)
解决 PA 的样本不均衡问题:先计算每个类别的 “正确分类像素数 / 该类总像素数”,再求所有类别的平均值。比如有 “行人”“汽车”“天空” 3 个类别,先分别算每个类别的精度,再取平均,能更公平地反映每个类别的分割效果。
3. 交并比(Intersection over Union, IoU)
分割任务的 “黄金指标”:模型预测的目标区域与真实目标区域的交集 / 两者的并集,取值范围 0~1(越接近 1,分割越精准)。比如预测的 “肿瘤区域” 与真实肿瘤区域的交集是 80,并有是 100,那么 IoU=0.8(80%)。
4. 平均交并比(mIoU)
所有类别的 IoU 的平均值,是目前分割任务的 “主流评估指标”(比如 VOC、Cityscape 比赛都用 mIoU 排名)。此外还有加权交并比(FWIoU):根据每个类别的像素数量给 IoU 加权(像素多的类别权重更大),更贴近实际应用场景。
七、图像分割网络的 “核心骨架”:卷积 + 反卷积

所有深度学习分割网络,本质都是 “先压缩特征,再恢复尺寸”,核心由两个模块组成:
1. 卷积模块(编码器,Encoder):“压缩图像,提取特征”
卷积模块的作用是 “下采样”—— 通过卷积层和池化层(如 Max Pooling),将图像的尺寸不断缩小(比如 224×224→112×112→56×56→28×28),同时提取图像的 “高层语义特征”(比如从边缘、纹理,到 “这是一只猫” 的抽象特征)。


2. 反卷积模块(解码器,Decoder):“恢复尺寸,生成掩膜”
编码器把图像压缩后,尺寸变小,无法直接作为分割结果(分割需要和原图尺寸一致)。这时候就需要 “反卷积(转置卷积)” 进行 “上采样”—— 将小尺寸的特征图恢复到原图尺寸(比如 28×28→56×56→112×112→224×224),最终生成与原图大小相同的分割掩膜。

关键:卷积与反卷积的 “转置关系”
卷积:输入 4×4 图像,用 3×3 卷积核,输出 2×2 特征图(尺寸缩小);
反卷积:输入 2×2 特征图,用 3×3 卷积核,输出 4×4 图像(尺寸放大);
本质:反卷积是卷积的 “逆操作”(数学上是转置关系),通过填充、权重调整,实现尺寸恢复。
八、典型分割网络的 “工作流程”
以最经典的 “卷积 - 反卷积” 架构为例,分割网络的工作流程如下:
- 输入图像:比如 224×224 的 RGB 图像;
- 编码器(卷积模块):通过多次 “卷积 + 池化”,将图像尺寸逐步缩小(224→112→56→28),同时提取高层特征;
- 解码器(反卷积模块):通过多次 “反卷积 + 上采样”,将特征图尺寸逐步恢复到 224×224;
- 输出掩膜:最后通过 Softmax 层,给每个像素分配类别标签,生成分割结果。

总结:从入门到进阶的学习路径
如果你想入门图像分割,可以按照以下步骤逐步深入:
- 理解基础:掌握 “语义 / 实例 / 全景分割” 的区别,熟悉 VOC/COCO 数据集;
- 学习指标:搞懂 mIoU 的计算逻辑,知道如何量化模型性能;
- 掌握核心模块:理解 “卷积下采样提特征、反卷积上采样恢复尺寸” 的原理;
- 实战模型:从简单模型(如 FCN)入手,再学习进阶模型(如 U-Net、Mask R-CNN);
- 实验验证:在 VOC 或 Cityscape 上跑通模型,对比不同参数对 mIoU 的影响。
图像分割是计算机视觉中 “精度要求最高” 的任务之一,也是最贴近实际应用的技术方向。随着大模型的发展,分割技术的精度和效率还在不断提升,未来在医疗、自动驾驶、机器人等领域会有更广泛的应用。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)