图像分割本质上就是给图片 “分类贴标签”,就像我们给水果分类、给房间分区一样简单。今天就用最通俗的语言,带你认识 7 种常见的图像分割类型,让你秒变 “分割小能手”。

一、先搞懂:什么是图像分割?​

我们先从生活场景入手。假设你有一张包含 “猫、狗、沙发、地板” 的照片,图像分割就是让电脑像人一样,把照片里的每一块区域 “分开”,并告诉我们 “这是猫”“那是狗”“这是沙发”“那是地板”。​

简单说:图像分割 = 给图片里的 “区域” 贴 “身份标签”。不同的分割类型,本质就是 “贴标签的规则不一样”—— 有的只分 “类别”,有的还要分 “个体”,有的甚至需要我们手动帮忙。

二、7 种常见分割类型

1. 语义分割:给 “类别” 贴标签,不管 “个体”​

核心逻辑:​

只区分 “是什么类别”,不区分 “同一个类别里的不同个体”。就像你去超市买水果,只把 “苹果、香蕉、橙子” 分开,不管这是 “苹果 A” 还是 “苹果 B”。​

举个例子:​

一张包含 3 只猫、2 只狗的照片,语义分割会把 “所有猫” 标成 “猫”(比如都涂成黄色),“所有狗” 标成 “狗”(比如都涂成蓝色),“背景地板” 标成 “地板”(比如涂成灰色)。但你分不清哪只是 “猫 1”,哪只是 “猫 2”。​

应用场景:​

  • 自动驾驶:让汽车知道 “这是道路”“这是行人”“这是树木”(不用区分 “行人 A” 和 “行人 B”,只要知道是行人就行);​
  • 卫星地图:区分 “农田、森林、建筑区”(只要知道区域类型,不用管具体哪块农田)。

2. 实例分割:给 “类别 + 个体” 贴标签,只关注 “前景”​

核心逻辑:​

不仅要分 “类别”,还要分 “同一个类别里的不同个体”,但只关注 “前景物体”(比如动物、人、车),不管 “背景”(比如地板、天空)。就像老师给班级同学点名,既要知道 “这是学生”(类别),还要知道 “这是小明”“这是小红”(个体),但不管教室的墙壁(背景)。​

举个例子:​

还是那张 3 只猫、2 只狗的照片,实例分割会把 “猫 1” 标成 “黄色 1 号”,“猫 2” 标成 “黄色 2 号”,“猫 3” 标成 “黄色 3 号”;“狗 1” 标成 “蓝色 1 号”,“狗 2” 标成 “蓝色 2 号”。但对 “地板”“沙发” 这些背景,完全不标注。​

应用场景:​

  • 安防监控:统计 “某区域有多少个行人”“多少辆汽车”(需要区分个体才能计数);​
  • 电商质检:检测 “一批零件里有多少个合格件、多少个次品”(要区分每个零件的个体)。

3. 全景分割:“语义 + 实例” 二合一,背景也不放过​

核心逻辑:​

同时实现 “语义分割” 和 “实例分割” 的功能 —— 既分 “类别”,又分 “前景个体”,还会给 “背景” 贴标签。就像你给家里做收纳,既要把 “衣服、书本、零食” 分开(类别),还要把 “衣服 1、衣服 2”“书本 1、书本 2” 分开(个体),同时给 “衣柜、书架、桌子” 这些家具(背景)也贴好标签。​

举个例子:​

那张猫和狗的照片,全景分割会:​

  • 前景:“猫 1(黄 1)、猫 2(黄 2)、猫 3(黄 3)、狗 1(蓝 1)、狗 2(蓝 2)”;​
  • 背景:“沙发(灰 1)、地板(灰 2)、墙壁(灰 3)”。​

应用场景:​

  • 自动驾驶(进阶版):不仅要知道 “这是行人、这是道路”,还要知道 “行人 1 在左边、行人 2 在右边”,同时标注 “红绿灯、护栏” 这些背景,方便规划路线;​
  • 城市管理:统计 “某路口有多少辆车、多少个行人”,同时区分 “人行道、非机动车道、绿化带”,判断是否有违规占用情况。

4. 超像素分割:把图片切成 “小积木”,不管类别​

核心逻辑:​

不关心 “这是什么”,只把图片分成很多 “颜色 / 纹理相似的小方块”(叫 “超像素”)。就像你把一张拼图拆开,变成一个个小拼块,每个拼块里的图案是相似的,但你不知道这个拼块对应 “猫” 还是 “沙发”。​

举个例子:​

一张有蓝天、白云、草地的照片,超像素分割会把 “蓝天” 切成几个蓝色小方块,“白云” 切成几个白色小方块,“草地” 切成几个绿色小方块。这些小方块没有 “类别标签”,只是 “相似像素的集合”。​

应用场景:​

  • 图片预处理:比如给图片打马赛克,先切成超像素,再模糊处理,比直接模糊像素更自然;​
  • 辅助标注:人工给图片标注时,不用一个像素一个像素标,只要标 “超像素块” 就行,能节省很多时间。

5. 交互式分割:“你指哪,我分哪”,需要手动帮忙​

核心逻辑:​

电脑自己分不准,需要你 “手动提示”—— 比如你用鼠标在图片上点一下 “这是猫”,再点一下 “这是背景”,电脑根据你的提示,把 “猫” 和 “背景” 分开。就像你教小朋友认水果,你指着一个苹果说 “这是苹果”,指着一个香蕉说 “这是香蕉”,小朋友就知道怎么分了。​

举个例子:​

你想把一张 “人物和复杂背景” 的照片里的人抠出来,直接让电脑分,可能会把 “头发” 和 “背景树” 搞混。这时候你用鼠标在 “人物衣服” 上涂一下(提示 “这是前景”),在 “背景树” 上涂一下(提示 “这是背景”),电脑就能准确抠出人物了。​

应用场景:​

  • 图像编辑:比如 PS 里的 “快速选择工具”,你用鼠标涂抹要选的区域,软件就会自动分割;​
  • 医学影像标注:医生看 CT 影像时,需要分割 “肿瘤” 区域,电脑自己分不准,医生用鼠标点一下 “这是肿瘤”,电脑就能辅助生成精确的肿瘤分割图。

6. 视频分割:给 “动态画面” 分割,保证 “连贯不跳变”​

核心逻辑:​

针对 “视频”(不是图片)的分割,不仅要分 “每一帧画面”,还要保证 “同一物体在不同帧里的标签一致”。就像你看动画片,里面的 “主角” 在第一帧是 “红色”,在第二帧、第三帧也得是 “红色”,不能一会儿红、一会儿蓝,否则会很奇怪。​

举个例子:​

一段 “小狗跑过草地” 的视频,视频分割会在每一帧里把 “小狗” 标成 “黄色”,“草地” 标成 “绿色”,“天空” 标成 “蓝色”。而且不管小狗跑到哪里,每一帧里的 “小狗” 都是同一个 “黄色标签”,不会变成其他颜色。​

应用场景:​

  • 视频抠图:比如把视频里的 “人物” 抠出来,替换成 “太空背景”,让人物看起来像在太空里;​
  • 智能监控:追踪 “某个人从门口走到电梯” 的全过程,每一帧都能准确标注 “这个人”,不会跟丢。

7. 医学影像分割:给 “身体内部” 分割,精准定位病变​

核心逻辑:​

专门针对 “CT、MRI、超声” 等医学影像的分割,目标是 “找到身体里的特定器官或病变”—— 比如在 CT 影像里分割 “肝脏”“肺结节”“肿瘤”。因为医学影像很复杂(比如灰度不均、有噪声),所以这种分割要求 “特别精准”,一点都不能错。​

举个例子:​

医生给病人做肺部 CT,医学影像分割会把 “肺部” 标成 “浅蓝色”,把 “肺里的结节” 标成 “红色”,把 “其他器官(比如心脏)” 标成 “灰色”。这样医生就能快速找到 “结节” 的位置和大小,判断是否有问题。​

应用场景:​

  • 疾病诊断:比如通过分割 “脑肿瘤”,判断肿瘤的类型和分期;​
  • 手术规划:比如肝脏手术前,分割 “肝脏” 和 “肿瘤”,确定手术要切除的部分,避免伤到其他器官;​
  • 治疗评估:比如化疗后,对比 “治疗前肿瘤大小” 和 “治疗后肿瘤大小”,看治疗有没有效果。

三、总结

分割类型

核心目标(贴标签规则)

简单类比

常见应用

语义分割

分 “类别”,不分 “个体”,全图覆盖

超市分水果(苹果 / 香蕉)

自动驾驶(道路 / 行人)

实例分割

分 “类别 + 个体”,只关注 “前景”

老师点名(小明 / 小红)

安防统计(人数 / 车数)

全景分割

分 “类别 + 前景个体 + 背景”,全图覆盖

家里收纳(衣服 / 衣柜)

自动驾驶进阶 / 城市管理

超像素分割

分 “相似像素块”,不分类别

拆拼图(小拼块)

图片预处理 / 辅助标注

交互式分割

需手动提示,按提示分割

教小朋友认水果

图像编辑(抠图)/ 医学标注

视频分割

分 “动态画面”,保证帧间一致

动画片主角颜色不变

视频抠图 / 智能监控追踪

医学影像分割

分 “器官 / 病变”,要求精准

医生找肿瘤

疾病诊断 / 手术规划

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐