High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy

高精度二分类图像分割:基于深度完整性先验与细粒度分块策略

理解

用两种关键技术解决 “高分辨率图像中精准区分前景和背景” 的问题

高精度二分类图像分割:像素级精准,只分两类 ——“要保留的目标(前景)” 和 “要去掉的背景”

核心技术:

  1. 深度完整性先验(解决 “怎么准确区分前景背景”)
    1. 伪深度图:用专门的模型(论文里是 DAM-V2)给普通 RGB 图像生成一张 “深度图”,这张图里的数值代表每个像素的 “远近”—— 目标(比如苹果)的像素值接近,背景(比如桌子、墙面纹理)的像素值混乱。
    2. 核心发现:前景目标的深度值特别 “稳定”(比如苹果的所有像素,深度值差异很小,方差低),而背景的深度值特别 “混乱”(比如墙面纹理的像素,深度值波动大)。
    3. 把这个规律当成 “指导信号”,让模型知道 ——“深度值稳定、方差小的区域,大概率是要找的目标;深度值混乱的,大概率是背景”,从根源上减少误检和漏检。
  2. 细粒度分块策略(解决 “高分辨率图像细节怎么抓准”)
    1. 分块:把一张大的高分辨率图像,分成很多小 patches(论文里是 8×8=64 块,比之前的 2×2 块密集得多),每块聚焦一个局部区域
    2. 细粒度的优势:高分辨率图像细节多(比如衣服上的花纹、物体的边缘),大区域处理容易忽略细节,小分块能精准捕捉这些 “细枝末节”
    3. 关键优化:不是盲目分块,而是 “自适应选择”—— 重点关注包含目标边界的分块,给这些分块更高的权重,同时抑制背景分块的干扰,既抓得细,又不浪费算力。

摘要

高精度二分类图像分割(DIS)是一项从高分辨率图像中提取细粒度目标的任务。现有方法面临一个困境:非扩散模型效率较高,但由于语义信息薄弱且空间先验不够稳健,容易出现误检或漏检问题;扩散模型借助强大的生成先验,虽能实现高精度分割,但存在计算开销大的问题。为此,我们发现来自单目深度估计模型的伪深度信息能够提供关键的语义理解,可快速揭示目标物体与背景之间的空间差异。受这一现象启发,我们提出了一种新颖的见解 ——深度完整性先验:在伪深度图中,前景物体始终呈现出稳定的深度值,其方差远低于杂乱的背景图案。为充分利用这一先验知识,我们设计了一种深度融合先验网络(PDFNet)。具体而言,该网络通过建立多模态交互建模,深度融合 RGB 特征与伪深度特征,实现深度引导的结构感知。我们还引入了一种新颖的深度完整性先验损失,以明确强化分割结果中的深度一致性。此外,我们设计了一个带有自适应分块选择的细粒度感知增强模块,用于执行边界敏感的细节优化。值得注意的是,PDFNet 仅需 9400 万参数量(不足扩散类模型参数量的 11%),便实现了最先进的性能,不仅优于所有非扩散模型,还超越了部分扩散模型。相关代码已开源至:https://github.com/Tennine2077/PDFNet

理解1

现有方法面临一个困境:非扩散模型效率较高,但由于语义信息薄弱且空间先验不够稳健,容易出现误检或漏检问题;扩散模型借助强大的生成先验,虽能实现高精度分割,但存在计算开销大的问题。

图像分割的核心需求是 “又快又准”:既要能快速处理高分辨率图像(比如手机修图、AR 实时抠图),又要精准区分前景(比如要抠的人 / 物)和背景

  1. 非扩散模型:“跑得快,但容易犯错”
    1. 优点(效率高):这类模型比如常见的 CNN、Transformer 架构,参数量不大,推理速度快,不用占太多算力,适合实际应用场景。
    2. 缺点(易误检 / 漏检):语义信息薄弱:模型 “看不懂” 图像内容,只能靠像素颜色、纹理这些表面特征判断;空间先验不稳健:对物体的 “空间结构” 判断不准,比如不知道 “杯子” 应该是一个完整的立体结构,容易把杯子把手漏检,或把杯子旁边的桌面纹理误判成杯子的一部分。
  2. 扩散模型:“做得准,但跑得极慢”
    1. 优点(精度高):这类模型(比如论文里的 DiffDIS、GenPercept)用了超大规模预训练模型(相当于见过几十亿张图像),有 “强大的生成先验”—— 能理解物体的语义(知道 “杯子” 是什么)和真实结构(知道杯子的形状、前后关系),分割出来的结果特别精准,几乎不会出错。
    2. 缺点(计算开销大):参数量超大:论文里提到这类模型参数量超过 865M,是非扩散模型的好几倍甚至十几倍;速度极慢:每秒处理不了 1 帧(FPS<1),比如处理一张高清图要好几秒,完全没法用在需要实时响应的场景(比如直播抠图、AR 互动)。
理解2

我们发现来自单目深度估计模型的伪深度信息能够提供关键的语义理解,可快速揭示目标物体与背景之间的空间差异。

用一张普通照片(单目图像)就能算出 “伪深度图”,这张图能帮模型 “看懂” 物体的空间结构,快速分清 “要分割的目标” 和 “背景”

单目深度估计模型:不用雷达、双目相机,只用一张普通 RGB 照片,就能估算出照片里每个像素 “离镜头有多远” 的模型

伪深度信息:不是真实测量的深度(比如雷达数据),是模型 “算出来” 的深度值,但精度足够用。伪深度图里,数值越接近,代表距离越近;数值差异大,代表距离差得多。

空间差异:就是目标(比如杯子)和背景(比如桌面、墙面)在 “前后远近” 上的区别 —— 目标是一个紧凑的空间整体,背景是不同距离的其他物体 / 区域。

普通 RGB 照片只能提供 “颜色、纹理” 这些表面信息,比如杯子和桌面颜色接近时,模型容易分不清;但伪深度图能直接给出 “距离” 信息:

  1. 杯子(目标)的所有像素,深度值都很接近(因为杯子是一个立体整体,离镜头距离差不多);
  2. 桌面、墙面(背景)的像素,深度值和杯子差异明显(比如桌面比杯子远一点,墙面更远)。

这种 “深度值的差异”,其实就是空间结构的体现 —— 模型不用纠结颜色纹理,只要看伪深度图,就能快速 get“哪些像素属于同一个空间整体(目标),哪些属于不同的空间区域(背景)”

之前的非扩散模型之所以容易误检、漏检,就是因为只靠 RGB 颜色纹理,“看不懂” 空间结构 ;而伪深度图刚好补上了这个短板

  1. 它是 “低成本获取” 的(一张照片就能生成,不用额外设备);
  2. 它是 “强引导” 的(空间差异比颜色纹理更能准确区分目标和背景);
  3. 它还 “快”(DAM-V2 生成伪深度图的速度远超扩散模型的计算速度)。
理解3

具体而言,该网络通过建立多模态交互建模,深度融合 RGB 特征与伪深度特征,实现深度引导的结构感知。

让模型同时 “看颜色纹理”(RGB 特征)和 “感知远近”(伪深度特征),并且让这两种信息互相配合、动态交流,最终靠 “远近信息” 引导模型看懂物体的真实空间结构,而不只是被表面颜色纹理迷惑

PDFNet 通过专门的跨模态注意力(CoA)模块实现这种交互,流程如下:

  1. 分别提取特征:模型的主编码器先从 RGB 图像中提取 “颜色纹理特征”(比如 “红色、圆形边缘”),再从伪深度图中提取 “空间深度特征”(比如 “深度值稳定、离镜头近”)。
  2. 动态交互验证:CoA 模块让两种特征 “对话”—— 比如 RGB 特征指向 “红色区域”,伪深度特征会检查这个区域的深度方差是否小(是不是一个完整物体);如果深度方差大(比如红色背景的纹理),就降低这个区域的权重,避免误判。
  3. 深度引导聚焦:伪深度特征会 “主导方向”—— 明确告诉模型 “深度稳定、方差小的区域,大概率是有完整结构的目标;深度混乱的区域,大概率是背景”。模型不再只盯着颜色,而是优先关注 “空间结构合理” 的区域。
理解4

我们还引入了一种新颖的深度完整性先验损失,以明确强化分割结果中的深度一致性。

给模型加一个 “专项纠错规则”—— 通过惩罚 “分割结果不符合深度规律” 的错误,强制让分割出的目标在 “深度” 上保持一致,避免出现 “看着像目标、但深度逻辑不通” 的误检 / 漏检

“深度一致性” 本质是两个要求,刚好对应这个损失的两个核心约束:

  1. 目标内部的深度要稳定:分割出来的前景目标(比如杯子),所有像素的深度值必须接近(方差小),不能出现 “杯子主体深度近、杯子把手深度远” 这种不符合物理逻辑的情况;
  2. 目标边界的深度要连续:目标和背景的边界,必须和深度图里的 “深度突变处” 对齐(比如杯子边缘对应深度值突然变化的地方),不能出现 “分割边界在深度值平缓的背景中间” 这种错位。
理解5

此外,我们设计了一个带有自适应分块选择的细粒度感知增强模块,用于执行边界敏感的细节优化。

通过高密度细粒度分块捕捉物体微小细节,再动态筛选出关键区域重点优化,最终让分割结果的边界(比如发丝、物体边缘)更精准,细节更完整

两个核心设计:

  1. 细粒度分块:把图像拆成 “小格子”,精准盯细节
  2. 自适应分块选择:不盲目处理所有格子,只盯 “关键区域”

Hi-End-MAE: Hierarchical encoder-driven masked autoencoders are stronger vision learners for medical image segmentation

Hi-End-MAE:分层编码器驱动的掩码自编码器是更强的医学影像分割视觉学习模型

理解

Hi-End-MAE 是一款针对医学影像分割优化的视觉学习模型,核心优势来自 “分层编码器驱动” 的设计

掩码自编码器(MAE):先 “遮住” 部分医学影像(比如 CT 扫描的部分像素块),再让模型学习还原被遮住的内容,通过这个过程自动提取影像特征,不用依赖大量人工标注的标签。

分层编码器驱动:和传统 MAE “解码器主导还原” 不同,它让编码器成为学习核心,同时利用编码器不同层的特征(比如第 3、6、9 层),而非只依赖最后一层的输出,这样能捕捉到更细致的解剖结构信息(比如血管的管状结构、肝脏的整体形态)。

Hi-End-MAE 本质是通过 “让编码器更专注学习解剖特征”+“整合多层特征信息”,优化了传统掩码自编码器的设计,专门适配医学影像分割的需求

摘要

由于标签稀缺,医学影像分割仍是一项艰巨的挑战。通过在大规模无标签医学数据集上利用掩码图像建模(MIM)对视觉 Transformer(ViT)进行预训练,是一种很有前景的解决方案 —— 既能保证计算效率,又能提升模型在各类下游任务中的泛化能力。然而,当前基于 ViT 的 MIM 预训练框架大多侧重于输出层的局部聚合表征,未能充分利用 ViT 不同层级的丰富表征,而这些表征能更好地捕捉更精准的医学下游任务所需的细粒度语义信息。

为填补这一空白,我们提出了分层编码器驱动的掩码自编码器(Hi-End-MAE)—— 一种简洁且高效的基于 ViT 的预训练方案,其核心包含两项关键创新:(1)编码器驱动的重建,即促使编码器学习更具信息量的特征,以指导掩码块的重建;(2)分层密集解码,即通过分层解码结构捕捉不同层级的丰富表征。我们在包含 1 万例 CT 扫描的大规模数据集上对 Hi-End-MAE 进行预训练,并在 7 个公开的医学影像分割基准数据集上评估其性能。大量实验表明,Hi-End-MAE 在各类下游任务中展现出卓越的迁移学习能力,彰显了 ViT 在医学影像应用中的潜力。

代码已开源,地址为:https://github.com/FengheTan9/Hi-End-MAE

理解1

通过在大规模无标签医学数据集上利用掩码图像建模(MIM)对视觉 Transformer(ViT)进行预训练,是一种很有前景的解决方案 —— 既能保证计算效率,又能提升模型在各类下游任务中的泛化能力。

掩码图像建模(MIM):故意遮住医学影像的部分区域(比如 75% 的 CT 像素块),让模型学习还原被遮住的内容,全程不用依赖标签。

下游任务:预训练后要完成的具体医学影像任务,比如肺结节分割、脑肿瘤识别、多器官定位等。

理解2

一种简洁且高效的基于 ViT 的预训练方案,其核心包含两项关键创新:(1)编码器驱动的重建,即促使编码器学习更具信息量的特征,以指导掩码块的重建;(2)分层密集解码,即通过分层解码结构捕捉不同层级的丰富表征。

Hi-End-MAE 用两种简洁且直击痛点的设计,让 ViT 模型在医学影像预训练中 “学更深、学更全”—— 既让编码器掌握精准的解剖特征,又不浪费 ViT 各层的有用信息,最终适配医学影像分割的需求。

  1. 编码器驱动的重建
    1. 传统 MAE 里,编码器只负责提取基础特征,解码器要花大量精力整合信息、还原掩码块
    2. 而 Hi-End-MAE 里,解码器只做 “辅助查询”—— 用掩码区域的 “查询信号”,去问编码器已经学到的可见区域特征,直接用编码器的特征来还原掩码块。
    3. 这就倒逼编码器必须学习 “更有用的特征”(比如血管的管状结构、肝脏的轮廓边界),因为还原掩码块的质量完全依赖编码器的特征质量。如果编码器学的特征模糊,就没法精准还原被遮住的器官部分,相当于 “逼着” 编码器把医学影像的解剖细节学扎实。
  2. 分层密集解码
    1. ViT 模型有多层 Transformer 结构(比如 12 层),传统 MIM 只用到最后一层的输出特征
    2. 而 “分层密集解码” 会让解码器主动去抓取 ViT 不同层级的特征(比如第 3、6、9 层),再通过自下而上的方式整合起来。
    3. ViT 不同层的特征各有价值 —— 浅层特征能捕捉器官边缘、纹理等细粒度细节,深层特征能捕捉器官整体形态、解剖位置等全局信息。分层解码把这些信息全利用起来,就能形成 “细节 + 全局” 的完整表征,刚好弥补 ViT 缺乏空间归纳偏置的短板,适配医学影像复杂的解剖结构。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐