医学图像分割论文

ConDSeg: A General Medical Image Segmentation Framework via Contrast-Driven Feature Enhancement

2024年12月11日发表在arxiv上

理解

ConDSeg: 一种通过对比驱动特征增强的通用医学图像分割框架

传统方法:给AI看很多标注好的图片,告诉它“这些像素是肿瘤,那些不是”。AI会尝试学习肿瘤的纹理、形状等特征。但当肿瘤与周围组织对比度很低、边界模糊时,AI就容易犯错。

对比驱动:在训练过程中,模型不仅仅看单张图片,它会主动地、有目的地去比较

它会从图像中提取很多小块的“特征”,比如一个图像块来自肿瘤中心,一个来自肿瘤边缘,一个来自附近的健康组织。

然后,模型通过对比学习,调整自己的参数,使得:

  1. 正样本对(例如,两个都来自肿瘤区域的特征)在模型的“特征空间”里位置非常接近。
  2. 负样本对(例如,一个来自肿瘤,一个来自健康组织的特征)在“特征空间”里位置被拉得很远。

特征增强:这种“比较”的过程,迫使模型去关注那些能够真正区分不同类别的、更本质的特征。它不再只是被动地记忆图案,而是主动地学习“什么特征让肿瘤是肿瘤,而不是肝组织”。这个过程增强了模型所学特征的判别能力

摘要

医学图像分割在临床决策制定、治疗方案规划和疾病追踪方面发挥着重要作用。然而,该技术仍面临两大主要挑战:一方面,医学图像中前景与背景之间往往存在 “软边界”,且光照不佳和对比度低的问题会进一步降低图像中前景与背景的可区分度;另一方面,共现现象在医学图像中普遍存在,对这类特征的学习会误导模型的判断。

为应对这些挑战,我们提出了一个名为 “对比驱动医学图像分割(ConDSeg)” 的通用框架。首先,我们设计了一种名为 “一致性强化(Consistency Reinforcement)” 的对比训练策略,该策略旨在提升编码器在不同光照和对比度场景下的鲁棒性,使模型即便在恶劣环境中也能提取高质量特征。其次,我们引入了 “语义信息解耦(Semantic Information Decoupling)模块”,该模块能够将编码器输出的特征解耦为前景、背景和不确定区域三类特征,并在训练过程中逐步获得降低不确定性的能力。随后,“对比驱动特征聚合(Contrast-Driven Feature Aggregation)模块” 会对前景与背景特征进行对比,以此引导多级别特征融合和关键特征增强,进一步区分待分割目标。此外,我们还提出了 “尺寸感知解码器(Size-Aware Decoder)”,以解决解码器的尺度单一问题。该解码器能精准定位图像中不同尺寸的目标,从而避免模型对共现特征的错误学习。

我们在涵盖三种场景的五个医学图像数据集上进行了大量实验,实验结果表明我们的方法实现了当前最先进的性能,证明了该方法的先进性及其在各类医学图像分割场景中的通用适用性。我们已开源相关代码,获取地址为:https://github.com/MengqiLei/ConDSeg

理解1

一方面,医学图像中前景与背景之间往往存在 “软边界”,且光照不佳和对比度低的问题会进一步降低图像中前景与背景的可区分度;另一方面,共现现象在医学图像中普遍存在,对这类特征的学习会误导模型的判断。

医学图像分割中最核心、最棘手的两个挑战:软边界、光照不佳与低对比度;共现现象

软边界、光照不佳与低对比度:目标看不清楚

“软边界”:在很多情况下,我们想要分割的物体(如肿瘤、器官边缘)与周围正常组织之间,并没有一条清晰、锐利的分界线。相反,它们的边界是模糊的、渐变的、相互渗透的。例如:脑胶质瘤(一种脑肿瘤)的浸润性生长方式,其边缘就像树根一样扎入正常的脑组织中,在MRI影像上无法找到一个绝对的边界。

“光照不佳和对比度低”:医学成像设备(如CT、MRI)生成的图像本身可能存在质量问题。光照不佳(可理解为信号强度不均)和低对比度,使得不同组织之间的灰度或颜色差异非常小。例如:在某些CT扫描中,早期肺癌的结节(前景)与其周围的肺组织(背景)密度非常接近,看起来就像一块几乎透明的玻璃,这就是著名的“磨玻璃结节”,其分割极具挑战性。

共现现象:模型学会了错误的关联看到A就以为是B

“共现现象”:指的是在训练数据中,某些物体或特征经常同时出现。模型为了更“轻松”地完成训练任务,可能会走捷径,不去学习目标物体真正的、本质的特征,而是去学习这些偶然的、表面的关联性。

虚假关联:模型发现,只要图像中有A特征,就很可能有B物体。于是,它就把A特征当成了判断B物体的决定性依据。

导致误判:当在一张新图像中,A特征出现了,但B物体其实并不存在时,模型就会产生错误的判断。

例如:要分割一张胸部X光片中的心脏

  1. 在绝大多数训练图片中,“心脏” 和 “胸骨” 总是同时出现在图像的特定位置。
  2. 模型可能并没有真正学会心脏的形状和纹理特征,而是简单地学会了:“哦,只要在图片中央看到一条竖状的、高密度的结构(胸骨),那么它旁边那一大块区域就应该是心脏。”
  3. 当遇到一张胸骨位置异常或有畸形的X光片时,模型就会错误地将心脏分割到错误的位置,因为它依赖的“路标”(胸骨)失效了。它把“胸骨”这个共现特征,误当成了“心脏”的判定特征。
理解2

首先,我们设计了一种名为 “一致性强化(Consistency Reinforcement)” 的对比训练策略,该策略旨在提升编码器在不同光照和对比度场景下的鲁棒性,使模型即便在恶劣环境中也能提取高质量特征。

核心目的:解决“看不清”的问题

问题来源:医学图像常存在光照不均、对比度低的问题,这导致同一器官或肿瘤在不同图像中看起来差异很大。

目标:让模型学会忽略这些无用的、干扰性的环境变化,而专注于物体本质的、不变的结构性特征(比如肝脏的特定形状、肿瘤的独特纹理)

实现方法:对比学习

“一致性强化”:

  1. 创造“副本”并施加干扰:对于训练集中的同一张医学图像,模型会创建多个不同的“副本”或“视图”。对这些副本施加各种光照变化、对比度调整、噪声干扰等,模拟现实中可能遇到的“恶劣环境”。这样一来,同一张图片就有了多个“看起来不一样”的版本。
  2. 强制要求“认出彼此”:模型的核心任务是:尽管这些副本看起来不同,但模型需要从中提取的特征在本质上是“一致”的。在训练过程中,模型被要求将这些来自同一源图像、但经过不同干扰的副本,在特征空间里拉近距离(视为“正样本对”)。同时,将来自不同源图像的副本,即使它们可能偶然看起来相似,在特征空间里推远距离(视为“负样本对”)。

通过迫使模型在多种扭曲的图像中寻找“一致性”,它极大地增强了编码器的鲁棒性。最终,当一个真实的、光照不佳、对比度低的医学图像输入时,这个经过“千锤百炼”的编码器已经见惯了各种“恶劣环境”,因此依然能够稳定地提取出高质量的、代表物体本质的特征

理解3

其次,我们引入了 “语义信息解耦(Semantic Information Decoupling)模块”,该模块能够将编码器输出的特征解耦为前景、背景和不确定区域三类特征,并在训练过程中逐步获得降低不确定性的能力。

它能把模糊的初步判断,梳理成清晰的“是”、“否”和“待定”三份档案,并持续学习如何减少“待定”档案的数量。

核心目的:解决“边界模糊”的问题

问题来源:医学图像中的“软边界”意味着存在大量难以判断属于前景(如肿瘤)还是背景(如正常组织)的像素。传统模型会强行给每个像素一个“是”或“否”的标签,这在边界处极易出错。

目标:承认不确定性的存在,并显式地、有策略地处理它。不是粗暴地二选一,而是将问题分解,集中精力解决最困难的部分。

工作原理:

  1. 接收特征:模块接收来自编码器的、包含丰富但混杂信息的原始特征图。
  2. 特征解耦:模块通过特定的网络结构(通常是不同的卷积层或注意力机制),将这批原始特征分解成三个独立的、各司其职的特征通道
    1. 前景特征:主要包含模型确信是目标物体(如肿瘤)的信息。
    2. 背景特征:主要包含模型确信是非目标区域的信息。
    3. 不确定区域特征:专门捕捉那些模棱两可、难以判断的边界区域信息。
  3. 动态优化与减少不确定性
    1. 在训练初期,由于模型能力较弱,不确定区域可能会很大,覆盖了大量的边界。
    2. 随着训练的进行,模型通过损失函数的引导,逐步学习如何将“不确定区域”中的特征,更准确地归类到“前景”或“背景”中
    3. 这个过程就像是 “逐步缩小待定选区” 。模型的能力体现在:它不仅能识别出明确的部分,更能学会如何聚焦于模糊地带,并提升对这些地带的判断力。

“语义信息解耦”模块:“语义”指的是图像内容的意义或类别,这里指编码器提取出的、能够帮助判断像素类别的高级特征,特指那些与类别判断相关的特征目的:处理语义模糊性(特别是边界的不确定性)

理解4

随后,“对比驱动特征聚合(Contrast-Driven Feature Aggregation)模块” 会对前景与背景特征进行对比,以此引导多级别特征融合和关键特征增强,进一步区分待分割目标。

通过“找不同”来“抓重点”通过系统地比较“是什么”和“不是什么”,来精确地聚焦并强化目标最独特的特征

核心目的:解决“如何聚焦关键特征”的问题

问题来源:即使前景和背景特征已经被解耦开来,模型在融合不同层次的特征(如浅层的细节特征和深层的语义特征)时,仍然可能“分不清主次”,无法在复杂环境中突出最关键、最具有判别力的信息。

目标:主动地、有指导地进行特征融合,确保融合后的特征能够最大化地区分前景和背景。

工作原理:对比驱动特征聚合

对比:

  1. 模块接收来自前面“语义信息解耦模块”的、已经初步分离的前景特征背景特征
  2. 此时,它不再将它们视为孤立的个体,而是将其视为一对 “正-反”范例。它开始系统性地比较:“目标区域(前景)和非目标区域(背景)之间,究竟有什么根本性的区别?”
  3. 这种比较不是在像素层面,而是在高维特征空间里进行的,比较的是它们的纹理、形状、上下文关系等抽象属性。

驱动:

  1. 通过对比,模块会计算出一个差异图注意力权重图。这个图清晰地标识出:“哪些特征对于区分前景和背景最为重要?”
  2. 例如,它可能会发现,某种特定的纹理模式在前景中非常普遍,但在背景中极其罕见。那么,代表这种纹理的特征就会被赋予极高的权重
  3. “驱动”一词的精髓就在于此:这个由“对比”产生的、代表“差异重要性”的权重图,将成为后续所有操作的“指挥棒”或“驱动力”(指导原则)

特征聚合:

  1. 模型要开始融合来自编码器不同层次(如浅层、中层、深层)的特征了。这是一个关键步骤,因为浅层特征包含精确定位信息(边缘、细节),而深层特征包含高级语义信息(“这是肝脏”)。
  2. 传统的特征聚合:可能只是简单地将它们相加或拼接起来,没有侧重点。
  3. 本模块的“对比驱动”聚合
    1. 它利用上一步生成的“注意力权重图”作为指导。
    2. 在融合多级特征时,它会显著增强那些被权重图标记为 “关键判别性” 的特征,同时抑制那些对区分前景背景帮助不大的特征。
    3. 结果是,融合后的特征不再是所有信息的简单堆砌,而是一个 “锐化” 后的、“突出重点” 的特征表示,其中目标最独特的特征被放大了。
理解5

此外,我们还提出了 “尺寸感知解码器(Size-Aware Decoder)”,以解决解码器的尺度单一问题。该解码器能精准定位图像中不同尺寸的目标,从而避免模型对共现特征的错误学习。

一个配备了“多套不同焦距镜头”的摄影师,他懂得根据目标的远近和大小,灵活切换最合适的镜头来精准对焦,而不是只用一套标准镜头去拍所有东西,从而避免了将无关的背景也拍进焦点。

核心目的:解决“尺度单一”与“共现特征误导”

尺度单一问题:传统的解码器在从上采样恢复图像细节时,通常对所有尺寸的目标使用同一种策略或感受野。

共现特征误导:模型可能会因为大目标(如心脏)经常与小目标(如特定血管)同时出现,而错误地将一些本不属于大目标的特征(血管的纹理)当作识别大目标的关键。

工作原理:“多路径并行”与“尺寸特异性处理”

尺寸感知解码器:承认不同尺寸的目标需要不同的处理方式

多路径/多分支设计:解码器内部并非单一通路,而是包含多条并行的处理路径。每一条路径都经过专门优化,用于处理和重建特定尺度范围的目标特征。

  1. 一条路径专注于大目标:可能拥有较大的感受野,能够整合广泛的上下文信息,从而准确地勾勒出器官等大目标的整体轮廓。
  2. 另一条路径专注于小目标:可能拥有较小的感受野和更精细的上采样策略,能够捕捉微小的细节,避免小肿瘤或小血管在特征融合过程中被“淹没”。

自适应融合:这些专门化的路径在处理完各自擅长的尺度信息后,它们的输出会被智能地融合起来,融合过程很可能是自适应的,即模型会根据图像的实际内容,决定如何权衡不同路径的贡献。例如,在图像主要包含小目标的区域,专注于小目标的路径输出会被赋予更高的权重。

共现现象如何避免:特征增强区分度和尺寸适配预测

对比驱动特征聚合模块通过前景与背景特征的对比引导,强化目标自身特征的表达,减少共现场景中无关特征的干扰;

共现现象常伴随 “不同尺寸目标的固定搭配”(如大息肉旁易出现小息肉),传统单尺度解码器易将这种尺寸搭配的共现特征误判为目标固有属性,尺寸感知解码器通过分尺寸独立预测,从预测逻辑上阻断共现特征的错误学习。

引言

医学图像分割是医学成像领域的基石,为临床决策、治疗计划和疾病监测提供了不可或缺的支持(Xun 等人,2022;Qureshi 等人,2023)。近年来,深度学习方法(Xi 等人,2024)在医学图像分割中显示出巨大潜力(Liu 等人,2021;Malhotra 等人,2022),例如 U-Net(Ronneberger, Fischer, and Brox 2015)、U-Net++(Zhou 等人,2018)、PraNet(Fan 等人,2020)、TGANet(Tomar 等人,2022)、CASF-Net(Zheng 等人,2023),不断推动分割性能的提升。

在医学图像领域,不同的任务场景使用不同模态的图像,例如内窥镜图像(Jha 等人,2020, 2021)、皮肤镜图像(Gutman 等人,2016;Codella 等人,2018)、数字扫描的全切片图像(Sirinukunwattana 等人,2017)等。尽管现有的深度学习方法已在医学图像分割领域取得了重大突破,但实现精确分割仍然是一个挑战,这主要源于两个方面:模糊边界和共现现象,如图 1 所示。一方面,与前景和背景边界清晰的自然图像相比,医学图像中的前景和背景通常是一种模糊的“软边界”(Xie 等人,2023;Lei and Wang 2024)。这种模糊主要是由于病变组织与周围正常组织之间存在过渡区域,导致边界难以界定。此外,在许多情况下,医学图像存在光照不佳和对比度低的问题(Cossio 2023;Peng and Wang 2021),这进一步模糊了病变组织与正常组织之间的边界,增加了区分边界的难度。另一方面,共现现象广泛存在于医学图像中(Chen 等人,2022)。例如,在内窥镜息肉图像中,小息肉倾向于与大小相似的息肉共同出现。这导致模型容易学习到某些与息肉本身无关的共现特征。而当病变组织单独出现时,模型往往无法准确预测。因此,我们提出了一个名为对比驱动的医学图像分割(ConDSeg)的通用框架来克服这些挑战。

为了解决模糊边界带来的挑战,我们首先引入了一种称为一致性增强(CR)的预备性训练策略。具体来说,我们将原始图像和经过强数据增强的图像输入编码器,并分别使用编码器的输出来预测分割掩码。通过最大化这些掩码对之间的一致性,我们增强了编码器对不同光照条件、颜色等场景的鲁棒性,使其即使在不利环境下也能提取高质量的特征。随后,我们提出了语义信息解耦(SID)模块,该模块将来自编码器的特征图解耦为三个不同的部分:前景、背景和不确定区域。在训练阶段,我们通过精心设计的损失函数,强制不确定区域的互补性以及前景和背景掩码的精确性,以促进不确定区域的减少。

为了进一步强调前景与背景的区别,并应对共现现象带来的挑战,我们提出了对比驱动特征聚合(CDFA)模块。CDFA 接收来自 SID 的前景和背景特征,在其对比信息的指导下,引导多层次特征的融合和关键特征的增强。此外,我们提出了尺寸感知解码器(SA-Decoder),以解决解码器在预测掩码时存在的尺度单一性问题(Cao 等人,2022;Wang 等人,2023)。负责不同尺寸的 SA-Decoder 分别接收来自不同层次的特征图,以预测不同大小的实体,从而增强模型区分同一图像中不同实体的能力,并防止错误地学习共现特征。总的来说,本文的主要贡献如下:

  • 我们提出的 CR 预备性训练策略能有效提高编码器对恶劣环境的鲁棒性,从而提取高质量特征。另一方面,SID 能够将特征图解耦为前景、背景和不确定区域,并通过专门设计的损失函数在训练过程中学习减少不确定性。
  • 我们提出的 CDFA 通过 SID 提取的对比特征来引导多层次特征的融合与增强。SA-Decoder 旨在更好地区分图像中的不同实体,并对不同大小的实体进行单独预测,从而克服共现特征的干扰。
  • 我们在五个医学图像数据集上进行了广泛的对比实验和消融实验,涵盖了三种模态下的任务。我们的 ConDSeg 在所有数据集上都达到了最先进的性能。
理解1

医学图像分割 vs 图像分割

医学图像分割是图像分割在医学领域的具体应用

图像来源与成像方式:

  1. 图像分割处理的图像来源广泛,包括自然场景图像、工业图像、卫星遥感图像、监控视频图像等,成像方式多样,比如自然场景图像主要通过普通相机、手机摄像头等拍摄;卫星遥感图像通过卫星搭载的光学或雷达传感器获取。
  2. 医学图像分割处理的图像专门来自医学领域,成像方式基于医学成像技术,如 X 光成像(利用 X 射线穿透人体不同组织后的衰减差异成像,主要用于骨骼、肺部等检查 )、CT(计算机断层扫描,通过对人体进行多个角度的 X 射线扫描并重建断层图像,可用于检测肿瘤、血管病变等)、MRI(磁共振成像,利用人体氢原子核在强磁场中的共振信号成像,对软组织分辨力高,常用于脑部、关节等检查 )、超声成像(通过超声波在人体组织中的反射、散射等形成图像,常用于妇产科检查、心脏检查等 )、PET(正电子发射断层显像,利用放射性药物在体内代谢分布成像,用于肿瘤的早期诊断、疗效评估等)。

图像内容与特征:

  1. 自然场景图像中,物体与背景边界相对清晰,物体特征较为明显且符合人们日常认知,例如拍摄的一张猫的照片,猫的轮廓和颜色与背景草地有明显差异;工业图像中,检测对象通常是具有规则形状或特定模式的零部件,背景相对简单且固定,像汽车发动机零件图像,零件的形状、尺寸等特征是检测的关键 。
  2. 医学图像中,病变组织与正常组织的边界往往模糊,存在过渡区域,例如肿瘤组织与周围正常组织的边界在 CT 图像中可能不清晰;医学图像还可能存在噪声、对比度低等问题,像超声图像,由于超声波的散射和反射特性,图像中会有较多斑点噪声,且不同组织间的对比度不高。
理解2

解决医学图像 “模糊边界”:核心是先通过预备训练增强模型鲁棒性,再通过模块设计精准区分图像区域。

第一步:一致性增强(CR)—— 提升模型 “抗干扰能力”

在正式分割训练前的 “基础训练”,目的是让模型对图像中的干扰因素不敏感。

  1. 输入设计:同时给模型输入两张图,一张是原始医学图像,另一张是对原始图做了强数据增强的图(比如故意改变光照、调整颜色、添加轻微噪声等,模拟实际拍摄中的不利环境)。
  2. 任务要求:让模型的编码器(负责提取图像特征的部分)分别对这两张图处理,并各自输出一个分割掩码(预测的前景、背景区域)。
  3. 核心目标:通过损失函数让这两个分割掩码尽可能 “一致”。也就是说,即使图像的光照、颜色变了,模型对 “哪里是可能的病变(前景)、哪里是正常组织(背景)” 的判断不能差太多。
  4. 最终效果:经过这种训练,编码器能忽略干扰因素,专注于图像中真正代表 “组织本质” 的特征,就算遇到边界模糊的图像,也能提取出高质量的特征用于后续分割。

在图像分割任务中,模型通常分为编码器(Encoder) 和解码器(Decoder) 两部分:

  1. 编码器的作用是对输入图像进行逐层处理,提取从低级到高级的特征(比如边缘、纹理、语义信息等),输出的是经过压缩的 “特征图”(包含图像的关键信息,但尺寸通常比原图小)。
  2. 解码器则基于编码器输出的特征图,逐步恢复空间分辨率,最终生成与原图尺寸一致的 “分割掩码”(mask)—— 掩码上每个像素的数值代表该位置属于某类别的概率(比如 “前景 / 病变”“背景 / 正常组织”)。

第二步:语义信息解耦(SID)模块 —— 精准 “拆分” 图像区域

这一步是在特征提取后:

  1. 区域拆分:将编码器输出的特征图,明确拆成三个部分 —— 前景(比如病变组织)、背景(比如正常组织)、不确定区域(前景和背景之间的模糊过渡区,也是分割的难点)。
  2. 训练约束:通过专门设计的损失函数,给模型两个关键约束:
    1. 强制 “不确定区域” 尽可能 “互补”:简单说就是让不确定区域的范围缩小,避免它模糊地覆盖大量区域,迫使模型明确判断一个像素属于前景还是背景。
    2. 强制 “前景和背景掩码” 更精确:让模型对已经判断为前景或背景的区域,预测结果更准确,减少误判。
  3. 最终效果:通过拆分和约束,模型会主动减少 “不确定区域” 的比例,从而让模糊的边界变得更清晰,提升分割精度。

解耦:明确拆分,目的就是主动把这些混合特征拆开,明确区分出 “确定是前景”“确定是背景”“暂时不确定” 这三类

理解3

进一步强调前景与背景的区别,并应对共现现象带来的挑战:

对比驱动特征聚合(CDFA)模块:强化 “前景 - 背景” 差异,对抗模糊

CDFA 的核心是通过 “对比信息” 让前景和背景的特征更 “泾渭分明”,同时优化特征融合的质量。

  1. 输入:接收来自 SID 模块的 “前景特征”(对应病变等目标区域的特征)和 “背景特征”(对应正常组织的特征)
  2. 目标:通过强调两者的差异,让模型更清晰地区分前景和背景,尤其在边界模糊或特征相似的区域(比如病变与周围组织颜色 / 纹理接近时)
  3. 对比信息指导:首先计算前景特征与背景特征之间的 “对比信号”(比如差异度、相似度),明确哪些特征是前景独有的、哪些是背景独有的。然后用这些对比信号 “引导” 多层次特征的融合:让模型在融合不同层级的特征(比如低级的边缘特征、高级的语义特征)时,优先保留和增强那些能体现前景 - 背景差异的关键特征,弱化无关特征(比如共现现象中可能被误判的 “连带特征”)。

尺寸感知解码器(SA-Decoder):适应多尺度实体,破解共现干扰

SA-Decoder 的核心是让解码器能 “针对性处理不同大小的实体”,避免因尺度单一导致的误判,尤其对抗共现现象(比如多个相似大小的病变同时出现时,模型容易混淆)

尺度单一为什么会加剧共现现象:一个尺度单一的解码器在处理特征时,共现现象为模型学习提供了一个非常强烈的上下文线索,模型为了最有效地完成所有目标的预测,会优先学习并依赖这种“空间共现关系” 作为核心判断依据。例如,多个大小相似的息肉成群出现,对于模型来说,它发现:“只要我检测到A息肉,那么在它的周围,就极有可能存在B息肉和C息肉。”以至于模型可以不仔细分析B和C区域本身的视觉特征,仅凭它们出现在A的附近,就将其判断为息肉。

SA-Decoder设计了多个专用的解码通路,每个通路被优化用于处理特定尺度范围的目标。迫使模型关注本体特征: 当一个小尺度解码器在分析一个疑似小息肉时,它不能(或者说很难)依赖“旁边有没有其他息肉”这个信息,因为它被设计的“职责”就是专注于局部区域的精细特征。它必须学会仅根据该区域本身的纹理、颜色、亮度来判断它是不是息肉。

  1. 尺寸感知的原因:用单一尺度的特征或统一方式处理所有实体会导致:小尺寸病变(如微小息肉)可能被忽略;大尺寸病变可能被分割不完整;共现现象中,多个相似大小的实体容易被模型学习到 “共现关联”(比如 “看到 A 就认为旁边一定有 B”),而非每个实体的独立特征,导致单独出现时预测错误。
  2. 具体操作:
    1. SA-Decoder 包含多个 “子解码器”,每个子解码器专门负责处理某一尺寸范围的实体(比如小、中、大)。
    2. 不同子解码器接收编码器输出的 “不同层次特征图”:低级特征图(高分辨率,含细节)适合小实体,高级特征图(低分辨率,含全局语义)适合大实体。
    3. 每个子解码器分别预测对应尺寸实体的分割掩码,最终整合所有结果。
  3. 解决的问题:
    1. 让模型对不同大小的实体都能精准分割(比如同时正确识别图像中的小息肉和大息肉);
    2. 迫使模型学习每个实体的独立特征(而非依赖共现关联),因为每个子解码器只专注于 “自身尺寸的实体特征”,减少共现特征的干扰(比如不会因为 “多个小息肉一起出现” 就误判单个小息肉)。

图一

图1:医学图像分割中的主要挑战。

理解

实现医学图像精准分割的两大挑战:模糊边界和共现现象

模糊边界方面:

(这种模糊主要是由于病变组织与周围正常组织之间存在过渡区域,导致边界难以界定。此外,在许多情况下,医学图像存在光照不佳和对比度低的问题,这进一步模糊了病变组织与正常组织之间的边界,增加了区分边界的难度。)

  1. 自然场景里(如 “Natural scene” 部分),物体(像狗)和背景的边界很清晰,分割标注(紫色的狗)能精准勾勒出物体轮廓。
  2. 但医学图像(“Medical image” 部分)不同,病变组织和周围正常组织的边界是 “软边界”,没有明显的区分线,再加上光照差、对比度低,就更难确定边界了,比如图中红色圈出的区域,边界就很模糊。

共现现象方面:

(在内窥镜息肉图像中,小息肉倾向于与大小相似的息肉共同出现。这导致模型容易学习到某些与息肉本身无关的共现特征。而当病变组织单独出现时,模型往往无法准确预测。)

  1. 看 “Co - occurrence”(共现)部分,当有多个大小相似的息肉一起出现时,“TGANet pred.” 的分割结果和 “Ours pred.” 相比,不够准确,这体现出模型容易受共现特征干扰,学习到和病变本身无关的共现特点。
  2. 再看 “Single occurrence”(单独出现)部分,当息肉单独存在时,“TGANet pred.” 的分割效果不好,而 “Ours pred.” 相对更准确,这表明共现现象存在时,病变单独出现会让模型难以准确预测,进一步说明共现对医学图像分割的挑战。

“TGANet pred” 指的是由 TGANet 模型得到的预测结果。

TGANet: Text-guided attention for improved polyp segmentation

2022 年发表在 arXiv 上,介绍了 TGANet 模型,这是一种文本引导的注意力架构,旨在解决息肉的可变大小和数量问题,以实现稳健的息肉分割。该模型在训练期间以文本注意力的形式利用与大小相关和息肉数量相关的特征,并引入了一个辅助分类任务来加权基于文本的嵌入,使网络能够学习到额外的特征表示,这些表示可以明显适应不同大小的息肉,并且可以适应具有多个息肉的情况。

相关工作

自动医学图像分割一直是医学图像领域的研究热点之一(Xun 等人,2022;Wang 等人,2022;Qureshi 等人,2023)。在过去的十年中,随着深度学习技术的兴起,大量新的分割方法被提出。基于编码器-解码器架构的 U-Net(Ronneberger, Fischer, and Brox 2015)创新性地利用跳跃连接来结合浅层和深层特征,解决了因下采样导致的细粒度信息丢失问题。在此基础上,U-Net++(Zhou 等人,2018)和 ResUNet(Diakogiannis 等人,2020)因其在医学图像分割中增强的性能而获得广泛认可。

近期的研究侧重于通过改进编码器-解码器架构中的各种模块或引入辅助监督任务来提升模型性能。CPFNet(Feng 等人,2020)通过结合全局金字塔引导模块和尺度感知金字塔融合模块,融合了全局/多尺度上下文信息。PraNet(Fan 等人,2020)通过并行部分解码器和反向注意力模块融合边缘特征,逐步扩展目标区域。TGANet(Tomar 等人,2022)通过引入文本标签的监督,引导模型学习额外的特征表示。Swin-Unet(Cao 等人,2022)、TransUNet(Chen 等人,2021)、XBoundFormer(Wang 等人,2023)则通过使用各种 Transformer 编码器的变体来提升性能。

在医学图像中,前景(如息肉、腺体、病变等)和背景通常没有清晰的边界,而是存在一种“软边界”。此外,由于物理限制和内部组织复杂的反射特性,图像中的光照条件和对比度往往受限。近年来,许多方法致力于克服这一挑战。SFA(Fang 等人,2019)引入了一个额外的解码器进行边界预测,并采用边界敏感损失函数来利用区域-边界关系。BCNet(Yue 等人,2022)提出了一个双边边界提取模块,该模块结合了浅层上下文特征、高层位置特征以及额外的息肉边界监督来捕捉边界。CFA-Net(Zhou 等人,2023)设计了一个边界预测网络来生成边界感知特征,并通过分层策略将其整合到分割网络中。MEGANet(Bui 等人,2024)提出了一个边缘引导注意力模块,使用拉普拉斯算子来强调边界。

尽管这些方法通过显式引入与边界相关的监督,提高了模型对边界的关注度,但它们并未从根本上增强模型自发减少模糊区域不确定性的能力。因此,在恶劣环境下,这些方法的鲁棒性较弱,为模型带来的性能提升有限。此外,共现现象是医学图像分割中一个容易被忽视的挑战。与自然场景中随机出现的物体不同,医学图像中的器官和组织表现出高度的固定性和规律性,因此共现现象广泛存在(Chen 等人,2022)。例如,在结肠镜图像中,较小的息肉常常同时多个出现,而较大的息肉附近则经常伴有较小的息肉。这导致现有模型在训练过程中可能过度依赖这些上下文关联,而非息肉本身的特征。当单个息肉出现时,模型往往倾向于预测出多个息肉。这正是由于模型未能学会准确区分前景与背景,以及图像中不同实体所致。

理解
  1. U-Net: Convolutional Networks for Biomedical Image Segmentation:采用编码器 - 解码器架构,通过跳跃连接将浅层和深层特征相结合,解决了下采样过程中细粒度信息丢失的问题
  2. UNet++: A Nested U-Net Architecture for Medical Image Segmentatio:一种嵌套 U-Net 架构,在 U-Net 的基础上进行改进,通过更复杂的连接方式和网络结构
  3. ResUNet:基于 ResNet 和 U-Net 结合的网络结构,ResNet 的论文《Deep Residual Learning for Image Recognition》,基于 U-Net 编码器 - 解码器骨干,结合了残差连接、空洞卷积、金字塔场景解析池化和多任务推理,用于遥感数据的语义分割
  4. CPFNet: Context Pyramid Fusion Network for Medical Image Segmentation:上下文金字塔融合网络,通过结合全局金字塔引导模块和尺度感知金字塔融合模块,融合了全局 / 多尺度上下文信息
  5. PraNet:基于并行反向注意力的息肉分割网络:并行反向注意力网络,通过并行部分解码器和反向注意力模块融合边缘特征,逐步扩展目标区域,在息肉分割等任务中表现出色
  6. TGANet: Text-guided attention for improved polyp segmentation:通过引入文本标签的监督,引导模型学习额外的特征表示,可对不同数据集中不同大小的息肉进行有效分割
  7. Swin-Unet: Unet-like Pure Transformer for Medical Image Segmentation:结合了 Swin Transformer 和 U-Net 的架构,利用 Swin Transformer 的特性,在医学图像分割中实现了较好的性能
  8. TransUNet: Transformers Make Strong Encoders for Medical Image Segmentation:将 Transformer 引入到 U-Net 架构中,通过 Transformer 编码器提升了模型对医学图像特征的学习能力,从而提高分割性能
  9. XBound-Former: Toward Cross-scale Boundary Modeling in Transformers:通过使用 Transformer 编码器的变体,致力于解决医学图像中的跨尺度边界建模问题
  10. SFA: Improving Cross-Domain Performance of Detection Transformers for Domain Adaptive Object Detection:Exploring Sequence Feature Alignment for Domain Adaptive Detection Transformers:引入了一个额外的解码器进行边界预测,并采用边界敏感损失函数来利用区域 - 边界关系,以应对医学图像中边界不清晰的问题
  11. BCNet: Bilayered Occlusion-Aware Instance Segmentation:Deep Occlusion-Aware Instance Segmentation with Overlapping BiLayers:提出了一个双边边界提取模块,结合了浅层上下文特征、高层位置特征以及额外的息肉边界监督来捕捉边界,提高医学图像分割的准确性
  12. CFANet: Context Feature Fusion and Attention Mechanism Based Network for Small Target Segmentation in Medical Images:设计了一个边界预测网络来生成边界感知特征,并通过分层策略将其整合到分割网络中,用于解决医学图像分割中的边界问题
  13. MEGANet: Multi-Scale Edge-Guided Attention Network for Weak Boundary Polyp Segmentation:多尺度边缘引导注意力网络,通过引入边缘引导注意力模块,使用拉普拉斯算子来强调边界,专门用于弱边界息肉的分割

方法

网络结构

ConDSeg 是一个两阶段架构。图 2 展示了其整体框架。在第一阶段,我们引入了一致性增强策略来初步训练编码器,迫使编码器块增强对弱光照、低对比度等不利条件的鲁棒性,确保在各种场景下都能有效提取高质量特征。在第二阶段,编码器的学习率被设置为较低水平以进行微调。

整个 ConDSeg 网络可以分为四个步骤:

  1. ResNet-50 编码器提取不同层级、具有不同语义信息的特征图 f1 到 f4。
  2. 承载深层语义信息的特征图 f4 被送入语义信息解耦模块,被解耦为富含前景、背景和不确定区域信息的特征图:ffg, fbg, fuc。
  3. 特征图 f1 到 f4 被送入对比驱动特征聚合模块,在 ffg 和 fbg 的引导下促进多层次特征图的逐步融合,并增强前景和背景特征的表示。
  4. 解码器 Decoders、Decoderm 和 Decoderl 分别接收 CDFA 在特定层级的输出,以根据大小定位图像中的多个实体。各个解码器的输出被融合以生成最终的分割掩码。
图二

图2:本文所提出的ConDSeg整体框架。

理解

Stage I:一致性强化(Consistency Reinforcement)

  1. 对输入图像进行强数据增强(Strong Aug.),得到 input₁(原始或轻度增强)和 input₂(强增强后)。
  2. 两者都输入到由 Block 1 - Block 4 组成的编码器中,生成各自的预测掩码 pred₁ 和 pred₂。
  3. 通过 一致性损失 约束两个预测结果,确保模型对 “原始图像 + 增强图像” 的分割具有一致性,提升模型对数据变化的鲁棒性。

Stage II:主分割流程(核心模块)

特征提取与扩张卷积(Dil. Conv)

  1. 输入图像经过 Block 1 - Block 4 (编码器)提取不同层级的特征 f₁ - f₄。
  2. 对 f₁ - f₄ 应用扩张卷积(Dilated Convolution),得到特征 e₁ - e₄。扩张卷积能在不增加参数量的前提下,扩大感受野,捕捉更广泛的上下文信息。

解耦模块(Decoupling)

  1. 针对最深层特征f₄,通过多个3×3 CBR(卷积 + 批量归一化 + 激活函数)和1×1 CBR分支,将特征解耦为前景特征、背景特征和不确定性特征
  2. 前景特征聚焦目标区域(如医学图像中的病变、息肉等)。
  3. 背景特征关注非目标区域。
  4. 不确定性特征用于建模分割的模糊性(比如边界不清晰的区域)。

特征融合与增强(CDFA)

  1. CDFA(Feature Fusion & Enhancement)模块对 “扩张卷积后的特征e” 和 “解耦得到的前景 / 背景特征” 进行融合与增强。
  2. 它通过交互前景特征和背景特征,强化目标与背景的区分度,生成更具判别性的特征F₁ - F₄

如何交互:

  1. 输入:来自 “解耦模块” 的前景特征,聚焦目标区域,如医学图像中的病变、息肉等)和背景特征,聚焦非目标区域,如正常组织)。
  2. 交互过程:通过双向箭头(绿色、橙色),前景特征和背景特征会 “相互参考、相互强化”—— 前景特征会突出 “与背景不同的独特性”,背景特征也会突出 “与前景不同的独特性”。
  3. 上方的医学图像(如内窥镜下的组织图像)中,红色框选的区域(标记为K)是待精细处理的局部区域
  4. 前景特征会在区域K中,强化 “属于前景的特征”
  5. 背景特征会在区域K中,强化 “属于背景的特征”
  6. 两者的交互会让区域K内 “前景与背景的边界 / 差异” 更清晰,为后续分割提供更具判别性的特征

多尺度解码(Decoder)

  1. 融合增强后的特征F₁ - F₄被输入到三个不同尺度的解码器( 小尺度、中尺度、大尺度),分别生成小、中、大尺度的分割结果。
  2. 最终通过融合操作得到融合后的特征,融合后的特征经过后续处理(可能是 “上采样 / 卷积调整尺寸” 等操作),得到最终的预测掩码,并通过掩码损失监督主分割任务

辅助监督(Auxiliary Head)

  1. 解耦得到的前景、背景、不确定性特征,还会输入到辅助头(Auxiliary Head),生成 “前景预测、背景预测、不确定性预测”。
  2. 分别通过前景损失、背景损失、互补性损失进行监督:
    1. 前景损失和背景损失约束前景 / 背景的分割精度。
    2. 互补性损失基于 “前景 - 背景的互补性(Degree of complementary)”,进一步强化两者的区分。

图例:

  1. BCE Dice loss function:用于分割任务的损失函数(结合了二元交叉熵和 Dice 系数,平衡正负样本与区域重叠度)。
  2. Degree of complementary:前景与背景特征的互补性,指导互补性损失优化。
  3. Feature transmission:特征在模块间的传递关系。
  4. Low learning rate:部分模块(带 “乌龟” 标记的)采用低学习率,避免训练不稳定或过拟合。
改善边界区分度

为克服边界模糊的挑战,我们提出了一致性增强策略语义信息解耦模块,具体内容将在以下两个小节中详细阐述。

一致性增强

编码器以其特征提取能力和鲁棒性支撑着整个模型的性能。因此,在第一阶段,我们的目标是最大化编码器的特征提取能力及其在弱光照和低对比度场景下的鲁棒性。为实现此目标,我们将编码器从整个网络中分离出来,并为其设计了一个预测头。我们确保该预测头的结构尽可能简单,以避免为其提供编码器块之外具备特征提取能力的额外结构,从而尽可能优化编码器性能。我们将第一阶段的这个初始训练网络称为 Net0。对于输入图像 X,一方面将其直接输入 Net0;另一方面,对 X 进行强数据增强以获得 X',然后将其输入 Net0。这些增强方法包括随机改变亮度、对比度、饱和度和色调,随机转换为灰度图以及添加高斯模糊。通过这种方式,我们模拟医学成像中的多变环境,例如弱光照、低对比度和模糊。此过程可表示如下:

此处,Aug(·) 表示强增强操作。M1 和 M2 分别表示使用原始图像和强增强图像的预测结果。对于 M1 和 M2,不仅需要它们逼近真实标签,还需要最大化它们之间的相似性。这确保了编码器在特征提取方面的鲁棒性,即对于相同内容,在任何条件下的预测掩码都应保持一致,且不应受光照、对比度等变化的影响。

为此,一方面,我们联合使用二元交叉熵损失和 Dice 损失来约束 M1 和 M2:

其中 i 代表所有像素的索引,Mi 是预测值,Yi 是真实标签。N 表示像素总数。通过 BCE Dice 损失,我们同时考虑了像素级预测精度和分割任务中的类别不平衡问题。

另一方面,我们设计了一种新颖的一致性损失,以在训练过程中最大化 M1 和 M2 之间的相似性。在量化模型输出的一致性时,传统方法如 KL 散度和 JS 散度通常从概率分布的角度衡量相似性。这些方法在理论上具有明确的统计学意义,但在实际应用中可能会遇到数值不稳定性,尤其是当预测概率接近 0 或 1 时。这些极端值处的对数函数可能引发数值问题,这在处理大量数据时尤为显著。相比之下,我们提出的一致性损失 Lcons 基于像素级分类精度设计,使用简单的二值化操作和二元交叉熵损失计算,直接比较预测掩码 M1 和 M2 之间的像素级差异。这使得计算更简单,并避免了数值不稳定性,使其对大规模数据更具鲁棒性。

具体来说,我们交替地将 M1 和 M2 之一二值化作为参考,并计算与另一个的 BCE 损失。首先,为二值化操作定义一个阈值 t,二值化函数 B(M, t) 定义如下:

一致性损失 Lcons 由以下公式给出,它计算了以 M1 为参考时 M2 的 BCE 损失和以 M2 为参考时 M1 的 BCE 损失的平均值:

最终,第一阶段的总体损失如下:

理解1

我们将编码器从整个网络中分离出来,并为其设计了一个预测头。我们确保该预测头的结构尽可能简单,以避免为其提供编码器块之外具备特征提取能力的额外结构,从而尽可能优化编码器性能。

通常,在端到端的网络(如分割网络的 “编码器 - 解码器” 结构)中,编码器的输出会直接传递给后续模块(如解码器),其性能依赖于整个网络的联合优化。而 “分离编码器” 指的是:将编码器作为一个独立模块单独处理,不依赖后续模块(如解码器)的反馈,单独对其进行训练或评估。目的是让编码器专注于学习 “通用、鲁棒的特征提取能力”,而不受后续模块(可能引入的复杂逻辑)的干扰。

“预测头” 是指接在编码器输出之后的轻量模块,用于将编码器提取的特征转化为具体任务的预测结果(如分类、分割的初步输出)。设计这个预测头的目的是:给编码器一个 “明确的学习目标”—— 通过预测头的输出与真实标签的差异(损失),反向传播优化编码器的参数,让编码器知道 “什么样的特征是有用的”。

理解2

第一阶段训练的损失函数由掩码损失和一致性损失两部分组成,整体公式为:

损失函数需同时满足两个需求:

  1. 确保编码器输出的特征能用于精准分割(贴近真实标签);
  2. 确保编码器对 “原始图像” 和 “强增强图像” 的特征提取具有一致性(不受数据增强干扰)。

掩码损失:优化分割精度,是二元交叉熵损失(BCE Loss) 与Dice 损失的结合,用于约束(Net_0)的预测结果((M_1)对应原始图像,(M_2)对应强增强图像)贴近真实标签(Y),同时解决分割任务中的 “类别不平衡” 问题

  1. 二元交叉熵损失(BCE Loss):从像素级概率角度优化预测,计算每个像素的预测概率与真实标签的差异。
  1. 为像素索引,N为总像素数;Yi=0或1(1 表示前景,0 表示背景),Mi∈[0,1](预测为前景的概率)
  • Yi=1,则logMi会惩罚Mi过小的情况;若为背景Yi=0,则log(1-Mi)会惩罚Mi过大的情况。
  1. Dice 损失:从 “区域重叠度” 角度优化预测,解决医学图像中 “前景像素少、背景像素多” 的类别不平衡问题(BCE 易偏向背景预测)。
    Dice 系数最初用于计算两个样本集的相似性,在图像分割任务中,它被用来衡量预测分割结果和真实分割结果之间的重叠程度。Dice 损失则是基于 Dice 系数i为像素索引,N为总像素数;Yi=0或1(1 表示前景,0 表示背景),Mi∈[0,1](预测为前景的概率)
    分子实际上是预测结果和真实结果中前景像素的交集的两倍,(仅当像素i同时满足 “真实为前景((Yi=1))” 和 “预测倾向于前景((Mi)有数值贡献)” 时,才会产生非零项)分母是预测结果和真实结果中前景像素的并集,Dice 系数的值域是 ([0, 1]),越接近 1 表示预测结果和真实结果的重叠度越高。而 Dice 损失是 (1 - Dice系数),所以 Dice 损失越小,重叠度越高。

  • BCE 损失在类别不平衡下的局限性:由于背景像素数量远多于前景像素数量,模型在训练时,背景像素对损失的贡献会占据主导地位。这就导致模型更倾向于将像素预测为背景,因为即使误判一些前景像素为背景,对整体损失的影响也相对较小;而如果将背景像素误判为前景,损失会大幅增加。所以 BCE 损失在类别不平衡的医学图像分割中,容易偏向背景预测,从而影响对前景的分割精度。
    Dice 损失关注的是预测结果和真实结果的重叠区域,也就是前景部分的分割准确性。它直接以 “前景像素的交集和并集” 来衡量分割效果,不受背景像素数量的影响。

一致性损失:优化特征稳定性,是 ConDSeg 提出的创新损失函数,用于约束(M1)(原始图像预测)和(M2)(强增强图像预测)的一致性 —— 确保编码器对 “同一内容、不同形态” 的图像,输出相似的分割结果,从而提升鲁棒性。

  1. 传统一致性损失(如 KL 散度、JS 散度)从概率分布角度计算相似性,当预测概率接近 0 或 1 时,易出现 “数值不稳定”(对数函数在极端值处波动大);而一致性损失基于 “像素级分类准确率” 设计,计算更简单、鲁棒性更强
  •  KL 散度为例,其计算两个概率分布P(如(M1))和Q(如(M2))的差异公式为:KL 散度的计算结果出现极端异常值(数值溢出或剧烈波动)
    JS 散度虽基于 KL 散度改进,M为P和Q的平均分布但本质仍依赖对数运算,在预测概率趋近 0 或 1 时,仍会因同样的极端值问题导致数值不稳定 —— 这种不稳定性会干扰模型反向传播过程,使参数更新异常,最终影响训练效果
  1. 计算步骤二值化处理:用阈值t(默认 0.5)将(M1)或(M2)转化为 “硬标签”(0 或 1),定义二值化函数(B(M, t)):双向 BCE 计算:交替将一个预测的二值化结果作为 “参考标签”,计算另一个预测的 BCE 损失,再取平均值:
  2. 逻辑说明:若(M1)和(M2)一致性高,那么 “(B(M2, t))作为标签时,(M1)的 BCE 损失” 和 “(B(M1, t))作为标签时,(M2)的 BCE 损失” 都会很小,最终一致性损失也小;反之则损失增大,迫使模型优化一致性。
  3. 阈值t的选择:默认(t=0.5),实验证明该值能平衡 “过分割”(t过高导致假阳性多)和 “欠分割”(t过低导致假阴性多),若t偏离 0.5,会显著降低一致性损失的约束效果。
    1. 假阳性(过分割):指模型将 “真实背景像素”((Y_i=0),如正常组织)误判为前景(二值化后标签 = 1),表现为分割结果中 “不该有的前景区域过多”。
    2. 假阴性(欠分割):指模型将 “真实前景像素”((Y_i=1),如病变、息肉)误判为背景(二值化后标签 = 0),表现为分割结果中 “该有的前景区域缺失过多”。
    3. 当t过高时:二值化对 “前景判定” 的门槛大幅提高;t过高会将这些 “本应属于前景的像素” 误判为背景,导致真实前景被大量漏分;为满足 “模型需尽可能捕捉真实前景” 的优化目标,当t过高导致大量前景漏分时,模型会被迫扩大 “高确信度前景区域” 的预测范围,可能将部分M略高于 0.8 的 “真实背景像素”(如与病变纹理相似的正常组织)误判为前景,最终导致假阳性增多,表现为过分割。
    4. 当t过低时:二值化对 “前景判定” 的门槛大幅降低;t过低会将这些 “本应属于背景的像素” 误判为前景,导致假阳性初步增多;为避免假阳性过多导致整体损失飙升,模型会被迫缩小 “低确信度前景区域” 的预测范围,可能将部分M略低于 0.2 的 “真实前景像素”(如极小病变、模糊病变核心)误判为背景,最终导致假阴性增多,表现为欠分割。
语义信息解耦

语义信息解耦模块旨在将编码器输出的高层特征图解耦为三个分别富含前景、背景和不确定区域信息的特征图。通过损失函数的约束,鼓励 SID 学习减少不确定性,从而实现对前景和背景的精确区分。

SID 始于三个并行分支,每个分支由多个 CBR 块组成。来自编码器的特征图 f4 被输入这三个分支,以获得三个具有不同语义信息的特征图:ffg, fbg, fuc,它们分别富含前景、背景和不确定区域特征。随后,这三个特征图通过一个辅助头进行预测,生成前景掩码 (Mfg)、背景掩码 (Mbg) 和不确定区域掩码 (Muc)。理想情况下,这三个掩码的每个像素值应为明确的 0 或 1,表明该像素所属的类别是确定的。此外,这三个特征图应呈现互补关系,即对于任何像素索引 i,三个掩码 Mfg, Mbg, Muc 应满足:

因此,我们的优化目标是使 Mfg 和 Mbg 分别逼近真实标签 Y 及其反码 (1 - Y)。同时,Mfg, Mbg, Muc 应大致满足前述互补性。

一方面,我们使用 BCE Dice 损失(记为 Lfg 和 Lbg)来优化 Mfg 和 Mbg 以逼近真实标签。此外,考虑到小尺寸实体占据的像素极少,其预测精度对总体损失影响较小,我们设计了一对动态惩罚项 β1, β2:

其中 N 代表像素总数,i 是所有像素的索引,范围从 1 到 N。本质上,β1 和 β2 是基于预测结果的面积比例计算的惩罚项,旨在让损失函数更多地关注面积较小的实体,从而提高损失函数的稳定性。因此,加入惩罚项后,Lfg 和 Lbg 转变为 β1 Lfg 和 β2 Lbg。

另一方面,考虑到辅助头的输出 Mfg, Mbg, Muc 实际上是概率分布,我们设计了一个简单而有效的损失函数来量化它们的互补程度:

此处,Mfg_i, Mbg_i, Muc_i 分别代表第 i 个像素被预测为前景、背景和不确定区域的概率。该公式为 SID 的预测提供了直接有效的约束。通过根据像素总数对损失进行归一化,损失函数的尺度与输入图像尺寸无关,使其值始终保持在 [0, 1] 范围内,从而充分保证了训练的稳定性。

总体而言,Lcompl 强制三个分支的预测结果具有互补性,确保每个像素被唯一地归类为前景、背景或不确定区域之一。此外,β1 Lfg 和 β2 Lbg 用于约束前景和背景分支的准确性。通过在训练中施加这些约束,模型逐渐减少不确定区域,并增强特征图 ffg 和 fbg 中前景和背景的显著性。

理解1

医学图像中普遍存在 “小尺寸前景像素占比极低” 的问题,若直接使用 BCE-Dice 损失约束,小尺寸前景的分割误差对整体损失的贡献会被大量背景像素的误差 “稀释”

为解决这一问题,设计了β1和β2两个动态惩罚项,通过 “根据预测区域的面积自适应调整损失权重”,强制模型关注小尺寸前景 / 背景的分割准确性。

预测前景掩码中所有像素的预测概率之和

tanh(.):双曲正切函数,取值范围为((-1,1)),此处因输入为 “区域面积占比”,取值范围进一步限定为((0,1))

核心特性是 “区域面积越小,惩罚权重越大”

前景尺寸极小,预测前景总面积极小,前景占比接近 0,此时tanh()接近 0,β1取值会显著增大;增大的β1会将前景分割损失的权重放大,即使小尺寸前景的分割误差本身很小,放大后的损失也会对整体损失产生显著贡献,迫使模型优先优化小尺寸前景的分割精度,减少漏分或错分。

前景尺寸较大,β1对前景分割损失的放大作用减弱,模型无需过度偏向大尺寸前景,避免因权重过高导致背景分割精度下降。

理解2

互补性损失:通过计算 “三类概率的交叉乘积和”,量化像素在三类标签中 “同时属于多类” 的程度,理想状态下,同一像素应 “明确属于一类、完全不属于另外两类”(即互补性),此时交叉乘积项应为 0,损失也为 0;若像素同时偏向多类(非互补),交叉乘积项会增大,损失也随之升高

互补:像素类别归属唯一以及三类区域无重叠

克服共现现象

共现现象在医学成像中广泛存在,这往往导致模型学习到错误的模式,从而降低其性能。图3展示了TGANet(Tomar等人,2022)与我们的方法在Kvasir-SEG数据集(Jha等人,2020)若干样本上的可视化对比。我们对两者均采用Grad-CAM(Selvaraju等人,2017)对靠近输出层的卷积层进行可视化,直观呈现模型的关注区域。对于共现息肉,两种模型均能实现准确定位。然而当息肉单独出现时,TGANet往往错误预测多个息肉。相比之下,我们的方法有效规避了共现现象的误导效应,在单个息肉出现时仍能保持精准识别与分割能力。在我们的框架中,我们通过专门设计的对比驱动特征聚合模块和尺寸感知解码器来克服共现现象,具体细节将在后续两个小节中详细阐述。

理解

Grad - CAM(梯度加权类激活映射):是一种用于深度学习模型可视化的技术,能直观呈现模型在做出决策时重点关注的图像区域

核心思路:基于卷积神经网络(CNN)的特性,CNN 最后一层卷积层的特征图包含了丰富的语义信息,Grad - CAM 通过计算这些特征图对于目标类别的重要性权重,然后将权重与特征图进行加权求和,得到一个可视化的热力图,显示出模型对图像中不同部分的关注程度。

计算步骤

  1. 获取特征图:对于输入图像,经过 CNN 前向传播,得到靠近输出层的卷积层特征图,记为(A^k),其中k表示特征图的通道索引。
  2. 计算梯度:对目标类别(比如图像分类中的某个类别,或图像分割中要分割的目标)的预测分数(y_c),关于卷积层特征图求梯度,得到
  3. 计算权重:对梯度在空间维度上求平均值,得到每个通道的权重,其中Z是特征图空间维度的大小,i、j是特征图的空间坐标。
  4. 生成激活图:将每个通道的权重与对应的特征图相乘并求和,得到激活图
  5. 后处理:对激活图进行 ReLU 操作,只保留对目标类别有正向贡献的部分,然后将激活图进行上采样到输入图像大小,就得到了 Grad - CAM 热力图。
图三

图3:不同方法的Grad-CAM可视化结果。该图展示了在共现情况和单独出现情况下,我们模型与TGANet所关注的区域。

理解

“共现(Co - occurrence)” 和 “单独出现(Single occurrence)” 两种目标存在场景

Image:原始的内窥镜图像;Ground truth:真实的分割标注;Vis. of TGANet:TGANet 模型对目标的分割可视化结果;Vis. of Ours(ConDSeg):ConDSeg 的分割可视化结果

可视化结果:热图分布

用不同的颜色来代表不同的数值范围。颜色越偏向红色的区域,意味着模型认为这个区域越可能是要分割的目标,或者对该区域的分割结果越有信心;而颜色偏蓝的区域,则表示模型认为这里是背景或者对分割结果信心较低。

对比驱动特征聚合

对比驱动特征聚合模块旨在利用 SID 解耦得到的前景与背景对比特征,来引导多层次特征融合。此外,它有助于模型更好地区分待分割实体与复杂背景环境。

具体而言,从编码器块输出的特征图 f1 至 f4 首先通过一组空洞卷积层进行预增强,得到 e1 至 e4。随后,CDFA 在对比特征(ffg, fbg)的引导下实现多层次特征融合。一方面,将前一级的输出与横向特征图(即 ei, i = 1, 2, 3, 4)沿通道方向拼接形成 F。然后将 F 输入 CDFA(e4 除外,它直接输入 CDFA)。另一方面,ffg 和 fbg 在输入 CDFA 之前,会通过卷积层和双线性上采样调整维度以匹配 F 的尺寸。

图 4 展示了 CDFA 的结构。ffg 和 fbg 均源于深层特征的解耦,其每个空间位置的特征都具有足够代表性,能为局部聚合邻近特征生成注意力权重。在每个空间位置 (i, j) 上,CDFA 通过结合前景和背景的细节,计算以 (i, j) 为中心的 K×K 窗口内的注意力权重。具体来说,给定输入特征图 F ∈ R^(H×W×C),首先通过多个 CBR 块进行初步融合。随后,该 C 维特征向量通过一个线性层权重 WV ∈ R^(C×C) 映射为值向量 V ∈ R^(H×W×C)。接着,值向量 V 在每个局部窗口上展开,为每个位置聚合邻域信息做准备。令 VΔi,j ∈ R^(C×K²) 代表以 (i, j) 为中心的局部窗口内的所有值,定义为:

前景和背景特征图(ffg 和 fbg)随后通过两个不同的线性层处理,生成相应的注意力权重 Afg ∈ R^(H×W×K²) 和 Abg ∈ R^(H×W×K²)。注意力权重的计算可表示为:

其中 Wfg ∈ R^(C×K⁴) 和 Wbg ∈ R^(C×K⁴) 分别是前景和背景特征图的线性变换权重矩阵。接着,位置 (i, j) 处的前景和背景注意力权重被重塑为 Âfg_i,j ∈ R^(K²×K²) 和 Âbg_i,j ∈ R^(K²×K²),并通过 Softmax 函数激活。然后,展开的值向量 VΔi,j 分两步进行加权:

此处,⊗ 表示矩阵乘法。最后,对加权的值表示进行密集聚合以获得最终输出特征图。具体来说,位置 (i, j) 处的聚合特征为:

理解1

空洞卷积层(Dil. Conv)是卷积神经网络(CNN)中的一种特殊卷积形式,它通过在标准卷积核的权重之间插入空洞(间隔),来增加卷积操作的感受野,同时不增加参数数量与计算量

工作原理:标准卷积是对输入特征图进行固定大小窗口的加权求和操作。而空洞卷积在标准卷积核的基础上,引入了一个 “扩张率(dilation rate)” 参数。当扩张率为 1 时,空洞卷积就等同于标准卷积。

以二维图像为例,假设我们有一个 3×3 的标准卷积核。当扩张率为 2 时,卷积核在实际进行卷积操作时,会在相邻权重之间插入间隔,使其在感受野上等效于一个 5×5 的卷积核(但实际参数量仍然是 3×3 卷积核的数量) 。这样在不增加参数数量的情况下,扩大了卷积操作能够 “看到” 的图像区域,即增大了感受野。通过调整扩张率,可以灵活控制感受野的大小。

当扩张率(r=2)时,卷积核的相邻权重之间会插入(r-1=1)个空洞(间隔)。原本 3×3 的卷积核,在 “虚拟感受野” 上会被 “拉伸”:

  1. 横向:原本 3 个权重,间隔 1 个空洞后,覆盖的范围是(1 + 3 + 1 = 5)(两边各 1 个空洞,中间 3 个权重);
  2. 纵向:同理,覆盖范围也是 5。
理解2

在 CDFA 模块的流程之前,通过卷积层和双线性上采样适配 F 的尺寸,与进入 CDFA 之后进行线性变换来适配维度的区别:

卷积层和双线性上采样:主要针对的是特征图的空间维度(高度和宽度) 。通过卷积操作可以对特征进行变换和提取,同时配合双线性上采样,能够改变特征图的大小,使得高度和宽度与输入特征 F 一致

线性变换:重点适配的是特征图的通道维度 。线性变换通过矩阵乘法等运算,将通道数变换为与后续注意力计算、特征聚合等操作相适配的维度,便于后续计算注意力权重等操作

理解3

为每个像素收集 “局部邻域的所有特征”(窗口展开),为后续 “邻域信息聚合,精准分割目标” 做准备

初步融合:让特征更具判别性(比如突出息肉的边缘、纹理)
经过 CBR 块初步融合后,特征图的维度仍为HxWxC,每个通道都承载着不同的语义信息(比如有的通道侧重边缘特征,有的侧重纹理特征)

线性层映射为值向量 V:

线性变换的过程:通道内的 “重新加权”,本质是对原始通道特征的 “优化重表示”,模型通过学习 (WV) 的权重,会自动强化 “对后续邻域聚合有用的通道特征”

线性层的核心操作,是对特征图中每个空间位置((i,j))的 C 维通道向量做矩阵乘法

局部窗口展开(Unfold):

理解4

以位置 ((i, j)) 为中心的局部窗口内的特征集合

要让窗口 ((i, j)) 为中心,需要计算窗口内每个位置相对于中心的偏移:

理解5

其中 Wfg ∈ R^(C×K⁴) 和 Wbg ∈ R^(C×K⁴) 分别是前景和背景特征图的线性变换权重矩阵。

(K^4) 的维度来源于局部窗口内前景与背景特征的 “成对交互规模”((K^2xK^2))

图四

图 4:对比驱动特征聚合(CDFA)模块的结构

理解

核心是利用前景和背景特征,引导对输入特征 F 的增强,最终得到输出特征 

 Softmax后得到前景注意力权重背景注意力权重

  1. 输入:前景特征和背景特征(来自语义信息解耦模块 SID)
  2. Linear :分别做线性变换,将特征映射到新的维度
    线性变换的作用是改变特征的通道维度,让特征能适配后续的注意力计算维度
  3. Reshape:把线性变换后的特征重塑为 (K^2*K^2) 大小(K 是局部窗口尺寸)
    为了后续计算 “窗口内的注意力”, 每个元素对应一个局部位置的权重
    Reshape 后的 (9×9) 矩阵,行和列都对应窗口内的 9 个位置
  4. Softmax:对重塑后的特征做 Softmax
    对 (K^2*K^2) 的矩阵做 Softmax,会得到行和为 1 的概率分布
    1. 行:代表 “当前评估的位置”(比如第 1 行,评估 “位置 1”)。
    2. 列:代表 “被评估的位置”(比如第1行的第 2 列,被 “位置 1” 评估的 “位置 2”)。
    3. 矩阵元素值:位置 A 对位置 B 的注意力权重(值越高,说明位置 A 认为位置 B 越重要)

输入特征 F 的预处理:

  1. 3×3 CBR:对输入特征 F 做 “卷积(Convolution)+ 批量归一化(BatchNorm)+ 激活(ReLU)” 操作,提取(K*K)的局部特征
  2. Linear :对 CBR 输出的特征做线性变换,映射到新维度,让 F 经过 CBR 后的特征,能和前景 / 背景的注意力权重维度匹配
  3. Unfold:将特征 “展开” 为局部窗口形式
    比如输入是 (H x W x C) 的特征图,Unfold 后会变成 (N x K^2 x C)(N 是窗口数量,每个窗口是 (K x K) 大小)
    为了逐窗口进行注意力加权

特征聚合与增强:

注意力加权:

  1. 用背景注意力权重,对 “展开后的 F 特征” 做逐元素乘法,得到背景引导的特征
  2. 再用前景注意力权重,对 “背景引导的特征” 做逐元素乘法,得到融合背景 + 前景引导的特征

将加权后的特征 “折叠(Fold)” 回原始尺寸,重新拼接成完整的 (H x W x C) 特征图,得到增强后的输出特征

举例:

尺寸感知解码器

我们设计了一个简单但有效的尺寸感知解码器,其结构详见补充材料。SA-Decoder 通过在不同层级分配不同尺寸的实体来实现分别预测。在多个 CDFA 输出的特征中,浅层特征图包含更细粒度的信息,使其适合预测较小尺寸的实体。随着层级的加深,特征图融入了越来越多的全局信息和更高层次的语义,使其更适合预测较大尺寸的实体。

因此,我们为小、中、大尺寸建立了三个解码器:Decoders, Decoderm, Decoderl。每个解码器接收来自两个相邻 CDFA 的特征,即分别接收 (Fe1, Fe2), (Fe2, Fe3), (Fe3, Fe4)。

三个解码器的输出随后沿通道维度进行拼接和融合。然后通过 Sigmoid 函数产生预测掩码。通过多个并行 SA-Decoder 的协同工作,ConDSeg 能够准确区分不同尺寸的个体。该模型既能精确分割大实体,也能准确定位小实体。

理解1

每个解码器接收来自两个相邻 CDFA 的特征,即分别接收 (Fe1, Fe2), (Fe2, Fe3), (Fe3, Fe4)。

(Fe1)靠前的 CDFA 模块处理的特征图分辨率较高,包含更多细节信息,而靠后的 CDFA 模块处理的特征图分辨率较低,但语义信息更丰富、抽象。将相邻 CDFA 的特征组合输入解码器,能使解码器同时获取到细节和语义层面的信息,让模型在进行预测时,既可以利用细节信息准确勾勒目标轮廓,又能依据语义信息正确判断目标类别。

理解2

然后通过 Sigmoid 函数产生预测掩码。

Sigmoid 函数是一种常用的激活函数,核心作用是将模型输出的任意实数范围值映射到 0  1 之间的概率值

通过该函数计算后,输出结果会严格落在 [0, 1] 区间内 —— 这一特性恰好适配 “预测掩码” 的需求,因为掩码中每个像素的取值需要代表 “该位置属于目标(如医学图像中的病变区域)的概率”,1 表示 “完全属于目标”,0 表示 “完全属于背景”。

整体优化与训练过程

ConDSeg 的训练是一个两阶段过程。第一阶段侧重于增强编码器的特征提取能力及其对不利条件的鲁棒性。在第二阶段,我们将编码器的学习率设置为较低水平,并优化整个模型。形式上,Lstage2 如下所示:

理解

第二阶段将编码器的学习率设置为较低水平

避免前期训练好的有效特征被破坏,同时适配后续任务的优化需求

第二阶段的核心目标往往是让解码器更好地利用编码器输出的特征,完成 “特征融合→细节细化→掩码预测” 的关键流程。将编码器学习率调低,可将优化重点转移到解码器参数上:让解码器在稳定的高质量输入特征基础上,专注学习 “如何整合不同层次特征”“如何精准映射特征到目标掩码” 等任务,避免编码器的参数更新干扰解码器的学习过程

较低的编码器学习率能降低参数更新的不确定性,让模型在第二阶段更稳定地收敛

实验

实验设置

为验证我们提出的ConDSeg在医学图像分割领域的性能及普适性,我们在五个具有挑战性的公共数据集上进行了实验:Kvasir-SEG (Jha et al. 2020)、Kvasir-Sessile (Jha et al. 2021)、GlaS (Sirinukunwattana et al. 2017)、ISIC-2016 (Gutman et al. 2016) 和 ISIC-2017 (Codella et al. 2018),涵盖了跨越三种医学图像模态的子领域分割任务。数据集的详细信息见补充材料。

所有实验均在NVIDIA GeForce RTX 4090 GPU上进行,图像尺寸调整为256×256像素。采用了简单的数据增强策略,包括随机旋转、垂直翻转和水平翻转。批量大小设置为4,并使用Adam优化器 (Kingma and Ba 2014) 进行优化。我们使用ResNet-50 (He et al. 2016) 作为默认编码器,该编码器也可替换为其他骨干网络,如Transformer(详见补充材料)。在第一阶段,学习率设置为1e-4。在第二阶段,我们加载编码器的权重并将其学习率设置为较低的1e-5,而网络其余部分的学习率设置为1e-4。CDFA的窗口大小设置为3。我们使用标准的医学图像分割指标,如平均交并比(mIoU)、平均Sørensen-Dice系数(mDSC)、召回率(Recall)和精确率(Precision)。

理解1

Kvasir-SEG 数据集:该数据集包含 1,000  息肉图像;每一张息肉图像都配有一个对应的 像素级标注的掩膜;包含胃肠道内窥镜检查中获得的息肉图像以及对应的像素级分割掩膜。

肉是结肠癌的前兆,精确的自动分割可以帮助医生更有效地发现、评估和切除息肉,是计算机辅助诊断系统中的关键一环。

理解2

Adam优化器自适应矩估计。它是一种广泛用于深度学习领域中的优化算法

在训练神经网络时,我们有一个损失函数,它衡量模型预测值与真实值之间的差距。训练的目标就是通过不断调整模型的数百万甚至数十亿个参数,让这个损失值尽可能小。

传统随机梯度下降(SGD):对所有参数使用同一个、固定的学习率。这可能导致一些问题:

  1. 如果学习率太小,收敛速度会非常慢,训练时间很长。
  2. 如果学习率太大,可能会在最优解附近来回震荡,甚至无法收敛。
  3. 它无法适应每个参数独特的特性。

Adam的出现就是为了解决这些问题,它通过自适应地为每个参数计算自适应的学习率,从而实现更高效、更稳定的训练。

  1. 动量(Momentum)
    1. 类比:就像一个小球滚下山坡,它不仅有当前坡度的指引,还会积累之前下降的“动量”,从而在方向一致的沟壑中加速冲过,在震荡方向及时刹车。
    2. 技术实现:Adam计算了梯度的一阶矩估计(First Moment),也就是梯度的指数加权移动平均值(可以理解为带有惯性的梯度方向)。这有助于加速在相关方向的收敛并减少震荡。
  2. RMSProp
    1. 类比:它为每个参数单独调整“步伐大小”。对于频繁更新、梯度大的参数(陡峭区域),它会缩小步长,以免越过最低点;对于不频繁更新、梯度小的参数(平坦区域),它会增大步长,加快学习。
    2. 技术实现:Adam计算了梯度的二阶矩估计(Second Moment),也就是梯度平方的指数加权移动平均值。这反映了每个参数历史梯度的大小变化。
  3. 偏差校正(Bias Correction)
    1. 在训练初期,由于移动平均值初始为0,会导致估计偏向于0。Adam引入了校正机制,使得在初始阶段的估计更加准确,这对于保证训练初期稳定性至关重要。

Adam的步骤:
在每次迭代(更新参数)时,Adam会为每个参数做以下事情:

  1. 计算当前梯度。
  2. 更新一阶矩估计(带 momentum)。
  3. 更新二阶矩估计(带 RMSProp)。
  4. 对这两个估计进行偏差校正
  5. 使用校正后的估计来计算参数的实际更新量:更新量 = (校正后的一阶矩) / (sqrt(校正后的二阶矩) + 一个极小值)
与其他最先进方法的比较

表1和表2详细列出了我们的方法与以下最先进方法的比较结果:U-Net (Ronneberger, Fischer, and Brox 2015)、U-Net++ (Zhou et al. 2018)、Attn U-Net (Oktay et al. 2018)、CENet (Gu et al. 2019)、CPFNet (Feng et al. 2020)、PraNet (Fan et al. 2020)、FAT-Net (Wu et al. 2022)、TGANet (Tomar et al. 2022)、DCSAUNet (Xu et al. 2023)、XBound-Former (Wang et al. 2023)、CASF-Net (Zheng et al. 2023)、EIU-Net (Yu et al. 2023)、DTAN (Zhao et al. 2024)。在所有五个数据集上,我们的方法均取得了最佳的分割性能。此外,我们在图5中比较了训练过程中的收敛速度。其中,"单阶段"和"两阶段"分别代表ConDSeg从头开始训练和加载预训练权重(使用CR)进行训练。图中显示,即使仅进行单阶段训练,ConDSeg也能达到先进水平。当使用完整的ConDSeg框架(两阶段)时,我们的方法实现了最快的收敛速度和最佳的性能。

表一

表1:在Kvasir-Sessile、Kvasir-SEG和GlaS数据集上与其他方法的比较。

表二

表2:在ISIC-2016与ISIC-2017数据集上与其他方法的比较。

图五

图5:在Kvasir-SEG数据集训练过程中,本文方法与其他方法收敛曲线的对比。

理解

这两张图是模型性能随训练轮次(Epoch)变化的对比曲线,用于评估不同模型在语义分割任务中的收敛性和最终性能,核心指标分别是 mIoU(平均交并比) 和 mDSC(平均 Dice 相似系数),均为分割任务中衡量精度的关键指标(数值越接近 1,性能越好)

  1. 所有模型在训练初期(前 20 个 Epoch)mIoU 快速上升,体现模型快速学习特征的过程。
  2. 后期(40~100 Epoch)曲线逐渐平稳,说明模型收敛。
  3. 对比不同模型:“Ours (Two-Stage)”(本文提出的两阶段模型)在 mIoU 上明显高于 U-Net、U-Net++、TGANet 等 baseline 模型,证明其在区域重叠度的精度上更优。
  4. 训练初期(前 20 个 Epoch)mDSC 快速上升,模型快速学习分割边界和区域的能力。
  5. 后期曲线平稳,模型收敛。
  6. 对比不同模型:“Ours (Two-Stage)” 同样显著优于其他 baseline 模型,说明其在分割区域的整体一致性(尤其是小目标或精细边界)上表现更突出。

DSC与 IoU 类似但对小区域更敏感

消融实验

为验证我们提出的一致性增强训练策略以及所有提出模块的有效性,我们进行了全面的消融实验,这将在以下两个小节中详细阐述。

训练策略

在Kvasir-SEG数据集上,我们为ConDSeg的训练策略设计了5组消融实验:1)直接训练Net0(3.2.1节提出)并使用Net0进行预测。2)使用CR策略训练Net0并使用Net0进行预测。3)直接训练整个ConDSeg网络,不使用两阶段策略。4)采用两阶段策略。在第一阶段,使用Net0初步训练编码器;在第二阶段,训练整个网络。但在第一阶段未使用CR。5)使用两阶段策略,并在第一阶段采用CR。

在这5组实验中,1)和2)旨在比较和验证CR在增强编码器鲁棒性方面的有效性。3)至5)旨在验证使用两阶段策略的有效性以及采用提出的CR策略对网络性能的额外益处。如表3所示,按设置1)至5)顺序呈现的实验结果表明:CR策略显著提高了编码器的特征提取能力及其对不利条件的鲁棒性;采用两阶段训练方法并在第一阶段利用CR策略显著提升了模型性能,取得了最佳结果。

表三

表3:关于训练策略的消融实验。

理解

提出的模块

为验证所提出模块对模型性能的有效性,我们在GlaS数据集上设置了3组消融实验。所有实验均基于已在第一阶段通过CR策略增强的编码器进行。基线指的是在ConDSeg中,移除了SID并将CDFA替换为普通卷积层,并使用单尺度解码器。其具体结构详见补充材料。我们的4组实验设置如下:1)基线。2)添加SID和CDFA模块。3)进一步采用SA-Decoder,即完整的ConDSeg架构。根据表4所示,当逐步添加模块时,mIoU和mDSC均显著提高,并且在所有模块都使用时达到最优。更多消融实验的可视化及结果详见补充材料。

表四

表4:关于不同模块的消融实验。

总结

我们提出了一种通用的医学图像分割框架ConDSeg,旨在缓解医学影像中普遍存在的软边界和共现现象带来的挑战。针对边界模糊、光照条件差及对比度低等问题,我们提出的预训练策略——一致性强化,专门用于增强编码器在不利条件下的鲁棒性。此外,我们设计了语义信息解耦模块,将编码器的特征解耦为前景、背景和不确定区域三个部分,在训练过程中逐步获得减少不确定性的能力。为应对共现现象的挑战,对比驱动特征聚合模块利用前景和背景信息指导多层级特征图的融合并增强关键特征,帮助模型进一步区分前景与背景。此外,我们引入了尺寸感知解码器,以实现对图像中不同尺寸多目标的精确定位。在涵盖多种模态的五个广泛使用的医学图像分割数据集上,我们的ConDSeg均取得了最先进的性能,验证了本框架的先进性和普适性。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐