2023 DMT(总结) 用于共显著性目标检测的判别性协同显著性和背景挖掘变压器
摘要
一 介绍
问题一:双变量的前景与背景建模范式什么意思?
双变量的前景与背景建模范式(Bivariate FG&BG Modeling Paradigm)是指在共显著目标检测(CoSOD)任务中,同时显式建模前景(Foreground, FG)和背景(Background, BG)信息,并通过增强两者的区分性来提升检测性能。
-
双变量(Bivariate):传统方法通常仅关注前景(共显著目标)的建模(单变量),而忽略对背景的显式分析。双变量范式则同时将前景和背景作为建模对象,强调两者的交互与对比。
-
显式建模(Explicit Modeling)
- 前景建模:通过挖掘图像组内共显著目标的共性(如一致性外观、位置等)和单图像内的显著性特征。
- 背景建模:显式识别背景中的干扰区域(如非共有的显著物体或相似伴随物),而非仅将其视为“非前景”的残余部分。
-
区分性增强(Discriminative Learning):通过对比学习(如通道注意力机制)或交互模块(如文中提出的CtP2T和TGFR),强化前景与背景特征的对立性,使模型更好地区分两者。例如:
- TGFR模块:利用学习到的前景/背景token反向优化分割特征,提升特征判别力。
- CtP2T模块:通过计算前景与背景token的通道相似性,抑制混淆性强的特征通道。
-
与传统方法的区别:传统方法(如单变量建模)仅通过隐式背景抑制(如损失函数约束)处理背景,而双变量范式将背景作为主动建模对象,通过显式对比和交互优化性能。
二 有关工作
2.1. 协同显著目标检测
2.2. Transformer
三 提出的方法
3.1 概述

图1. 我们所提出的用于协同显著目标检测(CoSOD)的DMT模型的总体流程图。具体而言,该框架由四个部分组成,即用于生成分割特征的区域对区域相关性模块(R2R)、用于构建检测标记的图像内对比诱导的像素到标记相关性模块(CtP2T)和协同显著性标记对标记相关性模块(CoT2T),以及用于在标记引导下细化分割特征的标记引导特征细化模块(TGFR)。
问题一:详细介绍一下这张图的流程是什么?
DMT CoSOD 由四个模块组成:
-
R2R:负责从图像中提取显著性分割特征。
-
CtP2T:从候选前景区域生成“共显 token(co-saliency token)”。
-
CoT2T:构建 token 间的协同交互,进一步融合图组信息。
-
TGFR(Token-Guided Feature Refinement):使用 token 引导分割特征精化。
整体流程步骤(图中从左往右):
1. 输入图像组:多张图像输入(图中左侧示意了不同图像),共享特征提取器(CNN),提取低层特征。
2. R2R:生成分割特征
-
蓝色箭头路径:各图通过 CNN 编码器(通常是 ResNet 等),产生分割特征。
-
得到的是初步的
F_seg,后续会被引导细化。
3. 候选区域生成 + 检测 token 构建
-
黄色盒子部分为三个步骤:
-
1Z2D: 把初始分割特征中的前景(或背景)区域编码成向量; -
CtP2T: 将图中前景区域构造成 co-saliency token(绿色方块); -
CoT2T: 将组内 token 进行交互融合,提取组级共性。
-
-
最终输出两个 token:
-
绿色:共显 token(co-saliency token)
-
橙色:背景 token(background token)
-
4. TGFR:Token 引导的分割特征精化
-
分割特征送入 TGFR 模块,和 token 一起作用;
-
TGFR 类似 Transformer 的注意力机制,引导
F_seg更聚焦于共显区域; -
过程重复 3 次,每一次的 TGFR 都用来自前一次精化后的特征和更新的 token。
5. 最终融合输出 CoSOD 结果
-
每张图最终得出
F_seg,再通过一个融合模块(如 1×1 Conv)生成预测 mask; -
输出是二值的共显目标区域(图中黑白图像)。
📌 总结关键点:
|
模块 |
作用 |
|---|---|
|
R2R |
CNN提取显著性候选区域 |
|
CtP2T |
将候选区域生成 co-saliency token |
|
CoT2T |
跨图 token 交互,提炼共性 |
|
TGFR |
用 token 引导分割特征细化 |
|
迭代流程 |
多阶段 TGFR 细化,逐步增强共显区域的表达能力 |
1. 输入阶段
-
输入数据:两张图像(如含人物和猫的图片),组成一个图像组(Image Group),目标是检测组内共有的显著目标(如猫)。
-
特征提取:通过CNN backbone(如ResNet)提取每张图像的底层视觉特征(图中标注的
CNN feature)。
2. 双分支处理流程
流程分为两条并行的数据流,分别用蓝色(分割特征生成)和橙色(检测令牌构建)表示:
分支一:分割特征生成(蓝色路径)
-
模块:R2R(Recurrent Refinement Network)
-
作用:迭代优化分割特征,生成初步的显著性区域特征(
Fet、Ftdt等)。 -
流程:
-
通过循环结构(如
GP21、GP231等模块)逐步细化特征。 -
结合跨图像信息,增强共显著目标的特征一致性。
-
-
分支二:检测令牌构建(橙色路径)
-
模块:CtP2T(Channel-to-Pixel Transformer)
-
作用:将CNN特征转换为前景(
co-saliency token)和背景(background token)的令牌(Token)。 -
关键操作:
-
计算通道相似性,抑制背景干扰通道(如
TnO、TnI等步骤)。
-
-
-
模块:CoT2T(Co-Saliency Token Transformer)
-
作用:对前景和背景令牌进行交互建模,强化两者的区分性(如
T2、T2.5等步骤)。
-
3. 特征细化与输出
-
模块:TGFR(Token-Guided Feature Refinement)
-
作用:利用分支二生成的令牌(前景/背景)反向优化分支一的分割特征。
-
流程:
-
前景令牌指导分割特征聚焦共显著区域(如
TGFR多次迭代)。 -
背景令牌抑制非共有干扰区域(如
dtn、drtn等操作)。
-
-
-
输出:最终生成高精度的共显著目标分割图(如
N1、nZ2等结果层)。
4. 关键设计亮点
-
双变量交互:前景和背景令牌通过对比学习(如CtP2T)显式区分,避免传统方法中背景干扰的问题。
-
动态细化机制:TGFR模块实现令牌与分割特征的闭环优化,提升细节保留能力(如猫的毛发边缘)。
-
协同处理:两条分支分别处理局部(分割)和全局(令牌)信息,通过交互模块(如CoT2T)融合多尺度特征。
5. 示例说明
-
输入图像组:一张含人物,一张含猫。
-
流程结果:
-
分支一可能初步分割出人物和猫;
-
分支二通过令牌分析发现“猫”是共显著目标,“人物”是背景干扰;
-
TGFR最终输出仅包含“猫”的共显著掩码。
-
四 实验
4.1. 评估数据集与评估指标
用了四种广泛使用的评估指标进行定量评估,即结构度量指标
、增强对齐度量指标
[10]、最大F值度量指标(maxF)[1]以及平均绝对误差(MAE)[6] 。
4.2. 实现细节
COCO - 9k数据集(65组共9213张图像)
DUTS类别数据集(291组共8250张图像)
五 与当前最先进方法的比较

表3. 我们的模型与其他当前最先进方法的定量比较。我们在三个共显著性目标检测(CoSOD)基准数据集上进行了比较。红色和蓝色分别表示最优结果和次优结果。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)