摘要

一 介绍

问题一:双变量的前景与背景建模范式什么意思?

双变量的前景与背景建模范式(Bivariate FG&BG Modeling Paradigm)是指在共显著目标检测(CoSOD)任务中,​​同时显式建模前景(Foreground, FG)和背景(Background, BG)信息​​,并通过增强两者的区分性来提升检测性能。

  1. ​双变量(Bivariate)​​:传统方法通常仅关注前景(共显著目标)的建模(单变量),而忽略对背景的显式分析。双变量范式则同时将前景和背景作为建模对象,强调两者的交互与对比。

  2. ​显式建模(Explicit Modeling)​

    • ​前景建模​​:通过挖掘图像组内共显著目标的共性(如一致性外观、位置等)和单图像内的显著性特征。
    • ​背景建模​​:显式识别背景中的干扰区域(如非共有的显著物体或相似伴随物),而非仅将其视为“非前景”的残余部分。
  3. ​区分性增强(Discriminative Learning)​​:通过对比学习(如通道注意力机制)或交互模块(如文中提出的CtP2T和TGFR),强化前景与背景特征的对立性,使模型更好地区分两者。例如:

    • ​TGFR模块​​:利用学习到的前景/背景token反向优化分割特征,提升特征判别力。
    • ​CtP2T模块​​:通过计算前景与背景token的通道相似性,抑制混淆性强的特征通道。
  4. ​与传统方法的区别​​:传统方法(如单变量建模)仅通过隐式背景抑制(如损失函数约束)处理背景,而双变量范式将背景作为主动建模对象,通过显式对比和交互优化性能。

二 有关工作

2.1. 协同显著目标检测

2.2. Transformer

三 提出的方法

3.1 概述

图1. 我们所提出的用于协同显著目标检测(CoSOD)的DMT模型的总体流程图。具体而言,该框架由四个部分组成,即用于生成分割特征的区域对区域相关性模块(R2R)、用于构建检测标记的图像内对比诱导的像素到标记相关性模块(CtP2T)和协同显著性标记对标记相关性模块(CoT2T),以及用于在标记引导下细化分割特征的标记引导特征细化模块(TGFR)。

问题一:​​详细介绍一下这张图的流程是什么?

DMT CoSOD 由四个模块组成:

  1. R2R:负责从图像中提取显著性分割特征。

  2. CtP2T:从候选前景区域生成“共显 token(co-saliency token)”。

  3. CoT2T:构建 token 间的协同交互,进一步融合图组信息。

  4. TGFR(Token-Guided Feature Refinement):使用 token 引导分割特征精化。


整体流程步骤(图中从左往右):

1. 输入图像组:多张图像输入(图中左侧示意了不同图像),共享特征提取器(CNN),提取低层特征。


2. R2R:生成分割特征

  • 蓝色箭头路径:各图通过 CNN 编码器(通常是 ResNet 等),产生分割特征

  • 得到的是初步的 F_seg,后续会被引导细化。


3. 候选区域生成 + 检测 token 构建

  • 黄色盒子部分为三个步骤:

    • 1Z2D: 把初始分割特征中的前景(或背景)区域编码成向量;

    • CtP2T: 将图中前景区域构造成 co-saliency token(绿色方块);

    • CoT2T: 将组内 token 进行交互融合,提取组级共性。

  • 最终输出两个 token:

    • 绿色:共显 token(co-saliency token)

    • 橙色:背景 token(background token)


 4. TGFR:Token 引导的分割特征精化

  • 分割特征送入 TGFR 模块,和 token 一起作用;

  • TGFR 类似 Transformer 的注意力机制,引导 F_seg 更聚焦于共显区域;

  • 过程重复 3 次,每一次的 TGFR 都用来自前一次精化后的特征和更新的 token。


 5. 最终融合输出 CoSOD 结果

  • 每张图最终得出 F_seg,再通过一个融合模块(如 1×1 Conv)生成预测 mask;

  • 输出是二值的共显目标区域(图中黑白图像)。


📌 总结关键点:

模块

作用

R2R

CNN提取显著性候选区域

CtP2T

将候选区域生成 co-saliency token

CoT2T

跨图 token 交互,提炼共性

TGFR

用 token 引导分割特征细化

迭代流程

多阶段 TGFR 细化,逐步增强共显区域的表达能力

1. 输入阶段​

  • ​输入数据​​:两张图像(如含人物和猫的图片),组成一个图像组(Image Group),目标是检测组内共有的显著目标(如猫)。

  • ​特征提取​​:通过CNN backbone(如ResNet)提取每张图像的底层视觉特征(图中标注的CNN feature)。


​2. 双分支处理流程​

流程分为两条并行的数据流,分别用​​蓝色(分割特征生成)​​和​​橙色(检测令牌构建)​​表示:

​分支一:分割特征生成(蓝色路径)​

  • ​模块:R2R(Recurrent Refinement Network)​

    • 作用:迭代优化分割特征,生成初步的显著性区域特征(FetFtdt等)。

    • 流程:

      1. 通过循环结构(如GP21GP231等模块)逐步细化特征。

      2. 结合跨图像信息,增强共显著目标的特征一致性。

​分支二:检测令牌构建(橙色路径)​

  • ​模块:CtP2T(Channel-to-Pixel Transformer)​

    • 作用:将CNN特征转换为前景(co-saliency token)和背景(background token)的令牌(Token)。

    • 关键操作:

      • 计算通道相似性,抑制背景干扰通道(如TnOTnI等步骤)。

  • ​模块:CoT2T(Co-Saliency Token Transformer)​

    • 作用:对前景和背景令牌进行交互建模,强化两者的区分性(如T2T2.5等步骤)。


​3. 特征细化与输出​

  • ​模块:TGFR(Token-Guided Feature Refinement)​

    • 作用:利用分支二生成的令牌(前景/背景)反向优化分支一的分割特征。

    • 流程:

      1. 前景令牌指导分割特征聚焦共显著区域(如TGFR多次迭代)。

      2. 背景令牌抑制非共有干扰区域(如dtndrtn等操作)。

  • ​输出​​:最终生成高精度的共显著目标分割图(如N1nZ2等结果层)。


​4. 关键设计亮点​

  1. ​双变量交互​​:前景和背景令牌通过对比学习(如CtP2T)显式区分,避免传统方法中背景干扰的问题。

  2. ​动态细化机制​​:TGFR模块实现令牌与分割特征的闭环优化,提升细节保留能力(如猫的毛发边缘)。

  3. ​协同处理​​:两条分支分别处理局部(分割)和全局(令牌)信息,通过交互模块(如CoT2T)融合多尺度特征。


​5. 示例说明​

  • ​输入图像组​​:一张含人物,一张含猫。

  • ​流程结果​​:

    • 分支一可能初步分割出人物和猫;

    • 分支二通过令牌分析发现“猫”是共显著目标,“人物”是背景干扰;

    • TGFR最终输出仅包含“猫”的共显著掩码。

四 实验

4.1. 评估数据集与评估指标

 用了四种广泛使用的评估指标进行定量评估,即结构度量指标 、增强对齐度量指标 [10]、最大F值度量指标(maxF)[1]以及平均绝对误差(MAE)[6] 。

4.2. 实现细节

COCO - 9k数据集(65组共9213张图像)

DUTS类别数据集(291组共8250张图像)

五 与当前最先进方法的比较

表3. 我们的模型与其他当前最先进方法的定量比较。我们在三个共显著性目标检测(CoSOD)基准数据集上进行了比较。红色和蓝色分别表示最优结果和次优结果。 

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐