TGRS 即插即用 | GLVMamba双剑合璧!让模型兼具全局视野与局部精度,代码已开源!
1. 基本信息

-
标题: GLVMamba: A Global–Local Visual State-Space Model for Remote Sensing Image Segmentation (GLVMamba: 一种用于遥感图像分割的全局-局部视觉状态空间模型)
-
论文来源:https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=11014226
2. 核心创新点
-
提出GLVMamba架构: 提出一种新的视觉状态空间(VSS)模型GLVMamba,该模型采用CNN作为编码器,并设计了创新的GLVSS模块作为核心解码器,有效融合Mamba的全局上下文建模能力与CNN的局部特征提取优势。
-
设计全局-局部VSS模块 (GLVSS Block): 针对Mamba中SS2D扫描机制破坏像素邻近性的问题,设计了GLVSS模块。该模块引入局部性前馈和移位窗口机制,增强了局部与全局上下文的融合,从而提升了模型对物体边缘轮廓的精细化分割能力。
-
构建尺度感知金字塔池化模块 (SCPP Module): 为解决遥感图像中的“孔洞”和误检问题,提出了SCPP模块。该模块能自适应地融合多尺度特征,并提取出最具判别性的信息,有效缓解了光照、阴影等因素导致的分割难题。
➔➔➔➔点击查看原文,获取本文及其他精选即插即用模块集合
https://mp.weixin.qq.com/s/feL76mVxrrfsz8aLt7NRSQ
3. 方法详解
整体结构概述
GLVMamba采用经典的编码器-解码器架构。编码器部分使用轻量级的CNN(ResNet18)作为骨干网络进行特征提取,并集成了一个尺度感知金字塔池化(SCPP)模块以捕获多尺度特征。解码器部分是模型的核心,由本文提出的多个全局-局部视觉状态空间(GLVSS)模块堆叠而成,负责在重建特征时深度融合全局与局部上下文信息。此外,模型通过跳跃连接将编码器低层级的特征传递给解码器,以补偿下采样过程中损失的空间细节。最终,解码器输出的特征图经过一个分割头(包含双线性插值和激活函数)恢复至原始分辨率,生成最终的分割结果。

Overall architecture of GLVMamba
步骤分解
-
编码器 (Encoder):
-
输入一幅遥感图像
X(尺寸 H×W×3),首先通过ResNet18骨干网络提取初步的层次化特征。 -
在编码器的深层,集成了SCPP模块,该模块通过并行处理(包括不同扩张率的空洞卷积、全局池化和标准卷积)来捕获不同尺度的特征。其内部的尺度感知机制能自适应地学习并融合这些多尺度信息,从而有效应对目标内部的变异性和类别间的相似性,减少“孔洞”和误检。
-
-
解码器 (Decoder):
-
解码器由四个阶段的GLVSS模块组成,负责从编码器输出的深层特征中逐步重建高分辨率的分割图。
-
GLVSS模块是此架构的核心。它并行处理输入特征:一个分支通过标准的线性投影和SiLU激活;另一个分支则通过一个包含深度可分离卷积和核心GLSS2D模块的复杂路径。
-
在GLSS2D模块内部,特征被分为两路:一路通过SS2D(2D选择性扫描)捕获长距离依赖关系,即全局上下文;另一路通过并行的卷积层(1x1和3x3)来补充SS2D扫描中丢失的邻近像素依赖关系,即局部上下文。
-
通过移位窗口(Shift Window)和局部性前馈(Locality Feedforward)机制,进一步加强了局部和全局特征的交互与细化。
-
最终,GLVSS模块将两个并行分支的输出通过哈达玛积(element-wise product)进行聚合,实现了全局与局部信息的有效融合。
-
-
跳跃连接 (Skip Connections):
-
为了保留图像的精细空间细节(如边缘和纹理),模型将编码器前三个阶段输出的特征图通过跳跃连接,直接馈送给解码器后三个阶段的对应层,弥补了因多次下采样造成的空间信息损失。
-
-
分割头 (Segmentation Head):
-
解码器输出的最终特征图通过一个简单的分割头,该分割头利用双线性插值进行上采样,将特征图尺寸恢复到与输入图像相同,并输出每个像素的类别预测,完成语义分割任务。
-
关键公式
-
状态空间模型 (SSM) 核心方程: SSM通过隐状态
h将输入序列x(t)映射到输出序列y(t)。其离散化形式如下:其中,
A,B,C,D是由输入动态调整的系统矩阵,决定了模型的动态行为。 -
GLVSS 模块特征聚合: GLVSS模块的输出
X*是由两个并行分支的特征X₁和X₂聚合而成:其中
LN是层归一化,DWConv是深度可分离卷积,GLSS2D是核心的全局-局部处理模块,⊙表示哈达玛积。 -
SCPP 模块特征融合: SCPP模块中的尺度感知部分将三个不同尺度的特征图
F_A,F_B,F_C进行加权融合,权重α,β,γ是通过自学习得到的像素级注意力图:
4. 即插即用模块作用
本文的核心贡献可被视为两个即插即用的模块:GLVSS Block 和 SCPP Module。
适用场景
-
遥感图像语义分割: 模块设计的初衷,适用于高分辨率航空、卫星影像的像素级分类,如土地覆盖测绘、城市规划、环境监测等。
-
通用语义分割: 可推广至其他需要精细化分割的场景,如自动驾驶中的道路场景理解、医疗影像(如MRI、CT)中的病灶分割。
-
需要融合全局与局部信息的视觉任务: 任何需要同时考虑长距离依赖和局部细节的计算机视觉任务,如目标检测、实例分割等。
主要作用
-
GLVSS Block:
-
模拟/替代Transformer能力: 以线性计算复杂度(
O(N))实现了类似Transformer的全局感受野,有效捕获长距离依赖关系,同时避免了Transformer二次方级别(O(N²))的计算开销。 -
增强局部细节建模: 通过引入并行卷积分支和移位窗口机制,弥补了Mamba原生SSM在2D图像上破坏空间邻近性的缺陷,显著增强了对物体边缘、纹理等局部细节的感知和重建能力。
-
提升模型鲁棒性: 通过有效融合全局与局部上下文,模型能更好地理解被阴影遮挡或与背景相似的物体,减少了误检和漏检。
-
-
SCPP Module:
-
增强多尺度特征表达: 通过并行使用不同扩张率的空洞卷积,捕获不同尺度的上下文信息,有效应对遥感图像中目标尺寸变化大的问题。
-
降低“孔洞”与误分类: 其内置的尺度感知机制能自适应地为不同尺度的特征分配权重,抑制噪声和无关信息,从而显著缓解因目标内部纹理不均一导致的“孔洞”现象以及类别间高度相似造成的误分类。
-
提升可部署性: 相比于ASPP等模块,SCPP通过自适应融合策略更高效地利用特征,有助于在保证性能的同时,构建更为精简和高效的模型。
-
总结
GLVMamba通过“全局-局部”双管齐下的GLVSS模块和“尺度自适应”的SCPP模块,为遥感图像分割提供了一个兼具Transformer全局视野和CNN局部精度的Mamba新范式,实现了高精度与高效率的平衡。
➔➔➔➔点击查看原文,获取本文及其他精选即插即用模块集合
https://mp.weixin.qq.com/s/feL76mVxrrfsz8aLt7NRSQ
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)