Transformer 之后:视觉语言模型与 RGB-D 感知的三条进化主线

本文承接第一篇"三个技术瓶颈"的叙事,聚焦 Transformer 确立范式之后的演变。三条主线贯穿全文:效率优化(让 Transformer 跑得动)、语义升维(从看见到看懂,VLM 的崛起)、几何内化(让深度从辅助通道变为注意力的一等公民)。

关键时间线

效率补课 2020 ViT(图像 Patch 化,O(n²) 代价显现) 2021 Swin Transformer(窗口注意力,线性复杂度) 2022 ConvNeXt(CNN 回潮)/ FlashAttention(工程加速) 语义升维:VLM 崛起 2021 CLIP(视觉-语言对齐)/ DINO(自监督视觉) 2023 LLaVA(多模态对话)/ SAM(通用分割)/ DINOv2 2024 Qwen-VL / InternVL(开源多模态大模型) 几何内化:RGB-D 感知进化 2024 统一 RGB-D Encoder(ICLR,深度参与注意力) 2025 Geometry Self-Attention(CVPR,几何先验驱动) 下一代候选 2024 Mamba / SSM(线性复杂度序列建模) Transformer 之后的感知架构演化(2020 – 2025)

一、起点:Transformer 落地的第一个问题——算不动

在这里插入图片描述

第一篇我们论证了 Self-Attention 如何一次性解答三个技术瓶颈。但"解答"有一个代价:O(n²) 的计算复杂度

对于一张 224×224 的图像切成 196 个 patch,这不算什么。但真实感知场景远不止于此:高分辨率工业相机(1024×1024 → 4096 个 patch)、密集点云(数万到数十万个点)、多帧视频——token 数量一旦上万,注意力矩阵的显存占用就呈平方级爆炸。

社区沿三条路线"补课":

  • 窗口注意力(Swin Transformer, 2021):把全局注意力限制在局部窗口内,再通过窗口移位(Shifted Window)实现跨窗口信息交换。复杂度从 O(n²) 降到 O(n),同时保留了层级特征结构。
  • 架构回潮(ConvNeXt, 2022):反过来思考——既然 Transformer 的训练策略(大 batch、强增强、长训练)这么好,能不能用它来"武装" CNN?ConvNeXt 用 Transformer 的训练配方重新设计 ResNet,证明 CNN 在同等算力下仍有竞争力。
  • 工程加速(FlashAttention, 2022):不改架构,改内存访问模式——通过 tiling 和 kernel fusion 减少 GPU 显存读写次数,将注意力计算的实际吞吐量提升 2-4 倍。

这三条线不是互斥的,而是叠加使用。效率补课是后续所有演变的前提——只有跑得动,才谈得上跑得好。


二、语义升维:VLM 让感知从"看见"走向"看懂"

在这里插入图片描述

从分类到理解

传统视觉模型的输出是封闭集合上的标签——“猫”“狗”“箱子”。但真实的机器人感知需求是开放式的:“找到货架第二层的红色箱子”“判断这个包裹是否破损”。这要求模型不仅看见物体,还要理解语言指令、空间关系和任务语义。

CLIP(2021) 打开了第一扇门:用对比学习把图像和文本编码到同一个向量空间,实现了零样本分类——不需要针对新类别重新训练,只要能用语言描述,模型就能识别。

多模态 Transformer 的统一架构

CLIP 之后,社区迅速走向更完整的视觉-语言模型(VLM) 架构:

  • 视觉 Encoder(通常是 ViT 或其变体)把图像编码为一组视觉 token;
  • 语言模型(通常是 LLM)把文本编码为语言 token;
  • 两组 token 在共享的 Transformer Decoder 中交互,实现跨模态推理。

LLaVA(2023)、Qwen-VL(2024)等模型验证了这条路线的通用性:同一个模型可以做图像描述、视觉问答、目标检测、甚至机器人指令解析。

环境感知的范式变化

VLM 对环境感知的影响是结构性的:

传统感知 VLM 驱动感知
预定义类别(COCO 80 类) 开放词汇(语言描述即类别)
固定任务(检测/分割) 指令驱动(“找到…”“判断…”)
单模态(RGB) 多模态(视觉 + 语言 + 空间)
场景无关 场景理解(空间关系、任务上下文)

向 3D 延伸

3D-VLM(PointCLIP、3D-LLM 等)开始将点云与语言对齐:不再只是"这是一个椅子",而是"这把椅子在桌子左边,椅腿朝前"。对机器人抓取而言,这意味着感知输出可以从"类别 + 框"升级为**“物体是什么、在哪里、怎么摆、能不能抓”**的完整语义描述。


三、几何内化:RGB-D 感知从"特征拼接"到"几何自注意力"

在这里插入图片描述

这是本文最核心的章节,也是我们团队正在推进的技术路线。

早期方案:深度只是"第二张图"

RGB-D 感知的直觉很简单:RGB 提供纹理和语义,深度提供几何。早期方案通常采用双流 CNN——RGB 和 Depth 各过一个 Encoder,然后在某一层做拼接(concat)或相加(add)融合。

问题在于:融合发生在特征提取之后。两个模态在各自的 Encoder 里独立编码,互不知道对方的存在;等到拼接时,RGB 特征已经"定型",深度信息只能做有限的修正。这就像两个人各写各的报告,最后订在一起——缺乏真正的协作。

第一步进化:统一编码,深度参与注意力

我们的第一个核心改进是取消双流,建立统一的 RGB-D Encoder

具体做法:将 RGB patch 和对应的深度 patch 在输入层就拼接为统一的 token 序列,从第一层 Transformer 开始,RGB token 和 Depth token 就在同一个注意力矩阵中交互。深度不再是"事后补充",而是从编码起点就参与特征构建。

这带来了两个关键收益:

  • 模态交互前置:浅层特征就已经融合了纹理和几何信息,而非等到深层才"见面";
  • 参数效率:单流 Encoder 的参数量显著小于双流,且避免了两个 Encoder 之间的特征对齐问题。

在 NYUDepthv2 和 SUNRGBD 两个标准基准上,这一方案在同等参数量下取得了当时的最优分割精度(ICLR 2024)。

第二步进化:几何先验驱动的自注意力

统一编码解决了"深度何时参与"的问题,但还没有解决"深度如何参与"的问题。在标准 Self-Attention 中,所有 token 的交互方式是相同的——Q·K 点积只衡量特征向量的相似度,不包含任何 3D 空间信息。两个在图像上相邻但深度差异很大的点(比如前景物体和背景墙壁),在注意力计算中与两个同深度的相邻点没有区别。

我们的第二步改进是:从深度图中显式提取几何先验,并将其注入注意力机制

技术路径:

  1. 几何先验生成:从深度图计算每个 patch 的 3D 坐标、法向量、局部曲率等几何属性;
  2. Geometry Self-Attention:在标准 Q·K 注意力之外,增加一个几何亲和项——两个 token 之间的注意力权重不仅取决于特征相似度,还取决于它们的3D 空间关系(距离、朝向、共面性);
  3. 自适应融合:几何先验的权重可学习,模型自行决定在哪些区域更依赖几何约束(如物体边缘),哪些区域更依赖语义相似度(如纹理均匀区域)。

这意味着深度不再是"第二张图",而是注意力机制的几何约束。在 CVPR 2025 的实验中,这一方案在分割精度和边界质量上均显著超越前代,尤其在物体边缘和遮挡区域——恰恰是抓取规划最关心的区域——提升最为明显。

对抓取/分拣的启示

在仓储物流场景中,抓取决策依赖的不仅是"这是什么物体",更是"这个物体的表面朝向如何、边缘在哪里、与相邻物体的空间关系如何"。几何自注意力天然适配这类需求:它让 Encoder 在特征提取阶段就编码了 3D 空间结构,而非把这些信息留给下游的位姿估计模块去"重新发现"。


四、后续迭代方向展望

在这里插入图片描述

站在当前节点,RGB-D 感知的进化沿四个方向展开:

效率侧:Geometry Self-Attention 引入了额外的几何计算开销。在机器人端侧部署(实时性要求 < 100ms)的约束下,稀疏注意力(只计算几何邻域内的 token)和线性注意力近似是必须攻克的工程问题。

融合侧:当前的 VLM 主要处理 RGB + 语言,RGB-D 感知主要处理 RGB + 深度。下一步是三模态统一——RGB-D + 语言 + 3D 几何在同一个 token 空间中交互,形成 Geometry-Aware VLM。想象一个模型同时理解"红色箱子"(语言)、“表面法向量朝上”(几何)、“纹理有破损”(视觉),并输出"从顶部抓取,避开破损区域"。

规模侧:RGB 领域已有 DINOv2 这样的通用视觉基础模型(在海量无标注图像上自监督预训练)。RGB-D 领域尚缺乏同等规模的预训练基础——大规模深度数据的采集成本远高于 RGB。合成数据(仿真环境渲染)和跨域迁移是可能的突破口。

任务侧:从分割/检测等"理解"任务,向 6-DoF 抓取位姿估计、可操作区域预测、装配序列规划等"行动"任务延伸。感知与决策的边界正在模糊——Encoder 的输出不再只是"看到了什么",而是直接编码"该怎么抓"。

下一代候选:Mamba / 状态空间模型(SSM)以线性复杂度处理长序列,在点云等大规模 3D 数据上展现出潜力。但短期内更可能是与 attention 混合使用(如局部用 SSM、全局用 attention),而非完全替代。


五、小结

Transformer 是"新基建",而非终点。效率优化让它跑得动,VLM 让它看得懂,几何内化让它感知到 3D 空间结构

对 RGB-D 感知而言,真正的进化不在于"加了一个深度通道",而在于让几何先验成为注意力机制的一等公民——从特征拼接的"物理混合",走向几何约束的"化学融合"。


延伸阅读

  1. Liu et al., Swin Transformer: Hierarchical Vision Transformer using Shifted Windows, ICCV 2021
  2. Radford et al., Learning Transferable Visual Models From Natural Language Supervision (CLIP), ICML 2021
  3. Liu et al., Visual Instruction Tuning (LLaVA), NeurIPS 2023
  4. Oquab et al., DINOv2: Learning Robust Visual Features without Supervision, TMLR 2024
  5. Gu & Dao, Mamba: Linear-Time Sequence Modeling with Selective State Spaces, COLM 2024
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐