Transformer 之后:视觉语言模型与 RGB-D 感知的三条进化主线
Transformer 之后:视觉语言模型与 RGB-D 感知的三条进化主线
本文承接第一篇"三个技术瓶颈"的叙事,聚焦 Transformer 确立范式之后的演变。三条主线贯穿全文:效率优化(让 Transformer 跑得动)、语义升维(从看见到看懂,VLM 的崛起)、几何内化(让深度从辅助通道变为注意力的一等公民)。
关键时间线
一、起点:Transformer 落地的第一个问题——算不动

第一篇我们论证了 Self-Attention 如何一次性解答三个技术瓶颈。但"解答"有一个代价:O(n²) 的计算复杂度。
对于一张 224×224 的图像切成 196 个 patch,这不算什么。但真实感知场景远不止于此:高分辨率工业相机(1024×1024 → 4096 个 patch)、密集点云(数万到数十万个点)、多帧视频——token 数量一旦上万,注意力矩阵的显存占用就呈平方级爆炸。
社区沿三条路线"补课":
- 窗口注意力(Swin Transformer, 2021):把全局注意力限制在局部窗口内,再通过窗口移位(Shifted Window)实现跨窗口信息交换。复杂度从 O(n²) 降到 O(n),同时保留了层级特征结构。
- 架构回潮(ConvNeXt, 2022):反过来思考——既然 Transformer 的训练策略(大 batch、强增强、长训练)这么好,能不能用它来"武装" CNN?ConvNeXt 用 Transformer 的训练配方重新设计 ResNet,证明 CNN 在同等算力下仍有竞争力。
- 工程加速(FlashAttention, 2022):不改架构,改内存访问模式——通过 tiling 和 kernel fusion 减少 GPU 显存读写次数,将注意力计算的实际吞吐量提升 2-4 倍。
这三条线不是互斥的,而是叠加使用。效率补课是后续所有演变的前提——只有跑得动,才谈得上跑得好。
二、语义升维:VLM 让感知从"看见"走向"看懂"

从分类到理解
传统视觉模型的输出是封闭集合上的标签——“猫”“狗”“箱子”。但真实的机器人感知需求是开放式的:“找到货架第二层的红色箱子”“判断这个包裹是否破损”。这要求模型不仅看见物体,还要理解语言指令、空间关系和任务语义。
CLIP(2021) 打开了第一扇门:用对比学习把图像和文本编码到同一个向量空间,实现了零样本分类——不需要针对新类别重新训练,只要能用语言描述,模型就能识别。
多模态 Transformer 的统一架构
CLIP 之后,社区迅速走向更完整的视觉-语言模型(VLM) 架构:
- 视觉 Encoder(通常是 ViT 或其变体)把图像编码为一组视觉 token;
- 语言模型(通常是 LLM)把文本编码为语言 token;
- 两组 token 在共享的 Transformer Decoder 中交互,实现跨模态推理。
LLaVA(2023)、Qwen-VL(2024)等模型验证了这条路线的通用性:同一个模型可以做图像描述、视觉问答、目标检测、甚至机器人指令解析。
环境感知的范式变化
VLM 对环境感知的影响是结构性的:
| 传统感知 | VLM 驱动感知 |
|---|---|
| 预定义类别(COCO 80 类) | 开放词汇(语言描述即类别) |
| 固定任务(检测/分割) | 指令驱动(“找到…”“判断…”) |
| 单模态(RGB) | 多模态(视觉 + 语言 + 空间) |
| 场景无关 | 场景理解(空间关系、任务上下文) |
向 3D 延伸
3D-VLM(PointCLIP、3D-LLM 等)开始将点云与语言对齐:不再只是"这是一个椅子",而是"这把椅子在桌子左边,椅腿朝前"。对机器人抓取而言,这意味着感知输出可以从"类别 + 框"升级为**“物体是什么、在哪里、怎么摆、能不能抓”**的完整语义描述。
三、几何内化:RGB-D 感知从"特征拼接"到"几何自注意力"

这是本文最核心的章节,也是我们团队正在推进的技术路线。
早期方案:深度只是"第二张图"
RGB-D 感知的直觉很简单:RGB 提供纹理和语义,深度提供几何。早期方案通常采用双流 CNN——RGB 和 Depth 各过一个 Encoder,然后在某一层做拼接(concat)或相加(add)融合。
问题在于:融合发生在特征提取之后。两个模态在各自的 Encoder 里独立编码,互不知道对方的存在;等到拼接时,RGB 特征已经"定型",深度信息只能做有限的修正。这就像两个人各写各的报告,最后订在一起——缺乏真正的协作。
第一步进化:统一编码,深度参与注意力
我们的第一个核心改进是取消双流,建立统一的 RGB-D Encoder。
具体做法:将 RGB patch 和对应的深度 patch 在输入层就拼接为统一的 token 序列,从第一层 Transformer 开始,RGB token 和 Depth token 就在同一个注意力矩阵中交互。深度不再是"事后补充",而是从编码起点就参与特征构建。
这带来了两个关键收益:
- 模态交互前置:浅层特征就已经融合了纹理和几何信息,而非等到深层才"见面";
- 参数效率:单流 Encoder 的参数量显著小于双流,且避免了两个 Encoder 之间的特征对齐问题。
在 NYUDepthv2 和 SUNRGBD 两个标准基准上,这一方案在同等参数量下取得了当时的最优分割精度(ICLR 2024)。
第二步进化:几何先验驱动的自注意力
统一编码解决了"深度何时参与"的问题,但还没有解决"深度如何参与"的问题。在标准 Self-Attention 中,所有 token 的交互方式是相同的——Q·K 点积只衡量特征向量的相似度,不包含任何 3D 空间信息。两个在图像上相邻但深度差异很大的点(比如前景物体和背景墙壁),在注意力计算中与两个同深度的相邻点没有区别。
我们的第二步改进是:从深度图中显式提取几何先验,并将其注入注意力机制。
技术路径:
- 几何先验生成:从深度图计算每个 patch 的 3D 坐标、法向量、局部曲率等几何属性;
- Geometry Self-Attention:在标准 Q·K 注意力之外,增加一个几何亲和项——两个 token 之间的注意力权重不仅取决于特征相似度,还取决于它们的3D 空间关系(距离、朝向、共面性);
- 自适应融合:几何先验的权重可学习,模型自行决定在哪些区域更依赖几何约束(如物体边缘),哪些区域更依赖语义相似度(如纹理均匀区域)。
这意味着深度不再是"第二张图",而是注意力机制的几何约束。在 CVPR 2025 的实验中,这一方案在分割精度和边界质量上均显著超越前代,尤其在物体边缘和遮挡区域——恰恰是抓取规划最关心的区域——提升最为明显。
对抓取/分拣的启示
在仓储物流场景中,抓取决策依赖的不仅是"这是什么物体",更是"这个物体的表面朝向如何、边缘在哪里、与相邻物体的空间关系如何"。几何自注意力天然适配这类需求:它让 Encoder 在特征提取阶段就编码了 3D 空间结构,而非把这些信息留给下游的位姿估计模块去"重新发现"。
四、后续迭代方向展望

站在当前节点,RGB-D 感知的进化沿四个方向展开:
效率侧:Geometry Self-Attention 引入了额外的几何计算开销。在机器人端侧部署(实时性要求 < 100ms)的约束下,稀疏注意力(只计算几何邻域内的 token)和线性注意力近似是必须攻克的工程问题。
融合侧:当前的 VLM 主要处理 RGB + 语言,RGB-D 感知主要处理 RGB + 深度。下一步是三模态统一——RGB-D + 语言 + 3D 几何在同一个 token 空间中交互,形成 Geometry-Aware VLM。想象一个模型同时理解"红色箱子"(语言)、“表面法向量朝上”(几何)、“纹理有破损”(视觉),并输出"从顶部抓取,避开破损区域"。
规模侧:RGB 领域已有 DINOv2 这样的通用视觉基础模型(在海量无标注图像上自监督预训练)。RGB-D 领域尚缺乏同等规模的预训练基础——大规模深度数据的采集成本远高于 RGB。合成数据(仿真环境渲染)和跨域迁移是可能的突破口。
任务侧:从分割/检测等"理解"任务,向 6-DoF 抓取位姿估计、可操作区域预测、装配序列规划等"行动"任务延伸。感知与决策的边界正在模糊——Encoder 的输出不再只是"看到了什么",而是直接编码"该怎么抓"。
下一代候选:Mamba / 状态空间模型(SSM)以线性复杂度处理长序列,在点云等大规模 3D 数据上展现出潜力。但短期内更可能是与 attention 混合使用(如局部用 SSM、全局用 attention),而非完全替代。
五、小结
Transformer 是"新基建",而非终点。效率优化让它跑得动,VLM 让它看得懂,几何内化让它感知到 3D 空间结构。
对 RGB-D 感知而言,真正的进化不在于"加了一个深度通道",而在于让几何先验成为注意力机制的一等公民——从特征拼接的"物理混合",走向几何约束的"化学融合"。
延伸阅读
- Liu et al., Swin Transformer: Hierarchical Vision Transformer using Shifted Windows, ICCV 2021
- Radford et al., Learning Transferable Visual Models From Natural Language Supervision (CLIP), ICML 2021
- Liu et al., Visual Instruction Tuning (LLaVA), NeurIPS 2023
- Oquab et al., DINOv2: Learning Robust Visual Features without Supervision, TMLR 2024
- Gu & Dao, Mamba: Linear-Time Sequence Modeling with Selective State Spaces, COLM 2024
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)