第一阶段:萌芽与质疑(2017 - 2019)

  • 2017年:Transformer 的诞生

    • Google 在论文《Attention is All You Need》中提出了 Transformer 架构,彻底抛弃了 RNN 和 CNN,完全依赖自注意力机制(Self-Attention)来建模序列数据,在机器翻译任务上取得巨大成功。
    • 当时主流观点:Transformer 是为序列(如文本)设计的,而图像是二维的、局部相关的结构,CNN 的归纳偏置(inductive bias)更适合处理图像。
  • 2018-2019年:初步探索

    • 一些研究开始尝试将注意力机制引入 CNN,如 Non-local Neural Networks,在 CNN 中加入全局注意力模块,提升性能,但核心仍是 CNN。
    • 此时还没有人直接用纯 Transformer 处理图像。

第二阶段:破局之作 —— Vision Transformer (ViT)(2020)

  • 2020年:ViT 的横空出世
    • Google 的 Alexey Dosovitskiy 等人在论文《An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale》中提出了 Vision Transformer (ViT)
    • 核心思想
      1. 将输入图像分割成固定大小的 图像块(patches)(如 16×16 像素)。
      2. 将每个图像块展平并线性投影为一个向量,形成一个“图像序列”。
      3. 像处理文本 token 一样,将这些 patch embeddings 输入标准的 Transformer 编码器。
    • 关键发现
      • ViT 在大规模数据集(如 JFT-300M)上预训练时,性能超越了最先进的 CNN
      • 但在中等规模数据集(如 ImageNet)上直接训练,性能不如 CNN。
    • 意义:首次证明了纯 Transformer 可以在图像分类任务上取得顶尖性能,打破了“CNN 不可替代”的神话。
    • 局限性:计算复杂度高(全局自注意力),且缺乏 CNN 的局部归纳偏置,在小数据上表现不佳。

第三阶段:改进与普及 —— 局部化与层次化(2021)

ViT 的成功激发了大量改进工作,核心目标是:降低计算成本、引入归纳偏置、适应多尺度任务

1. 局部注意力与窗口化(Swin Transformer, 2021)
  • Swin Transformer(微软亚洲研究院)是这一阶段的代表作。
  • 创新
    • 基于窗口的自注意力(Window-based Self-Attention):将图像划分为不重叠的局部窗口,在窗口内计算注意力,大幅降低计算量。
    • 移位窗口机制(Shifted Windows):在连续层之间移动窗口位置,使信息能在窗口间传递。
    • 层次化结构:通过逐步下采样构建多尺度特征图。
  • 优势:计算效率高,适合高分辨率图像,且生成的特征图可直接用于检测、分割等任务,性能全面超越 ViT 和 CNN。
2. 其他重要变体
  • DeiT (Data-efficient Image Transformer):通过知识蒸馏等技术,使 ViT 在小数据集上也能训练良好。
  • PVT (Pyramid Vision Transformer):提出金字塔结构,逐步下采样,生成多尺度特征。
  • TNT (Transformer in Transformer):认为 patch 太粗,进一步在 patch 内部对像素 token 建模。
  • LocalViT, CrossViT 等:探索如何更好地结合局部与全局信息。

第四阶段:融合与多样化(2022 - 2023)

研究者开始探索 CNN 与 Transformer 的融合,以及 更高效的架构

  • 混合架构(Hybrid Models)
    • 早期用 CNN 提取特征,后期用 Transformer 建模(如早期 ViT 的 backbone)。
    • 或在 Transformer 中嵌入卷积操作(如 CoAtNet)。
  • 高效 Transformer
    • MobileViT:轻量化设计,适合移动端。
    • MaxViT, EfficientFormer:优化计算和延迟,追求性能与效率的平衡。
  • 自监督学习
    • MAE (Masked Autoencoders)、BEiT 等基于掩码图像建模的自监督方法,极大提升了 ViT 的预训练效率和性能。

第五阶段:大模型与多模态时代(2023 - 至今)

Transformer 成为构建视觉大模型多模态系统的核心。

  • 视觉大模型(Vision Foundation Models)
    • DINOv2:通过自监督学习训练强大的通用视觉编码器,无需大规模标注数据。
    • SAM (Segment Anything Model):Meta 提出的通用图像分割模型,其图像编码器基于 ViT,展示了强大的零样本泛化能力。
  • 多模态大模型
    • CLIP(OpenAI):用对比学习联合训练图像编码器(ViT)和文本编码器,实现图文匹配,开启“文本指导视觉”新范式。
    • Flamingo, BLIP-2, Qwen-VL, LLaVA 等:基于 Transformer 的图文对话、视觉问答、图文生成等模型,将视觉与语言深度融合。

总结:Transformer 在 CV 中的发展脉络

阶段时间代表工作核心贡献
萌芽2017-2019Attention in CNN将注意力引入视觉,但未取代 CNN
破局2020ViT首次证明纯 Transformer 可用于图像分类
改进2021Swin, PVT, DeiT引入局部性、层次化、提升效率与数据效率
融合2022-2023CoAtNet, MobileViT, MAECNN-Transformer 融合,高效化,自监督
大模型2023-至今CLIP, DINOv2, SAM视觉大模型、多模态、通用视觉

影响与未来

  • 影响:Transformer 已成为计算机视觉领域的主流架构之一,与 CNN 并驾齐驱,甚至在许多任务上超越。
  • 未来方向
    • 更高效的视觉 Transformer。
    • 更强大的自监督/无监督学习。
    • 3D 视觉、视频理解中的应用。
    • 与具身智能、机器人等领域的结合。

Transformer 在视觉领域的发展,不仅是技术的演进,更是思维方式的转变:从依赖手工归纳偏置(CNN),到让模型从数据中学习全局关系(Transformer)。这场变革仍在继续。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐