Transformer 在计算机视觉领域的发展史
·
第一阶段:萌芽与质疑(2017 - 2019)
-
2017年:Transformer 的诞生
- Google 在论文《Attention is All You Need》中提出了 Transformer 架构,彻底抛弃了 RNN 和 CNN,完全依赖自注意力机制(Self-Attention)来建模序列数据,在机器翻译任务上取得巨大成功。
- 当时主流观点:Transformer 是为序列(如文本)设计的,而图像是二维的、局部相关的结构,CNN 的归纳偏置(inductive bias)更适合处理图像。
-
2018-2019年:初步探索
- 一些研究开始尝试将注意力机制引入 CNN,如 Non-local Neural Networks,在 CNN 中加入全局注意力模块,提升性能,但核心仍是 CNN。
- 此时还没有人直接用纯 Transformer 处理图像。
第二阶段:破局之作 —— Vision Transformer (ViT)(2020)
- 2020年:ViT 的横空出世
- Google 的 Alexey Dosovitskiy 等人在论文《An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale》中提出了 Vision Transformer (ViT)。
- 核心思想:
- 将输入图像分割成固定大小的 图像块(patches)(如 16×16 像素)。
- 将每个图像块展平并线性投影为一个向量,形成一个“图像序列”。
- 像处理文本 token 一样,将这些 patch embeddings 输入标准的 Transformer 编码器。
- 关键发现:
- ViT 在大规模数据集(如 JFT-300M)上预训练时,性能超越了最先进的 CNN。
- 但在中等规模数据集(如 ImageNet)上直接训练,性能不如 CNN。
- 意义:首次证明了纯 Transformer 可以在图像分类任务上取得顶尖性能,打破了“CNN 不可替代”的神话。
- 局限性:计算复杂度高(全局自注意力),且缺乏 CNN 的局部归纳偏置,在小数据上表现不佳。
第三阶段:改进与普及 —— 局部化与层次化(2021)
ViT 的成功激发了大量改进工作,核心目标是:降低计算成本、引入归纳偏置、适应多尺度任务。
1. 局部注意力与窗口化(Swin Transformer, 2021)
- Swin Transformer(微软亚洲研究院)是这一阶段的代表作。
- 创新:
- 基于窗口的自注意力(Window-based Self-Attention):将图像划分为不重叠的局部窗口,在窗口内计算注意力,大幅降低计算量。
- 移位窗口机制(Shifted Windows):在连续层之间移动窗口位置,使信息能在窗口间传递。
- 层次化结构:通过逐步下采样构建多尺度特征图。
- 优势:计算效率高,适合高分辨率图像,且生成的特征图可直接用于检测、分割等任务,性能全面超越 ViT 和 CNN。
2. 其他重要变体
- DeiT (Data-efficient Image Transformer):通过知识蒸馏等技术,使 ViT 在小数据集上也能训练良好。
- PVT (Pyramid Vision Transformer):提出金字塔结构,逐步下采样,生成多尺度特征。
- TNT (Transformer in Transformer):认为 patch 太粗,进一步在 patch 内部对像素 token 建模。
- LocalViT, CrossViT 等:探索如何更好地结合局部与全局信息。
第四阶段:融合与多样化(2022 - 2023)
研究者开始探索 CNN 与 Transformer 的融合,以及 更高效的架构。
- 混合架构(Hybrid Models):
- 早期用 CNN 提取特征,后期用 Transformer 建模(如早期 ViT 的 backbone)。
- 或在 Transformer 中嵌入卷积操作(如 CoAtNet)。
- 高效 Transformer:
- MobileViT:轻量化设计,适合移动端。
- MaxViT, EfficientFormer:优化计算和延迟,追求性能与效率的平衡。
- 自监督学习:
- MAE (Masked Autoencoders)、BEiT 等基于掩码图像建模的自监督方法,极大提升了 ViT 的预训练效率和性能。
第五阶段:大模型与多模态时代(2023 - 至今)
Transformer 成为构建视觉大模型和多模态系统的核心。
- 视觉大模型(Vision Foundation Models):
- 如 DINOv2:通过自监督学习训练强大的通用视觉编码器,无需大规模标注数据。
- SAM (Segment Anything Model):Meta 提出的通用图像分割模型,其图像编码器基于 ViT,展示了强大的零样本泛化能力。
- 多模态大模型:
- CLIP(OpenAI):用对比学习联合训练图像编码器(ViT)和文本编码器,实现图文匹配,开启“文本指导视觉”新范式。
- Flamingo, BLIP-2, Qwen-VL, LLaVA 等:基于 Transformer 的图文对话、视觉问答、图文生成等模型,将视觉与语言深度融合。
总结:Transformer 在 CV 中的发展脉络
| 阶段 | 时间 | 代表工作 | 核心贡献 |
|---|---|---|---|
| 萌芽 | 2017-2019 | Attention in CNN | 将注意力引入视觉,但未取代 CNN |
| 破局 | 2020 | ViT | 首次证明纯 Transformer 可用于图像分类 |
| 改进 | 2021 | Swin, PVT, DeiT | 引入局部性、层次化、提升效率与数据效率 |
| 融合 | 2022-2023 | CoAtNet, MobileViT, MAE | CNN-Transformer 融合,高效化,自监督 |
| 大模型 | 2023-至今 | CLIP, DINOv2, SAM | 视觉大模型、多模态、通用视觉 |
影响与未来
- 影响:Transformer 已成为计算机视觉领域的主流架构之一,与 CNN 并驾齐驱,甚至在许多任务上超越。
- 未来方向:
- 更高效的视觉 Transformer。
- 更强大的自监督/无监督学习。
- 3D 视觉、视频理解中的应用。
- 与具身智能、机器人等领域的结合。
Transformer 在视觉领域的发展,不仅是技术的演进,更是思维方式的转变:从依赖手工归纳偏置(CNN),到让模型从数据中学习全局关系(Transformer)。这场变革仍在继续。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)