Vit和VideoMAE
Vit : Vision Transformer 视觉Transformer
VideoMAE :Video Masked Autoencoders 视频掩码自编码器,是对Vit在视频上的进化。
- 传统工业视觉:单独使用 ViT / VideoMAE
- 大模型时代:作为 LLM 的视觉 Encoder
两者用途完全不同,是两种模型的神经架构。
一、单独使用 ViT,在工业上最常见业务是什么?
先说结论:
ViT 单独使用最多的不是普通图片分类,而是需要“高级视觉理解”的任务。
普通分类:
猫/狗/汽车
CNN已经很好。
ViT真正发挥优势的是:
- 大规模视觉理解
- 图像检索
- 医疗影像
- 遥感
- 自动驾驶
- 工业检测
1. 图像分类(早期主要用途)
最早 ViT 就是为了 ImageNet 分类提出的。
流程:
图片
↓
ViT Encoder
↓
分类Head
↓
1000类别
例如:
ImageNet:
狗
猫
汽车
飞机
代表模型:
ViT
Google原始版本:
- ViT-B/16
- ViT-L/16
- ViT-H/14
但是现在工业分类:
很多仍然用:
- ResNet
- EfficientNet
- ConvNeXt
原因:
CNN:
- 更快
- 更省算力
- 小数据效果好
2. 工业视觉检测(非常重要)
例如:
工厂:
检测:
- PCB缺陷
- 芯片缺陷
- 产品瑕疵
以前:
CNN:
图片
|
ResNet
|
分类
现在:
ViT:
图片
↓
ViT
↓
异常特征
↓
缺陷判断
优势:
可以捕获:
长距离关系。
例如:
PCB:
一个地方的小缺陷,可能和远处线路有关。
常用模型:
Swin Transformer
工业视觉非常常见。
原因:
纯ViT Attention计算量大。
Swin:
窗口Attention:
更适合高分辨率图片。
3. 图像检索(非常重要)
例如:
淘宝搜同款。
输入:
鞋子图片:
图片
↓
ViT
↓
Feature Vector
↓
向量数据库
↓
找相似商品
常用:
- CLIP ViT
- DINOv2
- EVA
4. 医疗影像
例如:
CT:
CT切片
↓
ViT
↓
疾病判断
MRI:
脑部影像
↓
Transformer
↓
病灶分析
因为医疗图像:
需要全局关系。
5. 自动驾驶
例如:
摄像头:
Camera
↓
ViT/Swin
↓
环境理解
识别:
- 车辆
- 行人
- 道路
Tesla、Waymo路线大量使用Transformer视觉。
二、单独使用 VideoMAE,在工业上最常见业务是什么?
VideoMAE定位:
视频理解(Video Understanding)
不是生成视频。
1. 视频行为识别(最直接)
你的 UCF101 就属于这个。
例如:
监控:
检测:
- 打架
- 摔倒
- 奔跑
- 入侵
流程:
视频
↓
VideoMAE
↓
动作分类
↓
报警
代表模型:
VideoMAE
MCG-NJU
经典。
2. 视频搜索
例如:
视频网站:
搜索:
“一个人在滑雪的视频”
系统:
视频:
↓
VideoMAE:
↓
视频Embedding:
↓
向量数据库:
↓
搜索。
3. 视频监控分析
工业非常大。
例如:
智慧城市:
摄像头:
人流
车辆
异常事件
VideoMAE:
理解:
时间变化。
4. 体育分析
例如:
足球:
- 球员动作
- 战术分析
篮球:
- 投篮动作
- 防守动作
5. 机器人
机器人:
需要:
理解环境变化。
例如:
机器人看到:
人拿杯子。
Video Encoder:
提取:
动作变化。
三、单独 VideoMAE 工业常用模型有哪些?
目前主要:
① VideoMAE
最经典。
特点:
自监督预训练。
模型:
- VideoMAE Base
- VideoMAE Large
- VideoMAE Huge
② VideoMAE V2
更大规模。
适合:
大数据训练。
③ Video Swin Transformer
工业应用很多。
结构:
视频版Swin。
④ MViT
Multiscale Vision Transformer。
Meta提出。
特点:
多尺度视频理解。
⑤ SlowFast
虽然不是Transformer,但是工业仍大量使用。
Meta提出。
视频行为识别经典。
四、现在进入大模型时代:LLM里面最常用的Vision Encoder是什么?
这个和单独视觉完全不同。
现在:
LLM需要的不是分类器,而是“视觉Token生成器”。
1. 图片LLM最常用Vision Encoder
第一梯队:
CLIP ViT
目前最经典。
例如:
LLaVA:
结构:
CLIP ViT-L/14
↓
Projector
↓
LLaMA
用途:
图片问答。
SigLIP
Google提出。
现在很多新模型使用。
例如:
Gemini相关路线。
优势:
比CLIP训练方式改进。
EVA-CLIP
国内外很多视觉大模型使用。
特点:
更强视觉能力。
InternViT
商汤/InternVL路线。
例如:
InternVL:
InternViT
+
LLM
2. 视频LLM最常用Video Encoder
这里目前比图片复杂。
因为视频成本巨大。
常见:
InternVideo
非常热门。
结构:
Video Encoder
↓
LLM
VideoMAE
很多研究使用。
例如:
VideoMAE
↓
LLM
Video Swin Transformer
也是常见。
CLIP逐帧 + 时间模型
工业也很多:
Frame
↓
CLIP ViT
↓
Temporal Transformer
↓
LLM
原因:
计算便宜。
五、单独模型 vs LLM视觉Encoder 对比
| 单独ViT | LLM视觉Encoder | |
|---|---|---|
| 目标 | 完成视觉任务 | 给LLM提供视觉理解 |
| 输出 | 分类/特征 | 视觉Token |
| 后面有没有LLM | 没有 | 有 |
| 训练目标 | 分类/自监督 | 视觉语言对齐 |
| 例子 | ImageNet | GPT-4V、LLaVA |
六、你作为音视频工程师,最相关路线
结合你的方向:
视频分析:
例如:
摄像头异常检测:
推荐:
RTSP视频流
↓
抽帧
↓
VideoMAE / Video Swin
↓
行为识别
↓
报警
AI数字人/视频生成:
不是VideoMAE。
路线:
语音
↓
LLM
↓
Diffusion Video Model
↓
视频
视频大模型:
未来路线:
视频
↓
Video Encoder
(VideoMAE / InternVideo)
↓
Projector
↓
LLM
↓
理解视频
最后总结一句:
单独使用:
ViT:
图片理解、检索、工业检测、医疗、自动驾驶。
最常见模型:
- ViT
- Swin Transformer
- DINOv2
- CLIP ViT
VideoMAE:
视频理解、行为识别、监控分析、视频搜索。
最常见模型:
- VideoMAE
- VideoMAE V2
- Video Swin Transformer
- MViT
在LLM里面:
图片:
CLIP ViT、SigLIP、EVA-CLIP、InternViT
视频:
InternVideo、VideoMAE、Video Swin、CLIP+Temporal Transformer
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)