CLIP

CLIP 解决“视觉和语言如何对齐”,核心目标是学习:Image↔Text,也就是让图像和文本进入同一个语义空间。

它使用两个编码器:Image Encoder、Text Encoder

然后通过 Contrastive Learning,让匹配的图像-文本对靠近,不匹配的图文对远离。

训练时用了约 4 亿对 image-text 数据,因此模型不再局限于固定类别,而可以利用自然语言描述视觉概念。训练完成后,CLIP 可以直接做 zero-shot classification,例如输入一张狗的图片,然后比较: "a photo of a dog"、"a photo of a cat"

哪个文本 embedding 和图片 embedding 更接近。论文在 30 多个视觉数据集上验证了这种 zero-shot transfer 能力。

BLIP-2

BLIP-2 主要解决的是:“怎么低成本地把“强视觉编码器”和“强大语言模型”连接起来”

在 BLIP-2 之前,如果想做视觉语言模型,常见做法是把视觉模型和语言模型一起训练或大规模微调,成本很高。BLIP-2 的核心思路是:

Frozen Vision Encoder + Q-Former + Frozen LLM

也就是:

图片→视觉编码器→Q-Former→LLM→文本输出

其中视觉编码器和大语言模型都尽量冻结,只训练中间的 Q-Former(Querying Transformer)。

Q-Former 的作用可以理解为“视觉信息压缩器 + 跨模态桥梁”。视觉编码器会输出很多 patch-level visual features,但 LLM 不适合直接接收这么多视觉特征,所以 Q-Former 用一组可学习的 query 去“询问”视觉特征:提取出最重要的视觉信息,压缩成少量视觉 token,再送给 LLM。

LLaVA

LLaVA 主要解决的是:如何让一个大语言模型真正具备“看图 + 按指令回答”的多模态能力。

核心思路是:Image→CLIP Vision Encoder→Projection→Vicuna→Response​

第一步,图片进入 CLIP 的视觉编码器:得到一组视觉特征。

第二步,使用 Projection 把视觉特征转换到 LLM 的 embedding 空间:Hv=WZ

因为 CLIP 的输出维度、表示空间和 Vicuna 的 token embedding 不一致,所以需要这个 projection。

可以理解成: 把“视觉语言”翻译成 LLM 能理解的语言

此阶段的训练做视觉-语言对齐,用的是 CC3M(Conceptual Captions 3M)的一个过滤子集。CC3M 本身就是互联网图片和对应 caption 的图文对。

第三步,把视觉 token 和用户文本指令一起送给 Vicuna:

[Visual Tokens,Text Tokens]→Vicuna

此阶段的训练利用 COCO 数据集已有的 annotation来让 GPT-4 自动生成视觉指令数据,也就是说,GPT-4 负责的是“造题和造答案”。

第四步,自回归生成文本:P(yt​∣I,instruction,y<t​)

RT-2

RT-2 主要解决的问题是:如何把 VLM 学到的视觉-语言知识,直接迁移到机器人动作控制上​

LLaVA 这类 VLM 最终输出的是“文字”,而 RT-2 希望进一步做到:

(Image,Language Instruction)→Robot Action​

所以如果只记一句最关键的话:

RT-2 本质上就是把 Action 也变成 Token,然后用 VLM 原本的 Token Prediction 能力直接学习机器人 Policy。

OpenVLA

它解决的核心问题是:能不能做一个开源、较小、能跨机器人使用、还能方便微调的通用 VLA?​

RT-2 很强,但模型闭源、规模大,而且普通研究者很难在自己的机器人上训练和修改。OpenVLA 因此发布了一个 7B 参数的开源 VLA,包括模型权重、训练代码和微调流程,并支持用 LoRA 等方式适配新机器人。它在 Open X-Embodiment 中约 97 万条真实机器人轨迹上训练。

它的完整流程是:

Image+Language Instruction→Visual Features→LLM→Action Tokens→Robot Action

OpenVLA 与 LLaVA 其实非常像:都是 Vision Encoder → Projector → LLM。最大的变化就是把 LLM 的输出从 language tokens 换成了 action tokens。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐