【具身智能】VLA论文阅读随笔
VLA
《A Survey on Vision-Language-Action Models for Embodied AI》
VLA被定义为能够处理来自视觉和语言的多模态输入以产生机器人动作从而完成具身任务的模型
本论文主要为综述论文,分为三个主要介绍方向
- VLAs的各个组件(视觉编码器,动力学模型,世界模型)
- 预测低级动作的控制策略(语言指令+视觉感知➡️低级动作)
- 高级任务规划器(将复杂任务分块处理)
(此外,文中还提供了广泛资源总结,VLAs面临的挑战与未来前景)
引言部分
VLAs需要处理视觉,语言,环境,动作模态的信息,去控制物理实体(机器人等)与环境进行交互。
VLAs的成功,从早期单模态模型的发展,循环神经网络,Transformer的主流,强化学习的发展,这些奠定的基础,一步步到现在的VLAs等多模态模型。
传统的机器人,使用强化学习,通常只处理单一环境的任务。现在需求增长,发展能在不同环境进行不同任务的策略变得重要。此外,语言指令也被要求融入策略中,产生了更复杂的策略问题。
文中提出,VLA通过视觉编码器捕捉环境状态,同时通过LLM的功能将语言指令编码,将这两者用各种策略进行对齐。然后喂给它机器人环境的数据进行微调,用LLM作为解码器来预测动作。
背景
具体的,机器人学习通常被构建为强化学习问题,表示为 s s s, a a a, r r r组成的马尔可夫决策过程。(这里可以参考我的另一篇随笔这里)
当在奖励预测困难时,也可以用模仿学习(及不含奖励)对预测动作建模。
此外,语言指令 p p p也加入了决策过程。
组件:
强化学习:
RL,深度Q网络,在一定程度上为VLA的发展奠定了基础。
-
RL的序列轨迹天然与序列建模问题相符合(同时也符合“人”在真实世界中的思考和行动),十分适合Transformer架构(与LLM同一),在此还发展了不同的类型(决策Transformer,轨迹Transformer)
-
Gato又将此拓展为可处理多模态的模型。
-
LLM与RL之间的协同效应,通过RLHF可以让LLM对齐偏好,通过LLM的语言反馈可以指导RL进行权重更新和指导奖励函数的设计。
视觉编码器:
这是重要的部分,它的功效直接影响VLA的性能。
这里有许多方法
-
CLIP,识别正确的图像文本对。
-
R3M,时间对比学习,拉近相关性强的时间帧的距离,拉远无关时间帧之间的距离。视频-语言对齐,判断视频是否对应于语言指令。
-
MVP,将视觉掩码自编码器应用于机器人数据集,重建破坏的图像块。
-
Voltron,结合语言条件化和语言生成,采用编码器-解码器Transformer结构,预训练在语言条件下的掩码图像重建和掩码图像语言生成。
-
VC-1,一种结合先前PVR的增强PVR模型。
-
DINOv2,使用教师网络和学生网络,学生网络接收局部视图,教师网络接收全局视图,训练学生网络去匹配正确的表示。其中教师网络通过学生网络进行指数移动平均更新。
-
I-JEPA,使用掩码图像块,预测原始世界中目标概念。
-
Theia,融合了各种基础视觉模型,在更小数据与尺寸下展现更优能力。
视频表示
视频表示可以分解为图像连续,用PVR进行表示。此外还有时间对比学习等方法可以使用。
F3RM,3D-LLM等技术,将视频中的3D信息提取供机器人学习。
3D高斯泼贱方法,用3D高斯椭圆体泼贱一个3D场景,其附带的各种物理性质使得3D场景变得更具有交互性质。
还有视觉和语言之外的信息,例如听觉,也可以提供重要线索。
动力学学习
动力学学习有两个部分:
-
s ^ t + 1 ← f f w d ( s t , a t ) \hat{s}_{t+1} \leftarrow f_{fwd}(s_t,a_t) s^t+1←ffwd(st,at):正向动力学,给定当前状态和动作,预测后续状态。
-
a ^ t ← f i n v ( s t , s t + 1 ) \hat{a}_{t} \leftarrow f_{inv}(s_t,s_{t+1}) a^t←finv(st,st+1):逆向动力学,给定已知状态和后续状态,预测所需动作。
一些方法:
-
Vi-PRoM,区分不同视频,恢复打乱的视频帧,使用伪标签的图像分类。
-
MIDAS,从观测中预测动作,进行逆向动力学学习。
-
SMART,在前向、逆向动力学预测基础上,增加了随机掩码的事后控制,将整个控制序列进行随机掩码覆盖动作,模型恢复。
-
MaskDP,状态和动作被掩码标记,模型学习恢复,直接使用到下游任务(及直接在任务数据集中)。
-
PACT,一个正向动力学模型。
-
VPT,先使用一个逆向动力学预测模型,用少量有动作标签视频训练。然后大量无动作标签视频被喂给这个预测模型,产生大量有动作标签的训练集。这训练集可以喂给VPT进行动作克隆训练。
-
GR-1,专为GPT风格的视频预测预训练,预测未来帧。
世界模型:
这里主要描述与前向动力学模型的区别。
前向动力学主要针对当下进行机器人任务服务,仅为一个辅助(可以想象为人的视觉预测)。世界模型构建一个内部世界,自主进行想象探索(可以想象为人的大脑),作为一个独立主模块。
(或许这两者可以通过某种方法进行互相弥补,比如通过前向动力学模型的信息来优化世界模型的预测之类的,类似图像生成中用DDIM反演过程中的生成去矫正SDEdit的生成过程)
-
Dreamer系列,可以参考我的这篇文章
DayDreamer在此基础上将模型运用于现实机器人任务。 -
IRIS,可以理解为使用Transformer的世界模型。
LLM诱导世界模型
LLM的功能可以用来改进VLA。
-
DECKARD,提示LLM以生成有向无环图表示的抽象世界模型,去指导Minecraft中的物品制造工作。
-
LLM-DM,作为PDDL构建的世界与现实逻辑之间的桥梁,通过它可以往返修改构建的世界使其符合逻辑和现实。
-
RAP,结合蒙特卡洛树搜索,让LLM介入搜索方向中预测下一步的动作,由世界模型预测奖励回报。
-
LLM-MCTS,在RAP的基础上,用LLM介入预测回报,通过其常识和经验,减少搜索空间。
(既然提到搜索,那结合A*算法,也许可以进一步进行搜索空间优化)
视觉世界模型
即生成未来状态的视觉图像,视频或3D场景——主要与物理世界对齐。
-
Genie,生成式交互模型,通过将视频帧压缩为连续token,预测token之间潜在动作,在自回归动力学预测中,可以生成一个可交互的世界。
-
3D-VLA,一种目标生成的3D世界模型,通过对视觉输入(图像,深度图,点云),然后通过扩散模型响应询问,生成目标状态。
-
UniSim,学习大量现实交互视频,能够在给定环境与动作时,生成动态过程。生成的视频可用来训练。此外还有将已有模拟器作为世界模型,通过MCTS来收集经验。
推理
通过语言推理来优化决策过程。
推理与高层任务规划天然契合。ThinkBot,ReAct,RAT,Tree-Planner等方法,通过推理进行规划,优化决策,处理异常。
另外,推理也可以赋予低级控制策略一定程度能力。针对计划,子任务,运动,视觉特征进行思维链推理。可以缓和模型仅靠“肌肉记忆”,也一定程度上提高不同任务泛化能力。
底层控制策略
即 a ^ t ∼ π θ ( a ^ t ∣ p , s ≤ t , a < t ) . \hat{a}_t \sim \pi_\theta(\hat{a}_t \mid p, s_{\leq t}, a_{<t}). a^t∼πθ(a^t∣p,s≤t,a<t).
设计底层控制策略有多种方法:
非Transformer控制策略
-
CLIPort,通过CLIP捕获图像与文本关系,使用Transporter提取空间信息,其中语义流特征通过各种方式来引导空间流特,生成目标动作。
-
BC-Z,通过语言指令和视频演示指令(即任务指令),然后任务指令嵌入与图像潜入(即操作环境)通过FiLM融合,指导目标动作生成。据说可以泛化无样本任务。
-
MCIL,通过多场景训练,一小部分图像语言配对数据来训练关联能力,对大部分无标签数据进行理解执行。
-
HULC,通过高层离散潜在计划,将任务分解为多个子任务。通过多模态Transformer分解子任务为低级局部策略。其中引入了基于对比学习的视觉-语言对齐损失。HULC++在此基础上将模型聚焦于需要交互的环境中。
-
UniPi,通过文本指令生成视频,使用逆动力学预测模型生成动作,变为策略,提高了泛化能力和知识迁移能力。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)