【具身智能】TurboVLA阅读随笔
本文是在阅读《TURBOVLA: REAL-TIME VISION-LANGUAGE-ACTION MODEL AT 32 HZ ON AN RTX 4090 WITH <1 GB VRAM》时记录的笔记,带有很强个人主观性,仅供参考。
前言
可以先去阅读VLA综述和经典的OpenVLA,再来看这篇论文,会有更加直观的感受。
- 为什么要TurboVLA?
先前的VLA模型,基本都以VLM作为基础进行改装以适应机器人任务。但这带来了一个问题:每次推理都需要极大的计算和内存,导致成本和延迟难以降低
于是TurboVLA出现。
- 使用 V+L→AV + L \rightarrow AV+L→A 而非经典的 V→L→AV \rightarrow L \rightarrow AV→L→A,提供了一种新思路。
- 模型容量急剧减小,在消费级 RTX 4090 上仅 0.2B 参数量且小于1GB的推理显存。
- 评估效果却媲美大规模的VLA策略。
我认为,真正重要的是TurboVLA走出了一条不同的道路,供人们研究和思考
TurboVLA的诞生(也可以说是引言)
VLA已经有许多基于LLM而发展起来的强大的模型,它们实际上都以这种方式运行:
V(语言指令+视觉输入+……)V(语言指令+视觉输入+……)V(语言指令+视觉输入+……)
↓\downarrow↓
L(LLM,进行推理和预测)L(LLM,进行推理和预测)L(LLM,进行推理和预测)
↓\downarrow↓
A(输出转化为动作)A(输出转化为动作)A(输出转化为动作)
但是这种方法依赖中间步骤LLM大量的推理计算,带来一系列问题。
思路:(我偏主观的理解描述😜)
- 先前的模型将各种输入转化为语言Token进行,从而自然而然想到以LLM来进行处理策略预测。但是,这实际上陷入人类思维中(以语言为基础),可以跳脱出来,直接对各个输入之间进行交互操作。
即
V+L(通过各自编码器)V+L(通过各自编码器)V+L(通过各自编码器)
↓(不同模态进行交互)\downarrow (不同模态进行交互)↓(不同模态进行交互)
A(生成连续的动作预测)A(生成连续的动作预测)A(生成连续的动作预测)
从而设计了TurboVLA。
- 两个编码器分别处理语言和图像输入。
- 通过交叉注意力模块融合特征。
- 随后被解码为连续动作。
一些知识
VLA
(仅做一些方法列举)
- 动作专家模块附着在LLM上
- 扩散策略
- 点动作
- ……(有点多)
高效动作执行
- 动作Token化
- 紧凑型VLA
- 减少沉余计算
- ……
任务指令
- 共享策略
- 预训练的指令融合
- 文本长范围控制
- 文本-视觉交错整合
- ……
前置知识
关于基于LLM构建的模型就不过多讲述,主要讲述TurboVLA使用的视觉-语言交互模块。
给定视觉特征ZvZ^vZv和指令特征ZlZ^lZl,通过
Z~v=Zv+Attn(Qv,Kl,Vl)\tilde{Z}^v = Z^v + \text{Attn}(Q_v, K_l, V_l)Z~v=Zv+Attn(Qv,Kl,Vl)
可以获得结合语言指令的视觉特征。
(语言指令的交互则直接将上式转换lll和vvv就行)
TurboVLA
编码器
考虑到直接将语言指令和视觉特征弄到动作策略维度上进行交互,为了实现此目标,语言指令和视觉输入都会有一个投影函数进行转化。
语言指令编码器
Zl=Pl(ftext(x))∈RNl×dZ^l = P_l(f_{\text{text}}(x)) \in \mathbb{R}^{N_l \times d}Zl=Pl(ftext(x))∈RNl×d
其中xxx为任务指令,ftextf_\text{text}ftext为编码器,PlP_lPl为投影函数。
在维度上,策略维度为ddd,这代表所有的交互都在ddd维空间中进行,而ZlZ_lZl的 Nl×dN_l \times dNl×d 维度则为了保留语言指令的更精确的信息。(NlN_lNl为编码后词元长度)
视觉指令编码器
Znv,(i)=Pv(fimg(In(i)))+Epos(i)+eview(i),Znv=[Znv,(1),…,Znv,(K)]Z_n^{v,(i)} = P_v \left( f_{\text{img}} \left( I_n^{(i)} \right) \right) + E_{\text{pos}}^{(i)} + e_{\text{view}}^{(i)}, \quad Z_n^v = \left[ Z_n^{v,(1)}, \dots, Z_n^{v,(K)} \right]Znv,(i)=Pv(fimg(In(i)))+Epos(i)+eview(i),Znv=[Znv,(1),…,Znv,(K)]
其中i,ni,ni,n代表多视角,Epos(i)E^{(i)}_{pos}Epos(i)为视图内空间特征信息,eview(i)e^{(i)}_{view}eview(i)为视角信息。
维度的话 Nv×dN_v \times dNv×d 同理。
状态编码器
Zns=fstate(sn)∈RNs×dZ_n^s = f_{\text{state}}(s_n) \in \mathbb{R}^{N_s \times d}Zns=fstate(sn)∈RNs×d
即加入机器人状态,这是机器人任务执行中的必要条件。
它不参与视觉-语言交互模块,直接作用于动作解码器。
视觉-语言交互模块
(Vnℓ,Lnℓ)=FusionLayerℓ(Vnℓ−1,Lnℓ−1),ℓ=1,…,N.(V_n^\ell, L_n^\ell) = \text{FusionLayer}_\ell(V_n^{\ell-1}, L_n^{\ell-1}), \quad \ell = 1, \dots, N.(Vnℓ,Lnℓ)=FusionLayerℓ(Vnℓ−1,Lnℓ−1),ℓ=1,…,N.
意思是经过NNN层交互器进行迭代,每次以上一层输出为新特征,以交互后特征为输出。
每一层由层归一化,双向交叉注意力和带有残差连接的特定模态前馈网络组成。(公式在前置知识中可窥见一二)
其中,Vn0V^0_nVn0 和 LN0L^0_NLN0 即为 ZnvZ^v_nZnv 和 ZlZ^lZl。
最后,最终输出被拼接:
Znvol=[VnN;LnN]Z_n^{vol} = [V_n^N; L_n^N]Znvol=[VnN;LnN]
动作解码器
这是一个轻量级的类Transfomer解码器。
A^n=Dθ(Qa,[Znvl;Zns])∈RH×da\hat{A}_n = D_\theta(Q_a, [Z_n^{vl}; Z_n^{s}]) \in \mathbb{R}^{H \times d_a}A^n=Dθ(Qa,[Znvl;Zns])∈RH×da
其中,Qa=[q1,……,qH]Q_a = [q_1,……,q_H]Qa=[q1,……,qH] 为 HHH个动作查询,DθD_\thetaDθ 为动作解码器。
通过类Transformer架构,HHH 步动作查询可由一次操作生成,一定程度上降低延迟。
训练
使用专家克隆训练。
给定目标动作序列,与预测动作序列进行 ℓ1ℓ_1ℓ1 损失计算。(考虑学习稳定性,对异常值的鲁棒性等)
~
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)