具身视觉语言动作模型(VLA)技术综述调研
·
具身视觉语言动作模型(VLA)技术综述调研
摘要
本文系统调研了四种主流VLA模型(GraspVLA、SmolVLA、SwiftVLA和OpenVLA),从算法架构、应用场景、评价指标等方面进行对比分析。GraspVLA专注于物体抓取任务,采用解耦设计处理透明物体;SmolVLA面向边缘计算场景,实现轻量化部署;SwiftVLA优化高频实时控制;OpenVLA作为开源标杆,强调通用多任务能力。研究发现,现有模型在语义理解、物理交互、计算效率等方面仍存在不足,未来需在跨模态表征、实时性优化和Sim-to-Real迁移等方向突破。该研究为具身智能系统开发提供了技术参考。
目录
1. GraspVLA
算法架构
- 主干网络:视觉语言模型(VLM)与动作专家(Action Expert)解耦设计。
- 视觉编码器:使用冻结的 DINOv2 提取稠密空间特征,融合 SigLIP(采用 Sigmoid Loss 的图文预训练模型)提取语义特征。
- 动作生成机制:以自回归方式监督 VLM 预测目标物体的 2D/3D 边界框(Bounding Box),并结合流匹配(Flow Matching)生成连续的机器人抓取姿态与轨迹动作。
针对场景
- 普通物体抓取:尺寸在 2cm ~ 25cm 范围内的日常物品。
- 透明/无纹理物体抓取:基于 RGB 图像输入而非高噪点云,极度适合 2D 视觉纹理与反射光泽场景。
评价标准与指标
- 抓取成功率(Success Rate):在 3 次尝试内成功抓取目标对象并抬升至指定高度。
- 路径长度加权成功率(PLWSR):引入轨迹长度与平滑度惩罚因子,惩罚无效抖动与冗余移动。
测试工具与数据集
- 互联网开源数据集:引入大规模图文语义对进行基础表征预训练。
- 合成数据集:采用渐进式动作生成(PAG)管线:
- 基于 Objaverse 的 LVIS 子集构建多样化三维场景。
- 使用 CuRobo 算法高效规划无碰撞轨迹。
- 使用 MuJoCo 动力学引擎判断物理可行性与碰撞接触。
- 基于 Isaac Sim 进行光线追踪与背景域随机化渲染。
参考文献与开源项目
- OpenVLA:基座 Transformer 结构微调架构参考。
- Octo:基于 Diffusion/Flow Matching 的动作专家头设计参考。
- PAI / AnyGrasp:对比基线。
泛化性与轻量化
- 泛化性:高度依赖合成数据的物理与视觉域随机化(随机化被抓物体尺寸/位置、桌子高度、环境光照与桌面背景纹理)。
- 轻量化:完全由仿真合成数据驱动,避免了高昂的人工示范与真实物理采集成本。
存在问题与痛点
- 指令理解:面对模糊描述(如“抓取那个红色的东西”)时易产生预测犹豫。
- 杂乱环境:密集遮挡与杂乱场景下对目标物体的边界识别率下降。
- 物理接触:缺少触觉反馈,对于光滑表面物体易因用力不当导致滑动脱落。
- 推理延迟:PAG 及流匹配多步采样带来了较高的计算开销与推理时延。
部署与实际应用
- 突破了传统基于点云方法(如 AnyGrasp)难以处理透明、高反光物体的局限,适用于工业分拣与家庭服务。
2. SmolVLA
算法架构
- 视觉编码:SigLIP 视觉编码器,抽取多尺度 RGB 图像特征。
- 语言解码:SmolLM2 轻量化语言模型,用于指令理解与跨模态交互。
- 动作头设计:基于流匹配(Flow Matching)建模连续动作空间,支持高效预测连续动作块(Action Chunking)。
- 注意力机制:交叉注意力(Cross-Attention)连接视觉语言特征,因果自注意力(Causal Self-Attention)用于时序建模。
- 线性投影(Linear Projection):将本体感知状态(Sensory States)、VLM 特征与动作统一投影至相同隐空间。
- 推理加速:支持异步推理算法,将策略预测与硬件控制解耦,消除控制死区。
针对场景
- 边缘侧部署:计算资源有限(如单卡甚至嵌入式 GPU)、对易部署性要求高的场景。
- 中短 Horizon 任务:步骤较少、对极致微米级精度要求不高的桌面推拔、抓放任务。
评价标准与指标
- 真实环境:细粒度步骤评分法(拆解 Task Steps,逐项判定并做分值归一化)。
- 虚拟环境:二元 Success Rate(1 代表成功,0 代表失败)。
- 时效指标:任务完成总时间(Time-to-Completion)、固定时间吞吐量(Throughput)。
测试工具与数据集
- 测试框架:基于 Hugging Face LeRobot 具身智能开源生态。
- 训练数据集:整合了社区 480+ 个开源机器人示范数据集。
泛化性与轻量化
- 泛化性:Sim-to-Real 迁移性能损失小,对背景干扰与微小位置漂移具有较强鲁棒性。
- 轻量化技术:
- Layer Skipping:仅保留 VLM 的前 1/2 核心层,大幅削减参数量。
- PixelShuffle:采用像素重排无损压缩图像 Token,将单帧特征压缩至 64 个 Token。
- 异步推理:降低运行管线延迟,显著缩短训练与评估周期。
存在问题与痛点
- 深度感知:2D 视觉压缩后缺乏强 3D 空间几何感知能力。
- 长程任务:在长 Horizon、多阶段复合任务中容错率低,存在累积误差。
- 控制冲突:在异步推理管线中,预测动作块与实时反馈间偶发动作衔接冲突(Execution Jitter)。
部署与实际应用
- 深度适配 SO-100 / SO-101 低成本桌面机械臂以及 LeKiwi 移动双臂机器人,用于低成本教学、桌面分拣与教育科研。
3. SwiftVLA
算法架构
- 视觉语言主干:高度剪枝/蒸馏的极轻量视觉语言模型(如 MobileVLM / PaliGemma 缩小版)。
- 高频动作头:单步流匹配或蒸馏式 Diffusion 动作头,结合极短轨迹预测(Action Chunking = 4~8)。
- 前馈控制映射:引入关节速度/力矩预测分支,实现从 VLM 特征到低层电机控制(Motor Direct Control)的高频直连。
- 混合时序流水线:将语义理解(低频 1~2 Hz)与轨迹推演(高频 20~50 Hz)分层解耦。
针对场景
- 高频实时控制:需要快速动态响应的场景(如动态抓取移动物体、乒乓球/推球、动态避障等)。
- 低算力嵌入式板卡:如 NVIDIA Jetson Orin Nano / Orin NX 等端侧设备。
评价标准与指标
- 控制频率(Control Frequency / Hz):控制循环实际达到的赫兹数(典型目标 ≥ 30 Hz \ge 30\text{Hz} ≥30Hz)。
- 端到端延迟(End-to-End Latency):从相机曝光完毕到电机响应的毫秒级时延(ms)。
- 动作平滑度指数(Action Smoothness Index):测量控制指令的加加速度(Jerk)。
测试工具与数据集
- 测试工具:Isaac Gym / MuJoCo 高频仿真环境、LeRobot C++ / Python 控制后端。
- 数据集:包含高频电机编码器数据与同步相机流的高帧率(60fps+)示范数据集。
泛化性与轻量化
-
轻量化:
-
知识蒸馏(Knowledge Distillation):将 7B 级大 VLA 的动作表示蒸馏至 1B 以下小模型。
-
量化部署:支持 INT8 / FP16 混合精度 TensorRT 引擎加速。
-
泛化性:注重动态扰动下的自适应恢复能力,但跨类目物体的语义泛化略弱于 7B 级模型。
存在问题与痛点
- 语义推理能力弱:过度追求速度导致 VLM 层数过浅,难以理解极其复杂的隐式语言指令。
- 过冲现象(Overshooting):在高频响应下,易因电机惯性产生位置过冲与末端微振动。
部署与实际应用
- 适用于移动底盘与机械臂协同的实时避障、高频流水线推抓分拣、无人机/四足机器人端侧视觉伺服。
4. OpenVLA(开源通用标杆)
算法架构
- 主干网络:基于 Llama-3(8B)或 Prismatic VLM 架构构建的 7B 级端到端大模型。
- 视觉编码:DINOv2 与 SigLIP 双视觉 backbone 特征融合(Dual Vision Encoder)。
- 动作离散化/连续化:将连续机器人动作空间离散化为 256 个 Bin Token,直接融入语言模型的词表进行自回归生成,或接自回归/Diffusion 动作头。
针对场景
- 通用多任务操控:跨场景、跨机械臂形态的零样本(Zero-Shot)或少样本(Few-Shot)泛化任务。
- 复杂语言指令理解:包含多步推理、空间方位关系识别的复杂任务(如“把左边倒数第二个杯子放到盘子里”)。
评价标准与指标
- 跨本体迁移率(Cross-Embodiment Success Rate):在未经微调的新机械臂上的任务成功率。
- Zero-Shot 泛化成功率:面对未见过的物体、未见过的背景与光照时的表现。
Test 工具与数据集
- 开源数据集:Open-X Embodiment (OXE) 包含 22+ 种机器人形态、100 万+ Episodes 的巨量数据集。
- 评价评估:SIMPLER 仿真评估基准、BridgeData V2 实物测试框架。
泛化性与轻量化
- 泛化性:具身智能领域泛化性能最强的开源模型之一,具备出色的语义与视觉泛化能力。
- 轻量化:模型体积较大(7B+),需依赖 QLoRA / LoRA 进行参数高效微调,推理时常用 4-bit / 8-bit 量化技术。
存在问题与痛点
- 算力消耗大:原生模型推理耗费大显存(需 24GB+ VRAM)。
- 控制频率低:自回归生成方式导致原生推理频率较低(仅 3~5 Hz),难以直接满足高动态伺服要求。
部署与实际应用
- 广泛作为具身智能领域的学术研究 Baseline,用于 ALOHA、WidowX、Franka Emika 等主流科研机械臂的泛化抓取与复杂指令执行。
5. 四大模型综合对比总结
| 维度 | GraspVLA | SmolVLA | SwiftVLA | OpenVLA |
|---|---|---|---|---|
| 核心定位 | 专项透明/普通物体抓取 | 低成本边缘端端到端模型 | 高频实时动态控制模型 | 通用多任务基座大模型 |
| 模型规模 | 中等(VLM + 动作专家) | 极小(< 2B,SmolLM2) | 小(< 1.5B / 蒸馏版) | 大(~7B+,基于 Llama-3) |
| 动作生成机制 | 流匹配 (Flow Matching) | 流匹配 (Flow Matching) | 蒸馏 / 极短 Chunk 快速生成 | 动作 Token 离散生成 / Diffusion |
| 控制频率 | 低中(5~10 Hz) | 中(1020 Hz,支持异步) | 高(30~50+ Hz) | 低(35 Hz) |
| 代表硬件 | 各种单/双臂 (搭配 Isaac Sim) | SO-100 / LeKiwi / 桌面臂 | 移动机器人 / 高频机械臂 | Franka / ALOHA / WidowX |
| 核心优势 | 透明物体抓取、合成数据驱动 | 算力需求低、LeRobot 易部署 | 推理延迟极低、动态响应快 | 语义与视觉泛化能力极强 |
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)