让 VLA 跑得上、跑得动、跑得快:五篇轻量化与实时化工作全景解读

文章摘要

视觉-语言-动作(VLA)模型正在从"云端大模型"走向"机器人本体"。本文系统解读 2026 年五篇代表性的高效 VLA 工作,它们分别从不同层面回答同一个问题——如何让 VLA 在消费级/嵌入式硬件上实时运行

  • TurboVLA(模型架构层):砍掉 LLM 中枢,0.2B 参数在 RTX 4090 上跑到 32 Hz、显存 <1 GB
  • CoTinyVLA(训练监督层):用 CoT 蒸馏代替堆参数,0.9B 模型在 LIBERO-Plus 上反超最强 7B 基线 4.7~15.9 分
  • vla.cpp(推理引擎层):基于 llama.cpp 的 C++ 运行时,一个二进制服务 7 种 VLA 架构,从 RTX 3060 跑到 8 GB 的 Jetson Orin Nano;
  • Reflex(系统调度层,ICML 2026):流式推理框架,50 Hz 稳定输出、推理加速 2.58×、峰值显存省 27%
  • Evo-Depth(感知增强层):0.9B 隐式深度增强策略,真机 90% 成功率、3.2 GB 显存 / 12.3 Hz

阅读本文你将获得:五篇工作的核心思路与框架拆解、关键数据对比表、开源资源清单,以及一份"按场景选型"的实用指南。

关键词:VLA、具身智能、实时推理、流式推理、模型轻量化、边缘部署、GGUF、Flow Matching


目录


一、汇总分析:五条技术路线,一个共同目标

1.1 全局思维导图

高效 VLA
2026

架构重构

TurboVLA

砍掉 LLM 中枢

V+L→A 直连

0.2B / 32Hz / 0.9GB

监督结构化

CoTinyVLA

CoT 蒸馏 35B→0.9B

Plan + Think 两级推理

LIBERO-Plus 86.4

推理引擎

vla.cpp

llama.cpp/ggml 生态

7 架构统一 GGUF

Jetson 级部署

系统调度

Reflex

分区注意力缓存

异步双流流水线

50Hz 流式控制

感知增强

Evo-Depth

隐式深度 IDEM

FiLM 空间调制 SEM

3.2GB / 12.3Hz

1.2 核心思路一句话总结

工作层面一句话思路
TurboVLA模型架构做减法:动作预测不必经过 LLM,视觉与语言特征直接双向交互后一次解码出动作块
CoTinyVLA训练监督做蒸馏:把 35B 教师的推理链(Plan/Think)蒸馏进 0.9B 学生,用监督结构换鲁棒性
vla.cpp推理引擎做移植:把 Python/PyTorch 技术栈编译成自包含 GGUF,无 Python 依赖跑在嵌入式板上
Reflex系统调度做流水:感知编码与动作去噪解耦成异步双流,KV 缓存三分区实现 O(1) 增量更新
Evo-Depth感知增强做加法(轻量的):从多视角 RGB 提取隐式深度,以 FiLM 调制方式注入空间信息

1.3 关键指标对比表

⚠️ 注意:各工作的评测基准与硬件不同,下表用于感知量级,不能直接横向判优劣

维度TurboVLACoTinyVLAvla.cppReflexEvo-Depth
性质新模型架构小模型+训练方法推理引擎(服务 7 种架构)推理系统(不改模型)新模型架构
参数量0.2B0.9B0.45B~3B(被服务模型)π0.5 / π0 / SmolVLA0.9B
旗舰指标LIBERO 平均 97.7%LIBERO-Plus 平均 86.4%(超 7B 基线)SmolVLA 较 PyTorch 7.95× 加速50 Hz 流式、加速 2.58×LIBERO 95.4%、真机 90%
延迟/频率31.2 ms(32 Hz)稳态 1.37 s / 8 步 chunkOrin Nano 上 84.76~458.84 ms/步推理 135.2→52.4 ms12.3 Hz
显存0.9 GB(RTX 4090)2.25 GiB 峰值(L40S)BitVLA 1.3 GiB 100% 成功峰值 VRAM 省 27%(LIBERO)3.2 GB(RTX 4090D)
目标硬件消费级 GPU单卡 GPURTX 3060 → AGX Orin → Orin NanoRTX 4090 + AgileX PiPerRTX 4090D + xArm6
开源程度代码+权重+训练代码+权重+评测管线代码+Demo+基准脚手架代码(GitHub)代码+权重+训练脚本

1.4 统一视角:它们其实在解决同一个控制环路的不同段

动作生成与执行

表征与决策

观测与感知

增强

替代LLM

注入推理

加速

承载

相机/状态/指令

视觉-语言编码

Evo-Depth
深度增强

多模态融合/推理

TurboVLA
直连交互

CoTinyVLA
CoT监督

动作专家
Flow Matching 去噪

Reflex
流式调度

vla.cpp
C++引擎

动作块 → 机器人

【重点】五篇工作互不冲突、可以叠加:你完全可以用 TurboVLA 的架构、CoTinyVLA 的蒸馏数据、Reflex 的流式调度,最后部署在 vla.cpp 上。这正是"高效 VLA"赛道 2026 年的图景——架构、数据、系统、引擎四条线同时收敛


二、TurboVLA:去掉 LLM 的 V+L→A 直连范式

2.1 简介

项目内容
论文TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM(arXiv:2607.27205,2026.07)
团队华中科技大学 H-EmbodVis + 华为
代码https://github.com/H-EmbodVis/TurboVLA
权重Hugging Face H-EmbodVis/TurboVLA
项目主页https://H-EmbodVis.github.io/TurboVLA

一句话:TurboVLA 对主流 VLA 做了一次"范式手术"——既然执行层的任务指令已经明确,每次动作预测为什么还要跑一遍大语言模型?

2.2 要解决的问题

主流 VLA(OpenVLA、π0 等)采用 V→L→A 通路:视觉特征先投影到 LLM 的词向量空间,与指令 token 拼接后一起过 LLM,再解码成动作。LLM 在这里是感知与动作之间的"中央接口",但每次策略调用都要付出十亿参数级的计算与显存代价。

2.3 思路流程与框架

TurboVLA 把通路重构为 V+L→A 直接映射。官方框架图(论文 Figure 3):

在这里插入图片描述

图:左为 V+L→A 总体管线——DINOv3 视觉特征与 BERT 指令特征经双向交互模块融合后,由 ACT 式解码器单次前向输出动作块;右为双向视觉-语言交互模块的层结构。

用 mermaid 重绘的数据流如下:

输出

核心交互

输入

多视角图像

DINOv3 视觉编码器
ViT-B / ViT-L

语言指令

轻量文本编码器
BERT-base

机器人状态

状态投影

双向视觉-语言交互模块
N=6 层交叉注意力
借鉴 Grounding DINO

ACT 式动作块解码器
H=12 个可学习查询
单次前向并行解码

连续动作块
12 步 × 动作维度

【重点】三个关键设计

  1. 轻量双向交互替代 LLM:N=6 层堆叠的双向交叉注意力——视觉特征"查询"指令定位目标,指令特征"查询"场景完成接地(grounding)。消融显示层数从 2→6 成功率从 93.5% 稳步升至 97.7%,N=8 反而略降(96.6%);
  2. 非自回归并行解码:ACT 风格解码器用 H 个可学习 action query 一次前向输出整个动作块,无动作 token 化、无逐词生成;动作视界 H=12 最优(H=8 时 96.4%,H=15 时降至 95.6%);
  3. 训练极简:纯行为克隆 + L1 损失,无需任何辅助语言建模目标。

2.4 实验结果

【重点】LIBERO 基准:仅 0.2B 参数(约为 π0.5 的 6%),平均成功率 97.7%,匹配甚至超越参数量大一个数量级的 VLA 系统。

【重点】效率(RTX 4090)

指标数值
端到端策略延迟31.2 ms(≈32 Hz 在线动作预测)
推理显存0.9 GB(<1 GB)
参数量0.2B

此外在 RoboTwin 双臂任务与真机任务(叠碗、抓取滚筒等)上保持有效。依赖的外部资产:DINOv3(LIBERO 用 ViT-B,RoboTwin 用 ViT-L)、BERT-base、GroundingDINO Swin-T。

2.5 开源使用说明

git clone https://github.com/H-EmbodVis/TurboVLA.git
cd TurboVLA
# LIBERO 与 RoboTwin 建议分开建 Python 3.10 环境
pip install torch==2.3.1 torchvision==0.18.1 --index-url https://download.pytorch.org/whl/cu121
pip install -e ".[libero]"
# 下载官方权重
hf download H-EmbodVis/TurboVLA --local-dir pretrained/TurboVLA

一条命令即可在指定 suite 上评测(experiments/libero/evaluate.py,支持 bf16)。TODO 列表中还包括对华为昇腾 NPU 的支持。

2.6 亮点与局限

  • 亮点:证明了执行级控制不必以 LLM 为中心;参数/显存/延迟三项同时降一个数量级而性能不降;设计简单、可复现性强。
  • ⚠️ 局限:放弃了 LLM 的开放世界知识与推理能力,对长尾语义指令、需要多步推理的任务可能受限——这恰好是下一篇 CoTinyVLA 想补的东西。

三、CoTinyVLA:用结构化监督代替堆参数

3.1 简介

项目内容
论文CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model(arXiv:2607.25487,2026.07)
代码https://github.com/BrainJellyPie/CoTinyVLA
权重Hugging Face euphoria-64/CoTinyVLA-Qwen3.5-0.8B
骨干Qwen3.5-0.8B

一句话:LIBERO-Plus 鲁棒性榜单上的领先者都在用 3B~7B 骨干,CoTinyVLA 证明把监督信号结构化,0.9B 也能反超

3.2 思路流程与框架

官方框架图(论文 Figure 1):

在这里插入图片描述

图:四阶段管线——多模态输入装配(双视角 16 帧历史 + 相机/时间文本标记)→ 层级 CoT(回合级 Plan + 块级 Think)→ 视觉-语言推理与本体投影 → 动作头输出 8 步 chunk。

三大组件的思维导图:

CoTinyVLA
0.9B

组件1-双视角时序输入

每步 16 帧历史

第三人称 + 腕部相机

文本相机/时间标记

组件2-层级CoT蒸馏

35B 教师生成推理链

回合级 Plan 总体规划

块级 Think 任务阶段/夹爪状态/下一子动作

组件3-复述增广

40 条基础指令

扩展为 800 条变体

语言扰动鲁棒性

三个组件分别瞄准不同的问题轴:时序输入解决"看不清物理状态",CoT 蒸馏解决"不会推理",复述增广解决"听不懂换一种说法"。推理时流程为:观测 → 生成 Plan/Think 推理 span → 视觉-语言推理 → 本体投影器 → 动作头输出 8 步 chunk。

3.3 实验结果

【重点】LIBERO-Plus(10,030 个扰动任务、7 个扰动维度、每任务 1 次 rollout):

模型参数SpatialObjectGoalLong平均
π03.3B60.761.444.948.453.9
OpenVLA-OFT7B84.066.563.066.470.0
OpenVLA-OFT+7B86.184.570.777.779.8
CoTinyVLA0.9B90.887.386.680.786.4

四个套件分别领先最强 7B 基线 +4.7 / +2.8 / +15.9 / +3.0 分,且所有置信区间不含零。参数量只有对手的约 1/8。在标准 LIBERO 上平均 97.5%,与最强 7B 持平、比最强亚十亿参数基线高 2.7 分。

【重点】最硬的增益在"机器人初始状态"扰动上:11 个已发布基线在该维度没有任何一个超过 53.2%,而 CoTinyVLA 在 Goal 套件达到 73.6%(最强基线仅 39.9%)——时序帧输入 + CoT 的组合显著改善了物理状态感知。

闭环推理画像(L40S,每卡 3 路并发 rollout):

属性数值
峰值显存2.25 GiB
回合初始延迟2.76 s
稳态延迟1.37 s / 8 步 chunk
每 chunk 推理 token26 个
Plan 缓存收益稳态延迟 -48.5%,推理 token -63.2%(成功率不变)

测试时干预实验(权重冻结,只改输入)非常有说服力:把 Plan 换成空白/矛盾文本,成功率掉 40~45 分;移除推理 span 直接归零;而礼貌前缀、训练集复述零影响——说明性能确实由"推理内容"支撑,而非语言风格。

3.4 开源使用说明

仓库提供完整管线:数据转换(convert_libero_plus.py)→ 推理标签生成(vLLM + Qwen3.5-35B-A3B-GPTQ-Int4 教师)→ 训练(torchrun 8 卡,--lm_loss_weight 0.1)→ 推理与多 GPU 动态评测(SQLite 队列分配任务、断点续评)。评测代码把 LIBERO-Plus 挂为 libero_plus.libero 独立命名空间,可与标准 LIBERO 共存于同一环境。

3.5 亮点与局限

  • 亮点:提出"监督结构 > 参数规模"的强证据;干预实验严谨地证明了推理链是承重墙而非装饰;2.25 GiB 峰值显存对嵌入式部署友好。
  • ⚠️ 局限:稳态 1.37 s/chunk 的延迟尚谈不上"实时";训练依赖 35B 教师生成监督,数据管线成本不低。

四、vla.cpp:一个 C++ 运行时统一七种 VLA

4.1 简介

项目内容
论文vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models(arXiv:2606.08094,2026.06)
团队VinRobotics、TU Darmstadt、马普智能系统研究所、斯图加特大学、DFKI 等
项目页/Demohttps://fai-modelopt-tech.github.io/vla-cpp.github.io/
生态构建于 llama.cpp / ggml 之上,Hugging Face vrfai(VinRobotics)

一句话:VLA 策略几乎都以"假设工作站级 GPU 的 Python/PyTorch 技术栈"发布,而机器人本体通常是 8 GB 统一内存的 Jetson——vla.cpp 填的就是这个部署鸿沟

4.2 思路流程与框架

【重点】它是首个原生支持 flow-matching/扩散 VLA 推理模式的 ggml 类引擎:缓存的视觉-语言前缀(prefix)被交叉注意力的动作专家在多个求解器步上反复消费。一个二进制、一套请求/响应协议、一种 bundle 格式,服务 7 种架构、5 种骨干、4 类动作头

模型视觉骨干语言骨干动作头参数求解步数 T
SmolVLASigLIP-So400mSmolLM2-360MFM 交叉注意力专家450M10
Evo-1InternViT-300MQwen2.5-0.5B交叉注意力 DiT770M32
BitVLABitSigLIP-LBitNet-2BMLP 回归(单趟无循环)2.4B
π0SigLIP-So400mGemma-2BFM 联合注意力专家3B10
GR00T-N1.5/1.6SigLIP2-400MQwen3-1.7BAltVL DiT3B4
GR00T-N1.7Qwen3-VL ViTQwen3-VLAltVL DiT3B4

官方系统架构图(论文 Figure 1):

在这里插入图片描述

图:无状态 C++ 服务器加载一个 GGUF bundle,对每条 Protobuf 观测执行 VLA 推理,经 ZeroMQ 返回反归一化的动作块;轻量 Python 客户端持有闭环控制,可驱动模拟器或真实机器人。

用 mermaid 重绘如下:

模型包

服务端 vla.cpp Runtime C++

客户端 Python

请求/响应

加载

机器人/模拟器
观测·配置·指令

统一协议
Protobuf+ZeroMQ

跨注意力 KV 缓存

Solver Loop 求解循环

三元 Tensor-Core 核

llama.cpp ggml 后端

CUDA / CPU AVX·NEON

GGUF bundle
model.gguf + mmproj
含归一化统计量

从 VLM 运行时到 VLA 运行时要补四个缺口(论文 Appendix A):暴露 LM 完整隐状态作交叉注意力源、前缀用双向掩码编码、显式的跨注意力缓存生命周期、以及用模型自带统计量反归一化动作——每一项都是"静默出错"的高发区。

4.3 实验结果

行为保真:LIBERO-Object 全套件(10 任务 × 20 回合 = 200 回合/架构),七种架构均复现参考 checkpoint 行为,差距在一个回合以内;BitVLA 200/200 满分,常驻内存仅 1.3 GiB

【重点】对 PyTorch 参考实现的加速(同权重、同 BF16、同模拟器):

  • SmolVLA:每环境步 28.16 ms vs 223.96 ms = 7.95× 加速,峰值显存基本持平(1410 vs 1406 MiB)——PyTorch eager 的主机端 kernel 发射开销让算力大量空转,vla.cpp 继承 llama.cpp 的静态图一次捕获、逐次回放;
  • 跨硬件每步延迟(ms)与 8 GB Orin Nano 峰值 RSS:
模型RTX 3060AGX OrinOrin NanoNano 峰值 RSS
SmolVLA28.1665.41141.812031 MiB
BitVLA37.85101.11355.652199 MiB
Evo-163.60131.01458.842135 MiB
GR00T-N1.514.1728.7884.76†5975 MiB
π09.7427.9039.10†6068 MiB
GR00T-N1.6/1.7~10.3~26.8装不下

† 模拟器需卸载到另一台机器。【重点】8 GB 模块上 7 个架构只有 5 个能加载——决定能否部署的是显存容量而非延迟

Roofline 洞见:batch-1 VLA 前向由高算力强度的视觉-语言前缀主导(compute-bound),低 token 数的动作专家是 memory-bound;因此部署杠杆是算力利用率 + 内存容量,而不是带宽。据此把 BitVLA 的三元 W2A8 矩阵乘从 dp4a(CUDA 核)迁到 IMMA 张量核:RTX 3060 每步 172.8→37.85 ms(4.6×)、AGX Orin 406.6→101.11 ms(4.0×),输出逐比特一致、成功率不变。

真机压力测试(ALOHA 臂 + GR00T-N1.6):同 checkpoint 同模块,vla.cpp 每 chunk 推理 ≈470 ms vs PyTorch ≈620 ms,闭环成功率 87.5% vs 40.0%(95% Wilson 区间不重叠)——每次重规划的观测新鲜约 150 ms,优势在长程任务上复利。

一个值得所有部署者警惕的发现:视觉塔的位置编码索引在 FP32/FP16 下舍入不同,会选错几乎每个 patch 的嵌入行,动作块偏移最高 ≈1.97(归一化单位,约 2σ,集中在夹爪通道)——任务直接失败且无任何报错;flow matching 的多步积分会把扰动放大而非抵消。vla.cpp 的对策是构建期逐块数值对齐门禁(fail-loud)。

4.4 开源使用说明

每个模型打包为自包含 GGUF bundle(语言模型+动作头+归一化统计+架构配置,视觉编码器内嵌或以 mmproj 伴随文件提供);服务端无状态、C++ 常驻加载,客户端 Python 负责闭环控制,ZeroMQ+Protobuf 传输,同一引擎不改代码驱动模拟器或真实机器人。当前支持 CUDA 与 CPU 后端,结构上可扩展至移动 NPU。

4.5 亮点与局限

  • 亮点:第一个把 7 种异构 VLA 收进单一自包含二进制的运行时;"compute-bound 前缀 / memory-bound 专家"的测量结论与 IMMA 核增益有普适指导意义;数值对齐门禁是工程教科书级实践。
  • ⚠️ 局限:无动态权重换入换出机制,大模型在 8 GB Nano 上仍装不下;原生低比特量化目前仅覆盖 BitVLA 的三元配置。

五、Reflex:把 Flow Matching VLA 变成流式系统

5.1 简介

项目内容
论文Reflex: Real-Time VLA Control through Streaming InferenceICML 2026,arXiv:2607.14695)
团队北京邮电大学计算机学院
代码https://github.com/9yc/Reflex
验证模型π0.5(2.3B)、π0(3.1B)、SmolVLA(500M)

一句话:瓶颈不在于单次推理多慢,而在于同步等待让机器人停下来思考——Reflex 不重训模型,而是把整个服务环路重构为异步流式架构。

5.2 要解决的问题

Flow matching VLA 的迭代去噪与实时控制存在根本冲突:全局时间步注入使 KV 缓存失效——去噪步 k 变了,所有层的内部状态都跟着变,缓存立即作废,只能在"慢到不可用的 O(N²) 重算"和"数学上错误的缓存复用"之间二选一。论文实测朴素 KV 缓存会产生 MSE>1.0 的灾难性误差和任务全败。

5.3 思路流程与框架

核心洞察是 Timestep-Invariance Property(时间步不变性):感知编码器在功能上独立于去噪循环(∂Enc/∂t_k=0)。官方系统架构图(论文 Figure 3):

在这里插入图片描述

图:视觉流(10–30 Hz)持续编码观测写入三分区环形缓冲区;策略流(50 Hz)经未来状态预测器、动作专家(AdaRMSNorm)与 Flow Matching 去噪器输出动作块;两流异步交换 KV。

据此 Reflex 有三大组件:

策略流 50Hz

缓存三分区

视觉流 10-30Hz

异步交换 KV

相机输入

VLM 编码器 50-100ms

环形缓冲区
分区注意力 KV

Static Prefix 静态前缀
指令token·算一次·永久钉住

Sliding History 滑动历史
最近N=10帧·FIFO逐出·增量Prefill

Dynamic Suffix 动态后缀
flow状态+时间步·每轮去噪重置

未来状态预测器
ŝ≈a_cmd

动作专家
AdaRMSNorm 数值稳定

Flow Matching 去噪
k步迭代

动作块 → 机器人

  1. 分区注意力(Partitioned Attention)——正确性:上下文切成静态前缀/滑动历史/动态后缀三区,只有动态后缀每个去噪步需要重算,实现 O(1) 增量缓存更新;在固定观测窗口与固定输入下输出与全批注意力完全等价(实测 MSE=0.00,附录给出证明)。配套"手动缓存合并":进入去噪循环前把前缀与历史合并为连续显存,消除高频循环里的 torch.cat 分配;
  2. AdaRMSNorm——稳定性:50 Hz 连续运行让模型接触高方差初始噪声的频率是离线训练的 50 倍,标准 BFloat16 RMSNorm 在 120~220 步后数值崩溃。AdaRMSNorm 用 FP32 计算 RMS 统计 + BF16 门控 MLP(以 flow 相位与本体状态为条件),代价远低于全 FP32 归一化,实现 >2000 步无 NaN/Inf 的无限时域流式推理;
  3. 异步流水线——吞吐:视觉线程做"生产者"持续编码推 KV,策略线程做"消费者"查询最新缓存生成动作;未来状态预测用最近一次指令动作近似未来状态(ŝ_{t+Δ}≈a_t^cmd,100 ms 前瞻内末端偏差 ❤️ cm);自适应重叠调度按实测延迟动态调整提前量 K。底层再配合算子融合(QKV 打包、SwiGLU Gate+Up 合并、FlashNorm、FusedAdaLN,每层 kernel 发射减半、动作专家前向延迟 -18%)与静态环形缓冲区(24/7 运行零动态分配)。

5.4 实验结果

【重点】效率(RTX 4090,上下文窗口 K=10):

指标数值
推理加速(π0.5, LIBERO)135.2 ms → 52.4 ms(2.58×)
推理加速(π0, 3.1B)2.73×(规模越大收益越大)
推理加速(SmolVLA 500M)2.29×(架构无关)
峰值 VRAMLIBERO -27%、Kinetix -24%(内存占用变平)
反应延迟最高 -54%(151.9→82.5 ms)
停顿率同步基线 100% → 0%
控制频率稳定 50 Hz 流式

任务性能:LIBERO 与同步基线持平(Long 套件 +3.6%/+4.0%);动态物理基准 Kinetix 上 +7.4%(π0.5)/ +6.7%(π0)——低延迟在动态场景直接转化为成功率。真机 AgileX PiPer 三任务 180 回合:成功率 +11/+14/+17 pp,反应延迟 101~110 ms、0% 停顿。

5.5 开源使用说明

代码位于 GitHub 9yc/Reflex。实现要点(附录 B/C):StreamingInputManager 管理缓存逐出与位置 ID;环形缓冲区在模型加载时一次性预分配;AdaRMSNorm 的门控 MLP 为单隐层 SiLU 结构;评测协议为 LIBERO 每套件 10 任务 × 50 回合、Kinetix 每任务 100 回合,延迟报 95 分位。

5.6 亮点与局限

  • 亮点:把"加速单个推理步"的范式升级为"流式异步执行";分区注意力的等价性有证明且实测 MSE=0;AdaRMSNorm 揭示了无限时域部署独有的数值稳定性问题;纯系统侧改造,不重训、不掉点
  • ⚠️ 局限:仅适用于感知编码器时间步不变的架构(统一 DiT 式、时间步进入视觉编码器的模型不在范围内);未来状态预测是一阶近似启发式,非学习模型。

六、Evo-Depth:给轻量 VLA 补上"空间感"

6.1 简介

项目内容
论文Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model(arXiv:2605.14950,2026.05)
团队上海交通大学 MINT 实验室(Evo-1 同团队)
代码https://github.com/MINT-SJTU/Evo-Depth
权重HF:MINT-SJTU/EVO-Depth-LIBEROEVO-Depth-MetaWorldEVO-Depth-Arena

一句话:纯 2D 的 VLA 在精确定位、精细放置、遮挡判断上成功率显著下滑;显式 3D 方案依赖深度传感器且对标定敏感——Evo-Depth 走中间路线:从多视角 RGB 隐式学深度,不加任何硬件

6.2 思路流程与框架

官方架构图(仓库 Evo_depth/assets/model_overview.png,已本地化):

在这里插入图片描述

图:上半部分为模型架构——IDEM 提取隐式深度、SEM 以 FiLM 调制视觉-语言表征、Flow-Matching 动作专家输出动作块;下半部分为三阶段渐进对齐训练策略。

用 mermaid 重绘的数据流如下:

输入

深度特征 D

2D 表征 Z

空间增强表征

多视角RGB

IDEM 隐式深度编码
Plain ViT ~0.13B
多视角深度预训练初始化

语言指令

视觉-语言骨干
InternViT-300M + Qwen2.5-0.5B

机器人状态

Flow-Matching 动作专家
去噪生成动作块

SEM 空间增强模块
平均深度特征→FiLM γ,β
Ẑ = γ⊙Z + β

连续动作块

【重点】三个设计决策

  1. IDEM(隐式深度编码模块):约 0.13B 的轻量 ViT,从多视角 RGB 提取紧凑深度特征,以 Depth Anything 3 的多视角深度预训练初始化——强调空间布局与相对几何关系,不生成高成本的显式 3D 中间表示
  2. SEM(空间增强模块):把深度特征作为 FiLM 调制信号(Ẑ=γ⊙Z+β)注入视觉-语言表征,而非对称拼接。消融证明:拼接(Concat)明显最差,交叉注意力与 SEM 接近,SEM 最好——调制式注入既保留 2D 表征的主导地位,又补进空间信号;
  3. 渐进对齐训练(三阶段):Stage 1 只训 SEM+动作专家(冻骨干与 IDEM)→ Stage 2 解冻 IDEM 做空间对齐 → Stage 3 全模块端到端联合优化。消融显示三阶段 > 两阶段 > 单阶段,渐进对齐显著优于直接联合训练。

6.3 实验结果

仿真(0.9B 参数)

基准成绩说明
Meta-World MT5084.4%SOTA,medium/hard/very hard 各难度档均最佳
LIBERO95.4%各套件均衡
LIBERO-Plus69.6%多扰动维度稳健
VLA-Arena41.1%干扰物与长程设定表现突出

真机(xArm6,三任务:放橙子、存网球、叠杯子):平均成功率 90% 为对比方法最高,同时模型最小、显存最低(3.2 GB)、推理频率最高(12.3 Hz)(RTX 4090D 平台)。四类扰动泛化实验中全面优于基线,位置扰动与精细物体交互场景优势最大。去除 IDEM 的消融在 camera/robot/layout 三个维度掉点最明显——印证隐式深度对视角变化、本体变化、物体排布的鲁棒性贡献。

6.4 开源使用说明

仓库提供统一的 websocket 推理服务器(默认端口 9000)+ LIBERO / LIBERO-Plus / MetaWorld MT50 / VLA-Arena 四套评测客户端;预训练权重按基准分三个 HF 仓库发布;训练侧支持 LeRobot v2.1 格式自定义数据,train.sh 内置完整三阶段渐进对齐配方(Accelerate + DeepSpeed 多卡)。

6.5 亮点与局限

  • 亮点:在"无 3D 硬件"与"重 3D 表征"之间找到实用甜点;部署指标(3.2 GB / 12.3 Hz)与成功率同时公开,工程参考价值高;消融完整(模块、训练阶段、融合策略三组)。
  • ⚠️ 局限:12.3 Hz 离高动态任务还有距离;三阶段训练管线比单阶段复杂,复现成本略高。

七、总结与选型建议

7.1 全文思维导图

高效VLA
选型

我要极限低延迟低显存

TurboVLA

0.2B/32Hz/0.9GB

放弃LLM推理能力

我要小模型的鲁棒性

CoTinyVLA

CoT蒸馏

LIBERO-Plus 86.4

我要部署到嵌入式板

vla.cpp

GGUF一体化

Orin Nano 8GB可行

我已有大模型要提速

Reflex

不重训纯系统改造

50Hz/-27%VRAM

我的任务需要空间精度

Evo-Depth

隐式深度

真机90%

7.2 结语

五篇工作共同勾勒出 2026 年 VLA 工程化的清晰脉络:

  1. 架构上,"LLM 是否必须是动作执行的中枢"开始被认真质疑——TurboVLA 的 V+L→A 直连证明执行层可以非常轻;
  2. 监督上,参数规模不再是鲁棒性的唯一来源——CoTinyVLA 用结构化的推理链监督把 0.9B 推过 7B;
  3. 系统上,"停下思考再行动"不是 VLA 的固有属性——Reflex 证明它是可以被流式架构消除的设计选择;
  4. 引擎上,部署鸿沟正在被 GGUF 生态填平——vla.cpp 让七种架构从消费 GPU 一路跑到 8 GB 嵌入式模块,并留下两条普适教训:前缀 compute-bound / 专家 memory-bound低精度部署必须数值门禁
  5. 感知上,空间能力可以用很轻的方式补上——Evo-Depth 的隐式深度调制是"性能-成本-实时性"三角的实用平衡点。

对从业者的一句话建议:先想清楚瓶颈在架构、数据、系统还是部署,再选对应的工具——而且它们大多可以组合使用。

参考链接

分享完成~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐