Vision-Language-Action 论文精读路线:从 Embodied Agents 到 Robotics Foundation Models
Vision-Language-Action 论文精读路线:从 Embodied Agents 到 Robotics Foundation Models

系列:AI 论文精读与复现训练营
日期:2026-08-10
适合读者:准备进入机器人学习、多模态智能体、具身智能方向的研究生;熟悉深度学习和 LLM/VLM、但还没有系统读过机器人论文的工程读者。
检索日期:2026-08-10
目录
- 为什么 VLA 是机器人学习的转折点
- 精读 VLA 论文的五条线
- 代表论文路线图
- 关键论文怎么读
- 方法与实验对比表
- 复现建议
- 常见误区
- 适合研究生继续做的选题
- 总结
- 参考资料
为什么这个主题重要
传统机器人学习论文常被拆成感知、规划、控制三个模块:视觉模型识别物体,规划器生成子目标,控制器输出动作。这个范式清晰,但每个模块的错误都会传给下游,而且每换一个机器人、相机视角、末端执行器或任务集合,都要重新调大量工程细节。
VLA 的野心是把这件事改写成一个端到端学习问题:输入图像、语言指令和机器人状态,输出下一步或一段未来动作。RT-2 把视觉语言模型转成动作模型,Open X-Embodiment 把不同实验室、不同机器人数据统一到可训练格式,OpenVLA 把开放权重和 PyTorch 训练管线推到社区面前,π0 用 flow matching 处理高频连续动作,FAST 把动作 tokenization 当成时序压缩问题,Gemini Robotics 和 GR00T 则把 VLA 推向更强的多步推理、humanoid 和 on-device 形态。
但对研究生来说,这个方向也容易误读。第一,VLA 不是“给 VLM 接机械臂 API”这么简单。低层动作要满足控制频率、平滑性、延迟和安全约束,动作空间比文本 token 更脆弱。第二,benchmark 成绩通常强依赖任务套件、相机视角、初始状态、控制器、是否早停、是否微调、演示数据是否重叠。第三,论文里最有价值的部分往往不是大模型口号,而是数据标准化、动作编码、动作 chunk、后训练和评测协议。
核心阅读方法:五条线拆一篇 VLA 论文

读 VLA 论文时,不要从模型名开始记。建议每篇都按下面五条线做笔记。
1. Perception Backbone:视觉表示从哪里来
记录它使用的是从头训练的视觉 transformer、DINOv2/SigLIP/PaliGemma/Gemini/Eagle/Qwen-VL 这类预训练 VLM,还是只用冻结特征。要追问:输入是单视角还是多视角?有没有 wrist camera?是否使用历史帧?图像分辨率和 token 数怎么影响延迟?如果论文宣称“泛化”,视觉 backbone 贡献了多少,机器人数据贡献了多少?
2. Language / Task Conditioning:语言到底控制什么
语言可能只是任务标签,也可能承担对象指代、空间关系、子目标规划和在线纠错。RT-2 强调从 web-scale VLM 迁移语义知识;OpenVLA 和 SmolVLA 强调语言条件下的操作策略;Gemini Robotics 1.5 进一步强调 agentic planning 和 thinking。读论文时要标出:语言是训练时监督,还是推理时交互?评测的指令是否真的覆盖组合泛化?
3. Action Representation:动作如何被模型生成
这是 VLA 论文的核心。RT-2 把动作离散成 token;OpenVLA 延续离散动作输出;Octo 使用 diffusion-style action head;π0 使用 flow matching 生成连续动作;FAST 用离散余弦变换压缩动作序列再 token 化;OpenVLA-OFT 则把 fine-tuning recipe 改成并行解码、action chunking、连续动作和 L1 目标。动作表示决定了控制频率、误差累积、训练稳定性和复现难度。
4. Robot Data:数据是否真的跨 embodiment
Open X-Embodiment 汇集 22 种机器人形态、超过 500 个技能和超过 100 万 episode,是这一轮通用机器人策略的关键基础设施。OpenVLA 报告使用来自 Open X-Embodiment 的 970k 真实机器人演示;Octo 使用 800k trajectories;π0/openpi 提供预训练于大规模机器人数据的模型;SmolVLA 则反向强调社区数据、低成本硬件和更小规模可复现。读数据部分时不要只记“多少条轨迹”,要记数据格式、动作空间、相机、任务文字、采集者、清洗规则和 license。
5. Evaluation & Reproduction:泛化证据是否可靠
VLA 评测最容易产生错觉。LIBERO、CALVIN、SimplerEnv、BridgeData、DROID、真实 ALOHA/Franka/humanoid 任务的难度不等价;同一个 benchmark 上,不同论文可能改 demonstrations、改 early stop、改 action chunk、改最大步数或只报告部分任务。论文如果没有公开评测脚本、初始化状态、失败案例和多 seed 结果,就不要把 SOTA 当成稳定事实。
代表论文路线图
第一阶段:从多任务机器人策略到具身多模态模型
RT-1(2022)是规模化真实机器人控制的重要起点:用大量真实机器人演示训练 transformer policy,让模型在语言指令下直接控制机器人。PaLM-E(2023)则把大型语言模型“具身化”,让语言模型接收图像、机器人状态等输入,输出计划或文字形式的中间结果。它还不是今天意义上直接输出底层 action 的 VLA,但它把“多模态预训练能否帮助机器人任务”变成了严肃问题。
第二阶段:VLM 到 VLA
RT-2(2023)明确提出 vision-language-action model:用 PaLI-X、PaLM-E 这类视觉语言模型作为基础,把机器人动作表示成 token,让模型从图像和语言直接生成动作序列。Open X-Embodiment 与 RT-X 同年出现,强调跨机器人数据混合训练。这个阶段的关键问题是:web-scale 视觉语言知识能否迁移到真实控制?不同 embodiment 的动作空间能否统一?数据多样性是否比单一机器人上的任务数量更重要?
第三阶段:开放模型与可复现训练
Octo(2024)和 OpenVLA(2024)让社区第一次可以系统比较开放 generalist robot policy。Octo 的价值在于小得多、可微调、强调通用 policy initialization;OpenVLA 的价值在于 7B 级开放 VLA、PyTorch/FSDP/LoRA/quantization 训练与部署路径、以及对 Open X-Embodiment 数据混合的工程化支持。对研究训练来说,OpenVLA 的 README、LIBERO 评测脚本和 troubleshooting 比论文摘要更值得细读。
第四阶段:连续动作、flow matching 与高频控制
π0(2024)把预训练 VLM 和 flow matching action expert 结合,目标是让模型输出高频连续动作 chunk,处理更复杂的 dexterous manipulation。FAST(2025)指出朴素 per-dimension/per-timestep 动作离散化在高频 dexterous 数据上会很差,于是把动作 tokenization 转成频域压缩问题,并释放 FAST+ tokenizer。OpenVLA-OFT(2025)则说明 fine-tuning recipe 本身可以显著改变速度和成功率:并行解码、动作 chunk、连续动作、L1 目标这些“工程选择”可能比换更大 backbone 更关键。
第五阶段:2025-2026 的 robotics foundation models
Gemini Robotics(2025)把 Gemini 2.0/2.5 的多模态推理接入物理行动,官方资料强调交互性、泛化、dexterity、on-device 低延迟和少量 demonstrations 的适配;但主模型和 SDK 多处处于 private preview/trusted tester 状态,复现时要标注访问限制。NVIDIA GR00T N1(2025)和后续 N1.5/N1.7 把 VLA 推向 humanoid,代码库到 2026 年已有 N1.7 版本、若干 checkpoint 和部署说明。SmolVLA(2025)则代表另一条重要路线:更小模型、更低硬件门槛、社区数据和异步推理。2026 年的 VLA 持续学习论文开始追问:真实场景里不断学习新任务时,模型是否会遗忘旧技能。
关键论文精读
RT-1:先读数据和控制接口
RT-1 的重点不是“Transformer 又赢了”,而是它把机器人学习的训练单位从单任务策略扩展到大规模多任务真实机器人数据。精读时要画出:观测包括什么,语言指令如何进入模型,动作维度如何定义,控制频率是多少,训练数据来自怎样的环境,评测怎样区分 seen/unseen task。复现上不要一开始追求完整真实机器人实验,可以先复现数据格式、action normalization 和离线 action prediction。
PaLM-E 与 RT-2:区分 planning model 和 action model
PaLM-E 更像具身多模态推理器,常与低层策略配合;RT-2 则把 VLM fine-tune 成能直接输出动作 token 的模型。读这两篇时要标注“输出是什么”:文本计划、子任务、动作 token,还是连续控制量。很多初学者把 embodied LLM、VLM planner、VLA policy 混在一起,导致 Related Work 结构混乱。
Open X-Embodiment / RT-X:把数据集当论文读
这篇不是普通 dataset paper。它的关键是 RLDS episode 格式、跨实验室数据整合、机器人 embodiment 差异、task annotation 和 RT-1-X/RT-2-X 的跨数据训练。精读时建议做一张数据地图:每个数据源的机器人、相机、动作空间、任务数量、license、是否适合自己的复现硬件。不要只引用“超过 100 万 episode”这样的宏观数字。
Octo 与 OpenVLA:开放基线的两种价值
Octo 的优点是更轻、开放、便于把 generalist policy 当作 initialization;OpenVLA 的优点是 VLM backbone 更强、开放模型更贴近 LLM/VLM 生态、fine-tuning 说明更完整。读 OpenVLA 时尤其要看它如何处理 Prismatic VLM、DINOv2/SigLIP 特征、Llama 2、动作 token、LoRA、LIBERO 和 BridgeData V2。对于科研训练,推荐把 OpenVLA 作为“能跑起来的主线”,把 Octo 作为“架构和数据 ablation 的对照”。
π0、FAST、OpenVLA-OFT:把动作表示读透
π0 的贡献不只是“更强机器人模型”,而是把 action generation 从离散 token 进一步推向连续轨迹生成;FAST 的贡献是把离散 VLA 的瓶颈定位到 action tokenizer;OpenVLA-OFT 的贡献是证明 fine-tuning 配方能极大影响推理速度、频率和 task success。读这三篇要重点比较:动作 chunk 长度、输出空间、损失函数、是否 autoregressive、推理是否并行、是否支持多视角和 proprioception。
Gemini Robotics、GR00T、SmolVLA:读官方资料时保持实验警惕
Gemini Robotics 和 GR00T 的官方页面非常重要,因为模型状态、访问方式、模型卡、checkpoint、SDK 和版本号更新很快。读这类资料时要把“论文可复现证据”和“官方 demo 能力描述”分开。SmolVLA 则特别适合研究生:它把模型缩小到 450M 级别,强调单 GPU/消费级设备、LeRobot 数据格式、异步推理和社区数据,是做课程项目或复现训练的现实入口。
方法与实验对比表
| 论文/系统 | 时间 | 关键问题 | 动作表示 | 数据与评测线索 | 复现难度 |
|---|---|---|---|---|---|
| RT-1 | 2022 | 多任务真实机器人控制能否 scale | 离散化动作 / transformer policy | Google 真实机器人厨房数据,官方开源模型与数据线索 | 高 |
| PaLM-E | 2023 | 大型语言模型如何接收具身输入 | 主要输出文本/计划,常接低层策略 | 多机器人、多模态任务 | 高 |
| RT-2 | 2023 | VLM 能否转成直接控制机器人的 VLA | 动作 token | RT-1 数据 + web/VLM 知识迁移 | 高 |
| Open X-Embodiment / RT-X | 2023 | 跨机器人数据能否统一训练 | 依模型而定 | 22 robot embodiments、500+ skills、100 万+ episodes | 中到高 |
| Diffusion Policy | 2023 | 连续 visuomotor policy 如何建模多峰动作 | diffusion action generation | 11 tasks、4 benchmarks,代码和日志较完整 | 中 |
| Octo | 2024 | 开放 generalist robot policy 初始化 | transformer + diffusion-style action head | 800k OXE trajectories,9 平台微调 | 中 |
| OpenVLA | 2024 | 开放 7B VLA 与可微调生态 | 离散动作 token | 970k robot demonstrations,LIBERO/BridgeData | 中到高 |
| π0 / openpi | 2024-2025 | VLM + flow matching 能否做高频 dexterous control | 连续 flow matching action chunk | 多平台 dexterous 数据,openpi 模型与代码 | 中到高 |
| FAST | 2025 | 动作 tokenization 是否限制 AR VLA | DCT/频域压缩动作 token | FAST+ tokenizer,1M robot action sequences | 中 |
| OpenVLA-OFT | 2025 | fine-tuning 配方如何提升速度与成功率 | 连续动作、L1、action chunk | LIBERO 与 ALOHA,项目页给出硬件需求 | 中 |
| SmolVLA | 2025 | 小模型和社区数据能否复现 VLA | flow matching action expert | LeRobot 社区数据、SO100/SO101、LIBERO | 低到中 |
| Gemini Robotics | 2025 | agentic VLA、on-device 与交互控制 | 官方未完全开放细节,输出 action | 私有预览/可信测试,官方模型卡与技术报告 | 高 |
| GR00T N1.x | 2025-2026 | humanoid generalist policy | VLM + diffusion transformer / action head | GitHub、model card、LIBERO/DROID/SimplerEnv checkpoint 线索 | 中到高 |
复现建议:从能跑开始,不要从真实机器人开始
第一步,选一个开放且脚本完整的栈。研究生训练建议优先从 LeRobot + LIBERO/Meta-World、OpenVLA 的 LIBERO 脚本、SmolVLA 或 GR00T 的公开 checkpoint 入手。真实机械臂复现不是第一步,因为硬件误差、相机标定、延迟、控制器和安全约束会掩盖模型问题。
第二步,固定评测协议。记录 random seed、任务 suite、初始化状态、最大步数、成功判定、是否 early stop、每个任务 rollout 数、是否使用同一份 demonstrations。VLA 结果差异很容易来自协议,而不是模型本身。
第三步,先做离线 sanity check。包括 action normalization 是否正确,动作维度顺序是否与环境一致,gripper 开合方向是否反了,图像通道和相机视角是否匹配,语言 prompt 是否与训练格式一致。很多“模型不工作”其实是接口错位。
第四步,只改一个变量。动作表示、backbone、数据 mixture、视角数量、action chunk、fine-tuning steps、LoRA rank、学习率都可能影响结果。做 ablation 时,不要同时换数据、模型和评测脚本。
第五步,保存失败轨迹。VLA 方向的研究价值通常来自失败模式:看错物体、听懂但抓不住、短程成功长程失败、对未见背景脆弱、连续学习后遗忘旧任务。失败视频、action traces 和 per-task logs 比一个平均成功率更有科研价值。
常见误区
误区一:把 VLA 论文当多模态 LLM 论文读。
VLA 的关键不是回答问题,而是闭环控制。延迟、控制频率、动作平滑、执行错误恢复,是论文质量的一部分。
误区二:只看 benchmark 平均分。
LIBERO 平均分高不等于真实机器人强;真实机器人 demo 好看不等于 protocol 严格;模型在一种 embodiment 上成功不等于跨机器人泛化。
误区三:忽略数据格式。
机器人数据的 observation/action/state/schema 往往比模型结构更决定复现成败。RLDS、LeRobot dataset、DROID、OXE、LIBERO 的格式差异必须单独整理。
误区四:把动作 token 当普通文本 token。
文本 token 错一个字可能还能恢复,动作 token 错一串会让机器人走偏。动作离散化、频域压缩、连续输出和 chunk stitching 都值得精读。
误区五:把官方 demo 当论文证据。
官方页面能提示方向,但科研引用要回到论文、模型卡、代码、评测脚本和可复现 protocol。访问受限、未开源权重、私有 benchmark 都要写清楚。
适合研究生继续做的选题
- VLA 动作表示的可控比较:在同一 LIBERO/SimplerEnv 设置下,比较离散 token、FAST tokenizer、L1 continuous head、diffusion/flow matching head,控制 backbone 和数据不变。
- VLA 失败模式分类器:从 rollout 视频和日志自动标注失败原因,如 grounding error、grasp failure、recovery failure、instruction drift、action saturation。
- 小数据 post-training 规律:系统比较 10/50/100/500 条 demonstrations 对不同 VLA 的影响,关注何时出现过拟合和灾难性遗忘。
- 跨 embodiment adapter:研究如何用少量标定数据把同一个 VLA 迁移到不同 action space,而不是为每个机器人重新训练全模型。
- VLA 评测协议审计:复查公开 leaderboard 的任务定义、rollout 数、early stop、数据重叠和失败报告,形成 reproducibility card。
- 安全约束下的 VLA 控制:把语义安全、workspace constraints、low-level controller 和 VLA action head 联合评测,避免只做文本层拒答。
总结
VLA 论文路线的主线不是“机器人终于有大模型了”,而是:机器人学习开始像 LLM 一样追求预训练、数据混合、后训练、开放权重和标准化评测;同时它仍然被物理世界的低层约束牢牢限制。读这个方向,要同时具备多模态模型视角和机器人实验视角。
如果只选三篇精读,建议顺序是 Open X-Embodiment/RT-X、OpenVLA、π0/FAST;如果要做复现,建议从 SmolVLA 或 OpenVLA-OFT 的开放脚本开始;如果要做选题,优先围绕动作表示、评测可靠性、小数据后训练和持续学习。VLA 方向还远没有收敛,真正好的研究问题往往藏在“论文 demo 很强,但换一个机器人、一个视角、一个任务协议就失败”的地方。
参考资料
以下资料均在 2026-08-10 检索。模型版本、代码仓库状态、benchmark 结果、private preview 访问状态可能变化,复现实验前需再次人工核验。
- RT-1: Robotics Transformer for Real-World Control at Scale, arXiv:2212.06817 / project page: https://robotics-transformer1.github.io/
- Google Research Blog, “RT-1: Robotics Transformer for real-world control at scale”, 2022-12-13: https://research.google/blog/rt-1-robotics-transformer-for-real-world-control-at-scale/
- PaLM-E: An Embodied Multimodal Language Model, Google Research Blog, 2023-03-10: https://research.google/blog/palm-e-an-embodied-multimodal-language-model/
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control / Google DeepMind Blog, 2023-07-28: https://deepmind.google/blog/rt-2-new-model-translates-vision-and-language-into-action/
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models / Google DeepMind Blog, 2023-10-03: https://deepmind.google/blog/scaling-up-learning-across-many-different-robot-types/
- Open X-Embodiment GitHub repository: https://github.com/google-deepmind/open_x_embodiment
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion, arXiv:2303.04137: https://arxiv.org/abs/2303.04137
- Diffusion Policy official code: https://github.com/real-stanford/diffusion_policy
- Octo: An Open-Source Generalist Robot Policy, arXiv:2405.12213: https://arxiv.org/abs/2405.12213
- OpenVLA: An Open-Source Vision-Language-Action Model, arXiv:2406.09246 / project: https://openvla.github.io/
- OpenVLA GitHub repository: https://github.com/openvla/openvla
- π0: A Vision-Language-Action Flow Model for General Robot Control, arXiv:2410.24164 / Physical Intelligence blog: https://www.physicalintelligence.company/blog/pi0
- Physical Intelligence openpi repository: https://github.com/Physical-Intelligence/openpi
- FAST: Efficient Action Tokenization for Vision-Language-Action Models, arXiv:2501.09747 / Hugging Face model card: https://huggingface.co/physical-intelligence/fast
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success, arXiv:2502.19645 / project: https://openvla-oft.github.io/
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics, arXiv:2506.01844 / Hugging Face blog: https://huggingface.co/blog/smolvla
- LIBERO benchmark project and code: https://libero-project.github.io/main.html and https://github.com/Lifelong-Robot-Learning/LIBERO
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset, arXiv:2403.12945 / repository: https://github.com/droid-dataset/droid
- Google DeepMind, “Gemini Robotics brings AI into the physical world”, 2025-03-12: https://deepmind.google/blog/gemini-robotics-brings-ai-into-the-physical-world/
- Google DeepMind, “Gemini Robotics On-Device brings AI to local robotic devices”, 2025-06-24: https://deepmind.google/blog/gemini-robotics-on-device-brings-ai-to-local-robotic-devices/
- Gemini Robotics model page and model cards: https://deepmind.google/models/gemini-robotics/gemini-robotics/ and https://deepmind.google/models/model-cards/
- NVIDIA GR00T N1: An Open Foundation Model for Generalist Humanoid Robots, arXiv:2503.14734 / research page: https://research.nvidia.com/labs/lpr/publication/gr00tn1_2025/
- NVIDIA Isaac-GR00T GitHub repository, checked latest visible N1.7 materials: https://github.com/NVIDIA/Isaac-GR00T
- GR00T N1.5 research page, 2025-06-11: https://research.nvidia.com/labs/gear/gr00t-n1_5/
- A Survey on Vision-Language-Action Models for Embodied AI, arXiv:2405.14093, v8 revised 2026-05-01: https://arxiv.org/abs/2405.14093
- Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models, arXiv:2412.14058 / project: https://robovlms.github.io/
- VLA-Arena benchmark project: https://vla-arena.github.io/
- Can VLA Models Learn from Real-World Data Continually without Forgetting?, arXiv:2605.26820: https://arxiv.org/abs/2605.26820
- AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models, arXiv:2603.08519: https://arxiv.org/abs/2603.08519
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)