【arXiv 2026】CronusVLA 论文解读|从机器人多帧时序建模视角
摘要
本文解读 arXiv 2026 论文《CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling》。该论文提出 CronusVLA——把单帧 VLA 模型高效扩展到多帧视觉-语言-动作建模的通用框架,通过融合单帧预训练与多帧后训练两阶段配方,在可学习特征空间聚合历史帧信息,其特别之处在于用连续特征块替代离散动作 token、保持与既有单帧 VLM 架构完全兼容。实验表明 SimplerEnv 12 任务平均成功率 70.9%(SOTA)、LIBERO 平均 97.0%、SimplerEnv-OR 鲁棒性 R-Score 86.9 全面领先,且 7 帧推理速度恒定 8.7 Hz、后训练仅约 50K 步,为多帧 VLA 建模提供了又快、又稳、又鲁棒的重要借鉴。
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling |
| 标题(中文) | 高效鲁棒的操作模型:多帧视觉-语言-动作建模 |
| 作者 | Hao Li, Shuai Yang, Yilun Chen, Xinyi Chen, Xiaoda Yang, Yang Tian, Hanqing Wang, Tai Wang, Dahua Lin, Feng Zhao, Jiangmiao Pang |
| 机构 | 中国科学技术大学 · 上海人工智能实验室 · 浙江大学 · 香港中文大学 |
| 会议 | arXiv 2026 |
| arXiv | arXiv:2506.19816 |
| 项目网站 | 暂未公开(以 arXiv 论文页为准) |
背景与动机:为什么单帧 VLA 需要多帧建模?
现有 VLA(视觉-语言-动作)模型大多沿用单帧范式:RT-2 在 2023 年开创动作 token 化融入 VLM 的思路,OpenVLA 在 2024 年以 7B 开源通用策略 + OXE 预训练奠定单帧基础。但单帧输入无法利用时序信息,带来两个根本问题:一是状态歧义——机器人无法从单张图像判断"手已接近物体还是正在抓取",运动线索缺失;二是观测脆弱——一旦当前帧被遮挡、模糊或损坏,单帧模型只能输出脱离上下文的动作。
多帧信息恰好提供两大优势:运动线索(连续观测解消状态歧义,判断执行阶段)与历史支撑(帧间一致信息让模型在损坏观测下仍能可靠推断)。然而直接把多帧图像喂给 VLM 骨干有两大代价:自注意力 token 数量平方级增长(预训练极其昂贵),冗余视觉 token 拖慢推理(在线控制对延迟极敏感)。
既有尝试各有短板:低层策略(ACT、扩散策略、GR-1)虽天然多帧但缺乏 VLM 通用性;VLA 侧的多帧建模中,TraceVLA 走视觉轨迹提示级路线,RoboVLMs 用 LSTM 记忆级从零训练,二者计算重、缺乏量化评测;而 SimplerEnv / LIBERO 等主流基准没有观测扰动评估,鲁棒性从未被系统量化。CronusVLA 的历史定位正在于此:多帧 VLA 从图像级输入堆叠 → 提示级/记忆级 → 特征级聚合(2026,CronusVLA),把低层策略的时序经验迁移到通用 VLA 上。
研究主线:从问题到结论

图 6:CronusVLA 研究主线:从单帧时序缺失问题到 70.9% SOTA 结论的完整推理链(Mermaid 流程图)
基准/方法设计:如何"白嫖"多帧而不付出二次方代价?
CronusVLA 的核心设计哲学只有一句话:保持单帧公式与 VLM 兼容。既然单帧预训练范式已被验证(OXE 大数据 + 离散动作 token 自回归),就不要推翻重来——把多帧能力放到后训练阶段显式建立,前向兼容一切单帧 VLA。
方法层面它是一套两阶段配方:单帧预训练(大尺度异构数据 OXE 上自回归预测动作 token,建立具身视觉-语言基础)+ 多帧后训练(连续可学习特征替代离散 token,特征块聚合 $M$ 帧历史)。评测层面则配套设计了 SimplerEnv-OR 鲁棒性基准:对渲染图像直接注入扰动(不修改仿真器),覆盖空间维(Global/Local/Discrete)与时间维(Constant 1:0 / Cyclic 1:1 / Sparse 1:3,1:5),共 24 类观测扰动、120+ 严重等级、2300+ 试验,让"观测鲁棒性"第一次可以被量化打分。

图 1:CronusVLA 多帧建模框架:单帧预训练 + 多帧后训练,推理更快、性能更高、观测更鲁棒
分类全景:多帧 VLA 建模的四条技术路线

图 7:多帧 VLA 建模的四条技术路线:CronusVLA 走特征级聚合(Mermaid 分类树)
方法细节:特征块 + 跨帧解码器 + 多帧正则化
特征块(Feature Chunking):把连续帧的可学习特征拼接为 $F_t^M = f_{t-M+1:t}$,帧间关联建立在特征层而非图像 token 层——这是兼容单帧 VLM 公式的关键,预训练权重可直接复用。
跨帧解码器:DiT 架构 + 扩散损失,通过自注意力 + 交叉注意力预测动作块 $a_{t:t+K-1}$,把时序结构写进解码器。
特征调制器:$\mathrm{DIV}$ 通道拆分当前帧特征以匹配历史数量,平衡时域贡献。
多帧正则化:历史特征使用 stop-gradient,梯度只走当前帧——训练更快、收敛更稳、保留单帧感知能力,把"历史解耦"显式写进训练目标。
推理侧用 FIFO 队列缓存历史特征并复用先前计算,时序成本从二次方降到线性,速度不随帧数下降(恒定 8.7 Hz)。

图 2:CronusVLA 框架:(a) 单帧预训练 (b) 多帧后训练(权重复制) (c) 特征块队列推理 (d) 跨帧解码器细节
实验设计与结果:仿真 + 真实世界的全面验证
评测协议:预训练用 OXE 27 数据集(7B 按 OpenVLA 协议、0.5B 基于 MiniVLA);后训练用 Bridge-v2 + Fractal(约 148K 集 / 5M 多帧片段);评测覆盖 SimplerEnv(GR VM/VA + WR VM 共 12 任务)、LIBERO(4 套件)与真实 Franka Research 3 机器人。成功率 SR 为主指标,鲁棒性 R-Score $= 100\times SR^i/SR$(每设置 200–400 trials)。
SimplerEnv 主表(12 任务平均成功率 %):
| 方法 | Google VM | Google VA | WidowX VM | 平均 |
|---|---|---|---|---|
| OpenVLA (7B) | 35.1 | 35.9 | 3.1 | 24.7 |
| SpatialVLA (3B) | 56.0 | 51.8 | 45.8 | 51.2 |
| RoboVLMs (2B) | 57.0 | 30.9 | 42.7 | 43.5 |
| TraceVLA (7B) | 45.8 | 49.8 | 27.7 | 41.1 |
| CogACT (7B) | 74.8 | 61.3 | 55.2 | 63.8 |
| CronusVLA (7B) | 78.6 | 73.8 | 60.4 | 70.9 |
SimplerEnv 12 任务平均 70.9%,显著超越最强基线 CogACT(63.8%);长程任务 Put in Drawer 达 64.8%(基线仅 0–30%)。LIBERO 平均 97.0%,相对 OpenVLA 提升 26.8%。

图 3:SimplerEnv-OR 基准:对渲染图像注入扰动(不改仿真器),支持空间与时间维的鲁棒性评测
鲁棒性:SimplerEnv-OR 总 R-Score 86.9 / SR 52.4,全面压制 CogACT(72.1/39.8)与 RoboVLMs(67.4/28.8)。时间维上扰动越稀疏表现越好(Sparse 下 R-Score 96.2),而单帧模型在高扰动下会产生 OOD 动作。帧数上 7B 最优 7 帧、0.5B 最优 4 帧,适中最好,且推理速度随帧数恒定(8.7 Hz)。

图 4:真实世界(Franka)实验:(a) 基础抓放 (b) 长程任务 (c) 泛化与遮挡/扰动鲁棒性(挑战下 72.6% 成功率)
后训练策略消融(附录 A)
| 配置 | G-VM | G-VA | W-VM | 速度 (Hz) |
|---|---|---|---|---|
| Baseline | 43.3 | 39.4 | 10.4 | 5.18 |
| +M.F.(图像级多帧) | 45.5 | 47.4 | 4.2 | 3.09 |
| +M.F.+Dec. | 52.2 | 58.1 | 34.4 | 8.73 |
| +Dec.+V.L. | 72.7 | 72.6 | 56.3 | 8.73 |
| +Reg. 完整(Ours) | 78.6 | 73.8 | 60.4 | 8.73 |
消融链清晰显示:图像级多帧(+M.F.)几乎无增益且速度掉到 3.09 Hz,跨帧解码器(+Dec.)把 WidowX 从 4.2 拉到 34.4,特征调制器(+V.L.)与多帧正则化(+Reg.)再推到 70.9%;完整配置 vs Baseline 为 70.9% vs 31.0%(平均视角)。效率对比:Ours-7B 7 帧 / 70.9% / 8.7 Hz / 114.9 ms / 50K 步,而 OpenVLA 为 5.2 Hz / 192.3 ms / 295K 步——两阶段配方把后训练成本压缩到约六分之一。

图 5:帧数影响:平均成功率随帧数先升后降(7B 最优 7 帧、0.5B 最优 4 帧);推理速度不随帧数下降
从消融链看创新信号(附录 C)
CronusVLA 的消融链构成了完整的"验证闭环":表示层替换(离散动作 token → 连续可学习特征 + DiT 扩散解码器)带来量化增益,图像级 +M.F. 32.4 → 特征级 +Dec. 48.2 → +Reg. 70.9,速度 3.09 → 8.73 Hz;多帧正则化把"历史解耦"写进训练(stop-gradient),去正则化收敛更慢且成功率下降;SimplerEnv-OR 每次只隔离一种扰动变量(空间×时间、确定性种子映射),用总 R-Score 86.9 证明"多帧信息"正是鲁棒性负载因素——以特征级解耦 + 严格消融 + 新基准三重证据正面回应"多帧建模代价高"这一领域假设。
结果对比总结

图 8:结果对比总结:CronusVLA 相对 OpenVLA 的性能、鲁棒性与效率三重优势(Mermaid 流程图)
关键发现
- 性能登顶:SimplerEnv 12 任务平均成功率 70.9%,超越最强基线 CogACT(63.8%)7.1 个百分点;长程任务 Put in Drawer 达 64.8%,而各基线仅 0–30%。
- 鲁棒性全面领先:SimplerEnv-OR 总 R-Score 86.9 / SR 52.4,压制 CogACT(72.1/39.8)与 RoboVLMs(67.4/28.8);Sparse 扰动下 R-Score 高达 96.2。
- 效率不降反升:7 帧推理速度恒定 8.7 Hz(114.9 ms),后训练仅约 50K 步;对比 OpenVLA 5.2 Hz / 192.3 ms / 295K 步,计算成本大幅压缩。
- 消融证据完整:完整配置 70.9% vs Baseline 31.0%;图像级多帧(3.09 Hz)→ 特征级(8.73 Hz)的速度跃迁证明特征级聚合才是效率杠杆。
- 帧数适中最好:7B 最优 7 帧、0.5B 最优 4 帧;真实世界遮挡/扰动挑战下成功率仍达 72.6%。
- 新基准补空白:SimplerEnv-OR 首次系统量化 VLA 观测鲁棒性(24 类扰动 / 120+ 严重等级 / 2300+ 试验)。
局限性
- 扰动覆盖有限:SimplerEnv-OR 的扰动类型尚不完整,采用固定频率扰动,缺少对关键帧的定向扰动。
- 数据依赖:多帧后训练依赖 Bridge-v2 / Fractal 等高质量跨具身数据。
- 帧数非单调:帧数过多反而掉点(7B 最优 7 帧、0.5B 最优 4 帧),需按模型调节。
- 评测面待扩展:基线数量与仿真环境支持有限,评测协议仍可完善。作者呼吁社区将鲁棒性评测纳入 VLA 标准实践。
常见问题(FAQ)
CronusVLA 与 OpenVLA 是什么关系?
CronusVLA 建立在 OpenVLA 的单帧预训练范式之上:复用其 7B 权重与 OXE 预训练协议,通过多帧后训练把单帧模型升级为多帧模型,全程保持单帧公式与 VLM 兼容,无需从零训练。
为什么多帧信息能提升机器人操作鲁棒性?
连续帧提供运动线索(解消状态歧义)与历史一致信息(支撑损坏帧下的可靠动作)。当当前帧被遮挡或扰动时,模型仍能从历史特征推断正确动作,单帧模型则会输出 OOD 动作。
直接把多帧图像喂给 VLM 有什么问题?
自注意力 token 数量平方级增长导致预训练昂贵,冗余视觉 token 拖慢在线推理。CronusVLA 把多帧关联从图像 token 空间搬到可学习特征空间,用 FIFO 队列缓存特征,时序成本从二次方降到线性。
多帧后训练需要多少数据与算力?
后训练使用 Bridge-v2 + Fractal(约 148K 集 / 5M 多帧片段),仅约 50K 步即可收敛,约为 OpenVLA 预训练(295K 步)的六分之一。
SimplerEnv-OR 基准如何注入观测扰动?
在渲染图像上直接叠加扰动(不改仿真器),空间维分 Global/Local/Discrete 三种,时间维分 Constant(1:0)、Cyclic(1:1)、Sparse(1:3、1:5)四种频率,共 24 类扰动、120+ 等级、2300+ 试验。
帧数是不是越多越好?
不是。7B 模型最优 7 帧、0.5B 模型最优 4 帧,帧数过多反而掉点;但推理速度不随帧数下降(恒 8.7 Hz),因为历史特征被缓存复用。
参考链接
- CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling (arXiv:2506.19816)
- OpenVLA: An Open Foundation Model for Generalist Robot Policies (arXiv:2406.09246)
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv:2307.15818)
- TraceVLA: Visual Tracing for Learning from Demonstrations (arXiv, 2025)
- CogACT: A Foundational VLA Model for Synergistic Robotic Manipulation (arXiv, 2025)
- π0: A Vision-Language-Action Flow Model (arXiv, 2024)
- LM-EmbodiedAI-Survey (arXiv:2508.10399, 2025)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)