摘要

本文解读 arXiv 2026 论文《CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling》。该论文提出 CronusVLA——把单帧 VLA 模型高效扩展到多帧视觉-语言-动作建模的通用框架,通过融合单帧预训练多帧后训练两阶段配方,在可学习特征空间聚合历史帧信息,其特别之处在于用连续特征块替代离散动作 token、保持与既有单帧 VLM 架构完全兼容。实验表明 SimplerEnv 12 任务平均成功率 70.9%(SOTA)、LIBERO 平均 97.0%、SimplerEnv-OR 鲁棒性 R-Score 86.9 全面领先,且 7 帧推理速度恒定 8.7 Hz、后训练仅约 50K 步,为多帧 VLA 建模提供了又快、又稳、又鲁棒的重要借鉴。

论文基本信息

项目 内容
标题(英文) CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
标题(中文) 高效鲁棒的操作模型:多帧视觉-语言-动作建模
作者 Hao Li, Shuai Yang, Yilun Chen, Xinyi Chen, Xiaoda Yang, Yang Tian, Hanqing Wang, Tai Wang, Dahua Lin, Feng Zhao, Jiangmiao Pang
机构 中国科学技术大学 · 上海人工智能实验室 · 浙江大学 · 香港中文大学
会议 arXiv 2026
arXiv arXiv:2506.19816
项目网站 暂未公开(以 arXiv 论文页为准)

背景与动机:为什么单帧 VLA 需要多帧建模?

现有 VLA(视觉-语言-动作)模型大多沿用单帧范式:RT-2 在 2023 年开创动作 token 化融入 VLM 的思路,OpenVLA 在 2024 年以 7B 开源通用策略 + OXE 预训练奠定单帧基础。但单帧输入无法利用时序信息,带来两个根本问题:一是状态歧义——机器人无法从单张图像判断"手已接近物体还是正在抓取",运动线索缺失;二是观测脆弱——一旦当前帧被遮挡、模糊或损坏,单帧模型只能输出脱离上下文的动作。

多帧信息恰好提供两大优势:运动线索(连续观测解消状态歧义,判断执行阶段)与历史支撑(帧间一致信息让模型在损坏观测下仍能可靠推断)。然而直接把多帧图像喂给 VLM 骨干有两大代价:自注意力 token 数量平方级增长(预训练极其昂贵),冗余视觉 token 拖慢推理(在线控制对延迟极敏感)。

既有尝试各有短板:低层策略(ACT、扩散策略、GR-1)虽天然多帧但缺乏 VLM 通用性;VLA 侧的多帧建模中,TraceVLA 走视觉轨迹提示级路线,RoboVLMs 用 LSTM 记忆级从零训练,二者计算重、缺乏量化评测;而 SimplerEnv / LIBERO 等主流基准没有观测扰动评估,鲁棒性从未被系统量化。CronusVLA 的历史定位正在于此:多帧 VLA 从图像级输入堆叠 → 提示级/记忆级 → 特征级聚合(2026,CronusVLA),把低层策略的时序经验迁移到通用 VLA 上。

研究主线:从问题到结论

CronusVLA 多帧 VLA 建模研究主线流程图:问题→动机→设计→方法→评测→结论

图 6:CronusVLA 研究主线:从单帧时序缺失问题到 70.9% SOTA 结论的完整推理链(Mermaid 流程图)

基准/方法设计:如何"白嫖"多帧而不付出二次方代价?

CronusVLA 的核心设计哲学只有一句话:保持单帧公式与 VLM 兼容。既然单帧预训练范式已被验证(OXE 大数据 + 离散动作 token 自回归),就不要推翻重来——把多帧能力放到后训练阶段显式建立,前向兼容一切单帧 VLA。

方法层面它是一套两阶段配方:单帧预训练(大尺度异构数据 OXE 上自回归预测动作 token,建立具身视觉-语言基础)+ 多帧后训练(连续可学习特征替代离散 token,特征块聚合 $M$ 帧历史)。评测层面则配套设计了 SimplerEnv-OR 鲁棒性基准:对渲染图像直接注入扰动(不修改仿真器),覆盖空间维(Global/Local/Discrete)与时间维(Constant 1:0 / Cyclic 1:1 / Sparse 1:3,1:5),共 24 类观测扰动、120+ 严重等级、2300+ 试验,让"观测鲁棒性"第一次可以被量化打分。

CronusVLA 多帧建模框架总览:单帧预训练与多帧后训练两阶段,兼顾性能与效率

图 1:CronusVLA 多帧建模框架:单帧预训练 + 多帧后训练,推理更快、性能更高、观测更鲁棒

分类全景:多帧 VLA 建模的四条技术路线

多帧 VLA 建模技术路线分类树:图像级、提示级、记忆级与特征级四类方法

图 7:多帧 VLA 建模的四条技术路线:CronusVLA 走特征级聚合(Mermaid 分类树)

方法细节:特征块 + 跨帧解码器 + 多帧正则化

特征块(Feature Chunking):把连续帧的可学习特征拼接为 $F_t^M = f_{t-M+1:t}$,帧间关联建立在特征层而非图像 token 层——这是兼容单帧 VLM 公式的关键,预训练权重可直接复用。

跨帧解码器:DiT 架构 + 扩散损失,通过自注意力 + 交叉注意力预测动作块 $a_{t:t+K-1}$,把时序结构写进解码器。

特征调制器:$\mathrm{DIV}$ 通道拆分当前帧特征以匹配历史数量,平衡时域贡献。

多帧正则化:历史特征使用 stop-gradient,梯度只走当前帧——训练更快、收敛更稳、保留单帧感知能力,把"历史解耦"显式写进训练目标。

推理侧用 FIFO 队列缓存历史特征并复用先前计算,时序成本从二次方降到线性,速度不随帧数下降(恒定 8.7 Hz)。

CronusVLA 系统框架:(a) 单帧预训练 (b) 多帧后训练(权重复制) (c) 特征块队列推理 (d) 跨帧解码器细节

图 2:CronusVLA 框架:(a) 单帧预训练 (b) 多帧后训练(权重复制) (c) 特征块队列推理 (d) 跨帧解码器细节

实验设计与结果:仿真 + 真实世界的全面验证

评测协议:预训练用 OXE 27 数据集(7B 按 OpenVLA 协议、0.5B 基于 MiniVLA);后训练用 Bridge-v2 + Fractal(约 148K 集 / 5M 多帧片段);评测覆盖 SimplerEnv(GR VM/VA + WR VM 共 12 任务)、LIBERO(4 套件)与真实 Franka Research 3 机器人。成功率 SR 为主指标,鲁棒性 R-Score $= 100\times SR^i/SR$(每设置 200–400 trials)。

SimplerEnv 主表(12 任务平均成功率 %)

方法 Google VM Google VA WidowX VM 平均
OpenVLA (7B) 35.1 35.9 3.1 24.7
SpatialVLA (3B) 56.0 51.8 45.8 51.2
RoboVLMs (2B) 57.0 30.9 42.7 43.5
TraceVLA (7B) 45.8 49.8 27.7 41.1
CogACT (7B) 74.8 61.3 55.2 63.8
CronusVLA (7B) 78.6 73.8 60.4 70.9

SimplerEnv 12 任务平均 70.9%,显著超越最强基线 CogACT(63.8%);长程任务 Put in Drawer 达 64.8%(基线仅 0–30%)。LIBERO 平均 97.0%,相对 OpenVLA 提升 26.8%

SimplerEnv-OR 基准示意图:对渲染图像注入空间与时间维扰动,不改仿真器即可评测鲁棒性

图 3:SimplerEnv-OR 基准:对渲染图像注入扰动(不改仿真器),支持空间与时间维的鲁棒性评测

鲁棒性:SimplerEnv-OR 总 R-Score 86.9 / SR 52.4,全面压制 CogACT(72.1/39.8)与 RoboVLMs(67.4/28.8)。时间维上扰动越稀疏表现越好(Sparse 下 R-Score 96.2),而单帧模型在高扰动下会产生 OOD 动作。帧数上 7B 最优 7 帧、0.5B 最优 4 帧,适中最好,且推理速度随帧数恒定(8.7 Hz)。

Franka 真实世界实验:(a) 基础抓放 (b) 长程任务 (c) 泛化与遮挡/扰动鲁棒性

图 4:真实世界(Franka)实验:(a) 基础抓放 (b) 长程任务 (c) 泛化与遮挡/扰动鲁棒性(挑战下 72.6% 成功率)

后训练策略消融(附录 A)

配置 G-VM G-VA W-VM 速度 (Hz)
Baseline 43.3 39.4 10.4 5.18
+M.F.(图像级多帧) 45.5 47.4 4.2 3.09
+M.F.+Dec. 52.2 58.1 34.4 8.73
+Dec.+V.L. 72.7 72.6 56.3 8.73
+Reg. 完整(Ours) 78.6 73.8 60.4 8.73

消融链清晰显示:图像级多帧(+M.F.)几乎无增益且速度掉到 3.09 Hz,跨帧解码器(+Dec.)把 WidowX 从 4.2 拉到 34.4,特征调制器(+V.L.)与多帧正则化(+Reg.)再推到 70.9%;完整配置 vs Baseline 为 70.9% vs 31.0%(平均视角)。效率对比:Ours-7B 7 帧 / 70.9% / 8.7 Hz / 114.9 ms / 50K 步,而 OpenVLA 为 5.2 Hz / 192.3 ms / 295K 步——两阶段配方把后训练成本压缩到约六分之一。

帧数影响分析:成功率随帧数先升后降,7B 最优 7 帧、0.5B 最优 4 帧,推理速度不随帧数下降

图 5:帧数影响:平均成功率随帧数先升后降(7B 最优 7 帧、0.5B 最优 4 帧);推理速度不随帧数下降

从消融链看创新信号(附录 C)

CronusVLA 的消融链构成了完整的"验证闭环":表示层替换(离散动作 token → 连续可学习特征 + DiT 扩散解码器)带来量化增益,图像级 +M.F. 32.4 → 特征级 +Dec. 48.2 → +Reg. 70.9,速度 3.09 → 8.73 Hz;多帧正则化把"历史解耦"写进训练(stop-gradient),去正则化收敛更慢且成功率下降;SimplerEnv-OR 每次只隔离一种扰动变量(空间×时间、确定性种子映射),用总 R-Score 86.9 证明"多帧信息"正是鲁棒性负载因素——以特征级解耦 + 严格消融 + 新基准三重证据正面回应"多帧建模代价高"这一领域假设。

结果对比总结

CronusVLA 与 OpenVLA 结果对比总结图:70.9% 成功率、8.7 Hz 推理速度、R-Score 86.9、50K 步训练

图 8:结果对比总结:CronusVLA 相对 OpenVLA 的性能、鲁棒性与效率三重优势(Mermaid 流程图)

关键发现

  • 性能登顶:SimplerEnv 12 任务平均成功率 70.9%,超越最强基线 CogACT(63.8%)7.1 个百分点;长程任务 Put in Drawer 达 64.8%,而各基线仅 0–30%。
  • 鲁棒性全面领先:SimplerEnv-OR 总 R-Score 86.9 / SR 52.4,压制 CogACT(72.1/39.8)与 RoboVLMs(67.4/28.8);Sparse 扰动下 R-Score 高达 96.2
  • 效率不降反升:7 帧推理速度恒定 8.7 Hz(114.9 ms),后训练仅约 50K 步;对比 OpenVLA 5.2 Hz / 192.3 ms / 295K 步,计算成本大幅压缩。
  • 消融证据完整:完整配置 70.9% vs Baseline 31.0%;图像级多帧(3.09 Hz)→ 特征级(8.73 Hz)的速度跃迁证明特征级聚合才是效率杠杆。
  • 帧数适中最好:7B 最优 7 帧、0.5B 最优 4 帧;真实世界遮挡/扰动挑战下成功率仍达 72.6%
  • 新基准补空白:SimplerEnv-OR 首次系统量化 VLA 观测鲁棒性(24 类扰动 / 120+ 严重等级 / 2300+ 试验)。

局限性

  • 扰动覆盖有限:SimplerEnv-OR 的扰动类型尚不完整,采用固定频率扰动,缺少对关键帧的定向扰动。
  • 数据依赖:多帧后训练依赖 Bridge-v2 / Fractal 等高质量跨具身数据。
  • 帧数非单调:帧数过多反而掉点(7B 最优 7 帧、0.5B 最优 4 帧),需按模型调节。
  • 评测面待扩展:基线数量与仿真环境支持有限,评测协议仍可完善。作者呼吁社区将鲁棒性评测纳入 VLA 标准实践。

常见问题(FAQ)

CronusVLA 与 OpenVLA 是什么关系?

CronusVLA 建立在 OpenVLA 的单帧预训练范式之上:复用其 7B 权重与 OXE 预训练协议,通过多帧后训练把单帧模型升级为多帧模型,全程保持单帧公式与 VLM 兼容,无需从零训练。

为什么多帧信息能提升机器人操作鲁棒性?

连续帧提供运动线索(解消状态歧义)与历史一致信息(支撑损坏帧下的可靠动作)。当当前帧被遮挡或扰动时,模型仍能从历史特征推断正确动作,单帧模型则会输出 OOD 动作。

直接把多帧图像喂给 VLM 有什么问题?

自注意力 token 数量平方级增长导致预训练昂贵,冗余视觉 token 拖慢在线推理。CronusVLA 把多帧关联从图像 token 空间搬到可学习特征空间,用 FIFO 队列缓存特征,时序成本从二次方降到线性。

多帧后训练需要多少数据与算力?

后训练使用 Bridge-v2 + Fractal(约 148K 集 / 5M 多帧片段),仅约 50K 步即可收敛,约为 OpenVLA 预训练(295K 步)的六分之一。

SimplerEnv-OR 基准如何注入观测扰动?

在渲染图像上直接叠加扰动(不改仿真器),空间维分 Global/Local/Discrete 三种,时间维分 Constant(1:0)、Cyclic(1:1)、Sparse(1:3、1:5)四种频率,共 24 类扰动、120+ 等级、2300+ 试验。

帧数是不是越多越好?

不是。7B 模型最优 7 帧、0.5B 模型最优 4 帧,帧数过多反而掉点;但推理速度不随帧数下降(恒 8.7 Hz),因为历史特征被缓存复用。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐