达摩院 ICRA'26|从“预测世界”到生成动作:RynnVLA-001基座模型用人类操作视频突破机器人数据瓶颈
作者|黄思腾,阿里巴巴达摩院算法专家
摘要
Vision-Language-Action (VLA) 模型被视为通向通用机器人智能的必经之路,因为它首次将“看见环境、理解指令、生成动作”统一到同一框架中,使机器人有望像大模型理解世界一样理解任务,并在开放环境中完成更灵活的泛化与交互。相比传统为单一任务、单一场景定制的控制范式,VLA展现出跨任务迁移、自然语言驱动操作以及持续扩展能力,因此被认为是迈向通用具身智能的关键技术路径。然而,制约其发展的“大山”始终是高质量机器人数据的匮乏。相比于互联网海量的图文数据,机器人轨迹数据的采集成本高、规模小,难以支撑起真正强大的通用模型。
为此,达摩院具身智能实验室提出了RynnVLA-001,这是一个基于大规模人类演示视频生成预训练的VLA基座模型。通过创新的两阶段预训练方法,模型首先在 1200 万段人类第一视角操作视频中学习视觉演化,随后通过轨迹感知建模桥接视觉与动作。通过让机器人学会“先看懂世界,再学会动作”,RynnVLA-001在相同的下游机器人数据集上微调后,显著超越了GR00T N1.5和Pi0等先进开源基座模型。这一工作证明了:人类视频数据是解决具身智能数据荒、提升机器人操作能力的“富矿”。

论文链接:https://arxiv.org/abs/2509.15212
开源代码:https://github.com/alibaba-damo-academy/RynnVLA-001

研究动机:克服机器人数据的“规模瓶颈”
在大语言模型(LLM)时代,Scaling Law已经证明了海量数据对智能涌现的重要性。相比之下,机器人领域VLA模型的发展正面临严重的数据稀缺困境:
-
采集成本高昂:机器人轨迹数据通常依赖人类对物理机器人进行遥操作(Teleoperation)来记录,不仅需要昂贵的硬件平台、维护与场地支持,还往往伴随着频繁的人工干预、设备磨损和较低的数据采集效率。尤其对于长时程、复杂接触类任务,一条高质量轨迹的获取往往需要反复调试与多次失败尝试,导致数据成本远高于互联网图文数据。
-
规模难以扩展:现有机器人数据集无论在任务种类、场景覆盖还是轨迹数量上,都远小于LLM的训练语料;同时,不同机器人平台之间在结构、传感器和控制接口上的差异,也使得数据难以直接复用和统一扩展。
我们的核心观察是:虽然机器人操作视频稀缺,但互联网上存在海量的人类第一视角(Ego-centric)操作视频。这些第一视角操作视频(如做饭、清洁、组装等日常活动)与机器人的拾取操作具有很强的相似性——都涉及手部对物体的拓取、移动、放置等操作。如果能让模型像人类一样,通过观察别人的动作(Human Demonstrations)来学习“如何操作物体”,就能极大地缓解数据瓶颈。而这个学习过程可以通过大规模视频生成预训练来实现,从而将人类操作中的物理动态先验迁移到机器人控制中。

技术解析:两阶段预训练的“降维打击”
为了挖掘人类视频中的潜在价值,RynnVLA-001采用了创新的渐进式三阶段训练策略,包括两阶段预训练流程和一阶段微调,来跨越视觉理解与底层动作执行之间的鸿沟,将人类视频中的操作先验逐步迁移到机器人控制中。

(一)第一阶段:第一视角视频生成预训练(Ego-Centric Video Generative Pretraining)
这一阶段的目标是训练一个图像到视频(Image-to-Video, I2V)模型,使其能够根据一张初始图像和语言指令来预测后续视频帧。这与VLA模型的推理过程非常相似——VLA模型同样是根据当前观察和语言指令来预测动作。通过让模型在视觉层面学习物理交互常识(如:手如何靠近物体、物体在受力后如何形变、遮挡关系等),这种“视觉预见力”为后续VLA的动作学习奠定了坚实基础。
在网络架构上,该阶段采用自回归(Autoregressive)Transformer。为了确保学到的先验知识与机器人操作直接相关,我们设计了一套精密的多阶段数据筛选管线,从Ego4D、HowTo100M、EPIC-KITCHENS、Something-Something等公开数据源中筛选出高质量的操作视频。该管线包含三个关键步骤:
-
关键点检测:使用姿态估计模型提取每一帧中的人体关键点,包括面部地标、躯干关节和手部关键点。
-
第一视角筛选:通过两个标准进行筛选——排除包含面部关键点的视频(说明是第三人称视角),保留手腕和手部关键点可见的视频(说明是第一视角操作)。
-
文本描述标注:使用Qwen2-VL-7B为每条视频生成简洁的文本描述,模仿机器人学习中常用的自然语言指令风格。
我们使用该管线筛选了1200万条第一视角人类操作视频作为训练数据,这些视频专注于第一人称视角的手部操作,与机器人夹爪的运动方式极为相似。此外,还筛选了24.4万条机器人操作视频作为补充。
一个关键的设计是:语言token与视觉token交织输入(interleaved),而非仅在开头提供一次语言指令。这种设计能更好地与VLA推理时的处理流程对齐,因为每次动作预测都需要同时依赖视觉和语言信息。训练使用交叉熵损失函数来监督离散视觉token和语言token的预测。如下图所示,预训练的I2V模型能够根据输入图像和文本提示生成合理的动作序列帧,包括修剪树篱、混合面粉、系鞋带、收拾物品等多种操作场景,从而为后续训练提供一个足够有效的骨干网络。

(二)第二阶段:人体轨迹感知视频建模(Human-Centric Trajectory-Aware Video Modeling)
第一阶段的I2V模型能够在视觉层面预测动态,但缺乏对动作的显式理解。第二阶段的核心思想是:在继续预测未来视频帧的同时,让模型同时预测人体关键点轨迹(尤其是手腕关键点)。人类手腕的运动轨迹可以被看作一种“动作”的表征,从而架起了视觉预测与动作生成之间的桥梁。通过这种方式,人类视频中的“操作逻辑”被精准地提取并迁移到了模型中。
该阶段使用EgoDex数据集,该数据集通过Apple Vision Pro采集人体上半身关节轨迹。模型不是直接预测原始坐标,而是预测由ActionVAE生成的紧凑连续嵌入。同时引入了状态嵌入(state embeddings)来提供当前手腕位置的本体感知信息,并添加了一个轻量级的动作头(单层线性层)来生成连续的动作嵌入。
-
ActionVAE:动作表征学习
ActionVAE是RynnVLA-001的一个重要创新点。它是一个变分自编码器,将动作序列(action chunks)压缩为紧凑的连续潜在嵌入,解码器则能从这个嵌入中重建出原始动作序列。这种设计有两个关键优势:一是避免重复预测单步动作可能导致的“停滞”问题,二是通过一次前向传播生成多个动作,显著提升推理效率。我们通过实验发现,引入ActionVAE不仅减少了预测的负担,更让生成的动作更加自然、连贯,极大地降低了模型在实际执行时的震荡风险。
值得注意的是,由于人类手部轨迹和机器人臂运动的运动学空间不同,我们分别训练了两个领域特定的ActionVAE:一个用于压缩人体轨迹(第二阶段),另一个用于压缩机器人动作(第三阶段)。ActionVAE是“具身特定”的,一旦训练完成,可以直接用于提取同一具身上新数据的动作嵌入,无需重新训练。
(三)第三阶段:机器人VLA建模(Robot-Centric Vision-Language-Action Modeling)
在最后一个阶段,模型继承前两个阶段的预训练权重,在机器人数据上进行微调。输入包括语言指令、双视角视觉观察(前方视图和手腕视图)和当前机器人状态。由于人类手部轨迹与机器人臂运动学存在显著差异,第二阶段的动作头会被丢弃,取而代之初始化一个新的轻量级动作头。
训练的优化目标包含两部分:一是机器人动作预测(使用L1损失),二是未来视觉预测(使用交叉熵损失)。后者作为辅助任务,能够正则化训练过程并保持模型对世界动态的理解。在推理时,模型仅预测动作嵌入,跳过未来视觉帧生成,从而大幅提升推理速度。

实验验证
为了验证RynnVLA-001的实际效果,我们基于LeRobot SO100机械臂在多样化的机器人操作任务上进行了严格评测,并针对预训练权重、模型组件设计及传感器功能进行了深度的消融实验。
(一)与先进开源基座模型对比
我们选取了三个具有代表性的机器人操作任务:绿色方块搬运、草莓精准抓取以及笔筒插笔。实验设置了单目标、多目标以及带有干扰项(Distractors)的三种场景,以模拟真实的复杂作业环境。

下表展示了RynnVLA-001与两个强基线模型的性能对比。在三个任务上RynnVLA-001均取得了显著的性能优势:

RynnVLA-001的平均成功率达到90.6%,相比Pi0的70.4%提升了20.2个百分点,相比GR00T N1.5的55.6%提升了35个百分点。特别在“抓取钢笔放入笔架”这个需要精确3D空间推理的任务上,RynnVLA-001的成功率为90.0%,远超GR00T N1.5(48.3%)和Pi0(64.4%)。

值得关注的是,在带干扰物的指令跟随场景中,Pi0的成功率从单目标的80.0%降至60.0%,显示出其指令跟随能力的局限性。而RynnVLA-001在这一场景下保持了91.7%的高成功率,表现极为稳定。这表明模型不仅学会了抓取,更理解了指令背后的语义逻辑,能够从杂乱环境中精准锁定目标。综合来看,RynnVLA-001凭借其强大的多模态对齐能力,在复杂、动态的环境下展现出了极高的稳定性和指令遵循精度,刷新了同类任务的性能基准。
(二)预训练有效性分析
我们通过四组对比实验探讨了预训练阶段对最终性能的影响:从零开始训练(Scratch)、仅加载图像预训练权重(Chameleon)、仅进行视频预训练(Video)以及我们的全流程预训练(Full)。

这组实验清晰地展示了每个预训练阶段的贡献。从随机初始化的4.4%到T2I预训练的50.0%,再到视频预训练的84.4%,最终到完整版的90.6%,每个阶段都带来了显著提升。特别是视频预训练阶段带来的跳跃式提升(50.0% → 84.4%),证明了从第一视角视频中学到的先验知识对VLA建模极为有效。综合来看,大规模人类视频预训练为机器人提供了宝贵的物理先验,而“轨迹感知”则是跨越视觉观察与实际控制鸿沟的关键技术手段。
(三)模型设计消融实验

在Calvin基准上,我们进一步对关键设计选择进行了消融实验,主要发现包括:
-
图像分辨率:从384×384降低到256×256会导致明显的性能下降,这是因为VQGAN组件是在512×512上预训练的,较低分辨率会导致重建质量下降。384×384在保持高重建保真度的同时,大幅减少了计算开销。
-
动作表征:使用VAE潜在空间预测动作优于直接预测原始动作序列,平均任务完成长度从4.019提升到4.161,验证了ActionVAE的有效性。
-
动作头深度:单层线性层的动作头优于五层MLP,后者反而导致性能下降(平均任务长度从4.019降至3.323)。这说明Transformer的输出表征已经足够有效,过深的解码头反而会引入噪声或过拟合。

应用场景
RynnVLA-001的成功证明了利用大规模人类视频进行生成式预训练是解决具身智能数据难题的有效路径。通过利用大规模人类视频数据将“视觉生成”与“动作轨迹”深度耦合,我们不仅缓解了机器人数据稀缺的问题,更为VLA模型注入了对物理世界交互过程的深层理解。未来,我们将探索将生成式预训练范式扩展至更多样化的具身任务中,并进一步探索更长时序的操作任务以及跨形态的动作迁移,让具身智能真正从实验室走向千家万户。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)