Xiaomi-Robotics-1:利用超过 10 万小时的真实世界轨迹数据扩展VLA模型
26年6月来自小米机器人的论文“Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories”。
Xiaomi-Robotics-1,是一款基础VLA模型,具备以下能力:(1) 能够遵循多样化的语言指令,在未见过的环境中“开箱即用”地执行广泛的移动操作任务;(2) 仅需极少量的微调数据,即可高效适应新下游任务。其提出一种包含预训练和后训练两个阶段的训练方案。在预训练阶段,利用通过 UMI 设备在海量环境和任务中采集的超过 10 万小时真实世界操作轨迹数据进行训练,从而赋予模型广泛且具有泛化能力的动作生成能力。关键在于,开发一套可扩展的自动标注流程,利用描述场景状态转换的自然语言对轨迹片段进行标注,为动作学习提供丰富且精确的条件信息。在后训练阶段,目标是将这些能力与具体的机器人形态及人类常用的指令性任务提示(prompt)相对齐,从而有效地将对状态转换的描述性理解转化为可执行的任务提示。概览如下图1:
大量实验表明,该模型展现出强大的扩展特性(scaling behavior)。在预训练过程中,随着数据规模和模型参数量的增加,Xiaomi-Robotics-1 的性能持续提升。这种扩展特性也延续到了后训练阶段:预训练模型越强大,在未见环境中的真实机器人评估表现就越出色。此外,Xiaomi-Robotics-1 作为一个强大的机器人基础策略,能够以极高的数据效率针对复杂的灵巧操作任务进行微调。在多个仿真基准测试中,Xiaomi-Robotics-1 的表现均优于现有的最先进方法。
Xiaomi-Robotics-1 是一种端到端视觉-语言-动作(VLA)模型,基于异构数据源(包括 UMI 轨迹、跨具身机器人轨迹以及视觉-语言数据)进行大规模训练。给定观测值 o_t 和语言指令 l,模型 pi_theta 通过最大化训练数据集 D 上的对数似然来学习预测时间段 t:t+H 内的动作序列(action chunk):
max_θ E(o_t, l, a_t:t+H) ∼ D logπ_θ(a_t:t+H | o_t, l)
采用包含预训练(pre-training)和后训练(post-training)两个阶段的训练策略。预训练阶段利用具有丰富开放世界多样性的可扩展非机器人数据集,赋予模型广泛且具有泛化能力的动作生成表征。随后,后训练阶段利用高质量的跨具身数据集,将这些表征与机器人具身形态及指令条件下的动作生成进行对齐。
1 模型
如图 2 所示,Xiaomi-Robotics-1 采用 Mixture-of-Transformers (MoT) [44] 架构,由预训练的视觉-语言模型 (VLM)(即 Qwen3-VL [3])和扩散 Transformer (DiT) [57] 组成。DiT 的层数与 VLM 保持一致,但采用了较小的隐层维度(hidden size)以实现更快的推理速度。Xiaomi-Robotics-1 不同规模变体的模型参数详见表 1。

VLM 接收当前的观测值 o_t 和语言指令 l 作为输入。DiT 在机器人本体感知状态 s_t 和 VLM 产生的 KV 缓存(KV cache)的条件下,通过流匹配(flow-matching)[49] 生成动作序列。
参考 [4],从 Beta 分布中采样时间步 tau,在训练过程中赋予噪声较大的时间步更高的权重。类似于 [8],利用自适应归一化层(adaLN)[57] 将流匹配的时间步条件注入 DiT,以进行动作生成。在推理阶段,利用随机噪声 aτ=0_t:t+H ∼ N(0,I) 初始化预测的动作片段。随后,通过 5 步欧拉积分(Euler integration)恢复出清晰的动作片段:a^τ + ∆τ^_t:t+H = aτ_t:t+H + ∆τ·v_θ(o_t, l, s_t, aτ_t:t+H,τ), 其中步长设定为 Delta tau=0.2。
为了加速收敛 [58],在 VLM 中引入辅助性的动作生成监督机制。具体而言,利用“选择策略”(Choice Policies)[59] 来实现 VLM 框架 [8] 内的直接动作生成。用多层感知机(MLP)将机器人状态编码为 token,并将其与动作及评分查询 token 一起附加到视觉-语言 token 序列的末尾。对应于动作和评分查询 token 的输出分别用于预测 K 个候选动作片段及其相应的 K 个评分。采用 [59] 中的“赢家通吃”(winner-takes-all)范式,即仅将 L1 损失最小的候选结果纳入动作损失的计算中。
具体而言,K个预测动作片段与真实动作片段之间的L1距离被用作评分预测的目标标签。
直接对VLM施加动作生成监督,可引导其表征向更有利于动作生成的特征靠拢,从而提升DiT的学习效率。然而,实验观察表明,若允许DiT的Token关注这些与动作相关的Token的KV缓存,反而会导致性能下降。推测这是因为出现一种“捷径”效应:DiT仅仅是简单复制VLM生成的动作,而未能将其自身的生成过程有效地建立在视觉与文本上下文的基础之上。为缓解这一问题,在DiT的注意力计算中排除这些与动作相关的Token,强制DiT的Token仅关注语言指令与视觉观测的表征。
2 训练与数据
预训练
在预训练阶段,主要目标是赋予模型广泛且具有泛化能力的表征,使其能够迁移应用于各种操作场景。为此,构建一个包含超过 10 万小时真实世界操作轨迹的数据集,这些轨迹通过通用操作接口(UMI)手持式夹爪 [17] 和第一人称视角(egocentric)摄像机采集(见图 3所示)。该数据集涵盖了多种任务,采集环境广泛,包括家庭、商业场所、工业现场、办公室及户外空间。传统的机器人轨迹标注需要根据任务语义手动分割轨迹,并为每个片段标注语言指令——这一过程极其耗时耗力,在大规模数据下难以实施。
为了实现语言标注的规模化,开发一套自动标注流水线:首先将每条轨迹划分为等长片段,随后利用 Qwen3.5-27B [70] 模型,针对每个片段内夹爪及场景中交互对象的状态变化生成描述。为加速标注过程,设计一种生产者-消费者流水线,将片段切分与描述生成(captioning)解耦:CPU 工作线程负责将片段切分并存入内存文件系统,同时客户端线程维持数百个并发的描述生成请求。这种高效的流水线能够在约两周内完成全部 10 万多小时数据的标注工作。在这一数据集上训练后,模型学会生成相应的动作,从而驱动场景从当前观测状态转换至语言标注所描述的目标状态。
模型通过联合最小化 DiT 的流匹配损失(flow-matching loss)L_{Flow}$和视觉语言模型(VLM)动作选择策略的回归损失(regression loss)L_{Regression} 来优化动作预测。为了保留预训练 VLM 的视觉语言能力,还在其之前工作 [8] 中构建的高质量视觉语言数据集上,利用“下一toke预测”(next-token prediction)目标 L_{NTP} 对模型进行联合训练。整体训练目标函数定义如下:
L = L_{Flow} + L_{Regression} + lambda L_{NTP}
其中,在实验中 lambda 设定为 0.1。视觉-语言数据与 UMI 轨迹按 1:9 的比例进行采样。为了最大化训练吞吐量,将一个批次(batch)内的所有视觉-语言 token 拼接成单个序列,以便进行 VLM 的前向传播。由于 VLM 的计算开销高于 DiT,通过对每个样本采样四个流匹配(flow-matching)时间步来分摊这一成本。由此产生的四个 DiT 输入同样会被拼接并在一次 DiT 传播中进行处理,同时以相应的解包(unpacked)VLM KV 缓存作为条件输入。
后训练阶段(Post-training)
后训练阶段的目标有两方面。首先,将 UMI 夹爪在预训练阶段习得的动作生成能力迁移到具体的机器人载体上。其次,将语言条件(language conditioning)从预训练时使用的状态转换描述,转变为人类在指示机器人执行任务时通常使用的祈使指令。
利用 UMI 设备、固定式机械臂和移动操作机器人采集的跨载体操作轨迹,构建了训练后阶段的数据集。具体而言,在各种家居环境和任务场景中,利用移动操作机器人和双臂机器人采集了超过 7,200 小时的机器人数据(图 4所示)。用 Qwen3.5 [70] 为人类分割的视频片段标注语言指令。此外,还纳入超过 1,000 小时的人工标注 UMI 数据,这些数据同时包含时间片段和语言指令标注。与预训练阶段使用的状态转换描述不同,这些语言指令高度贴合人类指示机器人执行任务的方式,直接契合在后训练阶段的对齐目标。最后,纳入开源机器人数据集,包括 Bridge V2 [74]、RT-1 [6] 和 DROID [28]。剔除轨迹中的静止或无动作片段,以防止模型学习到无信息量或带有噪声的信号。总体而言,后训练数据集包含约 10,000 小时的轨迹数据。
对于机械臂动作,采用相对于当前状态的末端执行器(EE)位姿增量(delta)。为统一不同具身(embodiments)下的机械臂动作空间,在预训练和后训练数据集中,将所有机器人数据及 UMI 数据的末端执行器坐标系朝向进行了统一。因此,无论底层硬件平台如何,相似的机械臂动作(例如相对于末端执行器坐标系的前后移动)都会产生一致的动作数值。对于移动机器人数据,分别使用底盘速度和腰部位置的相对增量来表示底盘动作与腰部动作。为了适应异构的物理形态,对所有轨迹数据采用统一的动作向量表示。
尽管不同机器人的机械臂动作保持一致,但它们的动作空间维度仍然存在差异。在损失计算过程中,屏蔽缺失动作分量对应的维度。
用与预训练相同的目标函数训练模型。视觉语言数据、开源机器人数据、带指令标注的 UMI 数据以及自主开发的机器人数据按 0.5:0.5:0.5:8.5 的比例进行采样。经过后训练后,该模型能够根据语言指令在未见过的环境中执行各种任务,无需额外设置。此外,它还能以极少的数据高效地适应新的下游任务。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)