astribot pdf 【翻译】
通过类人全身操作迈向人类水平智能
Astribot 团队
research@astribot.com
arXiv:2507.17141v1 [cs.RO] 2025 年 7 月 23 日
摘要
构建通用智能机器人一直是机器人学的一项根本目标。一条有前景的路径是镜像人类的进化轨迹:通过与环境的持续交互进行学习,并通过模仿人类行为获得早期进展。实现这一目标面临三大核心挑战:(1)设计具备人类水平物理能力、安全可靠的机器人硬件;(2)开发直观、可扩展、用于数据采集的全身遥操作界面;(3)创建能够从人类示教中学习全身视觉-运动策略的算法。为在统一框架内应对这些挑战,我们提出 Astribot Suite,一套面向多样化环境中通用日常任务的、用于全身操作的机器人学习套件。我们在大量需要全身协调、广阔可达性、人类水平灵巧性与敏捷性的活动上展示了系统的有效性。我们的结果表明,Astribot 在 embodiment、遥操作界面与学习管线三方面的紧密结合,标志着向现实世界通用全身机器人操作迈出的重要一步,为下一代智能机器人奠定了基础。
图 1:Astribot Suite 通过全身协调支持各种日常活动,展示了广阔可达性、类人灵巧性与敏捷性。所示为 DuoCore-WB 策略的 rollout 轨迹(每项任务一条),策略使用简单而有效的模仿学习算法,在我们的全身遥操作界面采集的示教上训练。活动包括:
(a) 递送饮料:机器人用一只臂抓起饮料,导航至门边,用另一只臂开门,进入房间,将饮料放到桌上。
(b) 存放猫粮:机器人用双臂抬起约 2kg 的猫粮袋,放入柜中,然后关上柜门。
© 扔垃圾:机器人导航至垃圾桶,按下按钮打开桶盖,将用过的纸杯丢弃,然后盖上桶盖。
(d) 整理鞋子:在人将一双鞋随机放在地毯上后,机器人靠近,用双手抓起鞋子,导航到鞋架,将鞋整齐摆放。
(e) 扔玩具:机器人从地板上拾起玩具并扔向远处。
(f) 捡玩具:机器人用双臂收集散落地面的玩具并放入收纳箱。
1. 引言
开发能够栖息于人类环境、像我们一样感知世界、理解自身行为后果、与周围安全交互,并最终与人类共处以辅助日常生活的智能机器人,长期以来一直是植根于科幻小说中未能实现的愿景(Gupta et al., 2021; Team et al., 2021)。我们主张,要实现这种类人能力——乃至机器人的类人水平智能——必须从与物理世界多样而精细的交互中学习。一个切实高效的起点是模仿人类行为,并强调类人能力:具备广阔可达性、灵巧性与敏捷性的全身协调。
要在日常场景中实现自主的全身操作,有三个根本性挑战。首先,需要精心设计的机器人硬件,既能在人类环境中安全部署,又能展现出人类水平的物理能力与表现力。其次,直观且可扩展的数据采集界面至关重要,使非专家用户也能自然高效地执行各种日常任务。第三,需要能够捕捉全身控制复杂性的学习模型,并具备向开放世界环境和活动扩展与泛化的潜力。
为此,我们通过引入一个用于学习现实世界全身操作任务的统一框架来解决上述挑战,如图 1 所示。我们的框架由三个核心组件构成:首先,我们开发了一个高性能的机器人平台——一台具有灵活躯干和移动底座的双臂操作器,旨在优雅有效地模拟人类行为。其次,我们引入一个全身遥操作界面,优先考虑通用性、高易用性和低延迟,使日常非专家用户能够进行可扩展的数据采集。最后,我们提出全身视觉-运动策略(DuoCore-WB)——一个简单而有效的学习算法,使用 RGB 观测和精心设计的动作表示来建模协调的全身动作。
我们的机器人平台是一台高性能、稳健、安全的移动操作器,面向通用任务设计。它采用创新的绳索驱动设计(Qian et al., 2018),紧密模拟人类肌肉组织,实现柔顺运动和精细施力。相比传统刚性连杆机器人,我们的设计具有更优的负载能力、更小的回差和惯量、更佳的紧凑性与更高的操作安全性。其轻量化结构、低摩擦传动和柔软缓冲特性,使其具备高分辨率力控制能力,这对于需要精确力反馈的 AI 驱动操作任务至关重要(Dai and Wang, 2025)。通过刚柔混合体动力学建模,实现了极低的控制延迟和高精度轨迹跟踪。此外,传动机构和制造工艺经过精心优化,以最大限度减少表面磨损并确保长期的机械耐久性,满足现实世界使用寿命需求。
在全身遥操作方面,我们引入一个直观且具有成本效益的系统,使用 VR 头显和手持摇杆。摇杆捕获的手部位姿被映射到机器人末端执行器的位置和姿态,随后通过全身控制转换为关节命令。系统支持两种控制模式:(1)第一人称视角模式,针对精确复杂操作任务和远程遥操作进行了优化;(2)第三人称视角模式,专为传输延迟最小的大范围全身运动设计,非常适合高动态任务或近场数据采集。
通过在多样化任务中高效采集数据,我们引入 DuoCore-WB——一种简单而有效的模仿学习算法,用于建模全身动作。我们着重强调三项核心设计选择,而非架构本身的复杂性:(1)基于 RGB 的视觉感知,使得能够使用预训练视觉编码器(Dosovitskiy et al., 2020; Oquab et al., 2023; Radford et al., 2021; Zhai et al., 2023)实现视觉泛化,并通过与大尺度 VLA 训练(Bjorck et al., 2025; Black et al., 2024; Driess et al., 2023; Intelligence et al., 2025; Kim et al., 2024; Liu et al., 2024; Team et al., 2025; Zitkovich et al., 2023)兼容来实现可扩展性;(2)在末端执行器(EE)空间进行全身策略控制,使用 SO(3) 作为姿态表示(Geist et al., 2024),以每个末端执行器自我中心坐标系中的增量(deltas)表达。在末端执行器空间学习有效缓解了误差累积——这一问题在学习全身策略时尤为突出——相比直接在关节空间学习。此外,以自我中心坐标系为参考表示动作,强调了视觉观测与动作目标之间的对齐,同时对于复杂、协调的全身活动中常见的大视角变化更具鲁棒性;(3)实时轨迹生成模块(RTG),利用二次规划(QP)优化将预测的动作块(action chunks)细化为平滑、精确、连续的执行。该模块作为后处理组件,具有鲁棒、实时、对生成动作块的上游策略无关的特点。
我们在图 1 所示的六项代表性现实世界全身任务上评估 Astribot Suite。每个 DuoCore-WB 策略都通过遥操作界面采集的数据进行训练,每项任务一个策略。递送饮料考察执行长时程任务、移动操作以及与铰接物体(门把手)灵巧交互的能力。存放猫粮评估受限空间(如低位柜子)内的协调双臂操作,以及处理高负载(约 2kg)时的动态稳定性。扔垃圾测试跨多阶段任务的双臂协调和对铰接部件(垃圾桶盖)的精细操作。整理鞋子关注低矮空间内的全身协调与同步双臂操作能力。扔玩具展示高动态运动与从地面精确抓取物体的能力。捡玩具全面评估通过协调的双臂交互连续准确操作多个物体的能力。学习得到的 DuoCore-WB 策略表现强劲,平均成功率达 80%,峰值成功率达 100%。我们认为,Astribot Suite 集成的机器人 embodiment、遥操作界面和学习框架,代表着向使现实世界能够执行日常任务的方向迈出的重要一步。
2. 硬件系统
本节详细介绍 Astribot Suite 的硬件组件。我们首先介绍图 2 所示的移动双臂操作器设计,它配备两个 7 自由度臂、一个灵活的 4 自由度躯干、一个 2 自由度头部以及一个 3 自由度全向移动底座——针对需要高机动性和广泛末端执行器可达性的日常任务进行了优化。然后我们介绍一个具成本效益的全身遥操作界面,可在广泛的现实操作场景下实现直观、高效的数据采集。
图 2:Astribot S1 —— Astribot Suite 的机器人平台。Astribot S1 配备两个 7 自由度臂,每个臂配备一个平行夹爪,以及一个 4 自由度铰接躯干、2 自由度头部和 3 自由度全向移动底座。(a) 展示系统的自由度,(b) 和 © 分别描绘机器人的工作空间范围和相机视场(FoV)分布。
表 1:Astribot S1 机器人与普通成年男性操作参数对比
| 参数 | Astribot S1 | 普通成年男性 |
|---|---|---|
| 单臂自由度 | 7 | 7 |
| 单臂负载(水平伸展) | 5kg | 3–5kg |
| 臂末端最大速度 | ≥ 10 m/s | 5–10 m/s(挥臂) |
| 臂末端最大加速度 | 100 m/s² | 50–100 m/s²(挥臂) |
| 臂末端定位重复精度 | ±0.1 mm | ±1–5 mm(训练后可达 ±0.5 mm) |
| 臂末端绝对定位精度重复性 | ±1 mm | ±1–5 mm(训练后可达 ±0.5 mm) |
| 身高 | 170 cm | 173 cm |
| 总重量(含电池) | 90 kg | 70 kg |
| 全臂展(含夹爪) | 194 cm | 171–175 cm |
Astribot S1 在所有指标上展现出人类水平或超人类的能力。
2.1 机器人平台
如图 2 所示,Astribot S1 机器人配备两个 7 自由度臂,安装在高度铰接的 4 自由度躯干上。每个臂配备一个平行夹爪,可处理高达 5kg 的负载,能够操作各种日常物体。夹爪的开合时间最快可达 0.15 秒,使数据采集能够涵盖扔掷等敏捷的类人行为。4 自由度躯干支持腰部转动、髋部屈曲及类似膝盖的铰接,使机器人能够在站姿与蹲姿之间平滑切换,这显著增强了垂直机动性并扩展了有效工作空间。2 自由度头部支持动态注视控制和与任务相关的视觉聚焦,镜像人类在大型或杂乱环境中的感知行为。S1 机器人实现了从地面到 2 米的有效垂直触及范围,以及高达 1.94 米(含夹爪)的水平触及范围。S1 机器人被设计为在以人为中心的环境中有效运行并支持多样化任务,如 表 1 所示,以普通成年男性为基准,它在关键性能指标上超越了人类水平。
在感知方面,S1 机器人配备多种车载传感器,以实现稳健的场景理解与操作。传感器的 FoV 如图 2© 所示。头部集成一个立体 RGB 相机和一个 RGB-D Orbbec Femto Bolt,从高位视角提供高分辨率视觉输入。两台 Intel RealSense D401 RGB-D 相机安装在腕部,以提供精细操作时的近距离观测。胸部还配备一台 Orbbec Gemini 335 RGB-D 相机用于中距离感知,底盘上配备 Livox MID-360 激光雷达用于 360 度空间感知与建图。所有 RGB-D 相机以 30Hz 运行。
为支持稳定敏捷的导航,机器人躯干安装在一个能够在地平面进行全向运动(holonomic)的移动底座上。底座支持最高 2 m/s 的线速度。底盘集成四个驱动模块,支持前后移动、横向平移和原地旋转,在受限环境中提供高机动性。
2.2 面向可扩展数据采集的低延迟遥操作
为支持对高自由度移动操作器的无缝控制并实现面向下游策略学习的可扩展数据采集,我们开发了一个优化的全身遥操作系统,设计时考虑了以下关键点:(1)直观、实时的全身控制,以无缝协调复杂运动;(2)稳健的安全机制,保护操作者和机器人;(3)高质量示教捕获,以实现有效的策略学习;(4)低成本实现,以增强可及性。
我们的遥操作系统采用 Meta Quest 3S VR 头显,将头显和手持摇杆的位姿映射到机器人末端执行器。全身控制(WBC)框架将这些输入转换为关节级命令,实现人类操作者与机器人之间的实时运动同步。系统支持两种互补的控制模式:
(1)第一人称视角模式:操作者佩戴 VR 头显,从机器人第一人称视角控制机器人。这种设置与人类自然的感知和操作习惯相符,使交互直观、降低学习门槛,特别适合服务机器人、人机协作等远程遥操作任务。该模式支持精细复杂的操作(如折叠衣服、整理小物件、精细抓取),提供高控制精度和沉浸式体验。
(2)第三人称视角模式:操作者将 VR 头显佩戴于胸前,站在机器人旁边,直接观察其全身状态进行控制。该设置特别适合大范围全身运动控制,尤其针对涉及高自由度、动态感强的演示与姿态调整。由于操作者可以不依赖图像传输而直接实时观察机器人行为,该模式有效消除了延迟带来的不确定性,提升安全性与响应性。因此,它非常适合执行高动态任务或进行近场数据采集。
两种控制模式可根据任务需求灵活切换,在远程精细操作与敏捷近场控制之间取得平衡。该系统广泛适用于服务机器人演示、人机协作以及各种场景下的大规模数据采集。
直观、实时的全身控制:如图 3 所示,我们重新配置 Meta Quest 3S 摇杆以支持直观的遥操作和示教记录。关键命令如下:
- 按住 grip 按钮激活动作跟随模式,使机器人跟踪全身人体运动。
- 扳机控制夹爪的开合。
- 左摇杆向移动底座下达命令。
- 右摇杆调节四肢的垂直位置。
这种配置使用户能够以直观、易用的方式同时控制全身运动和底座导航,支持高效、准确的遥操作。系统由一个优化的低延迟控制套件支撑:控制频率 100Hz,从遥操作命令到机器人动作的端到端响应延迟仅 20ms,确保流畅、响应迅速的遥操作。注意,第一人称视角模式下,图像传输延迟约 100ms。
安全:在为通用任务采集数据时,确保操作者和机器人的安全至关重要,尤其是在可能出现操作失误的情况下。系统集成两项安全特性:(1)机器人损坏防护:我们实现了一套倾覆防护机制,约束机器人全身质心,使其在各种配置和运动速度下都能安全运行,最大程度降低跌倒风险。此外,在遵循精细的自碰撞约束(包括机器人部件与夹爪之间的相互作用)的前提下,进行笛卡尔空间目标跟踪。这是通过与笛卡尔空间全身控制(WBC)控制器集成的物体邻近距离计算引擎实现的(Jin et al., 2024; Liu et al., 2023)。(2)冲击力缓解:我们的绳驱机器人设计由于具有被动柔顺性的机械结构本身就更安全。此外,利用基于模型的经典算法,基于精确的全身动力学和电机反馈信号估计作用在机器人和夹爪上的外力(Haddadin et al., 2017),无需额外力传感器。这些估计的外力结合高频扭矩限制,实现了全身和夹爪的主动柔顺控制,有效防止接触时的大冲击力。
高质量示教:遥操作界面的选择在下游策略学习(尤其是模仿学习)的性能中起着关键作用,在这种学习中能够一致地重放成功的示教轨迹至关重要。从经验上看,我们的遥操作系统在保持低动作跟踪误差的同时,实现了接近 100% 的重放成功率——这两项都是示教质量与策略可复现性的关键指标。如图 4 所示,我们可视化"捡玩具"任务(如图 1 所示)示教采集过程中,随机选取的 6 个关节的跟踪误差,该特定片段是用右臂拾起一个玩具。
低成本:遥操作界面设计极具成本效益,仅使用现成的 Meta Quest 3S 头显和摇杆。整个系统的总硬件成本不到 300 美元,使其具备可及性,可大规模部署。
图 4:高精度轨迹跟踪。通过遥操作界面记录的"捡玩具"任务的示教。图中显示 6 个随机选取关节的数据。蓝线表示命令关节位置,红线表示实际位置。点划绿线表示跟踪误差,始终保持在很小范围内,展示了高精度的轨迹跟踪。
3. 全身策略学习方法
本节介绍一种简单而有效的学习全身视觉-运动策略的方法。我们首先概述预备知识,然后介绍 DuoCore-WB——一种从示教数据中学习全身控制策略的算法。该方法强调简洁性与可扩展性,确保与大规模预训练的兼容性。DuoCore-WB 使用通过 Astribot Suite 遥操作界面采集的遥操作示教数据进行训练。模型架构概览如图 5 所示。
3.1 预备知识
用于策略学习的去噪扩散:扩散模型(Ho et al., 2020; Nichol and Dhariwal, 2021)通过向干净数据 x ∼ p(x) 添加噪声(前向过程)并学习逆转所加噪声(后向过程)来学习估计去噪得分 ∇_x log p_data(x)。将数据分布噪声化为各向同性高斯分布的过程在 𝒯 个时间步内完成,具有预定义的噪声调度 α_t ∈ (0,1) 与 ᾱ_t = ∏_{s=1}^t α_s:
zt=αˉt x+1−αˉt ϵ,ϵ∼N(0,I). z_t = \sqrt{\bar{\alpha}_t}\, x + \sqrt{1 - \bar{\alpha}_t}\, \boldsymbol{\epsilon}, \quad \boldsymbol{\epsilon} \sim \mathcal{N}(0, \mathbf{I}). zt=αˉtx+1−αˉtϵ,ϵ∼N(0,I).
在训练过程中,扩散模型 ε_φ(z_t | t) 通过以下损失学习估计噪声:
Lt=Ex,ϵ∼N(0,I)[∥ϵϕ(zt∣t)−ϵ∥2]. L_t = \mathbb{E}_{x, \boldsymbol{\epsilon}\sim\mathcal{N}(0,\mathbf{I})} \left[ \| \boldsymbol{\epsilon}_\phi(z_t | t) - \boldsymbol{\epsilon} \|^2 \right]. Lt=Ex,ϵ∼N(0,I)[∥ϵϕ(zt∣t)−ϵ∥2].
一旦训练完成,即可从带噪输入和相应的噪声预测中估计 x。最近,DDPM 被广泛用于建模策略 π_φ,以机器人观测 O_t 为条件,其中去噪网络 ε_φ(z_t | O_t, t) 通过行为克隆训练(Black et al., 2024; Chi et al., 2023; Jiang et al., 2025; Ze et al., 2024)。
3.2 全身视觉-运动策略
我们提出 DuoCore-WB,一种基于 Transformer 的模型(Vaswani et al., 2017),旨在学习面向通用操作任务的协调全身动作。如图 5 所示,DuoCore-WB 在末端执行器(EE)位姿空间而非高维关节位形空间对全身动作进行去噪,从而缓解误差累积。至关重要的是,模型在每个末端执行器的自我中心坐标系中学习增量位姿,这促进了视觉观测与动作目标之间的对齐,并增强了对全身活动中常见大视角变化的鲁棒性。策略仅使用 RGB 观测进行训练,确保与大规模 VLA(Bjorck et al., 2025; Black et al., 2024; Driess et al., 2023; Intelligence et al., 2025; Kim et al., 2024; Liu et al., 2024; Team et al., 2025; Zitkovich et al., 2023)模型预训练管线的无缝兼容。
图 5:用于模仿学习的 DuoCore-WB 模型架构。DuoCore-WB 在 embodiment 空间内对全身动作去噪,通过直接预测相对于 EE 坐标系的增量末端执行器位姿,促进有效的全身策略学习。
模型架构:我们从遥操作示教中采样图像-状态对以及相应的动作序列,以动作序列作为预测目标。观测图像来自头部、左手、右手相机,输入分辨率为 224×224×3。这些图像使用由 4 个阶段组成的 ResNet-Small 主干(每个阶段含 2 个残差块)进行编码。最终特征图分辨率为 7×7×512,然后用 1×1 卷积将通道维降至 384,再展平得到每张图像 49 个 patch token。为编码相机特定的空间信息,我们对每张图像的 token 添加一组可学习的位置嵌入,这些嵌入在同一张图像的所有 token 之间共享,以同时指示空间位置和相机来源。同时,机器人状态——包括底座运动、躯干配置、双臂末端执行器位姿以及头部姿态——被编码为状态向量,通过一个线性层投影到 384 维状态 token,并添加一个专门的可学习位置嵌入以表示该 token 的模态。来自三个相机视角的 patch token(3×49 个)与状态 token 拼接,形成 148 个 token 的序列,送入 Transformer 编码器以提取条件特征。然后我们应用条件扩散模型对动作序列去噪。带噪动作序列首先通过全连接层映射到嵌入空间,形成一组 query token 序列,每个都带有固定的时间步位置嵌入。解码器是带交叉注意力的 Transformer,query token 对编码的条件 token 进行注意。解码器输出通过线性层投影回原始动作空间,得到去噪后的动作序列,由训练目标监督。动作序列包括底座控制命令、躯干运动、双臂末端执行器轨迹以及头部控制信号。
实时轨迹生成模块(RTG):当代策略模型通常根据当前观测生成一串未来动作序列,每串称为一个动作块(action chunk)。虽然这些动作块带有时间索引,但其动态执行常引入若干挑战:(1)块内抖动:同一块内连续动作之间的不一致;(2)块间不连续:不同动作块之间的突变导致轨迹不连续,这在观测随时间显著变化的全身操作中更为突出。动作流中的突变不仅会降低执行稳定性,还可能对硬件完整性构成风险。
我们提出的方法是一个轻量级后处理模块,只要满足以下条件便可与任何视觉-运动学习算法无缝集成:(1)策略模型在每个推理周期生成一个动作块,块内每个动作都带有与训练数据时间分辨率对齐的时间戳;(2)推理时间短于单个动作块的执行时长——最好不超过其一半——以确保有足够的重叠用于平滑的轨迹过渡。
当生成新的动作块时,与之关联的观测时间戳被设为 t = 0。我们将块的总时长记为 t_e,推理延迟记为 t_1,轨迹生成模块的处理时间记为 t_2。新生成的动作块表示为 A_new[0 : t_e],当前正在执行的轨迹记为 A_old。当新动作块可用时,自观测时间戳 t = 0 起已经过了 t_1 + t_2 的时长。系统随后按如下方式处理:(1)丢弃过时部分 A_new[0 : t_1 + t_2];(2)继续执行 A_old[0 : t_1 + t_2];(3)从 t = t_1 + t_2 起在 A_new[t_1 + t_2 : t_e] 与 A_old[t_1 + t_2 : t_f] 之间进行平滑混合,其中 t_f 是预定义的混合窗口(通常由块时长和推理延迟决定),且 t_f ≤ A_old 的最后时间戳。
混合过程利用二次规划(QP)优化生成平滑且动力学可行的轨迹,全面解决连续性、过渡质量和物理约束。该公式的关键组件包括:
- 平滑项(S_1):最小化轨迹加速度以确保运动平滑,促进自然过渡、减小机械应力。
- 偏离旧轨迹(S_2):使用随时间衰减的权重 W_1(t) 惩罚与当前执行轨迹 A_old 的偏离,该权重随混合进展指数衰减以减小其影响。
- 偏离新动作块(S_3):使用权重 W_2(t) = 1 − W_1(t) 鼓励与新生成的动作块 A_new 对齐,该权重随时间增长,以平稳地将控制权交给新的策略输出。
- 速度约束(C_1):强制关节速度限制,确保生成的轨迹符合硬件安全和性能规范。
这种基于 QP 的方法支持实时轨迹精修,确保动作块之间的过渡准确、稳定、安全。对于初始动作块——没有可供混合的先前轨迹——使用以下组件通过对块本身进行优化生成轨迹:平滑项(S_1)、使用固定权重 W_1(t) = 1 的偏离损失(S_3)以及速度约束 C_1。最后,优化后的离散轨迹使用样条插值以确保运动平滑,并以与推理异步的方式执行,实现连续、稳定的控制。
RTG 在兼容性、全面性和鲁棒性方面具有显著优势。作为一种与模型无关的后处理方法,它可以与任何已训练策略无缝集成。它同时有效缓解块间不连续和块内抖动,并显式考虑关节速度限制等硬件约束。RTG 仅需带时间戳的动作块作为输入,不依赖对策略推理时间或频率的精确估计,因此对通信延迟和推理延迟具有内在的鲁棒性。
训练与部署细节:DuoCore-WB 训练目标为从带噪全身动作中预测所加噪声,损失为 L = MSE(ε_t, ε_θ(·|t)),其中 ε_t 为真实添加噪声,ε_θ 为预测噪声。部署时,推理在配备 NVIDIA RTX 4090 GPU 的工作站上进行,有效延迟 0.05s。策略推理以 20Hz 运行,推理结果以相同频率同步送入 RTG。然后 RTG 以 250Hz 向控制器下发动作命令。因此,每 0.05s 生成新的策略动作序列并更新 RTG 状态,而控制器命令每 0.004s 刷新一次。
表 2:任务成功率。对每项任务,我们执行 15–30 次评估,首次子任务失败时即终止该 episode。我们同时报告每个子任务的成功率和端到端整体任务成功率。“SR” 表示成功率。带 Ó 标记的子任务表示移动操作。
| 任务名 | # 示教 | 整体 SR | 子任务 | 子任务 SR |
|---|---|---|---|---|
| 递送饮料(deliver a drink) | 110 | 13/15 | 开门 Ó / 进入房间并放饮料到桌上 | 14/15 / 13/14 |
| 存放猫粮(store cat food) | 50 | 19/20 | 拾起猫粮放入柜中 / 关柜门 | 19/20 / 19/19 |
| 扔垃圾(throw away trash) | 100 | 13/30 | 按压打开垃圾桶盖 Ó / 把纸杯扔进桶里 / 关垃圾桶盖 | 15/30 / 15/15 / 13/15 |
| 整理鞋子(organize shoes) | 200 | 16/20 | 双手拾起鞋子 / 把鞋子放到鞋架 Ó | 17/20 / 16/17 |
| 扔玩具(throw a toy) | 74 | 20/20 | 从地上拾起玩具 / 把玩具扔远(>2m) | 20/20 / 20/20 |
| 捡玩具(pick up toys) | 200 | 19/20; 16/20 | 右手拾玩具 / 左手拾玩具 / 把玩具从左手递到右手 | 19/20 / 19/20 / 16/19 |
图 6:遥操作任务。我们在两项代表性任务上评估遥操作效率。第一项是在桌面上整理 9 件物品,要求广阔的可达性。第二项是将 4 件物品分类放入两个不同高度的抽屉,需要对开合低位抽屉进行精细操作。
表 3:任务完成时间对比。对比人类完成任务所需时间与专家、非专家使用我们遥操作界面完成两项代表性任务所需时间。所有完成时间单位为秒。
| 任务 | 人类 | 专家遥操作 | 非专家遥操作 |
|---|---|---|---|
| 桌面拾放 9 件物品 | 8.42 | 10.8 | 15.93 |
| 将 4 件物品分类放入 2 个抽屉 | 7.12 | 10.07 | 16.82 |
4. 实验
4.1 实验设置
我们在图 1 所示的六项代表性任务上评估 Astribot Suite:(1)递送饮料评估执行涉及移动操作和与铰接物体(如门把手)灵巧交互的长时程任务的能力。(2)存放猫粮测试在受限空间(如低位柜子)内的精细操作、空间约束下的协调双臂动作,以及处理重载(约 2kg)时的动态稳定性。(3)扔垃圾挑战多阶段双臂协调和对铰接部件(如垃圾桶盖)的精细操作。(4)整理鞋子强调低矮空间下的全身协调和同步双臂操作。(5)扔玩具突出机器人执行动态全身运动和从地面准确抓取小物体的能力。(6)捡玩具作为通过协调双臂控制持续、准确操作多物体的综合基准。这些长时程、多阶段任务可分解为一系列子任务。对每项任务,我们进行 15–30 次评估试验,首次子任务失败时即终止该 episode。我们同时报告每个子任务的成功率和端到端整体任务成功率。
4.2 Astribot Suite 遥操作界面直观高效,适用于策略学习
我们从效率和所采集示教对下游策略学习的质量两方面评估 Astribot Suite 的遥操作系统。具体而言,我们比较人类完成任务所需时间与专家、非专家使用 Astribot Suite 遥操作界面完成图 6 所示两项代表性任务所需时间。如 表 3 所示,对于简单的桌面任务,专家相比直接人类操作平均产生 28.27% 的开销,非专家则额外产生 60.93% 的开销。对于更复杂的全身任务——打开两个抽屉,将四件物品分类放入其中,然后关上抽屉——专家的开销增加到 41.43%,非专家则额外产生 94.80% 的开销。这些结果表明,即使在具有挑战性的全身操作场景下,遥操作界面也能实现高效、直观的操作。直观的遥操作界面使用户能够生成平滑、高度准确的机器人动作。跟踪误差非常低,如以右臂从地面"捡玩具"任务为例(图 4),图中显示 6 个随机选取关节的数据。低跟踪误差凸显了所采集示教的高保真度。此外,遥操作界面持续提供高质量数据,在各种任务中重放成功率接近 100%。
4.3 DuoCore-WB 是面向全身活动简单而有效的学习方法
我们在 表 2 中报告六项代表性任务的成功率,包括每个子任务的成功率和端到端整体任务成功率。带 Ó 标记的子任务表示移动操作,策略必须同时成功推断导航和操作命令。如表 2 所示,DuoCore-WB 实现了平均 80% 的成功率,峰值成功率 100%。成功率最低的子任务是"按压打开垃圾桶盖"。对动作序列和视觉输入的分析(图 7)表明,精确按压需要夹爪与按钮边缘良好对齐。然而,按钮在右手相机视图中显得很小,且与夹爪颜色相似,导致视觉对比弱、感知线索有限。该任务还显示出对多视角观测的更强依赖,无法在右手相机下充分利用自我中心坐标系的优势,最终阻碍了精确控制。
图 7:失败分析。右手相机视图揭示,精确按压需要夹爪与按钮边缘准确对齐,而该边缘缺乏显著的视觉特征。
在末端执行器空间学习以缓解误差累积:我们对比两种仅在动作表示上不同的设计:关节空间 vs 末端执行器(EE)空间。我们使用 SO(3) 表示末端执行器姿态,因为它提供连续表示,有利于神经网络更高效地学习(Geist et al., 2024)。对于机器人躯干保持固定的机动性有限的任务,两种表示训练的策略表现相当。然而,在全身任务中,基于关节的策略精度显著低于基于 EE 的策略。这种性能差距源于全身控制的本质:达到期望的末端执行器位姿需要跨越移动底座、躯干和手臂的层级运动链的协调运动。在关节表示下,模型必须预测这条链上所有关节的位置;近端关节(尤其是靠近底座的关节)的不准确性会通过系统传播,最终损害末端执行器的精度。
这种误差累积在涉及长误差传播路径的任务(如高度动态的全身活动)中尤为棘手。为此,我们评估两项代表性任务:仅需双臂协调的桌面清物任务,以及需要全身协调的地面级物体分类任务。使用 100 个训练示教,关节空间策略在桌面任务上取得 18/20 的成功率,EE 空间策略表现相近,为 19/20。然而,在更具挑战性的全身分类任务上,关节空间策略仅成功 5/20,而 EE 空间策略以 18/20 显著胜出。这些结果凸显了 EE 空间表示带来的卓越泛化能力和控制精度,尤其在复杂的全身任务上。此外,EE 表示对关节动力学或运动跟踪精度的变化更具鲁棒性(如训练与部署机器人之间的差异),从而缓解现实部署中的性能下降。
使用增量动作表示学习可改善轨迹平滑度:我们观察到,用绝对动作表示训练的策略在推理时,动作步之间常出现明显的不连续。这一问题在通过提高控制频率或动作幅度来提升执行速度时尤为明显,表现为轨迹中的突变臂部运动、停顿或振荡,显著损害任务的稳定性与安全性。我们对比使用增量动作表示与绝对动作表示训练的策略,关注两项任务上的动作连续性:桌面清物任务和地面级物体分类任务。
我们在留出测试集上评估所有策略,并分析相关关节维度。如图 8 所示,与绝对动作策略相比,增量动作策略生成的轨迹在所有维度上的预测动作块之间不连续性显著更小。从定量上看,整条轨迹的平均每步变化,绝对动作策略为 0.0058,增量动作策略为 0.0034。聚焦于动作块之间的过渡,绝对动作策略的平均变化为 0.0196,而增量动作策略保持在显著更低的 0.0032。这些结果证明,使用增量动作表示训练策略可获得卓越的平滑度和时间一致性。
图 8:不同动作表示训练的策略轨迹可视化。所示为 6 个随机选取的相关关节的动作值。使用增量动作表示训练的策略(右)产生的轨迹明显更平滑、更一致,相比绝对动作策略(左)生成的轨迹。
使用自我中心增量动作学习可改善观测-动作对齐:我们将增量动作表示为位姿变换矩阵,并研究两种不同的参考坐标系:机器人坐标系和末端执行器的自我中心坐标系(增量相对于末端执行器局部坐标系定义)。我们在多种桌面任务上系统比较这两种表示,包括由腕部相机主导的精细操作任务、由头部相机引导的大范围末端执行器重定位,以及需要全身协调的地面级物体拾取任务。所有评估均在每项任务仅 40 个示教的有限数据条件下进行。如 表 4 所总结,使用自我中心增量动作表示训练的策略平均成功率更高:
- 在由腕部相机观测主导的任务中,将增量定义在末端执行器自身坐标系中,等价于直接在相机坐标系中建模动作目标。这种紧密的空间耦合增强了视觉观测与动作之间的对齐,加快模型收敛并改善运动精度。
- 在主要由头部相机引导的任务中,头部相机与机器人基座坐标系之间的相对位姿更稳定。因此,将增量定义在基座坐标系中,有助于图像特征与控制输出之间更一致的映射,带来更佳表现。
- 对于全身协调任务,执行过程中头部相机视角变化显著,这会降低视觉观测与基座坐标系之间的一致性。相反,将增量定义在末端执行器坐标系中,提供了更稳定、更不变的运动目标表示,在复杂的协调任务中表现更佳。
- 此外,我们观察到在分布偏移下——如训练时使用自我中心末端执行器坐标系增量动作表示的新物体位置——展现出更强的空间推理泛化能力和更好的部署鲁棒性,尤其是在需要精确操作的任务中。
表 4:使用自我中心增量动作表示训练的策略在不同任务上达到更高的平均成功率。
| 任务类型 | 主导视角 | 自我中心增量 | 机器人增量 |
|---|---|---|---|
| 精细抓取(笔拾取) | 腕部相机 | 19/20 | 17/20 |
| 大范围运动(移动盒子) | 头部相机 | 17/20 | 19/20 |
| 全身协调(地面拾取) | 多视角融合 | 19/20 | 16/20 |
绝对与相对轨迹表示的讨论:在图 9 中,我们可视化两项代表性任务的右臂末端执行器轨迹:“从地面拾取物体并放到桌上"和"从地面拾取物体”,各含 500 条示教轨迹。我们比较上述三种主要轨迹表示形式:世界坐标系下的绝对轨迹、机器人坐标系下的相对轨迹和自我中心坐标系下的相对轨迹。
图 9:不同动作表示下 500 条轨迹的可视化。自我中心坐标系下的相对轨迹在每个时间步根据末端执行器的当前状态动态更新参考系,导致跨任务的轨迹分布结构上更对齐、更紧凑。
实验结果表明,相对轨迹表示优于绝对轨迹表示。在世界坐标系下定义的绝对轨迹对任务初始状态、目标位置和环境布局的变化非常敏感。因此,相同的动作在不同任务中产生多样化的轨迹,缺乏结构一致性,阻碍策略泛化。相反,相对轨迹在与机器人状态或任务上下文更紧密耦合的局部坐标系中定义动作,增强了跨任务的结构一致性。机器人坐标系下的相对轨迹(相对于机器人基座或初始末端执行器位姿定义)通过过滤掉全局变化来改善轨迹一致性,使轨迹更具可比性、更易学习。然而,由于参考系在整个任务过程中固定,它仍可能受机器人运动或任务阶段切换影响,导致轨迹变形。自我中心坐标系下的相对轨迹在每个时间步根据末端执行器的当前状态动态更新参考系,使动作从一致的"观察者视角"表达。这导致跨任务的轨迹分布结构上更对齐、更紧凑。该表示表现出最低方差、最高信息密度,并与机器人的自然感知和控制天然对齐,从而支持更有效的局部反馈策略。
总之,三种表示的相对效果可概述如 表 5。我们得出结论,使用自我中心坐标系下相对轨迹表示训练的策略,在多任务操作学习中取得最佳表现。该表示不仅最小化任务间差异,还显著降低轨迹建模的复杂度,使其成为一种更鲁棒、更高效的轨迹表示方案。
表 5:不同动作表示的比较
| 表示 | 跨任务一致性 | 轨迹复杂度 | 自适应性 | 控制友好性 |
|---|---|---|---|---|
| 绝对轨迹(世界坐标系) | 差 | 高 | 差 | 差 |
| 相对轨迹(机器人坐标系) | 良 | 中 | 良 | 良 |
| 相对轨迹(自我中心) | 最佳 | 最低 | 最佳 | 最佳 |
图 10:动作块平滑方法对执行轨迹的比较。x 轴为时间(秒),y 轴为随时间变化的动作值。彩色线表示 VLA 模型生成的动作块,红线为机器人的实际(预过滤)执行轨迹。我们的方法(RTG)有效生成紧贴预测动作块的平滑轨迹。
(a) 同步推理 / (b) 带后端滤波的异步推理 / © 带历史融合的异步推理 / (d) RTG(我们的方法)
实时轨迹生成(RTG)模块的有效性:我们将 RTG 与几种常用的缓解动作块间不连续的策略进行比较。同步推理将当前动作块(或其子集)执行完毕后再生成并执行下一块,确保时间一致性,但会因推理延迟引入执行停顿,降低过渡期间的响应性。异步推理立即切换到最新可用的动作块,通常需要滤波技术平滑突变过渡。一种更先进的技术——带历史融合的异步推理(如 ACT,Zhao et al., 2023)——通过对最近几个块中相同时间戳关联的动作进行加权平均来减少不连续。这种策略带来延迟,且当观测突变时可能不可靠;依赖过时或不准确的轨迹会妨碍及时过渡到更合适的动作块,最终降低任务成功率。
评估使用全身 VLA 模型,动作块大小为 32,目标频率 10Hz。在考虑通信延迟和阻塞数据等待后,有效推理频率降至约 7Hz。为清晰起见,结果以一维数据可视化。图 10 展示不同方法的轨迹:彩色线为 VLA 模型预测的动作块,红线为机器人的实际(预过滤)执行轨迹。相应的动作速度见 图 11。如图 10(a) 所示,同步推理由于阻塞等待下一次推理,在每个动作块末尾引入明显停顿;不过同一块内的插值确保了平滑、连续的执行。异步推理会产生显著的速度尖峰和突变过渡,在没有适当滤波的情况下直接执行这种不连续轨迹会危及硬件安全。带历史融合的异步推理缓解了部分不连续,但产生的速度幅值仍需额外滤波。如速度剖面(图 11)所示,我们提出的方法有效将速度限制在安全工作范围内(最大 0.033 m/s),即使在无后端滤波的情况下也能实现平滑执行。此外,执行轨迹与预测动作块紧密贴合(图 10(d)),减少轨迹漂移并最小化分布外状态——这两点对提升任务成功率和策略鲁棒性都至关重要。
图 11:动作块平滑方法对动作速度的比较。x 轴为时间(秒),y 轴为随时间变化的动作速度。我们的方法(RTG)有效将速度限制在安全范围内。
5. 结论、局限与未来方向
本文提出 Astribot Suite,一个面向全身操作的机器人学习套件,包含三个核心组件:(1)具备人类水平物理能力的安全机器人平台;(2)用于现实世界数据采集的直观、可扩展遥操作界面;(3)兼容大规模策略预训练的简单而有效的全身视觉-运动策略。
尽管在广泛任务上表现出色,Astribot Suite 仍存在某些局限——尤其是在学习需要更高敏捷性、灵巧性或长期记忆的更高级任务方面。
未来工作中,我们计划在以下方向战略性投入:
- 机器人硬件增强:我们将继续推进机器人平台,以达到更高能力和更佳安全性,旨在同时支持现实部署和前沿研究,从而推动具身智能的边界。
- 人机交互:我们将迭代更直观、更智能的人机交互方法,包括但不限于 AI 辅助遥操作以及促进人机无缝协作的自适应界面。
- 模型与系统可扩展性:我们将改进模型架构和预训练策略,以提升训练和推理效率,长期目标是实现可扩展的学习系统并广泛部署于以人为中心的环境中。
6. 贡献
- 核心贡献者:Guang Gao、Jinbo Zuo
- 参与贡献者:Junnan Jiang、Jingfan Zhang、Xianwen Zeng、Yuejiang Zhu、Lianyang Ma、Ke Chen、Minhua Sheng、Ruirui Zhang
- 项目负责人:Jianan Wang、Zhaohui An
参考文献
- J. Bjorck, F. Castañeda, N. Cherniadev 等. Gr00t n1: An open foundation model for generalist humanoid robots. arXiv:2503.14734, 2025.
- K. Black, N. Brown, D. Driess 等. π₀: A vision-language-action flow model for general robot control. arXiv:2410.24164, 2024.
- C. Chi, Z. Xu, S. Feng 等. Diffusion policy: Visuomotor policy learning via action diffusion. IJRR, 2023.
- Y. Dai and J. Wang. Co-evolving embodied intelligence with design for artificial intelligence architecture. Nature Reviews Electrical Engineering, 2(3):149–150, 2025.
- A. Dosovitskiy, L. Beyer, A. Kolesnikov 等. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv:2010.11929, 2020.
- D. Driess, F. Xia, M. S. M. Sajjadi 等. PaLM-E: An embodied multimodal language model. ICML, 2023.
- A. R. Geist, J. Frey, M. Zhobro, A. Levina, G. Martius. Learning with 3D rotations, a hitchhiker’s guide to SO(3). arXiv:2404.11735, 2024.
- A. Gupta, S. Savarese, S. Ganguli, L. Fei-Fei. Embodied intelligence via learning and evolution. Nature Communications, 12(1):5721, 2021.
- S. Haddadin, A. De Luca, A. Albu-Schäffer. Robot collisions: A survey on detection, isolation, and identification. IEEE T-RO, 33(6):1292–1312, 2017.
- J. Ho, A. Jain, P. Abbeel. Denoising diffusion probabilistic models. NeurIPS 33:6840–6851, 2020.
- Physical Intelligence, K. Black, N. Brown 等. π₀.₅: a vision-language-action model with open-world generalization. arXiv:2504.16054, 2025.
- Y. Jiang, R. Zhang, J. Wong 等. Behavior robot suite: Streamlining real-world whole-body manipulation for everyday household activities. arXiv:2503.05652, 2025.
- T. Jin, T. Kobayashi, M. Doi. Real-time detailed self-collision avoidance in whole-body model predictive control. IEEE-RAS Humanoids, 675–681, 2024.
- M. J. Kim, K. Pertsch, S. Karamcheti 等. OpenVLA: An open-source vision-language-action model. arXiv:2406.09246, 2024.
- B. Liu, G. Jiang, F. Zhao, X. Mei. Collision-free motion generation based on stochastic optimization and composite signed distance field networks of articulated robot. IEEE RA-L, 8(11):7082–7089, 2023.
- S. Liu, L. Wu, B. Li 等. RDT-1B: a diffusion foundation model for bimanual manipulation. arXiv:2410.07864, 2024.
- A. Q. Nichol, P. Dhariwal. Improved denoising diffusion probabilistic models. ICML, 8162–8171, 2021.
- M. Oquab, T. Darcet, T. Moutakanni 等. DINOv2: Learning robust visual features without supervision. arXiv:2304.07193, 2023.
- S. Qian, B. Zi, W.-W. Shang, Q.-S. Xu. A review on cable-driven parallel robots. Chinese Journal of Mechanical Engineering, 31(1):1–11, 2018.
- A. Radford, J. W. Kim, C. Hallacy 等. Learning transferable visual models from natural language supervision. ICML, 8748–8763, 2021.
- DeepMind Team, J. Abramson, A. Ahuja 等. Creating multimodal interactive agents with imitation and self-supervised learning. arXiv:2112.03763, 2021.
- Gemini Robotics Team, S. Abeyruwan, J. Ainslie, J.-B. Alayrac 等. Gemini Robotics: Bringing AI into the physical world. arXiv:2503.20020, 2025.
- A. Vaswani, N. Shazeer, N. Parmar 等. Attention is all you need. NeurIPS 30, 2017.
- Y. Ze, G. Zhang, K. Zhang, C. Hu, M. Wang, H. Xu. 3D diffusion policy: Generalizable visuomotor policy learning via simple 3D representations. arXiv:2403.03954, 2024.
- X. Zhai, B. Mustafa, A. Kolesnikov, L. Beyer. Sigmoid loss for language image pre-training. ICCV, 11975–11986, 2023.
- T. Zhao, V. Kumar, S. Levine, C. Finn. Learning fine-grained bimanual manipulation with low-cost hardware. arXiv:2304.13705, 2023.
- B. Zitkovich, T. Yu, S. Xu 等. RT-2: Vision-language-action models transfer web knowledge to robotic control. CoRL, 2165–2183, 2023.
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)