告别奖励函数:详解英伟达通用VLA×运控框架,一次搞定多模态机器人跑、跳、跪、爬
当前,虽然大语言模型和图像生成模型已经发展到万亿参数的规模,但人形机器人的控制技术却远远落后,模型规模小、行为单一,且训练过程需要大量人工设计的奖励函数,难以扩展。这种为特定任务手动设计奖励的方式,比如让机器人学会走路的奖励函数,并不能直接用于跳舞或格斗,导致每增加一个新能力,就需要重新设计一套复杂的系统,极大地阻碍了通用人形机器人控制技术的发展。
为了解决这个问题,本文提出了一个基于大规模运动追踪的通用人形机器人控制框架SONIC。该框架通过学习海量的人类运动捕捉数据,让机器人掌握各种自然、流畅的全身动作,并能将这些动作能力泛化到各种下游任务中,实现了对视频、文本、音乐和VR等多种输入方式的统一控制,展现了卓越的通用性和鲁棒性。
一、论文基本信息

- 论文标题: SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control (SONIC:为实现自然的类人全身控制而超大规模化运动追踪)
- 作者姓名与单位: Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, 等 (主要来自Nvidia)
- 论文链接: https://nvlabs.github.io/SONIC/
二、主要贡献与创新
- 首次将运动追踪作为人形机器人控制的基础任务,并证明了其在模型、数据和计算量上的良好扩展性。
- 构建了一个通用的运动标记空间(universal token space),通过单一策略即可支持多种异构输入模态。
- 设计了一个实时的运动学动作生成规划器,将运动追踪能力与交互式下游任务无缝衔接起来。
- 在仿真和真实世界的Unitree G1机器人上验证了方法的有效性,并成功与视觉-语言-动作(VLA)大模型集成。
三、研究方法与原理
该模型的核心思路是:将不同来源的运动指令(如机器人自身动作、人类动作、VR信号)编码到一个统一的、量化的“通用标记”(universal token)空间中,再由一个通用的解码器将这些标记翻译成机器人的具体控制指令。
如上图所示,SONIC框架主要由三大部分构成:运动生成器 (Motion Generators)、通用控制策略 (Universal Control Policy) 和下游任务 (Tasks)。它将复杂的机器人控制问题分解为“生成参考动作”和“物理追踪动作”两个步骤。
1. 通用 humanoid 运动追踪
该部分是模型的核心,它将运动追踪问题建模为一个马尔可夫决策过程 (MDP)。
- 状态 sts_tst: 包括机器人自身的本体感知状态 stps^p_tstp(如关节角度、速度、IMU数据等)和运动指令 stgs^g_tstg(即目标参考动作)。
- 动作 ata_tat: 策略网络 π\piπ 输出的目标关节角度,由底层的PD控制器执行。
- 奖励函数 rtr_trt: 奖励函数由两部分组成:追踪奖励 R\mathcal{R}R 和惩罚项 D\mathcal{D}D。
rt=R(stp,stg)+D(stp,at) r_t = \mathcal{R}(s^p_t, s^g_t) + \mathcal{D}(s^p_t, a_t) rt=R(stp,stg)+D(stp,at)
其中,追踪奖励 R\mathcal{R}R 用于鼓励机器人模仿参考动作,它包含了对机器人根关节(躯干)方向、身体各连杆的相对位置、相对朝向、线速度和角速度的模仿。例如,身体连杆相对位置的奖励项定义为:
rbodypos(t)=exp(−1∣B∣∑b∈B∥pp,relt,b−pg,relt,b∥22/0.32) r_{\text{body}}^{\text{pos}}(t) = \exp \left( -\frac{1}{|\mathcal{B}|} \sum_{b \in \mathcal{B}} \| p_{p,\text{rel}}^{t,b} - p_{g,\text{rel}}^{t,b} \|_2^2 / 0.3^2 \right) rbodypos(t)=exp(−∣B∣1b∈B∑∥pp,relt,b−pg,relt,b∥22/0.32)
这里的 pp,relt,bp_{p,\text{rel}}^{t,b}pp,relt,b 表示在 ttt 时刻机器人连杆 bbb 相对于根关节的实际位置,而 pg,relt,bp_{g,\text{rel}}^{t,b}pg,relt,b 则是参考动作中的目标位置。惩罚项 D\mathcal{D}D 则用于避免不平滑的动作、关节超出限制以及不期望的身体部位接触地面。
-
通用控制策略
为了处理来自不同源(如机器人、人类、VR设备)的运动指令,模型设计了一个独特的编码器-量化器-解码器结构。-
专用编码器 (Encoders):针对三种不同的运动指令,模型设计了三个专门的编码器:
- 机器人编码器 Er\mathcal{E}_rEr:处理机器人自身的未来多帧关节状态。
- 人类编码器 Eh\mathcal{E}_hEh:处理未来多帧的人体3D关节点位置(SMPL格式)。
- 混合编码器 Em\mathcal{E}_mEm:处理实时的上身关键点(头、手)和规划出的下身机器人动作,主要用于VR遥操作。
这三个编码器都是多层感知机(MLP),它们将不同形式的输入映射到一个共享的隐空间。
-
量化器 (Quantizer):将编码器输出的连续隐向量,通过有限标量量化 (Finite Scalar Quantization, FSQ) 技术,转换为一个离散的、统一的**“通用标记” zzz**。这个标记就像一个标准化的“动作指令”,无论原始输入是什么,它都用同一种格式表示。
-
解码器 (Decoders):通用标记 zzz 会被送入两个解码器:
- 机器人控制解码器 Dc\mathcal{D}_cDc:将 zzz 翻译成最终的机器人关节电机指令。
- 机器人运动解码器 Dr\mathcal{D}_rDr:这是一个辅助解码器,它尝试根据 zzz 重建出标准的机器人运动指令 grg_rgr。
-
-
训练过程
训练的目标是让模型学会如何将不同来源的运动指令都准确地追踪执行。其总损失函数 L\mathcal{L}L 包括四个部分:
L=Lppo+Lrecon+Ltoken+Lcycle \mathcal{L} = \mathcal{L}_{\text{ppo}} + \mathcal{L}_{\text{recon}} + \mathcal{L}_{\text{token}} + \mathcal{L}_{\text{cycle}} L=Lppo+Lrecon+Ltoken+Lcycle- Lppo\mathcal{L}_{\text{ppo}}Lppo:标准的**PPO(Proximal Policy Optimization)**算法损失,用于优化强化学习策略。
- Lrecon\mathcal{L}_{\text{recon}}Lrecon:重建损失。它要求无论输入是人类动作 ghg_hgh 还是混合动作 gmg_mgm,解码器 Dr\mathcal{D}_rDr 都能重建出对应的机器人标准动作 grg_rgr。这相当于一个隐式的动作重定向模块,教会模型如何将人类动作“翻译”成机器人能理解的动作。
Lrecon=∥Dr(zr)−gr∥2+∥Dr(zh)−gr∥2+∥Dr(zm)−gr∥2 \mathcal{L}_{\text{recon}} = \|\mathcal{D}_r(z_r) - g_r\|^2 + \|\mathcal{D}_r(z_h) - g_r\|^2 + \|\mathcal{D}_r(z_m) - g_r\|^2 Lrecon=∥Dr(zr)−gr∥2+∥Dr(zh)−gr∥2+∥Dr(zm)−gr∥2 - Ltoken\mathcal{L}_{\text{token}}Ltoken:标记对齐损失。它强制要求由机器人动作编码的标记 zrz_rzr 和由人类动作编码的标记 zhz_hzh 尽可能接近,确保跨物种的动作在隐空间中表示一致。
Ltoken=∥zr−zh∥2 \mathcal{L}_{\text{token}} = \|z_r - z_h\|^2 Ltoken=∥zr−zh∥2 - Lcycle\mathcal{L}_{\text{cycle}}Lcycle:循环一致性损失。它确保了从人类动作到机器人动作的“翻译”过程是可逆和一致的,进一步加强了隐空间的对齐。
2. 生成式运动学规划器
为了实现交互式控制(如游戏手柄控制),SONIC引入了一个生成式运动学规划器。这个规划器本身也是一个在大型运动数据集上训练的生成模型。它能够根据用户的高层指令(如“向前跑”、“向左闪避”或调整蹲下高度)和机器人当前状态,实时生成一小段(0.8-2.4秒)未来运动轨迹。这个规划器采用自回归(autoregressive)的方式,不断地在机器人历史状态和用户目标之间进行“插值”,生成自然的过渡动作。为了平滑处理用户可能发出的不合理指令(如从6m/s瞬间变为-6m/s),它还使用了一个临界阻尼弹簧模型来生成平滑的根关节目标轨迹。
x(t)=(xT−x0+(v0+c2(xT−x0))t)e−c2t x(t) = \left( x_T - x_0 + \left( v_0 + \frac{c}{2}(x_T - x_0) \right)t \right) e^{-\frac{c}{2}t} x(t)=(xT−x0+(v0+2c(xT−x0))t)e−2ct
四、实验设计与结果分析
实验部分旨在验证SONIC框架在泛化能力、可扩展性以及实际应用中的表现。
- 数据集:使用了一个包含170名演员、总时长超700小时、帧数超1亿的自建大规模高质量运动捕捉数据集。评估则在一个模型从未见过的、包含9小时各类动作的AMASS公开数据集子集上进行。
- 评测指标:主要包括成功率 (Success Rate, Succ),用于衡量机器人是否能全程跟蹤而不摔倒或偏离过远;以及平均每关节位置误差 (MPJPE),衡量追踪的精确度。
Scaling Up Motion Tracking (扩展性分析)
这部分实验探究了增加**数据量、模型尺寸和计算资源(GPU小时)**对性能的影响。
从图2可以看出,无论是增加数据量(从40万帧到1亿帧)、增加模型参数(从120万到4200万),还是增加训练算力,模型的追踪成功率(蓝线)都持续上升,而追踪误差MPJPE(红线)则持续下降。这有力地证明了运动追踪任务具有良好的可扩展性,即投入更多资源能带来实实在在的性能提升,这与传统需要精细调参的强化学习任务形成了鲜明对比。
Comparison with Baselines (与基线方法对比)
SONIC与当前最先进的三个运动追踪方法(Any2Track, BeyondMimic, GMT)在从未见过的动作序列上进行了对比。
结果如上图所示,在追踪成功率上,SONIC (Ours) 达到了94.3%,远超其他方法。在追踪误差指标(MPJPE、速度误差、加速度误差)上,SONIC也全面领先,说明其追踪动作不仅成功率高,而且在动作细节和物理动态上更逼真、更精确。
Real-World Evaluation (真实世界评估)
SONIC被直接部署在Unitree G1人形机器人上,在50个从未见过的多样化动作(包括舞蹈、跳跃等)上进行了零样本(zero-shot)测试。结果显示,真实世界中的成功率达到了100%,并且追踪误差与仿真结果非常接近(真实世界MPJPE为40.9mm,仿真中为42.7mm),证明了模型强大的**sim-to-real(从仿真到现实)**迁移能力。
VR-Based Teleoperation and Connecting to Foundation Models (VR遥操作与大模型集成)
该实验展示了SONIC的实用性。研究人员使用一套简化的VR设备(仅需头显和手柄)收集了300条机器人移动并抓取苹果的任务数据。然后,用这些数据微调了一个名为GR00T N1.5的VLA(视觉-语言-动作)大模型。
微调后的VLA模型能自主理解任务,并输出与VR遥操作相同格式的指令(头部和手腕姿态、移动速度等)。这些指令通过SONIC框架被无缝执行,最终在20次试验中达到了95%的成功率。这证明了SONIC可以作为一个可靠的“系统1”(快速、反应式的底层运动控制器),与VLA大模型的“系统2”(缓慢、深思熟虑的高层规划)能力完美结合,为实现通用自主的人形机器人铺平了道路。
五、论文结论与评价
本文的核心结论是,通过大规模扩展运动追踪任务,可以训练出一个强大且通用的机器人全身控制基础模型。实验证明,增加数据、模型尺寸和计算力能稳定地提升模型性能,使其能够零样本泛化到各种从未见过的复杂动作,并且在真实机器人上表现优异。这为解决传统机器人控制方法难以扩展的瓶颈提供了一个非常实用和有效的方向。
这项研究的重大意义在于,它找到了一个可以媲美语言模型“海量文本数据”的“海量运动数据”,并证明了“大力出奇迹”的缩放法则(Scaling Law)在机器人控制领域同样适用。它所提出的通用标记空间和运动规划器,使得一个单一模型就能接入VR、视频、文本甚至VLA大模型等多种控制方式,极大地提升了机器人的通用性和易用性,让机器人控制从“为每个任务定制专家”转向“训练一个全能通才”。
当然,该方法也存在一些待完善之处。首先,它主要关注动作的模仿,对安全性、能量效率、与环境的柔顺交互等方面考虑较少,这在长时间实际部署中至关重要。其次,模型虽然能处理多种输入,但对于有噪声或不完整的输入信号(如现实中不完美的视频姿态估计),其鲁棒性仍有提升空间。最后,该框架中的规划器和控制策略是分开训练的,未来若能进行端到端的联合训练,可能会进一步消除模块间的隔阂,实现更优的性能。
总而言之,SONIC为通用人形机器人的发展提供了一个清晰、可行的技术蓝图。它不仅展示了惊人的技术成果,更重要的是,它指明了一条道路:我们可以像训练语言大模型一样,通过“预训练+微调”的范式来打造强大的机器人“运动脑”,这无疑将深刻影响未来机器人学研究和产业应用的方向。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)