SONIC:像训练大模型一样训练人形机器人——NVIDIA用21万GPU小时打造通用全身控制器

前言

在人形机器人控制领域,长期以来存在一个尴尬的局面:大语言模型已经用上了万亿参数、上万张GPU,而最先进的机器人控制策略往往还只是一个三层MLP(多层感知机),在几张显卡上训练一个单一任务

为什么会这样?是机器人控制本身就不需要规模化的能力,还是我们一直没有找到正确的“任务”来规模化?

NVIDIA GEAR实验室的最新工作SONIC(Supersizing Motion Tracking for Natural Humanoid Control) 给出了一个令人信服的答案:将“运动追踪”作为基础任务,通过规模化(Scaling Up),我们可以在人形机器人上复现类似大模型的涌现能力和泛化性

论文链接:SONIC Project Page


一、核心思想:为什么是“运动追踪”?

传统方法的痛点

过去的人形机器人控制,主流思路有两种:

方法 代表工作 痛点
任务专用奖励工程 各种行走、奔跑控制器 每个新任务都要重新设计奖励函数,无法泛化
对抗式模仿学习 AMP、ASE、CALM 用判别器区分真实/生成动作,数据一多就容易模式崩溃

这两种方法的共同问题是:它们都不“可扩展”。任务越多,需要的人力就越多;数据越多,训练反而越不稳定。

SONIC的洞察

SONIC提出了一个关键洞察:运动追踪是一个天然“可扩展”的任务

为什么?

  • 密集监督:动作捕捉数据的每一帧都是一个明确的目标姿态,不需要任何奖励工程。
  • 数据丰富:过去几十年积累的动作捕捉数据浩如烟海(行走、跑步、舞蹈、体育、物体交互……)。
  • 信号稳定:随着数据量增加,监督信号始终明确可用,不会像判别器那样变“模糊”。

一句话总结:运动追踪 = 机器人领域的“语言建模”,每一帧都是一个“token”,整个任务就是让模型学会预测“下一个姿态”。


二、规模化实验:参数、数据、算力三管齐下

SONIC在三个维度上进行了系统的规模化实验:

2.1 数据规模

训练集规模 帧数 对应的运动片段数
4M 20k
10M 50k
22M 110k
超大 100M 310k

原始数据约700小时,经筛选和重定向后得到611小时有效训练数据(50fps)。

2.2 模型规模

1.2M参数到16M参数,再到42M参数。

虽然和大语言模型比起来这个规模还很小,但在物理仿真的人形机器人控制领域,这已经是一个数量级的跃升。

2.3 计算规模

节点数 GPU数 训练迭代数 GPU耗时
2节点 16 GPU 50k ~2K小时
4节点 32 GPU 50k ~9K小时
16节点 128 GPU 50k ~21K小时

2.4 核心结论:规模化确实有用!

实验中,SONIC用两种测试集来评估泛化能力:

  • test-content:完全没见过的运动类型(如某种特定的舞蹈风格)
  • test-repetition:见过类型但没见过的具体表演片段
模型规模 test-content成功率 test-content追踪精度(MPJPE-L)
1.2M 98.0% 27.7mm
16M 98.9% 25.4mm
42M 99.6% 23.8mm

结论非常清晰:模型越大、数据越多、算力越强,性能越好,特别是在处理从未见过的新运动时,泛化能力的提升尤为明显


三、技术架构:三个关键设计让规模化落地

拥有了一个强大的追踪策略之后,SONIC面临的第二个问题是:如何让它真正服务于各种实际应用?

SONIC用三个核心设计解决了这个问题:

3.1 通用控制策略:一个网络,三种输入

SONIC的策略网络采用了多编码器 + 共享隐空间 + 统一解码器的架构:

输入类型A(机器人关节角度)──→ 机器人编码器 ε_r ──┐
输入类型B(SMPL人体姿态) ──→ 人体编码器 ε_h   ──→ FSQ量化器 ──→ 通用令牌 ──→ 控制解码器 ──→ 关节指令
输入类型C(混合/稀疏输入)──→ 混合编码器 ε_m   ──┘

核心创新:FSQ量化(Finite Scalar Quantization)

SONIC没有用传统的VQ-VAE,而是用了FSQ做量化,原因:

  • VQ-VAE的致命问题:码本坍塌(Codebook Collapse),即大部分的码本向量在训练中从未被使用,导致表示能力下降。
  • FSQ的优势:从根本上避免了码本坍塌,训练更稳定,且配合PPO进行端到端训练时,梯度回传更干净。

3.2 生成式运动规划器:把“意图”变成“轨迹”

追踪策略本身只是一个“执行器”,它需要一个“参考运动”才能工作。

SONIC的生成式运动规划器负责把用户的高层意图(“往前走”、“蹲下到0.5米高度”、“左勾拳”)转化成具体的运动参考轨迹。

技术亮点

  • 采用掩码令牌预测(Masked Token Prediction) 架构,和MagViT等视频生成模型类似
  • 生成片段长度灵活(0.8-2.4秒),每100ms即可重新规划,响应极其敏捷
  • 仅需一个代表性动作片段就能生成一类技能,无需任何额外训练

3.3 通用令牌空间:连接所有模块的“通用语言”

这是SONIC最优雅的设计之一。所有的输入——无论是游戏手柄的方向指令、VR头显捕捉的全身姿态、网络摄像头的视频流,还是VLA模型输出的高层决策——最终都会被映射到同一个通用令牌空间中。

这个设计有两个关键收益:

  1. 即插即用:切换输入源只需要切换对应的编码器,无需重新训练策略
  2. 对VLA友好:离散的、低维的令牌空间远比连续的关节角度更容易被VLA模型学习和预测。

四、实验结果:全面的能力展示

4.1 追踪性能:全面超越基线

与当前最先进的追踪方法对比:

方法 test-content成功率 test-repetition成功率 MPJPE-L (mm)
Any2Track 31.1% 38.4%
BeyondMimic 81.6% 85.8% 39.1
GMT
SONIC (Ours) 98.7% 99.6% 23.2

SONIC的追踪精度比BeyondMimic降低了41%的误差。

4.2 碾压专用控制器:通用模型战胜专用模型

SONIC和专门为行走设计的控制器OpenHomie进行了速度追踪对比:

指标 OpenHomie(专用) SONIC(通用)
整体存活率 43.0% 98.5%
>1.5m/s时存活率 <20% ~100%(至4m/s)

这是一个非常反直觉但又极具说服力的结果:一个通用模型,在特定的行走任务上,击败了一个为此任务专门设计和优化的专家模型

4.3 仿真到真实:几乎零差距

在真实Unitree G1机器人上测试了123个运动序列:

场景 成功率 MPJPE-L
仿真 100% 22.3mm
真实世界 99.2% 25.7mm

上半身误差差距极小(21.8mm vs 22.2mm),脚部的差距较大(29.0mm vs 53.7mm),反映了真实世界中足部接触动力学的复杂性。

4.4 抗干扰能力:11公斤重物砸下来也不倒

论文中展示了一个令人印象深刻的实验:在执行策略的过程中,一个约11公斤的重物从头部高度砸到机器人身上。机器人吸收冲击、保持平衡、继续执行运动——没有任何恢复模块或策略自适应


五、最精彩的部分:VLA驱动的全身操控

这是SONIC最具前瞻性的贡献。SONIC的通用令牌空间被直接作为GR00T N1.5 VLA模型的“动作空间”

为什么令牌空间比关节角度更适合VLA?

论文做了清晰的消融实验:

VLA动作空间 平均成功率 最复杂任务(易拉罐回收入桶)
直接预测SMPL姿态 27% 0%
预测FSQ通用令牌 68% 60%

原因

  • 离散令牌空间是低维、结构化的,VLA更容易学习
  • 连续SMPL姿态空间会放大VLA的微小预测误差,导致灾难性失败
  • 令牌空间天然对齐了所有输入模态,VLA看到的训练数据分布一致

五个真实任务展示

任务 接口类型 训练轨迹数 成功率
苹果放盘子(3点接口) 3-point 300 90%
捡胡萝卜(全身接口) whole-body 3,900 75%
捡清洁刷(全身接口) whole-body 3,900 95%
踩踏板开垃圾桶(全身) whole-body 200 70%
易拉罐回收(全身,5步复合) whole-body 1,000 60%
电钻装箱搬运(全身) whole-body 300 70%

其中“易拉罐回收”任务涉及走到桌前→单手拿起易拉罐→走到垃圾桶前→用脚踩踏板开盖→单手投掷入桶,要求手、脚、全身平衡的实时协调——这在过去是一个极难实现的全身操控场景。


六、为什么SONIC能成功?一个更深层的解释

论文在讨论部分给出了一个关键洞察,值得单独拿出来说:

运动追踪的规模化优势来源于其“密集逐帧监督”的性质。

这和其他方法形成了鲜明对比:

方法类型 监督性质 规模化结果
任务专用奖励 稀疏、任务特定 能力饱和,无法泛化
对抗式模仿 判别器信号随多样性下降 数据越多越容易模式崩溃
运动追踪 密集、逐帧明确 信号随数据增长而丰富,持续受益

简单说:其他方法在规模扩大时会“变傻”,而运动追踪是“越学越聪明”


七、局限性与未来展望

当前局限

  1. 安全性与能效:目前没有对长时间部署中的安全性和能量效率做正式处理
  2. 极端运动失败:需要长时间、复杂地面接触的极端姿态(如僵尸爬行、盘腿坐)仍然会导致追踪失败
  3. 地面接触挑战:足部在真实世界中的精度(53.7mm)显著低于仿真(29.0mm),反映了接触动力学的复杂性

未来方向

SONIC的愿景是将自己定位为一个**“基础层”**。在这个基础上,未来可以构建更高层次的:

  • 感知模块:理解和理解环境
  • 推理模块:进行任务规划和决策
  • 交互模块:与人类进行自然交互

这标志着通用人形机器人自主性的重要一步。


总结

SONIC是近年来人形机器人控制领域最具启发性的工作之一。它证明了:

  1. “规模化”的范式可以迁移到机器人控制领域——只要选对了“基础任务”
  2. 运动追踪是一个理想的基础任务——具备密集监督、数据丰富、信号稳定的特点
  3. 通用模型可以战胜专用模型——用42M参数训练的通用追踪器,在行走任务上完胜专用行走控制器
  4. 统一的令牌空间是关键设计——它连接了底层控制和高层VLA模型,是通往通用机器人智能的桥梁

对于行业从业者而言,SONIC提供了一个清晰的路线图:

与其为每一个新任务重新设计控制器,不如投入资源构建一个大规模的运动追踪模型,然后用它作为“通用操作系统”,在其上快速开发各种应用。


参考资料

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐