【学习笔记】SONIC:像训练大模型一样训练人形机器人
SONIC:像训练大模型一样训练人形机器人——NVIDIA用21万GPU小时打造通用全身控制器
前言
在人形机器人控制领域,长期以来存在一个尴尬的局面:大语言模型已经用上了万亿参数、上万张GPU,而最先进的机器人控制策略往往还只是一个三层MLP(多层感知机),在几张显卡上训练一个单一任务。
为什么会这样?是机器人控制本身就不需要规模化的能力,还是我们一直没有找到正确的“任务”来规模化?
NVIDIA GEAR实验室的最新工作SONIC(Supersizing Motion Tracking for Natural Humanoid Control) 给出了一个令人信服的答案:将“运动追踪”作为基础任务,通过规模化(Scaling Up),我们可以在人形机器人上复现类似大模型的涌现能力和泛化性。
论文链接:SONIC Project Page
一、核心思想:为什么是“运动追踪”?
传统方法的痛点
过去的人形机器人控制,主流思路有两种:
| 方法 | 代表工作 | 痛点 |
|---|---|---|
| 任务专用奖励工程 | 各种行走、奔跑控制器 | 每个新任务都要重新设计奖励函数,无法泛化 |
| 对抗式模仿学习 | AMP、ASE、CALM | 用判别器区分真实/生成动作,数据一多就容易模式崩溃 |
这两种方法的共同问题是:它们都不“可扩展”。任务越多,需要的人力就越多;数据越多,训练反而越不稳定。
SONIC的洞察
SONIC提出了一个关键洞察:运动追踪是一个天然“可扩展”的任务。
为什么?
- 密集监督:动作捕捉数据的每一帧都是一个明确的目标姿态,不需要任何奖励工程。
- 数据丰富:过去几十年积累的动作捕捉数据浩如烟海(行走、跑步、舞蹈、体育、物体交互……)。
- 信号稳定:随着数据量增加,监督信号始终明确可用,不会像判别器那样变“模糊”。
一句话总结:运动追踪 = 机器人领域的“语言建模”,每一帧都是一个“token”,整个任务就是让模型学会预测“下一个姿态”。
二、规模化实验:参数、数据、算力三管齐下
SONIC在三个维度上进行了系统的规模化实验:
2.1 数据规模
| 训练集规模 | 帧数 | 对应的运动片段数 |
|---|---|---|
| 小 | 4M | 20k |
| 中 | 10M | 50k |
| 大 | 22M | 110k |
| 超大 | 100M | 310k |
原始数据约700小时,经筛选和重定向后得到611小时有效训练数据(50fps)。
2.2 模型规模
从1.2M参数到16M参数,再到42M参数。
虽然和大语言模型比起来这个规模还很小,但在物理仿真的人形机器人控制领域,这已经是一个数量级的跃升。
2.3 计算规模
| 节点数 | GPU数 | 训练迭代数 | GPU耗时 |
|---|---|---|---|
| 2节点 | 16 GPU | 50k | ~2K小时 |
| 4节点 | 32 GPU | 50k | ~9K小时 |
| 16节点 | 128 GPU | 50k | ~21K小时 |
2.4 核心结论:规模化确实有用!
实验中,SONIC用两种测试集来评估泛化能力:
- test-content:完全没见过的运动类型(如某种特定的舞蹈风格)
- test-repetition:见过类型但没见过的具体表演片段
| 模型规模 | test-content成功率 | test-content追踪精度(MPJPE-L) |
|---|---|---|
| 1.2M | 98.0% | 27.7mm |
| 16M | 98.9% | 25.4mm |
| 42M | 99.6% | 23.8mm |
结论非常清晰:模型越大、数据越多、算力越强,性能越好,特别是在处理从未见过的新运动时,泛化能力的提升尤为明显。
三、技术架构:三个关键设计让规模化落地
拥有了一个强大的追踪策略之后,SONIC面临的第二个问题是:如何让它真正服务于各种实际应用?
SONIC用三个核心设计解决了这个问题:
3.1 通用控制策略:一个网络,三种输入
SONIC的策略网络采用了多编码器 + 共享隐空间 + 统一解码器的架构:
输入类型A(机器人关节角度)──→ 机器人编码器 ε_r ──┐
输入类型B(SMPL人体姿态) ──→ 人体编码器 ε_h ──→ FSQ量化器 ──→ 通用令牌 ──→ 控制解码器 ──→ 关节指令
输入类型C(混合/稀疏输入)──→ 混合编码器 ε_m ──┘
核心创新:FSQ量化(Finite Scalar Quantization)
SONIC没有用传统的VQ-VAE,而是用了FSQ做量化,原因:
- VQ-VAE的致命问题:码本坍塌(Codebook Collapse),即大部分的码本向量在训练中从未被使用,导致表示能力下降。
- FSQ的优势:从根本上避免了码本坍塌,训练更稳定,且配合PPO进行端到端训练时,梯度回传更干净。
3.2 生成式运动规划器:把“意图”变成“轨迹”
追踪策略本身只是一个“执行器”,它需要一个“参考运动”才能工作。
SONIC的生成式运动规划器负责把用户的高层意图(“往前走”、“蹲下到0.5米高度”、“左勾拳”)转化成具体的运动参考轨迹。
技术亮点:
- 采用掩码令牌预测(Masked Token Prediction) 架构,和MagViT等视频生成模型类似
- 生成片段长度灵活(0.8-2.4秒),每100ms即可重新规划,响应极其敏捷
- 仅需一个代表性动作片段就能生成一类技能,无需任何额外训练
3.3 通用令牌空间:连接所有模块的“通用语言”
这是SONIC最优雅的设计之一。所有的输入——无论是游戏手柄的方向指令、VR头显捕捉的全身姿态、网络摄像头的视频流,还是VLA模型输出的高层决策——最终都会被映射到同一个通用令牌空间中。
这个设计有两个关键收益:
- 即插即用:切换输入源只需要切换对应的编码器,无需重新训练策略。
- 对VLA友好:离散的、低维的令牌空间远比连续的关节角度更容易被VLA模型学习和预测。
四、实验结果:全面的能力展示
4.1 追踪性能:全面超越基线
与当前最先进的追踪方法对比:
| 方法 | test-content成功率 | test-repetition成功率 | MPJPE-L (mm) |
|---|---|---|---|
| Any2Track | 31.1% | 38.4% | — |
| BeyondMimic | 81.6% | 85.8% | 39.1 |
| GMT | — | — | — |
| SONIC (Ours) | 98.7% | 99.6% | 23.2 |
SONIC的追踪精度比BeyondMimic降低了41%的误差。
4.2 碾压专用控制器:通用模型战胜专用模型
SONIC和专门为行走设计的控制器OpenHomie进行了速度追踪对比:
| 指标 | OpenHomie(专用) | SONIC(通用) |
|---|---|---|
| 整体存活率 | 43.0% | 98.5% |
| >1.5m/s时存活率 | <20% | ~100%(至4m/s) |
这是一个非常反直觉但又极具说服力的结果:一个通用模型,在特定的行走任务上,击败了一个为此任务专门设计和优化的专家模型。
4.3 仿真到真实:几乎零差距
在真实Unitree G1机器人上测试了123个运动序列:
| 场景 | 成功率 | MPJPE-L |
|---|---|---|
| 仿真 | 100% | 22.3mm |
| 真实世界 | 99.2% | 25.7mm |
上半身误差差距极小(21.8mm vs 22.2mm),脚部的差距较大(29.0mm vs 53.7mm),反映了真实世界中足部接触动力学的复杂性。
4.4 抗干扰能力:11公斤重物砸下来也不倒
论文中展示了一个令人印象深刻的实验:在执行策略的过程中,一个约11公斤的重物从头部高度砸到机器人身上。机器人吸收冲击、保持平衡、继续执行运动——没有任何恢复模块或策略自适应。
五、最精彩的部分:VLA驱动的全身操控
这是SONIC最具前瞻性的贡献。SONIC的通用令牌空间被直接作为GR00T N1.5 VLA模型的“动作空间”。
为什么令牌空间比关节角度更适合VLA?
论文做了清晰的消融实验:
| VLA动作空间 | 平均成功率 | 最复杂任务(易拉罐回收入桶) |
|---|---|---|
| 直接预测SMPL姿态 | 27% | 0% |
| 预测FSQ通用令牌 | 68% | 60% |
原因:
- 离散令牌空间是低维、结构化的,VLA更容易学习
- 连续SMPL姿态空间会放大VLA的微小预测误差,导致灾难性失败
- 令牌空间天然对齐了所有输入模态,VLA看到的训练数据分布一致
五个真实任务展示
| 任务 | 接口类型 | 训练轨迹数 | 成功率 |
|---|---|---|---|
| 苹果放盘子(3点接口) | 3-point | 300 | 90% |
| 捡胡萝卜(全身接口) | whole-body | 3,900 | 75% |
| 捡清洁刷(全身接口) | whole-body | 3,900 | 95% |
| 踩踏板开垃圾桶(全身) | whole-body | 200 | 70% |
| 易拉罐回收(全身,5步复合) | whole-body | 1,000 | 60% |
| 电钻装箱搬运(全身) | whole-body | 300 | 70% |
其中“易拉罐回收”任务涉及走到桌前→单手拿起易拉罐→走到垃圾桶前→用脚踩踏板开盖→单手投掷入桶,要求手、脚、全身平衡的实时协调——这在过去是一个极难实现的全身操控场景。
六、为什么SONIC能成功?一个更深层的解释
论文在讨论部分给出了一个关键洞察,值得单独拿出来说:
运动追踪的规模化优势来源于其“密集逐帧监督”的性质。
这和其他方法形成了鲜明对比:
| 方法类型 | 监督性质 | 规模化结果 |
|---|---|---|
| 任务专用奖励 | 稀疏、任务特定 | 能力饱和,无法泛化 |
| 对抗式模仿 | 判别器信号随多样性下降 | 数据越多越容易模式崩溃 |
| 运动追踪 | 密集、逐帧明确 | 信号随数据增长而丰富,持续受益 |
简单说:其他方法在规模扩大时会“变傻”,而运动追踪是“越学越聪明”。
七、局限性与未来展望
当前局限
- 安全性与能效:目前没有对长时间部署中的安全性和能量效率做正式处理
- 极端运动失败:需要长时间、复杂地面接触的极端姿态(如僵尸爬行、盘腿坐)仍然会导致追踪失败
- 地面接触挑战:足部在真实世界中的精度(53.7mm)显著低于仿真(29.0mm),反映了接触动力学的复杂性
未来方向
SONIC的愿景是将自己定位为一个**“基础层”**。在这个基础上,未来可以构建更高层次的:
- 感知模块:理解和理解环境
- 推理模块:进行任务规划和决策
- 交互模块:与人类进行自然交互
这标志着通用人形机器人自主性的重要一步。
总结
SONIC是近年来人形机器人控制领域最具启发性的工作之一。它证明了:
- “规模化”的范式可以迁移到机器人控制领域——只要选对了“基础任务”
- 运动追踪是一个理想的基础任务——具备密集监督、数据丰富、信号稳定的特点
- 通用模型可以战胜专用模型——用42M参数训练的通用追踪器,在行走任务上完胜专用行走控制器
- 统一的令牌空间是关键设计——它连接了底层控制和高层VLA模型,是通往通用机器人智能的桥梁
对于行业从业者而言,SONIC提供了一个清晰的路线图:
与其为每一个新任务重新设计控制器,不如投入资源构建一个大规模的运动追踪模型,然后用它作为“通用操作系统”,在其上快速开发各种应用。
参考资料:
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)