【Science Robotics 2026】SONIC:把运动跟踪做强做大,得到自然的人形全身控制|从人形机器人全身控制视角
摘要
本文解读 Science Robotics 2026 论文《SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control》。该论文提出 SONIC,把运动跟踪确立为人形机器人全身控制的可规模化基础任务:用 1 亿帧以上动捕数据(约 700 小时)、120 万到 4200 万参数的策略网络与 128 张 GPU / 2.1 万 GPU 小时的算力沿三条轴线同时放大,以逐帧密集监督替代人工奖励工程。其特别之处在于,作者用一个离散的通用 token 空间把机器人关节序列、SMPL 人体姿态与稀疏遥操作关键点压到同一个表示,使同一个策略能同时接受手柄、VR、视频、文本、音乐与 VLA 指令。实验表明 test-content(未见动作内容)成功率 99.6%、跨重定向管线基准 PHUMA 97.2%,0–5 m/s 速度跟踪生存率 98.5%(专才控制器 OpenHomie 仅 43.0%),并在 Unitree G1 真机上以 99.2% 成功率完成 124 条动作。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control |
| 标题(中文) | SONIC:把运动跟踪做强做大,得到自然的人形全身控制 |
| 作者 | Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Fernando Castañeda, Sirui Chen, Zi-Ang Cao, Jiefeng Li, David Minor, Qingwei Ben, Jinhyung Park, Zi Wang, Xingye Da, Runyu Ding, Tairan He, Haoru Xue, Wenli Xiao, Jan Kautz, Yan Chang, Umar Iqbal, Linxi "Jim" Fan, Yuke Zhu(前五位为共同一作,末两位共同指导) |
| 机构 | NVIDIA(GEAR / DAIR 实验室,Santa Clara) |
| 会议 | Science Robotics,Vol. 11, Issue 117(2026);DOI 10.1126/scirobotics.aed4592 |
| arXiv | arXiv:2511.07820 |
| 项目网站 | nvlabs.github.io/GEAR-SONIC |
背景与动机
为什么人形控制一直没有 scale?
过去十年,语言模型在 25,000 张以上的 GPU 上训练、见过数万亿 token,视觉生成模型处理了数十亿张图像,规模带来的涌现能力一再被验证。但仿真到现实的人形控制没有出现类似的曲线:主流控制器仍是百万参数级、单机训练、几天收敛,有时甚至要靠早停来防止过拟合;每个新能力(走路、跳舞、起身、遥操作)都要重新设计一套奖励函数。作者把根因归到任务选择上——走路这类任务的奖励天然给不出跳舞和起身的信号,规模越大,手工对齐奖励的成本越高。
生成式模仿(AMP、ASE、CALM)曾被视为出路:它们用判别器把动作分布匹配变成统一目标,不需要逐任务写奖励。但判别器的训练信号会随数据多样性退化——数据越杂、越接近真实分布,判别器越难区分真假,反馈越弱,最终走向模式坍塌。所以"数据更多"在对抗式框架下反而让优化更难。
SONIC 的关键洞察是:人形机器人的形态与人类同构,因此可以直接使用几十年的运动捕捉积累;而运动跟踪(让机器人复现一段参考动作)本身就是一个逐帧稠密、无需奖励工程的监督任务。沿着这个思路,"运动跟踪能不能像语言模型一样放大"就成了一个可以用实验回答的问题,而不是一句愿景。
从 DeepMimic 到可规模化的跟踪
2018 年的 DeepMimic 第一次用强化学习加参考动作片段做物理仿真动作模仿,开启了动捕驱动控制的路线;2021–2023 年的 AMP、ASE、CALM 用对抗式目标统一了奖励设计,但规模上不去;2023–2025 年,PHC、OmniH2O、HOVER、GMT、BeyondMimic 让单策略能学的动作从几十条涨到数千条,跟踪器开始"通用",却仍是小模型、单机训练。2026 年,SONIC 把跟踪当成可缩放任务并做到 1 亿帧、4200 万参数、128 张卡,同时用通用 token 把它接到运动规划器与 VLA 上。数据侧,作者所在动捕库中的 142,220 条、288 小时(522 位演员)已经以 BONES-SEED 之名在 Hugging Face 开源,同时提供 SOMA 与 Unitree G1 两种格式,为后续工作提供了可直接复用的基座。
研究主线:从问题到结论

图 11:SONIC 的研究主线(Mermaid 流程图)。 从「人形控制难缩放」这一问题出发,识别出根因是逐任务设计奖励,进而把运动跟踪确立为可规模化的基础任务,落到三编码器加通用 token 的具体设计,最后用三条缩放轴与三个测试集验证,并给出通用策略反超专才控制器的结论。
基准/方法设计
三条缩放轴与"训练后指定任务"
SONIC 的设计可以概括成一句话:一个策略、三个编码器、一个通用 token。运动命令分三类——机器人关节序列 $g_r$、SMPL 人体姿态 $g_h$、以及"头手关键点 + 下肢机器人运动"的混合命令 $g_m$,分别由三个多层感知机编码器(隐层 2048-1024-512-512)映射到共享隐空间,再经量化器压成一个离散的通用 token $z$。这个 token 同时驱动两个解码器:控制解码器输出 29 维关节目标指令,辅助的运动解码器重建机器人运动,充当隐式的"人到机器人"重定向模块。
量化选型上,作者用有限标量量化(FSQ)而不是常见的 VQ-VAE,原因有三点:FSQ 没有码本坍塌、不需要 commitment 损失和码本指数滑动平均、直通梯度可与 PPO 联合优化。在 33 个主类别、8,447 个子类的动作分布下,码本坍塌是真实风险。消融显示,同容量的多头 VQ-VAE 在 test-content 上的局部关节误差是 35.3 mm,FSQ 是 26.6 mm,相差 8.7 mm。
这套表示带来一个工程上非常重要的性质:训练完成之后才指定任务。要换一个新技能,只需要在上游换一个运动来源(一段代表性动作片段、一个规划器模式,或一个 VLA),控制策略本身完全不动。

图 1:SONIC 用一个通用控制策略覆盖多种任务。 同一个策略既能跟踪精细的全身动作,也能被规划器、遥操作与 VLA 驱动,差异只在输入接口而不在控制器本身。
分类全景

图 12:SONIC 的通用接口结构(Mermaid 分类图)。 机器人运动、人体 SMPL 姿态与混合关键点三类命令各配一个专用编码器,映射到共享隐空间并量化成通用 token;该 token 再驱动控制解码器输出 29 维关节目标、驱动运动解码器完成隐式人到机器人重定向。
方法细节
形式化、状态与奖励
跟踪被建模成标准马尔可夫决策过程,用 PPO 最大化折扣回报。策略输出目标关节位置(动作维度 29),交由关节级 PD 控制器执行,这样策略不必直接处理力矩层面的高频动力学。
状态由两部分组成:本体感知与运动命令。本体感知包含关节位置、关节速度、根角速度、根坐标系下的重力向量与上一步动作,取 10 帧历史拼接,给策略提供时序上下文与预判能力;运动命令则是上述三类 $g_r$、$g_h$、$g_m$ 之一。奖励由跟踪项(根与全身连杆的位姿、速度误差,含头、腕、踝末端)加平滑与稳定惩罚项组成,不需要逐任务设计。

图 2:方法总览(左半)。 四类任务(手柄、VR 三点、全身 VR、视频与多模态)经网络运动规划器、PICO VR 工具链与 GEM 运动生成器,产生机器人运动、混合运动与人类运动三种命令。

图 3:方法总览(右半)。 三种命令各配一个专用编码器,映射到共享隐空间后经量化器压成通用 token,再由机器人控制解码器与运动解码器分别输出关节指令与机器人运动。
四项损失与训练细节
训练用一个总目标把所有组件绑在一起:$\mathcal{L} = \mathcal{L}{\text{ppo}} + \mathcal{L}{\text{recon}} + \mathcal{L}{\text{token}} + \mathcal{L}{\text{cycle}}$。其中重建损失要求三种 token 都能重建出机器人运动——当输入是人体动作时,这一项等价于把"人到机器人重定向"写进损失;token 对齐损失约束三个编码器输出两两接近;循环一致性损失 $|\mathcal{E}_r(\mathcal{D}_r(z_h)) - z_r|^2$ 把人体 token 解码回机器人运动后再编码一次做校验。
训练使用非对称 actor-critic:评论家可以看到特权信息(基座线速度、全身连杆位姿、无噪声观测),执行者只看部署时真正可得的量。采样上采用基于分桶的自适应策略,按封顶后的失败率给困难动作加权。PPO 的关键超参是每卡 4096 个并行环境、每环境 24 步、$\gamma=0.99$、GAE $\lambda=0.95$、裁剪系数 0.2、熵系数 0.013、actor 学习率 $2\times10^{-5}$、critic 学习率 $1\times10^{-3}$、目标 KL 0.01。
部署:机载多速率架构
真机栈全部跑在机载 Jetson Orin 上,用 TensorRT 加 CUDA Graph 加速:策略前向 1–2 ms,运动生成约 12 ms。系统是四路并发循环——控制循环 50 Hz、指令下发 500 Hz、操作输入 100 Hz、运动规划 10 Hz,各线程按"最新数据优先"读取受读写锁保护的状态快照,避免某一路延迟拖垮整条链路。安全侧持续检查数据新鲜度、关节速度上限、电机错误与温度、流同步以及指令的 CRC32 校验;一旦触发停止,所有关节进入纯阻尼模式($K_p=0$、$K_d=8$ Nm·s/rad),让机器人顺势顺从(完整部署架构见 图 10)。
实验设计与结果
评测协议与数据集
训练数据共 31.7 万条片段、611 小时、8,447 个子类。评测构造三个测试集:test-content 含 182 个训练中完全没出现过的子类(7,016 条、15 小时),考分布外泛化;test-repetition 用见过的动作类型但全新表演(9,395 条、12 小时);外部基准 PHUMA 有 68,326 条动作,来自另一套重定向管线。指标上,成功率定义为根高或末端高度偏离参考不超过 0.25 m,另有局部关节误差 MPJPE-L(14 个身体连杆,单位 mm)以及速度与加速度距离。缩放曲线每个配置取 6 个评估检查点的均值与标准差,显著性用 Welch $t$ 检验,匹配比较用配对 $t$ 检验。
| 统计项 | 训练集 | test-content | test-repetition |
|---|---|---|---|
| 片段数 | 317,189 | 7,016 | 9,395 |
| 总时长(小时) | 611 | 15 | 12 |
| 唯一子类 | 8,447 | 182 | 1,088 |
| 与训练子类重叠 | — | 0% | 100% |
| 与训练片段重叠 | — | 0% | 0% |

图 4:训练数据采样示例(附录 A)。 每条动作都被重定向到 Unitree G1,覆盖移动、舞蹈、体育、格斗、手势与物体交互等 33 个类别——数据多样性本身就是可拓展轴之一。
三条缩放轴
| 缩放轴 | 配置范围 | 结果 |
|---|---|---|
| 数据规模 | 400 万 → 1 亿帧(2 万 → 31.7 万条片段) | 按子类均匀抽样保持多样性,成功率单调上升,OOD 增益最大 |
| 模型规模 | 120 万 → 1600 万 → 4200 万参数 | 42M:99.6% / 23.8 mm;1.2M:98.0% / 27.7 mm |
| 计算规模 | 16 → 32 → 128 张 GPU(2 千 → 2.1 万 GPU 小时) | 同为 5 万迭代时,更多卡带来更好的渐近性能 |

图 5:缩放与基准(正文图 2)。 A–C 为数据、模型、计算三条轴在 test-content(OOD)与 test-repetition 上的曲线;D–G 与基线跟踪器的成功率、MPJPE-L、速度与加速度距离对比;H–J 与专才控制器 OpenHomie 的速度跟踪对比;K–L 为仿真到真机的迁移。
与基线跟踪器和专才控制器的对比
| 方法 | test-content | test-repetition | PHUMA | MPJPE-L (mm) |
|---|---|---|---|---|
| SONIC | 98.5% | 99.2% | 97.2% | 23.7 |
| BeyondMimic | 82.0% | 85.4% | 73.8% | 40.9 |
| Any2Track | 61.6% | 69.4% | 78.5% | — |
跟踪精度上 SONIC 的局部关节误差相对 BeyondMimic 降低 42%。需要说明口径:几个基线各自在不同源数据与重定向上训练,因此这组对比主要反映跨数据集泛化与规模效应。在 0–5 m/s 的速度跟踪对比中,SONIC 的生存率是 98.5%(197/200),为速度跟踪专门调优的 OpenHomie 只有 43.0%(86/200);后者在约 2 m/s 之后开始劣化,超过 2.5 m/s 生存率跌到 20% 以下。更有意思的是专家自身的缩放:OpenHomie 从 1 张卡扩到 32 张卡,性能在 8 张卡见顶(误差 0.18 m/s、生存率 95.0%),继续加卡反而退化到 0.29 m/s 与 91.2%。
下游应用:规划器、多模态与 VLA
实时规划器把跟踪变成可交互系统:它把运动生成写成动作插值,自回归地生成 0.8–2.4 秒的片段,笔记本上推理不到 5 ms、机载约 12 ms,最快每 100 ms 重规划一次;支持 0–6.0 m/s 的任意速度与方向、醉酒/受伤/开心/潜行等风格、骨盆高度 0.3–0.8 m 的蹲跪、0–0.5 m/s 的爬行与连续拳击。这些应用全部是训练完成之后才指定的,规划器与策略都不再训练。

图 6:交互式全身控制(正文图 3)。 同一个策略在实时规划器驱动下完成不同速度、方向与风格(醉酒 / 受伤 / 开心 / 潜行)的导航,任意骨盆高度的蹲、跪、爬,以及连续的拳击动作。
| VLA 任务 | 接口 | 训练轨迹 | 成功率 |
|---|---|---|---|
| 苹果放到盘子 | 3 点 | 300 | 90% |
| 抓取胡萝卜 / 刷子 | 全身 | 3,900 | 75% / 95% |
| 用脚踩踏板开垃圾桶 | 全身 | 200 | 70% |
| 汽水罐丢垃圾桶(五步串联) | 全身 | 1,000 | 60% |
| 搬箱子到货架 | 全身 | 300 | 70% |
| 平均(5 个任务) | 75% |
VLA 侧,GR00T N1.5 预测 78 维动作(64 维通用 token + 14 维手部关节)。动作空间消融更能说明通用 token 的价值:用 FSQ token 平均成功率 68%,直接预测 SMPL 姿态只有 27%,在汽水罐任务上是 60% 对 0%——高维连续姿态空间会把小预测误差放大成不安全、抖动大的动作。

图 7:VLA 驱动的移动操作(正文图 5)。 从苹果放到盘子(3 点接口)到踩踏板开垃圾桶、汽水罐五步串联与搬箱子,全部由 GR00T N1.5 通过通用 token 接口自主执行。
消融证据
量化器方面,FSQ 相比同容量的多头 VQ-VAE 在 test-content 上把局部关节误差从 35.3 mm 降到 26.6 mm;token 维度比量化级数更重要(32-32 配置优于 16-32 与 32-16)。编码器方面,三个编码器成功率都超过 99.2%,人类编码器仅比机器人编码器差 0.6 mm(24.4 mm 对 23.8 mm),这是"用人类动捕训练人形"最直接的可行性证据;混合编码器因为只有稀疏的上肢关键点,误差是 26.5 mm。
| 配置 | 内容 SR | 内容 MPJPE-L | 重复 SR | 重复 MPJPE-L |
|---|---|---|---|---|
| FSQ(本文) | 99.3% | 26.6 | 99.6% | 25.5 |
| VQ-VAE | 98.7% | 35.3 | 99.3% | 32.2 |
| 机器人编码器 | 99.6% | 23.8 | 99.8% | 22.5 |
| 人类编码器 | 99.6% | 24.4 | 99.8% | 23.1 |
| 混合编码器 | 99.2% | 26.5 | 99.7% | 25.2 |

图 8:一致性损失对齐多编码器隐空间(附录 B)。 以爬行动作为例,左为有 token 对齐与循环一致性损失时的编码器间对角 L2 距离与交叉距离矩阵,右为去掉一致性损失后的结果——匹配帧之间不再对齐,偏差放大约 8 倍。
真机结果与鲁棒性
真机在 Unitree G1(29 个驱动关节)上评测 124 条动作,成功率 99.2%(123/124),仿真同集为 100%;整体局部关节误差 25.7 mm(仿真 22.3 mm),上半身 22.2 对 21.8 mm 几乎无损,脚部 53.7 对 29.0 mm——仿真到现实的残差几乎全部集中在脚上。抗扰实验中,约 11 kg 的重物从头顶上方落下砸中机器人,机器人吸收冲击后继续跟踪,未启用任何恢复模块。失败案例也值得记下:僵尸爬超出人形运动学极限,盘腿坐要求远离训练分布的持续地面接触。

图 9:真机评测集代表动作(附录 D)。 124 条动作覆盖嘻哈舞、谢幕鞠躬、跳高、踢腿、蹲行与匍匐,图中所示动作全部在真实 Unitree G1 上成功跟踪。

图 10:部署架构(附录 E)。 初始化阶段先把机器人插值到站立姿态并等待操作者确认;运行时 100 Hz 输入接口、10 Hz 运动规划、50 Hz 控制循环与 500 Hz 指令下发四路并发,安全监控持续检查数据新鲜度、关节速度上限、电机错误与温度、流同步与 CRC32 校验。
结果对比总结

图 13:SONIC 的关键结果链(Mermaid 流程图)。 未见动作内容上 99.6% 成功率,跨重定向管线的 PHUMA 上 97.2%,速度跟踪生存率 98.5% 对比专才控制器 43.0%,VLA 五个任务平均 75%,真机 124 条动作 99.2%——从仿真指标一路贯穿到真机部署。
关键发现
- 规模收益真实且可预测:数据从 400 万帧加到 1 亿帧、模型从 120 万加到 4200 万参数、算力从 16 卡加到 128 卡,三条轴的成功率单调上升,最小到最大配置的差异全部统计显著(Welch $t$ 检验,$P \leq 0.011$)。
- 泛化增益大于记忆增益:最难的 test-content(182 个训练中缺席的子类)上,最大模型做到 99.6% 成功率与 23.8 mm 局部关节误差,而最小模型只有 98.0% 与 27.7 mm;跨重定向管线的 PHUMA 基准仍有 97.2%。
- 通用策略反超专才控制器:0–5 m/s 速度跟踪生存率 98.5% 对 43.0%,且专才路线自身在 8 张卡就见顶——瓶颈不在算力,而在单任务奖励会很快饱和。
- 通用 token 是能被下游使用的动作空间:VLA 预测 FSQ token 比预测 SMPL 姿态平均高 42 个百分点(68% 对 27%),汽水罐任务上 60% 对 0%;统一 token 让 VLA 能同时预测手和脚,因此"用脚踩踏板"这类任务才得以成立。
- 规模带来工程可用性:策略前向 1–2 ms、重规划最快 100 ms、真机 124 条动作 99.2% 成功率、抗 11 kg 冲击而无需恢复模块——不需要为鲁棒性单独训练一套策略。
- 创新模式视角(附录 C):论文同时命中"审计并扭转负载假设"(把子领域默认的"人形控制不可大规模训练"换成稠密监督的跟踪任务)、"统一异构模态到同一表示空间"与"刻画极限然后超越"三种在顶会语料中被反复验证的创新模式,且每一种都配了受控对照实验。
局限性
- 安全与能效缺乏形式化处理:作者明确承认没有对长时间部署的安全性与能量效率做形式化分析,这对真实产品是硬约束。
- 极端动态下仍可能失衡:跟踪器靠对运动命令的域随机化与弹簧模型过滤不合理指令来获得鲁棒性,但更极端的条件或极剧烈动作下仍会失稳。
- 地面接触类动作仍是短板:附录给出的失败案例是"僵尸爬"(超出人形运动学极限)与"盘腿坐"(远离训练分布的持续地面接触构型)。
- 基线对比口径不完全对齐:各方法训练数据与重定向管线不同,论文把它定位为跨数据集泛化与规模效应的对比,而非严格数据匹配的基准。
- 脚部精度是仿真到现实的主要残差:53.7 mm 对 29.0 mm 的脚部误差说明精确落脚本质上是接触动力学问题,不会只靠加数据解决。
- 表述与口径上的观察(附录 F):论文主结论多用 "up to / steadily" 这类上界表述,负面分项(脚部误差、失败案例)主要放在补充材料展开;"用动捕做预训练"这一历史定位由数据、接口与开源三件事共同支撑,而摘要中的强表述都由实测曲线与显著性检验兜底。
常见问题(FAQ)
SONIC 到底是什么?
SONIC 是 NVIDIA 提出的通用人形全身控制策略:它把"运动跟踪"当作可缩放的基础任务,用超过 1 亿帧动捕数据与 128 张 GPU 训练出一个 4200 万参数的策略,再用实时运动规划器与统一的离散 token 接口,让同一个策略接受手柄、VR、视频、文本、音乐以及 VLA 模型的指令。
它和 BeyondMimic、GMT、Any2Track 这些跟踪器有什么不同?
那些工作把跟踪器做得更通用,但没有回答"能不能放大"这个问题,也都停留在小模型、单机训练的量级。SONIC 系统性地扫描了数据、模型规模与算力三条轴,并给出统计显著的缩放曲线;在跨数据集对比中,它在三个测试集上的成功率是 98.5% / 99.2% / 97.2%,对比 BeyondMimic 的 82.0% / 85.4% / 73.8%。
为什么用 FSQ 而不是 VQ-VAE?
因为 FSQ 不存在码本坍塌,也不需要 commitment 损失和码本指数滑动平均,直通梯度还能和 PPO 联合优化。在 33 类、8,447 个子类的多样分布下这点尤其重要:消融显示同容量的多头 VQ-VAE 在 test-content 上的局部关节误差比 FSQ 高 8.7 mm。
通用 token 空间的实际收益是什么?
两个:一是让"训练后指定任务"成为可能,换技能只需换上游运动来源,策略不用重训;二是让 VLA 学得动——预测 FSQ token 比直接预测 SMPL 姿态平均高 42 个百分点,而且因为 token 描述全身,VLA 可以同时预测手和脚,完成"用脚踩踏板开垃圾桶"这类任务。
真机上表现如何?
在 Unitree G1(29 个驱动关节)上评测 124 条动作,成功率 99.2%,整体局部关节误差 25.7 mm(仿真 22.3 mm);所有推理跑在机载 Jetson Orin 上,策略前向 1–2 ms。把约 11 kg 的重物从头顶上方砸落,机器人能吸收冲击并继续跟踪,没有启用恢复模块。
主要局限是什么?
作者指出缺少对安全性与能量效率的形式化处理,极端动态下仍可能失衡,需要持续地面接触的动作(如盘腿坐)仍是短板;另外脚部误差明显大于上半身(53.7 mm 对 22.2 mm),说明精确落脚仍是接触动力学问题。
参考链接
- 论文(Science Robotics 2026 / arXiv):SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
- 项目主页(含全部演示视频):nvlabs.github.io/GEAR-SONIC
- 代码与文档:NVlabs/GR00T-WholeBodyControl
- 开源数据:BONES-SEED(142,220 条 / 288 小时动捕,522 位演员)
- 关键基线:BeyondMimic (arXiv:2508.08241)、GMT (arXiv:2506.14770)、Any2Track (arXiv:2509.13833)
- 专才控制器对比:HOMIE (RSS 2025)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)