Science Robotics:英伟达SONIC算法在宇树 G1 上实现全身规模化控制

SONIC 以规模化动捕追踪 + 统一 Token 实现人形通用全身控制
——数据、模型、算力三维度规模化训练
目录
近日,英伟达团队在《Science Robotics》发布SONIC框架,首次证实运动追踪可作为人形机器人的可扩展基础任务。
依靠数据、模型、算力三维度规模化训练,单一套通用策略即可实现行走、抓取、拳击、VR遥操作、语言驱动多类全身任务,在Unitree G1人形机完成仿真到真机完整落地,同赛道专用控制器、传统模仿学习方案对比下综合性能断层领先,补齐人形通用智能控制长期存在的规模拓展短板。

01 三维规模化训练体系:数据/模型/算力同步放大
SONIC从三个维度同步做规模扩容,也是其泛化能力的核心来源,整套训练消耗21000 GPU小时,采用128卡集群完成训练,底层动捕数据集规模、模型参数量、训练算力均大幅超越前人工作。
超大规模人体动捕数据集
训练集累计611小时动捕素材,超1亿帧50Hz动作数据,拆分33大类、8447个细分动作子类别,涵盖步态、舞蹈、格斗、工具操作、伤病步态、交互抓取等全部人类日常行为,配套两套严格划分的测试集:

▲动捕数据集划分与动作类别分布统计表
- test-content子集所有动作类型训练完全未出现,专门衡量模型零样本泛化能力;
- test-repetition是训练已有动作,但更换表演者与动作细节,测试稳定性。
同时额外引入PHUMA公开外部动捕数据集做跨管线鲁棒验证,完全规避训练数据分布过拟合问题。
数据处理阶段通过通用重定向工具将人体SMPL动作适配Unitree G1关节结构,过滤人形无法完成的爬楼、久坐等动作,同时公开子集BONES-SEED数据集(288小时、14万条标注动捕),供行业复现对比。
模型参数量梯度扩容
模型参数量从120万逐级放大至4200万,消融实验清晰证明规模收益线性提升:
- 最小1.2M模型在全新动作子集成功率仅98.0,关节误差27.7mm;
- 最大42M大模型全新动作跟踪成功率99.6,MPJPE-L局部关节误差压缩至23.8mm,陌生动作泛化能力提升幅度远高于常规动作。
缩放曲线可见,数据、模型、算力任意一维扩容,成功率持续上涨,不存在性能饱和瓶颈,这是对抗式模仿学习不具备的核心特性。

▲SONIC 模型规模缩放与多基准算法定量对比曲线
大规模分布式训练
训练算力分为2卡/4卡/128卡三档,统一迭代至5万轮,128卡集群训练总算力达21000 GPU小时。
更大批量平滑优化过程,降低局部最优陷阱,即便面对完全陌生的人体动作,也能稳定拟合运动规律。

▲单套通用策略实现 Unitree G 人形机器人全品类全身运动控制实拍图
02 两大核心创新模块:统一Token空间+实时运动规划
SONIC不只是单纯的跟踪模型,配套两套上层组件,把底层动捕大模型转化为可交互、多模态通用人形控制系统,所有输入最终统一为量化通用Token,一套解码器驱动机器人,无需针对遥操作、语言、抓取单独训练子策略。

▲SONIC整体通用控制框架图
多编码器+FSQ量化通用Token空间
架构设计彻底解决不同输入模态不兼容痛点,设置三类专用编码器并行处理不同运动信号:
- 机器人编码器:处理机器人自身关节时序;
- 人体编码器:解析SMPL人体全身动捕姿态;
- 混合编码器:仅输入头、手稀疏关键点(三视点VR模式),由模型补全下肢运动。
三类编码器输出隐向量通过有限标量量化FSQ压缩为统一通用Token,放弃VQ-VAE方案,消融实验显示FSQ在陌生动作关节误差降低8.7mm,不会出现码本坍塌问题。

训练加入对齐损失 、循环损失
,保证人体、机器人、混合运动编码后的Token分布高度重合,语言、VR、视频、手柄输入全部共享同一动作空间,无需单独重定向前。
- 对比实验:
直接预测SMPL原始人体姿态作为动作输出时,复杂手脚协同任务平均成功率仅27%;
预测FSQ通用Token平均成功率68%,高难度垃圾桶踩踏丢物任务差距扩大至60个百分点,量化低维表征大幅降低VLA视觉语言模型的学习难度。

▲模型关键模块消融实验定量结果(量化器 / 编码器对比)
实时自回归运动规划器
底层跟踪模型只能复刻已有动捕片段,自研实时运动生成器承接用户连续指令,实现交互式自由控制。规划器自回归生成0.8–2.4s时长运动片段,笔记本推理低于5ms,Jetson Orin机载仅12ms,每100ms即可根据新指令重规划,支持连续风格、速度调整。

▲交互式全身控制效果
支持多类无预训练交互动作:
- 全向移动:速度0–6m/s,支持醉酒、潜行、受伤等差异化步态;
- 蹲跪、匍匐狭小空间通行,骨盆高度连续可调;
- 连续拳击对抗,动作流畅无卡顿、动作切换无停顿。
规划器仅需要单条参考动作片段,就能插值生成全部过渡姿态,不需要为每种交互动作单独训练专家策略,大幅降低拓展新行为的成本。
03 多模态全场景落地能力
依托统一Token接口,SONIC打通四类人机控制通路,单套策略兼容遥操作、视频驱动、文本/音乐生成、VLA自主操作四大应用,所有场景共用42M大模型,无需微调。

▲多模态实时控制整机效果:视频 / 文本 / 音乐 / VR 全身遥操作
- 单目视频遥操作:
普通Webcam实时捕捉人体全身姿态,60fps生成机器人动作,无需专业动捕设备; - 文本/音乐生成动作:
自然语言指令直接生成全身运动(如单脚踢、猴子跳舞),音乐自动匹配舞蹈动作; - VR双模式遥操作:
全身追踪套件完整复刻人体姿态;仅头手追踪三视点模式由模型自主生成下肢行走、蹲跪动作,采集的VR数据可直接用于训练VLA模型; - VLA自主手脚协同操作:
对接GR00T N1.5视觉语言模型,完成五类复杂全身操作任务。

▲VLA 模型基于通用 Token 接口完成各任务成功率表
五类任务平均75%成功率,核心难点是行走、抓取、单腿平衡踩踏多动作串联,传统解耦手脚控制器极易失衡,SONIC全身统一表征天然同步四肢运动。
04 全面超越专用控制器、传统跟踪基线
对比主流动捕跟踪算法
选取GMT、Any2Track、BeyondMimic三类现有全身跟踪基线,在三类测试集统计跟踪成功率:
- test-content全新动作:SONIC 98.5%,BeyondMimic仅82.0%;
- 外部PHUMA跨数据集:SONIC 97.2%,Any2Track仅78.5%;
关节误差对比SONIC相较BeyondMimic降低42%,陌生人体动作拟合能力形成明显优势。

对标专用行走控制器OpenHomie
OpenHomie是行业成熟单任务人形行走控制器,专门优化下肢速度跟踪,但速度超过2m/s稳定性快速崩塌,4m以上存活率不足20%;
SONIC通用全身策略全程稳定,全速度区间存活率98.5%,既能高速奔跑,又能同步完成上肢抓取,专用控制器无法兼顾全身协同动作。
仿真到真机迁移表现
在124组未见过的全身动作真机测试,仿真成功率100%,真机99.2%;整体局部关节误差仿真22.3mm、真机25.7mm。
误差主要集中在足部(仿真29.0mm/真机53.7mm),源于真实地面接触动力学难以完全复刻,上半身仿真与真机误差仅0.4mm,上身动作迁移几乎无损耗。
05 赛道格局:SONIC 重塑人形控制技术路线
当前人形机器人控制分为两条主流路线:
一是单任务专用控制器,行走、抓取、交互分模块训练,泛化弱、拓展成本极高;
二是对抗式模仿学习,动作种类一多就出现模式坍塌,无法规模化。
SONIC第三条路线证明大规模动捕跟踪可以作为人形具身大模型的通用底座,复刻语言、视觉领域“规模涌现”的成功路径。

从工程落地层面,该框架对商用人形机器人有明确增益:
一套底层控制策略覆盖导航、遥操作、人机交互、自主抓取全产品线,大幅缩减多套控制器的开发与调试周期;VR采集的人体动作数据可直接训练视觉语言自主模型,打通远程示教到自主操作的数据闭环。
同时公开动捕数据集与训练代码,降低学术界、企业通用人形控制器的研发门槛。
但SONIC并非完全解决人形自主全部问题,它侧重运动执行层通用化,上层环境感知、长时序任务规划仍需要搭配视觉大模型。
Ref
论文标题:SONIC: Supersizing motion tracking for natural humanoid whole-body control
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)