导语:让人形机器人学会人类的运动技能,是机器人学中最迷人的挑战之一。但过去的路线总在“自然”与“通用”之间二选一:要么精心调教出单一动作却无法泛化,要么拥有通用性却动作僵硬、不像人类。2026年8月,一项发表在《Science Robotics》上的研究给出了一个全新的答案。来自斯坦福大学等机构的研究者提出了BeyondMimic框架——它不满足于“模仿”人类动作,而是让机器人从海量人类运动数据中学习动作的“分布”,然后在执行未知任务时,通过引导扩散在推理阶段实时合成从未见过的新动作。这个框架不仅让机器人完成了空翻、回旋踢、街舞等高度敏捷的动作,还让它能零样本地完成避障导航、遥控操作和动作补全等全新任务。更关键的是,整个流程不需要为每个新任务重新训练。

一、核心矛盾:自然性与通用性为何难以兼得?

人形机器人控制领域存在两条长期对立的技术路线。

基于模型的方法:用简化动力学和高低频分层控制来规划轨迹。计算可行,但运动学近似往往产生不自然的动作——恒定质心高度、膝盖永远弯曲。试图通过调整动量成本来改善,只能做局部调整,无法恢复全身的人性化协调。

基于学习的方法:特别是强化学习,能完成走路、爬楼梯、跑步等多样化运动。但成功依赖为每项任务手工设计的奖励函数,每加一个新技能就要重新设计一次。更糟的是,“自然”和“像人”很难写成显式的优化目标,因此手工奖励产出的动作往往带着连续踏步、弯膝盖和重撞击的机器感。

基于人类运动数据的学习——特别是运动追踪——提供了第三条路。DeepMimic等先驱工作证明了模仿人类动作的可行性,但每种动作需要单独调参,且无法泛化到训练集之外。

此后的两派尝试各有短板。层次控制路线(任务无关的运动追踪器+任务级规划器)能复用技能,但牺牲敏捷性和自然性,且由于训练解耦,常常出现“规划器-控制器不匹配”。多任务生成模型路线(如VAE)能组合技能,但依赖训练时的显式目标条件,遇到障碍避让、长程导航这类“隐式目标”就退化出抖动、不自然的动作。

BeyondMimic的核心洞察是:把“学习动作”和“利用动作”解耦成两个阶段。第一阶段,用统一的运动追踪配方从人类数据中学会海量敏捷且自然的技能。第二阶段,用潜在扩散模型学习这些技能的分布,然后在推理时通过分类器引导,让这个分布被“拉向”任何未见过的任务目标。这样,任务适应不再需要重新训练,而是变成了一次推理时的梯度优化。

二、第一阶段:一个配方,学会一切

BeyondMimic的第一阶段解决了“如何大规模学习多样化人类动作”的问题。

关键是一个统一的运动追踪配方——同一套奖励函数、观测空间、动作空间、域随机化和超参数,适用于所有动作,无需任何运动特定的调参。

训练数据是约2.5小时的人类运动捕捉。研究者在高保真仿真中验证了所有动作,并在真实机器人上部署了21个代表性片段(总计15分钟)。这些动作覆盖了完整的技能谱系:

  • 静态平衡:单腿站立、从不同姿态起身

  • 高动态:单腿跳跃、回旋踢、180°/360°旋转跳跃、空翻

  • 风格化表达:老年步态、舞蹈序列、体育动作

特别值得关注的是空翻——一项需要爆发性起跳、空中受控旋转和精准落地的技能。在真实森林环境中,机器人达到了31 m/s²的峰值加速度和15.7 rad/s的骨盆角速度(均值为7.01 rad/s)。作为对比,熟练人类空中动作的平均角速度约为7.75 rad/s。这意味着机器人在空翻中的敏捷性已经达到了人类水平。

更令人印象深刻的是连续执行能力。机器人可以连续完成五次C罗式庆祝跳跃转身,保持风格和稳定性。而此前的研究只能完成单次执行。

自然性也得到了量化验证。一项77人参与的用户研究,比较了BeyondMimic与宇树机器人的原生控制器。结果显示:70.8%的参与者认为BeyondMimic的动作“更像人类、更自然”。在跑步动作上,偏好率更是高达84.7%。

这个配方能成功的秘密,藏在几个看似“反直觉”的设计选择中。

精确执行器建模,而非堆叠域随机化。此前四足机器人的研究已经发现:精确的执行器建模能大幅简化强化学习公式并缩小仿真到现实的差距。BeyondMimic验证并扩展了这一原则到人形机器人。传统方案需要大量域随机化、手动增益调节和精细的正则化来对抗大的sim-to-real差距。BeyondMimic证明,这些大量启发式方法对人形机器人同样是不必要的——用合理的奖励设计、最小的域随机化和精心的系统实现,就能让一个配方学会上百种动作。

连续旋转表示(Rot6D),而非四元数。消融实验显示,用四元数表示旋转会导致更高的追踪误差甚至摔倒;而Rot6D的平滑连续形式显著改善了sim-to-real迁移。原因是:不连续的旋转表示会诱导不稳定映射,过拟合到仿真特有的相关性,在真实硬件上无法泛化。

无历史观测。通常加入时序历史有助于学习,但在BeyondMimic的最小域随机化设置中,加入历史反而降低了性能。研究者的解释是:历史可能让策略记住仿真特有的状态-动作模式,导致真实世界动力学的分布偏移更大。

极低延迟部署。消融实验显示,即使2ms的人工延迟也会增加速度误差,5ms导致一次摔倒,10ms导致三次中两次失败。这解释了为什么BeyondMimic特意用C++从零开发了实时执行框架,确保策略推理和硬件执行之间的精确同步。

三、第二阶段:让“动作分布”成为控制器

第一阶段学会了动作。第二阶段要回答的问题是:怎么把这些动作“拼”起来解决新任务?

BeyondMimic采用了一个潜在状态-动作扩散模型。这个模型学习的是动作的分布——不是具体的动作序列,而是“什么样的状态-动作轨迹构成协调的人类化运动”。

这个选择的深意在于:扩散模型天生支持分类器引导。在扩散模型的去噪过程中,可以通过梯度上升将生成过程导向任何可微分的目标函数。这意味着,当遇到一个新任务时,不需要重新训练——只需要定义一个任务成本函数,然后在推理时用这个成本函数引导扩散过程即可。

具体架构分为两层。第一层是一个VAE,通过DAgger从运动追踪策略中压缩出平滑的动作潜空间。第二层是状态-潜变量扩散模型,预测未来0.64秒的状态-动作轨迹。推理时,当前动作从去噪后的潜变量解码而来,实现滚动时域控制。

这个设计的精髓在于:它把“规划”和“控制”耦合在一个模型里。不像传统的“运动规划器+物理追踪器”的分层架构会引入规划器-控制器不匹配,BeyondMimic的扩散模型本身就具备预测能力——它预测的不仅是动作,还包括这些动作将导致的状态变化。因此,任务目标可以直接作用于预测的未来状态,通过扩散过程反向传播,生成相应的动作序列。

四、零样本任务适应:从未见过的目标,立即执行

第二阶段的能力在四个未见过的任务上得到了验证,全部是零样本部署,无需任何重新训练。

命令条件运动。通过简单的速度成本函数引导扩散过程,机器人能完成任意方向的速度追踪和路径点导航。在仿真中,行走和跑步的平均速度追踪误差分别为12.14%和13.65%。在真实机器人上,它能平稳完成超过50米的连续跑步。即使受到大幅外部冲击(如被踢),也能在保持追踪目标的同时快速恢复。

最有趣的是步态的自然涌现。速度指令相似时,策略可能产生两种不同的步态——稳定行走或轻快慢跑——两者都人类化且动态稳定。更值得注意的是,从行走到跑步的平滑过渡在运动数据中极少出现且没有标注,但机器人在任务需要时自然推理并复现了这个过渡。这就像人类通过情境和意图获得平滑技能过渡,而非通过显式技能标注。

动作补全与任务过渡。通过注入未来关键帧——每隔0.2秒一个期望姿态——扩散策略能驱动从行走平滑过渡到空翻,并将离散的关键帧补全为时间上连贯的连续轨迹。完成空翻后,控制器又能平滑回到命令条件行走。

这个能力的最强展示是四个连续空翻与前后行走进跑交替拼接的长程执行。这个演示不仅展示了模式切换的鲁棒性,更证明了在不同任务规格之间自由来回切换的能力——从速度追踪到动作补全,无需任何重新训练或微调。

任务组合。这是大多数目标条件控制器面临的难题:可能的目标组合太多,无法穷举。BeyondMimic的解决方案是:让多个目标在推理时被同时评估和优化。因为成本函数保持简单且任务特定,它们可以灵活相加而不产生需要大量调试的复杂目标。一个典型示例是避障导航:将路径点追踪成本与基于有符号距离场的避障成本相加,机器人在遇到障碍时自动绕行并到达目标点。同样的成本组合在用户输入偏离目标时依然有效。

五、为什么这个框架如此重要?

BeyondMimic的意义可以从三个层次来理解。

对运动学习的启示。它证明了一个反直觉的观点:精确的机械建模比堆叠域随机化更重要。当执行器模型足够准确时,强化学习公式可以被大幅简化,sim-to-real差距也被大幅缩小。这意味着,未来的人形机器人运动学习,应该把更多精力放在系统辨识和精确建模上,而非设计复杂的随机化策略和奖励塑形。

对技能泛化的启示。它提供了一条从“模仿”到“创造”的路径。模型不是记住了完整运动序列,而是学会了运动的内在分布。一旦掌握了这个分布,就可以通过推理时的梯度引导,生成训练中从未出现过的新动作序列。这是一种“学会了动作的语言,就能说出新句子”的能力。

对基础模型的启示。论文报告了一个值得关注的现象:BeyondMimic的开源代码已被社区广泛采用,成为多个公开RL库的默认方法,多家公司已在不同尺寸和驱动配置的机器人平台上独立复现了这个框架。后续工作SONIC采用了同样的运动追踪配方,扩展到超过700小时的运动捕捉数据和21000 GPU小时的计算量,证明了这个公式本身是可以规模化的。

这暗示了一条通向人形机器人行为基础模型的可能路径:一个从人类运动数据中学习、能泛化到不同运动、环境和目标的模型,而非为每项任务重新训练的策略。

六、局限与未来

BeyondMimic的局限同样值得关注。

状态估计依赖。扩散模型继承底层状态估计系统的质量,本体感觉误差会直接传播到生成的轨迹中。改进状态估计——通过传感器融合或学习式估计器——是一个有前景的方向。

预测视界有限。当前系统预测未来0.64秒的轨迹,足以支持反应式控制和局部避障,但不足以应对需要提前预判远处目标的长期规划任务。

历史依赖的双刃剑。时序历史对稳定预测至关重要,但也可能让模型在引导激活时陷入重复运动模式。目前通过加大引导权重来对抗,但这会在模式切换时破坏去噪稳定性。结果是在引导扩散下,机器人一旦进入稳定步态轨道就很稳定,但在运动开始和结束时容易踉跄。

细粒度目标处理不足。基于引导的优化适合粗粒度目标,但对细粒度目标效果欠佳,且需要轻量级的引导权重调试。未来可借鉴视觉领域的成熟方法,如监督微调和适配器式控制层,来实现细粒度的可组合轨迹控制。

结语

BeyondMimic最深刻的意义,在于它重新定义了“从人类学习”这件事。

过去的范式是:让机器人模仿人类的每一个动作。BeyondMimic的范式是:让机器人学习人类动作背后的分布规律,然后在新任务中从这个分布中“生成”合适的动作。

这个转变看似微妙,实则根本。模仿是被动的复制,而生成是主动的创造。当机器人学会了动作的“语言”而不仅仅是“句子”,它就开始拥有了一种类似于人类的运动智能——能根据情境和意图,灵活地调用、组合和改造自己已掌握的技能。

正如论文中所言:“这项工作的目标,是迈向人形机器人行为的基础模型——一个直接从人类示范中学习、能泛化到不同运动、环境和目标的模型。”BeyondMimic朝这个方向迈出了实质性的一步。当机器人不再只是“复读机”,而是“能说话的人”时,它才真正开始理解人类的运动语言。

论文信息

标题:BeyondMimic: From motion tracking to versatile humanoid control via guided diffusion

作者:Qiayuan Liao, Takara E. Truong, Xiaoyu Huang, Yuman Gao, Guy Tevet, Koushil Sreenath, C. Karen Liu

机构:斯坦福大学等

期刊:Science Robotics, 2026年8月26日,第11卷第117期

DOI:10.1126/scirobotics.adx8924

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐