【学习笔记】Kimodo:可扩展的可控人体运动生成
·
一、 研究背景与动机
-
问题定义:
- 高质量3D人体运动数据在机器人学(如人形机器人演示学习)、仿真(数字孪生)和娱乐(游戏、影视)领域的需求日益增长。
- 传统获取方式存在瓶颈:手工动画繁琐且需要专业技能;动作捕捉(Mocap)成本高昂、环境受限;遥操作(Teleoperation)速度慢且动作不自然;从视频中恢复3D运动(MoCap from Video)技术尚不成熟,质量有限。
-
现有生成模型的局限:
- 近年来,基于扩散模型(Diffusion)、掩码模型(Masked Model)等的生成模型虽能通过文本或关键帧约束生成运动,但受限于公开数据集的规模(如HumanML3D仅含约30小时数据),其运动质量、控制精度和泛化能力不足。
- 部分工作尝试用从视频中恢复的大规模数据来提升泛化性,但这往往以牺牲运动质量为代价(视频重建本身存在误差)。
-
Kimodo的定位:
- 核心主张:生成模型本身可以成为一种高质量、可控的运动数据获取新范式。
- 理想模型应具备:
- 运动质量媲美光学动捕。
- 提供像手工动画一样灵活,但更直观的控制接口(文本+运动学约束)。
- 能生成多样化的运动,支持广泛的应用。
二、 核心贡献与创新点
- 大规模高质量数据集:使用Bones Rigplay数据集,包含700小时的光学动捕数据,覆盖大量动作类型和风格,并配有高质量人工文本标注。这是模型性能的基石。
- 精心的运动表示(Motion Representation):
- 平滑根节点轨迹(Smoothed Root):不使用原始的骨盆投影,而是对水平分量进行平滑处理。这更符合动画师绘制路径的习惯,避免了骨盆自然摆动对路径约束的干扰(见图8)。
- 全局化表示(Global Representation):关节位置和旋转均采用世界空间表示(而非相对于根节点朝向或父关节的局部表示)。这有两大好处:
- 便于**直接输入(Imputation)**稀疏约束(如指定某帧某关节的世界坐标/旋转)。
- 避免了因根节点朝向突变(如翻跟头)导致的表示不连续性问题,提升了训练稳定性。
- 两阶段扩散去噪器架构(Two-Stage Transformer Denoiser)(见图9):
- 分解策略:将去噪过程分解为根节点运动预测和身体运动预测两个阶段,使用两个独立的Transformer编码器。
- 端到端交织训练:与以往两阶段方法(先生成完整根轨迹,再生成身体)不同,Kimodo的每一步去噪都包含两阶段,允许根和身体在整个过程中相互协调校正,最终结果更协调。
- 具体流程:
- 第一阶段(根节点去噪器):以带噪的完整运动(含约束)为输入,预测全局根节点轨迹。
- 第二阶段(身体去噪器):将预测的全局根轨迹转换为局部表示(速度、角速度等),并与带噪的身体特征拼接,再预测干净的身体运动。
- 设计考量:全局表示利于施加根约束,而局部表示(速度、高度)为身体预测提供了更稳定、不变的参照系,减少了足部滑移等伪影。
- 广泛的运动学约束支持:通过**直接输入(Imputation)**机制,在去噪的每一步将约束值直接覆盖到带噪运动序列的对应位置。支持的约束包括:
- 全身关键帧、末端执行器(手/脚)位置/旋转、2D根节点路径/路点、足部接触模式。这些约束可以任意混合使用。
三、 关键技术细节
- 运动表示的具体构成:
- 每个姿态帧由
[r^p, r^a, j^p, j^v, j^a, f]组成。 r^p:平滑后的全局根位置(水平平滑,垂直不变)。r^a:全局根节点朝向(用sin/cos表示)。j^p:全局关节位置(水平相对于平滑根,垂直是全局)。j^v:全局关节速度。j^a:全局关节旋转(用6D连续旋转表示)。f:足部接触标志(4个布尔值)。
- 每个姿态帧由
- 训练策略:
- 两阶段课程学习:
- 第一阶段(前50万步):纯文本到运动训练,打好基础。
- 第二阶段(后50万步):混合文本和约束训练,且约束数量(关键帧数)从1线性增加到20,模拟实际应用场景。
- 数据增强:
- 文本:用LLM(Qwen3-32B)对描述进行改写、风格化、组合,丰富文本多样性。
- 运动:将两个动作片段拼接,并用模型自身生成平滑过渡,增加动作组合的多样性。
- 无分类器引导(CFG):在推理时,分别对文本和约束施加引导强度(
w_text,w_constr),用户可独立调节两者的影响权重。
- 两阶段课程学习:
- 多提示词序列生成:通过生成重叠片段并施加全身关键帧约束来保证过渡平滑,从而实现长序列、多指令的动作生成。
四、 关键实验结果与分析
- 定量评估设置:
- 在Bones Rigplay的保留测试集(按动作类型划分,约5000个动作)上评估。
- 指标:文本-运动匹配度(R-precision)、运动质量(FID)、足部滑移(Foot Skate)、以及各类约束的精度误差。
- 消融实验(Ablation Study,表1):
- 两阶段vs.单阶段:单阶段模型足部滑移和约束误差显著增大,证明了分解预测的有效性。
- 局部根表示vs.全局根表示:在第二阶段使用局部表示,比使用全局表示足部滑移更小,证实了局部表示作为身体预测条件的优越性。
- 平滑根vs.原始骨盆根:使用平滑根能大幅减少足部滑移,虽然会使骨盆相对于约束路径的偏差略有增加(但这是为了运动自然性的必要取舍)。
- 额外“寄存器”Token:添加额外的零向量Token作为条件输入,能提升模型的表征能力和性能。
- 课程学习:分阶段训练比从零开始混合训练约束精度更高。
- 缩放规律分析(Scaling Analysis,表2):
- 数据量:数据量从10%增加到100%,约束精度和足部滑移指标显著提升,证明了数据规模对控制精度的重要性。
- 模型大小:从小(S)到大(L)(282M参数),所有指标均有提升,显示出模型容量增加带来的收益。
- 批量大小(GPU数量):使用更多GPU(从4到16)增大批量,能提升梯度估计的准确性,从而改善所有指标,尤其是文本跟随能力。
五、 应用与局限性
- 应用示例:
- 交互式运动创作:提供了基于Viser的图形界面,用户可在时间线上拖拽、指定文本和约束,实时生成运动(图2)。
- 机器人演示生成:将训练数据重定向到Unitree G1机器人,可直接生成机器人动作演示,用于训练物理仿真策略(图6)。这比传统遥操作或动捕高效得多。
- 未来挑战(作者视角):
- 混合数据源:如何有效利用互联网上大量但噪声较多的视频数据,同时保持模型输出质量。
- 实时/在线生成:当前模型是“离线”设计,生成需数秒。对于需要实时交互的机器人控制等应用,需探索潜在空间扩散或自回归模型。
- 场景与物体交互:目前是纯人体运动,未来需引入场景和物体约束,使生成的运动能真正与虚拟或物理世界互动。
六、 总结
Kimodo是一项系统性工程,通过大规模高质量数据、精心设计的运动表示、创新的两阶段去噪架构,在运动质量、控制精度和泛化能力上实现了显著突破。它不仅推动了可控人体运动生成领域的边界,更重要的是,它提供了一个实用、直观且高效的运动创作工具,并展示了在机器人领域的直接应用前景,为后续研究(特别是如何进一步扩展数据和模型)奠定了坚实基础。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)