一、 研究背景与动机
  1. 问题定义

    • 高质量3D人体运动数据在机器人学(如人形机器人演示学习)、仿真(数字孪生)和娱乐(游戏、影视)领域的需求日益增长。
    • 传统获取方式存在瓶颈:手工动画繁琐且需要专业技能;动作捕捉(Mocap)成本高昂、环境受限;遥操作(Teleoperation)速度慢且动作不自然;从视频中恢复3D运动(MoCap from Video)技术尚不成熟,质量有限。
  2. 现有生成模型的局限

    • 近年来,基于扩散模型(Diffusion)、掩码模型(Masked Model)等的生成模型虽能通过文本或关键帧约束生成运动,但受限于公开数据集的规模(如HumanML3D仅含约30小时数据),其运动质量、控制精度和泛化能力不足。
    • 部分工作尝试用从视频中恢复的大规模数据来提升泛化性,但这往往以牺牲运动质量为代价(视频重建本身存在误差)。
  3. Kimodo的定位

    • 核心主张:生成模型本身可以成为一种高质量、可控的运动数据获取新范式
    • 理想模型应具备
      1. 运动质量媲美光学动捕。
      2. 提供像手工动画一样灵活,但更直观的控制接口(文本+运动学约束)。
      3. 能生成多样化的运动,支持广泛的应用。

二、 核心贡献与创新点
  1. 大规模高质量数据集:使用Bones Rigplay数据集,包含700小时的光学动捕数据,覆盖大量动作类型和风格,并配有高质量人工文本标注。这是模型性能的基石。
  2. 精心的运动表示(Motion Representation)
    • 平滑根节点轨迹(Smoothed Root):不使用原始的骨盆投影,而是对水平分量进行平滑处理。这更符合动画师绘制路径的习惯,避免了骨盆自然摆动对路径约束的干扰(见图8)。
    • 全局化表示(Global Representation):关节位置和旋转均采用世界空间表示(而非相对于根节点朝向或父关节的局部表示)。这有两大好处:
      • 便于**直接输入(Imputation)**稀疏约束(如指定某帧某关节的世界坐标/旋转)。
      • 避免了因根节点朝向突变(如翻跟头)导致的表示不连续性问题,提升了训练稳定性。
  3. 两阶段扩散去噪器架构(Two-Stage Transformer Denoiser)(见图9):
    • 分解策略:将去噪过程分解为根节点运动预测身体运动预测两个阶段,使用两个独立的Transformer编码器。
    • 端到端交织训练:与以往两阶段方法(先生成完整根轨迹,再生成身体)不同,Kimodo的每一步去噪都包含两阶段,允许根和身体在整个过程中相互协调校正,最终结果更协调。
    • 具体流程
      1. 第一阶段(根节点去噪器):以带噪的完整运动(含约束)为输入,预测全局根节点轨迹。
      2. 第二阶段(身体去噪器):将预测的全局根轨迹转换为局部表示(速度、角速度等),并与带噪的身体特征拼接,再预测干净的身体运动。
      • 设计考量:全局表示利于施加根约束,而局部表示(速度、高度)为身体预测提供了更稳定、不变的参照系,减少了足部滑移等伪影。
  4. 广泛的运动学约束支持:通过**直接输入(Imputation)**机制,在去噪的每一步将约束值直接覆盖到带噪运动序列的对应位置。支持的约束包括:
    • 全身关键帧、末端执行器(手/脚)位置/旋转、2D根节点路径/路点、足部接触模式。这些约束可以任意混合使用。

三、 关键技术细节
  1. 运动表示的具体构成
    • 每个姿态帧由 [r^p, r^a, j^p, j^v, j^a, f] 组成。
    • r^p:平滑后的全局根位置(水平平滑,垂直不变)。
    • r^a:全局根节点朝向(用sin/cos表示)。
    • j^p:全局关节位置(水平相对于平滑根,垂直是全局)。
    • j^v:全局关节速度。
    • j^a:全局关节旋转(用6D连续旋转表示)。
    • f:足部接触标志(4个布尔值)。
  2. 训练策略
    • 两阶段课程学习
      • 第一阶段(前50万步):纯文本到运动训练,打好基础。
      • 第二阶段(后50万步):混合文本和约束训练,且约束数量(关键帧数)从1线性增加到20,模拟实际应用场景。
    • 数据增强
      • 文本:用LLM(Qwen3-32B)对描述进行改写、风格化、组合,丰富文本多样性。
      • 运动:将两个动作片段拼接,并用模型自身生成平滑过渡,增加动作组合的多样性。
    • 无分类器引导(CFG):在推理时,分别对文本和约束施加引导强度(w_text, w_constr),用户可独立调节两者的影响权重。
  3. 多提示词序列生成:通过生成重叠片段并施加全身关键帧约束来保证过渡平滑,从而实现长序列、多指令的动作生成。

四、 关键实验结果与分析
  1. 定量评估设置
    • 在Bones Rigplay的保留测试集(按动作类型划分,约5000个动作)上评估。
    • 指标:文本-运动匹配度(R-precision)、运动质量(FID)、足部滑移(Foot Skate)、以及各类约束的精度误差。
  2. 消融实验(Ablation Study,表1)
    • 两阶段vs.单阶段:单阶段模型足部滑移和约束误差显著增大,证明了分解预测的有效性。
    • 局部根表示vs.全局根表示:在第二阶段使用局部表示,比使用全局表示足部滑移更小,证实了局部表示作为身体预测条件的优越性。
    • 平滑根vs.原始骨盆根:使用平滑根能大幅减少足部滑移,虽然会使骨盆相对于约束路径的偏差略有增加(但这是为了运动自然性的必要取舍)。
    • 额外“寄存器”Token:添加额外的零向量Token作为条件输入,能提升模型的表征能力和性能。
    • 课程学习:分阶段训练比从零开始混合训练约束精度更高。
  3. 缩放规律分析(Scaling Analysis,表2)
    • 数据量:数据量从10%增加到100%,约束精度和足部滑移指标显著提升,证明了数据规模对控制精度的重要性。
    • 模型大小:从小(S)到大(L)(282M参数),所有指标均有提升,显示出模型容量增加带来的收益。
    • 批量大小(GPU数量):使用更多GPU(从4到16)增大批量,能提升梯度估计的准确性,从而改善所有指标,尤其是文本跟随能力。

五、 应用与局限性
  1. 应用示例
    • 交互式运动创作:提供了基于Viser的图形界面,用户可在时间线上拖拽、指定文本和约束,实时生成运动(图2)。
    • 机器人演示生成:将训练数据重定向到Unitree G1机器人,可直接生成机器人动作演示,用于训练物理仿真策略(图6)。这比传统遥操作或动捕高效得多。
  2. 未来挑战(作者视角)
    • 混合数据源:如何有效利用互联网上大量但噪声较多的视频数据,同时保持模型输出质量。
    • 实时/在线生成:当前模型是“离线”设计,生成需数秒。对于需要实时交互的机器人控制等应用,需探索潜在空间扩散或自回归模型。
    • 场景与物体交互:目前是纯人体运动,未来需引入场景和物体约束,使生成的运动能真正与虚拟或物理世界互动。

六、 总结

Kimodo是一项系统性工程,通过大规模高质量数据、精心设计的运动表示、创新的两阶段去噪架构,在运动质量、控制精度和泛化能力上实现了显著突破。它不仅推动了可控人体运动生成领域的边界,更重要的是,它提供了一个实用、直观且高效的运动创作工具,并展示了在机器人领域的直接应用前景,为后续研究(特别是如何进一步扩展数据和模型)奠定了坚实基础。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐