近期的基础图像与视频生成模型展现出强大的泛化性与可控性,但其直接向具身场景的应用受到多视角一致性、几何连贯性及机器人本体约束等要求的限制。现有方法通常利用有限的机器人数据来适配基础模型,这往往会牺牲大规模预训练阶段获得的视觉知识。

        我们提出 Xiaomi-Robotics-U0,一个拥有 38B 参数​ 的多模态自回归模型,用于统一的具身合成。它将具身生成视为基础图像与视频生成的延伸,并联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成。这一统一框架在保留预训练世界基础模型泛化能力的同时,将其适配至具身环境。Xiaomi-Robotics-U0​ 是首个支持跨多种机器人本体的高质量多视角场景生成的模型,并引入了结构化的可控具身迁移以实现细粒度编辑,同时保持多视角一致性与交互动态。

        该模型在单步与序列生成任务上取得了 SOTA(当前最佳)​ 结果:在具身场景生成与迁移的人工评估中优于 GPT-Image-2.0,在 World Arena​ 具身视频生成榜单排名第一,并将 pi_0.5​ 在具有挑战性的真实世界操控任务中的分布外(OOD)成功率从 36.9% 提升至 63.2%。这些结果表明,基础世界模型既可充当具身世界模型,也可作为具身智能的可扩展数据引擎。


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐