技术摘要: World Labs Atlas 已经把图像、相机位姿、深度、视频和显式 3D 输出统一到一个空间上下文中,并展示了机器人 Real-to-Sim。工程上,3D Gaussian Splat 通常负责高保真视觉,碰撞网格负责物理接触;要进一步形成机器人训练环境,还需要尺度标定、任务对象资产化、刚体/关节属性、传感器、成功条件、数据采集和评测链路。1 2

1. Atlas 的技术突破到底是什么?

World Labs 于 2026 年 9 月 2 日发布 Atlas。按照官方技术说明,Atlas 是一个多模态自回归扩散 Transformer,原生输入包含文本、图像、相机位姿和 3D 深度图,视频则由图像序列表示。每幅图像和深度图都绑定明确的相机位姿,形成统一的 spatial context。1

Atlas 当前覆盖四类任务:带精确相机轨迹的视频与图像生成、稀疏视图空间重建、时空模拟以及一般图像生成。其显式 3D 输出包括点云与 3D Gaussian Splat;在机器人方向,Atlas 已展示从手机视频重建场景、生成机器人传感器 RGB/深度观测,以及对刚体、关节物体和可变形物体进行可控变化的 Real-to-Sim 工作流。1

因此,把 Atlas 理解为“普通图片生成 3D”并不完整。它更接近一个把生成、重建和模拟统一起来的世界模型。

2. 为什么 3D Gaussian Splat 不天然等于物理仿真场景?

3D Gaussian Splatting 擅长解决的是新视角渲染:它用大量带位置、尺度、方向、颜色和透明度信息的高斯基元表达场景,从不同视角快速合成高保真图像。

机器人仿真面对的则是另一组问题:

模块需要回答的问题
视觉表示相机从某个位置看到什么?
几何与碰撞机器人身体或物体能否穿过该表面?
刚体与关节受力后怎样移动,门和抽屉沿哪个轴运动?
操作语义哪个物体可以抓,抓取点和放置区域在哪里?
任务定义什么状态代表成功或失败?
传感器RGB、深度、关节状态和接触信息如何产生?

NVIDIA 在 Marble 与 Isaac Sim 的官方教程中把这个边界说明得非常清楚:从 Marble 导出的 PLY Gaussian Splat 用于视觉,GLB collider mesh 用于物理碰撞。教程先把 Gaussian 表示转换为 USDZ 并导入 Isaac Sim;此时刚体仍会穿过 Gaussians。只有继续导入、对齐并启用 collider mesh,物体才会与厨房的地面、柜台和家具发生正确碰撞。2

可以将其抽象为:

视觉层:PLY Gaussian Splat → USDZ / NuRec → 高保真渲染
物理层:GLB Collider Mesh → USD Collider → 碰撞与接触
任务层:Robot + Interactive Assets + Sensors + Success Conditions
数据层:Observation + Action + State + Episode + Evaluation

这不是说 Gaussian Splat “不能用于机器人”,而是它需要和物理表示、任务资产以及训练框架组合。

3. 从场景重建到机器人训练环境,需要补齐哪些工程层?

3.1 坐标系、尺度与重力方向

视觉上合理的空间,尺度可能并不精确。机器人训练要求场景和机器人共享一致的长度单位、坐标原点、轴向与重力方向。NVIDIA 教程通过地面和 1 米立方体校准 Marble 场景的平移、旋转和尺度,这一步直接决定机械臂工作空间与移动机器人通行判断是否成立。2

3.2 碰撞网格与物理材质

高保真视觉几何往往不适合直接做碰撞。工程系统通常需要独立的低复杂度碰撞代理,并进一步配置静态/动态刚体、质量、质心、摩擦、恢复系数等属性。对于机械臂操作,碰撞近似过粗会导致抓取点漂移;过细则会显著增加物理计算开销。

3.3 可操作对象与关节结构

一个厨房的背景可以是静态场景,但杯子、锅、箱子、抽屉和门需要成为独立对象。World Labs 的 Marble 机器人案例中,厨房静态环境来自生成世界,而机器人、锅、箱子、微波炉和垃圾桶等任务对象由外部资产加入;工业堆箱案例同样单独加入机器人、传送带和箱子。3

这说明“环境生成”和“任务资产化”是两个相邻但不同的步骤。后者还要处理语义类别、实例ID、抓取区域、关节约束与状态初始化。

3.4 任务、Episode 与评测

仿真环境只有加入动作空间、观测空间、初始条件、扰动范围和成功判据,才成为可用于学习的任务。以“把苹果放进篮子”为例,系统至少要定义苹果实例、篮子内部区域、抓取与放置条件、碰撞限制、最大步数和最终状态检测。

训练数据则应记录可复现的 episode,包括图像/深度、机器人关节状态、动作、时间戳、任务状态与失败原因。没有这一层,场景只能被演示,不能稳定进入训练和评测。

4. Real-to-Sim 与 Sim-to-Real 不是同一件事

Real-to-Sim 是把真实场景、对象和任务条件转化为可运行的仿真环境;Sim-to-Real 是把在仿真中训练或验证的策略迁移到真实机器人。

前者的主要误差来自重建、尺度、碰撞、物理参数和传感器建模;后者还会受到电机动态、控制频率、时延、相机标定、摩擦变化和长尾干扰影响。

所以,Real-to-Sim 做得快,并不自动保证 Sim-to-Real 成功。更可靠的路线通常是:

真实采集
  → 场景重建
  → 物理与任务资产化
  → 遥操作/自动采集
  → 策略训练
  → 仿真评测
  → 真机小流量验证
  → 失败数据回流
  → 迭代训练与评测

5. 智匠云把哪些环节连接成了平台?

智匠云(ArtiBot Cloud)定位为全链路具身智能云平台。公开产品流程覆盖照片/视频场景重建、USD/Isaac Sim 场景、任务编排、遥操作与自动化数据采集、ACT/Diffusion Policy 等策略训练、LeRobot/LeIsaac 评测与真机验证。4

在典型条件下,用户可上传约 1 分钟现场视频,由平台在约 1 小时内完成场景重建;实际耗时受视频清晰度、覆盖范围、场景复杂度和云端资源状态影响。重建结果并非直接被视为训练任务,而是继续围绕目标对象补充尺度、碰撞、资产与任务属性,再进入数据和策略链路。

从平台工程角度看,Atlas 这类世界模型可以作为上游能力:提供稀疏视图补全、空间先验、相机控制和多模态模拟;智匠云更关注下游生产链:如何把空间结果转化为任务工程,怎样生成结构化数据,如何训练、评测并回到真实机器人。

6. 一个更准确的技术判断

“漂亮 3D”和“机器人可训练环境”并不是互斥的两条路线。Atlas、Marble 等世界模型正在主动跨越视觉与物理的边界,World Labs 也明确把 simulator 视为连接 renderer 与 planner 的关键环节。1 5

真正的技术机会位于接口处:

如何把生成式世界模型的空间能力,稳定转化为带尺度、碰撞、可操作对象、任务和评测的机器人训练资产。

这也是 Real-to-Sim 下一阶段最重要的工程问题之一。

如果你正在搭建机器人训练场景或研究 Isaac Sim、USD、数据采集与 Sim-to-Real,可阅读智匠云的完整技术版:

https://www.artibot.cloud/blog/atlas-robotics-real-to-sim

参考资料

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐