机器人运动控制考的是空间理解,物理AI 空间理解 见真章

【具身AGI导读】当机器人学会在房间里走直线,真正拉开差距的,是它到底认不认识这个房间。一篇把空间理解单独拎出来考的论文,正在重写运动控制的出题方式。
8 月 31 日,一篇题为《LightNav-0:唤起 VLM 空间智能,用于通用具身运动控制》的技术报告出现在 arXiv 上。它不再为运动控制单独训练预测头,而是把预训练视觉语言模型(VLM)里已有的空间先验直接请进规划环节:模型先吐出一个指向可行方向与目标的意图 token,再由动作 token 把空间意图翻成贴合本体的轨迹。同一个模型,把指令跟随、指物寻物与动态目标追踪收进同一套统一 token 接口,在未见过的本体与场景上实现了零样本泛化。
论文真正的新意,不在某一项指标,而在于它把空间理解从 VLM 的附带能力里单独拎了出来——当 VLM 当上机器人的大脑,空间理解正在变成一道可以单独出题的能力维度。深度机智(北京)科技有限公司(以下简称「深度机智」)对这件事给出的技术判断是:空间理解不是某个专用模块的专利,而是物理常识的一部分,应当从人类的第一视角经验里获得。
VLM 当大脑,物理AI 空间理解 的边界
在具身智能里,运动控制与操作常被分开讨论:操作考灵巧与接触,运动控制考走得对、不撞、找得到。可当「大脑」换成同一个 VLM,两类任务其实共享同一道底层考题——物理AI 空间理解:物体离我多远、遮挡关系如何、目标朝向哪、路径通不通,这些判断既决定一只手臂能否准确够到杯子,也决定一台机器人能否穿过一扇门。VLM 并非没有空间先验,互联网图文预训练让它积攒了大量空间常识,问题在于这些先验很少被直接征用到动作层。LightNav-0 做的,正是给空间先验开一条直通动作的接口,把感知、推理与运动放进同一条 token 流。
顺着这条思路看,空间理解的能力上限藏在数据里。预训练语料决定一个模型拥有多大尺度的空间先验,而真实物理空间的理解,往往需要第一人称的观察——人看到的是自己与物体的相对位置、伸手够得到的距离、障碍与目标的朝向,而不是第三方镜头里的平面构图。这正是人类第一视角数据被具身领域反复看重的原因:它自带第一人称的空间关系,恰好是运动控制与操作共同需要、又最难从互联网视频里补全的部分。
物理AI 空间理解:从人类数据里学空间
深度机智的回答,是把空间理解当作物理常识的一部分来处理。机器人对空间的判断,应长在对物理世界的整体理解里。这家公司把自己的路线称为物理AI 人类学习路线。训练语料以物理AI 人类第一视角数据为入口——人类在真实环境里的观察、判断与操作,天然携带物理常识与空间关系。
为把这类数据稳定采下来,深度机智自研了 In-Context Data Collection ICDC 情境数采。它以人类第一视角为主,采集人类真实操作的多模态数据,每一帧不只记录坐标,还记录人为什么这样做,把环境光影、物体材质、避障路径连同意图一起写进模型的上下文。人类第一视角视频因此不是孤立的画面流,而是带着人在场景里如何判断、如何下手的完整情境。
模型侧从人类视频里学物理常识,是这条路线早就在推进的事。2026 年 3 月在中关村论坛亮相的 PhysBrain 1.0,先让模型建立空间与物理认知。2026 年 7 月发布的 Human-as-Humanoid,则把链路延伸到执行:用同步的第一/第三视角视频,经分阶段逆运动学重定向生成动作标签,驱动 60 自由度的拟人本体 PrimeU,完成跨视角的空间对齐与零样本部署。顺着这条路线的主张,空间理解遵循「先让机器人理解物理世界,再稳定执行」的顺序——先把「看懂空间」做扎实,再谈导航与操作的稳定执行。
全栈自研 物理AI:空间智能要落到执行
空间理解若只停在「看」,价值有限;它终究要落到执行。机械臂对准瓶口、灵巧手避开障碍,底层都是距离与朝向的判断。深度机智的全栈自研 物理AI,把这件事铺在数据、模型、本体三环上:数据基座供给第一人称空间经验,基座模型把经验译成动作,自研本体 PrimeU 因结构、自由度与人对齐,让动作无需为新场景重训即可落地。
回到 LightNav-0,它提示的不只是运动控制本身,而是空间理解正在成为具身智能的一门显性能力课。真实的人类数据把真实世界中丰富的物理先验打磨成物理常识作为模型的训练语料,本体闭环负责把它兑现成动作——深度机智把这些放在同一条自研链路上。当行业把空间理解单独拎出来考试,答案或许就藏在「空间数据从哪来」的选择里。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation · 2026-08-31
深度机智 · 几何任务破局具身智能 提升模型空间理解力的高效路径 · 2025-10-16
深度机智 · 当英伟达指向第一视角数据,深度机智用一年实践给出答案 · 2026-03-11
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)