T-RO最新综述!看完终于理解了具身操作的不同阶段和任务该用什么模型了
机器人操作一直是具身智能领域最具挑战的问题之一。
一个机器人完成“拿起杯子”“整理桌面”等看似简单的任务,实际上需要同时解决任务理解、环境感知、行为规划、动作生成以及物理交互等多个问题。
LLM、MLLM、VLA、Diffusion Polic这类模型和策略的快速发展,让机器人操作中的任务理解、规划推理与动作生成开始越来越紧密地交织在一起,原本相对清晰的技术边界也逐渐模糊。不同方法究竟处于机器人系统的哪一层、解决什么问题,以及彼此之间如何衔接,正成为理解这一领域快速演进的关键。
一个更加核心的问题也随之浮现:
Foundation Model 能否帮助机器人获得更加通用的操作智能?
近日,论文 《Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives》 被 IEEE Transactions on Robotics(T-RO)接收。该论文系统梳理了 Foundation Model 时代机器人操作的发展,并提出从 高层规划(High-Level Planning) 和 低层动作建模(Low-Level Action Modeling) 两个角度理解现代机器人操作的统一框架。

该综述由西安交通大学、香港科技大学(广州)、中国科学院、西湖大学、浙江大学、悉尼大学、北京智源人工智能研究院、北京大学等机构的学者联合完成。
-
论文标题: Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives
-
论文链接: https://arxiv.org/abs/2512.22983
-
项目主页: https://github.com/BaiShuanghao/Awesome-Robotics-Manipulation
01 机器人操作不仅是“视觉输入到动作输出”
完成一个真实世界操作任务,例如“将桌上的杯子放入柜子”,机器人并不是简单地将图像转换为动作,而需要理解用户意图、感知环境和物体状态、决定接下来应该做什么、生成可执行动作,并最终通过真实机器人完成物理交互。
因此,机器人操作并不是一个单一模型可以概括的问题,而是由多个功能层级共同构成的智能系统。综述将这一过程抽象为:
High-Level Planning → Low-Level Action Modeling → Actuation-Level Control

其中,High-Level Planning 负责生成任务计划、程序、几何约束、Affordance 或 3D 表示等结构化指导,回答机器人“应该做什么”;Low-Level Action Modeling 将环境观测和任务信息进一步转化为可执行动作或轨迹,回答机器人“具体应该如何动”;最终,Actuation-Level Control 将这些动作落实到位置、速度、力矩以及阻抗等真实机器人控制过程。
这一视角也帮助我们重新理解近年来大量出现的概念。LLM Planner、VLA、Diffusion Policy、Imitation Learning 等实际上对应不同的系统层级或建模维度,并不适合简单作为同一层级的技术路线进行比较。相比按照某一种模型家族组织文献,这种功能视角更关注不同模块在机器人系统中究竟承担什么角色,以及它们之间如何连接。
02 Foundation Model 如何进入机器人操作系统?
从整体上看,Foundation Model 对机器人操作的影响可以概括为两条互补的路径。
第一条路径发生在高层规划。Foundation Model 利用强大的语义理解、视觉感知和推理能力,生成不同形式的结构化规划信息:
Foundation Model → Task Plan / Program / Geometric Constraint / Affordance Prior / 3D Representation → Downstream Action Generation → Execution
这些 planning artifacts 本身并不是可直接执行的机器人动作。例如,语言模型可以生成任务步骤,代码模型可以生成程序,视觉语言模型可以推理关键空间关系,3D 表示可以提供抓取候选、空间对应关系或优化目标。随后,这些信息既可以被转化为目标位姿或空间约束,交给传统运动规划和控制方法,也可以作为条件输入学习型动作模型。
另一条路径则是 Foundation Model 直接参与低层动作建模:
Multimodal Observation / Instruction → Learning-based Action Model → Executable Action / Trajectory
近年来快速发展的 VLA 是其中具有代表性的方向。通过将视觉、语言、机器人状态以及大规模机器人数据结合起来,模型可以直接根据任务指令和环境观测预测机器人动作。两条路径并不是相互替代的关系:前者更强调结构化推理和规划,后者更强调从感知到动作的直接建模,而真正通用的机器人系统很可能需要二者更加紧密地结合。
03 高层规划:用结构化表示连接语义理解与物理行为
高层规划的核心不是让 Foundation Model 直接控制机器人,而是让模型回答:
给定当前环境和任务目标,机器人接下来应该做什么?

综述将现有方法理解为不同形式的 planning artifacts,即连接高层语义推理与下游动作生成的结构化规划产物。
-
Task Plan:从语言和视觉中形成任务计划。 LLM 可以利用语言知识完成任务分解、技能排序和长时序推理,例如 SayCan、Inner Monologue 等工作探索了如何利用语言模型生成和动态修正任务计划;随着 MLLM 的发展,PaLM-E、RoboBrain、Gemini Robotics-ER 等进一步将视觉感知融入高层推理,使机器人能够结合当前场景进行决策。但语言层面“看起来合理”的计划并不一定在物理世界中可行,因此仍需要环境反馈、几何约束和执行验证。
-
Program:利用程序表达复杂行为逻辑。 相比自然语言,代码能够显式表示条件判断、循环和任务组合关系。Code as Policies、ProgPrompt 等方法让 LLM 调用机器人感知和控制接口,将任务意图转化为更加结构化的程序。与此同时,代码的可执行性也意味着错误程序可能直接带来错误行为,因此程序正确性、约束满足和运行时安全同样重要。
-
Geometric Constraint:把语义理解转化为空间约束。 这类方法并不直接预测完整动作轨迹,而是生成目标位姿、关键点关系、空间代价或几何约束,再交由运动规划器或优化器求解。VoxPoser、ReKep、GeoManip 等工作体现了这一思路,它们实际上构建了一个连接 Foundation Model 语义推理与经典运动生成的中间接口。
-
Affordance Prior:理解环境“能够如何被操作”。 Affordance 将感知从“这是什么物体”进一步推进到“这个物体能够如何交互”,例如哪里适合抓取、哪些部件可以推动或旋转。近年来,视觉、语言和 3D Foundation Model 被进一步用于学习 action-relevant regions 和物体关系。不过,Affordance 只描述操作可能性,并不能保证几何上真正可行,因此通常仍需结合后续规划与控制。
-
3D Representation:为规划提供更丰富的空间结构。 Gaussian Splatting、Neural Descriptor Field、3D Feature Field 等表示能够将视觉感知转化为抓取候选、空间对应关系和优化目标,成为连接感知与动作的重要中间接口。相比直接从二维图像进行推理,结构化 3D 表示能够提供更明确的几何基础,但其效果也依赖于场景重建质量,并在动态、遮挡和部分可观测环境中面临挑战。

因此,高层规划的发展并不是简单地“让 LLM 给机器人下指令”,而是在探索什么样的中间结构最适合把 Foundation Model 的语义和推理能力传递给真实机器人执行系统。
04 低层动作建模:让机器人真正产生动作
如果高层规划解决“应该做什么”,那么低层动作建模解决的就是:
机器人应该如何根据当前观测和任务目标生成真正可执行的动作?
低层动作建模本身既包括 Sampling-based Planning、Trajectory Optimization、Model Predictive Control 等传统非学习方法,也包括近年来快速发展的学习型动作模型。本文重点围绕后者,从动作模型构建过程出发,将其进一步组织为:
Input Modeling → Latent Learning → Policy Learning

Input Modeling:机器人基于什么信息产生动作?
Input Modeling 决定机器人使用哪些感知信息,以及这些信息如何被编码、对齐和融合。早期 Vision-Action 模型主要依赖 RGB 或多视角图像,而随着任务复杂度提升,深度、点云和其他 3D 表示逐渐被引入,以增强机器人对空间结构、接触几何和遮挡场景的理解。
随着 Foundation Model 的发展,VLA 进一步将视觉和语言任务条件共同纳入动作建模,使机器人不仅能够“看到环境”,还能够结合更加开放的自然语言指令理解当前任务。论文进一步从 2D / 3D 输入以及 model-oriented / model-agnostic 两个维度系统梳理了 VLA 的发展。

与此同时,机器人输入也正在从视觉和语言继续走向真实的物理世界。触觉能够直接反映接触、滑动和材料属性,力觉能够感知机器人与环境之间的作用力,声音则可以补充视觉无法观察到的接触状态和事件。Input Modeling 因此决定的不只是机器人“看到了什么”,更决定机器人能够利用哪些信息理解和作用于真实世界。
Latent Learning:如何学习连接感知与动作的中间表示?
直接从高维感知输入生成复杂机器人动作往往十分困难,因此另一条重要路线是学习更加紧凑、可迁移的潜在表示。

一类方法关注 Pretrained Latent Learning,利用通用图像数据、人类第一视角视频以及机器人交互数据预训练视觉或多模态表示,使策略获得更加通用的环境表征。另一类方法进一步研究 Latent Action Learning,将复杂运动编码为更加紧凑的潜在动作表示,其中既包括通过量化获得的离散 action tokens,也包括连续 latent vectors、latent dynamics 以及 world-model-based representations。通过这些抽象,动作模型有望获得更好的迁移、组合以及跨任务、跨本体泛化能力。
Policy Learning:如何将表示解码为动作?
Policy Learning 最终关注如何把输入及潜在表示转化为具体机器人动作。不同方法采用了不同的动作生成机制,从早期 MLP-based Policy,到能够建模长时序依赖的 Transformer Policy,再到近年来广泛应用的 Diffusion Policy 和 Flow Matching Policy,策略模型正在从直接动作回归逐渐走向更加灵活的生成式动作建模。

05 面向未来:距离真正的通用 Robot Brain 还有多远?
Foundation Model 已经显著推动了机器人语义理解、任务规划和动作生成,但综述认为,距离真正开放世界中的通用机器人智能仍有四个核心问题需要解决。
构建真正通用的 Robot Brain。 当前机器人模型在新物体或已知任务组合上的表现不断提高,但许多结果仍更接近已有分布上的插值,而不是真正面向新任务结构、新物体类别、新环境乃至新机器人形态的外推。未来需要能够支持不同模态和不同本体接口的通用架构,同时结合持续学习、记忆、经验重放和高效模型更新机制,并进一步加强高层规划与低层闭环动作执行之间的耦合。
突破数据与评测瓶颈。 真实机器人数据昂贵且难以规模化,而现有 Benchmark 又往往只覆盖某一部分能力。例如 CALVIN 侧重长时序语言条件操作但场景有限,LIBERO 强调多任务和持续学习但本体相对固定,SimplerEnv 则更侧重 real-to-sim 一致性。未来不仅需要更加规模化的数据飞轮和高保真仿真,也需要更加统一、可复现的评价协议,让不同方法之间的比较真正具有意义。

从视觉感知迈向多模态物理交互。 真实世界中的操作智能不能只依赖视觉。未来机器人需要进一步统一触觉、力觉、声音甚至温度等多种感知信号,并解决不同模态采样频率、噪声和时序对齐问题。更进一步,对于布料、线缆、流体、颗粒物等复杂材料,仅有更丰富的感知仍然不够,还需要新的图结构或场表示以及更强的 physics-informed modeling,才能应对高维状态和复杂接触动力学。
让安全与协作成为系统能力。 当机器人真正进入家庭、工厂和其他人类环境,安全不能只是模型失败后的补救机制,而需要成为系统设计的一部分。机器人不仅需要满足运动学、动力学、力和能量等约束,还需要具备持续监控、故障检测、错误恢复和可靠 fallback 能力;在多机器人环境中,还需要支持预测式协调和安全协作。未来真实机器人系统很可能进一步融合学习方法的适应性与规则、MPC 等传统方法的稳定性。
总结
Foundation Model 正推动机器人操作从面向单一任务的技能学习,逐步走向更加通用的机器人智能。但通用机器人并不只是“模型更大、数据更多”,而是需要同时解决语义理解、结构化规划、多模态感知、潜在表示、动作生成、物理交互以及安全可靠性等一系列彼此耦合的问题。
这篇综述并没有简单按照 LLM、VLA、Diffusion Policy 等模型家族重新罗列已有工作,而是尝试从机器人系统真正承担的功能出发,以 High-Level Planning 和 Learning-based Low-Level Action Modeling 为主线重新组织近年来的研究进展。
从这一视角来看,Foundation Model 时代机器人操作真正需要回答的问题或许可以浓缩为一句话:
机器人如何形成对任务和世界的理解,并将这种理解可靠地转化为真实世界中可执行、可泛化的物理行为?
重磅!
全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)
推荐阅读
我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~
VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~
VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~
1v1 科研论文辅导来啦!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)