具身智能(Embodied Intelligence/Embodied AI)是指具有某种“身体”和行动能力的智能体,通过视觉、触觉、听觉、本体感觉等感知环境,并在与环境持续交互的过程中进行理解、推理、规划、行动和学习。

        这种“身体”既可以是真实机器人、机械臂、无人机、自动驾驶车辆,也可以是仿真环境或虚拟世界中的智能体。具身智能的重要目标之一,是让人工智能从单纯处理文本和图像,进一步发展为能够在物理或虚拟环境中完成实际任务的智能体。

        具身智能涉及VLM、VLN、VLA和世界模型等模型或研究方向;在系统实现上,又可以分为端到端架构和分层模块化架构。“VLX”则是一种尚未完全标准化的泛化命名。

        1.VLM(视觉语言大模型)   

        VLM让机器人“看懂并描述世界”,但通常不能独立完成精确的机器人控制。     

               V:视觉编码(看到画面)

              L:语言理解与生成(听懂指令、输出语义)

                VLM通常输入图像或视频与文本,完成:

  • 图像描述;
  • 视觉问答;
  • 目标识别与定位;
  • 场景理解;
  • 空间关系推理;
  • 任务分解。

        VLM的典型输出是文本、语义标签、边界框、坐标或其他结构化信息,但通常不会直接生成机器人底层控制指令。

        2.VLN(视觉语言导航)

                在VLM的基础上进行导航

  • VLN 在 VLM 的感知理解之上,增加了空间推理 + 路径规划

  • 输出是路径/移动动作,解决“去哪里、怎么走”

  • 面向移动(无人机、轮式机器人),不涉及精细操作

        3.VLA(视觉 - 语言 - 动作模型(Vision-Language-Action Model)

                在VLM的基础上进行执行

                输入:视觉 + 语言指令(任务(模仿人的交流))

                输出:各个电机的扭矩或者转角

  • 本质是端到端映射:感知 → 决策 → 动作一体

  • 典型代表:RT-2、OpenVLA、π0、Helix

        4.VLX(视觉-语言-X模型—— 统一架构框架)       

        “VLX”目前不是像VLM、VLN、VLA那样具有统一定义的标准学术类别。它更像一种泛化写法:

X代表动作、导航、触觉、音频、状态、规划、控制等任意附加模态或输出。

        5.WM(世界模型)

                核心本质:让智能体在“脑子里”预演世界如何变化——给定当前观测和动作,预测未来状态(下一帧图像、下一状态、奖励等),相当于一个可学习的内部仿真器。    

  • 输入:当前观测(图像/点云)+ 候选动作

  • 输出:对未来的预测(未来帧、状态转移、奖励)

  • 作用:让策略在“想象中”试错,减少真实交互成本

  • 定位:不直接控制电机,而是为 VLA/规划器提供预演与推理能力

  • 典型代表:Dreamer、Sora 类视频生成模型、Genie、V-JEPA

        6.  端到端--技术实现范式              

                核心本质:从输入到输出的直接映射,无需中间转换环节。

  • 端到端是实现范式,不是模型

  • VLA、VLX 都可以用端到端实现;VLM、VLN 也常是端到端训练的

  • 与之对立的是分层架构(感知→规划→控制分开)

端到端通常指:

传感器输入→神经网络→机器人动作

它并不意味着“完全没有中间过程”,而是指这些中间表征通常不需要人工逐个设计和分别监督,整个映射可以通过统一目标进行联合优化。

与端到端相对的是模块化或分层系统:

视觉感知 → 场景理解 → 任务规划 → 运动规划 → 控制执行

总结

VLM让机器人理解“看到了什么” 
VLN让机器人理解“应该去哪里” 
VLA让机器人决定“下一步怎么行动” 
世界模型:预演后果
端到端:一种实现方式(贯穿以上)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐