具身智能相关了解
具身智能(Embodied Intelligence/Embodied AI)是指具有某种“身体”和行动能力的智能体,通过视觉、触觉、听觉、本体感觉等感知环境,并在与环境持续交互的过程中进行理解、推理、规划、行动和学习。
这种“身体”既可以是真实机器人、机械臂、无人机、自动驾驶车辆,也可以是仿真环境或虚拟世界中的智能体。具身智能的重要目标之一,是让人工智能从单纯处理文本和图像,进一步发展为能够在物理或虚拟环境中完成实际任务的智能体。
具身智能涉及VLM、VLN、VLA和世界模型等模型或研究方向;在系统实现上,又可以分为端到端架构和分层模块化架构。“VLX”则是一种尚未完全标准化的泛化命名。
1.VLM(视觉语言大模型)
VLM让机器人“看懂并描述世界”,但通常不能独立完成精确的机器人控制。
V:视觉编码(看到画面)
L:语言理解与生成(听懂指令、输出语义)
VLM通常输入图像或视频与文本,完成:
- 图像描述;
- 视觉问答;
- 目标识别与定位;
- 场景理解;
- 空间关系推理;
- 任务分解。
VLM的典型输出是文本、语义标签、边界框、坐标或其他结构化信息,但通常不会直接生成机器人底层控制指令。
2.VLN(视觉语言导航)
在VLM的基础上进行导航
-
VLN 在 VLM 的感知理解之上,增加了空间推理 + 路径规划
-
输出是路径/移动动作,解决“去哪里、怎么走”
-
面向移动(无人机、轮式机器人),不涉及精细操作
3.VLA(视觉 - 语言 - 动作模型(Vision-Language-Action Model))
在VLM的基础上进行执行
输入:视觉 + 语言指令(任务(模仿人的交流))
输出:各个电机的扭矩或者转角
-
本质是端到端映射:感知 → 决策 → 动作一体
-
典型代表:RT-2、OpenVLA、π0、Helix
4.VLX(视觉-语言-X模型—— 统一架构框架)
“VLX”目前不是像VLM、VLN、VLA那样具有统一定义的标准学术类别。它更像一种泛化写法:
X代表动作、导航、触觉、音频、状态、规划、控制等任意附加模态或输出。
5.WM(世界模型)
核心本质:让智能体在“脑子里”预演世界如何变化——给定当前观测和动作,预测未来状态(下一帧图像、下一状态、奖励等),相当于一个可学习的内部仿真器。
-
输入:当前观测(图像/点云)+ 候选动作
-
输出:对未来的预测(未来帧、状态转移、奖励)
-
作用:让策略在“想象中”试错,减少真实交互成本
-
定位:不直接控制电机,而是为 VLA/规划器提供预演与推理能力
-
典型代表:Dreamer、Sora 类视频生成模型、Genie、V-JEPA
6. 端到端--技术实现范式
核心本质:从输入到输出的直接映射,无需中间转换环节。
-
端到端是实现范式,不是模型
-
VLA、VLX 都可以用端到端实现;VLM、VLN 也常是端到端训练的
-
与之对立的是分层架构(感知→规划→控制分开)
端到端通常指:
传感器输入→神经网络→机器人动作
它并不意味着“完全没有中间过程”,而是指这些中间表征通常不需要人工逐个设计和分别监督,整个映射可以通过统一目标进行联合优化。
与端到端相对的是模块化或分层系统:
视觉感知 → 场景理解 → 任务规划 → 运动规划 → 控制执行
总结
VLM让机器人理解“看到了什么” VLN让机器人理解“应该去哪里” VLA让机器人决定“下一步怎么行动” 世界模型:预演后果 端到端:一种实现方式(贯穿以上)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)