具身智能・机器人・无人机术语速查表
·
具身智能・机器人・无人机术语速查表
目的:让读者快速回答三个问题:它是什么?在系统哪一层?最容易和什么混淆?
标记:
标准= 已广泛稳定使用;常用= 工程/研究中高频但边界依上下文;新兴= 2025–2026 活跃但仍在形成定义。
A. 具身智能与基础模型
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Embodied AI | 具身智能:智能体通过身体与环境闭环交互 | 标准,不是“LLM+机器人”的同义词 |
| Physical AI | 物理 AI:强调 AI 在真实物理系统中的感知、推理和行动 | 常用,NVIDIA 等产业界高频使用 |
| Agent | 智能体:观察环境、选择行动、获得反馈的主体 | 标准 |
| LLM | 大语言模型 | 高层语义、规划、工具调用;不是高频控制器 |
| MLLM | 多模态大语言模型 | 可处理图像/音频/视频/文本 |
| VLM | 视觉语言模型 | 视觉与语言对齐,典型输出是语义/文本 |
| VLA | 视觉-语言-动作模型 | 视觉+语言(+状态)→机器人动作 |
| RFM | Robot Foundation Model,机器人基础模型 | 常用上位概念,VLA 可属于 RFM |
| GRP | Generalist Robot Policy,通用机器人策略 | 强调跨任务、跨场景策略 |
| Embodied Reasoning | 具身推理 | 空间、时间、物理、任务成功判断等高层推理 |
| World Model | 世界模型 | 当前状态/动作→未来状态或未来观测 |
| WAM | World-Action Model | 新兴;未来世界与动作联合建模 |
| WFM | World Foundation Model | 大规模预训练的通用世界模型,新兴/宽泛 |
| JEPA | Joint-Embedding Predictive Architecture | 在表征空间预测未来/缺失信息 |
| V-JEPA | Video JEPA | 面向视频时序表征学习 |
| Cross-Embodiment | 跨本体学习 | 在不同机器人形态间迁移能力 |
| Embodiment Gap | 本体差距 | 模型迁移到新机器人时仍需完成的适配工作,2026 新综述重点概念 |
| Zero-shot | 零样本 | 未针对目标任务/环境做专门训练直接测试 |
| Few-shot | 少样本 | 少量目标数据后适配 |
| OOD | Out-of-Distribution | 分布外:训练分布之外的数据/场景 |
| Open-world Generalization | 开放世界泛化 | 面向新环境、新物体、新任务组合的泛化 |
B. VLA 架构与动作生成
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Action Token | 动作 Token | 把连续动作离散化后作为语言模型 token 输出 |
| Action Tokenizer | 动作分词器 | 将高维动作序列压缩为离散 token |
| Action Expert | 动作专家 | VLM 之外专门负责连续机器人动作的网络分支 |
| Action Chunking | 动作分块 | 一次预测未来 H 步动作,而非单步动作 |
| ACT | Action Chunking Transformer | 经典模仿学习动作分块模型 |
| Diffusion Policy | 扩散策略 | 通过去噪生成连续动作序列 |
| Flow Matching | 流匹配 | 学习连续向量场生成动作分布,π₀/SmolVLA 等采用 |
| DiT | Diffusion Transformer | 用 Transformer 实现扩散/流模型主干 |
| Autoregressive Action | 自回归动作生成 | 一个 token/动作接一个生成 |
| Parallel Decoding | 并行动作解码 | 同时解码多个动作以提升实时性 |
| Continuous Action | 连续动作 | 位置、速度、关节角等连续值 |
| Discrete Action | 离散动作 | 前进/左转/抓取或量化动作 token |
| Delta Action | 增量动作 | 输出相对当前位置/姿态的增量 |
| Joint-space Action | 关节空间动作 | 直接给关节位置/速度/力矩 |
| Cartesian Action | 笛卡尔动作 | 末端执行器位置/姿态/增量 |
| Proprioception | 本体感觉 | 关节角、速度、力矩、IMU 等自身状态 |
| Policy | 策略 | 观测→动作映射 |
| Policy Head | 策略头 | 基座网络之上的动作输出模块 |
| Post-training | 后训练 | 通用预训练后针对目标技能/机器人再训练 |
| LoRA / PEFT | 参数高效微调 | 用较少参数适配新任务/本体 |
| Async Inference | 异步推理 | 执行动作与生成下一动作并行 |
| On-device VLA | 端侧 VLA | 在机器人本地计算平台运行,降低延迟与断网风险 |
C. 视觉与多模态感知
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Object Detection | 目标检测 | 输出类别和 2D 框 |
| Semantic Segmentation | 语义分割 | 每个像素分类,不区分同类实例 |
| Instance Segmentation | 实例分割 | 每个物体实例独立 mask |
| Panoptic Segmentation | 全景分割 | 语义+实例统一 |
| Open-Vocabulary Detection | 开放词汇检测 | 不限固定训练类别,可用文本查询 |
| VQA | 视觉问答 | 图像+问题→答案 |
| EQA | 具身问答 | 需要移动探索后回答问题 |
| Depth Estimation | 深度估计 | 预测每个像素距离 |
| Monocular Depth | 单目深度 | 单 RGB 推断相对/绝对深度 |
| Stereo Depth | 双目深度 | 通过视差计算深度 |
| Optical Flow | 光流 | 图像像素的时序运动场 |
| MOT | Multi-Object Tracking | 多目标跟踪 |
| ReID | Re-Identification | 跨视角/跨时间重新识别同一目标 |
| 6D Pose | 6D 位姿 | 3D 位置 + 3D 姿态 |
| Keypoint | 关键点 | 目标上的稳定几何/语义点 |
| Affordance | 可供性 | 物体哪里可以抓、推、坐、开等 |
| CLIP | 图文对比预训练 | 开放词汇视觉语义基础 |
| SigLIP | Sigmoid 图文对齐模型 | 多个 VLM/VLA 的视觉基础编码器 |
| DINOv2 | 自监督视觉表征 | 强通用视觉特征 |
| SAM / SAM2 | Segment Anything | 通用图像/视频分割 |
| Audio-Visual | 音视频融合 | 声源定位、事件检测等 |
| Tactile | 触觉 | 接触、滑移、局部形变 |
| F/T Sensor | 六维力/力矩传感器 | 常装在机械臂腕部 |
| Event Camera | 事件相机 | 输出亮度变化事件,适合高速和高动态光照 |
D. 3D 感知与场景表示
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Point Cloud | 点云 | 一组带坐标/属性的 3D 点 |
| Voxel | 体素 | 3D 空间中的像素 |
| Occupancy | 占据表示 | 空间是否被物体占据 |
| 3D Occupancy | 三维占据预测 | 体素级 free/occupied/semantic |
| BEV | 鸟瞰图 | 把多视图信息统一到俯视坐标 |
| TSDF | 截断符号距离场 | 常用于表面融合和重建 |
| ESDF | 欧氏符号距离场 | 每点到最近障碍物距离,路径规划常用 |
| SfM | Structure from Motion | 多图恢复相机位姿和稀疏结构 |
| MVS | Multi-View Stereo | 多视图稠密重建 |
| NeRF | 神经辐射场 | 隐式神经场景表示 |
| 3DGS | 3D Gaussian Splatting | 高斯椭球表示,实时渲染强 |
| Scene Graph | 场景图 | 对象节点+空间/语义关系 |
| Semantic Map | 语义地图 | 几何地图上叠加对象/类别/属性 |
| Spatial Memory | 空间记忆 | 保存地点、物体和历史观察 |
| Digital Twin | 数字孪生 | 真实系统/环境的数字化镜像 |
E. 定位、里程计与 SLAM
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Odometry | 里程计 | 估计相邻时刻运动,误差会累积 |
| VO | Visual Odometry | 仅视觉估计运动 |
| VIO | Visual-Inertial Odometry | 相机+IMU |
| LIO | LiDAR-Inertial Odometry | LiDAR+IMU |
| SLAM | 同步定位与建图 | 轨迹估计+地图+通常含全局优化 |
| Visual SLAM | 视觉 SLAM | 相机为主 |
| LiDAR SLAM | 激光 SLAM | 点云为主 |
| Loop Closure | 回环检测 | 识别已到访地点,消除累计漂移 |
| Pose Graph | 位姿图 | 节点为位姿,边为相对约束 |
| Factor Graph | 因子图 | 多传感器状态估计常用数学框架 |
| BA | Bundle Adjustment | 同时优化相机位姿和 3D 点 |
| EKF | 扩展卡尔曼滤波 | 非线性状态估计经典方法 |
| UKF | 无迹卡尔曼滤波 | 另一类非线性滤波 |
| GNSS | 全球卫星导航系统 | GPS 是其中一个系统 |
| RTK | 实时动态差分定位 | 高精度 GNSS |
| IMU | 惯性测量单元 | 加速度计+陀螺仪 |
| Visual-Inertial Fusion | 视觉惯性融合 | 无人机/AR/机器人高频定位基础 |
F. 导航与探索
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| PointNav | 点目标导航 | 已知目标相对/绝对坐标 |
| ObjectNav | 目标物体导航 | 目标是“冰箱/椅子”,未知坐标 |
| VLN | Vision-Language Navigation | 视觉+语言指令→导航动作 |
| Aerial VLN | 空中视觉语言导航 | 面向 UAV 的 3D/6DoF 导航 |
| Dialog Navigation | 对话式导航 | 多轮语言修正目标/路线 |
| Frontier Exploration | 前沿探索 | 选择已知/未知边界探索 |
| Active Perception | 主动感知 | 移动传感器以获得更有价值观测 |
| Next-Best-View | 下一最佳视角 | 为重建/识别选择下一观测位姿 |
| Global Planner | 全局规划器 | 在大范围地图给出整体路线 |
| Local Planner | 局部规划器 | 根据近场障碍实时避障 |
| Costmap | 代价地图 | 把障碍/风险编码成空间代价 |
| Behavior Tree | 行为树 | 任务逻辑、恢复与条件执行常用 |
G. 运动规划与优化
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| A* | 启发式图搜索 | 离散地图经典最短路 |
| D* Lite | 增量图搜索 | 地图更新后的快速重规划 |
| RRT | 快速扩展随机树 | 高维连续空间 |
| RRT* | 渐进最优 RRT | 随采样增加趋近更优路径 |
| PRM | 概率路线图 | 静态环境多查询 |
| Trajectory | 轨迹 | 带时间参数的路径和状态 |
| Trajectory Optimization | 轨迹优化 | 在约束下直接优化整段轨迹 |
| CHOMP | 梯度式轨迹优化 | 机械臂规划经典方法 |
| TrajOpt | 顺序凸优化轨迹规划 | 碰撞约束常用 |
| iLQR | 迭代线性二次调节 | 轨迹优化/控制 |
| DDP | Differential Dynamic Programming | 非线性最优控制 |
| Kinodynamic Planning | 动力学约束规划 | 同时考虑几何和动力学 |
| Collision Checking | 碰撞检测 | 规划不可缺少 |
| Signed Distance | 符号距离 | 距障碍表面距离,可用于优化 |
H. 机器人控制
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| PID | 比例-积分-微分控制 | 工业经典反馈 |
| LQR | 线性二次调节器 | 线性最优状态反馈 |
| MPC | 模型预测控制 | 滚动时域在线优化 |
| NMPC | 非线性 MPC | 无人机和复杂动力学常用 |
| Geometric Control | 几何控制 | 直接在 SO(3)/SE(3) 上设计控制器,无人机常见 |
| Impedance Control | 阻抗控制 | 让机器人呈现目标力-位移关系 |
| Admittance Control | 导纳控制 | 根据测量外力生成运动响应 |
| Force Control | 力控制 | 直接控制接触力 |
| Torque Control | 力矩控制 | 直接给关节力矩 |
| Whole-Body Control | 全身控制 | 人形/移动操作器多关节统一控制 |
| WBC | Whole-Body Controller | 全身控制器缩写 |
| Loco-Manipulation | 移动-操作一体化 | 同时走路与操作 |
| CBF | Control Barrier Function | 安全集约束控制 |
| Safety Filter | 安全过滤器 | 对学习策略动作做约束/修正 |
I. 机械臂与操作
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| FK | 正运动学 | 关节角→末端位姿 |
| IK | 逆运动学 | 末端目标→关节角 |
| Jacobian | 雅可比矩阵 | 关节速度↔末端速度 |
| End-Effector | 末端执行器 | 夹爪、吸盘、灵巧手、工具 |
| Gripper | 夹爪 | 常见二指夹具 |
| Dexterous Hand | 灵巧手 | 多指、多自由度 |
| Grasp Pose | 抓取位姿 | 抓取时末端 6D 位姿 |
| Grasp Quality | 抓取质量 | 稳定性、抗扰性等 |
| Force Closure | 力封闭 | 经典抓取稳定性条件 |
| Contact-Rich | 富接触任务 | 插拔、装配、折叠、擦拭等 |
| Bimanual | 双臂操作 | 两只手/臂协同 |
| Retargeting | 动作重定向 | 人/其他机器人动作映射到目标机器人 |
| Teleoperation | 遥操作 | 人控制机器人采集示范 |
| Kinesthetic Teaching | 拖动示教 | 人直接拖动机械臂记录轨迹 |
J. 模仿学习与强化学习
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| IL | 模仿学习 | 从专家演示学习 |
| BC | 行为克隆 | 监督学习观测→动作 |
| DAgger | Dataset Aggregation | 在线收集策略状态并让专家纠正 |
| RL | 强化学习 | 通过奖励和试错优化策略 |
| Model-Free RL | 无模型 RL | 不显式学习动力学模型 |
| Model-Based RL | 基于模型 RL | 利用真实/学习世界模型做规划或训练 |
| Offline RL | 离线强化学习 | 仅用固定数据集 |
| Online RL | 在线强化学习 | 部署中继续与环境交互 |
| PPO | Proximal Policy Optimization | 常用 on-policy RL |
| SAC | Soft Actor-Critic | 常用 off-policy 连续控制 RL |
| DQN | Deep Q-Network | 经典离散动作 RL |
| IRL | 逆强化学习 | 从演示推断奖励 |
| Reward Model | 奖励模型 | 学习判断行为质量/任务是否成功 |
| RLHF | 人类反馈强化学习 | 更常见于大模型,也可扩展到机器人偏好 |
| DPO | 直接偏好优化 | 偏好对齐方法,机器人中需明确应用设定 |
| MDP | 马尔可夫决策过程 | RL 基础数学框架 |
| POMDP | 部分可观测 MDP | 更符合真实机器人不完全观测 |
| Covariate Shift | 协变量偏移 | BC 部署失败的核心原因之一 |
| Catastrophic Forgetting | 灾难性遗忘 | 持续学习新技能后忘掉旧技能 |
| Continual Learning | 持续学习 | 持续吸收新知识/技能 |
| Lifelong Learning | 终身学习 | 长周期持续学习与保持能力 |
K. 数据与评测
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Episode | 一个完整交互回合 | 从开始到成功/失败/终止 |
| Demonstration | 专家示范 | imitation learning 数据基本单位 |
| Trajectory | 轨迹 | 状态/观测/动作序列 |
| Dataset Mixture | 数据混合 | 多来源、多机器人训练混合 |
| Data Engine | 数据引擎 | 采集→清洗→标注→训练→部署→失败回流闭环 |
| RLDS | Reinforcement Learning Datasets 格式 | Open X-Embodiment 使用 |
| LeRobotDataset | LeRobot 标准数据格式 | 同步视频+状态+动作 |
| Open X-Embodiment | 多机器人开放数据集合与统一格式 | 跨本体预训练的重要基础 |
| DROID | 大规模 in-the-wild 操作数据 | 真实多场景 |
| BridgeData V2 | 多任务操作数据 | 多环境、多语言指令 |
| AgiBot World | 大规模真实机器人数据平台 | 双臂/全身/多模态方向活跃 |
| LIBERO | 机器人 lifelong / multi-task 操作 benchmark | VLA 常用 |
| RoboCasa | 家居/厨房模拟与 benchmark | 2026 RoboCasa365 扩展明显 |
| Success Rate | 成功率 | 必须结合测试次数和难度看 |
| SPL | Success weighted by Path Length | 导航成功+路径效率 |
| Collision Rate | 碰撞率 | 无人机/导航关键 |
| Intervention Rate | 人工干预率 | 真实部署价值很高 |
| Recovery Rate | 恢复率 | 扰动/失败后恢复能力 |
| Seen / Unseen | 已见/未见 | 必须看作者怎么定义“未见” |
L. 仿真与 Sim2Real
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Simulation | 仿真 | 物理与传感器虚拟环境 |
| Sim2Real | 仿真到现实迁移 | 从仿真策略迁移真机 |
| Real2Sim | 现实到仿真 | 从真实场景构建仿真资产/数字孪生 |
| Domain Randomization | 域随机化 | 随机纹理、光照、动力学参数 |
| System Identification | 系统辨识 | 用真机数据估计动力学参数 |
| Residual Learning | 残差学习 | 学经典模型未建模部分 |
| Synthetic Data | 合成数据 | 仿真/生成模型产生的训练数据 |
| HIL | Hardware-in-the-Loop | 部分真实硬件接入仿真闭环 |
| SIL | Software-in-the-Loop | 纯软件闭环测试 |
| Isaac Sim | NVIDIA GPU 机器人仿真 | 高保真、合成数据、USD |
| Isaac Lab | GPU 并行机器人学习框架 | RL/IL/humanoid |
| MuJoCo | 高性能动力学仿真 | 控制、RL、操作 |
| Gazebo | ROS 生态仿真 | 移动机器人、无人机等 |
| Habitat | 具身导航仿真 | VLN/EQA/室内任务 |
| ManiSkill | 操作学习平台 | 机器人操作 benchmark |
| RLBench | 机械臂多任务 benchmark | IL/操作 |
| AirSim | 无人机/车辆视觉仿真 | Aerial navigation/perception |
| RoboCasa | 家庭操作仿真平台 | generalist robot learning |
M. ROS 2 与机器人软件工程
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| ROS 2 | 机器人中间件与工具生态 | 不是控制算法 |
| Node | 节点 | 独立功能进程/组件 |
| Topic | 话题 | 发布-订阅消息通道 |
| Service | 服务 | 同步请求-响应 |
| Action | 动作接口 | 适合长耗时、有反馈、可取消任务 |
| DDS | Data Distribution Service | ROS 2 通信底层 |
| TF2 | 坐标变换系统 | 机器人多坐标系核心 |
| rosbag2 | 数据录制与回放 | 采集传感器/调试 |
| URDF | 机器人描述格式 | 连杆、关节、惯量等 |
| SDF | 仿真描述格式 | Gazebo 等常用 |
| USD / OpenUSD | 通用 3D 场景描述 | Isaac / Omniverse 生态 |
| MoveIt 2 | ROS 2 机械臂规划平台 | IK、碰撞、规划、执行 |
| Nav2 | ROS 2 导航框架 | costmap、planner、controller、BT |
N. 无人机与 PX4
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| UAV / UAS | 无人机 / 无人航空系统 | UAS 更强调完整系统 |
| MAV | Micro Aerial Vehicle | 微型飞行器 |
| Quadrotor | 四旋翼 | 四个旋翼的多旋翼飞行器 |
| 6-DoF | 六自由度 | x/y/z 平移 + roll/pitch/yaw |
| PX4 | 开源飞控栈 | 姿态、位置、任务、failsafe 等 |
| ArduPilot | 另一主流开源飞控 | 多种飞行器支持 |
| MAVLink | 飞行器通信协议 | PX4/ArduPilot/QGC 常用 |
| MAVSDK | MAVLink 高层 SDK | 应用开发 |
| MAVROS | ROS 与 MAVLink 桥接 | ROS 1/2 场景常见 |
| uORB | PX4 内部消息总线 | 飞控模块间通信 |
| XRCE-DDS | PX4 ↔ ROS 2 通信路径之一 | 与 ROS 2/DDS 生态衔接 |
| Offboard Mode | 外部控制模式 | companion computer 给 setpoint |
| Setpoint | 设定值 | 位置/速度/姿态/角速度/推力等 |
| ENU | East-North-Up | ROS 常见世界坐标约定 |
| NED | North-East-Down | 航空/PX4 常见坐标约定 |
| FRD | Front-Right-Down | 飞机机体系常见 |
| RTL | Return-to-Launch | 返航 failsafe/飞行模式 |
| Geofence | 地理围栏 | 限制飞行区域 |
| VIO for UAV | 无人机视觉惯性里程计 | GNSS-denied 环境核心 |
| Aerial VLN | 空中视觉语言导航 | UAV + language grounding |
| UAV VLA | 面向 UAV 的 VLA | 必须说明输出 action space |
| Active Aerial Perception | 空中主动感知 | 自主选择视点收集信息 |
| Swarm | 集群 | 多无人机协作 |
| Formation Control | 编队控制 | 保持队形 |
| MARL | 多智能体强化学习 | 多机协同学习 |
| Task Allocation | 任务分配 | 多机决定谁做什么 |
| Cooperative Perception | 协同感知 | 多机共享感知信息 |
O. 人形机器人
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Humanoid | 人形机器人 | 具有人形躯干/四肢结构 |
| Bipedal Locomotion | 双足运动 | 走路、跑步、平衡 |
| Gait | 步态 | 行走周期模式 |
| ZMP | Zero Moment Point | 经典双足稳定性指标 |
| CoM | Center of Mass | 质心 |
| Support Polygon | 支撑多边形 | 静态/准静态平衡常用 |
| Whole-Body Policy | 全身策略 | 同时输出腿、躯干、臂等动作 |
| Loco-Manipulation | 移动操作 | 走路与操作协同 |
| Motion Retargeting | 动作重定向 | 人体/其他机器人动作映射到 humanoid |
| Teleop Suit | 全身遥操作设备 | 数据采集手段之一 |
P. 部署、系统与性能
| 术语 | 中文与定位 | 备注 |
|---|---|---|
| Latency | 延迟 | 从观测到动作可用的时间 |
| Throughput | 吞吐量 | 单位时间处理多少请求/帧 |
| Control Frequency | 控制频率 | 控制闭环更新速率 |
| Policy Frequency | 策略频率 | 学习模型动作更新速率 |
| Edge Computing | 边缘计算 | 在机器人本地/近端运行计算 |
| Companion Computer | 伴随计算机 | UAV 上运行 ROS/VLM/规划等 |
| Jetson | NVIDIA 边缘计算平台 | 机器人常用 |
| ONNX | 模型交换格式 | 跨框架部署 |
| TensorRT | NVIDIA 推理优化 | GPU 低延迟部署 |
| Quantization | 量化 | FP16/INT8/INT4 等压缩加速 |
| KV Cache | Transformer 缓存 | 加速自回归推理 |
| Watchdog | 看门狗 | 检测程序/通信失效并恢复/触发安全行为 |
| Failsafe | 故障保护 | 无人机/机器人异常时进入安全状态 |
| E-stop | 急停 | 真实机器人必须重视的硬件安全接口 |
最后:看到一个新缩写时的 6 问法
- 它属于感知、定位、推理、策略、规划、控制还是系统工程?
- 输入是什么? 图像、文本、状态、地图、触觉还是历史动作?
- 输出到底是什么物理量? 文本、航点、末端位姿、关节、速度还是推力?
- 执行频率是多少? 1 Hz 和 500 Hz 是完全不同的问题。
- 它替代了哪一层?又保留了哪一层?
- 它是真正的领域标准词,还是某篇论文自己起的名字?
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)