具身智能・机器人・无人机术语速查表

目的:让读者快速回答三个问题:它是什么?在系统哪一层?最容易和什么混淆?

标记:标准 = 已广泛稳定使用;常用 = 工程/研究中高频但边界依上下文;新兴 = 2025–2026 活跃但仍在形成定义。


A. 具身智能与基础模型

术语中文与定位备注
Embodied AI具身智能:智能体通过身体与环境闭环交互标准,不是“LLM+机器人”的同义词
Physical AI物理 AI:强调 AI 在真实物理系统中的感知、推理和行动常用,NVIDIA 等产业界高频使用
Agent智能体:观察环境、选择行动、获得反馈的主体标准
LLM大语言模型高层语义、规划、工具调用;不是高频控制器
MLLM多模态大语言模型可处理图像/音频/视频/文本
VLM视觉语言模型视觉与语言对齐,典型输出是语义/文本
VLA视觉-语言-动作模型视觉+语言(+状态)→机器人动作
RFMRobot Foundation Model,机器人基础模型常用上位概念,VLA 可属于 RFM
GRPGeneralist Robot Policy,通用机器人策略强调跨任务、跨场景策略
Embodied Reasoning具身推理空间、时间、物理、任务成功判断等高层推理
World Model世界模型当前状态/动作→未来状态或未来观测
WAMWorld-Action Model新兴;未来世界与动作联合建模
WFMWorld Foundation Model大规模预训练的通用世界模型,新兴/宽泛
JEPAJoint-Embedding Predictive Architecture在表征空间预测未来/缺失信息
V-JEPAVideo JEPA面向视频时序表征学习
Cross-Embodiment跨本体学习在不同机器人形态间迁移能力
Embodiment Gap本体差距模型迁移到新机器人时仍需完成的适配工作,2026 新综述重点概念
Zero-shot零样本未针对目标任务/环境做专门训练直接测试
Few-shot少样本少量目标数据后适配
OODOut-of-Distribution分布外:训练分布之外的数据/场景
Open-world Generalization开放世界泛化面向新环境、新物体、新任务组合的泛化

B. VLA 架构与动作生成

术语中文与定位备注
Action Token动作 Token把连续动作离散化后作为语言模型 token 输出
Action Tokenizer动作分词器将高维动作序列压缩为离散 token
Action Expert动作专家VLM 之外专门负责连续机器人动作的网络分支
Action Chunking动作分块一次预测未来 H 步动作,而非单步动作
ACTAction Chunking Transformer经典模仿学习动作分块模型
Diffusion Policy扩散策略通过去噪生成连续动作序列
Flow Matching流匹配学习连续向量场生成动作分布,π₀/SmolVLA 等采用
DiTDiffusion Transformer用 Transformer 实现扩散/流模型主干
Autoregressive Action自回归动作生成一个 token/动作接一个生成
Parallel Decoding并行动作解码同时解码多个动作以提升实时性
Continuous Action连续动作位置、速度、关节角等连续值
Discrete Action离散动作前进/左转/抓取或量化动作 token
Delta Action增量动作输出相对当前位置/姿态的增量
Joint-space Action关节空间动作直接给关节位置/速度/力矩
Cartesian Action笛卡尔动作末端执行器位置/姿态/增量
Proprioception本体感觉关节角、速度、力矩、IMU 等自身状态
Policy策略观测→动作映射
Policy Head策略头基座网络之上的动作输出模块
Post-training后训练通用预训练后针对目标技能/机器人再训练
LoRA / PEFT参数高效微调用较少参数适配新任务/本体
Async Inference异步推理执行动作与生成下一动作并行
On-device VLA端侧 VLA在机器人本地计算平台运行,降低延迟与断网风险

C. 视觉与多模态感知

术语中文与定位备注
Object Detection目标检测输出类别和 2D 框
Semantic Segmentation语义分割每个像素分类,不区分同类实例
Instance Segmentation实例分割每个物体实例独立 mask
Panoptic Segmentation全景分割语义+实例统一
Open-Vocabulary Detection开放词汇检测不限固定训练类别,可用文本查询
VQA视觉问答图像+问题→答案
EQA具身问答需要移动探索后回答问题
Depth Estimation深度估计预测每个像素距离
Monocular Depth单目深度单 RGB 推断相对/绝对深度
Stereo Depth双目深度通过视差计算深度
Optical Flow光流图像像素的时序运动场
MOTMulti-Object Tracking多目标跟踪
ReIDRe-Identification跨视角/跨时间重新识别同一目标
6D Pose6D 位姿3D 位置 + 3D 姿态
Keypoint关键点目标上的稳定几何/语义点
Affordance可供性物体哪里可以抓、推、坐、开等
CLIP图文对比预训练开放词汇视觉语义基础
SigLIPSigmoid 图文对齐模型多个 VLM/VLA 的视觉基础编码器
DINOv2自监督视觉表征强通用视觉特征
SAM / SAM2Segment Anything通用图像/视频分割
Audio-Visual音视频融合声源定位、事件检测等
Tactile触觉接触、滑移、局部形变
F/T Sensor六维力/力矩传感器常装在机械臂腕部
Event Camera事件相机输出亮度变化事件,适合高速和高动态光照

D. 3D 感知与场景表示

术语中文与定位备注
Point Cloud点云一组带坐标/属性的 3D 点
Voxel体素3D 空间中的像素
Occupancy占据表示空间是否被物体占据
3D Occupancy三维占据预测体素级 free/occupied/semantic
BEV鸟瞰图把多视图信息统一到俯视坐标
TSDF截断符号距离场常用于表面融合和重建
ESDF欧氏符号距离场每点到最近障碍物距离,路径规划常用
SfMStructure from Motion多图恢复相机位姿和稀疏结构
MVSMulti-View Stereo多视图稠密重建
NeRF神经辐射场隐式神经场景表示
3DGS3D Gaussian Splatting高斯椭球表示,实时渲染强
Scene Graph场景图对象节点+空间/语义关系
Semantic Map语义地图几何地图上叠加对象/类别/属性
Spatial Memory空间记忆保存地点、物体和历史观察
Digital Twin数字孪生真实系统/环境的数字化镜像

E. 定位、里程计与 SLAM

术语中文与定位备注
Odometry里程计估计相邻时刻运动,误差会累积
VOVisual Odometry仅视觉估计运动
VIOVisual-Inertial Odometry相机+IMU
LIOLiDAR-Inertial OdometryLiDAR+IMU
SLAM同步定位与建图轨迹估计+地图+通常含全局优化
Visual SLAM视觉 SLAM相机为主
LiDAR SLAM激光 SLAM点云为主
Loop Closure回环检测识别已到访地点,消除累计漂移
Pose Graph位姿图节点为位姿,边为相对约束
Factor Graph因子图多传感器状态估计常用数学框架
BABundle Adjustment同时优化相机位姿和 3D 点
EKF扩展卡尔曼滤波非线性状态估计经典方法
UKF无迹卡尔曼滤波另一类非线性滤波
GNSS全球卫星导航系统GPS 是其中一个系统
RTK实时动态差分定位高精度 GNSS
IMU惯性测量单元加速度计+陀螺仪
Visual-Inertial Fusion视觉惯性融合无人机/AR/机器人高频定位基础

F. 导航与探索

术语中文与定位备注
PointNav点目标导航已知目标相对/绝对坐标
ObjectNav目标物体导航目标是“冰箱/椅子”,未知坐标
VLNVision-Language Navigation视觉+语言指令→导航动作
Aerial VLN空中视觉语言导航面向 UAV 的 3D/6DoF 导航
Dialog Navigation对话式导航多轮语言修正目标/路线
Frontier Exploration前沿探索选择已知/未知边界探索
Active Perception主动感知移动传感器以获得更有价值观测
Next-Best-View下一最佳视角为重建/识别选择下一观测位姿
Global Planner全局规划器在大范围地图给出整体路线
Local Planner局部规划器根据近场障碍实时避障
Costmap代价地图把障碍/风险编码成空间代价
Behavior Tree行为树任务逻辑、恢复与条件执行常用

G. 运动规划与优化

术语中文与定位备注
A*启发式图搜索离散地图经典最短路
D* Lite增量图搜索地图更新后的快速重规划
RRT快速扩展随机树高维连续空间
RRT*渐进最优 RRT随采样增加趋近更优路径
PRM概率路线图静态环境多查询
Trajectory轨迹带时间参数的路径和状态
Trajectory Optimization轨迹优化在约束下直接优化整段轨迹
CHOMP梯度式轨迹优化机械臂规划经典方法
TrajOpt顺序凸优化轨迹规划碰撞约束常用
iLQR迭代线性二次调节轨迹优化/控制
DDPDifferential Dynamic Programming非线性最优控制
Kinodynamic Planning动力学约束规划同时考虑几何和动力学
Collision Checking碰撞检测规划不可缺少
Signed Distance符号距离距障碍表面距离,可用于优化

H. 机器人控制

术语中文与定位备注
PID比例-积分-微分控制工业经典反馈
LQR线性二次调节器线性最优状态反馈
MPC模型预测控制滚动时域在线优化
NMPC非线性 MPC无人机和复杂动力学常用
Geometric Control几何控制直接在 SO(3)/SE(3) 上设计控制器,无人机常见
Impedance Control阻抗控制让机器人呈现目标力-位移关系
Admittance Control导纳控制根据测量外力生成运动响应
Force Control力控制直接控制接触力
Torque Control力矩控制直接给关节力矩
Whole-Body Control全身控制人形/移动操作器多关节统一控制
WBCWhole-Body Controller全身控制器缩写
Loco-Manipulation移动-操作一体化同时走路与操作
CBFControl Barrier Function安全集约束控制
Safety Filter安全过滤器对学习策略动作做约束/修正

I. 机械臂与操作

术语中文与定位备注
FK正运动学关节角→末端位姿
IK逆运动学末端目标→关节角
Jacobian雅可比矩阵关节速度↔末端速度
End-Effector末端执行器夹爪、吸盘、灵巧手、工具
Gripper夹爪常见二指夹具
Dexterous Hand灵巧手多指、多自由度
Grasp Pose抓取位姿抓取时末端 6D 位姿
Grasp Quality抓取质量稳定性、抗扰性等
Force Closure力封闭经典抓取稳定性条件
Contact-Rich富接触任务插拔、装配、折叠、擦拭等
Bimanual双臂操作两只手/臂协同
Retargeting动作重定向人/其他机器人动作映射到目标机器人
Teleoperation遥操作人控制机器人采集示范
Kinesthetic Teaching拖动示教人直接拖动机械臂记录轨迹

J. 模仿学习与强化学习

术语中文与定位备注
IL模仿学习从专家演示学习
BC行为克隆监督学习观测→动作
DAggerDataset Aggregation在线收集策略状态并让专家纠正
RL强化学习通过奖励和试错优化策略
Model-Free RL无模型 RL不显式学习动力学模型
Model-Based RL基于模型 RL利用真实/学习世界模型做规划或训练
Offline RL离线强化学习仅用固定数据集
Online RL在线强化学习部署中继续与环境交互
PPOProximal Policy Optimization常用 on-policy RL
SACSoft Actor-Critic常用 off-policy 连续控制 RL
DQNDeep Q-Network经典离散动作 RL
IRL逆强化学习从演示推断奖励
Reward Model奖励模型学习判断行为质量/任务是否成功
RLHF人类反馈强化学习更常见于大模型,也可扩展到机器人偏好
DPO直接偏好优化偏好对齐方法,机器人中需明确应用设定
MDP马尔可夫决策过程RL 基础数学框架
POMDP部分可观测 MDP更符合真实机器人不完全观测
Covariate Shift协变量偏移BC 部署失败的核心原因之一
Catastrophic Forgetting灾难性遗忘持续学习新技能后忘掉旧技能
Continual Learning持续学习持续吸收新知识/技能
Lifelong Learning终身学习长周期持续学习与保持能力

K. 数据与评测

术语中文与定位备注
Episode一个完整交互回合从开始到成功/失败/终止
Demonstration专家示范imitation learning 数据基本单位
Trajectory轨迹状态/观测/动作序列
Dataset Mixture数据混合多来源、多机器人训练混合
Data Engine数据引擎采集→清洗→标注→训练→部署→失败回流闭环
RLDSReinforcement Learning Datasets 格式Open X-Embodiment 使用
LeRobotDatasetLeRobot 标准数据格式同步视频+状态+动作
Open X-Embodiment多机器人开放数据集合与统一格式跨本体预训练的重要基础
DROID大规模 in-the-wild 操作数据真实多场景
BridgeData V2多任务操作数据多环境、多语言指令
AgiBot World大规模真实机器人数据平台双臂/全身/多模态方向活跃
LIBERO机器人 lifelong / multi-task 操作 benchmarkVLA 常用
RoboCasa家居/厨房模拟与 benchmark2026 RoboCasa365 扩展明显
Success Rate成功率必须结合测试次数和难度看
SPLSuccess weighted by Path Length导航成功+路径效率
Collision Rate碰撞率无人机/导航关键
Intervention Rate人工干预率真实部署价值很高
Recovery Rate恢复率扰动/失败后恢复能力
Seen / Unseen已见/未见必须看作者怎么定义“未见”

L. 仿真与 Sim2Real

术语中文与定位备注
Simulation仿真物理与传感器虚拟环境
Sim2Real仿真到现实迁移从仿真策略迁移真机
Real2Sim现实到仿真从真实场景构建仿真资产/数字孪生
Domain Randomization域随机化随机纹理、光照、动力学参数
System Identification系统辨识用真机数据估计动力学参数
Residual Learning残差学习学经典模型未建模部分
Synthetic Data合成数据仿真/生成模型产生的训练数据
HILHardware-in-the-Loop部分真实硬件接入仿真闭环
SILSoftware-in-the-Loop纯软件闭环测试
Isaac SimNVIDIA GPU 机器人仿真高保真、合成数据、USD
Isaac LabGPU 并行机器人学习框架RL/IL/humanoid
MuJoCo高性能动力学仿真控制、RL、操作
GazeboROS 生态仿真移动机器人、无人机等
Habitat具身导航仿真VLN/EQA/室内任务
ManiSkill操作学习平台机器人操作 benchmark
RLBench机械臂多任务 benchmarkIL/操作
AirSim无人机/车辆视觉仿真Aerial navigation/perception
RoboCasa家庭操作仿真平台generalist robot learning

M. ROS 2 与机器人软件工程

术语中文与定位备注
ROS 2机器人中间件与工具生态不是控制算法
Node节点独立功能进程/组件
Topic话题发布-订阅消息通道
Service服务同步请求-响应
Action动作接口适合长耗时、有反馈、可取消任务
DDSData Distribution ServiceROS 2 通信底层
TF2坐标变换系统机器人多坐标系核心
rosbag2数据录制与回放采集传感器/调试
URDF机器人描述格式连杆、关节、惯量等
SDF仿真描述格式Gazebo 等常用
USD / OpenUSD通用 3D 场景描述Isaac / Omniverse 生态
MoveIt 2ROS 2 机械臂规划平台IK、碰撞、规划、执行
Nav2ROS 2 导航框架costmap、planner、controller、BT

N. 无人机与 PX4

术语中文与定位备注
UAV / UAS无人机 / 无人航空系统UAS 更强调完整系统
MAVMicro Aerial Vehicle微型飞行器
Quadrotor四旋翼四个旋翼的多旋翼飞行器
6-DoF六自由度x/y/z 平移 + roll/pitch/yaw
PX4开源飞控栈姿态、位置、任务、failsafe 等
ArduPilot另一主流开源飞控多种飞行器支持
MAVLink飞行器通信协议PX4/ArduPilot/QGC 常用
MAVSDKMAVLink 高层 SDK应用开发
MAVROSROS 与 MAVLink 桥接ROS 1/2 场景常见
uORBPX4 内部消息总线飞控模块间通信
XRCE-DDSPX4 ↔ ROS 2 通信路径之一与 ROS 2/DDS 生态衔接
Offboard Mode外部控制模式companion computer 给 setpoint
Setpoint设定值位置/速度/姿态/角速度/推力等
ENUEast-North-UpROS 常见世界坐标约定
NEDNorth-East-Down航空/PX4 常见坐标约定
FRDFront-Right-Down飞机机体系常见
RTLReturn-to-Launch返航 failsafe/飞行模式
Geofence地理围栏限制飞行区域
VIO for UAV无人机视觉惯性里程计GNSS-denied 环境核心
Aerial VLN空中视觉语言导航UAV + language grounding
UAV VLA面向 UAV 的 VLA必须说明输出 action space
Active Aerial Perception空中主动感知自主选择视点收集信息
Swarm集群多无人机协作
Formation Control编队控制保持队形
MARL多智能体强化学习多机协同学习
Task Allocation任务分配多机决定谁做什么
Cooperative Perception协同感知多机共享感知信息

O. 人形机器人

术语中文与定位备注
Humanoid人形机器人具有人形躯干/四肢结构
Bipedal Locomotion双足运动走路、跑步、平衡
Gait步态行走周期模式
ZMPZero Moment Point经典双足稳定性指标
CoMCenter of Mass质心
Support Polygon支撑多边形静态/准静态平衡常用
Whole-Body Policy全身策略同时输出腿、躯干、臂等动作
Loco-Manipulation移动操作走路与操作协同
Motion Retargeting动作重定向人体/其他机器人动作映射到 humanoid
Teleop Suit全身遥操作设备数据采集手段之一

P. 部署、系统与性能

术语中文与定位备注
Latency延迟从观测到动作可用的时间
Throughput吞吐量单位时间处理多少请求/帧
Control Frequency控制频率控制闭环更新速率
Policy Frequency策略频率学习模型动作更新速率
Edge Computing边缘计算在机器人本地/近端运行计算
Companion Computer伴随计算机UAV 上运行 ROS/VLM/规划等
JetsonNVIDIA 边缘计算平台机器人常用
ONNX模型交换格式跨框架部署
TensorRTNVIDIA 推理优化GPU 低延迟部署
Quantization量化FP16/INT8/INT4 等压缩加速
KV CacheTransformer 缓存加速自回归推理
Watchdog看门狗检测程序/通信失效并恢复/触发安全行为
Failsafe故障保护无人机/机器人异常时进入安全状态
E-stop急停真实机器人必须重视的硬件安全接口

最后:看到一个新缩写时的 6 问法

  1. 它属于感知、定位、推理、策略、规划、控制还是系统工程?
  2. 输入是什么? 图像、文本、状态、地图、触觉还是历史动作?
  3. 输出到底是什么物理量? 文本、航点、末端位姿、关节、速度还是推力?
  4. 执行频率是多少? 1 Hz 和 500 Hz 是完全不同的问题。
  5. 它替代了哪一层?又保留了哪一层?
  6. 它是真正的领域标准词,还是某篇论文自己起的名字?
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐