移动机器人传感器综述 论文阅读笔记《A Review of Sensing Technologies for Indoor Autonomous Mobile Robots》
原文来源:

这篇综述《A Review of Sensing Technologies for Indoor Autonomous Mobile Robots》的行文逻辑非常清晰:总—分—总,任务驱动,从单传感器到多传感器,从传统方法到学习/优化方法,最后落到趋势与挑战。下面按“行文架构 + 内容详述”的方式总结。
一、总体行文架构
论文整体结构如下:
-
引言:先搭AMR系统框架,再收缩到感知。
-
感知任务展开:定位、建图/SLAM、障碍识别与避障。
-
单传感器综述:IMU、超声波、红外、LiDAR、视觉、射频。
-
多传感器融合:Kalman、粒子滤波、神经网络、其他方法。
-
讨论与未来趋势:如何选传感器、LiDAR vs 视觉、未来方向。
其核心写作套路是:
先定义AMR需要哪些模块 → 说明感知为什么关键 → 把感知拆成定位、建图、物体/障碍识别等任务 → 再按传感器类型逐一介绍 → 最后讲多传感器融合和未来趋势。
每一类传感器或算法基本遵循:
是什么 → 有哪些类别 → 如何实现 → 有什么用 → 优缺点 → 如何改进/代表工作。
二、引言部分:先搭AMR框架,再聚焦感知
论文开篇指出,移动机器人基础包括四个模块:

-
Locomotion 运动:运动系统设计,涉及运动环境、可控性、效率、稳定性等。
-
-
Perception 感知:获取机器人工作环境和自身信息。
-
-
Cognition 认知:分析处理感知数据,给运动系统提供控制方案。
-
-
Navigation 导航:依赖感知、认知和运动控制,从起点到目标点。
-
其中,论文并没有详细展开locomotion、cognition、navigation,而是粗略定义后迅速聚焦到perception。原因是:感知是移动机器人安全高效执行任务的前提;如果无法准确高效感知环境,连简单任务也无法完成。
接着,论文把感知系统的主要任务概括为:

-
Localization 定位
-
Map building 建图
-
Object detection 物体检测
-
Obstacle avoidance 避障
-
Motion tasks 运动任务
然后分别解释这些任务。
1. 定位 Localization
是什么:估计移动机器人在运动过程中相对于周围工作区域的位置,是导航的基础。
类别:
![]()
-
惯性导航
-
GPS
-
主动信标/路标导航
-
模型匹配
如何实现/用途:
-
惯性导航:利用响应惯性力的传感器数据。
-
-
GPS:卫星定位,室外有效,室内受非视距和信号遮挡限制。
-
-
主动信标/路标:利用已知位置的信标或路标,通过相对位置关系定位,如图1a。
-
-
模型匹配:将传感器数据与地图模型匹配,例如2D LiDAR点云与占用栅格地图匹配,如图1b。
-
优缺点/改进:
-
GPS适用于室外导航,但是在室内受到非线性光源和信号阻挡的问题。
-
-
信标/路标需要部署维护。
-
模型匹配依赖环境地图和传感器观测。
2. 建图与SLAM
是什么:SLAM即同时定位与建图,机器人在未知环境中确定自身位置,同时构建环境地图。
组成:

-
定位组件:在已有地图上估计机器人位置。
-
建图组件:构建环境地图。
-
两者相互依赖、迭代提升精度。
常用传感器:LiDAR和视觉相机。
类别:

滤波方法:如Kalman滤波SLAM、粒子滤波SLAM。流程见图2:传感器数据→预处理→扫描匹配→状态估计→地图更新。
滤波SLAM的流程
论文Figure 2展示了滤波SLAM的典型流程:
Sensor data → Sensor data preprocessing → Scanning matching → State estimation → Map update
逐步解释:
Sensor data(传感器数据):LiDAR、相机、IMU等原始数据。
Sensor data preprocessing(预处理):去噪、去畸变、时间戳对齐等。
注意:这是一个递归的在线过程,每一步只依赖上一时刻的状态和当前观测,不需要像图优化那样保存所有历史节点再全局优化。
Scanning matching(扫描匹配):把当前帧的观测与已有地图或上一帧观测进行匹配,找出相对位姿变化。这是滤波SLAM的“观测模型”。
State estimation(状态估计):用滤波器(Kalman/粒子滤波)融合运动模型(预测)和观测模型(更新),估计当前机器人位姿。
Map update(地图更新):根据估计出的位姿,把新观测到的特征加入地图,更新地图概率分布。
图优化方法:前端+后端。前端做特征提取、数据关联;后端做位姿图优化。节点表示待优化变量,边表示误差或约束,如图3。
改进/趋势:

-
强化学习让机器人逐渐摆脱先验地图限制,仅通过图像输入判断导航动作。
-
设置到达奖励、碰撞奖励、好奇心奖励等,训练神经网络实现导航决策。
3. 障碍避免与物体检测
是什么:机器人移动中必须避免碰撞,避障是自主移动机器人关键任务。
如何实现:

-
避障更关注机器人周围近距离物体的局部位置信息。
-
范围传感器如超声波、LiDAR适合障碍检测。
-
视觉相机可识别障碍,甚至预测动态障碍轨迹。
用途:认知系统根据障碍距离和方向进行路径规划。
4. 传感器分类
论文把传感器分为:

-
本体感受/外部感受:proprioceptive / exteroceptive。
-
主动/被动:active / passive。
本体感受:电机速度、轮转角等,如编码器、加速度计、陀螺仪。
外部感受:图像、声波、无线信号,如视觉、超声波、LiDAR。
主动:向外发射能量并测量反馈,如声纳、LiDAR。
被动:测量进入传感器的环境能量,如CCD/CMOS相机。
三、单传感器技术详述
第2节是全文最大篇幅,按传感器类型逐一展开。每种传感器基本都按“原理—类别—实现—用途—优缺点—改进”来写。
1. IMU 惯性测量单元
是什么:集成加速度计、陀螺仪、磁力计,测量加速度、角速度、地磁方向。属于本体感受传感器。
如何实现:INS惯性导航系统用IMU做航位推算。根据初始位置、方向、速度,对加速度和角速度积分得到轨迹,如图4。

dead-reckoning:推断位置

优点:
-
输出更新率高。
-
不受外部干扰。
缺点:
-
依赖初始条件。
-
误差随时间累积,因为需要双重积分。
-
磁力计精度低,难以用于精确导航。
改进:
-
与其他传感器融合,作为辅助测量。
-
例如IMU+蓝牙+磁力计;IMU+视觉+EKF;轮式里程计+IMU+UWB+EKF。
2. 超声波/声纳
是什么:频率高于20kHz的声波,超出人耳上限。通常用于测距。
类别/测距方式:

-
反射型:发射→遇障碍反射→接收,测距离。
-
单向型:发射器和接收器分置,接收器接收发射器信号测距离。
-
测距依据:时间、相位、声振动。
用途:定位、导航、避障。

优点:
-
低成本。
-
对透明或反射物体,如玻璃、镜子,检测效果较好,这是很多光学传感器的难点。
缺点:
-
超声波波束太宽,方向精度差。
-
镜面反射导致距离计算不准。
-
易受环境噪声影响。
-
远距离强度衰减。
-
难以测量环境细节特征。
改进:
-
根据几何可靠性给声纳数据加权,构建占用栅格地图。
-
累积声纳数据实现房间级定位。
-
多超声波传感器、全向超声、粒子滤波、Kalman滤波等。
3. 红外传感器
是什么:红外是可见光与微波之间的电磁波。发射红外光束,接收器测强度。强度随距离衰减,也可用ToF测距。
类别:反射型、单向型。
用途:

-
定位:红外信标+CCD相机、三角/三边测量、EKF融合。
-
目标跟踪:发射器和接收器装在不同机器人上。
-
避障:响应快、体积小。

优点:成本低、响应快、体积小。
缺点:
-
难以穿透物体。
-
易受周围环境、光源、反射影响。
-
红外信标定位中障碍物可直接遮挡红外线。
改进:常作为辅助传感器,与超声波、视觉等融合。
4. LiDAR

是什么:激光探测与测距。发射多束激光,遇物体反射,接收后通过ToF测距,获得周围信息。

类别:室内移动机器人主要用2D LiDAR;3D LiDAR多用于智能驾驶。
用途:
-
定位:基于环境地图,如与占用栅格地图匹配。
-
SLAM:无先验地图时,用LiDAR点云估计位置并建图。
-
障碍检测、行人检测、跟踪。
优点:

-
测距精度高。
-
测量速度快、距离远。
-
相比视觉,受光照变化影响小,计算量相对小。
缺点:

-
玻璃、镜面等透明/反射环境下误差大。
-
2D LiDAR缺少高度信息。
-
旋转机构长期稳定性可能受影响。
改进:
-
玻璃墙环境:预计算候选距离,估计反射类型,扫描匹配。
-
与超声波融合,提高玻璃/镜面检测。
-
强度辅助SLAM、强度ICP、关键帧聚类去噪。
-
3D LiDAR点云转为2D LiDAR点云,降低计算量,同时识别不同高度障碍。
-
VLP+LiDAR SLAM松耦合融合。

论文表达上,提出可以用 proposed devised presented等
典型2D LiDAR SLAM方法:

-
Gmapping:基于RBPF,改进提议分布和选择性重采样。

-
Hector SLAM:基于EKF,可不用里程计,适合空中或不平地面,但LiDAR旋转过快易漂移。

-
Karto SLAM:首个开源PGO算法,稀疏Cholesky分解,引入后端优化和回环检测,适合大环境。

-
Cartographer:基于PGO,子图+回环检测,局部与全局结合,实时性好。
5. 视觉传感器

是什么:模拟人类视觉,捕捉、感知、解释可见光信息,输出数字信号。
主要类型:

-
单目相机
-
双目相机
-
RGBD相机
-
事件相机
-
光场相机
表1总结:

-
单目:成本低、易集成,但不能直接提供深度。
-
双目:左右图像,可立体视觉,但标定复杂、计算复杂、深度范围有限。
-
RGBD:直接提供RGB和深度,深度信息易受环境影响。
-
事件相机:以像素变化为事件,高动态、低功耗,但需预处理。
-
光场相机:加微透镜阵列,提供尺度信息,但计算量大,难实时。
实现/定位:
-
单目:针孔模型,通过帧间图像对比估计相机自身位置变化,本质是对极几何问题:
E=t^\wedge R,\ x_2^T E x_1=0E=t∧R, x2TEx1=0,八点法可求解;深度靠三角化。 -
双目/RGBD:可直接获得深度,用PNP算法,六对匹配点即可估计位姿;也可用P3P、EPNP减少点数。
-
事件相机:匹配时间、像素坐标、光强变化。
-
神经隐式方法:用函数或神经网络表示体素、网格、距离场等,适合复杂纹理和动态场景,如NICE-SLAM。
视觉预处理:


-
去畸变。
-
给特定物体分配语义标签。
-
图像部分重建,用GAN、扩散模型等减少光照、动态物体、阴影干扰。
地图类型:

-
点云地图:精度高,但存储和构建成本大。
-
3D占用栅格地图:降低计算和存储,适合大规模。
-
TSDF地图:截断符号距离函数,适合RGBD,精度高。
-
语义地图:加入语义信息,利于人机交互、动态物体剔除。
-
无地图导航:基于图像和深度强化学习,端到端感知决策,轻量、适应动态环境,但奖励机制和网络结构是挑战。
障碍识别优势:视觉相机能识别障碍,提供丰富环境信息,适合避障。
6. 射频技术 RF

用途:室内移动机器人定位。系统由信标站BS和移动机器人组成。RF可穿透门墙,覆盖建筑。
类型:WiFi、Bluetooth、Zigbee、UWB、RFID。
NLOS 的字面意思
-
LOS = Line-of-Sight:视距,发射器和接收器之间没有遮挡,信号直线传播。
-
NLOS = Non-Line-of-Sight:非视距,发射器和接收器之间有遮挡物(墙、门、家具、人体等),信号不能直线到达,只能通过反射、衍射、穿透等方式绕过来。
表2特点:

-
WiFi:范围250m,成本高,实现简单、覆盖大、速率高,但功耗高、精度有限、易受NLOS影响。
-
Zigbee:100m,中成本,极低能耗、低成本,但速率低、延迟高、易受NLOS影响。
-
Bluetooth:100m,低成本,简单、低能耗,但覆盖小、速率低、易受NLOS影响。
-
UWB:100m,高成本,高精度、高速率、低延迟、抗干扰、NLOS鲁棒,但高能耗和系统成本。
-
RFID:5m,低成本,极低能耗、简单、特定方法下精度高,但覆盖小、易受NLOS影响。
定位算法:

-
几何法:TOA、TDOA、AOA、RSSI,如图6。
-
TOA:测传播时间,需基站与机器人时间同步。
-
TDOA:测不同接收器到达时间差,只需基站间同步。
-
AOA:测信号到达角。
-
RSSI:测接收信号强度,用传播损耗模型算距离。
-





-
指纹法:预先建立指纹数据库,实时匹配RSSI等特征。精度更高,但建库工作量大,接收站位置变化需重建。

总结对比
| 方法 | 测量量 | 几何原理 | 最少基站数 | 同步要求 | 主要误差来源 |
|---|---|---|---|---|---|
| TOA | 传播时间 | 圆交汇(三边) | 3 | 基站与机器人同步 | 时间同步误差、NLOS |
| TDOA | 到达时间差 | 双曲线交汇 | 3 | 仅基站间同步 | NLOS、多径 |
| AOA | 到达角 | 射线交汇(三角) | 2 | 无需时间同步 | 角度误差、多径 |
| RSSI | 信号强度 | 圆交汇(三边) | 3 | 无需时间同步 | NLOS、多径、衰减模型不准 |
| 指纹 | RSSI 特征向量 | 数据库匹配 | 不要求几何 | 无 | 建库工作量大、环境变化 |
各RF技术改进:
-
WiFi:优化指纹定位、深度模糊森林、WiFi+视觉+LiDAR粗定位。
-
深度(Deep):指模型采用类似神经网络的“级联(Cascade)”结构。每一层由多个“模糊森林”组成,将上一层输出的特征(如信号强度)进一步抽象和组合,逐层传递,从而学习到更深层、更复杂的表征。
-
模糊(Fuzzy):指森林中的每棵“树”是“模糊决策树”。与传统决策树做“是/否”的硬划分不同,模糊决策树允许样本以一定的概率(或隶属度) 进入左右分支,这能更好地处理WiFi信号强度中普遍存在的噪声和不确定性。
-
森林(Forest):指集成了多棵模糊决策树,通过“集成学习”来提升整体的稳定性和准确率。
深度模糊森林:该方法被设计为一个端到端的坐标回归器:
-
输入是移动机器人接收到的多个WiFi路由器的RSSI特征向量。
-
深度模糊森林内部通过级联结构逐层提取特征。
-
最终输出是预测的机器人坐标。
论文指出,该模型融合了决策树和深度神经网络的优点
-
Zigbee:参考节点三角布局精度高;Zigbee RSSI+里程计自适应滤波;最小二乘校正RSSI。
Zigbee 也是一种自组网、协同通信的技术具体来说:
低功耗:Zigbee 设备在休眠和唤醒之间切换,电池可以用很久,适合传感器网络。
低速率:传输速率通常只有 250 kbps(2.4 GHz),远低于 WiFi。
低延迟但比 WiFi 差:论文指出 Zigbee 延迟较高,不适合实时视频等大流量场景。
自组网:支持星型、树型、网状(Mesh) 拓扑,节点可以互相转发数据,扩展覆盖范围。
低成本:芯片和模块便宜,适合大规模部署。
-
Bluetooth:RSSI+三边测量,精度约1m;BLE 5.1 AOA;BLE易受干扰,可与IMU融合。
-
UWB:梯度下降+最小二乘;TDOA+高斯滤波+加权;INS/UWB+IMM+Kalman;UWB+里程计WAKF;LiDAR/UWB多机器人SLAM。
UWB(Ultra-Wideband,超宽带)是一种极短脉冲、极宽频带的无线通信技术。在论文的室内移动机器人定位部分,它被列为射频(RF)定位技术中精度最高、对 NLOS 最鲁棒的一种。
UWB 为什么精度高、抗 NLOS
1. 时间分辨率极高
UWB 脉冲极短,接收端可以非常精确地分辨直射路径和反射路径的到达时间。
传统 WiFi/蓝牙信号持续时间长,多径信号会重叠在一起,难以区分;UWB 脉冲短,多径副本在时间上分得很开,容易剔除。
2. 对 NLOS 鲁棒
在 NLOS 环境下,信号会反射、绕射。UWB 因为时间分辨率高,能识别出最先到达的直射路径(如果存在),或者至少能更准确地估计传播时间,因此距离误差比 WiFi、蓝牙、Zigbee 小得多。
3. 抗干扰能力强
UWB 频带极宽,功率谱密度极低,对其他窄带通信系统干扰小,也不容易被窄带干扰影响。
4. 低延迟、高速率
UWB 可以支持很高的数据传输速率,同时延迟很低,适合实时定位。
-
RFID:粒子滤波、粒子平滑、线性最小二乘,适合短距离目标跟踪识别。
7. 单传感器总结

论文表3总结:
-
IMU:高频、抗干扰,但需初始条件、误差累积。
-
超声波:低成本、不受透明/反射物体影响,但远距离衰减、噪声敏感。
-
红外:低成本,但易受环境光和反射干扰。
-
LiDAR:测距精度高,但透明/反射环境受限。
-
视觉:信息丰富,但计算量大、易受光照影响。
-
RF:环境和障碍影响小,但不适合未知环境,无法测朝向。
四、多传感器融合
第3节指出:单一传感器难以满足复杂场景,多传感器融合可取长补短,提高定位精度、障碍识别效率等。常用融合算法包括:

1. Kalman滤波类

适用:高频、高精度动态数据融合。假设线性、高斯分布、噪声高斯时,只需均值和方差迭代。
卡尔曼滤波通常计算量更小,在满足高斯分布假设的场景下极其高效。
同样,我们按照数据流向,从左到右拆解这个流程:
1. 输入端:多传感器信息
图中有两路“Sensor information”输入:
上方输入(Sensor information):通常指外部环境传感器,如激光雷达(LiDAR)、摄像头、GPS等。它的作用是提供绝对观测,用来修正累积误差。
左侧输入(Sensor information):通常指内部运动传感器,如轮速计(Odometry)、IMU(惯性测量单元)。它的作用是提供相对运动,用来推算下一时刻的位置。
2. 预处理阶段:匹配(Match)
match(匹配):上方传感器信息首先进入“match”模块。
作用:这通常是将当前传感器扫描到的环境特征(比如激光点云)与已知地图进行比对,找出当前观测到的特征在地图中的实际位置。这一步的输出相当于一个观测值(Measurement),准备用来校正状态。
3. 卡尔曼滤波核心阶段(虚线框内)
虚线框内是卡尔曼滤波的两个经典步骤:预测(Prediction) 和 更新(Update)。
State prediction(状态预测):
输入:左侧的传感器信息(通常是里程计/IMU)和上一时刻的状态。
原理:根据运动学模型,推算“如果机器人按照这个速度移动,下一秒大概会在哪里”。这一步会增加系统的不确定性(因为运动模型有误差,且没有外部观测来纠正)。
输出:预测的机器人状态(先验估计)和预测的协方差矩阵。
State update(状态更新):
输入:上一步的预测状态 + 上方“match”模块传来的观测值。
原理:这是卡尔曼滤波的核心校正步骤。系统会比较“预测的位置”和“观测到的位置”,并根据两者的置信度(协方差)进行加权平均。
卡尔曼增益(Kalman Gain):算法会自动计算一个权重——如果预测很准(不确定性小),就更相信预测;如果观测很准(传感器精度高),就更相信观测。
输出:更新后的机器人状态(后验估计)。这一步会减小系统的不确定性,得到更准确的结果。
4. 输出端
Estimated state(估计状态):经过预测和更新后,系统输出当前时刻最优的状态估计(位置、速度、姿态等)。
流程:预测+更新,如图7。
改进:EKF、UKF处理非线性。
代表:
-
视觉SLAM+LiDAR SLAM+EKF惯性导航。
-
超声波+红外+电子罗盘+EKF避障。
-
LiDAR+RGBD+编码器+IMU+UKF。
-
rank Kalman、迭代Kalman、LiDAR-惯性里程计。
2. 粒子滤波类


适用:任意分布,蒙特卡洛,用粒子表示概率密度,权重大表示匹配好。

问题:全局定位时粒子分布全图,计算量大。
改进:粗定位+精定位,如图8。
1. 输入端:多传感器信息
图的最左侧和最上方有多个输入源,这就是“多传感器融合”的体现:
Sensor information(传感器信息):最左侧输入,通常指激光雷达(LiDAR)、摄像头、毫米波雷达等环境感知传感器的数据。
Sensor information (Odometry)(里程计信息):下方输入,通常来自轮速计或IMU(惯性测量单元),用于提供机器人自身运动估计(运动模型)。
Map(地图):上方输入,提供环境先验信息,用于和传感器观测数据进行匹配。
2. 预处理与初始化阶段(虚线框外)
Rough localization(粗略定位):这是算法的第一步。系统利用最左侧的传感器信息,先粗略估算出机器人当前大概在什么位置。这一步通常计算量小,但精度不高,主要是为了给后面的粒子滤波提供一个初始的搜索范围。
3. 粒子滤波核心阶段(虚线框内)
虚线框内是经典的粒子滤波算法流程,包含四个核心步骤:
Particle cloud generation(粒子云生成):
根据上一步的“粗略定位”结果,在机器人可能存在的空间内随机撒下大量的“粒子”(Particle)。每个粒子代表一个可能的位姿(位置+朝向)。粒子云越密集,初始覆盖范围越广。
Particle motion simulation(粒子运动模拟):
结合下方的里程计信息(Odometry),对每一个粒子进行运动学推演。也就是模拟“如果机器人真的在这个位置,根据轮子转动和惯性,它现在应该走到哪里了”。这一步会让粒子云随着机器人的移动而移动。
Weight calculation(权重计算):
这是最关键的一步。结合上方的地图(Map)和最新的传感器信息(Sensor information),计算每个粒子的权重。
原理:如果某个粒子所在的位置,传感器探测到的环境与地图上的特征吻合度极高,那么这个粒子的权重就高(代表它更可能是真实位置);反之,如果探测结果与地图完全对不上,权重就低。
Resampling(重采样):
根据权重,淘汰掉那些权重极低(位置不对)的粒子,并复制权重高的粒子。这样,粒子云会逐渐向真实位置集中。重采样后,粒子分布更加精准。
4. 输出端
Estimated state(估计状态):经过重采样后,系统将所有粒子的状态进行加权平均(或其他统计方式),输出最终估算出的机器人状态(通常是高精度的位置和姿态)。
总结一下它的工作逻辑:
先大概知道在哪(粗略定位)。
撒一堆可能的位置点(粒子云生成)。
根据运动模型让这些点动起来(运动模拟)。
看看哪个点跟地图和传感器最吻合(权重计算)。
把不吻合的点杀掉,留下吻合的点(重采样)。
输出最吻合的那个位置(估计状态)。
这种架构的优点是:抗干扰能力强,能处理非线性、非高斯分布的问题,非常适合在复杂环境中融合多种传感器(如激光+里程计+地图)来实现高精度的定位。
-
CNN图像检索候选位置+LiDAR AMCL精定位。
-
文本语义粗定位+LiDAR MCL。
-
LiDAR+双AprilTag粗定位+自适应蒙特卡洛。
3. 神经网络类

优势:自动提取特征,避免手工设计,泛化好、鲁棒,适合非线性,精度可能更高。如图9。
如果说前两张图(粒子滤波、卡尔曼滤波)是基于模型(Model-based)的方法(依赖于物理公式和概率统计),那么这张图代表的是基于数据驱动(Data-driven)的方法。它不依赖人工建立的复杂运动学或观测方程,而是让神经网络自己从大量数据中学习传感器之间的关联。
我们同样按照数据流向,从上到下拆解:
1. 输入端:多源传感器信息
Sensor information 1, 2, ..., n:
图上方有多个并列的输入箭头,代表系统同时接收多种不同类型的传感器数据。
这些传感器可能包括:摄像头(图像)、激光雷达(点云)、毫米波雷达、IMU(惯性测量单元)、轮速计、GPS等。它们的数据格式、量纲、频率通常各不相同。
2. 预处理阶段:归一化(Normalization)
Normalization(归一化):
这是数据进入神经网络前的关键预处理步骤。
为什么需要? 不同传感器的数据范围差异巨大。比如,图像像素值可能是 0-255,IMU 的角速度可能是 -10 到 10 rad/s,GPS 坐标可能是几百万的数值。如果不处理,数值大的特征会主导网络训练,导致模型无法收敛。
作用:将各种传感器的数据通过数学变换(如 Min-Max 缩放、Z-Score 标准化等),统一映射到相似的数值范围(通常是 0-1 或均值为0方差为1)。这样能加速神经网络的训练,并提高最终精度。
3. 核心处理阶段:神经网络(Neural Network)
Neural network(神经网络):
归一化后的多路数据被送入一个神经网络模型(具体是什么网络取决于任务,可能是全连接网络 MLP、卷积神经网络 CNN、循环神经网络 RNN 或 Transformer 等)。
黑盒特性:与卡尔曼滤波有明确的“预测-更新”公式不同,神经网络是一个“黑盒”。它内部包含大量的权重参数(Weights)和偏置(Biases)。
工作原理:网络通过多层神经元对输入特征进行非线性变换和特征提取。在训练阶段,它会通过反向传播算法,学习如何将多传感器输入映射到正确的输出状态。它自动学习到了“在什么情况下该相信哪个传感器”以及“传感器之间的互补关系”。
4. 输出端
Estimated state(估计状态):神经网络最后一层的输出,就是融合后的最终结果(如机器人的位置、速度、姿态等)。
代表:
-
ANN融合声纳、罗盘、无线信号。
-
LiDAR+编码器三层网络。
-
2D LiDAR+IMU的RCNN。
-
相机+2D LiDAR的FusionLoc,多头上自注意力。
-
RSSI+磁力计+MLP。
-
超声波+双目+2D LiDAR+ANN。
4. 其他方法
-
加权平均:简单、实时,但未考虑前后状态关系,动态环境抗扰差。
-
图优化:SLAM中多传感器融合框架。如UWB+LiDAR+里程计两阶段优化:先UWB节点和里程计边粗优化,再LiDAR ICP精优化。能处理非线性,但计算复杂度高,通常回环或重定位时优化。

三种算法大总结(图7、8、9对比)
到这里,你已经看完了多传感器融合的三类主流方法。我把它们放在一起对比,帮你建立一个完整的知识框架:
| 特性 | 图7:卡尔曼滤波 (KF/EKF/UKF) | 图8:粒子滤波 (PF) | 图9:神经网络 (NN) |
|---|---|---|---|
| 核心逻辑 | 概率统计:高斯分布 + 线性/非线性模型 | 蒙特卡洛:随机采样 + 权重评估 | 数据驱动:学习输入到输出的映射 |
| 依赖条件 | 需要精确的运动模型和观测模型 | 需要精确的运动模型和观测模型 | 需要大量的训练数据(真值标签) |
| 计算复杂度 | 中等(取决于状态维数) | 高(取决于粒子数量) | 推理时低(训练时极高) |
| 可解释性 | 强(每一步都有明确的物理意义) | 强(权重和重采样逻辑清晰) | 弱(黑盒模型,难以解释内部决策) |
| 适用场景 | 线性/弱非线性系统,传感器噪声稳定 | 强非线性、多峰分布、全局定位 | 传感器数据极其复杂、难以建模、有大量数据 |
| 典型应用 | 组合导航、GPS+IMU融合 | 机器人SLAM、蒙特卡洛定位 | 自动驾驶端到端感知、多模态融合 |
总结一下:
-
卡尔曼滤波是经典且可靠的“老大哥”,适合大多数常规场景。
-
粒子滤波是处理复杂、非线性环境的“特种兵”,但计算成本高。
-
神经网络是近年来的“新贵”,它不依赖物理模型,只要有足够的数据,就能拟合出极其复杂的融合策略,是目前自动驾驶和机器人领域非常热门的方向。
五、讨论与未来趋势
讨论:如何选择传感器和算法

-
IMU:短时轨迹推算,辅助其他定位。

-
信标类:RF、超声、红外,可提供稳定绝对位置,但需安装维护,大规模部署成本高。

-
LiDAR/视觉:可精确定位,但依赖环境信息,环境变化时易受影响。
-

-
SLAM中:
-
LiDAR:计算量小、测距准、受光照小,但信息少,2D无高度,旋转机构稳定性问题。
-
视觉:纹理丰富、结构稳定,但受光照、动态、计算量影响。
-
单目室内鲁棒性差。
-
-
障碍检测:
-
视觉:识别障碍,信息丰富。
-
超声波、LiDAR:测距和位置精确。
-
未来趋势

-
多源信息融合:单一传感器难满足复杂场景,多传感器融合提高精度、效率、稳定性。

-
灵活高效的优化策略:针对复杂动态环境,探索合适优化策略;用并行计算、分布式计算提高大规模/多模态数据处理效率。

-
与神经网络结合:神经网络增强稳定性,自学习能力可处理传感器干扰和环境因素;但现有算法在不同室内场景中误差仍大。未来结合更多传感器、更复杂网络结构,以及大语言模型和芯片技术。
六、论文行文架构总结
可以用一句话概括:
论文从AMR四模块出发,粗略定义locomotion、cognition、navigation,迅速聚焦perception;然后把感知拆成定位、建图/SLAM、障碍识别与避障;接着按传感器类型逐一介绍IMU、超声波、红外、LiDAR、视觉、RF;再上升到多传感器融合的Kalman、粒子滤波、神经网络和其他方法;最后讨论选型与未来趋势。
其写作特点:
-
总—分—总:先系统框架,再任务和传感器,再融合与趋势。
-
任务驱动:定位、建图、避障贯穿全文。
-
单传感器到多传感器:先分析各自优缺点,再讲融合。
-
传统到学习:从滤波、图优化到神经网络、强化学习、大模型。
-
每节模板化:定义→分类→原理→用途→优缺点→改进/代表工作。
-
图表辅助:图1定位方法,图2滤波SLAM,图3图优化SLAM,图4 IMU航位推算,图5测距方式,图6 RF定位,图7-9融合算法;表1视觉传感器,表2 RF技术,表3传感器特性。
整体上,这是一篇典型的“感知技术综述”:先建立AMR系统语境,再以感知任务为纲、传感器为目,最后用多传感器融合和未来趋势收束。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

















所有评论(0)