原文来源:

第一次论文选读|机器人工程实践

这篇综述《A Review of Sensing Technologies for Indoor Autonomous Mobile Robots》的行文逻辑非常清晰:总—分—总,任务驱动,从单传感器到多传感器,从传统方法到学习/优化方法,最后落到趋势与挑战。下面按“行文架构 + 内容详述”的方式总结。


一、总体行文架构

论文整体结构如下:

  1. 引言:先搭AMR系统框架,再收缩到感知。

  2. 感知任务展开:定位、建图/SLAM、障碍识别与避障。

  3. 单传感器综述:IMU、超声波、红外、LiDAR、视觉、射频。

  4. 多传感器融合:Kalman、粒子滤波、神经网络、其他方法。

  5. 讨论与未来趋势:如何选传感器、LiDAR vs 视觉、未来方向。

其核心写作套路是:

先定义AMR需要哪些模块 → 说明感知为什么关键 → 把感知拆成定位、建图、物体/障碍识别等任务 → 再按传感器类型逐一介绍 → 最后讲多传感器融合和未来趋势。

每一类传感器或算法基本遵循:

是什么 → 有哪些类别 → 如何实现 → 有什么用 → 优缺点 → 如何改进/代表工作。


二、引言部分:先搭AMR框架,再聚焦感知

论文开篇指出,移动机器人基础包括四个模块:

  • Locomotion 运动:运动系统设计,涉及运动环境、可控性、效率、稳定性等。

  • Perception 感知:获取机器人工作环境和自身信息。

  • Cognition 认知:分析处理感知数据,给运动系统提供控制方案。

  • Navigation 导航:依赖感知、认知和运动控制,从起点到目标点。

其中,论文并没有详细展开locomotion、cognition、navigation,而是粗略定义后迅速聚焦到perception。原因是:感知是移动机器人安全高效执行任务的前提;如果无法准确高效感知环境,连简单任务也无法完成。

接着,论文把感知系统的主要任务概括为:

  • Localization 定位

  • Map building 建图

  • Object detection 物体检测

  • Obstacle avoidance 避障

  • Motion tasks 运动任务

然后分别解释这些任务。

1. 定位 Localization

是什么:估计移动机器人在运动过程中相对于周围工作区域的位置,是导航的基础。

类别:

  • 惯性导航

  • GPS

  • 主动信标/路标导航

  • 模型匹配

如何实现/用途:

  • 惯性导航:利用响应惯性力的传感器数据。

  • GPS:卫星定位,室外有效,室内受非视距和信号遮挡限制。

  • 主动信标/路标:利用已知位置的信标或路标,通过相对位置关系定位,如图1a。

  • 模型匹配:将传感器数据与地图模型匹配,例如2D LiDAR点云与占用栅格地图匹配,如图1b。

优缺点/改进:

  • GPS适用于室外导航,但是在室内受到非线性光源和信号阻挡的问题。

  • 信标/路标需要部署维护。

  • 模型匹配依赖环境地图和传感器观测。

2. 建图与SLAM

是什么:SLAM即同时定位与建图,机器人在未知环境中确定自身位置,同时构建环境地图。

组成:

  • 定位组件:在已有地图上估计机器人位置。

  • 建图组件:构建环境地图。

  • 两者相互依赖、迭代提升精度。

常用传感器:LiDAR和视觉相机。

类别:

  • 滤波方法:如Kalman滤波SLAM、粒子滤波SLAM。流程见图2:传感器数据→预处理→扫描匹配→状态估计→地图更新。

    • 滤波SLAM的流程

      论文Figure 2展示了滤波SLAM的典型流程:

      Sensor data → Sensor data preprocessing → Scanning matching → State estimation → Map update

      逐步解释:

    • Sensor data(传感器数据):LiDAR、相机、IMU等原始数据。

    • Sensor data preprocessing(预处理):去噪、去畸变、时间戳对齐等。

    • 注意:这是一个递归的在线过程,每一步只依赖上一时刻的状态和当前观测,不需要像图优化那样保存所有历史节点再全局优化。

    • Scanning matching(扫描匹配):把当前帧的观测与已有地图或上一帧观测进行匹配,找出相对位姿变化。这是滤波SLAM的“观测模型”。

    • State estimation(状态估计):用滤波器(Kalman/粒子滤波)融合运动模型(预测)和观测模型(更新),估计当前机器人位姿。

    • Map update(地图更新):根据估计出的位姿,把新观测到的特征加入地图,更新地图概率分布。

  • 图优化方法:前端+后端。前端做特征提取、数据关联;后端做位姿图优化。节点表示待优化变量,边表示误差或约束,如图3。

改进/趋势:

  • 强化学习让机器人逐渐摆脱先验地图限制,仅通过图像输入判断导航动作。

  • 设置到达奖励、碰撞奖励、好奇心奖励等,训练神经网络实现导航决策。

3. 障碍避免与物体检测

是什么:机器人移动中必须避免碰撞,避障是自主移动机器人关键任务。

如何实现:

  • 避障更关注机器人周围近距离物体的局部位置信息。

  • 范围传感器如超声波、LiDAR适合障碍检测。

  • 视觉相机可识别障碍,甚至预测动态障碍轨迹。

用途:认知系统根据障碍距离和方向进行路径规划。

4. 传感器分类

论文把传感器分为:

  • 本体感受/外部感受:proprioceptive / exteroceptive。

  • 主动/被动:active / passive。

本体感受:电机速度、轮转角等,如编码器、加速度计、陀螺仪。
外部感受:图像、声波、无线信号,如视觉、超声波、LiDAR。
主动:向外发射能量并测量反馈,如声纳、LiDAR。
被动:测量进入传感器的环境能量,如CCD/CMOS相机。

三、单传感器技术详述

第2节是全文最大篇幅,按传感器类型逐一展开。每种传感器基本都按“原理—类别—实现—用途—优缺点—改进”来写。

1. IMU 惯性测量单元

是什么:集成加速度计、陀螺仪、磁力计,测量加速度、角速度、地磁方向。属于本体感受传感器。

如何实现:INS惯性导航系统用IMU做航位推算。根据初始位置、方向、速度,对加速度和角速度积分得到轨迹,如图4。

dead-reckoning:推断位置

优点:

  • 输出更新率高。

  • 不受外部干扰。

缺点:

  • 依赖初始条件。

  • 误差随时间累积,因为需要双重积分。

  • 磁力计精度低,难以用于精确导航。

改进:

  • 与其他传感器融合,作为辅助测量。

  • 例如IMU+蓝牙+磁力计;IMU+视觉+EKF;轮式里程计+IMU+UWB+EKF。

2. 超声波/声纳

是什么:频率高于20kHz的声波,超出人耳上限。通常用于测距。

类别/测距方式:

  • 反射型:发射→遇障碍反射→接收,测距离。

  • 单向型:发射器和接收器分置,接收器接收发射器信号测距离。

  • 测距依据:时间、相位、声振动。

用途:定位、导航、避障。

优点:

  • 低成本。

  • 对透明或反射物体,如玻璃、镜子,检测效果较好,这是很多光学传感器的难点。

缺点:

  • 超声波波束太宽,方向精度差。

  • 镜面反射导致距离计算不准。

  • 易受环境噪声影响。

  • 远距离强度衰减。

  • 难以测量环境细节特征。

改进:

  • 根据几何可靠性给声纳数据加权,构建占用栅格地图。

  • 累积声纳数据实现房间级定位。

  • 多超声波传感器、全向超声、粒子滤波、Kalman滤波等。

3. 红外传感器

是什么:红外是可见光与微波之间的电磁波。发射红外光束,接收器测强度。强度随距离衰减,也可用ToF测距。

类别:反射型、单向型。

用途:

  • 定位:红外信标+CCD相机、三角/三边测量、EKF融合。

  • 目标跟踪:发射器和接收器装在不同机器人上。

  • 避障:响应快、体积小。

优点:成本低、响应快、体积小。

缺点:

  • 难以穿透物体。

  • 易受周围环境、光源、反射影响。

  • 红外信标定位中障碍物可直接遮挡红外线。

改进:常作为辅助传感器,与超声波、视觉等融合。

4. LiDAR

是什么:激光探测与测距。发射多束激光,遇物体反射,接收后通过ToF测距,获得周围信息。

类别:室内移动机器人主要用2D LiDAR;3D LiDAR多用于智能驾驶。

用途:

  • 定位:基于环境地图,如与占用栅格地图匹配。

  • SLAM:无先验地图时,用LiDAR点云估计位置并建图。

  • 障碍检测、行人检测、跟踪。

优点:

  • 测距精度高。

  • 测量速度快、距离远。

  • 相比视觉,受光照变化影响小,计算量相对小。

缺点:

  • 玻璃、镜面等透明/反射环境下误差大。

  • 2D LiDAR缺少高度信息。

  • 旋转机构长期稳定性可能受影响。

改进:

  • 玻璃墙环境:预计算候选距离,估计反射类型,扫描匹配。

  • 与超声波融合,提高玻璃/镜面检测。

  • 强度辅助SLAM、强度ICP、关键帧聚类去噪。

  • 3D LiDAR点云转为2D LiDAR点云,降低计算量,同时识别不同高度障碍。

  • VLP+LiDAR SLAM松耦合融合。

论文表达上,提出可以用 proposed devised presented等

典型2D LiDAR SLAM方法:

  • Gmapping:基于RBPF,改进提议分布和选择性重采样。

  • Hector SLAM:基于EKF,可不用里程计,适合空中或不平地面,但LiDAR旋转过快易漂移。

  • Karto SLAM:首个开源PGO算法,稀疏Cholesky分解,引入后端优化和回环检测,适合大环境。

  • Cartographer:基于PGO,子图+回环检测,局部与全局结合,实时性好。

5. 视觉传感器

是什么:模拟人类视觉,捕捉、感知、解释可见光信息,输出数字信号。

主要类型:

  • 单目相机

  • 双目相机

  • RGBD相机

  • 事件相机

  • 光场相机

表1总结:

  • 单目:成本低、易集成,但不能直接提供深度。

  • 双目:左右图像,可立体视觉,但标定复杂、计算复杂、深度范围有限。

  • RGBD:直接提供RGB和深度,深度信息易受环境影响。

  • 事件相机:以像素变化为事件,高动态、低功耗,但需预处理。

  • 光场相机:加微透镜阵列,提供尺度信息,但计算量大,难实时。

实现/定位:

  • 单目:针孔模型,通过帧间图像对比估计相机自身位置变化,本质是对极几何问题:
    E=t^\wedge R,\ x_2^T E x_1=0E=t∧R, x2T​Ex1​=0,八点法可求解;深度靠三角化。

  • 双目/RGBD:可直接获得深度,用PNP算法,六对匹配点即可估计位姿;也可用P3P、EPNP减少点数。

  • 事件相机:匹配时间、像素坐标、光强变化。

  • 神经隐式方法:用函数或神经网络表示体素、网格、距离场等,适合复杂纹理和动态场景,如NICE-SLAM。

视觉预处理:

  1. 去畸变。

  2. 给特定物体分配语义标签。

  3. 图像部分重建,用GAN、扩散模型等减少光照、动态物体、阴影干扰。

地图类型:

  • 点云地图:精度高,但存储和构建成本大。

  • 3D占用栅格地图:降低计算和存储,适合大规模。

  • TSDF地图:截断符号距离函数,适合RGBD,精度高。

  • 语义地图:加入语义信息,利于人机交互、动态物体剔除。

  • 无地图导航:基于图像和深度强化学习,端到端感知决策,轻量、适应动态环境,但奖励机制和网络结构是挑战。

障碍识别优势:视觉相机能识别障碍,提供丰富环境信息,适合避障。

6. 射频技术 RF

用途:室内移动机器人定位。系统由信标站BS和移动机器人组成。RF可穿透门墙,覆盖建筑。

类型:WiFi、Bluetooth、Zigbee、UWB、RFID。

NLOS 的字面意思
  • LOS = Line-of-Sight:视距,发射器和接收器之间没有遮挡,信号直线传播。

  • NLOS = Non-Line-of-Sight:非视距,发射器和接收器之间有遮挡物(墙、门、家具、人体等),信号不能直线到达,只能通过反射、衍射、穿透等方式绕过来。

表2特点:

  • WiFi:范围250m,成本高,实现简单、覆盖大、速率高,但功耗高、精度有限、易受NLOS影响。

  • Zigbee:100m,中成本,极低能耗、低成本,但速率低、延迟高、易受NLOS影响。

  • Bluetooth:100m,低成本,简单、低能耗,但覆盖小、速率低、易受NLOS影响。

  • UWB:100m,高成本,高精度、高速率、低延迟、抗干扰、NLOS鲁棒,但高能耗和系统成本。

  • RFID:5m,低成本,极低能耗、简单、特定方法下精度高,但覆盖小、易受NLOS影响。

定位算法:

  • 几何法:TOA、TDOA、AOA、RSSI,如图6。

    • TOA:测传播时间,需基站与机器人时间同步。

    • TDOA:测不同接收器到达时间差,只需基站间同步。

    • AOA:测信号到达角。

    • RSSI:测接收信号强度,用传播损耗模型算距离。

  • 指纹法:预先建立指纹数据库,实时匹配RSSI等特征。精度更高,但建库工作量大,接收站位置变化需重建。

总结对比

方法测量量几何原理最少基站数同步要求主要误差来源
TOA传播时间圆交汇(三边)3基站与机器人同步时间同步误差、NLOS
TDOA到达时间差双曲线交汇3仅基站间同步NLOS、多径
AOA到达角射线交汇(三角)2无需时间同步角度误差、多径
RSSI信号强度圆交汇(三边)3无需时间同步NLOS、多径、衰减模型不准
指纹RSSI 特征向量数据库匹配不要求几何无建库工作量大、环境变化

各RF技术改进:

  • WiFi:优化指纹定位、深度模糊森林、WiFi+视觉+LiDAR粗定位。

  • 深度(Deep):指模型采用类似神经网络的“级联(Cascade)”结构。每一层由多个“模糊森林”组成,将上一层输出的特征(如信号强度)进一步抽象和组合,逐层传递,从而学习到更深层、更复杂的表征。

  • 模糊(Fuzzy):指森林中的每棵“树”是“模糊决策树”。与传统决策树做“是/否”的硬划分不同,模糊决策树允许样本以一定的概率(或隶属度) 进入左右分支,这能更好地处理WiFi信号强度中普遍存在的噪声和不确定性。

  • 森林(Forest):指集成了多棵模糊决策树,通过“集成学习”来提升整体的稳定性和准确率。

     深度模糊森林:该方法被设计为一个端到端的坐标回归器:

  1. 输入是移动机器人接收到的多个WiFi路由器的RSSI特征向量。

  2. 深度模糊森林内部通过级联结构逐层提取特征。

  3. 最终输出是预测的机器人坐标。
    论文指出,该模型融合了决策树和深度神经网络的优点

  • Zigbee:参考节点三角布局精度高;Zigbee RSSI+里程计自适应滤波;最小二乘校正RSSI。
    Zigbee 也是一种自组网、协同通信的技术

    具体来说:

低功耗:Zigbee 设备在休眠和唤醒之间切换,电池可以用很久,适合传感器网络。

低速率:传输速率通常只有 250 kbps(2.4 GHz),远低于 WiFi。

低延迟但比 WiFi 差:论文指出 Zigbee 延迟较高,不适合实时视频等大流量场景。

自组网:支持星型、树型、网状(Mesh) 拓扑,节点可以互相转发数据,扩展覆盖范围。

低成本:芯片和模块便宜,适合大规模部署。

  • Bluetooth:RSSI+三边测量,精度约1m;BLE 5.1 AOA;BLE易受干扰,可与IMU融合。

  • UWB:梯度下降+最小二乘;TDOA+高斯滤波+加权;INS/UWB+IMM+Kalman;UWB+里程计WAKF;LiDAR/UWB多机器人SLAM。
    UWB(Ultra-Wideband,超宽带)是一种极短脉冲、极宽频带的无线通信技术。在论文的室内移动机器人定位部分,它被列为射频(RF)定位技术中精度最高、对 NLOS 最鲁棒的一种。
     

    UWB 为什么精度高、抗 NLOS

    1. 时间分辨率极高

    UWB 脉冲极短,接收端可以非常精确地分辨直射路径和反射路径的到达时间。

    传统 WiFi/蓝牙信号持续时间长,多径信号会重叠在一起,难以区分;UWB 脉冲短,多径副本在时间上分得很开,容易剔除。

    2. 对 NLOS 鲁棒

    在 NLOS 环境下,信号会反射、绕射。UWB 因为时间分辨率高,能识别出最先到达的直射路径(如果存在),或者至少能更准确地估计传播时间,因此距离误差比 WiFi、蓝牙、Zigbee 小得多。

    3. 抗干扰能力强

    UWB 频带极宽,功率谱密度极低,对其他窄带通信系统干扰小,也不容易被窄带干扰影响。

    4. 低延迟、高速率

    UWB 可以支持很高的数据传输速率,同时延迟很低,适合实时定位。

  • RFID:粒子滤波、粒子平滑、线性最小二乘,适合短距离目标跟踪识别。

7. 单传感器总结

论文表3总结:

  • IMU:高频、抗干扰,但需初始条件、误差累积。

  • 超声波:低成本、不受透明/反射物体影响,但远距离衰减、噪声敏感。

  • 红外:低成本,但易受环境光和反射干扰。

  • LiDAR:测距精度高,但透明/反射环境受限。

  • 视觉:信息丰富,但计算量大、易受光照影响。

  • RF:环境和障碍影响小,但不适合未知环境,无法测朝向。

四、多传感器融合

第3节指出:单一传感器难以满足复杂场景,多传感器融合可取长补短,提高定位精度、障碍识别效率等。常用融合算法包括:

1. Kalman滤波类

适用:高频、高精度动态数据融合。假设线性、高斯分布、噪声高斯时,只需均值和方差迭代。

卡尔曼滤波通常计算量更小,在满足高斯分布假设的场景下极其高效。

同样,我们按照数据流向,从左到右拆解这个流程:

1. 输入端:多传感器信息

图中有两路“Sensor information”输入:

  • 上方输入(Sensor information):通常指外部环境传感器,如激光雷达(LiDAR)、摄像头、GPS等。它的作用是提供绝对观测,用来修正累积误差。

  • 左侧输入(Sensor information):通常指内部运动传感器,如轮速计(Odometry)、IMU(惯性测量单元)。它的作用是提供相对运动,用来推算下一时刻的位置。

2. 预处理阶段:匹配(Match)

  • match(匹配):上方传感器信息首先进入“match”模块。

    • 作用:这通常是将当前传感器扫描到的环境特征(比如激光点云)与已知地图进行比对,找出当前观测到的特征在地图中的实际位置。这一步的输出相当于一个观测值(Measurement),准备用来校正状态。

3. 卡尔曼滤波核心阶段(虚线框内)

虚线框内是卡尔曼滤波的两个经典步骤:预测(Prediction) 和 更新(Update)。

  • State prediction(状态预测):

    • 输入:左侧的传感器信息(通常是里程计/IMU)和上一时刻的状态。

    • 原理:根据运动学模型,推算“如果机器人按照这个速度移动,下一秒大概会在哪里”。这一步会增加系统的不确定性(因为运动模型有误差,且没有外部观测来纠正)。

    • 输出:预测的机器人状态(先验估计)和预测的协方差矩阵。

  • State update(状态更新):

    • 输入:上一步的预测状态 + 上方“match”模块传来的观测值。

    • 原理:这是卡尔曼滤波的核心校正步骤。系统会比较“预测的位置”和“观测到的位置”,并根据两者的置信度(协方差)进行加权平均。

    • 卡尔曼增益(Kalman Gain):算法会自动计算一个权重——如果预测很准(不确定性小),就更相信预测;如果观测很准(传感器精度高),就更相信观测。

    • 输出:更新后的机器人状态(后验估计)。这一步会减小系统的不确定性,得到更准确的结果。

4. 输出端

  • Estimated state(估计状态):经过预测和更新后,系统输出当前时刻最优的状态估计(位置、速度、姿态等)。

流程:预测+更新,如图7。

改进:EKF、UKF处理非线性。

代表:

  • 视觉SLAM+LiDAR SLAM+EKF惯性导航。

  • 超声波+红外+电子罗盘+EKF避障。

  • LiDAR+RGBD+编码器+IMU+UKF。

  • rank Kalman、迭代Kalman、LiDAR-惯性里程计。

2. 粒子滤波类

适用:任意分布,蒙特卡洛,用粒子表示概率密度,权重大表示匹配好。

问题:全局定位时粒子分布全图,计算量大。

改进:粗定位+精定位,如图8。

1. 输入端:多传感器信息

图的最左侧和最上方有多个输入源,这就是“多传感器融合”的体现:

  • Sensor information(传感器信息):最左侧输入,通常指激光雷达(LiDAR)、摄像头、毫米波雷达等环境感知传感器的数据。

  • Sensor information (Odometry)(里程计信息):下方输入,通常来自轮速计或IMU(惯性测量单元),用于提供机器人自身运动估计(运动模型)。

  • Map(地图):上方输入,提供环境先验信息,用于和传感器观测数据进行匹配。

2. 预处理与初始化阶段(虚线框外)

  • Rough localization(粗略定位):这是算法的第一步。系统利用最左侧的传感器信息,先粗略估算出机器人当前大概在什么位置。这一步通常计算量小,但精度不高,主要是为了给后面的粒子滤波提供一个初始的搜索范围。

3. 粒子滤波核心阶段(虚线框内)

虚线框内是经典的粒子滤波算法流程,包含四个核心步骤:

  • Particle cloud generation(粒子云生成):

    • 根据上一步的“粗略定位”结果,在机器人可能存在的空间内随机撒下大量的“粒子”(Particle)。每个粒子代表一个可能的位姿(位置+朝向)。粒子云越密集,初始覆盖范围越广。

  • Particle motion simulation(粒子运动模拟):

    • 结合下方的里程计信息(Odometry),对每一个粒子进行运动学推演。也就是模拟“如果机器人真的在这个位置,根据轮子转动和惯性,它现在应该走到哪里了”。这一步会让粒子云随着机器人的移动而移动。

  • Weight calculation(权重计算):

    • 这是最关键的一步。结合上方的地图(Map)和最新的传感器信息(Sensor information),计算每个粒子的权重。

    • 原理:如果某个粒子所在的位置,传感器探测到的环境与地图上的特征吻合度极高,那么这个粒子的权重就高(代表它更可能是真实位置);反之,如果探测结果与地图完全对不上,权重就低。

  • Resampling(重采样):

    • 根据权重,淘汰掉那些权重极低(位置不对)的粒子,并复制权重高的粒子。这样,粒子云会逐渐向真实位置集中。重采样后,粒子分布更加精准。

4. 输出端

  • Estimated state(估计状态):经过重采样后,系统将所有粒子的状态进行加权平均(或其他统计方式),输出最终估算出的机器人状态(通常是高精度的位置和姿态)。

总结一下它的工作逻辑:

  1. 先大概知道在哪(粗略定位)。

  2. 撒一堆可能的位置点(粒子云生成)。

  3. 根据运动模型让这些点动起来(运动模拟)。

  4. 看看哪个点跟地图和传感器最吻合(权重计算)。

  5. 把不吻合的点杀掉,留下吻合的点(重采样)。

  6. 输出最吻合的那个位置(估计状态)。

这种架构的优点是:抗干扰能力强,能处理非线性、非高斯分布的问题,非常适合在复杂环境中融合多种传感器(如激光+里程计+地图)来实现高精度的定位。

  • CNN图像检索候选位置+LiDAR AMCL精定位。

  • 文本语义粗定位+LiDAR MCL。

  • LiDAR+双AprilTag粗定位+自适应蒙特卡洛。

3. 神经网络类

优势:自动提取特征,避免手工设计,泛化好、鲁棒,适合非线性,精度可能更高。如图9。

如果说前两张图(粒子滤波、卡尔曼滤波)是基于模型(Model-based)的方法(依赖于物理公式和概率统计),那么这张图代表的是基于数据驱动(Data-driven)的方法。它不依赖人工建立的复杂运动学或观测方程,而是让神经网络自己从大量数据中学习传感器之间的关联。

我们同样按照数据流向,从上到下拆解:

1. 输入端:多源传感器信息

  • Sensor information 1, 2, ..., n:

    • 图上方有多个并列的输入箭头,代表系统同时接收多种不同类型的传感器数据。

    • 这些传感器可能包括:摄像头(图像)、激光雷达(点云)、毫米波雷达、IMU(惯性测量单元)、轮速计、GPS等。它们的数据格式、量纲、频率通常各不相同。

2. 预处理阶段:归一化(Normalization)

  • Normalization(归一化):

    • 这是数据进入神经网络前的关键预处理步骤。

    • 为什么需要? 不同传感器的数据范围差异巨大。比如,图像像素值可能是 0-255,IMU 的角速度可能是 -10 到 10 rad/s,GPS 坐标可能是几百万的数值。如果不处理,数值大的特征会主导网络训练,导致模型无法收敛。

    • 作用:将各种传感器的数据通过数学变换(如 Min-Max 缩放、Z-Score 标准化等),统一映射到相似的数值范围(通常是 0-1 或均值为0方差为1)。这样能加速神经网络的训练,并提高最终精度。

3. 核心处理阶段:神经网络(Neural Network)

  • Neural network(神经网络):

    • 归一化后的多路数据被送入一个神经网络模型(具体是什么网络取决于任务,可能是全连接网络 MLP、卷积神经网络 CNN、循环神经网络 RNN 或 Transformer 等)。

    • 黑盒特性:与卡尔曼滤波有明确的“预测-更新”公式不同,神经网络是一个“黑盒”。它内部包含大量的权重参数(Weights)和偏置(Biases)。

    • 工作原理:网络通过多层神经元对输入特征进行非线性变换和特征提取。在训练阶段,它会通过反向传播算法,学习如何将多传感器输入映射到正确的输出状态。它自动学习到了“在什么情况下该相信哪个传感器”以及“传感器之间的互补关系”。

4. 输出端

  • Estimated state(估计状态):神经网络最后一层的输出,就是融合后的最终结果(如机器人的位置、速度、姿态等)。

代表:

  • ANN融合声纳、罗盘、无线信号。

  • LiDAR+编码器三层网络。

  • 2D LiDAR+IMU的RCNN。

  • 相机+2D LiDAR的FusionLoc,多头上自注意力。

  • RSSI+磁力计+MLP。

  • 超声波+双目+2D LiDAR+ANN。

4. 其他方法

  • 加权平均:简单、实时,但未考虑前后状态关系,动态环境抗扰差。

  • 图优化:SLAM中多传感器融合框架。如UWB+LiDAR+里程计两阶段优化:先UWB节点和里程计边粗优化,再LiDAR ICP精优化。能处理非线性,但计算复杂度高,通常回环或重定位时优化。

三种算法大总结(图7、8、9对比)

到这里,你已经看完了多传感器融合的三类主流方法。我把它们放在一起对比,帮你建立一个完整的知识框架:

特性图7:卡尔曼滤波 (KF/EKF/UKF)图8:粒子滤波 (PF)图9:神经网络 (NN)
核心逻辑概率统计:高斯分布 + 线性/非线性模型蒙特卡洛:随机采样 + 权重评估数据驱动:学习输入到输出的映射
依赖条件需要精确的运动模型和观测模型需要精确的运动模型和观测模型需要大量的训练数据(真值标签)
计算复杂度中等(取决于状态维数)高(取决于粒子数量)推理时低(训练时极高)
可解释性强(每一步都有明确的物理意义)强(权重和重采样逻辑清晰)弱(黑盒模型,难以解释内部决策)
适用场景线性/弱非线性系统,传感器噪声稳定强非线性、多峰分布、全局定位传感器数据极其复杂、难以建模、有大量数据
典型应用组合导航、GPS+IMU融合机器人SLAM、蒙特卡洛定位自动驾驶端到端感知、多模态融合

总结一下:

  • 卡尔曼滤波是经典且可靠的“老大哥”,适合大多数常规场景。

  • 粒子滤波是处理复杂、非线性环境的“特种兵”,但计算成本高。

  • 神经网络是近年来的“新贵”,它不依赖物理模型,只要有足够的数据,就能拟合出极其复杂的融合策略,是目前自动驾驶和机器人领域非常热门的方向。

五、讨论与未来趋势

讨论:如何选择传感器和算法

  • IMU:短时轨迹推算,辅助其他定位。

  • 信标类:RF、超声、红外,可提供稳定绝对位置,但需安装维护,大规模部署成本高。

  • LiDAR/视觉:可精确定位,但依赖环境信息,环境变化时易受影响。

  • SLAM中:

    • LiDAR:计算量小、测距准、受光照小,但信息少,2D无高度,旋转机构稳定性问题。

    • 视觉:纹理丰富、结构稳定,但受光照、动态、计算量影响。

    • 单目室内鲁棒性差。

  • 障碍检测:

    • 视觉:识别障碍,信息丰富。

    • 超声波、LiDAR:测距和位置精确。

未来趋势

  1. 多源信息融合:单一传感器难满足复杂场景,多传感器融合提高精度、效率、稳定性。

  1. 灵活高效的优化策略:针对复杂动态环境,探索合适优化策略;用并行计算、分布式计算提高大规模/多模态数据处理效率。

  1. 与神经网络结合:神经网络增强稳定性,自学习能力可处理传感器干扰和环境因素;但现有算法在不同室内场景中误差仍大。未来结合更多传感器、更复杂网络结构,以及大语言模型和芯片技术。

六、论文行文架构总结

可以用一句话概括:

论文从AMR四模块出发,粗略定义locomotion、cognition、navigation,迅速聚焦perception;然后把感知拆成定位、建图/SLAM、障碍识别与避障;接着按传感器类型逐一介绍IMU、超声波、红外、LiDAR、视觉、RF;再上升到多传感器融合的Kalman、粒子滤波、神经网络和其他方法;最后讨论选型与未来趋势。

其写作特点:

  1. 总—分—总:先系统框架,再任务和传感器,再融合与趋势。

  2. 任务驱动:定位、建图、避障贯穿全文。

  3. 单传感器到多传感器:先分析各自优缺点,再讲融合。

  4. 传统到学习:从滤波、图优化到神经网络、强化学习、大模型。

  5. 每节模板化:定义→分类→原理→用途→优缺点→改进/代表工作。

  6. 图表辅助:图1定位方法,图2滤波SLAM,图3图优化SLAM,图4 IMU航位推算,图5测距方式,图6 RF定位,图7-9融合算法;表1视觉传感器,表2 RF技术,表3传感器特性。

整体上,这是一篇典型的“感知技术综述”:先建立AMR系统语境,再以感知任务为纲、传感器为目,最后用多传感器融合和未来趋势收束。






Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐