多机器人未知环境目标搜索与最优导航:论文分享
1. 论文解决了什么问题?
论文《Target Search and Cost-Optimal Navigation in Unknown Environments for Multi-Robot Systems》研究的是:
多台机器人在完全未知的环境中,如何快速找到目标,并在存在未知区域和动态障碍的情况下,以较低成本安全到达目标。
传统方法通常只解决探索、目标识别、任务分配或路径规划中的某一部分,而本文将这些模块组合成了一套完整流程。
论文主要解决两个问题:
-
目标未知时,如何让多机器人高效搜索,减少重复探索。
-
目标发现后,如何合理分配机器人,并实现低成本、安全导航。
2. 整体方法
论文提出了一套分层控制框架,可以概括为:
多机器人探索
→ 目标识别与定位
→ 未知区域风险评估
→ 机器人任务分配
→ 全局路径规划
→ 局部动态避障
其中主要使用了以下技术:
-
Voronoi 动态区域划分
-
YOLO 加 RGB-D 相机
-
未知区域风险系数
-
Hungarian 匈牙利算法
-
改进 Dijkstra
-
TD3 深度强化学习
论文的核心贡献不是提出某一个全新的单独算法,而是把这些模块组合成一套可以完成完整任务的多机器人系统。
3. 多机器人协同探索
在目标还没有被发现时,多台机器人首先进行环境探索。
论文采用 Voronoi 动态分区,根据各机器人的当前位置把环境划分成不同区域,每台机器人主要负责自己的区域。
这样可以避免多台机器人同时搜索同一个位置,从而减少重复探索。
机器人还会根据:
-
与当前位置的距离
-
与上一个目标点的距离
-
与其他机器人的距离
-
是否存在障碍
-
区域是否已经探索
对候选探索点进行评分,然后选择收益较高的位置继续搜索。
简单来说就是:
先划分责任区域,再选择最值得探索的位置。

4. YOLO 加 RGB-D 完成目标定位
机器人搜索过程中利用 RGB-D 相机进行目标检测。
首先,YOLO 从彩色图像中检测目标,并得到目标的二维位置。
然后,根据对应位置的深度信息,计算目标在相机坐标系中的三维位置。
最后结合机器人自身位姿,将目标位置转换到统一的世界坐标系,并发送给其他机器人。
因此这一部分完成了:
目标检测 → 深度获取 → 三维定位 → 多机器人共享
发现目标以后,系统从“探索模式”切换到“导航模式”。

5. 如何处理未知区域?
这篇论文比较重要的一点,是对未知区域进行成本建模。
例如有两条路线:
-
路线一比较长,但全部是已经探索过的区域;
-
路线二比较短,但需要穿过大量未知区域。
如果只看距离,机器人可能会选择第二条路线,但未知区域中可能存在障碍。
因此作者设计了一个风险系数,根据环境中的障碍物密度和当前探索进度,对未知区域增加额外成本。
探索较少时,机器人允许适当经过未知区域,提高效率;
随着地图信息越来越完整,对高风险未知区域的惩罚会逐渐增加。
本质上就是:
把“未知和风险”转换成路径规划可以计算的成本。

6. 多机器人任务分配
发现目标后,系统会在目标附近生成多个候选目标点。
然后计算每台机器人到不同目标点的路径成本,形成一个机器人和目标之间的成本矩阵。
再使用 Hungarian 匈牙利算法进行匹配,使整个机器人团队的总成本尽量小。
因此不是简单采用:
谁离得近谁去。
而是:
从整个机器人团队角度寻找更合理的分配方案。
而且随着地图更新或者机器人避障导致路径发生变化,任务还可以重新分配。
7. Dijkstra 加 TD3 完成导航
导航阶段采用了全局和局部相结合的方案。
全局规划
使用改进 Dijkstra。
不同于普通最短路,它不仅考虑距离,还会考虑未知区域的风险成本,因此得到的是综合成本较低的路径。
局部避障
如果机器人在运动过程中遇到动态障碍,则切换到 TD3 局部规划器。
TD3 根据机器人当前位置、局部目标和 LiDAR 数据,直接输出机器人线速度和角速度,实现动态避障。
避开障碍之后,再重新回到全局路径。
因此整个导航策略可以理解为:
Dijkstra 负责决定整体怎么走,TD3 负责处理眼前突然出现的障碍。
8. 实验效果
论文使用 3 台移动机器人进行了 Gazebo 和 ROS 仿真实验,共设计三类环境。


每个场景进行了 30 次实验。结果如下:
| 场景 | 成功率 | 平均路径长度 | 碰撞率 |
|---|---|---|---|
| 场景一 | 100% | 38.78 米 | 0% |
| 场景二 | 100% | 55.16 米 | 0% |
| 场景三 | 96.7% | 145.34 米 | 0% |
即使在复杂迷宫环境中,机器人仍然保持了较高的成功率,而且三个实验场景的碰撞率均为 0。
与论文中的对比方法相比,本文方法的路径长度分别降低约:
-
27.19%
-
21.31%
-
24.92%
说明这种全局规划加局部强化学习的方法能够有效降低整体导航成本。

9. 真实机器人验证
论文还进行了真实机器人实验。
实验场地约为 10 米乘 10 米,使用 3 台移动机器人进行协同探索。
整个过程可以分成三阶段:
第一阶段:探索和建图
多台机器人分散搜索环境。
第二阶段:目标发现
机器人检测并定位目标,同时共享目标坐标。
第三阶段:导航
系统重新进行任务分配和全局路径规划,并利用 TD3处理动态障碍。
真实实验最终验证了整个系统从“探索目标”到“安全导航”的完整流程。


10. 总结
这篇论文可以用一句话概括:
先通过 Voronoi 让多机器人分工搜索,再通过 YOLO 和 RGB-D 找到目标,通过风险建模和匈牙利算法完成任务分配,最后利用 Dijkstra 负责全局规划、TD3 负责动态避障。
整体流程为:
未知环境
→ 多机器人分区探索
→ 目标识别定位
→ 未知区域风险评估
→ 任务分配
→ 全局路径规划
→ 动态避障
→ 到达目标
这篇论文最值得借鉴的地方,是把探索、感知、任务分配、路径规划和强化学习控制串成了一套完整的多机器人自主任务流程。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)