《人-机器人协同制造系统:技术、应用及未来发展趋势综述》
一、 问题背景:为什么需要人机协作制造?
1. 传统制造模式的“三座大山”
| 模式 | 核心特征 | 致命缺陷 |
|---|---|---|
| 传统自动化生产线 | 机器人按固定程序重复执行 | 刚性太强——换一个产品型号就要重新编程调试,无法适应“多品种、小批量”的定制化需求 |
| 纯人工生产线 | 完全依赖工人的技能和经验 | 效率瓶颈——人的体力、精度、注意力有上限,且容易疲劳出错,难以保证一致性 |
| 传统制造模式(整体) | 高能耗、低资源利用率、高废品率 | 不可持续——不符合碳达峰、碳中和的全球趋势 |
2. 两条宏观趋势的汇合
-
Industry 5.0(工业5.0):不同于工业4.0强调“全自动化”,工业5.0强调 “以人为本(Human-Centric)” ——机器不是取代人,而是增强人。
-
可持续发展(Sustainability):全球资源约束、碳中和目标、循环经济需求——制造业必须同时实现高效率+低能耗+少浪费。
3. 人机协作制造的核心主张
“人类提供灵活性、决策力和环境适应能力;机器人提供高精度、连续作业能力和无疲劳耐力——两者协作,实现1+1>2的效果,同时还能优化资源配置、降低能耗、减少废品。”
二、 核心贡献(这篇综述做了什么?)
这是一篇综述论文,它的“贡献”不在于提出新算法,而在于构建了一个完整的知识框架:

| 贡献 | 核心内容 |
|---|---|
| ① 首次系统梳理HRC技术体系 | 建立了“感知→交互→建模→执行→决策”的完整技术闭环框架 |
| ② 六大核心技术的独立章节 | 任务分配、多模态感知、增强交互、数字孪生、自适应运动控制、协同决策 |
| ③ LLM/VLM在HRC中的系统整合 | 首次将LLM、VLM、MLLM在HRC中的应用作为一个独立视角进行梳理 |
| ④ 8个详细技术对比表 | 每个核心技术模块都配有“方法对比表”,列出代表性方法、作者、年份和核心思路 |
| ⑤ 应用场景与未来趋势 | 覆盖汽车、航空、航天、船舶四大高端制造领域,并指出5大未来方向 |
三、 核心内容与代表性公式/方法
作为综述,论文本身没有提出新公式,但它在各章节中归纳了该领域最具代表性的数学方法和架构。我帮你提炼几个核心模块的代表性工作:
1. HRC任务分配
核心挑战:如何把复杂的制造任务“拆解”并“分配”给人类和机器人?
代表性方法(深度学习的视角,图2):

| 方法 | 核心思路 | 代表工作 |
|---|---|---|
| LSTM动态分配 | 用LSTM捕捉工人的疲劳程度和任务能力,动态调整任务分配 | Joo et al. (2022) |
| CNN/ST-GCN动作识别 | 用Azure Kinect采集骨架序列,ST-GCN+1DCNN识别协作装配动作,准确率91.7% | Gao et al. (2024) |
| RNN意图识别 | 基于手部轨迹和RGB-D视频,预测操作者的下一步意图(随观察比例增加,精度趋近100%) | Mavsar et al. (2021) |
代表性方法(LLM的视角,图3):

| 方法 | 核心思路 | 代表工作 |
|---|---|---|
| MLLM+数字孪生 | 融合视频+音频多模态数据,自动生成任务模型和分配方案 | Dimitropoulos et al. (2025) |
| GPT-4.0语音交互 | 整合语音指令+视觉传感器,适应不同粒度的语言变体,指令理解成功率98% | Lim et al. (2024) |
| MLLM“感知-决策-执行”架构 | 端到端的人机协作工作流,协作成功率90-95% | Chen et al. (2026) |
2. 多模态感知(Section 3)
核心挑战:机器人需要同时“看到”操作者的动作、“听到”指令、“感觉到”物理交互。
代表性方法(表2):
| 技术 | 应用 | 代表工作 |
|---|---|---|
| ResNet(CNN) | 识别操作者的骨架关键点、身体姿态和动作(抓取、放置、拧紧) | Heydari et al. (2024) |
| BERT(NLP) | 深度理解复杂文本指令或工作流描述,提取关键信息 | Xue et al. (2023) |
| ST-GCN + ResNet(多模态融合) | 骨架图经ST-GCN处理,RGB帧经ResNet处理,晚期融合实现高效动作识别 | Wang et al. (2024) |
3. 自适应运动控制(Section 6)
核心挑战:在动态环境中,机器人如何安全、精确地运动?
三大技术支柱:
| 方向 | 核心技术 | 代表工作 |
|---|---|---|
| 路径规划 | 改进A*算法+人工势场法(APF),实现3D环境中的平滑避障 | Lin et al. (2025) |
| 碰撞检测 | 几何模型检测(深度相机+LiDAR)+ 力矩观测器检测(无需外部传感器) | Tang et al. (2024) |
| 代码生成 | LLM+多阶段引导(规划-设计-实现),自动生成控制代码 | Han et al. (2025) |
4. 人机协同决策(Section 7)
核心挑战:人类和AI如何共同做出更好的决策?
两大技术路线:
| 路线 | 核心思想 | 代表工作 |
|---|---|---|
| LLM路线 | 用提示词+思维链引导LLM模拟决策过程,提供建议+理由;用LIME/SHAP解释特征重要性,提升用户信任 | Ribeiro et al. (2016), Lundberg et al. (2017) |
| 强化学习路线 | 建模为协作式部分可观测马尔可夫决策过程;用逆强化学习从人类行为数据中推断奖励函数 | Sadigh et al. (2016), Ng et al. (2024) |
四、 比较的基准(综述中的对比框架)
作为综述,论文的“比较”不是实验精度对比,而是方法论的对比和演进脉络的梳理。论文共提供了8个详细的对比表格:
| 表号 | 对比内容 | 核心维度 |
|---|---|---|
| 表1 | HRC任务分配方法 | 深度学习 vs LLM vs 传统优化 |
| 表2 | 多模态感知方法 | CNN/RNN/Transformer vs PLM/VLM |
| 表3 | 增强交互方法 | AR/VR/MR vs VLM驱动 |
| 表4 | 数字孪生融合方法 | 感知建模 vs 系统组织 |
| 表5 | 自适应运动控制方法 | 路径规划 vs 碰撞检测 vs 代码生成 |
| 表6 | 协同决策方法 | LLM驱动 vs RL驱动 |
| 表7 | 实际应用案例 | 汽车/航空/航天/船舶 |
五、 数据集(综述中提到的代表性资源)
作为综述,论文本身不提出新数据集,而是系统性地整理了该领域的研究资源。以下是几个代表性的数据来源:
| 类别 | 数据集/资源 | 用途 |
|---|---|---|
| 动作识别 | NTU RGB+D, Kinetics | 人体动作识别预训练 |
| 骨架数据 | HumanAct12, AMASS | 骨架动作识别与生成 |
| 工业场景 | EPFL-Smart-Kitchen (ESK) | 厨房场景装配动作,含33个动词标签 |
| 多模态感知 | NEU-COCO | 工业物体检测与抓取 |
| 视觉语言 | VisTW (台湾繁体中文基准) | VLM在制造场景中的性能评估 |
| 异常检测 | PV_actual AD (光伏产线实际数据) | 工业异常检测,评估合成数据+多模态学习的效果 |
六、 五大未来方向(Section 9.2)
这是综述最“接地气”的部分,直接指出该领域下一步的技术缺口和商业化机会:
| 方向 | 核心技术 | 落地场景 |
|---|---|---|
| ① 智能自适应优化 | LLM意图理解 + 多模态融合 + 强化学习 | 动态任务分配、实时感知调整 |
| ② 轻量化模块化集成 | 轻型协作机器人 + 微服务架构 + 数字孪生配置 | 小批量定制化生产 |
| ③ 多维安全保障 | 主动避障 + EEG疲劳检测 + 伦理规范 | 近距离人机协作安全 |
| ④ 标准化与生态构建 | 国际标准 + 产学研协同 | 打破技术壁垒,推动大规模应用 |
| ⑤ 绿色低碳转型 | 智能能源管理 + 循环经济 + 碳排实时监测 | 碳中和目标下的制造业升级 |
总结:
这篇综述是在工业制造场景中“落地”的最佳指南——它告诉你,你的技术栈恰好是工业5.0时代人机协作最需要的关键能力,而你要做的是把技术模块,嵌入到“感知→理解→决策→执行”的HRC技术闭环中。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)