一、 问题背景:为什么需要人机协作制造?

1. 传统制造模式的“三座大山”
模式核心特征致命缺陷
传统自动化生产线机器人按固定程序重复执行刚性太强——换一个产品型号就要重新编程调试,无法适应“多品种、小批量”的定制化需求
纯人工生产线完全依赖工人的技能和经验效率瓶颈——人的体力、精度、注意力有上限,且容易疲劳出错,难以保证一致性
传统制造模式(整体)高能耗、低资源利用率、高废品率不可持续——不符合碳达峰、碳中和的全球趋势
2. 两条宏观趋势的汇合
  • Industry 5.0(工业5.0):不同于工业4.0强调“全自动化”,工业5.0强调 “以人为本(Human-Centric)” ——机器不是取代人,而是增强人

  • 可持续发展(Sustainability):全球资源约束、碳中和目标、循环经济需求——制造业必须同时实现高效率+低能耗+少浪费

3. 人机协作制造的核心主张

“人类提供灵活性、决策力和环境适应能力;机器人提供高精度、连续作业能力和无疲劳耐力——两者协作,实现1+1>2的效果,同时还能优化资源配置、降低能耗、减少废品。”

二、 核心贡献(这篇综述做了什么?)

这是一篇综述论文,它的“贡献”不在于提出新算法,而在于构建了一个完整的知识框架

贡献核心内容
① 首次系统梳理HRC技术体系建立了“感知→交互→建模→执行→决策”的完整技术闭环框架
② 六大核心技术的独立章节任务分配、多模态感知、增强交互、数字孪生、自适应运动控制、协同决策
③ LLM/VLM在HRC中的系统整合首次将LLM、VLM、MLLM在HRC中的应用作为一个独立视角进行梳理
④ 8个详细技术对比表每个核心技术模块都配有“方法对比表”,列出代表性方法、作者、年份和核心思路
⑤ 应用场景与未来趋势覆盖汽车、航空、航天、船舶四大高端制造领域,并指出5大未来方向

三、 核心内容与代表性公式/方法

作为综述,论文本身没有提出新公式,但它在各章节中归纳了该领域最具代表性的数学方法和架构。我帮你提炼几个核心模块的代表性工作

1. HRC任务分配

核心挑战:如何把复杂的制造任务“拆解”并“分配”给人类和机器人?

代表性方法(深度学习的视角,图2)

方法核心思路代表工作
LSTM动态分配用LSTM捕捉工人的疲劳程度和任务能力,动态调整任务分配Joo et al. (2022)
CNN/ST-GCN动作识别用Azure Kinect采集骨架序列,ST-GCN+1DCNN识别协作装配动作,准确率91.7%Gao et al. (2024)
RNN意图识别基于手部轨迹和RGB-D视频,预测操作者的下一步意图(随观察比例增加,精度趋近100%)Mavsar et al. (2021)

代表性方法(LLM的视角,图3)

方法核心思路代表工作
MLLM+数字孪生融合视频+音频多模态数据,自动生成任务模型和分配方案Dimitropoulos et al. (2025)
GPT-4.0语音交互整合语音指令+视觉传感器,适应不同粒度的语言变体,指令理解成功率98%Lim et al. (2024)
MLLM“感知-决策-执行”架构端到端的人机协作工作流,协作成功率90-95%Chen et al. (2026)
2. 多模态感知(Section 3)

核心挑战:机器人需要同时“看到”操作者的动作、“听到”指令、“感觉到”物理交互。

代表性方法(表2)

技术应用代表工作
ResNet(CNN)识别操作者的骨架关键点、身体姿态和动作(抓取、放置、拧紧)Heydari et al. (2024)
BERT(NLP)深度理解复杂文本指令或工作流描述,提取关键信息Xue et al. (2023)
ST-GCN + ResNet(多模态融合)骨架图经ST-GCN处理,RGB帧经ResNet处理,晚期融合实现高效动作识别Wang et al. (2024)
3. 自适应运动控制(Section 6)

核心挑战:在动态环境中,机器人如何安全、精确地运动?

三大技术支柱

方向核心技术代表工作
路径规划改进A*算法+人工势场法(APF),实现3D环境中的平滑避障Lin et al. (2025)
碰撞检测几何模型检测(深度相机+LiDAR)+ 力矩观测器检测(无需外部传感器)Tang et al. (2024)
代码生成LLM+多阶段引导(规划-设计-实现),自动生成控制代码Han et al. (2025)
4. 人机协同决策(Section 7)

核心挑战:人类和AI如何共同做出更好的决策?

两大技术路线

路线核心思想代表工作
LLM路线用提示词+思维链引导LLM模拟决策过程,提供建议+理由;用LIME/SHAP解释特征重要性,提升用户信任Ribeiro et al. (2016), Lundberg et al. (2017)
强化学习路线建模为协作式部分可观测马尔可夫决策过程;用逆强化学习从人类行为数据中推断奖励函数Sadigh et al. (2016), Ng et al. (2024)

四、 比较的基准(综述中的对比框架)

作为综述,论文的“比较”不是实验精度对比,而是方法论的对比和演进脉络的梳理。论文共提供了8个详细的对比表格

表号对比内容核心维度
表1HRC任务分配方法深度学习 vs LLM vs 传统优化
表2多模态感知方法CNN/RNN/Transformer vs PLM/VLM
表3增强交互方法AR/VR/MR vs VLM驱动
表4数字孪生融合方法感知建模 vs 系统组织
表5自适应运动控制方法路径规划 vs 碰撞检测 vs 代码生成
表6协同决策方法LLM驱动 vs RL驱动
表7实际应用案例汽车/航空/航天/船舶

五、 数据集(综述中提到的代表性资源)

作为综述,论文本身不提出新数据集,而是系统性地整理了该领域的研究资源。以下是几个代表性的数据来源:

类别数据集/资源用途
动作识别NTU RGB+D, Kinetics人体动作识别预训练
骨架数据HumanAct12, AMASS骨架动作识别与生成
工业场景EPFL-Smart-Kitchen (ESK)厨房场景装配动作,含33个动词标签
多模态感知NEU-COCO工业物体检测与抓取
视觉语言VisTW (台湾繁体中文基准)VLM在制造场景中的性能评估
异常检测PV_actual AD (光伏产线实际数据)工业异常检测,评估合成数据+多模态学习的效果

六、 五大未来方向(Section 9.2)

这是综述最“接地气”的部分,直接指出该领域下一步的技术缺口和商业化机会:

方向核心技术落地场景
① 智能自适应优化LLM意图理解 + 多模态融合 + 强化学习动态任务分配、实时感知调整
② 轻量化模块化集成轻型协作机器人 + 微服务架构 + 数字孪生配置小批量定制化生产
③ 多维安全保障主动避障 + EEG疲劳检测 + 伦理规范近距离人机协作安全
④ 标准化与生态构建国际标准 + 产学研协同打破技术壁垒,推动大规模应用
⑤ 绿色低碳转型智能能源管理 + 循环经济 + 碳排实时监测碳中和目标下的制造业升级
总结:

这篇综述是在工业制造场景中“落地”的最佳指南——它告诉你,你的技术栈恰好是工业5.0时代人机协作最需要的关键能力,而你要做的是把技术模块,嵌入到“感知→理解→决策→执行”的HRC技术闭环中。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐