很多人好奇:如今人形机器人可以切黄瓜、倒水、叠衣服。这些复杂灵活的动作,机器人究竟是怎么学会的?

在过去,机器人的动作靠人工编程实现。工程师需要逐行编写代码,定义每一个关节转动角度、运动轨迹。流水线上面向固定工序的工业机器人,靠这套模式可以稳定作业。但这套方案短板十分突出。环境稍有变化,物体位置偏移,就需要工程师重新调试改写代码。面对叠衣服、倒水这类动态、非标准化任务,变量极多,根本无法穷举所有情况。想要机器人掌握多样的复杂动作,必须跳出手写代码的思路,转向机器自主学习。

模仿学习:像孩子模仿大人一样学本领

人类孩童学习很多技能,不需要弄懂全部原理,通过观察、模仿大人的行为,就能掌握动作要领。模仿学习正是借鉴了这套逻辑。

研究人员通过遥操作设备,人为操控机器人完成目标任务,完整记录下视觉画面、关节运动、抓取力度等全套轨迹数据。机器人从大量人类示范样本中提炼动作规律,复刻完成任务的行为模式。

叠衣服就是典型场景。操作人员多次示范摊平、对齐、折叠T恤的完整流程。机器人不去死记单条轨迹,而是学习“抓住衣角、对齐边缘、弯折布料”这类通用行为逻辑。拿到一件从未见过的衬衫,也能依照学到的模式完成折叠。

模仿学习上手快,可以快速教会机器人基础技能。但它的局限也很明显:高度依赖人类高质量示范数据;如果示范样本存在瑕疵,机器人也会一并学下错误习惯;遇到示范中从未出现的突发状况,容易直接失效。

强化学习:在反复试错中自我迭代

如果说模仿学习是“跟着师傅照做”,强化学习就是“在练习里摸出最优解”。

这套机制的核心是奖励信号。机器人自主执行动作,任务完成就给予正向奖励;动作出错、任务失败就给予惩罚。机器人不断尝试,在一次次试错中,逐步筛选出能够拿到更高分数的动作策略。

不需要人类每一步手把手演示,机器人可以自己探索不同的动作方案。比如倒水任务,水顺利倒入杯子获得高分;洒出水就扣分。经过成千上万次反复试验,机器人慢慢学会控制抬壶角度、移动速度,懂得如何稳住水流。

强化学习不依赖大量人工示范,擅长针对任务持续优化策略。但缺点也很现实:全部在真机上试错成本极高。机器人反复磕碰、摔落,会带来硬件损耗,训练周期漫长。

物理模拟器:零成本的虚拟训练场

为了解决真机训练成本高、风险大的痛点,物理仿真模拟器成为行业的标配工具。

模拟器在电脑中搭建高保真虚拟物理世界,复刻重力、摩擦力、物体形变等物理规则。机器人可以在虚拟环境中无限次练习。摔倒、碰撞、打翻物品都不会造成硬件损坏,几乎没有实物损耗。还可以开启并行训练,成千上百个虚拟机器人同时开展练习,几天时间就能完成现实中数年的训练量。

这就诞生了Sim‑to‑Real(仿真迁移)技术:绝大多数复杂动作,优先在虚拟仿真环境完成大规模训练。虚拟世界打磨好动作策略之后,再迁移到真实机器人硬件上,用少量真实场景数据做微调,适配现实世界传感器噪声、物理参数差异,把虚拟中学到的本领落地到现实。

现实案例:切黄瓜、倒水、叠衣服如何练成

如今演示中看到的切黄瓜、倒水、叠衣服,大多是模仿学习+强化学习+仿真训练三者结合的产物。

第一步,在仿真环境采集基础示范数据,用模仿学习让机器人先掌握任务基础动作框架,具备完成任务的基本能力。 第二步,开启强化学习,在虚拟环境大量试错迭代。比如切黄瓜,反复调整下刀角度、夹持力度;叠衣服不断调整抓取点位,优化折叠顺序。 第三步,把训练得到的策略部署到实体机器人,在真实环境开展少量微调,适配真实布料形变、食材软硬等现实条件,最终实现稳定完成整套操作。

当然,这套技术路径依旧存在不少难题。仿真与现实之间始终存在现实鸿沟;复杂长时序任务,依旧容易出现中途失误;高质量训练数据获取依旧成本不菲。

从手写每一行运动代码,到模仿示范,再到自主试错迭代,机器人学习范式正在发生根本性变化。正是依靠模仿学习、强化学习与仿真平台的协同,具身机器人才一步步解锁越来越多贴近生活的复杂操作。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐