清华大学自动化系赵明国研究员团队在机器人顶刊 Science Robotics上发表论文《Learning vision-driven reactive soccer skills for humanoid robots》。

论文提出将视觉感知与运动控制直接耦合的统一强化学习控制器,仿真训练后零样本部署到人形机器人真机,仅凭本体视觉连贯完成找球、追球与多方向踢球。

NOKOV 度量动作捕捉系统为本研究提供人体踢球动作数据以及机器人与足球的位置真值,分别用于构建参考运动数据集与虚拟感知系统建模。

点击观看视频https://www.bilibili.com/video/BV1Up8w6cEnB/

一、引用格式

Yushi Wang et al., Learning vision-driven reactive soccer skills for humanoid robots.Sci. Robot.11, eaed1152(2026). DOI: 10.1126/scirobotics.aed1152

二、案例概览

案例概览

内容

研究机构

清华大学自动化系赵明国研究员团队

论文期刊

Science Robotics

研究对象

Booster T1人形机器人

核心任务

视觉驱动反应式足球

学习方法

强化学习、AMP、编码器-解码器

视觉输入

机载相机

NOKOV度量动作捕捉系统作用

采集人体脚弓踢球动作,获取机器人与足球位置真值

真机表现

前场踢球成功率80%–90%

环境验证

草地、石板、土壤、沥青、橡胶等环境均获得良好实验结果

三、研究背景:人形机器人为什么需要视觉驱动的反应式足球控制?

人形机器人踢足球要求机器人把敏捷运动与不可靠的本体视觉感知紧密结合起来。传统感知、规划、控制分离的模块化流程难以在动态环境中做出敏捷反应;端到端强化学习方法,或依赖动作捕捉系统提供的特权状态信息、难以走出实验室,或依赖计算密集的场景建模、仿真到真机迁移出现性能退化。因此,能在真实环境中稳健工作的视觉驱动反应式人形足球控制器仍是开放挑战。

四、方法与创新:人形机器人如何通过强化学习学习踢足球?

本文把人形机器人踢足球表述为一个"感知受限的控制问题":不把感知当作给控制器提供输入的预处理模块,而是把真实的感知不确定性作为学习过程的内在组成部分。研究者在仿真中训练单一的强化学习策略,策略直接接收视觉检测结果与机器人本体感知信息,输出期望关节位置,从而在同一控制框架内连续完成寻球、接近足球、步态调整与踢球。策略训练完成后零样本部署到 Booster T1 人形机器人(高约 1.2 米、重约 30 千克)上,仅依靠机载相机与机载计算运行。

系统概述。现实世界的机器人配备了 板载相机用于视觉感知。图像检测结果被投影到鸟瞰图(BEV)空间中。球检测结果直接提供给策略,而场地标志物则由里程计模块处理,以从长期信息中推断球门位 置。该感知流程旨在为强化学习(RL)策略高效地提取并表征视觉特征。

创新一:如何实现端到端的感知-运动耦合

与传统感知、规划、控制相互分离的模块化流程不同,本文的策略把视觉感知与运动控制直接耦合:感知不再是给控制器提供输入的预处理模块,而是学习过程的内在组成部分,策略在闭环中持续适应感知不确定性并调整动作。

创新二:如何利用人体踢球动作训练机器人?把对抗运动先验(AMP)拓展到真实世界的动态视觉场景帮助机器人学习自然的踢球动作

为学习类人踢球方式,研究采集人体脚弓踢球动作与公开行走数据构建参考运动数据集:NOKOV 度量动作捕捉系统录制了 30 秒人体脚弓踢球动作,另从公开 ACCAD 数据集中选取 76.28 秒全向行走数据。该数据集用于训练 AMP 判别器,引导策略在完成任务的同时保持自然动作风格;研究进而将 AMP 与感知管线结合,把 AMP 拓展至真实世界的实际控制。

创新三:如何缩小人形机器人视觉控制的sim-to-real gap?研究利用虚拟感知系统与编码器-解码器架构模拟真实视觉噪声,用于弥合sim-to-real gap

真实本体视觉带噪声、有延迟、会检测失败,研究据此在仿真中显式建模这些感知噪声;噪声参数来自真实数据——机器人按规则追球、由人移动足球,采集约 1 小时观球数据,用 NOKOV 度量动作捕捉系统记录机器人与足球的位置真值、与视觉检测对照完成定量建模。在此基础上,策略网络采用编码器-解码器架构:编码器把过去 50 帧(约 1 秒)的历史观测压缩为 64 维隐状态,解码器再从隐状态中重建足球真实位置等部署时无法直接获得的信息,使策略学会从带噪声、不完整的观测中恢复可靠状态。

本文提出的学习框架。 智能体(Actor)接收部分观测,并利用编码器-解码器架构从历史数据中重建完整状态。该策略使用PPO进行训练,同时结合来自环境的奖励和编码了运动先验的判别器提供的奖励,并采用多个评论家(Critics)来提供价值估计。该策略在仿真环境中进行训练,只有以蓝色突出显示的模块被部署到硬件上。

五、实验验证

1.多场景与真实比赛表现

本文将控制器零样本部署到草地、石板、土壤、沥青、橡胶等多种地形与不同视觉条件,各场景均保持可靠追球与运动能力;该控制器还作为清华大学火神队模块参加 RoboCup 2025 成年组人形联赛与 2025 年世界人形机器人运动会,助力球队夺冠。

2.踢球成功率

本文按 RoboCup 成年组规格在多个预设位置测试踢球成功率,真机前场成功率达 80%–90%,与仿真相当且全程无摔倒。

3.感知-动作协调

为考察感知-动作耦合能力,策略会主动调整头部与躯干朝向将球保持在相机视野内,球位置估计误差较规则基线降低 46%。

4.步态行为分析

为分析运动模式的多样性与敏捷性,单一策略可平滑切换行走、转弯与左右脚踢球等多类步态,敏捷性优于规则基线。

控制器在不同场景下的表现。 (A至C)世界人形机器人运动会中的真实比赛表现。(D至F)RoboCup中的真实比赛表现。(G至I)对球的反应式响应与实时适应。(J至L)在不同地形和视觉多样化环境中的鲁棒行为。

、NOKOV度量动作捕捉系统在本研究中的作用

在本研究中,NOKOV度量动作捕捉系统主要承担两类数据采集任务:一是采集人体脚弓踢球动作,为 AMP 对抗运动先验提供参考运动数据;二是记录机器人与足球的位置真值,并与机载视觉检测结果进行对照,用于构建虚拟感知系统和建模真实视觉中的噪声、延迟与检测失败。由此,动作捕捉数据并不直接替代机器人的机载视觉控制,而是作为训练与仿真建模阶段的高精度参考数据,帮助研究团队把人体动作、视觉观测和真机足球任务连接起来。

项目

内容

被捕捉对象

人体脚弓踢球动作;机器人与足球的位置

输出数据

人体踢球动作数据;机器人与足球的位置真值

数据用途

构建 AMP 参考运动数据集;与视觉检测结果对照,用于虚拟感知系统建模和仿真训练

七、通讯作者简介

赵明国,清华大学自动化系研究员、机器人控制实验室主任、无人系统中心类脑机器人交叉中心主任、加速进化首席科学家。主要研究方向:融合“类脑芯片”及“类脑计算”构建人工通用智能研究平台、基于类脑计算的机器人控制。

八、常见问题

Q1:NOKOV度量动作捕捉系统在人形机器人踢足球研究中有什么作用?

A1:NOKOV度量动作捕捉系统主要承担两项数据采集任务:一是记录人体弓踢球动作,用于构建AMP参考运动数据集;二是记录机器人与足球的位置真值,并与视觉检测结果进行对照,用于建立虚拟感知系统

Q2:为什么人形机器人踢足球需要人体动作数据?

A2:研究通过人体脚弓踢球动作构建参考运动数据集,并利用AMP判别器引导强化学习策略在完成足球任务的同时保持自然的动作风格。

Q3:如何解决机器人视觉感知噪声带来的sim-to-real gap?

A3:研究利用NOKOV记录的机器人和足球位置真值与视觉检测结果进行对照,对真实视觉中的噪声、延迟和检测失败进行定量建模,并在仿真中构建虚拟感知系统。

Q4:人形机器人视觉踢球的真实效果如何?

A4:论文实验显示,控制器零样本部署到真实人形机器人后,在多种地形和视觉条件下保持可靠运动能力,真机前场踢球成功率达到80%–90%,测试过程中全程无摔倒。

据清华大学相关报道,该控制器还支持清华火神队在2025及2026两届RoboCup人形机器人足球大型组获得冠军,并助力球队卫冕2026年世界人形机器人运动会足球5V5大型组冠军。

相关新闻清华火神队卫冕世界人形机器人运动会足球5V5大型组冠军-清华大学

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐