【ICRA 2025】WMP:基于世界模型的视觉足式运动感知|从四足机器人具身智能视角
摘要
本文解读 ICRA 2025 论文《World Model-based Perception for Visual Legged Locomotion》(基于世界模型的视觉足式运动感知,简称 WMP)。该论文提出世界模型感知框架 WMP,通过融合 RSSM 隐空间动态建模、低频递归状态更新与单阶段强化学习,把高维视觉历史压缩成可预测的隐状态,替代传统 Teacher-Student 特权学习的信息瓶颈。实验表明WMP 在仿真六地形中全面超越特权学生策略并逼近教师策略,真机 Unitree A1 可跨越 85cm 沟壑(约 2.1 倍机长)、攀爬 55cm 高台(约 2.2 倍机高)、穿越 22cm 低矮通道(约 0.8 倍机高),且纯仿真训练的世界模型能开环预测真实深度序列,为四足机器人视觉感知提供了新范式借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | World Model-based Perception for Visual Legged Locomotion |
| 标题(中文) | 基于世界模型的视觉足式运动感知 |
| 作者 | Hang Lai, Jiahang Cao, Jiafeng Xu, Hongtao Wu, Yunfeng Lin, Tao Kong, Yong Yu, Weinan Zhang |
| 机构 | 上海交通大学 · 字节跳动研究(ByteDance Research) |
| 会议 | ICRA 2025(IEEE International Conference on Robotics and Automation, Atlanta) |
| arXiv | https://arxiv.org/abs/2409.16784 |
| 项目网站 | https://wmp-loco.github.io/ |
为什么足式运动需要世界模型?
足式运动强化学习已经证明,纯本体感觉的"盲策略"可以穿越斜坡、楼梯等简单地形,但在沟壑、攀爬、倾斜与匍匐这类需要视觉预判的复杂地形上严重受限。直接在高维像素上做强化学习又极其数据低效,而且前视相机拍到的地形并不在脚下,策略必须"记住"过去几秒的感知才能行动。
主流解法是特权学习框架:先在仿真里训练一个能访问地形扫描点(scandots)等特权信息的教师策略,再让学生策略用深度图像模仿教师(代表工作:RMA、Parkour 系列、Egocentric)。但该范式有两个结构性缺陷:
- 信息差:蒸馏有泛化误差,学生性能始终落后教师;当特权信息与图像之间存在鸿沟时差距更大。
- 手工特权设计:扫描点间距受地形网格分辨率限制(仿真中为 10cm),既无法区分到边界的精确距离,也无法表示悬空障碍;在 Tilt、Crawl 这类地形上甚至完全失效。
作者从动物认知的"心理模型"假说出发:动物能利用对世界的内部模型,用有限的感知做前瞻性决策。这正是基于模型的强化学习(MBRL)——Dreamer 系列与 RSSM 已在像素级控制中证明其威力。WMP 的核心问题由此提出:视觉足式运动能否从世界模型学习中获益?
研究主线:从问题到结论

图 8(Mermaid 流程图):WMP 研究主线——从特权信息差问题到逼近教师、超越学生的结论
基准/方法设计
WMP 的基准设计一句话概括:世界模型只做"感知压缩器",不做环境模拟器。与 Dreamer 类 MBRL 不同,WMP 不用世界模型生成 rollout 数据——因为仿真器本身比学习模型更准确,仿真采样也足够廉价;世界模型的职责是把一串高维深度图像压缩成低维隐状态,让策略"站在巨人的肩膀上"决策。
框架由两个模块组成,单阶段同时训练:
- 世界模型(RSSM 变体):每 $k$ 步更新一次隐状态,联合训练编码器、动态预测器与解码器;
- 策略(Actor-Critic + PPO):以本体感觉与隐状态的组合为输入,输出 12 维关节目标位置。
输入输出规模:本体感觉 45 维(机身角速度、重力投影、指令、关节位置速度、上一动作),深度图像 64×64(58°×58° 视场角),动作 12 维关节位置偏移。训练在 Isaac Gym 中并行创建 4096 个 Unitree A1 实例。

图 1:Scandots 无法表达边界距离与悬空障碍,深度图可以——特权学习信息差的根源
世界模型四类设计

图 9(Mermaid 流程图):世界模型四类设计——WMP 采用隐空间 RSSM 路线
方法细节:RSSM 低频感知压缩
WMP 采用 RSSM(Recurrent State-Space Model)变体作为世界模型。考虑到仿真中深度图获取成本与真机板载算力(Jetson NX),原始 RSSM 被改造为低频运行:世界模型每 $k$ 步更新一次隐状态 $h_t$,策略则在两次更新之间复用同一隐状态高频决策。
四个组件构成世界模型:递归模型根据上一隐状态、上一随机状态与动作序列预测新隐状态;编码器从当前观测得到后验随机状态 $z_t$;动态预测器给出不依赖观测的先验状态 $\hat{z}_t$;解码器重建观测 $\hat{o}_t$。损失为重建项加 $\beta$ KL 正则项:重建项保证后验状态包含足够观测信息,KL 项迫使先验逼近后验,从而支持开环预测未来感知。
策略与评论家(Critic)的输入都包含 $\mathrm{sg}(h_t)$(stop-gradient 后的隐状态),把世界模型与策略优化解耦,避免表征漂移。Critic 仍可访问特权信息(扫描点、足底接触力、随机化物理参数),作者发现隐状态对 Critic 学习至关重要——因为扫描点无法表示 Tilt 与 Crawl 地形。奖励设计采用简化的速度跟踪奖励(避免手工选路点)加 AMP 风格的运动风格奖励,让机器人收敛出自然步态。训练细节:$K_p=40, K_d=1.0$ 的 PD 控制器,真机深度图像经时空滤波后降采样至 64×64,世界模型端到端延迟约 40ms。

图 2:WMP 框架——世界模型以 $k$ 步间隔更新,策略高频运行在隐状态之上
实验设计与结果
评测协议:仿真在 Isaac Gym 中创建 4096 个 Unitree A1,覆盖 Slope(0–36°)、Stair(5–21cm)、Gap(0–90cm)、Climb(0–54cm)、Tilt、Crawl 六类地形,难度课程与 legged_gym 一致,100 条轨迹平均回报。基线包括:Teacher(特权 oracle)、Student(ConvNet-RNN 蒸馏,复现 Parkour 的教师-学生流程)、Blind(世界模型去掉深度图像)、WMP w/o Prop(去掉本体感觉)。真机评测用 Unitree A1 + 板载 Jetson NX,Intel D435i 深度相机 60Hz 采集(424×240)后处理至 64×64。
仿真主表(平均回报,越高越好):
| 地形 | WMP (ours) | Teacher | Student | Blind | WMP w/o Prop |
|---|---|---|---|---|---|
| Slope | 36.55 | 36.70 | 36.31 | 33.96 | 36.07 |
| Stair | 35.06 | 35.07 | 34.93 | 23.56 | 34.62 |
| Gap | 32.37 | 32.80 | 27.07 | 9.80 | 30.73 |
| Climb | 34.64 | 35.32 | 33.42 | 14.11 | 34.67 |
| Tilt | 34.73 | — | — | 3.94 | 30.78 |
| Crawl | 36.60 | — | — | 8.92 | 36.41 |

图 3:世界模型间隔 $k$(左)与训练片段长度(右)消融——$k=5$、1 秒片段最优
WMP 在 5/6 地形取得(教师之外)最优回报:Gap 上 32.37 vs Student 27.07(+5.3);Tilt/Crawl 上 Teacher 与 Student 因扫描点失效而无法使用,WMP 仍达 34.73 / 36.60。去掉深度的 Blind 在 Gap 上骤降至 9.80(-69.7%),证明视觉结构是性能的关键来源。$k=5$(0.1s 间隔)是真机 40ms 延迟约束下的精度-算力权衡;1 秒训练片段已足够——"一秒前看到的就在脚下"。

图 4:六地形隐状态 t-SNE——世界模型学到地形可分的高层表征(仅 Slope/Climb 轻微重叠)
真机评测(附录 A):室内五类地形各 10 次试验,Student 只能通过低难度档位,WMP 通过全部地形,包括 Tilt 与 Crawl。极限能力:Gap 85cm(2.1 倍机长)、Climb 55cm(2.2 倍机高)、Crawl 22cm(0.8 倍机高),接近仿真最难度。真机成功率汇总见图 6。

图 5:真机深度图与世界模型开环预测——纯仿真训练即可预测真实感知(Crawl 障碍形状差异源于仿真未见该形状)

图 6:室内真机成功率(10 次试验)——WMP 通过 Tilt/Crawl,Student 止步低难度
户外泛化(附录 B):公园环境上下楼梯、攀爬 45cm 平台、穿越草地与碎石,户外/室内行为一致,验证世界模型表征的泛化性(定性证据,见图 7)。

图 7:户外实验快照——楼梯、45cm 平台攀爬、草地与碎石穿越
结果对比总结

图 10(Mermaid 流程图):结果对比——去深度 -69.7%、Gap 超 Student +5.3、真机 85cm 成功
关键发现
- WMP 在仿真 6 地形中的 5 个取得(教师之外)最优平均回报,Gap 地形比 Student 高 +5.3(32.37 vs 27.07)。
- Tilt/Crawl 上 Teacher 与 Student 因扫描点失效无法使用,WMP 仍保持 34.73 / 36.60 的高回报——世界模型隐状态表达力超过手工特权信息。
- 去掉深度的消融使 Gap 回报下降 69.7%(32.37 → 9.80),证明视觉结构在起作用,而非世界模型"记忆"了地形。
- 真机 Unitree A1 极限:Gap 85cm(2.1 倍机长)、Climb 55cm(2.2 倍机高)、Crawl 22cm(0.8 倍机高),10 次试验通过全部地形。
- 纯仿真训练的世界模型在真实 D435i 深度序列上开环预测仍然准确,显著缩小 Sim-to-Real 差距。
- 户外实验中 WMP 稳定完成楼梯上下、45cm 平台攀爬与草地碎石穿越,行为与室内一致。
局限性
- 纯仿真世界模型:训练数据全部来自仿真器,未利用真实轨迹提升模型精度(作者明确列为未来工作)。
- 算力约束:真机只能支持 0.1s 低频世界模型更新($k=5$),无法达到仿真中的最优间隔 $k=2$。
- 验证范围:仅在 Unitree A1 与六类地形上验证,未覆盖其他机器人形态,也未与 Dreamer 等其他 MBRL 方法直接对比。
- 复现门槛:匿名评审阶段未开放代码,复现依赖深度图像预处理细节与 Isaac Gym 环境配置。
常见问题(FAQ)
WMP 与传统 Teacher-Student 特权学习有何本质区别?
WMP 是单阶段端到端训练:世界模型把视觉历史压缩成隐状态后直接训练策略,没有教师策略、没有手工特权信息设计,也没有两阶段蒸馏的信息差。
为什么世界模型要低频更新?
真机上深度图获取与世界模型计算共约 40ms 延迟,若每步都更新隐状态无法满足控制频率;每 $k=5$ 步(0.1s)更新一次是精度与算力的权衡,仿真中更小的 $k$ 效果更好。
WMP 的世界模型与 Dreamer 有何不同?
WMP 的世界模型不做 rollout 数据生成(仿真器更准确),只作为感知压缩器提取隐状态供策略使用;Dreamer 用世界模型在想象环境中训练策略。
扫描点(scandots)为什么无法表示 Tilt 与 Crawl?
扫描点密度受仿真地形网格分辨率限制(10cm),无法区分到边界的精确距离,也无法表示悬空障碍与多层高度结构;深度图像则能完整表达这些地形。
世界模型能预测真实世界的深度吗?
能。纯仿真训练的世界模型在真机轨迹上做开环长程预测仍然准确,只在仿真中从未见过的障碍形状上有细微差异——这正是 Sim-to-Real 泛化的直接证据。
参考链接
- arXiv 论文页:https://arxiv.org/abs/2409.16784
- 项目网站(WMP-Loco):https://wmp-loco.github.io/
- DreamerV3(Hafner et al., 2023):https://arxiv.org/abs/2301.04104
- RSSM / Learning Latent Dynamics(Hafner et al., ICML 2019):https://arxiv.org/abs/1803.10122
- Parkour(Cheng et al., Science Robotics 2024):https://www.science.org/doi/10.1126/scirobotics.adi9756
- legged_gym(Rudin et al., CoRL 2022):https://arxiv.org/abs/2206.03672
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)