摘要

本文解读 ICRA 2025 论文《World Model-based Perception for Visual Legged Locomotion》(基于世界模型的视觉足式运动感知,简称 WMP)。该论文提出世界模型感知框架 WMP,通过融合 RSSM 隐空间动态建模低频递归状态更新单阶段强化学习,把高维视觉历史压缩成可预测的隐状态,替代传统 Teacher-Student 特权学习的信息瓶颈。实验表明WMP 在仿真六地形中全面超越特权学生策略并逼近教师策略,真机 Unitree A1 可跨越 85cm 沟壑(约 2.1 倍机长)、攀爬 55cm 高台(约 2.2 倍机高)、穿越 22cm 低矮通道(约 0.8 倍机高),且纯仿真训练的世界模型能开环预测真实深度序列,为四足机器人视觉感知提供了新范式借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) World Model-based Perception for Visual Legged Locomotion
标题(中文) 基于世界模型的视觉足式运动感知
作者 Hang Lai, Jiahang Cao, Jiafeng Xu, Hongtao Wu, Yunfeng Lin, Tao Kong, Yong Yu, Weinan Zhang
机构 上海交通大学 · 字节跳动研究(ByteDance Research)
会议 ICRA 2025(IEEE International Conference on Robotics and Automation, Atlanta)
arXiv https://arxiv.org/abs/2409.16784
项目网站 https://wmp-loco.github.io/

为什么足式运动需要世界模型?

足式运动强化学习已经证明,纯本体感觉的"盲策略"可以穿越斜坡、楼梯等简单地形,但在沟壑、攀爬、倾斜与匍匐这类需要视觉预判的复杂地形上严重受限。直接在高维像素上做强化学习又极其数据低效,而且前视相机拍到的地形并不在脚下,策略必须"记住"过去几秒的感知才能行动。

主流解法是特权学习框架:先在仿真里训练一个能访问地形扫描点(scandots)等特权信息的教师策略,再让学生策略用深度图像模仿教师(代表工作:RMA、Parkour 系列、Egocentric)。但该范式有两个结构性缺陷:

  • 信息差:蒸馏有泛化误差,学生性能始终落后教师;当特权信息与图像之间存在鸿沟时差距更大。
  • 手工特权设计:扫描点间距受地形网格分辨率限制(仿真中为 10cm),既无法区分到边界的精确距离,也无法表示悬空障碍;在 Tilt、Crawl 这类地形上甚至完全失效。

作者从动物认知的"心理模型"假说出发:动物能利用对世界的内部模型,用有限的感知做前瞻性决策。这正是基于模型的强化学习(MBRL)——Dreamer 系列与 RSSM 已在像素级控制中证明其威力。WMP 的核心问题由此提出:视觉足式运动能否从世界模型学习中获益?

研究主线:从问题到结论

WMP 研究主线流程图:从特权信息差问题到世界模型设计、实验与结论

图 8(Mermaid 流程图):WMP 研究主线——从特权信息差问题到逼近教师、超越学生的结论

基准/方法设计

WMP 的基准设计一句话概括:世界模型只做"感知压缩器",不做环境模拟器。与 Dreamer 类 MBRL 不同,WMP 不用世界模型生成 rollout 数据——因为仿真器本身比学习模型更准确,仿真采样也足够廉价;世界模型的职责是把一串高维深度图像压缩成低维隐状态,让策略"站在巨人的肩膀上"决策。

框架由两个模块组成,单阶段同时训练

  • 世界模型(RSSM 变体):每 $k$ 步更新一次隐状态,联合训练编码器、动态预测器与解码器;
  • 策略(Actor-Critic + PPO):以本体感觉与隐状态的组合为输入,输出 12 维关节目标位置。

输入输出规模:本体感觉 45 维(机身角速度、重力投影、指令、关节位置速度、上一动作),深度图像 64×64(58°×58° 视场角),动作 12 维关节位置偏移。训练在 Isaac Gym 中并行创建 4096 个 Unitree A1 实例。

世界模型动机:扫描点无法表达边界距离与悬空障碍,深度图可以

图 1:Scandots 无法表达边界距离与悬空障碍,深度图可以——特权学习信息差的根源

世界模型四类设计

世界模型四类设计分类图:隐空间 RSSM、Transformer、扩散与 JEPA

图 9(Mermaid 流程图):世界模型四类设计——WMP 采用隐空间 RSSM 路线

方法细节:RSSM 低频感知压缩

WMP 采用 RSSM(Recurrent State-Space Model)变体作为世界模型。考虑到仿真中深度图获取成本与真机板载算力(Jetson NX),原始 RSSM 被改造为低频运行:世界模型每 $k$ 步更新一次隐状态 $h_t$,策略则在两次更新之间复用同一隐状态高频决策。

四个组件构成世界模型:递归模型根据上一隐状态、上一随机状态与动作序列预测新隐状态;编码器从当前观测得到后验随机状态 $z_t$;动态预测器给出不依赖观测的先验状态 $\hat{z}_t$;解码器重建观测 $\hat{o}_t$。损失为重建项加 $\beta$ KL 正则项:重建项保证后验状态包含足够观测信息,KL 项迫使先验逼近后验,从而支持开环预测未来感知

策略与评论家(Critic)的输入都包含 $\mathrm{sg}(h_t)$(stop-gradient 后的隐状态),把世界模型与策略优化解耦,避免表征漂移。Critic 仍可访问特权信息(扫描点、足底接触力、随机化物理参数),作者发现隐状态对 Critic 学习至关重要——因为扫描点无法表示 Tilt 与 Crawl 地形。奖励设计采用简化的速度跟踪奖励(避免手工选路点)加 AMP 风格的运动风格奖励,让机器人收敛出自然步态。训练细节:$K_p=40, K_d=1.0$ 的 PD 控制器,真机深度图像经时空滤波后降采样至 64×64,世界模型端到端延迟约 40ms。

WMP 框架图:世界模型低频更新隐状态,策略高频运行

图 2:WMP 框架——世界模型以 $k$ 步间隔更新,策略高频运行在隐状态之上

实验设计与结果

评测协议:仿真在 Isaac Gym 中创建 4096 个 Unitree A1,覆盖 Slope(0–36°)、Stair(5–21cm)、Gap(0–90cm)、Climb(0–54cm)、Tilt、Crawl 六类地形,难度课程与 legged_gym 一致,100 条轨迹平均回报。基线包括:Teacher(特权 oracle)、Student(ConvNet-RNN 蒸馏,复现 Parkour 的教师-学生流程)、Blind(世界模型去掉深度图像)、WMP w/o Prop(去掉本体感觉)。真机评测用 Unitree A1 + 板载 Jetson NX,Intel D435i 深度相机 60Hz 采集(424×240)后处理至 64×64。

仿真主表(平均回报,越高越好)

地形 WMP (ours) Teacher Student Blind WMP w/o Prop
Slope 36.55 36.70 36.31 33.96 36.07
Stair 35.06 35.07 34.93 23.56 34.62
Gap 32.37 32.80 27.07 9.80 30.73
Climb 34.64 35.32 33.42 14.11 34.67
Tilt 34.73 3.94 30.78
Crawl 36.60 8.92 36.41

模型间隔与训练长度消融

图 3:世界模型间隔 $k$(左)与训练片段长度(右)消融——$k=5$、1 秒片段最优

WMP 在 5/6 地形取得(教师之外)最优回报:Gap 上 32.37 vs Student 27.07(+5.3);Tilt/Crawl 上 Teacher 与 Student 因扫描点失效而无法使用,WMP 仍达 34.73 / 36.60。去掉深度的 Blind 在 Gap 上骤降至 9.80(-69.7%),证明视觉结构是性能的关键来源。$k=5$(0.1s 间隔)是真机 40ms 延迟约束下的精度-算力权衡;1 秒训练片段已足够——"一秒前看到的就在脚下"。

隐状态 t-SNE 可视化

图 4:六地形隐状态 t-SNE——世界模型学到地形可分的高层表征(仅 Slope/Climb 轻微重叠)

真机评测(附录 A):室内五类地形各 10 次试验,Student 只能通过低难度档位,WMP 通过全部地形,包括 Tilt 与 Crawl。极限能力:Gap 85cm(2.1 倍机长)、Climb 55cm(2.2 倍机高)、Crawl 22cm(0.8 倍机高),接近仿真最难度。真机成功率汇总见图 6。

真机深度图像与长程开环预测

图 5:真机深度图与世界模型开环预测——纯仿真训练即可预测真实感知(Crawl 障碍形状差异源于仿真未见该形状)

室内真机成功率

图 6:室内真机成功率(10 次试验)——WMP 通过 Tilt/Crawl,Student 止步低难度

户外泛化(附录 B):公园环境上下楼梯、攀爬 45cm 平台、穿越草地与碎石,户外/室内行为一致,验证世界模型表征的泛化性(定性证据,见图 7)。

户外实验快照

图 7:户外实验快照——楼梯、45cm 平台攀爬、草地与碎石穿越

结果对比总结

WMP 结果对比流程图:去深度下降 69.7%,Gap 超学生 5.3,真机 85cm 成功

图 10(Mermaid 流程图):结果对比——去深度 -69.7%、Gap 超 Student +5.3、真机 85cm 成功

关键发现

  • WMP 在仿真 6 地形中的 5 个取得(教师之外)最优平均回报,Gap 地形比 Student 高 +5.3(32.37 vs 27.07)。
  • Tilt/Crawl 上 Teacher 与 Student 因扫描点失效无法使用,WMP 仍保持 34.73 / 36.60 的高回报——世界模型隐状态表达力超过手工特权信息。
  • 去掉深度的消融使 Gap 回报下降 69.7%(32.37 → 9.80),证明视觉结构在起作用,而非世界模型"记忆"了地形。
  • 真机 Unitree A1 极限:Gap 85cm(2.1 倍机长)、Climb 55cm(2.2 倍机高)、Crawl 22cm(0.8 倍机高),10 次试验通过全部地形。
  • 纯仿真训练的世界模型在真实 D435i 深度序列上开环预测仍然准确,显著缩小 Sim-to-Real 差距。
  • 户外实验中 WMP 稳定完成楼梯上下、45cm 平台攀爬与草地碎石穿越,行为与室内一致。

局限性

  • 纯仿真世界模型:训练数据全部来自仿真器,未利用真实轨迹提升模型精度(作者明确列为未来工作)。
  • 算力约束:真机只能支持 0.1s 低频世界模型更新($k=5$),无法达到仿真中的最优间隔 $k=2$。
  • 验证范围:仅在 Unitree A1 与六类地形上验证,未覆盖其他机器人形态,也未与 Dreamer 等其他 MBRL 方法直接对比。
  • 复现门槛:匿名评审阶段未开放代码,复现依赖深度图像预处理细节与 Isaac Gym 环境配置。

常见问题(FAQ)

WMP 与传统 Teacher-Student 特权学习有何本质区别?

WMP 是单阶段端到端训练:世界模型把视觉历史压缩成隐状态后直接训练策略,没有教师策略、没有手工特权信息设计,也没有两阶段蒸馏的信息差。

为什么世界模型要低频更新?

真机上深度图获取与世界模型计算共约 40ms 延迟,若每步都更新隐状态无法满足控制频率;每 $k=5$ 步(0.1s)更新一次是精度与算力的权衡,仿真中更小的 $k$ 效果更好。

WMP 的世界模型与 Dreamer 有何不同?

WMP 的世界模型不做 rollout 数据生成(仿真器更准确),只作为感知压缩器提取隐状态供策略使用;Dreamer 用世界模型在想象环境中训练策略。

扫描点(scandots)为什么无法表示 Tilt 与 Crawl?

扫描点密度受仿真地形网格分辨率限制(10cm),无法区分到边界的精确距离,也无法表示悬空障碍与多层高度结构;深度图像则能完整表达这些地形。

世界模型能预测真实世界的深度吗?

能。纯仿真训练的世界模型在真机轨迹上做开环长程预测仍然准确,只在仿真中从未见过的障碍形状上有细微差异——这正是 Sim-to-Real 泛化的直接证据。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2409.16784
  • 项目网站(WMP-Loco):https://wmp-loco.github.io/
  • DreamerV3(Hafner et al., 2023):https://arxiv.org/abs/2301.04104
  • RSSM / Learning Latent Dynamics(Hafner et al., ICML 2019):https://arxiv.org/abs/1803.10122
  • Parkour(Cheng et al., Science Robotics 2024):https://www.science.org/doi/10.1126/scirobotics.adi9756
  • legged_gym(Rudin et al., CoRL 2022):https://arxiv.org/abs/2206.03672

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐