T-RO 2026 | 会探路、敢跳跃、摔不垮!DreamWaQ++:让四足机器人解锁全地形自适应运动
导读: 四足机器人如何稳健闯过楼梯、沟壑、碎石陡坡?KAIST团队推出DreamWaQ++控制器,融合本体感知与3D点云外部感知,单阶段训练、仿真直接落地真机零微调。一套神经网络就能解锁探路、跳跃、越障等多种自适应运动,传感器故障时还能降级运行,适配多款四足机器人硬件。
-
作者:I Made Aswin Nahrendra, Byeongho Yu, Minho Oh, Dongkyu Lee, Seunghyun Lee, Hyeonwoo Lee, Hyungtae Lim, Hyun Myung
-
单位:韩国科学技术院KAIST
-
论文标题:DreamWaQ++ Obstacle‑Aware Quadrupedal Locomotion With Resilient Multimodal Reinforcement Learning
-
发表信息:IEEE Transactions on Robotics, VOL.42,2026
-
论文链接:https://ieeexplore.ieee.org/abstract/document/11353057
🔍研究背景
四足机器人在巡检救灾等野外场景拥有广阔应用前景🚁。现有本体感知的“盲运动”强化学习方案,仅依靠机器人自身传感器,在平地表现尚可,但无法提前感知楼梯、沟壑等障碍物,碰到复杂非结构化地形极易绊倒踩空。
引入深度相机、激光雷达的感知运动方案成为研究方向,但实际落地仍存在诸多难题❗
-
外部感知采样频率低,和本体控制环路存在异步延迟,同时伴随点云噪声、外参标定误差;
-
LSTM存在梯度消失,Transformer算力开销大,难以适配机载设备;
-
缺少探索激励时策略容易保守,对陌生地形泛化差;不少方案还需要多阶段分步预训练,调参复杂。
因此亟需一套单阶段端到端框架,兼顾多模态感知、时序记忆、实时推理与行为探索,同时对传感器各类扰动具备鲁棒性,DreamWaQ++就此展开研究。
💡主要贡献
-
多模态感知模块✨:融合本体感知与3D点云外部感知,兼容深度相机、激光雷达多种传感器,能够处理楼梯、缺口、可形变地面等各类复杂地形。
-
弹性多模态深度强化学习框架📦:整套网络单阶段端到端联合训练,依托非对称Actor‑Critic架构与多组辅助损失,学习鲁棒的运动策略。
-
技能发现优化目标🎯:设计基于互信息最大化的「多样性增益」,激励策略涌现多样化步态,适配不同障碍物。
-
多硬件大规模验证🔬:在Unitree Go1/A1、ANYmal‑C、Hound多款四足机器人完成仿真+实物实验,验证控制器的可拓展能力。
-
完备的消融实验📊:针对记忆结构、损失函数、网络组件开展定量消融分析,拆解每个模块对性能的贡献,为后续研究指明方向。
🛠️研究方法

DreamWaQ++整体分为感知流水线和控制流水线两大模块,全部网络联合训练。算法选用PPO近端策略优化,采用非对称Actor‑Critic架构。
-
Actor(策略网络)接收仿真中添加噪声的模拟真实观测;
-
Critic只能访问仿真环境内部的特权状态;
-
策略网络以输出目标关节位置,底层PD控制器运行在,输出关节力矩指令。
分层外部感知记忆
外部点云传感器采样频率仅,远低于的控制频率,会带来不可忽视的异步延迟。论文利用位姿变换,把历史帧点云统一转换到机器人当前机体坐标系,拼接得到稠密时序点云观测:
式中代表历史时刻点云经过位姿变换后,映射到当前机器人机体坐标系下的点云。
实验设置外部感知采样,取。依靠状态估计网络预测机体线速度,欧拉积分完成位姿更新;每当收到一帧新传感器数据,就重置积分,抑制位姿漂移。训练阶段随机修改传感器外参、注入观测噪声,提升策略鲁棒性。
外部感知编码器

主干网络选用PointNet处理无序3D点云;新增置信度滤波层,过滤点云中的离群噪声:
为PointNet主干网络,统计点云特征方差。过滤高方差的噪声离群特征后,通过最大池化得到外部感知隐向量 。
本体感知编码器
基于MLP‑Mixer搭建,输入连续帧本体时序观测(,对应时间窗口)。借助变分推断输出随机隐变量,一路送入多模态混合器,另一路用于预测机器人机体线速度。
为解决VAE训练常见的后验崩塌问题,论文提出约束重参数化技巧:
强制约束分布标准差范围:,本文设置,兼顾训练稳定性与特征表达能力。
多模态混合器 Multimodal Mixer
同样采用MLP‑Mixer架构,先分别对本体、外部感知隐特征执行层归一化,保证两种模态尺度对齐,再完成跨模态特征融合。对比Transformer,参数量更小,推理速度更快,适合机载设备。
多组辅助损失函数
-
估计损失 :用MSE约束本体编码器预测机体线速度:
引入自适应bootstrap机制,根据累计奖励的变异系数,动态选择是否使用网络预测速度。
-
VAE损失:本体感知VAE,完成未来本体观测重建:
外部感知VAE,从融合后的多模态隐变量解码重建地形高度图:
论文设计自适应调度策略,根据重建误差动态调整KL散度权重,降低调参难度。
-
对比损失 :不再直接回归环境属性,而是对齐Actor多模态隐特征与Critic特权状态的隐特征,拉近正样本距离、推开随机负样本,缩小真实观测与特权信息之间的分布鸿沟。
-
技能发现|多样性增益 :最大化观测与多模态隐变量之间的互信息MI:
第一项最大化隐变量熵,鼓励运动行为多样化;第二项条件熵实现降噪聚类,平衡探索与利用,避免策略陷入保守。
⚙️实现细节
-
仿真训练环境:NVIDIA Isaac Gym Preview3,基于LeggedGym库;3500个并行智能体,A5000 GPU整体训练时长约11小时。训练完成的网络直接部署真实机器人,完全不需要微调。
-
时序与底层控制:本体感知采样,外部感知,策略网络运行;训练阶段加入随机延迟,模拟真实世界传感器异步现象。底层PD控制器参数:,。
-
域随机化增强:负载、PD增益、电机强度、质心偏移、地面摩擦、系统延迟全部做随机化;本体、外部观测注入多等级噪声;每个训练episode随机设置传感器外参偏差,模拟标定误差。
-
奖励课程设计:关节力矩、关节速度、加速度、动作平滑等正则奖励权重随迭代指数退火:
前期靠正则保证仿真‑现实迁移效果;后期降低权重,鼓励机器人探索更多运动模式。
-
特权状态:仅Critic网络可用,包含机器人局部高程图、真实机体速度、外力力矩、足端位置、机器人物理参数等仿真内部真值信息。
🧪实验

实验硬件覆盖Unitree Go1、Unitree A1、ANYmal‑C、KAIST Hound;传感器包含RealSense深度相机、Ouster、Livox系列激光雷达。
楼梯竞速对比实验

对比两组基线:DreamWaQ(无视觉本体感知方案)、Unitree原厂感知控制器。
DreamWaQ++控制的机器人R1跑完50级楼梯耗时35s;DreamWaQ频繁踩空打滑;原厂控制器受环境地图延迟限制,反应慢,发生摔倒,无法完成完整赛程。异步对照实验表明:DreamWaQ++速度估计误差显著更低,步态自适应能力更强。
障碍物感知能力


-
环境可供性感知:即便下达直行指令,机器人也会主动选择风险更低、更容易通行的台阶,自主改变行进方向规避危险。
-
自适应摆腿行为:根据足端落地位置动态调整摆腿幅度,实现一步跨越两级台阶。大规模仿真测试,相比ViL‑teacher基线,楼梯攀爬成功率高出20‑40%。
未知环境涌现行为


面对高度未知的地形,机器人会自动停下,伸出足端试探地形,形成原生的探测技能。
当机器人站在可移动平台上,平台被突然抽走时,机器人快速扩大支撑多边形,实现安全落地。
模型仅在斜坡样本上训练,却可以自主攀爬陡坡,机身姿态贴合坡面,后腿关节力矩相比DreamWaQ降低约1.5倍。
跨机型泛化能力

整套训练框架直接迁移到ANYmal‑C、Hound机器人,仅修改机器人本体硬件参数,奖励函数权重完全不变。训练样本最大台阶高度只有,Hound机器人却可以成功攀爬的台阶。
仅修改两处超参(降低速度跟踪奖励权重、提升多样性增益权重),策略即可学会跑酷跳跃。真机上Go1搭载负载可以翻越障碍物,还能完成高台向前跳跃动作。
消融与鲁棒性测试

-
架构消融:不使用时序记忆,小腿碰撞次数显著上升;仅简单拼接模态特征、不做多模态混合,任务成功率大幅下滑;LSTM隐式记忆效果优于无记忆,但性能弱于本文MLP‑Mixer。
-
损失消融:移除对比损失,性能小幅下降;移除多样性增益带来的性能衰减最为严重,策略行为变得保守,面对复杂地形极易失败。
-
模型性能对比:MLP‑Mixer预测精度接近Transformer,但是计算开销远低于Transformer,优于普通MLP与RNN。
-
传感器失效降级测试:外部感知输入白噪声,甚至相机完全脱落损坏,机器人依旧依靠本体感知,通过足端、膝盖多点接触地面维持运动,实现故障降级运行。
-
隐空间分析:多模态隐向量可以区分不同地形环境;调节部分外部感知隐变量,能够直接控制机器人摆腿高度。
📝总结
DreamWaQ++构建了一套轻量化、高鲁棒性的障碍物感知四足运动控制器✅。
-
通过分层外部记忆解决传感器频率异步问题;PointNet搭配置信滤波处理噪声点云;MLP‑Mixer高效完成本体‑外部感知跨模态融合。
-
结合对比损失、自适应‑VAE、互信息多样性增益,实现单阶段训练,无需多步预训练;策略自然涌现地形探测、大摆腿、跳跃、感知故障降级等多种行为。
-
仿真训练完成直接部署真机,兼容多种外部传感器,同时可以适配不同构型的四足机器人。
未来展望🔭:给相机增加伺服俯仰机构,让机器人同时学习运动与主动感知,模仿动物主动观察环境的行为,进一步提升复杂环境下自主能力。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)