EWAM详解:用于具身智能闭环在线自适应的增强型世界动作模型
1. 介绍
核心问题
- 开放环境部署难:机器人面临物体姿态、场景布局、执行意外(如碰撞、抓空、感知幻觉)的无限多样性,收集覆盖所有情况的演示数据成本极高。
- 静态离线模型脆弱:现有的世界动作模型(WAMs)虽然能预测未来状态并生成动作,但一旦在静态离线训练后直接部署,遇到执行层级的偏差(例如预测的动作撞到障碍物、预测抓取但抓空)就会失效,无法自我修正
解决方案:EWAM 的“闭环在线适应”架构。EWAM没有重新训练整个大模型,而是冻结了预训练的Cosmos3-Nano-Policy-DROID主干,仅在其策略路径上添加了4个可训练层,形成一个“记忆→监测→决策→修正”闭环反馈回路。
- 神经经验记忆层(位于DiT中间层)—记忆检索功能提供与任务相关的执行上下文
- 神经异常检测层(位于状态预测头之后)—异常检测监控预测与实际执行之间的偏差
- 神经策略路由层(位于异常检测之后)—路由机制负责选择直接执行、保守重规划或回滚恢复
- 神经动作校正层(位于动作输出头之后)—动作校正层则利用执行诊断信息对生成的动作片段进行精细调整。
2. 方法

数据流阶段:
阶段一:骨干网络预测
- 起点:机器人接到指令l,视觉 ot,机器人状态 qt
- 世界模型(World Model)先预测,再生成候选动作
阶段二:插件对候选动作做“纠偏与执行”
- 经验记忆→策略选择→实时错误修正→动作精炼
阶段三:闭环学习
- 获取执行结果
- 经验过滤:高质量经验才允许进入下一步。否则直接丢弃
- 自学习模块:筛选出的“好经验”,对前面 4 个插件进行在线微调
- 记忆库更新
三个主要组件:
- 用于多模态感知的视觉-语言编码器(VLE)
- 用于长程任务规划的自回归(AR)推理器
- 用于动作生成的扩散Transformer(DiT)
四个额外插件:
- 神经经验记忆层(位于DiT中间层):该层插入DiT的第lmem层,从记忆M中检索与任务相关的经验,并将其注入DiT的隐表征中。这使得扩散过程能够同时基于当前上下文和检索的历史经验进行条件化生成。
- 神经异常检测层(位于状态预测头之后):该层利用预测状态 st+1、当前状态 st、原始动作候选序列 a 以及DiT隐状态,检测执行过程中的异常情况,包括预测与实际不符、碰撞风险、抓取失败(空抓)、感知幻觉以及力控违规。
- 神经策略路由层(位于异常检测之后):该层根据异常检测结果 lt 选择合适的执行策略:直接执行、保守重规划或回滚恢复。它输出路由决策 rt,用于调节动作修正过程。
- 神经动作修正层(位于动作输出头之后):该层根据异常信号 lt、路由决策rt 和记忆上下文M,对原始动作输出 a 进行精细调整。它在去噪阶段执行修正,以确保执行过程既安全又高效。
2.1 Neural Experience Memory Layer
神经经验记忆层被插入到DiT的中间层lmem=6,使行动的产生能够以当前的背景和检索到的历史经验为条件
其中Wq是可学习的查询投影,MemoryEncoder编码基于AR推理上下文ct的经验记忆,是门控标量,其值为0.6。
表2是一些参数的具体数值

2.2 Neural Anomaly Detection Layer
在状态和原始动作预测之后插入神经异常检测层。在第一步,eprev被初始化为零。

代表先前预测残差,表明机器人现在的真实位置
和“模型以前预测的现在位置“差异。
代表候选动作的物理一致性:检测“模型有没有违背物理法则”,同时利用了物理动力学模型(DynamicsModel),根据当前具实状态S和原始候选动作a,重新推算了一遍具实的物理后果
计算两者之间的差距。
最终输出 6 维异常向量 ,为下游路由和纠正提供执行诊断。
2.3 Neural Policy Routing Layer
在异常检测层之后插入神经策略路由层。它基于异常信号、AR上下文
和存储器M选择适当的执行策略。MemSummary(M)提供了记忆状态的简洁摘要

具体的阈值如下所示:

2.4 Neural Action Correction Layer
在动作输出头之后插入神经动作校正层。它基于异常信号、路由决策
和存储器上下文M来改进原始动作输出a,MemSummary(M)提供了记忆状态的简洁摘要

- 直接执行:当异常信号低于阈值时,继续执行生成的操作。
- 保守的重新计划:当检测到轻微异常时,触发带有保守约束的行动纠正。
- 回滚恢复:当检测到严重异常时,从记忆中恢复到最近的稳定状态
CorrectionNet是一个轻量级的神经网络,计算修正量,是修正强度的门控标量(0.5),其训练目标如下:

目标是模型让 “修正后的动作 ” 逼近 “安全的动作
”。
其中 I[anomaly]代表异常门控开关,系统检测到异常发生(比如即将碰撞或抓空了),这个值为1,否则为0。来源:模拟器回滚、保守恢复、过去已成功存入记忆的成功条目。RollbackAction在记忆中检索最近的稳定状态作为保守动作。
2.5 闭环在线学习

数据流步骤如下:
- 感知 → VLE 编码:原始视觉观测
和本体感觉状态
经由视觉-语言编码器(Vision-Language Encoder)编码,生成
。
- 编码 → AR 推理:自回归推理器(Autoregressive Reasoner)处理
,生成推理上下文
。
- 推理 → 具有记忆增强功能的 DiT:DiT 利用记忆增强中间层(位于
= 6 处的神经经验记忆层)处理自回归 Token,并从 M 中检索相关经验。
- DiT 输出 → 状态/动作候选:状态预测头生成
,动作头生成原始动作片段
。
- 状态/动作候选 → 异常检测:神经异常检测层结合先前的预测残差、候选动作的动力学一致性以及学习的风险评分,生成异常向量
。
- 异常检测 → 策略路由:神经策略路由层根据
选择执行策略
{direct, conservative, rollback}。
- 路由 + DiT 输出 → 动作修正:神经动作修正层(Neural Action Correction Layer)根据
、
和记忆上下文,将原始动作
优化为修正后的动作
。
- 修正后的动作 → 环境执行:修正后的动作在环境中执行。
- 执行结果 → 经验筛选:执行结果由经验过滤器进行评估;只有合格的轨迹才能进入下一阶段。
- 筛选后的经验 → 记忆/参数更新:合格的轨迹被写入经验记忆 M;神经层会进行间歇性的参数更新。
用稀疏的在线经验直接更新预训练的WAM主干有灾难性遗忘的风险,其中模型丢失了从原始数据集学习到的一般能力。因此,EWAM采用了“保寸适应策略”,具体包括三点原则:
- 即时记亿检索(Memory-first):当一项新任务开始时,系统首先从记忆(k = 5个最近邻)中提取相关经验,以提供特定任务的上下文。这种基于检索的适应是瞬时的,并且不修改任何模型参数。
- 保守的参数更新:在线参数更新只是间歇性地发生,并且只影响轻量级神经层适配器,而不影响冻结的Cosmos3-Nano - Policy-DROID主干。这保留了模型的一般one-shot能力,同时允许逐渐适应。
- 严格的经验过滤(ExperienceFiltering):只有高质量的轨迹(通过所有安全和效率检查)被写入记忆库
2.6 训练和在线更新目标
离线训练时,预训练的Cosmos3-Nano--Policy-DROID骨干被冻结;仅训练四个神经层参数θ和轻量适配器。为四个神经层添加监督损失:

前面两个公式表示状态预测和动作生成,第三个公式代表记忆检索,使用余弦相似度,使得当前的视觉观测 和语言指令
与检索到的历史经验
接近。第四个公式代表异常检测:分类损失(BCE),训练系统准确报出碰撞、空抓等风险的概率;回归损失(L2),训练系统准确算出预测与现实之间的物理偏差。
下述公式代表二元风险头
![]()
![]()
![]()
在部署过程中,每次样本通过过滤时,EWAM都会更新记忆库,并且只是间歇性地更新神经层参数

2.7 错误触发与回滚
基础预测误差:

动态阈值:
![]()
其中为最近错误窗方差,
表示异常接触,
表示感知幻觉或空抓。在以下情况下会触发校正
![]()
这里对幻觉进行数学定义:
![]()
其中, = 0.85 and
= 0.15 N。
>0.85代表夹爪被异常紧密地闭合(视觉上觉得抓到了),
<0.15N:传感器反馈的接触力极小、(实际根本没碰到物体)。
结论:夹小合拢了但没受力=视觉产生幻觉。
在线rollout可以表示为如下:

Memory和轻量级参数更新则由质量门Q(Et)控制

其中 是预定更新指示符。
2.8 经验过滤
核心:只有高质量的轨迹才能被写进记忆库 EWAM在存储器写入或参数更新之前应用质量门。只有当所有条件都满足时,轨迹才被视为合格。低质量的样本会被记录用于诊断,但不会写入内存,也不会用于更新参数

- 安全评分:系统必须评价自己这次执行是安全的
- 任务评分:系统必须认为这次执行对最终任务(如把香蕉放进碗里)是有实质性积极贡献的
- 最大夹爪力。限制在0.8以下。
- 末端执行器SPARC评分:SPARC (Spectral Arc Length) 通常用来衡量动作的平滑度或震颤程度。≤ -2.5 意味着动作必须非常平顺,不能有剧烈抖动或来回抽动的低质量操作
- 移动路径长度:必须在一个合理的较短距离(1.2米)内完成 任务任务完成时间,必须在 15 秒内完成该动作序列
局限:这些阈值是针对在 RoboLab 的特定容器操作任务(BananaInBowlTask等)

2.9 轨迹存储
每个存储器项目包含索引键、值
、结果标签
和回滚锚
![]()
该键结合了任务、场景、对象和布局签名:

存储的值包括执行上下文:
![]()
记忆的检索打分机制:当机器人处于一个新场景 t 时,它需要在庞大的记忆库中快速找到最像当前场景的历史经验。

其中e (λ1, λ2, λ3, λ4) = (0.35, 0.30, 0.20, 0.15)
3. 实验
硬件与环境
- 仿真平台:RoboLab 仿真环境。
- 算力配置:双 GPU 工作站(2× NVIDIA RTX 5880 Ada,48GB 显存)
- 零样本(Zero-shot)测试任务
- BananaInBowlTask:香蕉入碗(软物体容器操作,)。
- BananasInBinOneMoreTask:香蕉转移(引入干扰物/杂物的容器转移任务)。
- BlockStacking OrderAgnosticTask:积木堆叠(多物体操作,必须按顺序放置,考验逻辑规划能力)。
鲁棒性测试
- 物体位置扰动:物体位置随机偏移(标准差 σ=0.02m)。
- 光照变化:光照强度在 ±15% 的范围内随机波动
结果如下所示:

性能和算力权衡:用 10 毫秒的延迟换取 83.7% 的故障率降低
![]()
测试的主要结果如下:

下面进行了消融实验:

结果显示:在线自学习和错误修正影响比较大。没有在线学习,该模型不能积累特定任务的执行证据,并且必须依赖于在预训练知识;没有动作修正层,系统能检测到异常,但无法对动作进行微调
泛化性测试的结果如下:

4. 总结和局限
定位:EWAM 是基于预训练骨干网络的一个“闭环适应层
五步闭环: 检索经验提供先验 →异常检测器(Critic)监测预测与现实的偏差 → 反馈模块修正不安全动作 → 回滚机制确保在危险时退回安全位置 → 质量门控确保只从成功中学习
与其他方法的关系:EWAM 与现有的“动作流形 VLA 模型、潜在动作 WAM、高效 WAM 推理、因果世界模型”是互补的,而不是对立的
核心结论:即使在 100% 成功率已经饱和的情况下,EWAM 依然能大幅提升执行效率(时间、路径)和恢复能力。消融实验确认了“记忆优先,适配器次之”的设计正确性
局限:
- 实验边界(Sim-only)仅限于仿真,没有真机验证
- 4 个插入层(特别是它们的维度、接口和超参数)是专门针对 Cosmos3-Nano-Policy-DROID 骨干网络设计的
- 回滚通过模拟器的检查点(Checkpoints)实现的,但是相应的真实机器人状态恢复没有被验证
- 6 个过滤阈值是高度场景专用,失败模式目前只有四种
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)