Zeva:用于可泛化具身操作的上下文因果学习
26年8月来自清华AIR研究所和Z-Brain公司的论文“Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation”。
由于现实世界中存在未知的物理条件,仅通过预训练难以实现可泛化的具身操作。机器人需要在实际部署过程中实时学习自身的物理交互,并利用这些知识指导后续动作。Zeva,这是首个能够在保持策略模型冻结的情况下,从机器人自身的物理交互经验中进行上下文学习(ICL)的框架。Zeva 采用因果交互提取器将执行的动作及其引起的状态变化编码为因果交互信号,并将其存储在双时间尺度因果记忆中。对于后续动作,相关的因果交互信号会从记忆中检索并作为上下文注入到冻结的策略模型中。仿真和实际操作实验表明,Zeva 在所比较的前沿 VLA 和 WAM 中性能最佳,更重要的是,它能够在部署过程中实现无需梯度更新的自我进化。随着机器人交互经验的积累,其成功率持续提高。此外,所获得的交互经验可以泛化到不同的任务中。
如图 1 所示:Zeva 通过上下文因果学习 (ICCL) 实现具身智能的自我演化。Zeva 通过提取动作诱发的因果转换、维护双时间尺度交互记忆以及检索因果上下文以进行情境策略调整,来学习机器人动作与由此产生的状态变化之间的因果关系。无需参数更新,Zeva 即可使冻结的策略通过自我演化和人类引导的经验注入逐步改进,从而在实际应用中实现强大的性能,并超越特定任务演示,实现跨任务知识迁移。

为了实现 ICCL 的目标,Zeva 框架将原始交互转换为双时间尺度因果记忆。Zeva 由三部分组成:(1)因果交互提取(CTE),它将动作和效果映射到潜空间;(2)双时间尺度记忆管理,它构建经验以供检索;(3)上下文策略注入,它为基础模型提供因果提示。
如图2展示这些组件如何与双路径基础策略耦合。自回归路径编码多模态上下文,而扩散路径生成连续的机器人动作。对于每个执行的转换,CTE 提取一个阶段token和一个因果交互信号:简短交互轨迹提供最近尝试内的证据,而持久交互记忆检索跨尝试累积的阶段匹配证据。由此产生的因果提示会影响扩散路径中的全注意力模块,使策略能够在保持所有模型参数不变的情况下,根据上下文改变其动作策略。

1 第一部分:因果交互提取
为了弥合原始像素与因果推理之间的差距,用因果转换编码器 (CTE) 将交互映射到潜因果空间。
a) 交互递归:在每个时间步 τ,提取三个瞬态信号:视觉潜信号 s_τ、动作编码信号 u_τ 和观测到的效果信号 d_τ。受轨迹级行为表征 [27] 的启发,通过门控递归将这些信号整合到因果交互状态 B_τ 中。状态 B_τ 被投影为两个分量:表示任务进度的阶段token p_τ 和表征动态的因果交互信号 e_τ。它们共同构成因果交互单元 ξ_τ = (p_τ, e_τ)。
b) 学习目标:用多目标损失函数优化因果转换编码器,以确保 e_τ 能够捕捉物理因果关系。
• 因果效应预测 (L_effect):该目标函数解码 e_τ 和候选动作,以预测视觉状态变化 ∆s_τ,从而将信号与物理效应联系起来。
• 任务身份聚类 (L_task):一种监督式对比损失函数,用于对同一任务的不同片段进行聚类,以学习任务一致的交互空间。
• 阶段进展 (L_phase):一种损失函数,用于确保 p_τ 能够捕捉任务执行的单调进展。
2 第二部分:双时间尺度因果记忆
Zeva 将交互单元 (p_τ, e_τ) 组织成两个记忆流,以支持当前片段内和片段间尝试的适应。
a) 简要交互轨迹:Hbrief_τ 存储最近交互信号 {e_j} 的滑动窗口。这为策略提供关于当前操作有效性的即时本地上下文。每次尝试结束后,此跟踪都会重置。
b) 持久交互记忆:Hpim_τ 会累积同一事件中不同尝试的因果单元 ξ = (p,e),并在新事件开始前清除。为了确保可扩展性,采用基于相似性的合并方法。对于新的单元 ξ_τ = (p_τ,e_τ),通过计算以下公式找到最相似的条目 ξ∗:
S_merge(ξ_τ,ξ_j) = β_p sim(p_τ,p_j)+β_e sim(e_τ,e_j),
然后更新持久记忆。这确保只有当新体验与现有记录的任务进度和物理动态都匹配时,才会将其合并。
3 第三部分:上下文策略注入
最后阶段将存储的经验转换为基础模型所需的结构化因果提示。
a) 阶段条件检索:用当前阶段 p_τ 查询持久记忆,以获取最相关的交互证据。检索到的集合 R_τ 由与其关联阶段匹配的当前进度的信号组成。
b) 因果提示构建:通过将任务token g 和当前阶段token p_τ 与短期和长期交互历史整合,构建记忆上下文 M_τ。具体来说,记忆上下文编码器 F_mem 在通过共享投影器 P_proj 投影历史流后,融合这些组件。通过将 M_τ 作为因果提示注入,冻结的基础模型执行隐式因果推理。它根据先前交互的成功或失败调整其动作 π(a_τ | o_τ, M_τ),以最大化任务成功率。
4 推理
部署期间,所有参数均保持冻结状态。智能体在线更新其因果记忆,基础模型将不断演化的 M_τ 视为决策的动态上下文。完整的上下文因果推理过程总结于算法 1 中。

实验设置
- 回合(episode)和尝试协议:用两个评估单元:回合和尝试。一个回合对应于一个由其初始化定义的单个任务实例,包括场景布局、物体姿态和机器人的初始配置。随机回合在回合开始时独立地对该初始化进行采样。固定回合选择一次初始化,并在重复尝试中保持不变。一次尝试是指从初始观察到终止或成功为止的一次连续策略执行。在固定回合中的每次新尝试之前,环境都会恢复到相同的初始状态。
简短交互轨迹 (BIT) 在每次尝试开始时都会被清除,而持久交互记忆 (PIM) 则在同一回合内的多次尝试之间保留。这两个记忆在下一个回合开始之前都会被清除。回合在第一次成功尝试后立即终止,并且每个比较的方法都获得相同的最大重试预算。
-
仿真基准测试:用 RoboCasa365 中的五个代表性任务对 Zeva 进行评估,这些任务涵盖了多种厨房操作技能,例如与关节物体的交互、物体放置和电器操作。将这五个任务的评估子集称为 RoboCasa365-Atomic5(Atomic5)。每个任务均在 50 个独立随机的回合中进行评估。
-
真实化学实验室(ChemLab-Evo):为了评估 Zeva 能否在部署后通过积累交互经验来提高其操作能力,构建ChemLab-Evo,这是一个使用 ARX 机械臂在 80 cm × 60 cm 工作空间中运行的真实化学实验室基准测试。ChemLab-Evo 包含七个任务,涵盖三个难度递增的技能组合级别。级别 1(原子级)通过“拿起试管”、“放置烧杯”和“倒水”来评估单个操作基元。级别 2(短序列级)通过“滴定”和“配制盐溶液”引入了简短的技能组合。级别3(复杂)通过平衡称重和提取来评估长时程、多阶段的流程。随着复杂性的增加,成功执行的条件从完成单个目标原语转变为按预定顺序完成所有组成阶段。这种分层评估方法能够不仅考察任务层面的性能,还能考察随着任务复杂性的增加,累积的交互经验是否能提高执行可靠性。主要基准测试和每个消融配置均使用 20 个独立随机化的回合来评估每个任务。
-
对比基线:在 Atomic5 平台上,将 Zeva 与 LingBot-VA [8]、Xiaomi-Robotics-1 [36]、τ0-WM [37]、Fast-WAM [34] 和 Cosmos3-Nano [18] 进行比较。对于 ChemLab-Evo 平台,还加入 π0.5 [14]。所有基线均使用与 Zeva 相同的特定任务训练数据集、观察和动作界面以及评估协议在本地复现。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)