摘要

本文解读 arXiv 2026 论文《World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks》。该论文提出世界-自我建模(World-Ego Modeling)这一具身世界模型新范式,通过把未来演化拆成世界演化(持续的、与指令无关的场景规律)与自我动力学(机器人中心、受指令条件化的行为)两条预测职责,并以角色条件注意力(RCA)状态预测器加级联并行混合专家(CP-MoE)扩散生成器落地为 WEM 模型,目标是解决混合导航-操作任务中的长时程退化。其特别之处在于把"世界-自我边界画在哪里、要在架构的哪一层解耦"当成可以受控测量的设计变量,而不是停留在定性分解上。实验表明 WEM 在 HTEWorld 基准上取得 61.48 的 EWMScore,超过 PAN-style 基线 3.08 分、超过 14B 版本的 Cosmos-Predict 2.5 共 6.07 分,同时保持常规操作类基准上的竞争力,为长时程具身世界建模提供了重要借鉴。

视频讲解:点击观看 B 站视频

论文基本信息

项目内容
标题(英文)World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks
标题(中文)世界-自我建模:混合具身任务的长时程演化
作者Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen
机构中关村学院 具身交互实验室(ZGCA HMI Lab) · 中科院自动化所 · 国科大 · 上海交大 · 北京大学
会议arXiv 2026
arXivarXiv:2605.19957
项目网站zgca-hmi-lab.github.io/WEM

背景与动机

具身世界模型的目标是学习物理动力学,从而预测未来、生成合成数据,或者作为策略的模拟器。近年基于视频生成的世界模型已经能产出相当逼真的未来 rollout,但在长时程具身场景里性能会明显退化——画面不再保持连贯,行为也不再对齐指令。

论文把退化的一个重要来源归结为世界与自我的纠缠。世界承担的是持续存在、与指令无关的场景规律,比如房间布局与物体恒常性;自我承担的是机器人中心、受当前指令条件化的动力学,比如机械臂运动与接触驱动的物体位移。两者的性质完全不同:前者跨数十轮持续存在,后者只活在当前一步。把两者塞进同一条生成流,模型就必须用同一套容量同时拟合两种时间尺度,长时程下必然顾此失彼。

这个问题在混合导航-操作任务上最尖锐。导航要求场景长期一致,操作要求接触与指令严格对齐,两个目标在同一条流里互相拉扯。论文点名对比的相关工作包括 Cosmos-Predict 2.5、WoW-7B 与 PAN-style 基线:它们都能预测未来观测,但多数把场景演化、机器人运动、任务意图与接触动力学耦合在单一生成流中,因此容易在长时程复合任务上出现时间不一致与指令对齐偏弱。相邻思想里,JEPA 系(如 V-JEPA 2)在表征空间分离预测与动作,GEM 把自我视角的未来视频分解成相机运动、物体动态与场景合成——但它们主要面向动作条件、视角运动或局部物体动态,没有系统研究"边界画在哪里、要解耦到哪一层"。

论文的研究思路可以概括成一条问题链:

  1. 具身世界模型到底是否需要把世界与自我解耦?
  2. 如果需要,边界应该按什么准则来画?
  3. 解耦应该在架构的哪一层发生?

研究主线:从问题到结论

基准/方法设计

世界-自我建模把一个单体模型的预测拆成清晰的二段式。原本的单体模型直接由观测、历史与指令预测下一段视频,把场景结构、视角变化、机器人运动与物理交互全部压进一条预测通路;论文则先把未来拆成两路互补状态,再让生成器在给定这两路状态与当前指令的条件下生成下一段视频。用公式表示就是 $S_k^{w}, S_k^{e} = \Phi_\phi(O_0, V_{<k}, a_{\leq k})$,随后 $\hat{V}k = \mathcal{D}\theta(C_k, a_k, S_k^{w}, S_k^{e})$,其中 $\Phi_\phi$ 是视觉语言状态预测器,$\mathcal{D}_\theta$ 是视频生成器,$C_k$ 是当前生成窗口的局部视觉条件。这里要强调,世界状态与自我状态并不是世界的两个独立因子,而是把不同的预测职责分配给未来的不同侧面。

论文给出的世界观是:自我由本体(embodiment)与被操作物体构成,世界由布局(layout)、物体(objects)与上下文(context)构成;两条流沿时间并行展开,自我演化对应精确的物体交互,也就是操作,世界演化对应稳定的场景一致性,也就是导航。而这两件事并不独立,而是互为条件——这正是混合导航-操作任务难以用单一生成流处理的根本原因。

分类全景

三种边界视角各有自己的代理信号与实现代价,可以直接并列比较。

方法细节

WEM 遵循两阶段范式:视觉语言状态预测器把多模态历史映射成紧凑的隐状态,带 CP-MoE 结构的视频扩散生成器则在给定这些状态与当前指令的条件下解码下一段视频。整个框架其实在两条正交的设计轴上展开——世界-自我边界画在哪里,以及解耦发生在架构的哪一层。

边界画在哪里:三种视角

运动视角按视觉运动的来源划分边界。在静态场景假设下,相机自运动会在背景上诱导出可预测的场景流,与之吻合的像素由视角变化解释、归给世界;与之背离的像素反映接触驱动的物体动力学、归给自我。实现上,论文用 RAFT 估计稠密光流,再用 RANSAC 拟合匹配特征对得到相机单应矩阵,把相机流渲染出来,残差就是物体残差流。

语义视角按场景实体的具身角色划分边界。机器人本体与当前被操作的物体共同构成自我区域,其余的背景与未被操作物体构成世界区域,服务于长时程场景一致性。这个视角的关键性质是交互依赖:一个可动物体在被操作之前属于世界,被操作时并入自我,交互结束后归还世界。边界不是一张固定掩码,而是随交互状态流动的。

意图视角不切分像素,而切分条件来源。世界反映由视觉历史确立的信息,自我反映由当前指令诱导的信息,预测器自行学习如何从两路条件中提取并整合信息来生成未来。这个视角与 Iso-Dream 隔离可控与非可控视觉动力学的思路相关,但这里的划分对象变成了指令诱导的自我动力学与历史确立的世界规律。

解耦发生在哪一层

论文比较了三种解耦强度。前解耦在后续管道的输入处做分离,把中间特征切成世界相关与自我相关两组 token,再用一个共享模块在受限交叉条件下处理,下游计算仍是共享的。后解耦在输出处做分离,两条专门分支各自在完整特征上、分别以世界状态与自我状态为条件产生预测,最后融合;计算完全复制,但输入没有切分。全解耦把两者结合起来:先按代理信号把 token 路由到两条专门分支,分支各自只受一路状态条件,最后再用同一个代理把输出反路由回一条序列。

三种强度都跑在同一套骨干上——一个前置专家加世界/自我专家的 CP-MoE 结构,因此对比是受控的。

WEM 的四个关键设计

非对称查询预算:状态预测器给世界与自我分配 256 个可学习查询中的 192 个与 64 个。论文的理由很直接——强制等分等于预设两路承载的信息量相当,但世界要跨长历史积累场景结构,自我只管当前一步的指令动态,容量需求本就不同,因此把比例当成超参数。

角色条件注意力(RCA):世界查询可以注意全部视觉历史、既往指令以及彼此,但被屏蔽当前指令与自我查询 token,让世界状态锚定在历史积累的场景规律上;自我查询只看彼此、当前指令与最近若干轮,远端历史与世界查询 token 被遮掉,让自我状态锚定在当前局部上下文的指令条件化动力学上。两组条件来源不相交,避免共享骨干导致两路状态坍缩成同一个表示。

CP-MoE 生成器:把预训练视频 DiT 骨干重排为级联并行混合专家结构。前置专家用 24 个 DiT 块,在噪声潜变量上做自注意力,随后并行接两路交叉注意力,同时关注文本指令、世界状态与自我状态,两路输出相加后进 FFN——同时看到两路状态,正是它能产出代理信号的前提。角色专家各 6 个块,块拓扑与前置专家一致,但严格只在一路状态条件下工作,文本条件保持不变。与标准稀疏 MoE 不同,三个专家始终全部激活,专业化来自预定义的职责分配,而不是学出来的路由函数。

语义头与双重损失:语义头是一个轻量 DPT 头,把前置专家的多层中间特征与自我状态融合,输出视频 patch 级的世界-自我掩码。这里多读几层特征而不是只看末端输出,是为了在细粒度空间上画出准确边界。掩码同时充当路由与反路由信号:世界 token 派给世界专家,自我 token 派给自我专家;为避免边界接缝,每个专家的活跃 token 集会扩展到已分配区域的空间邻居。训练目标是流匹配损失加上掩码损失,$\mathcal{L}=\mathcal{L}{\text{flow}}+\lambda\mathcal{L}{\text{mask}}$,其中掩码损失是类别平衡的二元交叉熵与 Dice 项之和,权重 $\lambda$ 取 0.3 并在训练中退火到初始值的 20%。

实验设计与结果

HTEWorld 基准

为了评测长时程混合任务,论文在 BEHAVIOR-1K 之上构建了 HTEWorld。训练集提供 125K 段视频片段、450 万帧以上,评测集是 300 条多轮轨迹、2000 条以上指令。任务形态是导航与操作交替出现的长时程序列,典型例子是"走到冰箱前 → 打开冰箱门 → 拿起披萨 → 放进冰箱 → 关上门"。

标注有三种。语义世界-自我掩码直接来自仿真器的实例分割;光流标注用 RAFT 估计稠密光流后,再用 RANSAC 拟合单应矩阵分解出相机流,残差即物体流;语言标注用 Gemini 生成,关键在于动态提示构造——把机器人接地描述、整条轨迹的动作标签序列、当前片段在动作内的时序位置,以及严格的输出规则一起编进提示,既给足长时程上下文,又要求模型只描述当前片段可见的物理运动。论文还做了一道意图清洗:动作标签里偶尔混入截断产生的辅音串,生成前会被剥离。

评测协议与主结果

主指标是 WorldArena 的 16 项归一化指标合成的 EWMScore,论文另外引入 6 项 HTEWorld 专属指标:RCBD(片段边界动态)、LPSA(后期前缀状态对齐)、CISR(指令步检索)测多轮连续生成;PMPA(相位匹配运动剖面)、CPDM(跨相位判别间距)、FPHS(前沿相位跳变一致性)测导航与操作的统一。所有模型都在同一训练集上全参微调 4 个 epoch,用 16 张 A100 80GB、学习率 1e-5、EMA 0.99;评测统一生成 37 帧、480×480、16 FPS、35 步扩散。

方法EWMScore动态程度 DD背景一致 BC交互质量 Inter
WoW-7B53.4422.7666.8680.90
Cosmos-Predict 2.5-2B54.8324.6271.5483.02
Cosmos-Predict 2.5-14B55.4129.3773.8584.70
PAN-style Baseline58.4038.1480.2486.33
WEM(6B)61.4841.5287.9290.80

6 项 HTEWorld 专属指标上 WEM 同样全胜:

指标WoW-7BCosmos-14BPAN-styleWEM
RCBD 片段边界动态0.230.260.270.31
LPSA 后期对齐0.830.830.860.87
CISR 指令步检索0.490.510.490.57
PMPA 相位运动0.450.480.500.54
CPDM 跨相位间距0.470.490.460.52
FPHS 相位跳变0.850.850.880.89

设计研究与组件消融

两组设计研究回答"边界画在哪"和"在哪一层解耦"。

研究变体EWMScore
边界视角意图视角58.69
边界视角运动视角59.36
边界视角语义视角61.48
解耦层级无解耦58.40
解耦层级前解耦58.85
解耦层级后解耦(无语义代理 / 有语义代理)58.59 / 61.09
解耦层级全解耦(WEM)61.48

组件消融进一步确认每一条结构约束都在起负载作用:去掉非对称查询预算(改成 128 比 128)降到 60.50,把 RCA 掩码放宽让两组查询互相可见降到 60.64,去掉邻居扩展路由(改成严格掩码路由)降到 59.57,完整模型是 61.48。下降幅度最大的是路由那一项。

结果对比总结

关键发现

  1. 边界视角的排序是"语义 > 运动 > 意图":语义视角 61.48,运动视角 59.36,意图视角 58.69。运动视角依赖光流分解,在大视角变化与接触交互下噪声偏大;意图视角没有显式空间边界,难以诱导出有效分离。
  2. 代理信号必须在路由与反路由全程生效:后解耦去掉语义代理会从 61.09 掉到 58.59,说明只在输出端做融合远远不够;全解耦进一步把它拉回 61.48。
  3. 6B 规模打赢 7B 与 14B:WEM 的 61.48 超过 PAN-style 基线 3.08 分、超过 14B 的 Cosmos-Predict 2.5 共 6.07 分,说明在这类任务上结构比规模更关键。
  4. 三项结构约束各自独立贡献:去掉邻居扩展路由掉 1.91 分,去掉非对称查询预算掉 0.98 分,去掉 RCA 掉 0.84 分。
  5. 角色专家确实分化:自我专家的输出里场景被完全置白、只剩机械臂与被操作物;世界专家的输出里机器人被置白、只剩稳定场景;不做路由时两者重新纠缠。
  6. 混合任务优化没有牺牲常规能力:在原始 WorldArena 上 WEM 得到 58.10,与 IRASim 的 58.12 基本持平,仍落后 Ctrl-World 的 59.70。

局限性

仿真依赖:全部实验建立在 BEHAVIOR-1K 仿真上。这便于受控评测与细粒度标注,但覆盖不了真实世界的视觉多样性、传感噪声、物体差异与接触动力学,仿真到真实的迁移仍是开放问题。

边界构造依赖:默认的语义视角需要实例分割标注,没有标注的数据集要多一步预处理。运动视角虽然不用语义标签,但同样依赖光流预处理,而且在大视角变化或接触丰富的交互下不够鲁棒。意图视角去掉了显式空间标注,但在实验里提供的分离更弱。作者把弱监督或自监督的边界估计列为关键后续方向。

残差长时程退化:片段级的自回归仍会累积误差,生成时程很长时,早期错误会传播到后续预测,远端片段之间的一致性比片段内的局域连贯更难过关。作者明确指出,解耦本身并不足以完全解决长时程生成。

状态表示与设计空间未穷尽:用通用视觉语言模型做状态预测未必是最优的紧凑状态提取方式,可能引入不必要的计算;固定容量的查询分配也未必匹配不同场景与交互阶段的复杂度。三维几何、可供性、可控性、因果交互、任务进度等边界定义都还没有探索。

常见问题(FAQ)

WEM 与已有视频世界模型的主要区别是什么?

多数视频世界模型把场景演化、机器人运动、任务意图与接触动力学耦合在单一生成流里,WEM 则把未来演化显式拆成世界与自我两条预测职责,并让架构中的状态提取、token 路由与专家计算三处都体现这一分离。论文的对照实验显示,只在输出端融合是不够的。

为什么语义视角比运动视角和意图视角效果更好?

语义视角直接按场景实体的具身角色划分,把交互区域与持续场景区域分开,同时允许两者在自运动下一起移动。运动视角依赖光流分解,而把相机流与物体流分开在大视角变化与接触交互下噪声较大;意图视角没有显式空间边界,实践中难以诱导出有效的分离。

世界-自我分离真的必要吗,还是只是换个说法?

论文用受控设计研究回答这个问题:无解耦的 EWMScore 是 58.40,前解耦 58.85,后解耦配合语义代理 61.09,全解耦 61.48。也就是说分离的必要性不只是概念主张,而是被逐档测量出来的结果。

HTEWorld 相比已有基准新增了什么?

已有视频世界模型基准多面向短时程操作或单提示生成,缺少长时程混合导航-操作的检验。HTEWorld 提供 125K 训练片段(450 万帧以上)与 300 条多轮评测轨迹(2000 条以上指令),并引入 6 项专属指标,分别刻画多轮连续生成与导航-操作统一两类能力。

CP-MoE 与常见的稀疏混合专家有什么不同?

标准稀疏 MoE 依赖可学习的路由函数在专家之间做选择,CP-MoE 中前置专家、世界专家与自我专家始终全部激活,专业化来自预定义的职责分配与语义代理给出的路由信号,因此不需要额外的负载均衡机制。

这套方法能直接迁移到真实机器人数据吗?

目前还不确定。论文的全部结论都来自仿真环境,作者把在真实机器人轨迹与真实视频上评估列为首要的后续工作,因为真实场景中的感知误差、执行误差与更复杂的物理交互会对世界-自我分解提出更高要求。

参考链接

  1. 论文 arXiv 摘要页——World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks
  2. 项目主页——包含框架图、结果表与定性视频
  3. 代码仓库
  4. HTEWorld 数据集
  5. Cosmos World Foundation Model Platform for Physical AI——对比基线所属的世界基础模型平台
  6. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning——在表征空间做分解的代表工作

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐