【arXiv 2026】What-If World:具身场景中通用世界模型的因果基准测试|从世界模型物理因果评测视角
摘要
本文解读 arXiv 2026 论文《What-If World: A Causal Benchmark for General World Models in Embodied Scenarios》(UCLA · 田纳西大学 · 亚马逊)。该论文提出首个对比式干预视频世界模型基准 What-If World,通过融合六原语物理干预分类学、319 组锚定真实帧的对比测试三元组与APEO 成对评测框架,回答"视频生成模型是否真的对受控输入变化敏感"。其特别之处在于把评测范式从"单条视频是否合理"转向"输入一变、输出是否按物理规律变"。实验表明最强模型 Grok Imagine 的成对均值也仅 51.7%,闭源平均 43.1% 领先开源 27.8% 达 15.3 个百分点,且单视频评测对约 13.1% 的成对物理失败完全不可见,为具身智能世界模型评测提供了可复用的诊断基础设施。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | A Causal Benchmark for General World Models in Embodied Scenarios |
| 标题(中文) | What-If World:具身场景中通用世界模型的因果基准测试 |
| 作者 | Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian |
| 机构 | UCLA · University of Tennessee · Amazon |
| 会议 | arXiv 2026 |
| arXiv | https://arxiv.org/abs/2605.27589 |
| 项目网站 | 暂未提供独立项目主页(以 arXiv 预印本为准) |
背景与动机:为什么单视频评测测不出世界模型的因果敏感度?
自动驾驶与机器人操作正在把视频生成模型当作通用世界模拟器使用:模型预测控制器用 rollout 做规划,VLA(视觉-语言-动作)策略用生成视频做训练数据。在这个使用方式下,关键能力不是"单条视频看起来像真的",而是输入改变时输出按物理规律改变——干预敏感性。
一个典型例子:给模型提示"急刹车"与"轻刹车",如果两条生成视频的刹车距离几乎相同,说明模型只学会了"刹车"的视觉模板,对真正应该塑造结果的输入毫无反应。这种失败天然是成对出现的:单看任何一条视频都无可挑剔,只有放在一起比较才能发现。然而现有评测全部逐条打分:
- 视频质量与物理基准:VBench(CVPR 2024)、EvalCrafter、VideoPhy、PhyGenBench 等,每条视频针对单一提示独立评分,"各自都合理"即可通过;
- 具身世界模型基准:DrivingGen、WorldSimBench、WorldArena 转向评测下游任务效用,但仍非成对因果;
- 视频因果理解基准:CLEVRER、NExT-QA、CRIPP-VQA 让模型观看已有视频并回答因果问题——测的是感知,不是生成端是否跟踪干预。
回看视频世界模型评测的演进(附录 H):2024 年 VBench/EvalCrafter 确立单视频质量评测,2024–2025 年 VideoPhy/PhyGenBench 把物理常识引入单视频评测,2025–2026 年 WorldSimBench/DrivingGen/WorldArena 转向具身下游效用——评测粒度从"像不像"推进到"变不变、变对不对"的转折点,正是 What-If World 在 2026 年完成的成对干预评测。这与世界模型的实际使用方式对齐:planner 与 VLA 训练消费的正是"给干预、看后果"的 rollout。
研究主线:从问题到结论

图 8(Mermaid 流程图):研究主线:单视频评测测不到干预敏感性 → 六原语分类学 → 319 组对比三元组 → APEO 框架 → 9 模型全矩阵评测 → 对比瓶颈结论
基准设计:What-If World 如何把 ceteris paribus 变成可操作协议
测什么:六原语因果分类学。 两位领域专家(自动驾驶、机械臂各一)从 1,000 条真实视频(nuScenes + DROID)中独立编码候选物理变量,再按因果机制联合合并:32 个候选经过"物理上根本、跨具身共享、操作上可隔离"三条准入准则筛选,最终得到 18 个子类、归并为 6 个物理原语——环境域 3 个(表面摩擦、材质与介质、障碍物配置),交互域 3 个(空间对齐、力与程度、时间序列)。每个原语在自动驾驶与机械臂操作中各有实例(附录 A 完整展开):
| 域 | 物理原语 | 自动驾驶实例 | 机械臂实例 |
|---|---|---|---|
| 环境 | 表面摩擦 | 干沥青 vs 结冰路面 | 光滑玻璃 vs 橡胶垫 |
| 环境 | 材质/介质 | 晴干 vs 雨雪天气 | 木块 vs 海绵 |
| 环境 | 障碍配置 | 净空 vs 锥桶障碍 | 净空 vs 路径阻挡物 |
| 交互 | 空间对齐 | 车道横向偏移(安全 vs 碰撞) | 3D 抓取对准 |
| 交互 | 力/程度 | 缓刹 vs 急刹、缓加速 vs 地板油 | 轻触 vs 重压 |
| 交互 | 时间序列 | 超越时机(加速 vs 让行) | 合爪相对下探时机 |
怎么测:对比三元组构造。 每条样本锚定一条真实视频中动作开始前一帧作为因果分支点 $x_0$——两条视频从此状态出发(状态固定),干预变量尚未显现、保留改变未来的余地(物理 affordance)。提示被分为相机视角、初始场景、智能体动作三段,只编辑动作段中目标变量的描述,得到只差一个物理变量的提示对 $(p^{+}, p^{-})$;两条提示都不写出物理后果(结果隐藏),模型必须自己从 $x_0$ 与 $v$ 推出结局。当真实帧与反向提示冲突(晴天道路配"冰面"),用 Nano Banana 只改目标环境条件。提示对由三位研究人员独立起草、交叉复核再全体一致裁定,约 37% 的初稿因动作描述与 $x_0$ 不符或措辞不明确被拒。

图 1:What-If World 基准概览:三阶段分别回答 (1) 测什么——六原语因果分类学;(2) 怎么测——锚定真实帧的对比三元组构造;(3) 怎么评——APEO 成对评测协议
分类全景:六原语如何统一自动驾驶与机械臂

图 9(Mermaid 流程图):六原语分类学:环境域(表面摩擦/材质介质/障碍配置)+ 交互域(空间对齐/力与程度/时间序列),各配自动驾驶与机械臂实例
方法细节:APEO 双模式评测协议
怎么评:APEO 四维 × 双模式。 APEO 把成对视频需要满足的条件拆成四个互补维度,每个维度对应一个具体下游消费者:
- A(Adherence,依从性):干预是否被执行——动作省略/替换、目标错位即失败;对应 VLA 策略训练对控制指令的跟随。
- P(Physics,物理):运动是否物理有效——morphing、瞬移、无源力即失败;成对模式检查轨迹是否在干预前重叠、干预后按物理规律分叉。
- E(Environment,环境):非因果背景是否保持不变——背景坍缩、物体恒常性破坏、相机幻觉即失败;成对模式专门排查"通过幻觉场景差异假装分叉"。
- O(Outcome,结果):结果是否朝预测方向发散——模式坍缩(两条一样)、因果反转(方向相反)、无差异是三类典型失败;仅成对模式。
A/P/E 三个维度都有单视频模式($A_s, P_s, E_s$,判断单条视频是否合理)与成对模式($A_p, P_p, E_p$),O 只有成对模式 $O_p$。评分由 Gemini 3.1 Pro 作为 VLM 裁判,对每个检查回答原语条件化的二分问题,裁判模板含角色设定、场景上下文、评分细则、严格记分逻辑与固定 JSON 输出,并与人类标注做过对齐验证(附录 B)。

图 2:基准构建管线:Stage 1 从 nuScenes/DROID 筛选具备物理条件片段,取动作起始前一帧为因果分支点 $x_0$;Stage 2 编写共享场景、仅改一个物理变量的对比提示对并隐藏结果;三元组 $(x_0, p^{+}, p^{-})$ 喂给视频模型产出 $(V^{+}, V^{-})$
实验设计与结果:9 个世界模型的完整因果记分卡
协议。 评测覆盖两个具身域:自动驾驶(nuScenes,11 个子类)与机械臂操作(DROID,7 个子类),共 18 个子类、319 个实例。九个模型全部零微调、共享同一 $x_0$ 与提示对:开源侧 HunyuanVideo-1.5、Cosmos-Predict2、CogVideoX、Wan2.2;闭源侧 Grok Imagine、Veo 3.1、Seedance 2.0/1.5、Kling 3.0。每条实例每模型产两条视频,共 5,742 条;开源部分在 4× RTX A6000 上约耗 1,300 GPU 小时,闭源与裁判走 kie.ai API。
主表(pAvg = APEO 成对均值,主指标;sAvg = 单视频质量均值)。
| 模型 | sAvg | pAvg | $O_p$ | 排名 |
|---|---|---|---|---|
| CogVideoX1.5-5B | 34.2 | 22.7 | 11.3 | 9 |
| Wan2.2-5B | 46.1 | 28.4 | 17.2 | 7 |
| HunyuanVideo1.5-8.3B | 51.7 | 27.0 | 10.7 | 8 |
| Cosmos-Predict2-2B | 50.8 | 32.9 | 14.7 | 5 |
| Seedance 1.5* | 52.7 | 32.4 | 26.0 | 6 |
| Kling 3.0* | 62.0 | 38.6 | 21.0 | 4 |
| Seedance 2.0* | 69.5 | 41.8 | 32.0 | 3 |
| Veo 3.1* | 68.9 | 50.9 | 44.8 | 2 |
| Grok Imagine* | 69.0 | 51.7 | 45.1 | 1 |
*闭源。开源平均 pAvg 27.8% vs 闭源 43.1%,差距 15.3 个百分点。

图 3:对比瓶颈示例(AD,Force/Degree):同一 $x_0$ 出发,$V^{+}$="轻踩油门缓慢爬行"、$V^{-}$="地板油极限起步",T=1/3/5s 采样——成对评测要计量的正是行驶距离差

图 4:对比瓶颈示例(机械臂,Force/Pressure):同一 $x_0$ 出发,"轻触保持若即若离" vs "重压留下深痕"——接触痕迹的可区分性即因果评测对象
+Hint 消融(附录 B)。 把预期结果直接写进生成提示(如"导致与前车距离增大"),APEO 平均只提升 +0.047,$O_p$ 提升 +0.069 后仍只有 52.0%——对比瓶颈主要来自模型渲染不出规定的物理转变,而不是推不出结果。即便明说"间距应增大",模型也画不对。
定性失败案例(附录 D)。 三类典型失败最能说明成对评测的价值:因果反转($V^{-}$ 应刹车使间距增大,模型反而让间距缩小,图 5);摩擦变化下的模式坍缩(模型画出雪景但刹车距离与干路相同,表面属性不产生物理效果,图 6);时序推理失败(半空先合爪再下探应抓空,两条视频都成功拾取,图 7)。

图 5:因果反转(AD,Spatial Alignment):$V^{-}$ 应刹车使与前车间距增大,模型反而让间距缩小——$V^{+}$ 单独看完全正常,只有成对评测能抓住

图 6:摩擦变化下的模式坍缩(AD,Surface Friction):$p^{-}$ 指定无摩擦冰冻面,模型画出了雪但刹车距离与干路完全相同——表面属性不影响物理结果

图 7:时序推理失败(机械臂,Temporal Sequencing):$p^{-}$ 在空中先合爪再下探应抓空,模型两条视频都成功拾取——"合爪-下探"次序被忽略
结果对比总结

图 10(Mermaid 流程图):结果对比总结:开源均值 27.8% 与闭源 43.1% 汇聚到对比瓶颈结论——最强仅 51.7%,单视频虚高 20+ pp,力/程度领先而摩擦/时序困难
关键发现
- 因果推理远未解决:最强模型 Grok Imagine pAvg 仅 51.7%、$O_p$ 45.1%,在近一半因果任务上失败;开源四模型聚在 27.8% 附近,整体落后闭源 15.3 个百分点。
- 单视频与成对产生不同排行榜:sAvg 第一的 Seedance 2.0(69.5%)跌到 pAvg 第三(41.8%,落差 27.7 pp);Cosmos-Predict2 从单视频第 7 升至成对第 5——评谁更强取决于评测范式。
- 部分失败对单视频评测不可见:314 条全部通过单视频检查的样本中,成对物理仍失败 13.1%、结果失败 8.3%——"每条都对、放一起不差分毫"的隐藏失败层。
- 模型跟随可见线索而非物理状态:$O_p$ 排序为力/程度 40.4% > 空间对齐 30.9% > 材质/介质 23.9% > 障碍配置 15.5% ≈ 时间序列 15.3% ≈ 表面摩擦 14.2%——初始帧里看不见的因果变量(摩擦、质量、时序)最难。
- 时间序列是普适难题:最好模型 $O_p$ 仅 25.6%,闭源相对开源的优势从力/程度的 23.2 pp 压缩到 5.9 pp——时序因果可能不是单纯堆数据与算力能解决的。
- Oral 信号分析(附录 C):论文命中"审计并扭转负载假设"(PC 最偏爱模式,用 13.1% 隐藏失败定量推翻单视频评测假设)、"设计混淆隔离诊断工具"(APEO 把失败定位到因果管线环节)与"重新表述为可解对象"(模糊属性落实为 319 个可判定任务)三个创新模式,执行质量扎实,属于典型的社区价值取向工作。
局限性
- 测能力不测效用:APEO 各维度虽锚定具体下游消费者(VLA 训练、模型规划器),但分数如何转化为部署性能留待未来验证。
- 失败只做现象学归类:模式坍缩、因果反转等按现象命名,不归因到具体架构或训练数据——那需要训练侧受控实验。
- 评测范围有限:两个具身域与九个模型;VLM 裁判依赖单一供应商(Gemini 3.1 Pro),虽做人类标注对齐,判官偏差仍在。
- 叙事层面(附录 F):论文措辞以数字前置的证据框架为主,新颖性立场直陈既有基准测不到对比失败、对自家贡献用"首个对比式干预基准",整体无明显 hedge 残留。
常见问题(FAQ)
What-If World 和 VideoPhy / PhyGenBench 有什么区别?
VideoPhy、PhyGenBench 评测单条生成视频的物理合理性(模型是否画出符合物理的运动),每条视频独立打分;What-If World 评测的是成对干预敏感度——给共享初始帧的两条提示只差一个物理变量,检查两条视频是否按物理预测的方向分叉。前者的"单条合理"是后者的必要条件但远非充分条件。
什么是对比瓶颈(contrastive bottleneck)?
模型能生成两条各自都合理、但几乎相同的视频——急刹与轻刹距离相同、轻触与重压痕迹一致——即对输入中的物理变量不敏感。论文发现 314 条全单视频通过的样本中有 13.1% 成对物理失败,且单视频 sAvg 比成对 pAvg 普遍虚高 20 个百分点以上。
APEO 四个维度分别查什么?
A(依从性)查干预是否被执行;P(物理)查运动是否物理有效;E(环境)查非因果背景是否保持不变(排查幻觉式分叉);O(结果)查结果是否朝预测方向发散(模式坍缩、因果反转、无差异)。A/P/E 有单视频与成对双模式,O 仅成对。
为什么时间序列原语对所有模型都最难?
时序要求模型协调多个子动作的相对时机(先合爪还是先下探、先加速还是先让行),最优模型 $O_p$ 也仅 25.6%,闭源优势压缩到 5.9 pp。论文推测这类关系推理可能超出当前"数据+算力"范式,需要显式关系推理或物理模拟层等架构创新。
把结果写进提示(+Hint)能救模型吗?
不能。附录 C.8 消融显示,明说物理结果后 APEO 平均仅 +0.047,$O_p$ 提升到 52.0% 仍不过半——瓶颈主要在渲染(画不出规定的物理转变)而非预测(推不出该发生什么)。
这个基准能直接用于 VLA 策略训练吗?
作者谨慎限定:What-If World 测的是因果能力而非下游效用。每个维度虽对应具体下游消费者(A 对应 VLA 控制跟随、P 对应模型预测控制器),但分数如何转化为部署性能、如何用成对协议做训练数据筛选,是留给未来工作的方向。
参考链接
- What-If World 论文(arXiv 2605.27589):https://arxiv.org/abs/2605.27589
- B 站视频讲解(横屏 + 竖屏双版本):https://www.bilibili.com/video/BV19mYE6ZEeZ
- VideoPhy:物理常识视频生成评测(arXiv 2406.03520):https://arxiv.org/abs/2406.03520
- DROID 机械臂数据集(arXiv 2403.12945):https://arxiv.org/abs/2403.12945
- nuScenes 自动驾驶数据集官网:https://www.nuscenes.org/
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)