26年9月来自上海AI实验室的论文“InternW0: A Foundational Physical World Model for Efficient Real-World Interactions”。
请添加图片描述

它最有价值的地方,是把视频预测、实时控制、异构数据预训练和接触反馈整合成可执行的机器人系统;但其“通用物理世界模型”定位,仍超出了当前实验充分验证的范围。


一、论文要解决什么问题?

机器人既需要预测未来,也需要及时响应现实变化。两者存在计算上的矛盾:
视频世界模型能够提供较长时间范围的预测,但生成开销大。
动作控制必须快速更新,尤其是在插入、抓握、移液等接触操作中。
如果反复等待视频生成,控制就会迟缓;如果一直执行旧预测,环境变化又会使预测失效。

InternW0 的思路是:低频生成未来预测,高频根据最新观测调整动作,并持续修正动作模型所读取的预测信息。

它还试图回答另外两个问题:如何共同利用不同机器人的动作数据与无动作标注的人类视频,以及如何将力觉、触觉引入接触操作。

如图1 所示世界模型InternW序列的框架:
请添加图片描述

二、模型框架如何工作?

如图2 所示InternW0的框架:
请添加图片描述

可以将系统理解为两条协同运行的路径:

当前图像+语言指令 → 视频专家 → 未来视频的内部表示与缓存
最新图像+机器人状态+可选接触历史 → 修正缓存的读取方式 → 动作专家 → 下一段动作

  1. 视频专家:提供较长时间范围的预测背景

视频通过冻结的 Wan VAE 编码,Video-DiT 学习未来视觉变化,并提供每一层的注意力键值缓存,即 K/V。

一个关键设计是:视频专家不接收机器人专属动作 token 或域身份。这样有利于跨机器人共享视觉预测能力,也方便利用没有动作标注的人类视频;但它同时限制了该分支对“不同候选动作会造成什么后果”的直接建模。

  1. 动作专家:根据最新反馈生成短动作片段

轻量 Action-DiT 接收最新视觉特征、本体状态、语言和机器人专属接口信息,输出连续动作。

论文的训练样本包含 64 个动作步,划分为四个 16 步片段。每个片段以其起点的图像和机器人状态为条件,因此可以在执行过程中引入新反馈。

  1. 核心连接:观测条件化的 K/V 编辑器

最新图像由冻结的 DINOv3 编码,生成查询,从缓存的视频预测中提取相关信息,再生成残差修正:
请添加图片描述

直观上,如果预测中的物体位置与现实出现偏差,动作专家可以读取一个经当前观测调整的预测上下文。

需要准确理解:这里修改的是动作专家使用的预测特征,并没有重新生成或显式纠正整段未来视频。原始缓存保持不变,每个动作片段重新构造自己的修正版;后台生成新预测后,再替换旧缓存。

  1. 联合训练:让预测表示服务于控制

视频和动作都采用连续流匹配训练:
人类第一视角视频:提供视频预测监督。
机器人轨迹:同时提供视频和动作监督。
动作损失经 K/V 编辑器反向传播到视频专家,使视觉表示不仅服务于画面预测,也服务于动作生成。

训练时另有共享参数的条件视频流,按一定概率使用干净或加噪的真实视频;推理时改用生成视频。这一安排提高了条件多样性,但仍存在训练与部署条件之间的差异。

  1. 跨机器人与接触反馈

跨机器人预训练采用统一的 37 维状态/动作接口,配合域专属投影、可学习软提示和有效性掩码。预训练覆盖约 7,233.5 小时、81.2 万条 episode、25 个训练域,其中 EgoLab 提供约 275 小时实验室第一视角视频。

如图 3所示EgoLab数据集:
请添加图片描述

接触任务则在后训练阶段加入力/触觉历史,并联合预测:

[{动作}, {力/力矩}, {触觉表示}]

动作通道用于执行,接触通道表示预期反馈。论文没有充分展示这些预测反馈如何进一步用于显式约束或优化控制。

三、实验结果说明了什么?

如图 5真实世界的5个任务:
请添加图片描述

请添加图片描述

有三处尤其值得关注。

第一,长流程仍然不够可靠。表 6 中,MOF 最后一步成功率为 26.7%;表 7 中,移液最后一步为 46.7%。按照文中顺序执行的评估方式,这些末步指标更接近整条流程完成情况。它们与平均进度率有很大差距。

第二,泛化提升需要分开看。Clean2Random 的平均成绩相对 GigaBrain-0.7 高约 8.3 个百分点,但主要来自 Clean 场景;在真正引入未见随机化的场景中,两者几乎持平。不能将“平均领先”直接解释为“域外泛化显著领先”。

第三,EgoLab 消融有积极信号,但控制不够充分。在受限数据实验中,加入约 50 小时 EgoLab 后,随机场景成功率从 13.73% 升至 21.97%。然而,数据从约 50 小时机器人数据增加到约 100 小时混合数据,因此尚不能区分收益来自人类视频本身、实验室语义,还是更多训练数据。

四、主要贡献是什么?

1 将预测的及时性落实到架构。

论文把低频预测与高频反馈控制连接起来,并通过缓存编辑减少预测过时的影响。这是最有实际意义的贡献。

2 形成兼容视频监督与动作监督的训练体系。

无动作标注的人类视频可以参与训练,而动作损失又能影响视频表示,使两类数据产生联系。

3 提供异构机器人数据的工程化处理方案。

统一接口、缺失通道掩码、域级采样、轨迹过滤及恢复训练等设计,对规模化训练有实际价值。

4 将验证推进到实验室接触任务。

灵巧手移液、透明器具操作和多阶段实验流程,比单纯展示抓取更能暴露模型的实际能力与问题。

对创新性的定位应有所保留:论文明确继承 AHA-WAM 的异步执行和观测引导路由,借鉴 X-VLA 的软提示。其贡献更偏向综合系统、规模化训练与应用验证,不能把所有核心组件都视为本文首创。

五、主要问题与证据缺口

  1. “物理世界模型”的因果能力尚未充分证明。

论文概念框架讨论动作条件下的状态转移,但实际视频专家不接收候选动作。因此,它更直接实现的是“预测视觉未来并据此生成动作”,尚未充分展示:

同一状态下比较不同动作后果;
对外部干预进行反事实预测;
利用预测结果搜索和选择最优动作。

这不否定其作为世界—动作模型的价值,但限制了更强的因果与规划主张。

  1. 核心机制缺少充分消融。

尚缺少系统比较:关闭视频预测、关闭 K/V 编辑器、同步与异步执行、加入与移除力觉、仅输入力觉与同时预测力觉等。

因此,现有结果难以明确分解数据规模、视觉表示、预测目标、接触信号和底层控制器各自的贡献。真实实验中的 Fast-WAM 被描述为没有预训练,这也使其对比难以单独证明预测机制的优势。

  1. 科学实验验证主要停留在操作层面。

MOF 任务实际上覆盖合成中的溶液准备阶段,没有给出完整合成产物的质量验证。移液任务也未报告体积偏差、重复性或不同液体条件下的精度。

因此,当前证据更支持“机器人能更好地操作实验器具”,尚不足以证明“可靠完成科学实验并获得合格结果”。

  1. 统计与复现信息不足。

真实任务每项只有 15 次试验,完整试验成功率改变一次就相差约 6.7 个百分点。文中缺少置信区间及充分的多种子结果。

此外,当前模型参数规模、完整预训练预算、真实任务示教规模、灵巧手动作接口细节和异步部署配置等信息不够完整。第 20 页提到的约 4B、最终低于 1B,是未来目标,不能当作当前模型规模。

  1. 实时性测量尚不完整。

60.73 ms 是有价值的动作路径指标,但部署还需要知道视频刷新周期、首次启动等待、并发时资源竞争、延迟波动和传感器到执行器的总延迟。16.47 Hz 也不等于底层力控伺服频率。

另一个值得研究的细节是:论文把 50 fps 按 60 fps、25 fps 按 30 fps 的模型时间约定处理。虽然采样保持模态对齐,但真实时间尺度并不完全一致,可能影响对速度及接触动力学的学习;这需要实验验证。

六、未来下一步工作

作者提出了多模态扩展、干预理解、长时记忆、跨机器人迁移、持续学习和模型压缩等方向。可以先集中解决以下问题:
请添加图片描述

其中最值得优先开展的研究题目是:“基于预测误差与接触不确定性的事件触发重规划”。它直接延伸本文最有价值的异步架构,同时能够回答一个尚未解决的问题:什么时候修正旧预测已经足够,什么时候必须重新预测?

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐