近期,WorldArena 2.0公布最终评测结果。考拉悠然旗下悠然无界世界模型在Track 1视频质量赛道获得全球第二,并在Background Consistency和JEPA Similarity两项指标中排名第一。

相比排名本身,更值得关注的是:WorldArena究竟在评价世界模型的什么能力?

如果只是把世界模型理解成“生成未来视频的模型”,很容易忽略真正的技术难点。对于具身智能而言,模型不仅需要生成视觉上合理的未来,还需要维持空间结构、物体状态、运动轨迹以及交互过程的一致性。

换句话说,重点并不是“画得像不像”,而是预测出来的世界是否合理

世界模型为什么需要“长时推演”?

假设一个机器人正在执行桌面操作任务。

当前时刻,它看到桌子、杯子和机械臂。接下来,机械臂向杯子移动、完成抓取,再把杯子放到另一个位置。

对于世界模型来说,需要根据当前状态和动作序列,预测未来环境会如何变化。

短时间预测相对容易,但随着推演长度增加,一个典型问题会逐渐出现:误差累积

比如第一阶段杯子的位置只偏了几个像素,经过连续多步预测后,这种偏差可能不断放大,最终导致杯子漂移、机械臂轨迹异常,甚至整个场景结构发生变化。

因此,长时推演实际上考验的是模型能否持续维护一个稳定的“世界状态”。

这也是Background Consistency这类指标的意义。

Background Consistency在测什么?

Background Consistency可以理解为背景一致性。

它关注模型在连续生成过程中,是否能够稳定保持环境中的背景、纹理、布局和空间结构。

传统视频生成模型经常出现一种现象:单帧看起来没有问题,但时间一长,桌面纹理发生变化、物体位置逐渐漂移,甚至背景中的设备凭空出现或消失。

对于普通视频生成,这可能只是视觉瑕疵;但对于世界模型而言,这是一个更严重的问题。

因为如果环境状态都无法持续保持,模型就很难为机器人后续规划提供可靠预测。

此次悠然无界在这一指标上的表现,本质上反映的是其在长时间场景状态保持方面的能力。

JEPA Similarity为什么值得关注?

另一项指标JEPA Similarity,则与传统的像素级相似度有所不同。

简单来说,它并不只是判断两个画面“长得像不像”,而是更加关注高层表征是否一致,例如物体状态、场景语义以及动作引起的变化是否被保留下来。

举个例子:

机械臂把一个杯子从桌子左侧移动到右侧。

如果模型生成的视频纹理非常逼真,但杯子没有真正移动,或者机械臂与杯子的交互关系不合理,那么从视觉生成角度看可能仍然不错,但从世界模型角度看,预测已经失败。

因此,JEPA Similarity更接近于评价:

模型有没有正确理解“发生了什么变化”。

这也是为什么世界模型评测正在逐渐从纯视觉质量转向状态变化与物理一致性。

WorldArena还在考察“没见过的环境”

另一个值得注意的问题是分布外泛化。

现实中的机器人不可能只在训练数据完全覆盖的环境中工作。

进入一个新的工厂、新的房间,甚至只是设备位置发生变化,都可能构成新的数据分布。

因此,在WorldArena的相关任务中,模型需要面对此前没有见过的场景,根据初始环境和动作序列继续预测未来状态。

除此之外,还有长程连续操作、双臂协同等任务。

这些任务的共同难点在于:

模型不能简单记忆训练数据,而需要真正建立空间—动作—状态变化之间的关系。

从这些视频中可以比较直观地看到,世界模型真正要解决的问题,并不是单纯的视频生成,而是:

给定当前世界和一个动作,预测这个动作之后的世界。

从世界模型到具身智能

这也解释了为什么世界模型越来越多地与具身智能联系在一起。

机器人要完成一个任务,通常需要经历感知、理解、规划和执行。

传统感知模型解决的是“现在看到了什么”,而世界模型进一步回答:

如果执行某个动作,接下来可能发生什么?

有了这种预测能力,智能体就可以在真实执行之前比较不同动作可能产生的结果,再进行规划。

目前,悠然无界也在与Geek Mind具身大脑结合,并进入工业巡检等场景。

从技术关系来看,世界模型更偏向环境理解和未来预测,具身大脑则负责把这些预测能力进一步接入任务规划和执行过程。

这也是世界模型从视频生成走向具身智能的关键变化。

写在最后

世界模型目前仍然处于快速发展的阶段,评价体系也在持续演进。

但从WorldArena 2.0可以看到一个比较明确的趋势:

世界模型的竞争正在从“能否生成未来”,转向“能否正确预测未来”。

画面清晰度只是基础。

更重要的问题是,模型能否理解三维空间,保持长期状态一致,处理未见环境,并正确预测动作带来的变化。

对于具身智能而言,只有当这种预测足够稳定,世界模型才可能真正成为机器人规划和行动的一部分。

从这个角度看,Background Consistency、JEPA Similarity以及长程预测等指标的价值,可能比单纯的视频视觉质量更值得关注。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐