世界模型太火了,在WAIC2026人工智能大会上,在具身智能展馆中,世界模型代替VLA登上了舞台。

6月,AI教母李飞飞world Lab团队发文,将世界模型分为三大类:

渲染器:以像素的形式输出观测,专供人眼欣赏,主打一个长得像;

模拟器:输出几何、物理和动力学状态,人类和程序都能拿去算、去交互,主打一个算得准;

规划器:输入观测和目标,直接告诉机器人“下一步该咋办”,主打一个能指挥。

以前这三类各干各的:渲染器是动作进去,画面出来;规划器反过来,是画面进去,动作出来。

但李飞飞预言,这三条路的边界正在消失,视频模型开始接受动作指令,三维模型开始输出碰撞网格,规划器也开始在脑子里推演未来。

在WAIC2026的物理智能论坛上,飞捷科思,这家由英伟达物理引擎奠基人张立华教授回国创立的物理AI时代Infra的公司,发布了他们的新一代物理世界模型Fysiverse。

这套东西,恰好把李飞飞的预言搬到了现实里:它既是渲染器,也是模拟器,更是规划器。

抛开晦涩的技术概念,从飞捷科思CTO杨鼎康博士的演讲中,抽丝剥茧来看清楚Fysiverse世界模型到底是怎么回事,以及对具身机器人来说,到底意味着什么?

图片

01

世界模型火爆的另一面,

不同路线仍然存在问题

飞捷科思CTO杨鼎康博士一开篇就提到,从物理AI完整闭环来看,一个智能系统要进入真实世界,不能只有感知,也不能只有大模型推理。

机器人需要从摄像头、传感器和任务指令中,识别对象、空间、材料和关系,将它们转化成可计算的世界状态;随后通过世界模型和物理引擎,预演动作可能产生的结果,再完成规划、策略选择和风险控制,最终在真机上执行,并将反馈重新送回系统。

世界模型位于这个闭环的中间,连接“看懂世界”和“在世界中行动”。

为什么世界模型如此重要?

因为真实世界不能无限试错。机器人抓取失败,可能损坏物体;工业产线上的错误动作,可能造成碰撞、停机,甚至安全事故。

因此,物理AI必须具备行动前的预演能力。给定当前状态、动作目标和物理约束,系统需要提前推演下一刻的状态、轨迹和风险。

只有形成感知、建模、推演、决策、执行、反馈的闭环,AI才能从回答问题走向承担真实任务。Fysiverse要解决的正是这一闭环中最难也最缺失的世界推演环节。

从杨博士的总结来看,不同世界模型虽然技术路线各异,但至少需要具备三个共同能力:

第一,承载世界状态和历史记忆;

第二,接受动作输入,并反馈状态变化;

第三,产生可用于训练和决策的未来结果。

换句话说,世界模型的核心并不是生成一段连续视频,而是:承载状态、接受动作、推演结果。

从技术形态上来看,现有世界模型主要有三条路线,但也各有局限。

视频世界模型擅长从像素中学习时空相关性,视觉表现力强,但是视觉生成不等于物理应用正确,可能发生穿透;隐式世界模型在浅空间中建模状态,更适合学习和决策,局限在于隐式表征难以直观验证,很难解释它是否遵循物理规律;三维世界模型恢复明确的空间结构,能够观察和慢游,但没有质量摩擦和接触关系,不等于可交互、可仿真。

对于物理AI来说,关键不是结果看起来合理,而是接触是否正确、受力是否一致、材料是否产生正确的响应,应用结果能否被复现和验证。

飞捷科思认为,下一阶段并不是简单地选择提供一条路线,而是需要把它们统一到可计算、可验证的物理状态上。

如李飞飞所言,未来统一世界模型可以根据不同需求进行三种投影,面向人类输出像素和观测,它是渲染器;面对系统输出对象、几何和物理状态,它是模拟器;面向机器人输出动作和策略,它是规划器。

三者并不是割裂的产品,而是同一世界状态在不同任务上的表达,这里模拟器是结构型骨架,因为只有掌握世界状态如何演化,模型才能够既生成可信画面,也为具身智能提供可靠的动作依据。

当生成模型开始进入模拟领域,也带来新的风险,几何看起来正确,并不代表具有正确的物理属性。因此面向物理AI的世界模型,至少要满足四个要求:

1. 显示承载对象、材料接触和约束;

2. 能够接受机器人的动作任务、目标和环境条件;

3. 下一个状态来自可计算的物理演化;

4. 整个过程应该可回放、可复现、可评估。

只有这样,世界模型输出的结果才能真正用于训练决策和安全验证,而不仅是用于展示。

02

范式拆解:Fysiverse

打破世界模型的边界

物理世界模型Fysiverse,从真实观测出发,先重建可仿真的三维世界,再利用参数和引擎来预演未来的状态,最后把物理预演转化为生成过程中的强约束,使结果同时具备视觉真实性和物理可信度,整个体系包含三个部分。

1. Real-to-Sim,负责把二维观测转换成可仿真的三维场景;

2. Sim-to-Sim,负责在物理规律下演化状态;

3. Sim-to-real阶段,负责把可验证的物理过程转译为视频和观测。

图片

(图:飞捷科思物理世界模型Fysiverse)

1

Real-to-Sim,把二维观测变成可仿真场景

Fysiverse可以接收文本、图像或全景观测。

首先由Fysiverse-3D完成对象级分割、三维重建、几何和材质生成,以及空间布局恢复。它要回答的是:这个世界里有什么,它们分别在哪里?

这里的重点,不是生成一张看起来立体的图,而是让每个对象保持独立身份。

桌子、椅子、杯子、柜子不再黏在同一张画面里,而是成为可以单独移动、替换和编辑的三维资产。

系统还会根据提示词中的前后、左右、上下、支撑和遮挡关系,将物体放到合理位置,使场景能够进入后续的物理参数补全和仿真流程。

除了文本生成,Fysiverse-3D也支持从单张RGB图像恢复三维场景。

图片

(图:从全景图重建3D世界)

即使是一张随手拍摄的办公室、客厅照片,甚至卡通风格图像,系统也可以尝试拆解出独立对象,并恢复成可编辑的三维布局。

单张图片天然存在遮挡和尺度不确定性,因此这里的目标并不是一步到位地还原绝对真实,而是以更低的输入成本,构建一个可继续修正、可进入仿真的场景基础。

与英伟达以视频为主要输入的SimFoundry相比,Fysiverse-3D强调从单张图像出发,降低场景数据采集门槛。同时,其相关管线已经开源,并兼容现有生态,希望将Real-to-Sim从一项展示能力变成研究者可以直接使用和验证的基础工具。

2

Sim to Sim,给三维世界补上物理含义

创建了几何世界之后,还需要理解其中的物理含义,要知道物体的密度、摩擦、硬度、弹性和形变趋势。OmniFysics是全模态物理理解构建的基础模型,承担的就是这部分工作。

这个概念比英伟达的cosmos要早了至少半年。在多个国际公开的物理AI感知评测基础上,当前的3B版本在综合指标上领先同尺寸模型,并在大部分指标上超过了更大size的模型。

OmniFysics将分散在图像、文本、音频和物理任务中的知识,转化成可以被仿真系统记录和调用的物理参数与约束。

图片

(图:具备物理属性的世界生成)

随后,Fysics物理引擎负责进行动力学、碰撞和约束求解。这一步回答的是:这个世界按照什么物理规律运行?

3

Sim-to-Real,把推演后的状态转成视频景

有了几何、材料和约束,系统便可以推演未来。真实世界不只有刚体,同一个物体还必须处理软体、流体等不同的物质形态。

Fysiverse-Video将材料类型与物理参数真正放进状态演化链路,在同样的受力条件下,因为硬度、密度和摩擦的不同,会产生完全不同的形态、流动、堆积,甚至是碰撞过程。

多材质不是替换视觉纹理,而是真正改变物体在物理运动过程中的演化规律,使最终的视频继承了一个可检查、可验证的物理过程。

Fysiverse-Video另一个关键能力是可控,同一个初始场景、方向、初速度和弹性参数不同,未来的结果就应当不同。

图片

(图:多参数可控)

直接把这些参数作为推演条件,无论是向左、向右还是向后,速度从低到高,弹性从弱到强,系统都会产生对应的轨迹碰撞和回弹结果,可控性非常重要。

因为机器人训练和工程评测需要系统性地改变条件,构造可比较的实验,而不是依赖一次不可重复的随机生成。

因此,Fysiverse的核心区别并不是把下一帧生成得更漂亮,而是:先计算下一时刻的世界状态,再将其转换成画面。

03

物理世界模型Fysiverse,对具身机器人落地意味着什么?

将Fysiverse放到具身操作中,其价值就更加直接。它可以在不同机器人本体、不同场景和不同任务下进行大规模状态推演。

图片

(图:Fysiverse对具身落地的价值)

重点不是生成某一个固定机械臂的演示,而是建立统一接口,将机器人动作、对象状态和场景约束送入同一套世界推演链路。

这样一来,系统可以批量产生:成功操作、失败操作、危险操作,以及现实中难以采集的长尾交互数据。这些数据可以用于策略训练和风险评估。

对于机器人来说,真正有价值的结果,不是视频看起来像机器人在工作,而是机器人动作和对象状态之间存在可靠的因果关系。

例如在刚体案例中,一排柜子依次倒下,系统需要正确处理碰撞顺序、接触传播、动量传递和物体不穿透。

图片

(图:推演减少99%物理幻觉)

在流体案例中,水团在重力作用下坠落、破碎和飞溅,水的体积、方向和表面变化需要保持前后连续,而不是每一帧各自生成。

在软体案例中,泰迪熊弹起后落下,系统不仅要保持整体轨迹,还要处理局部形变、弹性恢复和能量耗散。

这些案例想证明的是刚体、流体和软体都能够在同一套物理状态框架中被推演。

Fysiverse的最终价值,在于将真实世界转化成可复用的物理AI资产。

第一类是可仿真的场景资产,包括对象级三维模型、材料参数、空间布局和接触关系。

第二类是受到动作和物理参数约束的状态与视频序列,可以为机器人提供成功、失败和长尾交互数据。

第三类是可重复的闭环评测任务。通过统一初始状态、动作脚本和物理条件,不同机器人和策略模型可以在更接近的条件下训练和测试。

图片

(图:现实操作VS仿真训练)

对于机器人企业来说,这至少可能带来三方面的价值。

首先,降低真实世界试错成本。机器人可以先在仿真环境中碰撞、滑落和失败,再把筛选后的策略放到真机执行,减少设备损耗和安全风险。

其次,补足长尾数据。现实数据采集往往集中在成功演示,而碰撞、卡住、形变和失败动作成本更高,也更危险。世界模型可以系统地改变条件,批量构造这些稀缺样本。

最后,推动机器人评测走向可复现。今天很多机器人Demo的场景、物体和成功标准并不统一,很难直接比较。可重复的世界模型任务,有机会为机器人训练、策略验证、数字孪生和安全测试提供统一底座。

图片

结语:

下一代世界模型的竞争,正在从画面质量走向世界状态与因果推演能力。

飞捷科思的Fysiverse所代表的全新范式,是让生成模型继续发挥视觉理解和表达优势,同时通过显式物理模拟,补足其在接触、受力、材料和因果建模上的短板。

它不是简单地在渲染器、模拟器和规划器之间选择一条路线,而是试图以模拟器为骨架,将三者重新接起来。

正如杨鼎康博士在结尾所说:让世界模型从“看起来像真实世界”,走向“能够服务真实世界”。

图片

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐