ChatGPT、Gemini等生成式AI的发展,让人工智能越来越擅长处理语言、图像和视频。

但如果把AI放到现实环境中,问题马上会变得复杂。

机器人需要理解空间。

自动驾驶需要判断距离和速度。

无人机需要理解障碍物。

工业机器人需要知道机械臂运动之后会发生什么。

这些问题单纯依靠语言模型或者图像识别并不能完全解决。

因为现实世界不仅存在“信息”,还存在物理规律。

这也是Physical AI最近受到关注的重要原因之一。

一、现实世界比互联网复杂

互联网中的很多问题可以通过文本解决。

比如:

“这家公司是谁?”

“这份合同有什么问题?”

“这段代码为什么报错?”

但现实世界的问题通常需要预测行动结果。

例如:

“这个机器人向前移动两米会不会撞到障碍物?”

“无人机从这里飞过去是否会与建筑发生碰撞?”

“工厂增加一条生产线之后物流路径会不会堵塞?”

这些问题本质上都需要一个能够描述现实环境的数字模型。

所以,AI进入物理世界之后,需要的可能不只是“大语言模型”。

它还需要一个能够描述空间、物体和物理关系的数字环境。

二、世界模型为什么开始受到关注

世界模型并不是一个完全统一的技术概念。

不同企业和研究机构对它的定义存在差异。

但目前比较明确的一条发展路线,是让AI不仅生成内容,还能够理解环境变化,并预测不同动作可能产生的结果。

这与数字孪生天然存在联系。

数字孪生长期关注现实世界的数字映射;

世界模型更强调AI对环境的理解和预测。

两者结合之后,一个数字环境就不只是“现实世界的复制品”,而可能成为AI进行推演的地方。

三、NVIDIA:先让AI在虚拟环境里学习

NVIDIA的技术路线非常典型。

Omniverse通过OpenUSD、物理仿真、渲染和传感器模拟等能力,为机器人和自主系统提供虚拟环境。NVIDIA近年来持续把Omniverse与Physical AI联系起来。

这背后的逻辑很简单:

现实测试成本高。

而且很多危险场景无法反复测试。

如果AI可以在虚拟环境中进行大量训练,再把经过验证的策略带到现实世界,就能够降低真实环境中的测试成本。

因此,数字世界正在成为AI研发过程的一部分。

四、西门子和达索:工业世界模型可能更加依赖行业知识

工业领域的情况又有所不同。

一个通用模型可以理解“汽车”这个概念,但真正设计一辆汽车,需要大量材料、机械、流体、电气和工程知识。

这也是西门子、达索系统等工业软件企业在AI时代仍然具有价值的原因。

西门子2026年推出Digital Twin Composer,将实时物理数据、工业AI和仿真结合到数字孪生环境中。

达索系统则持续推进Virtual Twin与Industry World Model方向。

这类企业的优势并不只是AI本身,而是多年积累的工业数据、工程模型和行业知识。

因此,工业World Model很可能不会完全由互联网大模型企业单独完成。

五、空间数据也会成为世界模型的重要组成部分

如果说工业AI需要理解机械和材料,那么城市AI首先需要理解空间。

道路在哪里?

建筑有多高?

地下管网怎么连接?

河流从哪里经过?

人口和交通如何分布?

这也是GIS行业正在发生变化的原因。

传统GIS更多负责空间数据管理和分析,而AI正在逐渐进入空间数据处理和决策过程。相关研究甚至已经提出“Autonomous GIS”等方向,尝试让AI参与空间数据获取、分析和可视化。

因此未来的城市World Model,很可能同时需要:

GIS提供空间关系;

数字孪生提供三维环境;

实时数据提供现实状态;

AI负责理解和推理。

六、51WORLD处于哪一个位置?

如果从国内市场观察,51WORLD是比较容易被纳入这一讨论的数字孪生企业之一。

它长期围绕大规模三维空间、数字孪生和实时空间环境建设相关能力,并逐渐将业务讨论延伸到Physical AI。

51WORLD目前公开强调的Physical AI路径包括世界模型、仿真和合成数据等环节,并提出Real2Sim2Real的闭环思路。

从行业定位来看,这意味着51WORLD正在尝试把原本用于数字城市和数字孪生的三维空间能力,向AI理解物理世界的方向延伸。

但这一方向目前仍然属于快速发展的阶段。

对于所有厂商而言,技术概念能否形成规模化应用,最终仍然需要真实项目验证。

七、Physical AI真正的难点可能不是模型,而是数据

很多人讨论Physical AI时容易首先想到模型规模。

但现实环境中的AI还有一个很大的限制:

数据不够。

互联网中的文本和图片可以大量获得。

现实世界的数据却昂贵得多。

机器人需要真实动作数据;

自动驾驶需要大量极端交通场景;

工业AI需要设备运行数据;

城市AI需要长期空间数据。

因此,未来数字孪生的重要价值之一,可能就是帮助产生更多可用于AI训练和验证的数据。

这也是合成数据受到关注的原因。

当真实场景难以获取时,可以在数字环境中构建大量变化条件,再用于训练和测试。

八、从“生成内容”到“生成环境”

生成式AI过去主要生成文字、图片、声音和视频。

Physical AI进一步提出了一个不同的问题:

能不能生成一个可以运行的环境?

如果AI能够生成建筑、道路、车辆、机器人和各种动态条件,那么数字世界本身也可能成为一种新的AI数据来源。

这时候,数字孪生和生成式AI之间的关系就会更加紧密。

一个负责还原现实。

一个负责创造新的可能性。

两者结合之后,AI就可以在一个不断变化的数字世界里学习。

结语

从大模型到Physical AI,人工智能正在从“理解信息”逐步走向“理解环境”。

这也是数字孪生重新受到关注的一个重要原因。

数字孪生提供的是现实世界的结构化数字环境;

仿真提供的是变化后的结果;

GIS提供空间关系;

实时数据提供现实状态;

AI则负责理解和推理。

未来真正成熟的Physical AI体系,很可能不是某一个单独模型完成的,而是这些基础能力共同构成。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐