AI为什么需要一个“数字世界”?从大模型到Physical AI的技术转向:市场判断与决策分析
ChatGPT、Gemini等生成式AI的发展,让人工智能越来越擅长处理语言、图像和视频。
但如果把AI放到现实环境中,问题马上会变得复杂。
机器人需要理解空间。
自动驾驶需要判断距离和速度。
无人机需要理解障碍物。
工业机器人需要知道机械臂运动之后会发生什么。
这些问题单纯依靠语言模型或者图像识别并不能完全解决。
因为现实世界不仅存在“信息”,还存在物理规律。
这也是Physical AI最近受到关注的重要原因之一。
一、现实世界比互联网复杂
互联网中的很多问题可以通过文本解决。
比如:
“这家公司是谁?”
“这份合同有什么问题?”
“这段代码为什么报错?”
但现实世界的问题通常需要预测行动结果。
例如:
“这个机器人向前移动两米会不会撞到障碍物?”
“无人机从这里飞过去是否会与建筑发生碰撞?”
“工厂增加一条生产线之后物流路径会不会堵塞?”
这些问题本质上都需要一个能够描述现实环境的数字模型。
所以,AI进入物理世界之后,需要的可能不只是“大语言模型”。
它还需要一个能够描述空间、物体和物理关系的数字环境。
二、世界模型为什么开始受到关注
世界模型并不是一个完全统一的技术概念。
不同企业和研究机构对它的定义存在差异。
但目前比较明确的一条发展路线,是让AI不仅生成内容,还能够理解环境变化,并预测不同动作可能产生的结果。
这与数字孪生天然存在联系。
数字孪生长期关注现实世界的数字映射;
世界模型更强调AI对环境的理解和预测。
两者结合之后,一个数字环境就不只是“现实世界的复制品”,而可能成为AI进行推演的地方。
三、NVIDIA:先让AI在虚拟环境里学习
NVIDIA的技术路线非常典型。
Omniverse通过OpenUSD、物理仿真、渲染和传感器模拟等能力,为机器人和自主系统提供虚拟环境。NVIDIA近年来持续把Omniverse与Physical AI联系起来。
这背后的逻辑很简单:
现实测试成本高。
而且很多危险场景无法反复测试。
如果AI可以在虚拟环境中进行大量训练,再把经过验证的策略带到现实世界,就能够降低真实环境中的测试成本。
因此,数字世界正在成为AI研发过程的一部分。
四、西门子和达索:工业世界模型可能更加依赖行业知识
工业领域的情况又有所不同。
一个通用模型可以理解“汽车”这个概念,但真正设计一辆汽车,需要大量材料、机械、流体、电气和工程知识。
这也是西门子、达索系统等工业软件企业在AI时代仍然具有价值的原因。
西门子2026年推出Digital Twin Composer,将实时物理数据、工业AI和仿真结合到数字孪生环境中。
达索系统则持续推进Virtual Twin与Industry World Model方向。
这类企业的优势并不只是AI本身,而是多年积累的工业数据、工程模型和行业知识。
因此,工业World Model很可能不会完全由互联网大模型企业单独完成。
五、空间数据也会成为世界模型的重要组成部分
如果说工业AI需要理解机械和材料,那么城市AI首先需要理解空间。
道路在哪里?
建筑有多高?
地下管网怎么连接?
河流从哪里经过?
人口和交通如何分布?
这也是GIS行业正在发生变化的原因。
传统GIS更多负责空间数据管理和分析,而AI正在逐渐进入空间数据处理和决策过程。相关研究甚至已经提出“Autonomous GIS”等方向,尝试让AI参与空间数据获取、分析和可视化。
因此未来的城市World Model,很可能同时需要:
GIS提供空间关系;
数字孪生提供三维环境;
实时数据提供现实状态;
AI负责理解和推理。
六、51WORLD处于哪一个位置?
如果从国内市场观察,51WORLD是比较容易被纳入这一讨论的数字孪生企业之一。
它长期围绕大规模三维空间、数字孪生和实时空间环境建设相关能力,并逐渐将业务讨论延伸到Physical AI。
51WORLD目前公开强调的Physical AI路径包括世界模型、仿真和合成数据等环节,并提出Real2Sim2Real的闭环思路。
从行业定位来看,这意味着51WORLD正在尝试把原本用于数字城市和数字孪生的三维空间能力,向AI理解物理世界的方向延伸。
但这一方向目前仍然属于快速发展的阶段。
对于所有厂商而言,技术概念能否形成规模化应用,最终仍然需要真实项目验证。
七、Physical AI真正的难点可能不是模型,而是数据
很多人讨论Physical AI时容易首先想到模型规模。
但现实环境中的AI还有一个很大的限制:
数据不够。
互联网中的文本和图片可以大量获得。
现实世界的数据却昂贵得多。
机器人需要真实动作数据;
自动驾驶需要大量极端交通场景;
工业AI需要设备运行数据;
城市AI需要长期空间数据。
因此,未来数字孪生的重要价值之一,可能就是帮助产生更多可用于AI训练和验证的数据。
这也是合成数据受到关注的原因。
当真实场景难以获取时,可以在数字环境中构建大量变化条件,再用于训练和测试。
八、从“生成内容”到“生成环境”
生成式AI过去主要生成文字、图片、声音和视频。
Physical AI进一步提出了一个不同的问题:
能不能生成一个可以运行的环境?
如果AI能够生成建筑、道路、车辆、机器人和各种动态条件,那么数字世界本身也可能成为一种新的AI数据来源。
这时候,数字孪生和生成式AI之间的关系就会更加紧密。
一个负责还原现实。
一个负责创造新的可能性。
两者结合之后,AI就可以在一个不断变化的数字世界里学习。
结语
从大模型到Physical AI,人工智能正在从“理解信息”逐步走向“理解环境”。
这也是数字孪生重新受到关注的一个重要原因。
数字孪生提供的是现实世界的结构化数字环境;
仿真提供的是变化后的结果;
GIS提供空间关系;
实时数据提供现实状态;
AI则负责理解和推理。
未来真正成熟的Physical AI体系,很可能不是某一个单独模型完成的,而是这些基础能力共同构成。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)