世界模型:让AI在虚拟世界中先试错,再把经验迁移到真实物理世界

一个人形机器人站在厨房里,面前的灶台上放着一口热锅。它需要把锅里的菜盛到盘子里——但如果直接伸手,会被烫伤;如果先关火,菜会凉;如果用铲子,角度不对会把菜撒出来。人类在做这个动作之前,大脑里已经"预演"了无数种可能:伸手的轨迹、铲子的角度、菜的流动、锅的温度——这就是人类大脑中的"世界模型"。

AI也需要这样的能力。当前的大语言模型擅长文字推理,但当机器人需要在真实物理世界中行动时,它必须回答一个更根本的问题:"如果我做这个动作,接下来会发生什么?"这就是世界模型(World Model)要解决的核心问题——让AI学会在内部模拟物理世界,预测动作的后果,在虚拟环境中先试错,再把经验迁移到真实世界。

2026年,世界模型已经从学术概念演变为AI产业的核心战场。OpenAI的Sora 2、Google DeepMind的Genie 3、NVIDIA的Cosmos 3、Wayve的GAIA系列、蚂蚁灵波的LingBot-World——各大科技公司纷纷投入重兵,因为世界模型被认为是通向物理AI(Physical AI)和具身智能(Embodied AI)的关键基础设施。黄仁勋多次断言:"AI的下一波是机器人,而世界模型是机器人的大脑。"

本文将从世界模型的起源与核心思想出发,全面拆解其四大技术路线(视频生成、JEPA潜空间预测、3D空间智能、具身操作),对比Sora 2、Genie 3、Cosmos 3等代表性系统,分析关键技术挑战与落地应用,帮你建立对世界模型领域的完整技术认知。

一、什么是世界模型:从心理学概念到AI核心引擎

1.1 起源:Ha & Schmidhuber的开创性工作

"世界模型"这个概念最早可以追溯到认知心理学——人类大脑通过内部模型来模拟和预测外部世界。2018年,David Ha和Jürgen Schmidhuber发表了经典论文《World Models》,首次将这一概念系统性地引入强化学习领域。他们提出了一个简洁而深刻的架构:

  • VVision:变分自编码器(VAE),将高维图像压缩为低维潜空间表示;
  • MMemory:混合密度网络循环神经网络(MDN-RNN),预测潜空间的未来状态;
  • CController:一个简单的线性控制器,基于V和M的输出决定动作。

这个架构的核心洞见是:智能体不需要在真实环境中反复试错,而是可以在自己学到的世界模型"梦境"中训练,然后将策略迁移到真实环境。Ha和Schmidhuber在CarRacing赛车游戏中验证了这一思路:智能体在世界模型的梦境中训练后,在真实游戏中取得了当时的最优成绩。

1.2 现代世界模型的核心定义

2026年的世界模型已经远远超出了2018年的VAE+RNN架构,但核心思想一脉相承。现代世界模型可以定义为:一种能够从观测数据中学习物理世界的动力学规律,并在内部模拟"如果执行某个动作,世界将如何演化"AI模型。

一个完整的世界模型通常包含四个核心能力:

  1. 感知(Perception:从图像、视频、语言、音频等多模态输入中提取世界状态的抽象表示;
  1. 预测(Prediction:基于当前状态和动作,预测未来的世界状态(可以是像素级视频、抽象潜空间表示或3D几何);
  1. 行动(Action:将动作作为条件输入,实现可控的世界模拟——"如果我向左转,会看到什么";
  1. 规划(Planning:在世界模型内部进行多步推演,选择最优动作序列,实现模型预测控制(MPC)。

1.3 为什么世界模型在2026年爆发

世界模型的概念早在2018年就提出了,但直到2026年才成为产业热点,背后有三个驱动力:

驱动力

具体表现

对世界模型的影响

物理AI浪潮

人形机器人、自动驾驶、工业自动化爆发,AI需要从"数字世界"走向"物理世界"

世界模型是物理AI的核心基础设施,让机器人在虚拟环境中安全试错

真实数据稀缺

机器人操作数据采集成本极高,长尾场景难以覆盖,真实世界试错有安全风险

世界模型可以生成无限的合成训练数据,解决具身智能的数据瓶颈

生成式AI成熟

扩散模型、Transformer、视频生成技术成熟,Sora等模型证明了AI可以生成物理合理的视频

生成式AI的技术积累直接迁移到世界模型,视频生成成为世界模型的第一条技术路线

二、世界模型的核心架构:感知-预测-行动-渲染的闭环

虽然不同技术路线的世界模型在具体实现上差异很大,但它们都遵循一个通用的架构范式:感知编码动力学预测动作条件渲染解码的闭环,并通过奖励/价值函数反馈优化。

世界模型核心架构:感知编码动力学预测动作条件渲染解码,奖励函数形成闭环
 

2.1 感知/编码器(Perception / Encoder

感知模块的作用是将高维的原始观测(图像、视频、语言、音频、传感器数据)压缩为低维的潜空间表示。这是世界模型的"眼睛"——它决定了模型能"看到"什么。

不同路线的编码器差异很大:视频生成路线通常使用VAE(变分自编码器)将视频帧压缩为离散或连续的token;JEPA路线使用联合嵌入架构将图像编码为抽象特征;3D空间智能路线使用多视角编码器恢复3D几何表示。编码器的质量直接决定了后续预测的精度——如果感知阶段丢失了关键物理信息(如物体的深度、材质、碰撞属性),预测阶段就无法准确模拟物理交互。

2.2 动力学模型(Dynamics Model

动力学模型是世界模型的"大脑"——它学习物理世界的状态转移规律,预测"接下来会发生什么"。这是世界模型最核心的组件,也是技术竞争最激烈的地方。

现代世界模型的动力学模块几乎都采用Transformer架构,以自回归的方式逐帧预测未来状态。以Genie 3为例,其动力学模型是一个自回归Transformer,输入是潜动作和前序帧的token,输出是下一帧的token预测。Cosmos 3则采用Mixture-of-Transformers(MoT)架构,将推理塔(VLM)和生成塔紧密耦合在同一个模型中,实现物理理解和世界生成的统一。

动力学模型的核心挑战是长期预测的误差累积——每一步预测的微小误差,在多步推演后会被放大,导致预测的世界逐渐偏离真实物理规律。这是当前所有世界模型都面临的根本难题。

2.3 动作模型(Action Model

动作模块的作用是将智能体的动作(如机器人关节角度、车辆方向盘转角、游戏手柄输入)作为条件注入动力学模型,实现可控的世界模拟。这是世界模型区别于普通视频生成模型的关键——普通视频生成是"给定文本,生成视频",而世界模型是"给定动作,预测世界如何响应"

动作条件的注入方式有多种:Genie系列使用潜动作模型(Latent Action Model),从无标注视频中无监督地学习潜动作表示;Cosmos 3引入了专门的动作token(Action Tokens)类,将动作作为与语言、视觉、音频并列的核心模态,直接桥接物理世界的控制信号;Wayve的GAIA系列则直接使用车辆的驾驶指令(转向、加速、制动)作为条件。

2.4 渲染/解码器(Renderer / Decoder

渲染模块将动力学模型预测的潜空间状态解码为可观测的输出——可以是像素级视频帧、3D点云、语义分割图或抽象状态表示。这是世界模型的"画笔"——它决定了模型的预测以什么形式呈现。

视频生成路线的解码器通常是VAE解码器或扩散模型,将潜token还原为高质量视频帧;3D空间智能路线的解码器可以输出3D点云或神经辐射场;JEPA路线则不做像素级解码,直接在抽象空间输出预测结果。解码器的选择直接影响世界模型的应用场景——需要可视化交互的场景用视频解码器,需要机器人控制的场景用抽象状态输出更高效。

2.5 奖励/价值函数(Reward / Value Function

奖励函数形成闭环:世界模型预测的未来状态经过奖励函数评估,反馈给动力学模型和控制器,优化动作选择。在强化学习框架下,智能体可以在世界模型的"梦境"中进行模型预测控制(MPC)——通过多步推演选择累积奖励最大的动作序列,然后在真实世界中执行。这就是Ha & Schmidhuber原始论文中"在梦境中训练"的核心机制。

三、四大技术路线:从生成像素到控制世界

2026年的世界模型领域已经分化为四条边界清晰的技术路线,分别从不同角度解决"AI如何模拟物理世界"的问题。这四条路线不是互斥的,而是在不断融合——最新的系统(如Cosmos 3)已经在尝试将多条路线统一到一个架构中。

世界模型四大技术路线:视频生成、JEPA潜空间预测、3D空间智能、具身操作
 

3.1 路线一:视频生成路线——"只要看过的视频足够多,就能顿悟物理"

核心思想

这条路线的核心信仰是:物理规律隐含在海量视频数据中,只要模型足够大、数据足够多,AI就能在压缩和生成视频的过程中,隐式地"学会"万有引力、碰撞、流体动力学等物理规律。它不硬编码任何物理公式,而是让模型从数据中暴力学习。

技术上,这条路线以扩散模型(Diffusion)和Transformer为核心,将视频生成问题转化为"给定条件(文本/图像/动作),生成未来视频帧"的问题。代表系统包括OpenAI的Sora/Sora 2、Google的Veo、阿里巴巴的Wan、NVIDIA的Cosmos-Predict等。

关键技术

  • 视频tokenizerVAE:将高维视频帧压缩为低维离散或连续token,降低动力学模型的计算量。Sora使用时空patch化的DiT(Diffusion Transformer)架构,直接在压缩潜空间中操作;
  • 扩散TransformerDiT:以去噪扩散概率模型为基础,用Transformer替代U-Net作为骨干网络,实现高质量视频生成;
  • 动作条件注入:通过ControlNet、交叉注意力或动作token等方式,将动作条件注入生成过程,实现可控的世界模拟;
  • 长视频生成:通过滑动窗口、KV缓存、记忆机制等技术,生成长达数分钟的物理一致视频。

代表系统

系统

机构

发布时间

核心能力

Sora / Sora 2

OpenAI

2024.02 / 2025.09

文本到视频,1080p高质量生成,物理一致性强

Veo 2 / Veo 3

Google DeepMind

2024-2025

高质量视频生成,支持相机运动控制

Wan 2.1

阿里巴巴

2025

开源视频生成模型,支持长视频

Cosmos-Predict 2.5

NVIDIA

2025-2026

物理AI世界预测,支持机器人和自动驾驶场景

优缺点

优势:视觉质量极高,生成的视频逼真度强;不需要显式的3D几何建模,端到端学习;数据来源丰富(互联网海量视频)。

劣势:计算量极大,训练和推理成本高;像素级生成包含大量与决策无关的冗余信息;长期预测误差累积严重,物理一致性在长视频中难以保证;不直接输出可用于控制的抽象状态。

3.2 路线二:JEPA潜空间预测路线——"不重建像素,直接预测有决策价值的抽象状态"

核心思想

这条路线由Yann LeCun倡导,核心思想与视频生成路线针锋相对:重建每一个像素是浪费的——智能体不需要预测"墙上有几条纹路",只需要预测"墙在那里、不能穿过去"这种有决策价值的抽象状态。JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)在抽象表示空间中预测被遮挡或未来的部分,而不是在像素空间重建。

JEPA的核心架构包括:一个联合嵌入空间,将图像编码为抽象表示;一个预测器,在抽象空间中预测未来或被遮挡的表示;一个能量函数,衡量预测与真实表示的差异。通过这种方式,模型学会了提取对预测和决策最有用的特征,而不是浪费算力在像素级细节上。

代表系统

  • I-JEPA / V-JEPA(Meta,2023-2024):LeCun团队的原始JEPA实现,在图像和视频上验证了联合嵌入预测的有效性;
  • V-JEPA 2(Meta,2025):第二代视频JEPA,支持更长时序的抽象预测,在多个视频理解基准上取得SOTA;
  • JEPA-based世界模型:多个研究团队将JEPA表示与强化学习结合,构建高效的世界模型用于机器人控制。

优缺点

优势:计算效率高,不需要生成像素,推理速度快;学习到的表示天然适合决策和控制;对冗余信息不敏感,泛化能力强;LeCun认为这是通向AGI的更可行路径。

劣势:无法直接可视化,预测结果是抽象向量而非视频,调试和验证困难;抽象表示的质量依赖编码器设计,容易丢失关键物理细节;生态和工具链不如视频生成路线成熟;工业界落地案例相对较少。

3.3 路线三:3D空间智能路线——"3D几何空间中重建和预测世界"

核心思想

这条路线认为:物理世界本质上是3D的,2D视频投影丢失了深度和几何信息,在3D空间中直接建模才能保证物理一致性。它将3D几何(点云、体素、神经辐射场、3D Gaussian Splatting)作为世界模型的表示基础,在3D空间中进行重建、预测和交互。

3D空间智能路线的关键技术包括:多视角3D重建、神经辐射场(NeRF)、3D Gaussian Splatting、可微渲染、3D Transformer等。它的目标是生成一个可以从任意视角观察、可以在其中自由移动的3D虚拟世界。

代表系统

系统

机构

核心能力

Genie 2 / Genie 3

Google DeepMind

从单张图像生成可交互3D环境,Genie 3实现24fps@720p实时交互

Cosmos 3

NVIDIA

Omnimodal世界模型,统一3D多维度旋转位置编码(mRoPE),支持3D空间推理

LingBot-World

蚂蚁灵波

视频生成世界模型,与LingBot-Map 3D重建形成闭环

HunyuanWorld

腾讯

开源3D世界生成模型,支持交互式环境创建

优缺点

优势:3D几何一致性天然更好,多视角观察不会出现2D视频生成中的"视角不一致"问题;可以直接输出机器人和自动驾驶需要的3D信息(深度、障碍物位置、可行驶区域);支持自由视角探索和交互。

劣势:3D表示的计算和存储成本高;大规模3D场景的生成质量仍不如2D视频;需要多视角数据或3D Ground Truth监督,数据获取成本高;实时3D渲染对硬件要求高。

3.4 路线四:具身操作/世界动作路线——"从生成世界到控制世界"

核心思想

这是2026年最新兴、也最被产业界看好的路线。它的核心思想是:世界模型的终极目标不是生成好看的视频,而是控制真实物理世界中的智能体。因此,动作(Action)不应该只是一个条件输入,而应该是与感知、预测并列的核心输出——世界模型应该同时输出"世界会变成什么样"和"智能体应该做什么"。

这条路线将世界模型与VLA(Vision-Language-Action)模型深度融合,实现感知-预测-决策-执行的端到端统一。NVIDIA Cosmos 3是这条路线的旗舰——它引入了专门的动作token(Action Tokens),将动作作为与语言、视觉、音频并列的核心模态,可以同时进行物理推理、世界生成和动作预测。

代表系统

  • Cosmos 3(NVIDIA,2026):Omnimodal世界模型,Mixture-of-Transformers架构,推理塔+生成塔双塔耦合,64B/16B/4B三档(Super/Nano/Edge),支持世界-动作联合预测,可在Jetson边缘平台部署;
  • GR-2(Google DeepMind,2025):通用机器人世界模型,支持跨机器人本体的动作预测和世界模拟;
  • GAIA-1 / GAIA-2(Wayve,2023-2025):自动驾驶世界模型,以驾驶动作为条件生成未来场景,用于自动驾驶策略训练和验证;
  • RynnVLA-002(开源,2026):开源VLA世界模型,支持机器人操作任务的联合预测和控制。

优缺点

优势:直接面向物理AI和具身智能的落地需求,输出可直接用于控制;感知-决策-执行端到端统一,避免了模块化系统的误差累积;动作token的引入让世界模型可以直接学习"动作-后果"的因果关系;边缘部署版本(Cosmos3-Edge 4B)让实时机器人控制成为可能。

劣势:技术最复杂,需要同时优化感知、预测和动作三个目标;训练数据要求最高——需要带动作标注的机器人/驾驶数据,而这类数据极其稀缺;跨本体泛化困难,不同机器人的动作空间差异大;安全性和可解释性要求高,错误的动作预测可能导致真实世界的物理损害。

3.5 四条路线的融合趋势

值得注意的是,这四条路线不是孤立发展的,而是在快速融合。最新的旗舰系统已经在尝试将多条路线统一到一个架构中:

  • Cosmos 3同时融合了视频生成(Cosmos-Predict)、3D空间智能(mRoPE 3D位置编码)和具身操作(动作token),是目前融合度最高的系统;
  • Genie 3融合了视频生成和3D空间智能,从2D视频生成走向可交互3D环境;
  • JEPA路线也在探索与视频生成的结合——用JEPA的高效表示作为视频生成的条件,兼顾效率和质量。

未来的世界模型很可能是一个统一的Omnimodal架构,在同一个模型中同时支持像素级生成、抽象状态预测、3D几何重建和动作控制,根据不同的应用场景灵活切换输出形式。

四、代表性系统深度对比:Sora 2Genie 3Cosmos 3谁更强?

维度

Sora 2 (OpenAI)

Genie 3 (Google)

Cosmos 3 (NVIDIA)

GAIA-2 (Wayve)

技术路线

视频生成

视频生成+3D交互

全模态融合(生成+3D+动作)

自动驾驶世界动作

核心架构

DiT(扩散Transformer)

视频tokenizer+潜动作模型+动力学Transformer

MoT(混合Transformer),推理塔+生成塔

视频生成+驾驶动作条件

输入模态

文本/图像

单张图像+交互动作

语言+图像+视频+音频+动作

多摄像头视频+驾驶指令

输出

视频(1080p)

可交互3D环境视频(24fps@720p)

视频+3D+动作+推理

未来驾驶场景视频+策略

动作支持

有限(相机运动)

潜动作(无监督学习)

动作token(核心模态)

驾驶动作(核心条件)

开源

闭源(API)

闭源(研究预览)

开源(GitHub,64B/16B/4B)

闭源

边缘部署

不支持

不支持

支持(4B Edge版,Jetson Orin/Thor)

车载部署

目标场景

内容创作

游戏/交互环境

物理AI/机器人/自动驾驶

自动驾驶

物理一致性

强(短序列)

强(交互场景)

强(物理推理+生成统一)

强(驾驶场景)

对比结论:Sora 2在视频生成质量和内容创作场景领先;Genie 3在实时交互式3D环境生成方面独树一帜;Cosmos 3是目前架构最统一、模态最全面、唯一开源且支持边缘部署的旗舰系统,在物理AI和机器人场景最具落地性;GAIA-2在自动驾驶垂直场景深耕,是世界动作模型的代表。四条路线各有侧重,选择哪个系统取决于具体的应用场景和部署需求。

五、关键技术挑战:世界模型离"完美模拟物理世界"还有多远?

  1. 长期预测的误差累积:这是世界模型最根本的挑战。每一步预测的微小误差,在多步推演后会被指数级放大,导致预测的世界逐渐偏离真实物理规律。当前的世界模型在几秒到几十秒的短序列预测中表现良好,但在分钟级以上的长期预测中,物理一致性会显著下降。解决方向包括:引入物理约束(如能量守恒、碰撞检测)、多假设预测(而非单一确定性预测)、在线校正(用真实观测不断修正预测)。
  1. 物理一致性的保证:视频生成路线的模型经常出现"物理错误"——物体穿透、重力异常、材质不真实、多视角不一致。虽然Sora等大模型在短序列中表现出惊人的物理理解,但在复杂交互场景(如多物体碰撞、流体、柔性物体)中仍经常出错。解决方向包括:可微物理引擎集成、3D几何约束、物理一致性损失函数。
  1. 计算成本与实时性的矛盾:世界模型的训练和推理成本极高——Sora级别的模型需要数千GPU训练,推理也需要高端GPU。但机器人和自动驾驶场景要求实时推理(≥30fps),且很多场景需要在边缘设备上运行。解决方向包括:模型压缩和量化、分页KV缓存(FlashInfer)、边缘专用模型(Cosmos3-Edge 4B)、JEPA等高效表示路线。
  1. 动作条件的可控性:世界模型需要精确响应动作输入——"我转了30度方向盘,世界应该精确地变化30度对应的视角"。但当前的动作条件注入(如ControlNet、交叉注意力)在精细控制上仍不够精确,动作与世界响应之间的因果关系不够稳定。解决方向包括:专门的动作token设计、动作-世界联合训练、可微控制接口。
  1. 训练数据的稀缺性:世界模型需要海量的、带动作标注的视频数据——不仅要"看到世界",还要知道"做了什么动作导致世界变成这样"。互联网视频大多没有动作标注,而机器人和自动驾驶的动作标注数据采集成本极高。解决方向包括:无监督潜动作学习(Genie系列)、合成数据生成(用仿真引擎生成带标注数据)、跨本体数据迁移。
  1. 3D一致性与多视角泛化:2D视频生成的模型在多视角观察时经常出现不一致——同一个物体从不同角度看形状不同。3D空间智能路线虽然解决了这个问题,但3D生成的质量和效率仍不如2D。如何在保持2D生成效率的同时保证3D一致性,是当前的研究热点。

六、应用场景:世界模型正在改变哪些行业?

应用领域

核心价值

典型用例

代表玩家

人形机器人

在虚拟环境中安全试错,生成无限训练数据,sim-to-real迁移

机器人操作策略训练、长尾场景覆盖、安全验证

Agility Robotics、Figure AI、NVIDIA Cosmos

自动驾驶

生成极端场景训练数据,预测其他道路参与者行为,闭环仿真测试

自动驾驶策略训练、 corner case生成、闭环仿真验证

Wayve GAIA、Uber、Waabi、NVIDIA OmniDreams

游戏与交互

从单张图像生成可交互3D世界,玩家行为驱动世界演化

 procedurally生成游戏环境、NPC行为模拟、交互式电影

Google Genie、腾讯混元世界

内容创作

文本/图像到高质量视频,降低视频制作门槛

短视频生成、电影特效、广告制作、虚拟主播

OpenAI Sora、Google Veo、阿里Wan

医疗健康

生成手术训练视频,模拟医疗操作后果,医学教育

外科手术训练、医学影像合成、康复模拟

NVIDIA Cosmos Transfer(手术视频生成)

工业仿真

模拟生产线运行,预测设备故障,优化工艺流程

数字孪生、工厂优化、机器人调度仿真

NVIDIA Omniverse + Cosmos

七、行业趋势与未来展望

  1. "生成世界""控制世界":世界动作模型成为主流。2026年最显著的趋势是世界模型从单纯的视频生成,走向感知-预测-决策-执行的端到端统一。Cosmos 3引入动作token、GR-2支持跨本体动作预测、Wayve GAIA系列深耕自动驾驶控制——世界模型的终极价值不在于生成好看的视频,而在于让智能体在真实世界中安全、高效地行动。
  1. Omnimodal统一架构:语言+视觉+音频+动作+3D的大融合。Cosmos 3的Mixture-of-Transformers架构代表了一个重要方向:将所有模态(语言、图像、视频、音频、动作、3D几何)统一到同一个表示空间和同一个模型中,通过统一的3D mRoPE位置编码实现跨模态的时空一致性。未来的世界模型将是一个全能的Omnimodal模型,根据不同场景灵活切换输入输出模态。
  1. 开源生态爆发:从闭源API到开源可部署。NVIDIA Cosmos全面开源(64B/16B/4B三档)、腾讯混元世界开源、阿里Wan开源、RynnVLA等开源VLA世界模型涌现——世界模型正在从闭源API走向开源可部署,开发者可以在自己的硬件上运行和微调世界模型,大大加速了技术落地和生态繁荣。
  1. 边缘部署突破:世界模型走进机器人本体。Cosmos3-Edge 4B版本可以在Jetson Orin/Thor等边缘平台上运行,这意味着世界模型不再只能在云端推理,而是可以直接部署在机器人和车辆本体上,实现低延迟的实时世界模拟和控制。边缘部署是世界模型从实验室走向真实物理世界的关键一步。
  1. 物理AI成为AI产业的下一波增长引擎。黄仁勋多次断言"AI的下一波是物理AI",而世界模型是物理AI的核心基础设施。随着人形机器人、自动驾驶、工业自动化的爆发,世界模型的市场需求将呈指数级增长。2026年只是世界模型产业的起点,未来5年将是世界模型技术快速成熟和大规模落地的关键期。
  1. 世界模型与大模型的深度融合:从语言智能到物理智能。当前的大语言模型(LLM)擅长数字世界的推理,但缺乏物理世界的理解。世界模型与LLM的深度融合——让LLM在世界模型的"梦境"中进行物理推理和规划——将是通向AGI的重要路径。未来的AI系统将是"语言大脑+世界模型身体"的统一架构,既能思考,又能行动。

世界模型代表了AI从"理解数字世界"到"模拟和控制物理世界"的范式跃迁。从Ha & Schmidhuber 2018年的VAE+RNN,到2026年Sora 2、Genie 3、Cosmos 3的百花齐放,世界模型已经从学术概念演变为物理AI的核心引擎。虽然长期预测误差、物理一致性、计算成本等挑战仍待解决,但四大技术路线的快速融合、开源生态的爆发、边缘部署的突破,正在让世界模型加速走进真实世界。对于机器人、自动驾驶、游戏、医疗、工业等领域的开发者和创业者来说,现在正是拥抱世界模型技术的最佳时机——谁能率先掌握世界模型的能力,谁就能在物理AI的浪潮中占据先机。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐