判断一段 AI 生成的内容,到底是一段"视频",还是一个"世界",有个特别简单的办法:

转身。

沿着街道往前走,拐过一个路口,再回到原地——刚才那栋楼还在吗?

推开桌上的杯子,它会朝着真实的方向倒下吗?

镜头从第一人称切到第三人称,人物、空间、光影还保持一致吗?

这几个动作,对今天所有的 AI 视频模型来说,都太难了。

过去两年,AI 视频一直在卷画质、卷时长、卷运镜。但无论画面多逼真,只要你看一眼就结束、不能走进去、也记不住刚才发生过什么,它本质上仍然只是一段被提前生成好的内容 网易科技

8月17日,有一家公司把这个分界线往前推了一步。

智象未来(HiDream.ai)发布了 HiDream-O1-World——一个你能走进去、能操控、能持续交互的 AI 世界 环球网

一、从"生成画面"到"生成世界",差在哪?

先别被"世界模型"这四个字唬住。它和视频生成模型,底层逻辑完全不是一回事。

视频生成关心的是:下一帧像不像。

世界模型关心的是:下一步对不对。

打个比方,Sora 能生成"一辆汽车飞过十字路口"的画面,像素精美、运镜讲究。但从物理角度看,一辆车不会不减速、不碰撞就这么飞过去 甲子光年

世界模型则必须理解场景里每个物体的空间位置、物理属性和因果逻辑——苹果会落地,车会打滑,碰撞必须守恒。

这也是为什么 OpenAI 的 Sora 最终被关停。它是个顶级的"画面生成器",但从没真正理解过世界。

HiDream-O1-World 想做的是后者。它支持文本、图片、交互式操控三种输入,提供漫游、编辑、交互三大能力 腾讯新闻

  • 漫游:第一人称、第三人称随便切,驱动角色行走、转头、环顾。潜水场景里镜头拉近,珊瑚的纹理细节清晰可见,水面光影跟着视角实时变幻,全程稳定不漂移。
  • 编辑:一句话让角色抓取、奔跑、下蹲、跳跃,或者触发降雨、物体坠落。这不是局部修图,而是几何、光照、材质、物理逻辑的全局统一响应。
  • 交互:输入"出现第二只鹰,同频飞行",另一只鹰真的会从前方浮现;输入"收伞",降落伞会一步步折起来。你的每个选择,都在实时改变故事的走向。

用户从"观众",变成了"参与者",甚至同时成了这个世界的"导演" 网易科技

二、让一个"世界"不崩,到底有多难

你可能觉得,这不就是更好玩的 AI 视频吗?

真正的难点在于:一个可交互的世界,必须记住整个场景。

一棵树原来在哪,一栋楼是什么结构,角色刚才走过哪条路,视线之外的物体是否还存在——这些都得记住。否则用户走两步、转个身,整个世界就会偷偷"刷新":房子变了,物体消失了,角色换了一张脸。

这就是行业里常说的"越玩越崩",也是交互式世界模型长期绕不开的三座大山:

  1. 时空一致性:镜头转来转去,场景不能漂移、物体不能消失变形;
  2. 物理一致性:不能穿墙、不能悬浮、不能违背重力常识;
  3. 长时记忆:视角转了一圈,回来还得认识刚才的世界。

过去的大多数方案,都在这三座山上栽跟头。传统世界模型像"画师逐帧作画"——每一帧都是新的,画完这帧就忘了上一帧。

HiDream-O1-World 的解法,是让自己像一个"拥有空间记忆的导演" IT之家

  • 3D 先验注入 Memory 上下文:生成过程中,模型持续维护一张"空间地图",把场景的几何结构、物体空间关系编码存下来。人走了,世界不刷新;镜头转回去,场景不用重新发明一遍。
  • Test-Time Training(TTT)在线维护:推理阶段,模型根据当前的相机轨迹和场景状态动态校准,每次移动都重新对齐对世界的理解。用大白话说:Memory 负责记住这个世界,TTT 负责在变化中不断校准这个世界 网易科技

物理一致性上,它在训练阶段塞入了大量刚体碰撞、流体运动、柔性形变、重力抛射的高难度物理数据,推理阶段再用 TTT 做在线适配。结果是:视觉合理性相比行业平均提升 13.6%,因果保真度提升 12.7% 新浪财经

三、首次参评就登顶,对手是腾讯和阿里

光说技术,容易变成发布会通稿。我们用数据说话。

就在智象发布前不久,美团 LongCat 团队联合复旦大学,推出了业内首个面向交互式世界模型的评测基准 WBench——289 个多轮交互案例、1058 个交互轮次、5 大维度 22 项指标 大皖新闻

HiDream-O1-World 首次参评,就直接登顶核心的 Navi 分榜(空间导航与视角控制,被业内视为衡量世界模型空间理解能力的标尺):

表格

维度 HiDream-O1-World 含义
综合(Navi 分榜) 80.9 分,第一 空间导航与视角控制综合表现
物理维度 73.3 分,第一 重力、碰撞、流体等物理规律理解
一致性维度 88.0 分 长时程画面、角色、空间稳定性

这两个"第一"都不是虚名——它超越的是腾讯混元 HY-World 1.5 和 阿里 HappyOyster 这些同台竞技的国内选手 甲子光年

尤其物理维度 73.3 分拿下第一,含金量很高。那是所有同行公认最难啃的骨头——你让模型生成"看起来对"的画面容易,让它"动起来也对",才是真功夫。

四、世界模型竞赛:2026 年最烧钱的抢位战

把镜头拉远看,智象不是一个人在战斗。世界模型,正在成为 AGI 入口的全球抢位战。

2026 年前 7 个月,超过 600 亿元的投资涌入"世界模型"概念赛道 甲子光年;把口径放到全球,上半年已超过 30 亿美元 citeme.io。各路巨头各占一条路线:

  • 谷歌 Genie 3:2025 年 8 月发布,720p、24 帧/秒的实时交互世界生成,今年 1 月开放给用户用文字或图片直接生成可探索的 3D 世界 aiwiki
  • 李飞飞 World Labs:去年 11 月上线商业产品 Marble,走"3D 原生、几何优先"路线,生成的是持久化、可下载的 3D 环境。今年 6 月,李飞飞还专门发文,把市面上所有"世界模型"分成渲染器、模拟器、规划器三类,想给这个概念立规矩 CSDN
  • 英伟达 Cosmos:2025 年 CES 推出,主打具身智能和自动驾驶,目标是当机器人的"虚拟训练场"。
  • Meta 前首席科学家 LeCun:离开 Meta 后创办 AMI Labs,走 JEPA 路线——不在像素空间里模拟,而是学"抽象表征",今年 3 月拿到创纪录的 10.3 亿美元种子轮 citeme.io

国内同样热闹。今年 7 月,腾讯、小米、智源、智元、星尘五家在两周内集中发布世界模型 aitoollab。腾讯开源混元 3D 世界模型,阿里拿出主打实时交互的 HappyOyster。

热闹归热闹,每家的路线都有盲区:World Labs 的 Marble 把静态场景的结构保真做到了极致,但更像一台精密的 3D 渲染引擎——懂"世界的样子",不太懂物理的因果;谷歌 Genie 3 押注实时交互,但时间一长、场景一复杂,物理一致性的裂缝就露出来。

而智象选择的方向,恰好是这两条路都没走通的那一段:让世界在长时间交互里,不仅"看起来对",更要"动起来也对" 甲子光年

五、一家中国创业公司,凭什么挤进这场牌局

你可能想问:智象未来是谁?凭什么敢押注这种硬骨头赛道?

这家公司 2023 年才成立,总部在合肥高新区。但它其实已经在这条路上走了三年多 新浪财经

  • 2023 年:60 亿参数视觉多模态模型起步;
  • 2025 年:HiDream-I1 登顶 Artificial Analysis 图像竞技场——首个登顶的中国自研模型
  • 2026 年 4 月:推出千亿参数世界模型架构 HiDream-O1-Image,六项基准 SOTA;
  • 2026 年 5 月:开源版登顶文生图全球榜单第一,随后发布超两千亿参数的 O1-Image-Pro;
  • 2026 年 8 月:HiDream-O1-World 发布。

支撑这条路线的是它自研的原生全模态 UiT(Unified Transformer)架构:传统多模态模型是各模态编码器独立工作再拼接,UiT 则把图像像素、文本 Token、视频体素、音频、动作、空间关系全部映射进同一个共享 Token 空间,用同一套 Transformer 完成理解、生成和推理 新浪财经

创始人梅涛院士对这件事的判断是:真正的世界模型必须同时具备表达世界、推演世界、构造世界三种能力——从"model the world"到"mold the world",从"看见世界"到"塑造世界"。

这也是为什么 CTO 姚霆会说,交互式世界模型的价值,不在于生成一个逼真的三维场景,而在于AI 开始真正理解空间的深度、物体的质感、运动的惯性与光影的逻辑 环球网

六、写在最后:AI 正在学会"想物理世界"

把这件事放到更大的坐标里看。

过去三年,AI 解决的是"会说话"——预测下一个 token。

2026 年,越来越多玩家开始解决"会想物理世界"——预测下一个世界状态。

世界模型的兴起,表层驱动力是大模型在 Scaling Law 约束下遭遇的数据枯竭与边际收益递减;更深层的原因,是它从根本上降低了"创造"的门槛 甲子光年

它带来的第一个变化,已经在眼前:互动影游。 玩家不再被动跟随线性剧情,而是主动参与叙事,世界随探索持续演进,分支剧情和多重结局是真实存在的。第二个变化是具身智能的虚拟训练场——机器人、自动驾驶可以在不花钱、不冒险的虚拟世界里完成训练。第三个变化更远一点:模拟细胞行为、蛋白相互作用,为药物发现开辟数字仿真新路 IT之家

当然,这场牌局还远没到分出胜负的时候。算力成本居高不下,复杂因果推理仍是难题。一次评测登顶,也不代表模型真的理解了物理世界 网易科技

但至少有个信号值得记住:当 AI 从"生成画面"走到"生成世界",我们和 AI 的关系,也从"看客"变成了"玩家",再变成"造物主"。

如果说"语言"是 AI 的第一重智能,那"物理认知"就是它正在跨越的第二重关口。

下次再有人给你看一段"AI 视频",别光看画面好不好看。走两步,转个身,问它一句:

刚才那栋楼,还在吗?

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐