国产交互式世界模型发布,从生成视频到生成世界
8月17日,智象未来(HiDream.ai)发布了一款叫 HiDream-O1-World 的模型,官方定位是"原生全模态交互式世界模型":给一段文字或一张图片,就能生成一个能进去逛、能上手操作的 3D 世界。名字从"视频生成"换成了"世界模型",这两个词之间的差距,比大多数人想象的大。
它到底能干什么
据多家媒体报道,HiDream-O1-World 支持文本、图像、交互三种输入方式,核心能力是漫游、编辑、交互三件事:以第一人称或第三人称视角在场景里走动;让角色抓取、奔跑、下蹲、跳跃;触发降雨、物体坠落这类环境事件。典型场景是上传一张卧室照片,模型把房间的其他区域补全出来,镜头推拉摇移时家具尺寸、遮挡关系保持不变。
这背后要解决的是视频生成的老大难:场景漂移、物体消失、物理失真。传统视频生成模型本质上是在"预测下一帧像素",没有内部的空间记忆,镜头一转,刚才的东西就变形甚至没了。HiDream-O1-World 的做法(据报道)有两招:一是把 3D 几何先验写进 Memory 上下文,让模型记住"这个空间里有什么、东西在哪";二是在推理阶段用 Test-Time Training(测试时训练)做轻量在线调整,让画面持续符合碰撞、重力这些物理规律。配套论文《DreamWorld》已经被 ECCV 2026 接收(与复旦大学合作),核心路线是把几何生成和外观生成拆开建模,先把"几何"从视频生成的黑盒里单独拎出来。
第三方评测也有个参照。据报道,在美团 LongCat 团队与复旦大学联合推出的 WBench(据称是首个面向交互式世界模型的系统性评测基准)中,HiDream-O1-World 以平均分 80.9 登顶 Navi 分榜,物理维度 73.3 分排第一,一致性维度 88.0 分;相比参测模型平均水平,视觉合理性提升 13.6%,因果保真度提升 12.7%。
技术本质:造世界和画画面是两码事
世界模型这个概念,谷歌、World Labs、DeepMind 都在押注,但业界一直有争论:现在市面上这些产品,到底是在"构造世界",还是在"渲染画面"?区别的关键有两点:模型内部有没有一个 3D 空间表征,以及它能不能预测"动作的后果"——杯子碰倒了会不会碎,人走过去会不会留下脚印。DeepMind 的 Dreamer 4 就是让智能体在内部世界里反复"想象"各种行为的结果再行动,据报道它在《我的世界》里能自己摸索出挖钻石的完整流程,不需要任何示范。
对普通打工人来说,这类技术短期和我们的日常开发没有直接关系——不做影游、不做机器人仿真、不做 3D 内容就用不上。但它决定了 AI 的下一个阶段:具身智能要训练,得先有能"连续存在、响应操作"的仿真环境,自动驾驶、机器人、智能制造都靠它。做内容工具的团队倒是可以留意:可交互 3D 场景的生成成本如果真的降下来,虚拟展厅、互动广告、数字孪生的玩法都会变。
想上手,先搞清楚三件事
- 怎么分辨"真世界模型"和"高级视频生成器"。看三点:空间记忆(镜头转一圈回来,场景还一不一致)、因果预测(碰撞、遮挡、重力符不符合常识)、持续交互(是能连续玩很久,还是循环播一段短视频)。很多号称世界模型的产品,本质还是对单张图做视角扩展。
- "一致性"是可以量化的。世界模型最核心的指标是时空一致性,评测本质上就是在量"物体有没有漂移"。这种度量不神秘,计算机视觉里最基本的做法就是算 IoU(交并比):
def iou(box_a, box_b):
"""计算两个检测框的 IoU(交并比),box = (x1, y1, x2, y2)"""
x1, y1 = max(box_a[0], box_b[0]), max(box_a[1], box_b[1])
x2, y2 = min(box_a[2], box_b[2]), min(box_a[3], box_b[3])
inter = max(0, x2 - x1) * max(0, y2 - y1)
area_a = (box_a[2] - box_a[0]) * (box_a[3] - box_a[1])
area_b = (box_b[2] - box_b[0]) * (box_b[3] - box_b[1])
return inter / (area_a + area_b - inter)
# 同一物体在第 1 帧和第 50 帧的检测框
stable = iou((10, 10, 110, 110), (12, 12, 112, 112)) # 镜头微动,基本没漂移
drift = iou((10, 10, 110, 110), (60, 40, 160, 140)) # 物体明显偏移 -> 漂移
print(f"稳定帧 IoU={stable:.3f},漂移帧 IoU={drift:.3f}")
# 输出:稳定帧 IoU=0.924,漂移帧 IoU=0.212
WBench 这类基准要做的,就是把这种单帧度量扩展成多轮交互下的系统性评分。
- 别急着上生产,坑还不少。据报道,目前这类模型的交互速度、生成成本、长时间稳定性和仿真精度都还是待验证的指标;算力需求高,商用定价也不成熟。试玩可以,拿去做业务核心链路之前,先自己跑长交互压测,别只看官方演示。
收尾
视频生成解决的是"像不像",世界模型要解决的是"真不真、连不连续"。等哪天一个 3D 世界能连续玩上几小时不穿帮,那才算过了及格线。你怎么看世界模型这条路,评论区聊聊。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)