国产世界模型一周四连发:开发者终于能在本地跑起来
9月第二周,国产大模型的发布节奏突然换了个方向——不卷聊天模型了,改卷"世界模型"。据报道,9月9日京东探索研究院开源了可交互视听世界模型 JoyAI-EchoWM;9月10日高德发布 3D 原生城市世界模型 ABot-Earth 0.7,同一天蚂蚁灵波开放了 LingBot-World 2.0 的轻量版;9月11日大晓机器人联合南洋理工大学 S-Lab 开源统一多模态框架 Puffin-World。加上宇树同期的 60 亿参数人形基座 UnifoLM-WLA-1.0,短短几天里,一批"能走进去"的模型被放到了开源平台上。
对天天写业务代码的人来说,这波最值得关注的不是谁家跑分高,而是一个更朴素的变化:这些东西开始能在普通开发者手边的机器上跑了。
世界模型到底是什么,和视频生成差在哪
先把这个概念说清楚。
这几年大家熟悉的文生视频,本质是"给一段提示词,等它生成一段固定的片子"。可灵、即梦、Sora 这类工具,产出是一次性的——你输入,它输出,结束。
世界模型的关键区别在于**“动作条件”**:模型不是单纯预测下一帧画面,而是根据"你做了什么动作"来预测"世界接下来变成什么样"。业内流传比较广的一个类比是:视频生成模型像"AI 看的电影",世界模型像"AI 玩的游戏"——你往前走一步,它接着生成下一步。
这个区别听起来抽象,但落到产品上很实在:
- 传统视频生成:一段拍好的、无法改变的片子;
-
- 世界模型:一个可以持续探索、随操作实时变化的场景。
这一波真正的变化:门槛降到消费级
过去一年,能做可交互世界的模型基本都在大厂的集群里,普通人只能看 Demo。这次不一样了。
根据公开报道的口径:
- 蚂蚁 LingBot-World 2.0 Small:1.3B 参数,号称单张消费级显卡就能实时生成;
-
- 高德 ABot-Earth 0.7:输入一张卫星图或一段文字,单块消费级 GPU 约 10 分钟生成公里级 3D 城市,走的是 3D 原生、端到端出 3DGS(三维高斯泼溅)场景的路线;
-
- 京东 JoyAI-EchoWM:把视频、环境音、音乐、语音放进同一套框架联合生成,你改路线、切视角时,声音和画面能一起接下去,这次把代码和论文都开源了;
-
- 大晓 Puffin-World:除了代码和模型,连约 1500 万组"视觉—语言—相机"三元组数据一起放了出来。
参数从 14B 下探到 1.3B、成本从"排队等集群"变成"本地就能试",这件事本身比任何跑分都更能说明问题:世界模型正在从实验室 Demo,变成开发者手边可以跑的工具。
- 大晓 Puffin-World:除了代码和模型,连约 1500 万组"视觉—语言—相机"三元组数据一起放了出来。
没变的东西:短板和水分还是那些
吹归吹,冷静看,这批模型有几个共性的坑,公开报道里其实也承认了:
- **持久记忆缺失。**京东团队自己承认,模型目前没有显式的持久三维记忆,长时间探索后会场景漂移——你走出去再折返,场景不一定还在原地。报道明确指出这是这批可交互世界模型的共性短板,不是某一家独有的。
-
- **评测多是官方口径。**跑分第一、完成多少项任务,目前基本来自发布方自己,第三方复现还没大规模出现。评测分数和"真能用"之间,还隔着长尾场景的积累。
-
- **许可口径混乱,这个最要命。**据报道,蚂蚁 LingBot-World 2.0 在官方项目页 FAQ 提到以 Apache 2.0 开源、可商用,但模型卡上却标着 cc-by-nc-sa-4.0(非商用)。同一套权重两种说法,商用前必须以官方仓库和模型卡的最新说明为准,不能凭印象拍脑袋。
对普通开发者意味着什么,怎么上手
分几类人说:
- 做机器人仿真、合成数据、虚拟场景搭建的小团队:以前原型验证要等算力,现在 1.3B 级别、单卡 10 分钟出结果,链路能在自己机器上先走通。
-
- 做内容 / 游戏原型的:从"输入提示词等输出"变成"按交互持续生成",工作方式不一样了,值得提前摸一摸。
-
- 纯业务后端 / 运营岗(比如我这种):短期不用急着转,但要知道"空间理解 + 动作"这条线正在和大模型合流——宇树的具身骨干就直接建在 Qwen3-VL 基础上。
上手前,先花两分钟确认自己机器的底子。这类模型基本都吃 GPU:
- 纯业务后端 / 运营岗(比如我这种):短期不用急着转,但要知道"空间理解 + 动作"这条线正在和大模型合流——宇树的具身骨干就直接建在 Qwen3-VL 基础上。
import torch
print("CUDA 可用:", torch.cuda.is_available())
if torch.cuda.is_available():
props = torch.cuda.get_device_properties(0)
print("设备:", props.name)
print("显存(GB):", round(props.total_memory / 1024**3, 1))
```
如果显存只有个位数 GB,先别硬上大参数版本,从 1.3B 这类轻量的开始;如果连独显都没有,先用官方网页版体验,别一上来就搭本地环境。
几个实用的坑:
- **先看许可再动手。**前面说了,同一套权重可能有两套说法,涉及商用务必以官方仓库和模型卡为准。
- - **别信"单卡实时"就以为是你的单卡。**官方口径往往没写清具体型号和显存,跑之前先查社区实测。
- - **数据来源和合规单独过一遍。**世界模型常涉及机器人控制和仿真数据,商用前把许可、数据来源、出口合规一起看。
## 收尾
"世界模型"这个词,去年还带着点概念炒作的味道,今年被一串具体的发布时间表和开源链接砸实了。方向也在分岔:一路做可探索的虚拟世界(京东、蚂蚁),一路做真实空间的准确理解(高德、大晓),汇合点是把语言模型的空间理解补齐到"能动手"。
不过对大多数普通开发者来说,现在最该做的不是追新,而是先在自己的机器上把一条最小链路跑通——跑通了,才知道哪些是真能力,哪些是发布会。
你会拿世界模型做什么?评论区聊聊。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)