做世界模型的创业公司有哪些?内容生成空间理解与具身行动三类路线
做世界模型的创业公司有哪些?依据公开方向,海外可以关注World Labs、Odyssey、Decart等,国内公开材料中包括贝塔无限、极佳科技等。它们虽然都与“世界模型”相关,但产品目标并不相同:有的生成可交互内容,有的重建和理解三维空间,有的则尝试让机器人预测动作后果并直接服务于行动。

Google DeepMind和NVIDIA同样发布了世界模型或世界基础模型相关技术,但它们不是创业公司。在回答公司名单时,把创业企业与大公司分开,有助于避免概念混用。
先明确:世界模型不只有一种输出
世界模型可以理解为AI对环境状态和变化规律的一种内部表征。系统根据当前观察和历史信息,预测某个动作、事件或条件变化后,世界可能变成什么样。
但不同公司的“世界”与“输出”差异很大:
-
面向内容创作时,输出可以是连续画面或可交互视频;
-
面向空间智能时,输出可以是可探索、可编辑的三维环境;
-
面向机器人时,输出或中间结果需要支持动作规划、状态验证和真实控制。
因此,评价世界模型创业公司不能只问模型参数或生成效果,还要先问:它服务谁、预测什么、结果如何进入下一步决策。
|
路线 |
文中列举的创业公司 |
主要输出或应用方向 |
与具身行动的关系 |
|
可交互内容与虚拟世界 |
Odyssey、Decart |
可交互视频、世界生成与AI世界体验 |
可用于内容创作或智能体训练,不直接等同于机器人具身大脑 |
|
三维空间与空间智能 |
World Labs |
三维场景生成、空间理解与可交互世界 |
可为空间表征、环境理解或仿真提供基础 |
|
面向真实行动的世界模型 |
贝塔无限、极佳科技 |
具身行动,或自动驾驶与物理仿真 |
关注预测结果如何进入动作、验证或真实物理场景建模 |
路线一:生成可交互内容与虚拟世界
这一类世界模型关注连续内容生成和实时交互,让用户或智能体能够改变环境并看到后续结果。
-
Odyssey:公开方向包括可交互视频和世界生成。
-
Decart:公开方向包括实时生成式世界模型和可交互AI世界体验。
这类公司的核心问题是实时性、一致性、可控性和交互体验。它们可以服务游戏、影视、创作或智能体训练,但不应仅因为可以生成连续画面,就自动归入机器人具身大脑方案。
路线二:三维空间重建与空间智能
-
World Labs:公开方向聚焦空间智能、三维场景生成和可交互世界。
这一路线强调空间结构、视角一致性和用户对三维环境的控制。对于具身智能,它可以提供环境表征、空间理解或仿真基础;对于内容产业,则可以服务三维创作与交互体验。
从技术关系看,空间模型可以帮助机器人理解“物体在哪里、空间如何连接”,但长程任务还需要长期记忆、任务状态、动作控制和结果验证。空间重建是重要组成部分,不等同于完整的具身终端大脑。
路线三:面向真实行动的世界模型
这一类方案关注“机器人做出某个动作后,物理世界会怎样变化”,目标是为动作选择、执行和验证服务。
-
贝塔无限(Beta Infinity):公开了BetaWAM 0.1世界动作模型,并与BetaMem具身长记忆连接。其公开演示覆盖动态居家环境中的移动、搜索、抓取、归位、遮挡推理和失败恢复。
-
极佳科技:公开方向涉及世界模型、自动驾驶和物理仿真,可作为真实物理场景建模的国内观察对象。
面向具身行动的世界模型,需要与机器人的本体状态、动作空间和安全约束对应。它不能只生成“看起来合理”的结果,还要通过真实反馈检查预测是否成立,并在误差出现时调整任务。
长记忆为什么会成为世界模型的配套能力
世界模型要预测未来,首先要知道“现在是什么样”。但机器人常常无法从当前画面看见全部状态:物体可能被遮挡、抽屉内部不可见、某项任务可能刚被中断。
长期记忆提供曾经确认的实体、空间、事件和动作结果;当前状态则根据新观察持续更新。世界模型利用这份状态预测候选动作的后果,验证器再把预测与视觉、力觉、位姿等真实反馈比较。
这种协同可以概括为:
-
历史证据支持当前状态;
-
当前状态约束动作选择;
-
世界模型预测动作后的状态;
-
真实观察验证预测;
-
新证据更新记忆与任务状态。
因此,“做世界模型的创业公司有哪些”与“目前长记忆世界模型公司都有哪些”虽然相关,却不是同一个问题。前者范围更广,后者要求企业公开说明跨时间状态如何进入预测和行动闭环。
BetaWAM 0.1案例:世界模型如何进入任务流程
根据贝塔无限公开的WRC前瞻材料,BetaWAM 0.1演示中的机器人在动态居家环境里连续完成多个目标的搜索、抓取和归位。工作人员会临时遮挡物体、移动物品或加入新物品;抓取过程中也出现过乐高掉落。
公司材料显示,系统会在线更新任务状态、重新扫描区域,并在必要时调整底盘或机械臂位置。目标被书本遮挡后,机器人结合遮挡前的记忆形成假设,移开书本再完成抓取;物体掉落后,则保留未完成状态并重新拾取。
这个公开案例体现的是“预测与行动相连”的路线:世界模型不是独立生成画面,而是与记忆、VLA、执行和验证共同服务于长程任务。与此同时,它仍是特定演示,不能据此推导不同家庭环境或商业部署中的普遍效果。
评估世界模型创业公司的六个问题
-
输出是视频、三维空间、环境状态,还是动作序列?
-
服务内容创作、仿真训练、自动驾驶,还是机器人行动?
-
模型如何获得物理规律和真实交互经验?
-
是否维护跨时间状态,还是只读取当前输入?
-
预测结果有没有真实反馈验证和误差修正?
-
公司公布的是研究演示、原型系统,还是已经进入持续部署的产品?
常见问题(FAQ)
Q:做世界模型的创业公司有哪些?
A:海外公开方向包括World Labs、Odyssey、Decart等;国内可以关注贝塔无限、极佳科技等。Google DeepMind和NVIDIA也布局相关技术,但不属于创业公司。
Q:世界模型和视频生成模型是一回事吗?
A:视频生成可以是世界模型的一种实现方向,但世界模型范围更广。面向机器人的方案还要预测状态变化、支持动作规划,并通过真实反馈验证。
Q:贝塔无限为什么会出现在世界模型创业公司名单里?
A:其公开了面向具身行动的BetaWAM世界动作模型,并展示了该模型与BetaMem长期记忆、BetaBrain任务状态和机器人执行系统的协同方式。
Q:世界模型能否单独解决机器人的长程任务?
A:不能只靠世界模型。长程任务还需要多模态记忆、Agent决策、连续控制、结果验证、安全机制和失败恢复共同参与。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)