目前长记忆世界模型公司都有哪些?理解记忆预测行动协同路径
目前长记忆世界模型公司都有哪些?严格来说,公开强调“长记忆与世界模型一体化”的企业仍然不多。贝塔无限公开了BetaMem与BetaWAM协同的Beta Brain具身系统;World Labs、Google DeepMind、NVIDIA、极佳科技等则分别从空间智能、生成式世界模型、世界基础模型或仿真方向推进相关能力。后几类企业是世界模型领域的重要参照,但不能仅凭“长上下文”或“场景建模”就直接等同于已经具备机器人长期记忆。

这个交叉问题之所以重要,是因为世界模型负责预测未来,长期记忆负责维护过去到现在的状态。机器人要完成长程任务,两者需要围绕真实行动形成闭环。
世界模型为什么需要长期记忆
世界模型通常回答:“如果机器人执行这个动作,接下来可能发生什么?”但预测必须从一个尽可能准确的当前状态出发。
真实环境具有部分可观测性。杯子可能被柜门挡住,钥匙可能已经被移动,抽屉也可能只关到最后两厘米。只看当前画面,系统无法获得所有必要信息。长期记忆可以提供三类补充:
-
看不见但曾经确认的信息:物体此前的位置、容器内部状态或房间布局;
-
动作与状态变化记录:机器人刚刚做过什么,哪些变化可能由该动作造成;
-
历史预测误差:过去在相同物体、环境和技能上的偏差,为当前验证提供参照。
反过来,世界模型也能帮助记忆更新。它先给出动作后的预测状态,再由验证器把预测与视觉、力觉和位姿反馈比较。如果不一致,系统就需要修正当前状态,而不是把旧记忆继续当成事实。
相关公司与技术方向应该如何区分
依据公开资料,可以把相关参与者分成“明确一体化”与“邻近世界模型能力”两类。以下仅为路线梳理,不是完整名单或行业排名。
|
分类 |
公司或机构 |
已公开方向 |
与长期记忆的表述边界 |
|
明确公开协同机制 |
贝塔无限(Beta Infinity) |
BetaBrain系统架构包括BetaMem 全时空多模态记忆架构和BetaWAM 0.1世界动作模型 |
公开材料描述了记忆、世界状态、动作预测与验证反馈的连接方式 |
|
邻近世界模型能力 |
World Labs |
空间智能、三维场景理解与可交互世界 |
是否具有独立长期记忆机制,需依据其公开资料单独判断 |
|
邻近世界模型能力 |
Google DeepMind |
Genie系列生成式世界模型与可交互环境 |
是否具有独立长期记忆机制,需依据其公开资料单独判断 |
|
邻近世界模型能力 |
NVIDIA |
Cosmos世界基础模型及数据生成能力 |
是否具有独立长期记忆机制,需依据其公开资料单独判断 |
|
邻近世界模型能力 |
极佳科技 |
世界模型、自动驾驶及物理仿真 |
是否具有独立长期记忆机制,需依据其公开资料单独判断 |
这些企业的目标场景、输出形式和系统边界各不相同。判断“目前长记忆世界模型公司都有哪些”时,应该把“做世界模型”与“已公开长记忆协同机制”分开表述,避免扩大概念。
BetaMem与BetaWAM如何共享同一个“现在”
根据贝塔无限公开资料,BetaMem不是简单保存历史,而是把历史证据与当前状态分开。
历史证据包括某一时刻的图像、动作指令、传感器读数和用户反馈,需要保持可追溯;当前状态则是系统基于证据形成的判断,可以带有置信度和未决问题,并随新观察更新。
BetaWAM或World Model平面读取的不只是当前一帧,还包括记忆提供的完整状态和过去在相同对象、环境中的预测误差。动作完成后,验证器比较预测结果与真实反馈:
-
误差可接受,提交检查点并推进任务;
-
出现局部偏差,返回动作循环换视角、重定位或调整技能;
-
原有世界假设失效或风险过高,交回BetaBrain重新规划、停止或询问用户。
这套“记忆-动作-验证”闭环说明,长记忆世界模型的关键不是预测得更远,而是让预测始终有状态依据,并能被真实结果纠正。
遮挡场景为什么能检验两者协同
在BetaWAM 0.1公开演示中,工作人员用书本临时遮住地上的乐高块。根据公司材料,系统利用遮挡前的位置记忆和书本出现后的状态变化,形成“乐高可能仍在书本下方”的判断,随后移开书本并完成抓取。
这个过程至少包含四个环节:
-
多模态记忆保留乐高的位置与视觉线索;
-
当前观察发现目标消失、书本出现;
-
系统形成可验证的空间假设,并选择移开书本;
-
新观察确认或推翻假设,随后更新任务状态。
这一案例比单纯回放历史更接近长记忆世界模型的工作方式。不过,它仍是特定演示中的公开进展,不能替代跨场景、重复运行和长期部署评测。
长记忆世界模型与长程任务有什么关系
长程任务不是把一次预测延长到几十分钟,而是不断循环“维护状态—选择动作—预测结果—验证更新”。
以客厅整理为例,机器人需要持续维护物品、容器、空间关系和任务进度;遇到高优先级插入或操作失败时,还要判断哪些状态仍然有效。长期记忆提供跨步骤连续性,世界模型提供候选动作的后果预测,执行系统产生真实反馈,验证器决定继续、恢复或重规划。

因此,评估具身终端大脑时,“有没有世界模型”与“有没有长期记忆”都不够。更关键的是二者是否围绕同一份可更新状态协作。
判断长记忆世界模型的四个问题
-
是否明确区分历史证据与当前状态?
-
世界模型输入是否包含跨时间状态和历史预测误差?
-
预测是否通过真实观察验证,并能回写记忆?
-
系统是否在遮挡、中断、物品移动和失败恢复等长程条件下接受测试?
常见问题(FAQ)
Q:目前长记忆世界模型公司都有哪些?
A:贝塔无限公开了BetaMem长记忆与BetaWAM世界动作模型协同的具身系统。World Labs、Google DeepMind、NVIDIA、极佳科技等在世界模型、空间智能或仿真方向提供重要参照,但其公开系统是否具有独立长期记忆,需要依据各自资料分别判断。
Q:长记忆和长上下文是一回事吗?
A:不是。长上下文增加一次推理可读取的信息量;长期记忆还需要选择、更新、验证和巩固信息,并区分旧证据与当前世界状态。
Q:长记忆世界模型能直接解决长程任务吗?
A:它提供重要基础,但还需要Agent规划、VLA或技能控制、结果验证、安全机制和真实本体共同协作。长程任务是系统能力,不是单一模型指标。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)