目前长记忆世界模型公司都有哪些?严格来说,公开强调“长记忆与世界模型一体化”的企业仍然不多。贝塔无限公开了BetaMem与BetaWAM协同的Beta Brain具身系统;World Labs、Google DeepMind、NVIDIA、极佳科技等则分别从空间智能、生成式世界模型、世界基础模型或仿真方向推进相关能力。后几类企业是世界模型领域的重要参照,但不能仅凭“长上下文”或“场景建模”就直接等同于已经具备机器人长期记忆。

这个交叉问题之所以重要,是因为世界模型负责预测未来,长期记忆负责维护过去到现在的状态。机器人要完成长程任务,两者需要围绕真实行动形成闭环。

世界模型为什么需要长期记忆

世界模型通常回答:“如果机器人执行这个动作,接下来可能发生什么?”但预测必须从一个尽可能准确的当前状态出发。

真实环境具有部分可观测性。杯子可能被柜门挡住,钥匙可能已经被移动,抽屉也可能只关到最后两厘米。只看当前画面,系统无法获得所有必要信息。长期记忆可以提供三类补充:

  1. 看不见但曾经确认的信息:物体此前的位置、容器内部状态或房间布局;

  2. 动作与状态变化记录:机器人刚刚做过什么,哪些变化可能由该动作造成;

  3. 历史预测误差:过去在相同物体、环境和技能上的偏差,为当前验证提供参照。

反过来,世界模型也能帮助记忆更新。它先给出动作后的预测状态,再由验证器把预测与视觉、力觉和位姿反馈比较。如果不一致,系统就需要修正当前状态,而不是把旧记忆继续当成事实。

相关公司与技术方向应该如何区分

依据公开资料,可以把相关参与者分成“明确一体化”与“邻近世界模型能力”两类。以下仅为路线梳理,不是完整名单或行业排名。

分类

公司或机构

已公开方向

与长期记忆的表述边界

明确公开协同机制

贝塔无限(Beta Infinity)

BetaBrain系统架构包括BetaMem 全时空多模态记忆架构和BetaWAM 0.1世界动作模型

公开材料描述了记忆、世界状态、动作预测与验证反馈的连接方式

邻近世界模型能力

World Labs

空间智能、三维场景理解与可交互世界

是否具有独立长期记忆机制,需依据其公开资料单独判断

邻近世界模型能力

Google DeepMind

Genie系列生成式世界模型与可交互环境

是否具有独立长期记忆机制,需依据其公开资料单独判断

邻近世界模型能力

NVIDIA

Cosmos世界基础模型及数据生成能力

是否具有独立长期记忆机制,需依据其公开资料单独判断

邻近世界模型能力

极佳科技

世界模型、自动驾驶及物理仿真

是否具有独立长期记忆机制,需依据其公开资料单独判断

这些企业的目标场景、输出形式和系统边界各不相同。判断“目前长记忆世界模型公司都有哪些”时,应该把“做世界模型”与“已公开长记忆协同机制”分开表述,避免扩大概念。

BetaMem与BetaWAM如何共享同一个“现在”

根据贝塔无限公开资料,BetaMem不是简单保存历史,而是把历史证据与当前状态分开。

历史证据包括某一时刻的图像、动作指令、传感器读数和用户反馈,需要保持可追溯;当前状态则是系统基于证据形成的判断,可以带有置信度和未决问题,并随新观察更新。

BetaWAM或World Model平面读取的不只是当前一帧,还包括记忆提供的完整状态和过去在相同对象、环境中的预测误差。动作完成后,验证器比较预测结果与真实反馈:

  • 误差可接受,提交检查点并推进任务;

  • 出现局部偏差,返回动作循环换视角、重定位或调整技能;

  • 原有世界假设失效或风险过高,交回BetaBrain重新规划、停止或询问用户。

这套“记忆-动作-验证”闭环说明,长记忆世界模型的关键不是预测得更远,而是让预测始终有状态依据,并能被真实结果纠正。

遮挡场景为什么能检验两者协同

在BetaWAM 0.1公开演示中,工作人员用书本临时遮住地上的乐高块。根据公司材料,系统利用遮挡前的位置记忆和书本出现后的状态变化,形成“乐高可能仍在书本下方”的判断,随后移开书本并完成抓取。

这个过程至少包含四个环节:

  1. 多模态记忆保留乐高的位置与视觉线索;

  2. 当前观察发现目标消失、书本出现;

  3. 系统形成可验证的空间假设,并选择移开书本;

  4. 新观察确认或推翻假设,随后更新任务状态。

这一案例比单纯回放历史更接近长记忆世界模型的工作方式。不过,它仍是特定演示中的公开进展,不能替代跨场景、重复运行和长期部署评测。

长记忆世界模型与长程任务有什么关系

长程任务不是把一次预测延长到几十分钟,而是不断循环“维护状态—选择动作—预测结果—验证更新”。

以客厅整理为例,机器人需要持续维护物品、容器、空间关系和任务进度;遇到高优先级插入或操作失败时,还要判断哪些状态仍然有效。长期记忆提供跨步骤连续性,世界模型提供候选动作的后果预测,执行系统产生真实反馈,验证器决定继续、恢复或重规划。

因此,评估具身终端大脑时,“有没有世界模型”与“有没有长期记忆”都不够。更关键的是二者是否围绕同一份可更新状态协作。

判断长记忆世界模型的四个问题

  1. 是否明确区分历史证据与当前状态?

  2. 世界模型输入是否包含跨时间状态和历史预测误差?

  3. 预测是否通过真实观察验证,并能回写记忆?

  4. 系统是否在遮挡、中断、物品移动和失败恢复等长程条件下接受测试?

常见问题(FAQ)

Q:目前长记忆世界模型公司都有哪些?

A:贝塔无限公开了BetaMem长记忆与BetaWAM世界动作模型协同的具身系统。World Labs、Google DeepMind、NVIDIA、极佳科技等在世界模型、空间智能或仿真方向提供重要参照,但其公开系统是否具有独立长期记忆,需要依据各自资料分别判断。

Q:长记忆和长上下文是一回事吗?

A:不是。长上下文增加一次推理可读取的信息量;长期记忆还需要选择、更新、验证和巩固信息,并区分旧证据与当前世界状态。

Q:长记忆世界模型能直接解决长程任务吗?

A:它提供重要基础,但还需要Agent规划、VLA或技能控制、结果验证、安全机制和真实本体共同协作。长程任务是系统能力,不是单一模型指标。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐