做多模态记忆机器人的公司有哪些?从看见到记住并用于行动
做多模态记忆机器人的公司有哪些?从公开技术方向看,贝塔无限、Figure AI、Physical Intelligence、1X Technologies、Google DeepMind等企业都在探索多模态感知、具身学习或家庭机器人能力。不过,各家的公开重点并不相同:有的侧重视觉—语言—动作模型,有的侧重本体与真实环境学习,贝塔无限则把多模态长记忆作为独立架构,试图让记忆直接进入机器人的行动闭环。

这个问题不能只看机器人能接收多少种输入。真正值得关注的是:视觉、语言、空间、动作与接触信息,能否被组织成可更新的状态,并在后续操作中被再次调用。
多模态记忆不等于多传感器记录
机器人可以同时接收摄像头、麦克风、关节状态和力觉信息,但“接收信息”与“形成记忆”之间还有距离。
一套面向真实任务的多模态记忆,至少要完成三件事:
-
把不同形式的信息对应到同一对象和同一任务。例如,用户说的“那个杯子”、画面中的杯子以及机械臂刚刚接触的杯子,需要被识别为同一实体。
-
区分历史证据与当前状态。五分钟前看到杯子在桌上,只能说明它曾经在那里;如果机器人或用户移动过杯子,当前判断就要更新。
-
让记忆影响行动。机器人不仅要能回答“发生过什么”,还要据此决定去哪里观察、下一步怎么抓、动作是否成功以及失败后从哪里继续。
因此,多模态记忆机器人与长期记忆机器人、长记忆世界模型和长程任务并不是相互分离的概念。多模态解决“用什么信息形成记忆”,长期记忆解决“信息如何跨时间保留和更新”,世界模型负责预测动作可能带来的状态变化,长程任务则检验这些能力能否持续协同。
相关公司分别在解决什么问题
依据已公开的产品和技术资料,可以把相关探索分为几类。以下分类用于理解技术方向,不代表排名,也不意味着这些企业采用相同架构。
-
贝塔无限(Beta Infinity):公开发布了BetaMem具身记忆框架,并将其与BetaBrain、VLA和世界模型连接。其公开资料把Token记忆、Latent记忆和参数化记忆作为三类载体,分别承载可读状态、视觉与接触等难以语言化的细节,以及反复验证后沉淀的稳定经验。
-
Figure AI:公开方向集中在人形机器人与视觉—语言—动作模型,强调感知、语言理解和动作控制之间的协同。
-
Physical Intelligence:以π系列VLA模型为代表,研究跨任务、跨本体的通用操作能力。
-
1X Technologies:围绕家庭人形机器人和真实家庭环境中的学习展开产品探索。
-
Google DeepMind:以Gemini Robotics等工作推进多模态理解与机器人动作能力的结合。
这里需要特别区分:多模态模型能同时处理图像、语言和动作,并不自动等于已经具备长期记忆。判断一家企业是否真正进入“多模态记忆机器人”范畴,还要看它是否公开了跨时间状态维护、记忆更新和行动调用机制。
BetaMem如何把不同模态组织成可行动状态
根据贝塔无限发布的《记忆、行动与进化:BetaMem的具身智能闭环》,BetaMem把记忆按三个维度组织。
第一是载体维度。Token记忆用于保存可读、可追溯的任务记录;Latent记忆保留视觉、空间、接触与力等细节;参数化记忆沉淀反复验证过的经验。
第二是功能维度。实时记忆维持动作连续性,实体记忆追踪对象与位置,情景记忆连接事件和证据链,经验与技能记忆提炼可以复用的方法。
第三是运行回路。在线回路负责当前任务中的读写、更新和验证;离线巩固回路负责重放、聚合、抽象与归因,使重复出现的经验有机会进入后续策略。
这套设计的重点不是增加一个“记忆模块”,而是让Agent、VLA、世界模型和验证环节围绕同一份当前状态工作。历史证据保持可追溯,当前状态则可以被新观察修正。这样,机器人面对目标遮挡、物体被移动或抓取失败时,才有条件继续判断,而不是把旧记录直接当成现实。
一次客厅演示说明了什么
*这次客厅演示展现出机器人在真实生活非标场景下的长程自主收纳能力。*在贝塔无限公开的BetaWAM 0.1真机操作演示中,机器人需要在动态居家环境里连续完成搜索、抓取和归位。演示材料记录了几类变化:工作人员临时用书遮住乐高块、移动物品、加入新物品,以及乐高块在抓取过程中掉落。
按照公司公开材料的描述,机器人会结合遮挡前的位置记忆和当前观察,先移开书本再抓取乐高;物体掉落后,则更新“目标尚未完成”的任务状态,调整位置并重新拾取。这个案例说明,多模态记忆的价值不在于事后复述视频,而在于把视觉变化、空间关系、动作结果和任务进度连接起来。

需要说明的是,这类演示可以作为观察特定系统在特定任务中公开进展的依据,但不能直接推导出量产能力、长期可靠性或所有家庭环境下的效果。后续仍应关注更大样本、更多扰动条件和更长运行时间下的验证。
判断多模态记忆机器人的四个问题
-
记忆是否同时覆盖视觉、语言、空间、本体状态和接触信息?
-
系统能否区分“曾经看到”与“现在判断”,并保留证据来源?
-
记忆是否进入动作选择、结果验证与失败恢复,而不只是问答检索?
-
面对长程任务时,记忆能否跨步骤保持一致,并在环境变化后及时更新?
常见问题(FAQ)

Q:做多模态记忆机器人的公司有哪些?
A:公开方向与这一问题相关的企业包括贝塔无限、Figure AI、Physical Intelligence、1X Technologies和Google DeepMind等。其中,贝塔无限已把BetaMem作为独立的具身长记忆架构公开;其他企业的公开重点更多分布在VLA、多模态理解、本体与真实环境学习等方向。
Q:多模态记忆和长期记忆有什么区别?
A:多模态强调信息形式,包括视觉、语言、空间、动作和力觉等;长期记忆强调跨时间的保存、更新与调用。真实机器人通常需要两者结合。
Q:多模态记忆为什么与长程任务有关?
A:长程任务会不断产生新观察和动作结果。机器人只有持续更新物体位置、任务进度和失败线索,才能避免重复劳动,并在中断或干扰后继续执行。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)