让机器人记住的,不该只是画面,而是它此刻对世界的判断。

贝塔无限首创「全时空多模态记忆具身大脑架构BetaMem」

让机器人整理一次客厅。半程过去,它把杯子放进了柜子,转身回到桌前,又开始找那个杯子。

它不是不会抓,是不知道自己刚才做了什么。

今天的大模型已经能理解图像、拆解任务、调用工具,具身模型也开始能导航、能操作真实世界。但任务一旦从单次问答、单次抓取拉长到十几分钟以上,一个基础问题就会暴露:机器人能否始终知道世界现在什么样、任务走到了哪一步、上一个动作造成了什么后果、失败之后该从哪里接上。

这不是把更多历史塞进上下文就能解决的,也不是在模型外挂一个向量数据库就能解决的。具身智能面对的世界持续变化、只能部分观测、处处是物理约束。机器人每做一个动作,都可能改变物体位置、空间可达性和后续计划。一次被遮挡的观察、一次没有完全关上的抽屉、一次抓取后的轻微滑落,都会让“计划中的世界”和“真实世界”分叉。

记忆必须参与进来——参与状态估计、行动选择、效果验证和失败恢复。

BetaMem 是我们围绕这个问题构建的具身记忆框架。它面向长程复杂任务,在 Agent、VLA(视觉—语言—动作模型)与 World Model(世界模型)之间维护一份统一、可更新的认知状态,并用真实世界的反馈持续改进记忆与行为。这里的记忆不只服务于 Agent 的规划:同一份状态直接进入 VLA 的动作生成和 World Model 的预测,在抓取、开合、力度这些物理交互环节上产生增益。本文讲三件事:为什么需要这套框架、它怎么组织记忆、记忆如何进入操作闭环。

三句话看懂 BetaMem。

一,具身机器人缺的不是更大的上下文或更多存储,而是一份随动作和观察不断更新的当前状态;

二,BetaMem 把“发生过什么”和“现在是什么样”分开,让同一份状态同时供模型注意、Agent 决策和物理执行使用——VLA 和世界模型因此不再只看见眼前几帧;

三,每一次真实任务的成败都会回流,同时改进“记什么”和“怎么做”。

一、机器人到底需要记住什么

BetaMem v0.1 选了三个日常任务,它们分别考验三种不同的记忆能力。

图 1|BetaMem v0.1 演示画面:实体记忆、情景记忆和经验记忆分别进入真实任务流程。

“帮我拿瓶可乐过来”考验实体记忆:可乐是什么、最后在哪里看到、该位置现在是否仍可信。

“找不到钥匙了,找到后帮我拿过来”考验情景记忆:围绕钥匙重构事件链,记录已经查过和仍值得搜索的位置。

“根据用户图片寻找未知物品”考验经验记忆:把视觉线索与环境经验结合,生成可验证的搜索假设。

三类任务对应三种能力:实体召回、情景重构、经验推断。同一条历史信息,会因为当前任务不同,被组织成位置、事件或搜索假设——具身记忆的关键从来不在“存”,而在“怎么组织”。

但这三个任务都还太短。真正的压力来自连续的长任务。

回到开头那个客厅整理。三十分钟里,机器人要识别散落物品、判断哪些该动、排出先后顺序、选择抓取和放置方式,同时不断处理新观察和意外:先收玩具再搬杯子,途中发现垃圾桶满了;抓取失败,物体位置变了;一次临时避障,偏离了原计划。

这时候,记忆至少要持续维护四类信息:

  • 任务进度哪些子任务已经完成,哪些仍在进行,哪些因为前置条件不满足而暂停;

  • 世界状态:物体当前位置、容器开合状态、空间占用关系及其可信度;

  • 动作结果:刚才执行了什么,预期效果是什么,实际观察到什么;

  • 恢复线索:失败发生在哪里、原因可能是什么、哪些步骤可以复用、应该从哪个检查点继续。

一旦这些信息散落在各模块自己的缓存里,开头那一幕就会发生:规划器以为杯子还在桌上,VLA 已经把它挪到柜子边,视觉模块因为遮挡没确认最终位置。几步之后,机器人按过期状态重新搜索,甚至把做完的事又做一遍。

长程任务的真正难点在协作:感知、推理、行动、验证必须围绕同一份状态。

二、更大的上下文和外部记忆库,为什么还不够

现在常见的 Agent 记忆做法是:把历史对话、图像描述、视频片段、动作日志写进外部存储,需要时用相似度检索捞回来,塞进上下文。这套方法在知识问答、个人信息记忆和静态任务上很好用。搬到具身场景,会撞上三个结构性问题。

第一,检索到的是过去,不是现在。

五分钟前在桌上看到杯子,不等于杯子现在还在桌上。

这句话听着像废话,却是整个系统设计的分水岭。具身世界被机器人、用户和其他物体不断改写,光存下观察远远不够,还要记录观察之后发生了什么动作、状态可能怎么转移、现在还剩多少把握。否则记忆存得越多,过期的“事实”干扰决策的机会就越多。

第二,记忆和行动是断开的。

很多系统只在做计划、答问题时读记忆,真正执行动作时靠的是一小段视觉—语言上下文。长程目标、局部动作和执行反馈因此无法互相校正。有用的记忆不止要说清“过去发生了什么”,还要决定“现在看哪里、下一步做什么、什么时候该停或该重试”。

这一层的代价很具体。VLA 大多以当前几帧观察加一句指令为条件生成动作,近似无状态:手伸过去挡住目标,视野里目标消失,抓取就落空;瓶盖已经拧了半圈,重新观察后又从初始姿态拧起。World Model 的处境类似,它要预测动作的后果,却看不见遮挡背后和容器内部,也不知道这只杯子有多重、这个抽屉阻尼多大——这些都不在当前帧里,只能来自记忆。

更麻烦的是,高层 Agent、VLA、World Model、VLM、导航各自缓存了一份自己的世界。分工可以保留,状态必须共享,否则计划、控制和预测会逐步漂移,系统只能靠反复重新感知来打补丁。

第三,记忆机制本身不会进步。

一次成功或失败的真实操作,带的学习信号比任何静态语料都直接:哪条线索起了作用、哪段记忆造成了误判、哪种恢复策略有效、用户满不满意。可如果系统只是把这些经历追加进数据库,从不调整自己怎么写、怎么压缩、怎么召回,它用得再久也不会变好。

所以真正的核心问题从来不是“怎么存更多”:

如何把连续感知压缩为可更新的世界与任务状态,让这份状态参与决策和动作,并利用真实世界反馈持续改进记忆与行为。

图 2|历史观察是形成当前状态的证据;当世界可能已经变化时,系统需要主动验证,而不是直接复用旧事实。

三、记忆是一份判断,不是一份日志

BetaMem 对具身记忆的定义是:

具身记忆是智能体对世界的一份判断。它由连续的观察、动作和反馈形成,覆盖实体、事件、空间、任务与经验;它保存可追溯的历史证据,也随时可以被新证据推翻。它不只回答“发生过什么”,还要参与判断现在、预测未来、选择动作、从失败中恢复。

图 3|以寻找钥匙为例:历史证据保持可追溯,当前状态带有置信度和未决问题,并直接决定下一步验证动作。

这个定义刻意分开了两样东西:历史证据和当前状态。

历史证据是确实发生过的:某一刻的图像、一条抓取指令、一次传感器读数、一句用户反馈。它必须可追溯,不能被后续推理悄悄改写。当前状态则是系统的判断,比如“杯子大概率进了左侧柜子,但柜门挡着,还得确认”。它允许被推断,也必须随新证据更新。

分开之后,记忆就从一条流水账变成了一个环:证据支撑状态,状态约束行动,行动带来新观察,新观察再回头验证或修正状态。

人的长期记忆也不是逐帧录像。我们对经历做选择性编码,靠线索唤起,用已有知识重构细节,在反复使用中巩固。BetaMem 借的是这套功能分解——压缩、检索、重构、巩固——而不是拿脑区去对应工程模块。

落到系统里,记忆按三个维度组织。

图 4|BetaMem 的三维记忆组织:载体决定以什么形式记,功能层决定记什么,在线与巩固回路决定何时更新。

载体:以什么形式记。Token 记忆承载可读、可追溯的状态与任务记录;latent 记忆不转成文字,直接以向量形式保留视觉、空间、接触与力的细节——这恰恰是语言写不清、VLA 又必须用到的那部分;参数化记忆把反复验证过的稳定经验——包括物体的可抓取点、需要的力度方向这类物理常识——沉淀进策略或模型。

功能层:记什么。实时记忆维持动作连续性,实体记忆管对象和位置,情景记忆串起事件和证据链,经验与技能记忆提炼可跨任务复用的方法。四者是流动的:实时观察更新实体状态,一串状态变化构成情景,多个情景沉淀为经验。

回路:什么时候更新。在线回路低延迟地读写、更新、验证,负责“这一次做对”;离线巩固回路做重放、聚合、抽象和归因,负责“下一次做得更好”。

四、一个状态,五个平面

系统的中枢是 BetaBrain。它的职责是协调,不是包办:围绕当前目标组织状态,判断证据够不够,然后决定下一步——直接动手、继续探索、调用技能、请求工具、执行恢复,或者停下来问用户。

围绕 BetaBrain,整个系统可以拆成五个平面。

图 5|BetaMem 的顶层闭环:连续观察形成带证据的可更新状态,BetaBrain 在 Agent Loop 中选择行动、探索、验证与恢复;真实任务轨迹和多维奖励再分别更新记忆策略与行为策略。

记忆与状态平面:索引原始证据,维护实体、事件、任务、置信度和未决问题,随时回答“我们知道什么、依据是什么、还缺什么”。

Agent 决策平面:把用户意图变成一份持续更新的任务状态,而不是每一步都重新生成完整计划。

World Model 平面:预测候选动作会造成什么状态变化,为事后验证提供参照。它的输入不只是当前观察,还有记忆给的完整状态(包括此刻看不见但先前证实过的部分)和过去在这里的预测误差。

执行平面:导航、移动、VLA、低层控制和工具调用,按各自的时间尺度读取不同的状态切片——秒级的接触与相位、跨任务沉淀的对象物理属性,都在这里被用上。

  • 反馈与学习平面:从任务、证据、状态、恢复、用户和风险信号中,更新记忆策略与行为策略。

BetaMem 原型给出的一条经验是:Planner 最大的价值在于跨步骤维护“还有什么问题没解决”,而不在于反复重新规划。操作任务同理——BetaBrain 维护任务状态,VLA 关注短时的动作—感知上下文,控制器关注更短周期的反馈,三者靠共享目标、状态和验证结果保持一致。

五、让记忆真正起作用的三个机制

架构说明了模块怎么分工,下面三个机制说明记忆如何真正改变模型和行为,最后再合到操作任务上,看这些机制换来了什么。

  1. 状态形成:从“检索过去”到“估计现在”

传统检索以查询为中心,在历史里找语义相似的片段。具身任务需要的是另一种能力:根据连续的证据和动作,估计此刻世界最可能是什么样。

BetaMem 给每条关键状态都带上来源、时间、置信度和更新原因。“钥匙在玄关柜上”来自十分钟前的直接观察;“钥匙可能被放进了抽屉”来自用户动作加遮挡后的推断。执行时优先用最新、最相关、最可验证的那条,同时保留证据链备查。

接下来怎么做,取决于把握和代价。观察充分就直接推进;把握不足但代价很小,就带着假设先行动、路上验证;一旦出错代价高,就先去拿更多信息。于是“要不要多读一段记忆、要不要重新看一眼”本身也成了决策的一部分。

流式视频同理。触发记忆的不是看了多久,而是当前观察有没有信息缺口。系统先用已有状态预测眼前的情境:预测对上了就继续更新,对不上再回溯历史证据修正。记忆由此从一个被动的长视频缓存,变成预测—验证—纠正的状态机制。

  1. 记忆作为控制:同时管住模型、Agent 和动作

记忆要改变行为,就得在三个层次上同时施加控制。

图 6|三层记忆控制的计算路径。模型层负责按当前问题聚合跨时间证据;Agent 层和动作层分别负责决策门控与短时执行恢复。

模型层。记忆直接参与注意力和证据聚合,不只是当作额外 token 拼在输入前面。BetaMem 用一套轻量的模型侧记忆,让当前问题按需取用跨时间的证据——早期出现但关键的视觉线索可以一直影响现在的理解,同时不必把全部历史反复灌回上下文。它与 Agent 层的显式状态共享证据引用,但表示形式不必相同:模型内部盯的是感知线索,Agent 层维护的是能解释、能追溯的世界与任务状态。

Agent 层。记忆通过世界状态、任务进度、置信度和未决事项来控制探索与规划。BetaBrain 不必每一步重读全部历史,只取与当前决策相关的部分,并说得清自己为什么继续、为什么停止。BetaEQA 的问题驱动探索就是这样做的:维护跨步 TODO、场景信息和已走轨迹,先判断证据够不够,再由证据约束的验证环节压掉没有依据的回答。

动作层。VLA 和技能控制器需要两种记忆。

短的一种是动作—感知记忆:正在执行哪个技能、进行到哪个相位、目标最后确认的位姿、最近几次接触的力与触觉反馈、预期的后状态是什么。它不是把历史帧堆进上下文,而是把“这次操作到目前为止发生了什么”压成少量可持续更新的变量,让遮挡下的抓取、拧瓶盖这类多相位技能不至于每帧重来。执行中的小偏差在这一层消化,不惊动上面;一旦超过阈值,就把异常写回任务状态,触发重试、换技能或上报。

长的一种是跨 episode 的物理经验。VLA 权重里存的是训练集上的平均经验,而单次交互中学到的具体常识——这个柜门要先抬一下才拉得开、这只玻璃杯外壁有水很滑、这个抽屉阻尼偏大——通常在 episode 结束时就丢了,下次遇到同一个柜门还是从零试起。BetaMem 把它们写成对象级、环境级的可复用条目,既能作为条件输入直接喂给 VLA,也能在巩固回路里沉淀进策略参数。一旦把语义子目标和连续控制分层开来,两层需要的记忆时间尺度也就不同:高层拿任务级的经验和约束,低层拿秒级的接触与相位状态。这也是记忆需要同时分长短两档的原因。

三层用的是同一份认知状态的不同切片:模型看证据,Agent 看目标和不确定性,动作回路看控制和效果。记忆负责让它们保持一致,不负责统一它们的输入格式。

3. 联合进化:同时学习“记什么”和“怎么做”

记忆策略和行为策略是绑在一起的。一次失败,可能是动作没做好,也可能是关键线索压根没写进去、召回的时机不对、过期状态没及时纠正,还可能是这个物体的重量、摩擦和正确开法从来没被记下来,VLA 每次都在重新试错。只按任务成败更新动作模型,记忆的毛病会一直留着;只训练检索准确率,真实任务成功率未必提升。

所以 BetaMem 把两者放进同一个反馈框架里联合优化。奖励同时看八件事:任务完成、关键证据覆盖、状态一致性、失败恢复、用户满意度、执行效率、长期收益、安全风险。短期奖励推动这一次做完,长期奖励衡量某段记忆在后续任务里到底有没有用,风险成本则拦住那些为了探索或提速而做出的危险动作。

这不意味着所有模块都要同时上端到端大训练。更现实的是分层推进:先用显式状态、规则化反馈和可审计日志把闭环跑通,等数据攒够,再训练写入门控、记忆压缩、读取策略、技能选择和模型适配器。

一次交互,能变成一组训练数据。用户说了一句“咖啡不加糖”,机器人照做,用户接受了。

这条交互的价值远不止一条偏好记忆。它可以被展开成一整组训练数据:记忆问答、正确动作与错误动作的对比、相关记忆与干扰记忆的检索对,以及日后偏好改变时的版本更新样本。同理,一次用户纠正、一次动作失败、一次状态冲突,都能转化成监督信号——这次该召回哪段记忆、哪些状态已经过期、什么时候该重新看一眼、新证据应该新增、覆盖还是只调低旧记忆的置信度。

一次真实交互,就此扩展为“召回—验证—选择—归因—更新”的一串样本,系统由此慢慢学会怎么记、怎么查、怎么用。

目标是让它从真实使用中回答三个问题:

  • 哪些信息值得长期保留?

  • 什么时机、以何种形式读取最有效?

  • 哪种行动能在当前不确定性与风险下获得更好的长期结果?

图 7|记忆策略与行为策略的联合训练管线。真实轨迹经失败归因和奖励分解后,分别更新写入、读取、验证策略与动作、技能、恢复策略。

4. 合到一起:操作任务上提升了什么

前面分别讲了模型层、Agent 层和动作层。落到操作任务上,记忆为 VLA 提供短时动作状态和长期物理经验,为世界模型提供更完整的状态和历史预测误差,也让 Agent、预测与执行始终基于同一个“现在”。这些能力结合起来,才能解决前文提到的几类典型失败。

动作做到一半就断片。机械臂伸过去的一瞬间,目标常常被自己的手臂遮住;拧瓶盖要转好几圈,插插头要经过对准、试插、微调几个阶段。只看当前几帧,既不知道目标去了哪里,也分不清这是第一圈还是第三圈,近似无状态的策略只能硬猜,或者退回起点重来。短时记忆将目标位姿、执行进度和接触反馈压缩成少量变量,让动作在遮挡中继续,中断后也能从当前阶段接上。

同一个物体反复试错。第一次摸索出柜门要“先抬再拉”,下次却又从零开始。物理经验记忆把方法沉淀为对象级经验,直接提供给 VLA,让一次试错变成可持续复用的经验。

做过的事又做一遍。杯子已经收进柜子,规划器却仍按旧状态寻找。动作结果及时写回共享状态,Agent、VLA 和世界模型才能基于同一个“现在”协作,避免重复劳动和过期决策。

把失败判成成功。抽屉究竟关好了,还是卡在最后两厘米?世界模型根据记忆中的完整状态预测动作完成后的结果,验证器再与实际观察比对;历史预测误差则帮助判断偏差是否异常。具体过程在下一节展开。

失败后不知道从哪里继续。验证发现这一步没完成后,任务轨迹中的检查点和状态可以帮助系统回到最近一个仍然有效的节点,而不是重启整个任务。

这些收益在长程任务中更明显,最终体现为更高的完成率、更少的重试和更强的失败恢复能力。

六、记忆如何进入 Agent Loop

具身操作不是“查一次记忆,然后按规则执行一串动作”。记忆被放进一个持续运行的循环:每一轮接收新观察、更新共享状态、按当前问题取用记忆,再由 BetaBrain 决定下一步。这个“下一步”可以是移动、抓取、调用技能,也可以是主动观察、验证假设、局部恢复、询问用户,甚至是停下来。下面描述的是几层互相嵌套的循环,不是流水线上的固定阶段。

图 8|BetaMem 的嵌套 Agent Loop。外层任务循环维护世界与任务状态,内层动作循环维持连续控制,验证结果决定继续、局部恢复或重规划;低频学习循环再用真实轨迹更新记忆与行为策略。

外层:维护共享状态

每一轮先把视觉、语言、机器人状态、上一个动作的结果和用户反馈整理成新证据,据此更新共享状态 S_t。状态里有目标实体与空间关系、任务进度、置信度、未决问题和风险,每条结论都带着证据来源和有效范围。BetaBrain 手上拿的从来不是一份开局定好就不再变的计划,而是一份随观察和环境持续修正的工作状态。

决策:动手、探索、验证、恢复,还是停下

BetaBrain 按需读取实体、情景、空间、技能或用户记忆,然后挑一个最有价值的动作。证据够,直接调用技能;缺关键信息,换个视角或主动探索;状态冲突,先验证;执行偏了,局部恢复或重新规划;风险太高、目标不清楚,就问用户。记忆在这里不只提供动作参数,它还改变了可选动作的范围、取信息的方式和停止的条件。

内层:短时连续控制

选定物理操作之后,VLA 或技能控制器进入一个快得多的循环,用前面说的动作—感知记忆连续产生细粒度动作,随时纠偏。对象的可抓取点、力度方向这类长期经验在进入循环前一次性给定,循环内部只处理秒级的接触与相位。它的节奏比外层任务循环高一到两个数量级——外层跟不上,也不需要跟。

需要外层介入的只有一种情况:局部策略救不回来。这时异常被写回共享状态,控制权交还 BetaBrain。

验证:决定下一轮从哪里开始

动作结束不等于任务完成。

World Model 先给出这个动作的预测后状态——依据的是记忆里的完整状态和这个物体、这个环境上的历史误差,而不只是当前一帧。验证器再拿它和视觉、力觉、位姿等真实反馈比对。误差可接受,就提交检查点、推进任务;只是局部偏差,就退回动作循环换视角、重定位、调技能;世界假设已经失效或风险超预算,就回到 BetaBrain 重新规划、停止或询问用户。多大的误差才算异常,也不是拍脑袋定的阈值,而是从这个物体、这个动作过去的偏差里学出来的。验证结果是下一轮的起点,不是流程末尾补的一道检查。

学习:让一次经历改变后续策略

任务轨迹会完整记录状态变化、证据引用、记忆读写、动作、恢复点和最终结果。低频的学习循环对失败做归因,把任务、证据、状态、恢复、风险几路反馈拆开,分别更新记忆策略和行为策略。反复出现的稳定模式,会从情景记忆抽象成经验或技能;一次偶然的失败不会被直接固化成普遍规则。新策略要先过离线评测和安全门控,才能进入后续任务的 Agent Loop。

组合:按用户、空间和任务加载

经验沉淀下来之后,还得能被管理和复用。BetaMem 按作用范围切分长期记忆:用户记忆存偏好和长期交互,空间记忆存房间布局和环境规律,任务记忆存找物、收纳这类任务的经验,设备记忆存具体设备的操作方式和安全约束。

执行任务时,BetaBrain 只围绕当前的用户、空间和目标组合相关模块。给某位用户做咖啡,它同时调用这位用户的口味偏好、厨房的环境记忆、咖啡制作经验和设备安全规则。各模块独立更新、独立做版本管理,按任务动态拼装——记忆边界因此清晰可控,长期经验也更容易复用。

七、四个任务,四种记忆

1. 拿一瓶可乐:实体记忆

BetaBrain 先从实体记忆里取出可乐的候选位置、最近一次观察的时间和置信度。位置够新、中间没发生可能改变场景的事,就直接导航过去;信息可能过期,就在靠近目标区域时先看一眼确认。

到了之后,视觉观察更新可乐的精确位置和可抓状态。这类瓶子之前抓过,记忆会一并给出可靠的抓取点和合适的力度,VLA 不必从零试探;抓取完成后,系统确认物体确实离开了原位并被稳定握住。回到用户面前,交付完成,任务状态才关闭。

这条链路看着简单,却把两条原则走完了:历史位置不是当前事实,动作结束不是任务完成。

2. 找钥匙:情景记忆

系统先围绕钥匙重建事件链:最后一次看到它是什么时候,之后用户去了哪些地方,打开过哪些容器,哪些区域已经找过。情景记忆做的是重建,不是逐帧回放——它要拼出对当前问题最有解释力的那条线。

搜索过程被写进任务状态,避免重复检查,每次观察都会刷新位置假设。找到之后,系统保留支撑结论的证据,再进入取物和交付。就算最后没找到,它也要说得清:查过哪些地方、还剩哪些候选、现在的不确定性有多大——而不是丢下一句“没找到”。

图 9|寻找钥匙的端到端证据链。每次观察都会更新候选状态,并改变下一步探索、操作和停止条件。

3. 照图找一件叫不出名字的东西:经验记忆

系统先从图片里提取视觉特征和可能用途,再去关联环境中见过的相似物件和摆放习惯。没有高置信度匹配时,就靠经验生成可验证的搜索假设——优先去放同类功能物品的区域,而不是把所有位置遍历一遍。

每次探索都会更新候选集合和已排除区域。哪怕这件东西此前没有名字,latent 视觉记忆也能做跨视角匹配,token 级状态则记下搜索的理由和进度。找到之后经用户确认,它的身份和常在位置就此固定下来。

4. 三十分钟的客厅整理:全部记忆

这是一类综合性的长程任务,前面所有机制都要在持续变化的真实环境里同时运转:

用实体记忆维护物品、容器和空间关系;

用情景记忆记录移动过程与异常事件;

用任务状态维护子任务依赖和完成条件;

用短时记忆支持连续导航与操作;

用 World Model 结合记忆里的完整状态和历史误差,预测动作效果并进行后状态验证;

用经验记忆选择技能、识别风险并恢复失败;

用巩固学习把反复出现的任务模式转化为更稳定的策略。

评价这种任务,光看“整理完没有”远远不够。还要看状态是否长期保持一致、有没有重复劳动、失败后能不能恢复、关键结论有没有证据支撑、平均耗时和安全风险如何,以及最重要的一条:用得越久,它有没有可测量地变好。

图 10|约三十分钟的客厅整理任务:多类记忆共同维护对象状态、任务进度、连续操作、异常恢复和经验沉淀。

八、几条技术线如何汇到一起

BetaMem 做的不是模块拼接,而是给模型记忆、Agent 状态、具身执行和反馈学习定义同一套接口:状态 S_t描述此刻的世界与任务,Agent API 统一观察、更新、读取、行动、验证、恢复,轨迹 τ 记录每一次记忆读写、动作、结果和奖励。

图 11|多条技术积累汇入同一 BetaMem 闭环:原型任务、模型侧记忆研究、Agent状态与主动探索 和长时多模态研究分别提供真实任务轨迹、跨时间证据利用、Agent 状态与主动探索,以及流式记忆与评测方法。

原型任务把实体、情景、经验三类记忆放进真实交互,产出从用户意图、环境观察到导航、操作、结果验证的完整轨迹。这些轨迹既是系统的输入,也是判断记忆写入、读取和失败恢复是否有效的基础数据。

模型侧记忆研究解决跨时间的关键视觉线索如何持续影响当前理解,按当前问题取用证据,避免反复读全量历史。

Agent 状态维护和主动探索负责跨步 TODO、BeliefState、场景快照、轨迹记忆和证据约束验证一起回答三个问题:还缺什么信息、去哪里拿、什么时候可以停。

长时多模态与评测把持续观察变成可更新的流式记忆,并用状态变化、观察缺失、相似物干扰、操作失败、任务中断等受控扰动,测量状态准确性、证据覆盖、重复探索、失败恢复和安全风险。具身大模型在任务尺度和分层推理上的进展也提供了参照:高层给出语义子目标、低层负责连续控制,两层各自需要时间尺度匹配的记忆。

接上同一套状态、API 和轨迹接口之后,BetaBrain、World Model、VLA、验证器和学习模块就能围绕同一组事实协作。评测也随之变化:不再只看最终成功率,而是能定位失败到底出在状态形成、记忆读取、动作执行、效果验证还是经验巩固。

图 12|长程具身记忆的实验协议:受控扰动、基线、消融、状态与证据指标以及恢复指标共同构成可复现评测。

结语:记忆的价值,在于它改变了什么

回到开头那只杯子。机器人转身就忘,不是因为它存下的东西太少,而是因为存下的东西从来没有变成“现在的世界是什么样”。

BetaMem 要改的就是这一点。token、latent 和参数化记忆被组织成同一份状态,进入模型注意、Agent 决策、VLA 执行、World Model 验证和反馈学习。这也不只是 Agent 的记忆:VLA 少了它,只能在几帧的视野里动作;World Model 少了它,只能凭当前一帧猜下一帧。模块各自专业,但共享同一个世界,在同一个闭环里演化。

从“拿一瓶可乐”到“整理三十分钟的客厅”,变的不只是步骤数量,而是对状态连续性、证据可信度、动作验证和失败恢复的全面考验。

记忆只有真正改变了智能体怎么看、怎么判断、怎么行动、怎么从结果里学习,它才是具身智能的大脑,而不只是它的档案馆。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐