CoALA 这篇论文(Cognitive Architectures for Language Agents,普林斯顿团队 Sumers、姚顺雨等人提出)里划分的四层记忆——工作记忆、情景记忆、语义记忆、程序性记忆——现在几乎是数字 Agent 记忆系统设计的默认参照。LangChain 的 Memory 模块、Letta(原 MemGPT)项目,基本都是在这套划分下做工程实现。工作记忆对应当前任务的上下文窗口,情景记忆对应过去交互的历史记录,语义记忆对应知识库和事实性信息,程序性记忆对应工具调用方式和操作流程。这套划分好用,是因为数字 Agent 的"世界"本身就是符号化的——文本、API、结构化数据,记忆存取不需要额外的表征转换。

具身智能要直接套用这套划分,第一个卡住的地方是情景记忆。机器人的"经历"不只是一段对话历史,还包含它在物理空间里走过的轨迹、和物体接触的方式、动作执行成功或失败的过程——这些信息本质上是连续的空间和时序数据,不是文本。如果直接套用数字世界的做法,把情景记忆存成一段文字描述"几点做了什么",会丢掉后续决策真正需要的空间坐标和时序细节。这不是记录方式的取舍问题,是两种数据结构本身不兼容。

一个更现实的方案是在 CoALA 四层之外单独拆出两层:空间记忆,记录物体和环境的三维位置关系;时序任务轨迹记忆,记录动作序列执行的完整过程,而不是执行结果的文字总结。这两层是数字 Agent 完全不需要处理的维度,也是具身记忆系统真正的增量部分,而不是简单把已有情景记忆概念套过来就能解决。

“本体”(ontology)这个词在两个世界里说的不是一件事。数字 Agent 语境下的本体,指概念和概念之间的关系抽象,比如"用户"和"订单"这两个实体怎么关联;机器人语境下的本体,更接近字面意义的"身体"——关节结构、执行器的能力边界、物理约束条件。两种含义共用一个词,打通它们需要额外一层映射,目前没有成熟方案能把两边的"本体"统一到同一套表示里。

程序性记忆反而是相对容易迁移的一层。数字世界"怎么调用一个工具"和机器人世界"怎么执行一个技能",在结构上是类似的操作序列,都可以复用、可以组合。这也是为什么结构化技能库这条路线(VLA 落地的三条路径之一)能够比较自然地对应到程序性记忆这一层——技能库本质上就是把程序性记忆做成了可插拔的模块。

我们在 Octo 这边先做扎实的是数字 Agent 之间共享的 Context 和沉淀下来的经验(Preference,每次验收、打回积累的判断依据),这一层解决的是"多个数字 Agent 怎么共享同一份组织记忆"。往具身场景延伸的时候,物理世界要补的是空间记忆和时序轨迹记忆这两个数字世界不需要处理的维度,而不是从零重新设计一整套记忆框架——这也是我们看待这条路径延伸的基本判断。https://github.com/orgs/Mininglamp-OSS/repositories

情景记忆能不能同时兼容文本描述和空间坐标两种表征方式,还是必须拆成两套独立存储再在检索时做融合,这个问题目前没有定论,也是具身记忆架构里最不确定的一块。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐