「连接记忆、认知与行动」

目录

01    模型能力之外,还要有接手任务的系统能力

02    执行闭环:在真实世界的变化中,把任务做对

03    自进化闭环:让今天的经历,成为下一次任务的能力

04    双域认知领先,执行能力走向真机检验

05    端侧部署,让自进化走向本地

06    从一次接手,到长期协作


人把杯子和熊猫玩偶放进收纳篮,再将桌面恢复原状。接到开始指令后,机器人依次完成同样的收纳。用户没有逐步告诉它先抓什么、再放哪里、任务要求来自刚刚发生的人类行为。

这是理想 ME-Brain 的一段真实演示。从看到人怎么做,到理解任务、组织动作、检查结果, ⼀次简单的收纳背后,是认知、记忆与行动的连续协作。

一次示范怎样变成机器人自己的执行计划?现场发生变化,它又该如何继续?这些问题,把具身智能的要求从“模型能理解什么”,推向了“系统能完成什么”。

理想发布的MachEmbodied-Brain(ME-Brain)1.0,将这些能力纳入⼀套完整的具身系统。

两条相连的闭环构成了它的主线:任务执行闭环,让机器人根据目标与现场变化推进任务;经验演化闭环,让记忆与技能在交互中更新,驱动部署后的系统级自进化。

01    模型能力之外,还要有接手任务的系统能力

Agent = Model + Harness 已是常见的理解方式:模型提供能力,运行机制组织上下文、工具和执行。对机器人而言,这套机制还必须深入物理世界,把人的意图、环境变化和动作结果纳入同一条任务流程。

ME-Brain 的认知核心 Cognitive Core 由 ME-VLM 承担,在同一个模型中统一具身认知与多模态 Agent 能力。它理解现场,也组织任务;既决定下一步做什么,也判断上一步是否做成。

Action Model 将决策落实为机器人动作。其 Focus-VLWA 模型结合当前观察、视觉历史与局部未来预测,为执行提供依据。Evolvable Memory 则持续整理观察和执行经历,把即时状态、任务事件与可复用经验提供给不同模块。

这套协作让模型能力有了连续发挥作用的方式:人类示范可以成为任务来源,环境事件可以改变执行时机,动作反馈可以触发计划调整,积累的经验则能够进入下一轮决策。

02    执行闭环:在真实世界的变化中,把任务做对

真实世界不会严格按照计划运行。目标可能被移动,抓起的物体可能滑落,下一步操作所需的条件也可能迟迟没有出现。

一份开始时合理的计划,执行到一半就可能不再适用。机器人要把任务做对,必须能够判断现场发生了什么,并据此修正接下来的行动。

ME-Brain 的执行闭环,正是围绕这种不确定性建立的。认知核心结合当前场景制定计划,为子任务设置可观察的完成条件;动作模型执行后,新观察与执行结果返回认知核心,由它判断任务是否完成、能否继续,以及是否需要等待或重新规划。

“规划—执行—观察—判断—重规划—再执行”,让计划能够随着真实状态持续更新,而不是在动作发出后失去对结果的掌握。

这里最关键的能力,是对物理执行情况作出正确判断。夹爪闭合不等于抓取成功,物体移动了也不等于放到了正确位置。遮挡、接触关系和细微的状态变化,都可能影响结论。Cognitive Core 需要理解这些物理信息,才能区分动作已经完成、执行出现偏差,还是条件尚未满足。具身认知能力因此直接决定了闭环能否有效纠偏。

如果结果偏离预期,系统会进一步分析问题来自感知、规划还是动作执行,再更新任务进度与恢复策略。定位偏差和抓取后滑落需要不同的处理方式,不能简单重复同一条指令。重新规划的作用,就是把这些判断转成新的子任务与技能调用,让后续行动重新对准任务目标。

等待同样属于这一过程。在“等绿碗出现,再把勺子放进去”的 Demo 中,紫色碗、橙色碗先后进入工作区,系统没有贸然执行,而是保持监测。直到监测工具报告绿碗出现,Agent 才被唤起,重新获取现场图像,确认勺子和目标碗的位置,规划并执行放置,最后检查勺子是否入碗、夹爪是否释放。

这段演示呈现了条件未满足时的处理方式:先等待,再根据变化后的现场重新规划执行。等待、观察和行动被纳入同一条任务流程,系统不必强行沿着已经不适用的步骤往下走。

有效的调整还需要动作模型利用历史。Focus-VLWA 在视觉语言主干之外维护独立的视觉记忆库,从本轮轨迹起点到当前均匀采样最多 32 帧头部相机图像。动作表示通过交叉注意力查询相关历史,再用检索结果调节动作专家的中间特征;世界模型专家则预测下一次交互事件附近的局部变化。当前动作因此能够同时参考眼前状态、历史线索与局部未来预测。

闭环提高任务成功率的关键,就在于让执行反馈持续修正后续决策,减少错误沿着原计划累积。计划并不需要预先穷尽所有状况,但系统必须具备发现偏差、等待条件和调整行动的能力。

在这一执行机制之上,ME-Brain 还展示了从人类行为中获取任务的能力。在收纳 Demo 中,用户先将粉色杯子和熊猫玩偶放进白色篮子。系统记住示范,待物品被拿回桌面、用户发出开始指令后,重新观察现场,调用已有操作能力,依次完成收纳并检查结果。

人类示范提供了“做什么、按什么顺序做”的依据,执行闭环则负责结合当前环境将它落实。用户可以通过示范表达任务,而不必逐条描述动作;机器人仍然依靠观察、规划与结果验证来完成操作。

在执行闭环的支撑下,ME-Brain 进一步完成了长程手冲咖啡演示,并在一小时的抓取演示中,面向 100 多件物品累计完成 455 次抓取,该次演示成功率达到 100%。从多步骤的长程任务,到高频重复的持续作业,这些演示展现了闭环系统持续把任务做对的能力。

03    自进化闭环:让今天的经历,成为下一次任务的能力

接手一次任务,只是起点。

更进一步的问题是:机器人今天看过的示范、完成的操作、遇到的失败,能否改变明天处理任务的方式?

ME-Brain 通过 Evolvable Memory 与认知核心的协作,将能力积累延伸到部署之后。这里的自进化发生在系统层:无须每次交互后重新训练模型,系统就能更新外部记忆、技能及其调用策略,使后续决策拥有新的经验依据。

记忆因此不再只是保存过去的档案,而是参与能力更新的机制。

这条自进化路径从分层记忆开始。短期记忆保留密集的近期多模态状态,为局部执行提供历史条件;中期记忆将连续记录整理为关键事件和任务阶段,支持进度管理与失败恢复;长期记忆进一步提炼成功条件、失败模式和可复用经验,服务后续任务。

信息经过提炼,但证据不会被切断。完整任务、子任务与关键事件通过节点关联,中长期记忆仍保留通向底层记录的路径。系统既可以快速读取经验概要,也可以回到具体的视觉、空间与动作信息,判断这段经验是否适合当前场景。

决定经验价值的,是认知核心对执行过程的理解。同样一次“抓取失败”,定位偏差与抓取后滑落意味着不同的问题。认知核心把状态变化、完成情况和失败原因写入记忆,后续规划便能利用这些区别,而不只是重复读到一句“上次失败了”。

经验还会进一步改变技能库。按照报告描述的机制,经过反复验证的成功操作可以组合为可复用技能;已有技能的适用条件可以修订;持续失败的技能则被替换。系统积累的既是“发生过什么”,也是“什么条件下,怎样做更合适”。

前面的收纳 Demo 展示了这条路径的入口:人类行为被保留为视觉记忆,再用于机器人的规划与执行。在更完整的经验演化机制中,人类示范与自主执行反馈都能成为经验来源,经过整理、归因和复用,进入后续任务。

执行产生经验,认知解释经验,记忆组织经验,技能更新再影响下一次执行。“执行—获取—演化—再执行”,让两条闭环真正连成一体,也为机器人从“训练后固定”走向“部署后演化”提供了一条系统路径。

04    双域认知领先,执行能力走向真机检验

看懂人类行为、理解物理反馈、组织长程任务,对认知核心提出了双重要求:既有扎实的具身理解,也有通用推理与工具调用能力。ME-VLM 将两者统一在同一个模型中。

在技术报告所列具身模型的对比中,Cognitive Core 的 ME-VLM 35B-A3B 版本在物理认知与数字 Agent 两类评测上均取得多项最高分。

具身评测覆盖物理理解、长程规划、动作与执行、纠错四类能力。26 项基准中,ME-VLM 35B-A3B 在 14 项取得最高分或并列最高分,报告均分为 70.9,较所列最强对照高 8.2 分。

数字 Agent 评测覆盖多模态理解、工具与技能调用、长程规划、推理和指令跟随。16 项指标中,ME-VLM 35B-A3B 在 13 项取得最高分或并列最高分。其中,GPQA 为 78.7,AIME25 为 72.9,IFEval 为 86.9。

这种双域能力,为系统在物理场景中进行理解、推理与任务调度提供了模型基础。执行侧的表现,则进一步由记忆任务、双臂仿真和真机操作检验。

在涵盖计数、遮挡、历史指代与模仿的 16 项 RoboMME 任务中,ME-Brain 平均成功率为 47.88%,高于表中次高的 FrameSampling + Modulation(44.62%)。

在双臂仿真基准 RoboDojo 中,ME-Brain 接受了 54 种配置、共 1296 次试验。按五类能力等权汇总后,平均得分为 21.51、成功率为 16.03%,均为报告列出的五个系统最高,对照成绩来自官方榜单。其中,ME-Brain 的记忆维度成功率为 24.67%,表中次高为 9.11%。

团队自建的真机基准 ME-RealBench 使用 Piper 双臂机器人,六项任务各进行 10 次独立试验。ME-Brain 的平均成功率为 66.7%,平均得分为 69.5,均高于所测其他模型;相比 DMO.5,分别提升 11.7 个百分点和 12.8 分。

05    端侧部署,让自进化走向本地

一个能够长期积累经验的机器人,也需要在用户身边维护这些经验。环境观测、行为习惯与任务历史不断增加,本地生成和调用记忆,可以减少敏感信息在设备与云端之间的传输,缩短记忆访问链路。

通过与马赫 M100 的软硬件协同优化,ME-Brain 的记忆、认知和行动三个核心模块已分别验证可在端侧独立运行。其中,Evolvable Memory 已支持本地记忆生成、存储、演化和检索,认知核心也提供面向端侧的 4B 版本。

这让系统级自进化有了走向本地部署的工程基础。下一步,团队将继续推进整套系统的轻量化适配,让完整的认知、记忆与行动闭环在端侧协同运行。

06    从一次接手,到长期协作

ME-Brain 下一阶段要推进的,是让任务中的自主执行与任务之间的经验演化,在更长时间里持续运转。

随着交互增加,系统需要区分哪些经验仍然有效,哪些记录已经重复,哪些细节值得保留。后续将进一步研究记忆压缩、冗余清理与动态活跃度监测,结合任务相关性、访问频率和时效性管理记忆,在保留关键经验的同时控制存储和检索成本。

更长期的目标,是让本地记忆逐渐积累对用户偏好、行为模式和需求的理解,并随着生活环境与习惯变化持续更新。机器人与人的协作,也由此有机会从一次性的任务交付,走向带有经验积累的长期服务。

团队还将通过长期运行、环境变化和技能复用的对照与消融实验,检验记忆及技能更新对任务成功率、失败恢复能力和资源开销的影响,让自进化的收益得到持续、可量化的验证。

从看懂一次人类示范,到主动等待合适时机,再到根据执行结果调整计划,ME-Brain 展示了机器人接手任务的不同方式。记忆驱动的自进化,则让这些任务之间有了联系:新的执行会留下经验,积累的经验能够参与新的行动。

让大模型进入真实任务,既需要把眼前的事情做成,也需要让过去的经历继续发挥作用。ME-Brain 用两条相连的闭环,将可靠执行与部署后的持续演化纳入同一套系统。

项目主页:https://machembodied.com/ME-Brain/ME-Brain-1.0.html

项目github:https://github.com/MachEmbodied/ME-Brain-1.0

技术报告:https://arxiv.org/abs/2609.24271

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐