基于长短期反思优化的可演化具身智能体在机器人操作中的应用
26年4月来自平安集团技术公司的论文“Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization”。
实现通用机器人需要赋予机器人根据环境和反馈进行适应和进化的能力。传统方法面临诸多局限性,例如训练量大、跨任务泛化困难以及缺乏可解释性。提示学习为无需大量训练、仅需反思过往经验即可实现机器人自我进化提供了新的机遇。然而,如何从任务的成功和失败中提取有意义的见解仍然是一个挑战。为此,提出可进化具身智能体(EEAgent)框架,该框架利用大型视觉-语言模型(VLM)来更好地理解环境和进行策略规划。为了增强对过往经验的反思,提出一种长短期反思优化(LSTRO)机制,该机制能够根据过往经验和新近学习的教训动态地改进提示,从而促进持续的自我进化,最终提高任务的整体成功率。
如图 1 所示,受人类学习过程的启发,特别是记忆在反思和适应中的作用,该方法将长期记忆和短期记忆作为 VLM 中的可解释提示结合起来。长期记忆积累通用知识以实现稳健的任务执行,而短期记忆则捕获最近的特定任务经验以动态改进性能。通过不断更新和整合这些记忆,智能体逐步提高任务成功率,以最少的试验实现定性的自我进化。
可演化具身智能体概述
可演化具身智能体(EEAgent)框架旨在使机器人能够理解其环境,并根据人类指令和通过机器人光学模块获取的环境信息,协调一系列物理操作。EEAgent 利用大型视觉-语言模型(VLM)来促进视觉反思,这对于高级自演化至关重要。如图 2 所示,EEAgent 由两个核心模块组成:(1)环境解释器 F_ei,负责解释当前环境与所提供指令之间的关系。(2)策略规划器 F_pp,负责根据环境信息和指令生成动作序列 A。为了解决记忆提取的挑战,引入长短期反思与优化(LSTRO)算法。

环境解释器
理解环境是机器人操作的关键步骤。在本研究中,利用ChatGPT-4o [5](一种复杂的视觉语言模型)来实现环境解释器F_ei。如图2所示,首先利用LLM的函数调用能力生成一系列函数工具。具体来说,本研究定义四种类型的函数工具:(1)extract env entities():使用SAM[22]实现,从当前环境中提取物体实体。(2)image match():当指令中指定视觉实体(图像)时,该函数(使用VLM)识别环境中最佳匹配的实体(最相似的物体)。如图2所示,提示信息将存储记忆。此外,VLM还会生成目标图像的特征描述以进行自我进化。 (3)语义匹配():用于指令中实体以文本形式描述的情况,例如“将棋盘格圆片放入黄紫色波点盘中”。它使用VLM实现,其提示结构和工作机制与图像匹配()类似。(4)场景匹配():此函数处理多对多实体匹配(例如,“重新排列到此场景”任务)。它的实现方式是迭代地使用这两个匹配工具,将指定场景中的每个实体与当前环境中对应的实体进行匹配。
策略规划器
策略规划器 F_pp 旨在生成一系列可执行操作。该模块使用LLM实现,如图 2 所示。与匹配工具(例如图像匹配())类似,策略规划器的提示信息包含任务描述、原则、建议和输出格式。然而,与 image match() 不同,策略规划器利用基于任务特征的预定义动作库,使 LLM 能够使用有限的可用动作集生成满足指令的动作序列。由于实验是在 VIMA-Bench [20] 上进行的,可以为动作库定义两个动作:PickPlace 和 PickRotate。每个动作都附带描述和参数要求。例如,PickPlace 的描述是“抓取物体并将其移动到指定位置”,需要参数“抓取位置”和“放置位置”。此外,还提供示例来指导正确的动作序列生成,并限制 LLM 以 JSON 格式输出序列。使用此策略规划器,可以有效地根据环境信息和用户指令生成可执行的动作序列。
长短期反思与优化
- 总体策略:为了缓解基础模型与物理机器人系统之间的差异,存储包含外部知识的记忆至关重要。受人类认知中区分长期记忆和短期记忆的启发,为智能体的知识提出类似的结构。长期记忆(LM)存储适用于各种任务的通用经验集,而短期记忆(SM)则存储特定于任务的信息。随着时间的推移,短期记忆可以逐渐整合到长期记忆中,从而增强智能体的知识库。此外,基于任务成功和失败的反思过程使智能体能够利用有价值的见解更新这两个记忆系统。
为了通过动态更新EEAgent中的提示(以自然语言描述的过去经验记忆)来增强任务的自我进化能力,提出一种长短期反思与优化(LSTRO)方法。如算法1所示,环境解释器和策略规划器都整合LM和SM。LM旨在概括具有全局相似性的原则或环境。而SM仅包含针对当前指令和环境的具体建议。在本研究中,假设反馈要么成功要么失败,并且两者采用不同的策略。成功:反思过程包括总结成功经验并将其整合到学习模型(LM)中。失败:首先定位错误,然后提取失败经验中的原则和建议,同时更新长期记忆(LM)和短期记忆(SM)。长期记忆(LM)影响跨任务,而短期记忆模型(SM)仅影响当前任务。通过这一过程,具体的短期记忆模型(SM)经验逐渐整合到长期记忆(LM)中,最终转化为能够提升整体性能的通用原则。
2)错误定位:当系统任务失败时,定位错误源至关重要。本研究提出两种检测环境解释器和策略规划器中错误的方法。
(a)图像描述一致性:环境解释器中的错误通常源于图像匹配函数(image match()),其中视觉-语言模型(VLM)可能难以识别细粒度的图像特征。为了解决这个问题,提出一种图像描述一致性方法。具体来说,通过在测试图像和参考图像中添加额外的描述性特征,可以引导 VLM 关注更精细的细节。然后,LLM评估这些描述的一致性。如果它们匹配,则认为图像匹配过程成功;否则,此步骤中可能存在错误。本质上,该方法将基于 VLM 的感知与思维链推理相结合,利用额外的图像特征描述来增强错误检测。
(b)动作到指令的一致性:对于策略规划器,提出了一种动作到指令的一致性方法。在此方法中,LLM 根据已执行的动作重新生成指令,然后将其与原始指令进行比较。如果指令匹配,则原始动作很可能是正确的。如果不匹配,则该动作很可能是错误的。本质上,这种方法利用少样本学习来调整LLM生成的操作,从而减少潜在错误。
3)反思:EEAgent框架基于成功和失败的反馈进行反思[27]。对于成功案例,系统会使用特定的提示来引导LLM总结有效的成功经验,并将这些经验存储在长期记忆中以提升未来的表现。考虑到环境解释器或策略规划器可能会多次执行,所有过去的对话都会被连接起来,使LLM能够总结出成功经验中最简洁、最有用的方面。对于失败案例,LLM会回忆相关的记忆,诊断失败的根本原因,并生成可操作的建议来改进任务执行。此外,LLM还会生成简洁有效的经验总结,以防止在未来的任务中重复出现错误。
- 优化(记忆更新):本研究提出一种基于过去经验(在反思过程中进行总结)的洞察,动态更新智能体提示信息的方法,从而实现智能体的演化。本文方法更进一步,解决LLM生成反思信息中固有的不确定性。反思信息可能与现有记忆存在冗余或矛盾,而LLM的输出容易产生幻觉,这会进一步增加不确定性。随着时间的推移,这些问题可能会降低反思信息在未来类似任务中的相关性。首先利用LLM评估反思内容的通用性。一旦内容通过评估,便将其与现有记忆相结合。LLM随后整合语义冗余信息并解决矛盾。这一过程最终生成一个精炼的长期记忆列表,其中包含新知识和现有知识。此外,为了应对视觉语言任务的复杂性,将存储的记忆数量限制在一个固定的最大值。
实验设置
为了验证方法,使用 VIMA-Bench 基准测试集 [20],该测试集提供一系列涵盖视觉理解和任务规划的多样化任务。具体来说,从 VIMA-Bench 中选择六个子任务进行评估(如图 3 所示)。这些子任务包括:(1)将 {object1} 放入 {object2};(2)将 {scene} 中具有 {texture1} 的物体放入具有 {texture2} 的物体中;(3)将 {object1} 旋转 {angles} 度;(4)重新排列物体以匹配指定的 {scene};(5)将物体重新排列成特定配置,然后将其恢复到原始位置;(6)将 {object1} 放入 {object2},然后放入 {object3},最后将它们恢复到各自的原始容器中。这些任务与 Instruct2Act [19] 中使用的评估协议一致。 VIMA-Bench 还提供一个四级泛化评估协议,包括 L1(位置泛化)、L2(组合泛化)、L3(新对象泛化)和 L4(新任务泛化)。评估设置的更多细节可在 [20] 中找到。系统基于 ChatGPT-4o 接口构建,并使用 SAM 的大型版。最大试验次数和最大长记忆容量分别设置为 3 和 20。值得注意的是,该系统不涉及任何局部模型训练或推理。
基线
为了全面评估方法,对三种类型的方法进行了比较:(1)基于 LLM 规划的方法:在此类别中,比较 CaP [9]、Instruct2Act [19] 和 CLIN [16]。虽然 Instruct2Act 可以直接应用于 VIMA-Bench,但 CaP 和 CLIN 是在 Instruct2Act 的基础上进行的特定修改。 (2)基于学习的方法:比较几种基于学习的方法,包括 VIMA-20M [20]、VIMA-Gato [28]、VIMA-Flamingo [23] 和 VIMA-GPT [13]。(3)提示策略:为了评估提出的 LSTRO 方法对具身智能体的影响,评估本文提出的具身智能体框架内的各种提示策略。这些策略包括:(a)没有 LSTRO 的普通具身智能体(Vanilla EA),(b)思维链提示(CoT-Prompt)[25],(c)基于排序的自洽性(SC),(d)基于选择的 SC,(e)基于反思的 SC [24]。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)