26年9月来自浙大、南航、Cornell大学、宇泛智能(Universal Ubiquitous AI Co)、新加坡国立和杭州云深处科技(DEEP Robotics)公司的论文“EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents”。

视觉-语言-动作(VLA)模型将视觉观察和语言指令直接映射到机器人动作,但长时程任务需要的不仅仅是动作预测。智能体必须协调感知、规划、执行、进度验证和恢复,以适应物理状态的演变。动作预测或模型生成的技能决策本身并不能保证所提出的操作在当前状态下有效,也不能保证其结果能够得到验证。EmbodiedSkills,是一个统一的框架,它将每个技能决策视为一个执行方案:运行时在执行前检查其前提条件,并在执行后验证结果。一个共享的可执行技能接口将高级技能选择、有界的低级 VLA 执行和动作后验证连接在一个智能体循环中。由于该接口保持不变,因此可以在不改变智能体循环的情况下替换或调整低级 VLA 策略。该接口还将规划、执行、验证和恢复事件记录为结构化轨迹,这些轨迹为各个组件提供监督,并在有交互式反馈时支持可选的在线调整。其在 RoboTwin 2.0 和 LIBERO 平台上,使用 Qwen3-VL 和 OpenPI/π0.5 实例化 EmbodiedSkills。任务自适应的底层 VLA 策略在 50 个 RoboTwin 2.0 任务中取得 86.20% 的平均成功率,在四个 LIBERO 测试套件中取得 97.40% 的平均成功率。这些结果验证 EmbodiedSkills 中使用的任务自适应底层 VLA 策略的执行性能。在四个记忆相关的 RMBench 任务中,相同的任务自适应执行方法取得 12.5% 的平均成功率。该框架提供了一个可训练和可检查的智能体层,用于将这些策略转化为闭环具身系统。


如图 1 所示EmbodiedSkills概述。EmbodiedSkills通过可执行技能协调观察、规划、验证、执行、确认和恢复,将底层VLA策略转换为闭环的具身智能体。高层策略提出结构化操作,而受保护的运行时环境验证并执行这些操作,并将执行后的反馈记录为结构化轨迹。
请添加图片描述

EmbodiedSkills 将具身 VLM-VLA 系统构建为一个受保护的有限阶段控制器,该控制器控制可执行的具身技能。高层智能体策略读取任务、当前视觉证据、循环状态和阶段允许的技能,然后选择一个结构化操作。底层 VLA 策略将活动子目标、当前观察结果和机器人状态映射到一个有界动作块。运行时检查每个提议的操作,将其结果记录为显式工件,并在依赖工件的上下文发生变化时使其失效,并将更新后的状态暴露给下一个决策。模型、环境和 VLA 策略适配器在具体实例化中保持此接口。

如图 2所示 高层 VLM 分解指令,选择可执行的子目标,并根据后操作观察结果验证进度。底层 VLA 策略将每个活动子目标作为有界动作块执行。
请添加图片描述

1 智能体状态和技能决策

一个episode从自然语言指令 x 和环境 E 开始。在循环步骤 t,方法级状态为:

s_t = (z_t, M_t, H_t) ,

其中 z_t 是当前阶段,M_t 是可用任务工件的集合,H_t 是有序的循环轨迹。工件可能包括当前观测值、可选的感知和接地结果、世界状态、完整任务计划、活动子目标、预检证据、动作块、执行报告、验证报告和恢复上下文。

策略接收一个部署一致的紧凑上下文:

C_t =Ψ(x,z_t,M_t,H_t),

其中 Ψ 保留完整计划、活动子目标、当前工件摘要、最近的错误以及最近决策和技能结果的有序、有界摘要。较旧的条目在固定的历史预算下被压缩或丢弃,而当前计划和子目标保持显式。原始模拟器内部数据和无界日志不会插入到策略上下文中。

该策略从状态相关的动作集中选择一个结构化决策:

A_t = G_state(K_z_t,s_t),

仅公开与当前 d_t ∼ π_θ(· | C_t,z_t,A_t) 兼容的选择,其中 K_z_t 是阶段 z_t 的配置技能集,G_state 是工件。该策略有三种控制类型:

d_t ∈ {RunSkill(k, q), AdvanceStage, FinishRun},

其中 k 是一个允许的技能,q 是其有效载荷。因此,技能执行、向前推进和终止共享一个结构化决策接口,而基于证据的重新路由仍然由运行时控制。

2. 可执行技能契约

每个具身技能都由以下契约表示:

k = (X_k, Y_k, pre_k, exec_k, post_k, fail_k) ,

其中,X_k 和 Y_k 是类型化的输入和输出模式,pre_k 定义先决条件,exec_k 是可执行操作,post_k 指定最终的状态更新,fail_k 将失败映射到明确的状态和证据。工件携带来源和新鲜度信息,因此观察结果、计划和操作不会在其依赖关系发生变化后被静默重用。该契约适用于模型支持的技能和确定性操作,并防止文本提案被误认为是物理状态转换。

在调用时,契约定义技能可以使用的状态和证据;调用后,它确定输出、副作用和失败如何成为共享任务状态的一部分。因此,模型生成的结果在模式和先决条件得到验证之前,都被视为提案。成功的输出会成为可支持后续技能的类型化工件,而失败的输出则作为明确的证据供下一个策略决策使用。这使得学习到的感知、规划、验证和动作生成可以组合,而无需假设它们具有相同的内部表示。

同样的契约也定义了失效边界。当观察结果、活跃子目标或执行结果发生变化时,只有依赖于已更改证据的工件需要更新。因此,循环可以重用仍然有效的上下文,同时防止过时的预测授权新的物理动作。因此,技能契约同时充当组合接口、运行时有效性边界和结构化训练轨迹来源。

3. 阶段结构技能空间

运行时使用有序阶段集:

Z = (观察、计划、预检、执行、验证、恢复)

这些阶段描述了循环的语义结构,而非一个僵化的单遍程序。当新的观察结果、执行结果或验证证据使当前计划失效时,策略可能会重新访问之前的阶段。

接地取决于任务和策略,而不是全局固定为源-目标对。一个任务可能不需要显式对象绑定,也可能只需要一个交互对象、多个对象或多个目标。直接基于语言的 VLA 策略可以根据图像、机器人状态和子目标文本进行操作,而基于几何的控制器可能还需要显式对象或区域绑定。

4 受保护的运行时转换

策略提出决策,而运行时定义其执行语义。由于这三个控制具有不同的不变性,使用单独的保护机制。这种分离使得学习的策略能够在有意义的操作中进行选择,而无需让提示本身负责执行安全或状态一致性。

5 有界动作执行

在 Execute 中,底层 VLA 策略将活动子目标、当前观测、机器人状态和就绪证据映射到一个动作块和一个执行报告:

(g_t, O_t, F_t) −→ a_t −→ e_t,

其中,g_t 是活动子目标,O_t 是当前观测,F_t 是预检证据,a_t 是提议的动作块,e_t 记录其观测结果。一个动作块是一个有界命令序列:

a_t = (τ_t, U_t, H_t, η_t), U_t = [u1_t,…,uH_t_t],

其中,τ_t 是动作类型,H_t 是视域,η_t 将动作块与其子目标和观测上下文关联起来。令 Σ_p 表示策略模块 p 公开的动作模式。运行时仅在以下情况下接受一个数据块:

R_act(a_t, s_t) = 1[0 < H_t ≤ H_max]1[a_t |= Σ_p] · 1[fresh(a_t; g_t, O_t)]1[valid(U_t)]。

此操作会检查策略特定的动作类型和维度、数值有效性、执行范围以及与当前子目标和观测结果的一致性。执行完一个数据块后,循环会获取新的证据,然后再决定下一步操作。因此,一个语义子目标可能需要多个有界数据块,而不是被强制限制在一个动作范围内。

6 验证与恢复

验证仅使用最新动作块之后捕获的证据来评估当前活动子目标。它预测一条语义路径,路径包含以下集合:

V = {前进,继续,重观察,重规划,恢复,完成}

该路径要么推进计划,要么保留当前子目标以供另一次有界尝试,要么刷新场景证据,要么修改计划,要么进入恢复状态。恢复使用相同的显式任务状态和失败证据来生成修改后的执行上下文,并在执行下一个物理动作之前再次检查该上下文。整体任务成功与否仍然由环境的评估协议定义,而不是由局部子目标的判断定义。

如表1 所示EmbodiedSkills 的六个阶段。每个阶段都会暴露一组语义操作,而运行时会检查这些操作所需的证据是否有效。
请添加图片描述

7 算法概述

算法 1 概述 AgentLoop。在每个步骤中,策略接收精简状态和可采纳的技能。运行时保护机制会阻止缺乏有效证据的决策,并且每个操作结果都会附加到后续决策使用的有序跟踪中。
请添加图片描述

8 模块化接口

EmbodiedSkills 结合了类型化的任务状态、阶段结构化的技能接口、运行时验证、轨迹日志记录、环境适配器和动作策略模块。感知、规划、动作生成、验证和恢复可以使用带有阶段特定适配器的共享基础模型,也可以使用独立的模型,前提是它们的输入和输出遵循相同的技能和状态契约。


EmbodiedSkills 通过显式接口公开规划、技能选择、执行、验证和恢复。这种结构允许学习到的组件独立进行调整,而无需一个端到端的优化过程。在实例中,组件级监督是主要的训练机制。当交互数据和可靠的环境评估器可用时,相同的轨迹接口也支持可选的闭环策略优化。

1 组件级监督式自适应

规划器经过训练,能够将任务指令和当前视觉上下文映射到一系列有序的可执行语义子目标。子目标指定应达到的物理状态,而底层 VLA 策略则在运行时检查下生成用于达到该状态的动作序列。因此,监督机制避免在高层计划中嵌入特定于模拟器的控制细节。

底层 VLA 策略通过子任务级别的演示进行单独调整。每个训练示例将观测结果和机器人状态与当前子目标及其对应的动作序列配对。在部署时,策略通过 Execute 接口接收相同类型的子目标条件上下文,并发出一个有界动作块。一个语义子目标可能需要多个动作块:每个动作块之后,都会收集新的证据,验证器决定是继续执行还是循环前进。

对于高层控制,在保持底层 VLA 策略冻结的情况下,监督基于部署一致性决策轨迹的 Qwen3-VL 调度器。每个示例都基于任务、可见观测结果、紧凑的任务状态、最近的有序历史记录以及当前阶段允许的技能。目标是阶段性技能决策及其结构化论证,包括循环是否应继续当前子目标、推进计划或请求修改后的上下文。冻结底层视觉语言分析 (VLA) 策略将此 SFT 阶段与持续控制学习隔离:它改进了状态条件调度和技能使用,而无需改变底层动作的生成方式。

其他学习的决策可以使用相同的分解方法。例如,验证器可以根据执行后的观察结果和子目标完成标签进行调整,而外部调度器可以根据有效的技能选择及其运行时结果进行调整。这些组件可以共享一个基础视觉语言模型,同时使用特定于阶段的适配器;运行时契约在不同的适配器之间保持不变。EmbodiedSkills 不要求所有组件都进行联合训练,在适当的情况下可以使用确定性组件或外部提供的组件。

2. 与部署一致的训练样本

训练样本遵循与已部署组件相同的输入边界。对于时间 t 的模型决策,记为:

x_t = (g, z_t, I_t, set, K_t, h_t), y_t = 组件决策,

其中,g 是任务指令,z_t 是当前阶段,包含该调用可见的图像,set 是紧凑的运行时状态,K_t 是可接受技能的集合,h_t 是紧凑的最近循环历史记录。组件仅接收与其接口相关的字段。具体而言,规划器接收规划上下文,验证器接收活动子目标和最新的执行后证据,调度器接收可接受的选择以及最新的工件和错误。

技能输出、环境反馈、先前的决策和运行时错误按其原始时间顺序保留为条件上下文。在数据构建和部署过程中应用相同的历史压缩规则,因此组件不会使用在测试时缺失的证据进行训练。对于视觉语言监督,损失仅应用于学习组件生成的token;提示、图像、工具结果和环境消息是上下文,而非预测目标。这保留了策略提案和运行时提供的证据之间区别。

3 可选的闭环自适应

完整的 AgentLoop 还可以收集交互式轨迹。一个episode包含模型决策、已执行的技能和观察到的结果:

τ = ( (x_1,y_1),…,(x_T,y_T),e_1:T,R),

其中 e_1:T 是类型化的运行时跟踪,R 由环境适配器提供,并在适用时包含对无效智能体决策的显式惩罚。基础设施故障与智能体策略故障分开记录。在智能体级自适应过程中,底层 VLA 策略可以保持不变,这样优化过程就可以在不改变连续控制器的情况下改变高层决策。

组内相对策略优化(GRPO)是一种支持的机制。给定 M > 1 次相同任务条件的部署,可以在组内对回合得分 A_i 进行归一化。

对于决策 t 生成的token j,令 ρ_i,t,j 为更新策略与部署策略之间的似然比。掩码裁剪目标函数定义为 L_online。

episode级的归因必然较为粗略:相同的收益会被分配给多个决策,而这些决策的因果贡献可能并不相同。因此,其将在线优化视为一种可选的细化机制,而不是组件级监督的替代方案,也不是本文主要结果的来源。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐