26年7月来自拓元智慧、中山大学和鹏城实验室的论文“PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution”。

视觉-语言-动作模型、世界模型和智能体规划器各自解决了物理智能的重要方面。然而,仅靠它们的组合无法提供通用的执行抽象、共享的状态表示、语义验证或跨异构具身的持久体验。ROS 提供消息传递基础设施,但任务级编排和结果解释仍然取决于具体应用。PhyAgentOS,是一个运行时基础架构,它为物理智能体提供调度、验证、内存管理、基准测试和安全性等系统级服务。PhyAgentOS 基于会话中心运行时构建,其中会话而非单个动作被视为调度、兼容性预检、监督执行、证据收集和验收的最小单元。

为了将认知规划与物理执行解耦,该系统将认知与物理的边界表示为一个文件系统。其“状态即文件”(State-as-a-File)协议将跨层状态具体化为嵌入 YAML 的人类可读 Markdown 文档,从而生成可检查和版本化的执行记录,而无需智体层和运行时层之间直接的代码依赖关系。这些协议视图共同构成一个统一的认知状态空间,该空间协调任务意图、运行时和目标能力、结构化环境状态、执行状态以及历史经验。这种共享状态使会话验证器能够通过发出基于证据的成功、失败或重规划的判断,来区分执行终止和语义任务完成。已验证的结果通过认知记忆整合为可重用的知识和纠正性经验教训,从而在会话之间形成一个闭环的试错循环,而无需重新训练神经模型。

基准测试重用与部署相同的会话、运行时和验证路径,使评估结果可追溯到实际执行过程。策略驱动和智体驱动的执行都受到分层安全架构的约束,该架构由兼容性预检、动作桥接、SafetyGuard、心跳监控和目标本地约束组成。验证过程遵循循序渐进的路径:首先利用游戏环境评估无底层控制的认知规划能力;其次,仿真引入物理动力学、延迟和具身控制方面的挑战;最后,真实机器人引入硬件限制、环境噪声和执行器误差等因素。所有层级的认知层均保持不变。PhyAgentOS 在 Optimus-67、StarDojo 和 DST-Dojo 上进行了认知规划基准测试,其统一协议已在超过 19 种机器人模型上得到验证,涵盖仿真和物理平台。在 LIBERO、Calvin 和 RoboCasa365 上的进一步评估表明,该系统在多种视觉-语言-动作模型中均展现出良好的可用性和性能提升。


如图 1 展示一种架构分离:三个独立的流程——感知到行动、预测模拟和高级推理——各自独立运行,没有共享的状态表示或通用的验证层。统一 PhyAgentOS 框架作为一个集成层旨在弥补这一差距。其中物理世界中人工智能的三种相互竞争场景:VLA模型(直接感知到行动)、世界模型(预测模拟)和智能体系统(高级推理和工具使用)。每种愿景单独来看都表现出色,但它们都无法提供跨范式验证执行、持久化记忆和隔离故障的架构层。
请添加图片描述

如图 2 正式展示现有中间件提供的功能与具身人工智能所需功能之间的差距。上排列出三种范式共有的三个结构性缺陷,下排则列出操作系统层必须提供的相应功能。其中具身人工智能操作系统的三大要求:统一的具身接口(左)、可靠的执行和验证循环(中)以及跨任务学习(右)。PhyAgentOS 通过显式的文件协议和适配器链、具有监督调度的会话中心运行时以及由多层持久内存驱动的自进化机制来满足每一项要求。
请添加图片描述

PhyAgentOS 的设计围绕着一个系统级问题展开,而这个问题仅靠策略模型无法解决:如何将高层意图转化为可执行、可中断、可验证且可跨异构目标重用的物理交互?视觉-语言-动作模型可以生成动作序列,基于 LLM 的智能体可以分解长时程目标,但这些能力本身都无法定义谁有权执行动作、如何检查兼容性、如何控制故障,以及如何返回执行证据以供后续推理。因此,PhyAgentOS 将具身智能视为一个协调的运行时过程,而不是单一的模型调用。

该架构将此过程分为两个推理层面。智能体层确定应该做什么:它解释请求、构建任务上下文、分解目标、选择执行方法和目标,并评估返回的证据。运行时层决定任务的执行方式:它验证执行契约、监督会话生命周期、维护观察-动作循环,并确保目标端的安全。共享的协议边界连接这两个层面,而不会引入直接的代码依赖。这种顺序——意图形成、受控执行和显式状态交换——为本节的其余部分提供了组织逻辑。

图 3 将 PhyAgentOS 展示为一个智体层和一个运行时层,二者通过共享的协议边界连接。这种分离是功能性的,而不仅仅是组织结构上的。上层将开放式的用户请求转换为可验证的执行合约;下层将该合约转换为与游戏、模拟器或机器人的有界交互。协议边界记录了切换过程和返回的证据,从而防止任何一个层依赖于另一个层的内部控制流。
请添加图片描述

智体层是 PhyAgentOS 的决策中心,但并非硬件控制器。它的职责是将不明确的自然语言请求转换为会话,以便在操作任何目标之前检查其执行要求。图 4 总结了这一转换过程。
请添加图片描述

会话编译完成后,职责从认知规划转移到受控执行。运行时层由四个阶段组成:WatchdogSupervisor、SessionRunner、SkillRuntime 和 Target。每个阶段都缩小了职责范围,从会话级治理到目标本地执行。

WatchdogSupervisor 是唯一的监控入口点。如图 5 所示,它声明待处理的会话,验证其运行时合约,创建运行器,监控心跳,传播超时或取消信号,并将最终结果写回协议边界。它特意不执行观察-行动循环。这种区别将调度和故障隔离限制在一个精简的监控组件中,同时允许执行策略独立演进。
请添加图片描述

如图6所示,SkillRuntime架构包含两个分支:PolicySkillRuntime和BuiltinSkillRuntime。
请添加图片描述

在 PolicySkillRuntime 流程中,策略负责生成智能动作,而 PhyAgentOS 负责确保这些动作可执行、安全且可追踪。会话编译完成后,智能体程序会留在底层循环之外。运行时会反复从目标获取观测数据,将其转换为模型的预期输入,调用推理,将结果转换为标准动作表示,并执行生成的动作或动作块。

在 BuiltinSkillRuntime 流程中,没有独立的策略服务器。智体通过受控的 TargetSessionHandle 参与在线工具循环——观察、决策、调用工具,然后再次观察。这种模式适用于离散游戏交互、基准测试编排、脚本化程序、机器人原语和系统自动化,其中下一步操作取决于符号状态或新返回的事件,而不是固定的连续控制策略。

尽管决策循环不同,但这两个流程最终汇聚于同一架构边界。它们都源自会话,由 WatchdogSupervisor 监督,针对预设目标执行,并以结构化证据包结束。这种汇聚至关重要:它使得语义验证、基准测试、故障诊断和长期学习能够独立运行,而无需考虑底层行为是由策略模型生成还是由智体引导的工具序列生成。

在智体和运行时职责分离之后,协议层的角色就变得明确了:它是连接二者状态转换的显式契约。协议并非额外的执行引擎,也不编码特定于目标的控制逻辑。相反,它记录请求内容、选择的功能和目标、系统当前观察到的内容以及从结果中学习到的信息。图 7 总结了五个主要的协议文档。
请添加图片描述

智体层、运行时层、双重执行流程和协议契约共同定义了一个完整的具身执行路径。智体层负责决策和编译;运行时层负责验证和执行;协议层记录交接过程和返回的证据;语义验证层则决定系统应该接受、恢复还是重新规划。PhyAgentOS 正是基于这种结构,支持在游戏、模拟和真实机器人之间实现透明执行,同时避免将模型智能与物理系统治理混淆。


架构确立了任务意图与物理执行的分离方式。剩下的问题是,如何使这种分离成为一个封闭的、自我改进的系统,而不是从规划到行动的单向流水线。PhyAgentOS 通过一系列机制来回答这个问题,这些机制作用于引入的显式协议状态。

首先,异构的观察结果、任务依赖关系、运行时状态和执行证据被投影到一个共享的认知状态空间中。
其次,会话验证器解释该状态,以确定已完成的执行是否真正满足了其语义目标。
第三,验证结果在各个会话中累积并整合为可检索的知识,从而将局部试错转化为长期适应。基准测试随后将相同的循环扩展为一个受控的实验过程,用于测量和验证自我演化。分层安全栈约束每个阶段,以确保增强的自主性不会导致不受控制的物理探索。

这种设计是经过深思熟虑的。只有当任务意图和物理证据在公共状态空间中表示时,验证才有意义;只有当存储的结果经过语义判断后,记忆才有用;只有当重复试验保持可比性、可归因性和可复现性时,基准测试才能支持演进。因此,以下各小节将依次从状态对齐到语义接受,从接受到经验巩固,再从经验巩固到系统评估和安全部署。

目标可能完成某个动作,但并未完成其背后的目标任务。例如,机械臂可能到达指令姿态并在容差范围内闭合,但未能成功抓取目标;反之,即使名义上的抓取基元报告失败,目标也可能通过计划外的接触到达目标区域。底层完成信号对于控制至关重要,但它们描述的是指令是否被执行,而非预期的世界变化是否发生。将这些信号视为任务成功会造成系统性的隐性错误:执行轨迹正常终止,而环境状态却偏离了目标

PhyAgentOS 将执行终止与语义接受分离。在 SessionRunner 达到终止条件后,SessionVerifier 会根据共享认知状态空间中的会话契约评估执行情况。如图8所示:运行时终止会生成一个证据包,而不是自动返回成功标签。验证器会比较任务意图、初始状态和终止状态、环境快照以及执行历史记录,以返回成功、失败或重新规划的结果。
请添加图片描述

两个持久化的知识接口区分正面经验和纠正性经验。KNOWLEDGE.md 存储已验证的成功模式及其适用条件、目标和运行时来源以及观察到的性能。lessons.md 存储以失败为中心的记录:失败的目标、相关证据、诊断出的原因、尝试的纠正措施以及该纠正措施是否随后得到验证。这种分离避免了常见的失败模式,即仅仅因为某个恢复假设被提出就将其视为事实。只有当其纠正效果得到后续验证时,该条目才能成为可重用的经验教训。

如图9 所示闭环试错法。会话证据经过语义验证、诊断、修订、重新执行,并整合为情景记录、语义知识和可重用方法。成功的实践案例存储在 KNOWLEDGE.md 文件中;经过验证的失败纠正措施存储在 lessons.md 文件中。

请添加图片描述

如图10所示将基准测试作为运行时编排。可用性门验证所需的模拟目标和策略运行时,编译器将任务-初始状态对具体化为会话,标准的 Watchdog-Runner-SkillRuntime 路径执行并验证每个回合。
请添加图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐