26年7月来自中国电信TelAI的论文“From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence”。

这是一篇路线图(Roadmap)综述类论文,不提出完整可运行模型,而是梳理开放世界物理智能领域现状,诊断行业三大核心鸿沟,提出Embodied Brain(具脑)+Physical Harness(物理适配层)的分层栈架构,定义接口契约,给出协同演进研究路线。

核心思想:当前 VLA、世界模型一味扩大模型参数量、轨迹数据规模,并不能带来可复用、可累积的物理智能;真正瓶颈在于模型‑数据‑系统之间缺少显式语义接口契约,推理、控制、感知、执行强耦合,更换机器人硬件就要重训模型。需要把高层物理推理与硬件专属执行解耦。

一、核心内容与方法

1. 域演进梳理

作者梳理四条技术发展脉络:动作策略模型 → 语义对齐模型 → VLA 视觉语言动作策略 → 世界模型 → WAM 即世界-动作模型(World Action Models)。

如图 1 所示从WAM研究到具身大脑和协同演化的物理智能堆栈,系统层面的发展趋势是:WAM 为研究干预条件预测提供一条途径,而具身大脑仍然是可重用物理推理和意图形成的更广泛目标。
请添加图片描述

VLA:输入多模态观测直接输出机器人执行器动作向量;缺陷:动作带来的物理后果是隐式的,不对外暴露,难以做规划、校验、故障恢复、跨机器人迁移。

WAM 世界-动作模型:给定当前物理上下文 + 候选干预动作,显式预测该干预带来的物理后果(状态变化、接触、不确定性、有效时间范围、参考坐标系)。输出可以是视频、几何、隐式潜变量,不强制视频生成,关键是输出要服务决策。

WAM 是当前原型,Embodied Brain 具脑是长期目标;具脑不输出执行器指令,输出意图:期望状态变迁 / 能力调用请求。

2. 诊断行业三大耦合鸿沟(Three Coupled Gaps,如图 3/7所示)

请添加图片描述

模型与表示鸿沟(Model and representation gap) 没有收敛 WAM 该输出什么信息;很多模型只模仿行为,不跟踪物理状态、接触关系、不确定性;模型推理逻辑和机器人本体形态、控制器深度绑定,换硬件就要修改模型输出头、重新训练。

目标与标准化鸿沟(Objective and standardization gap) 仅用任务最终成功率无法区分成功来源:是物理推理强?还是控制器强?还是 benchmark 捷径?数据集、任务、评测协议不统一;缺少统一语义记录干预、预测后果、观测结果;大量数据无法跨项目复用。

生态与系统鸿沟(Ecosystem and systems gap) 物理 Agent 没有像数字大模型 Agent 那样成熟的工具调用运行时;预测、规划、控制器、校验、内存全部耦合在项目私有系统;组件不能插拔替换。

3. 提出完整物理智能栈(Physical‑intelligence stack)分层方案

整套系统分为五大功能模块,强调功能解耦而非一定物理模块化,可以联合训练,但接口语义必须可观测。

1 Embodied Brain 具脑(高层推理模型) 输入:观测、任务、记忆、机器人能力描述; 输出:意图表征(intended state transition /capability request),包含实体、坐标系、约束、不确定性、完成条件;不输出关节 / 执行器命令,不负责高频硬件控制。WAM 为具脑提供预测能力原型。

2 Physical Harness 物理适配层(物理运行时 / 调度中枢,类比数字 Agent 的工具 Harness) 核心职责:把具脑抽象意图落地到真实硬件;完成坐标系对齐、能力解析、预条件校验、调用工具 / 控制器、执行监控、故障恢复;生成 Trace Card 记录全部交互过程。 区分:Tool Model(抓取规划、仿真、状态估计等算法模块) vs Tool(真实硬件 / 外设,夹爪、移动底盘);Harness 维护能力注册表,做分层能力拆解。

3 三套标准化记录契约(Cards,轻量语义规范,不强制统一文件格式)
Embodiment Card:机器人本体描述,传感器、坐标系、安全限制、可用工具;
Task Card:任务目标、约束、成功 / 失败模式;
Trace Card:完整可回放交互轨迹,记录意图、翻译过程、工具调用、校验决策、真实结果、失败归因。

4 闭环后训练 Closed‑loop post‑training 只有经过校验准入(admission gate)的高质量 Trace,才允许回灌训练;设置回归与安全闸门,防止模型把错误经验不断放大。

5 分层评测体系 Layered evaluation 不再只看端到端任务成功率;拆解多层指标:物理预测保真度、脑‑harness 意图对齐、控制器执行、工具编排、安全校验、可追溯性、自迭代安全性。

如图 2所示从预测到物理执行的接口。WAM原型评估干预后果;具身大脑形成意图;而装置则将能力落地、协调执行,并将结果记录在追踪卡中,以便进行评估和学习。
请添加图片描述

如图 16 所示为受限冲击任务的物理能力分层组合。该装置将一个意图分解为机械臂、机械爪和外部工具的调用。能力契约揭示框架、限制和故障模式;执行状态通过跟踪卡返回,用于诊断和学习。
请添加图片描述

如图4所示具身-模型族中的角色和预测接口。上图根据其主要系统职责区分动作模型、VLA策略、世界模型、WAM以及具身大脑目标。下图比较显式预测、预测性潜表征以及潜转换(transition)或动作接口。这些类别可能存在重叠,并且并非线性历史顺序。
请添加图片描述

如图 14 所示物理驾驭的内部职责包括:将大脑意图接地、对齐实体(entities)和框架(frames)、解析功能、检查前提条件、同步控制器、监控执行过程并记录跟踪卡。运行时内存、功能注册表和已允许的跟踪信息支持自适应和路由。
请添加图片描述

4. 近期研究里程碑(Near‑term milestones)

落地WAM 预测契约:模型输出附带预测时域、参考系、不确定性,并且证明预测确实提升干预决策质量;
构建可验证的 Brain‑Harness 表示接口:支持替换工具 / 机器人本体,测量适配器开销;
实现自适应 Harness 与 Trace 生态:Trace 可以把失败归因到「意图错误 / 翻译错误 / 工具选择错误 / 环境扰动」。

如图 12 所示从具身大脑能力到生态系统协调的五-阶段协同演化路径。实线蓝色箭头表示设计依赖关系,灰色线条将每个阶段与其职责分组,虚线绿色箭头返回到模型、利用和任务/评估设计的相关路径。
请添加图片描述

二、论文主要贡献

如图 11 所示具身大脑与周围物理智能堆栈之间的功能边界。传感器和身体状态为模型预测和决策提供信息;该组件管理内存、路由、日志记录、验证和功能调用;工具模型、控制器和验证器协调与物理环境的交互。
请添加图片描述

1 问题诊断层面:识别物理智能规模化的核心瓶颈不是算力与数据规模,而是耦合的三大鸿沟 指出单纯堆参数、堆机器人轨迹数据集无法带来累积式技术进步,这是对当前 VLA 范式重要反思。区分「模型容量提升」和「能力可复用、组件可替换」两个不同目标。

2 定义 WAM 预测契约(WAM prediction contract) 重新定义世界动作模型 WAM:重点不是输出模态(视频不是必选项),而是输出对决策有用的干预后果,附带时域、坐标系、不确定性、有效性条件;区分「预测后果」和「直接输出执行动作向量」,厘清 WAM 与 VLA 模型边界。

3 提出 Embodied Brain + Physical Harness 的分层系统范式
高层具脑只输出意图请求,剥离硬件相关细节;底层 Harness 承担物理世界适配、工具编排、校验、故障记录;
借鉴数字 Agent 工具调用 Harness 思想迁移到机器人,把物理推理与硬件执行解耦;更换控制器、夹爪不需要重新训练高层推理模型,仅修改 Harness 适配器。

4 提出三套契约卡片(Embodiment/Task/Trace Card)与分层评测框架 不强制统一存储格式,聚焦语义契约,让异构数据集、benchmark、机器人的经验可以相互比较; 把评测从单一任务成功率拆解为多层证据,实现失败归因;提出闭环训练的准入闸门机制,规避自强化错误。

5 完整可演进的路线图 给出从现有 WAM 原型向未来具脑演进的可落地技术路径与可验证实验指标,不是空想式 AGI 设想;明确哪些是现在可做的原型,哪些是长期目标。

如图 13 所示大脑模型、驾驭和外部功能的运行时组织结构。驾驭通过工具注册表和验证器门路由请求,调用感知、规划、控制或安全模块,并将调用、结果和故障记录在跟踪日志中。
请添加图片描述

三、论文局限与存在问题

1. 概念框架层面,缺少具体实现方案

属于路线图综述,没有给出具体模型、没有开源实现,全部是概念与接口规范;如何设计 Brain‑Harness 之间意图表示没有标准答案,只是提出应当具备哪些字段;意图用什么编码(语言 / 结构化 3D 表示 / 学习 token)仍是开放问题。

「功能解耦」不等于天然获得跨具身迁移能力,作者自己也承认:模块化只是一个待验证的假设,不能保证一定带来迁移收益,需要大量实证验证。

2. 接口契约的工程落地挑战巨大

Trace/Embodiment/Task Card 只是语义 schema,现实中大规模真实机器人采集完整元数据成本很高;很多现有数据集缺少坐标系、失败模式、预条件等信息,改造存量数据集代价高昂。

Harness 适配器负担转移:把跨本体迁移难度从模型训练转移到适配器开发;如果机器人形态差异极大,适配器复杂度会很高,甚至接近重训模型。

意图‑执行翻译歧义:具脑输出抽象意图,Harness 翻译到硬件动作,中间会产生歧义;如何定义意图有效性校验、歧义消解没有给出具体解法。

3. WAM 与 Embodied Brain 本身仍然存在固有缺陷

WAM 预测契约要求输出不确定性、参考系、有效条件,现有世界模型很难高质量输出全部这些元信息;视频生成模型视觉逼真,但物理一致性、接触预测经常出错。

没有解决高层推理幻觉:Embodied Brain 依然依赖大模型 / 世界模型做物理推理;Harness 可以校验执行,但很难修复高层意图本身的物理错误。

4. 闭环学习的准入闸门很难工程化

论文提出只有高质量 trace 才允许回灌训练,但如何自动判定 trace 质量、区分失败来源(脑的错误 /harness 翻译错误 / 环境扰动)是未解决难题;真实机器人安全约束下,很难大规模采集各类失败样本。

5. 评测与生态标准落地困难

分层评测指标很多属于前瞻性指标,大部分目前没有现成 benchmark、没有公开数据集支持测量;
依赖社区达成共识,现实中不同研究机构、企业有自己的数据格式、系统栈,统一语义契约存在现实阻力。

6. 部分边界问题未充分讨论

没有详细处理高频反射、紧急安全响应(对应 TypeGo S0 反射层);Harness 如何兼顾高层意图规划和毫秒级硬件安全反射,没有展开;
对多任务抢占、任务调度、并发处理涉及较少。

四、总结

该文是一篇高价值的具身 AI 领域路线综述,批判了当前主流 VLA 端到端范式的耦合缺陷,倡导高层物理推理与硬件执行解耦,提出 WAM 契约、Embodied Brain+Harness 分层架构、Trace 等一套完整思想。它不产出新模型,但为未来具身智能系统设计提供顶层设计参考。

主要风险在于:整套方案的效果是假设性,需要大量工程实践验证;接口、契约、适配器会引入新的复杂度。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐