Palm-E 模型详解

Palm-E

基本信息

项目

内容

全称

Pathways Language to Action with Embodied

机构

Google DeepMind

论文

[Palm-E](https://palm-e.github.io/)

架构

Transformer (PaLM + ViT)

动作类型

离散/连续 Token

训练方式

模仿学习 + 语言数据

模型架构

输入图像 ──→ ViT Encoder ──┐
                              ├──→ PaLM LLM ──→ 动作Token
文本指令 ──→ Text Embed ────┤
机器人状态 ──→ State Embed ──┘

动作Token ──→ 映射 ──→ 连续动作

核心思想

Palm-E 是 Google 的具身多模态大模型:

• 结合 PaLM 大语言模型

• 融入视觉和机器人状态

• 输出动作序列

数据格式

输入

字段

格式

说明

多视角图像

[N, H, W, 3]

多个相机

文本指令

字符串

任务描述

机器人状态

向量

关节角度等

输出

字段

格式

说明

动作Token

离散ID

预测的动作

核心公式

1. 多模态输入融合

$$x = [\text{ViT}(I_1); ...; \text{ViT}(I_n); \text{Text}; \text{State}]$$

2. LLM 生成动作

$$P(a_{t+1} | I, s, \text{instr}) = \text{PaLM-E}(I, s, \text{instr})$$

3. 动作解码

$$a_{continuous} = \text{ActionHead}^{-1}(a_{token})$$

与 RT-2 的区别

方面

Palm-E

RT-2

LLM

PaLM

RT-2 自己的

状态输入

有

无

视觉编码

ViT

RT-2 自己

优点

1. 多模态融合:视觉 + 文本 + 状态

2. LLM 能力:推理能力强

3. 具身理解:理解物理世界

缺点

1. 动作精度:离散 Token 有量化误差

2. 计算资源:PaLM 参数量大

3. Google 内部:完整模型未公开

使用场景

核心场景

场景

说明

**具身AI研究**

学术研究语言-视觉-动作的融合

**复杂推理任务**

需要多步推理的操作任务

**长期任务规划**

复杂的多阶段任务

**Google 生态**

在 Google 技术栈上开发

典型任务

1. 复杂推理任务:
   - "如果物体A在物体B上面,就把它们一起放到C上面"
   - "先打开盒子,再把红色积木放进去"
   - "按照从左到右的顺序排列物体"

2. 长期任务:
   - "整理厨房:先洗碗,再擦台面,最后归位"
   - "布置餐桌:先放盘子,再放餐具"
   - "清洁房间:先收集杂物,再擦拭表面"

3. 语义理解任务:
   - "把最重的物体放到最低的架子上"
   - "把容易碎的物品放到安全位置"
   - "把所有圆形的东西放到一个组"

适用条件

条件

要求

硬件

高端机械臂 + 多相机

计算

TPU / 高端 GPU

技术能力

熟悉 Google 技术栈

研发资源

大规模模型训练能力

与 RT-2 的选择

条件

推荐

需要机器人状态输入

Palm-E

强调泛化能力

RT-2

计算资源有限

RT-2

学术研究用途

两者皆可

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐