Palm-E 模型详解
Palm-E 模型详解
Palm-E
基本信息
|
项目 |
内容 |
|
全称 |
Pathways Language to Action with Embodied |
|
机构 |
Google DeepMind |
|
论文 |
[Palm-E](https://palm-e.github.io/) |
|
架构 |
Transformer (PaLM + ViT) |
|
动作类型 |
离散/连续 Token |
|
训练方式 |
模仿学习 + 语言数据 |
模型架构
输入图像 ──→ ViT Encoder ──┐
├──→ PaLM LLM ──→ 动作Token
文本指令 ──→ Text Embed ────┤
机器人状态 ──→ State Embed ──┘
动作Token ──→ 映射 ──→ 连续动作
核心思想
Palm-E 是 Google 的具身多模态大模型:
• 结合 PaLM 大语言模型
• 融入视觉和机器人状态
• 输出动作序列
数据格式
输入
|
字段 |
格式 |
说明 |
|
多视角图像 |
[N, H, W, 3] |
多个相机 |
|
文本指令 |
字符串 |
任务描述 |
|
机器人状态 |
向量 |
关节角度等 |
输出
|
字段 |
格式 |
说明 |
|
动作Token |
离散ID |
预测的动作 |
核心公式
1. 多模态输入融合
$$x = [\text{ViT}(I_1); ...; \text{ViT}(I_n); \text{Text}; \text{State}]$$
2. LLM 生成动作
$$P(a_{t+1} | I, s, \text{instr}) = \text{PaLM-E}(I, s, \text{instr})$$
3. 动作解码
$$a_{continuous} = \text{ActionHead}^{-1}(a_{token})$$
与 RT-2 的区别
|
方面 |
Palm-E |
RT-2 |
|
LLM |
PaLM |
RT-2 自己的 |
|
状态输入 |
有 |
无 |
|
视觉编码 |
ViT |
RT-2 自己 |
优点
1. 多模态融合:视觉 + 文本 + 状态
2. LLM 能力:推理能力强
3. 具身理解:理解物理世界
缺点
1. 动作精度:离散 Token 有量化误差
2. 计算资源:PaLM 参数量大
3. Google 内部:完整模型未公开
使用场景
核心场景
|
场景 |
说明 |
|
**具身AI研究** |
学术研究语言-视觉-动作的融合 |
|
**复杂推理任务** |
需要多步推理的操作任务 |
|
**长期任务规划** |
复杂的多阶段任务 |
|
**Google 生态** |
在 Google 技术栈上开发 |
典型任务
1. 复杂推理任务:
- "如果物体A在物体B上面,就把它们一起放到C上面"
- "先打开盒子,再把红色积木放进去"
- "按照从左到右的顺序排列物体"
2. 长期任务:
- "整理厨房:先洗碗,再擦台面,最后归位"
- "布置餐桌:先放盘子,再放餐具"
- "清洁房间:先收集杂物,再擦拭表面"
3. 语义理解任务:
- "把最重的物体放到最低的架子上"
- "把容易碎的物品放到安全位置"
- "把所有圆形的东西放到一个组"
适用条件
|
条件 |
要求 |
|
硬件 |
高端机械臂 + 多相机 |
|
计算 |
TPU / 高端 GPU |
|
技术能力 |
熟悉 Google 技术栈 |
|
研发资源 |
大规模模型训练能力 |
与 RT-2 的选择
|
条件 |
推荐 |
|
需要机器人状态输入 |
Palm-E |
|
强调泛化能力 |
RT-2 |
|
计算资源有限 |
RT-2 |
|
学术研究用途 |
两者皆可 |
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)