π0.5 要解决的不是让机器人在熟悉场景里把某个动作做得更漂亮,而是一个更难落地的问题:机器人换到从未见过的厨房或卧室,面对新的物体、布局和任务组合,能否只根据一句“清理厨房”完成十几分钟的连续操作。Physical Intelligence 的答案不是单纯增加目标机器人数据,而是把跨本体机器人数据、高层子任务标注、网页视觉语言数据和人类口头指导放进同一套 VLA 训练流程,再由同一个模型先用语言决定下一步做什么,随后输出连续控制动作。

  • π0.5 建立在 π0 上,核心增量是异构数据共训练、离散与连续动作混合训练,以及高层/低层分级推理。
  • 预训练阶段用 FAST 将动作离散化,与文本、目标框等统一做下一 token 预测;后训练阶段加入 300M Action Expert,用 Flow Matching 生成连续动作块。
  • 推理时先自回归生成语义子任务,例如“拿起枕头”,再以该子任务为条件生成 50 步、约 1 秒的低层动作块。
  • 论文只使用 RGB 图像、语言和机器人本体状态,不需要深度图,也不预测未来图像,因此它仍是 VLA,不是 World Model 或 World-Action Model。
  • 真正带来泛化的不是某一种数据,而是数据配方:跨本体数据提供动作能力,网页数据补充物体语义,高层标注和 verbal instruction 帮助长程任务拆解。

相关资料:

在这里插入图片描述

图 1 的重点不只是“数据很多”,而是输入和监督形式很多:图像、文字、目标框、离散动作 token 和连续动作都进入同一套跨模态策略。目标移动机器人自己的家庭数据只是其中一小部分,其他机器人与网页数据承担了迁移知识的作用。

1、π0.5解决的是开放世界泛化,不是单一技能成功率

传统 VLA 的常见评测方式,是在训练环境或与训练环境非常接近的布置中执行任务。这种设置能证明模型学会了动作,却很难回答它换一个家庭后是否仍然理解“餐具应该放进水槽”“衣服应该放进洗衣篮”。π0.5 把泛化拆成了三个相互关联的层次:

泛化层次 机器人需要解决的问题 主要知识来源
物理与动作 新餐盘应该从边缘抓,抽屉怎样打开 多机器人、多环境动作数据
视觉与物体 识别训练中没见过的工具、餐具和家居物品 网页图文、问答和目标定位数据
语义与任务 “整理卧室”下一步该拿枕头还是关抽屉 高层子任务标注、verbal instruction

论文在约 100 个家庭环境中收集了约 400 小时移动操作数据,但预训练阶段 97.6% 的样本并不是目标移动机器人执行家庭任务的数据。这个数字很关键:π0.5 的结论不是“400 小时足以覆盖所有家庭”,而是目标数据负责锚定任务,其他数据负责扩展技能、视觉语义和任务结构。

在这里插入图片描述

图 2 展示了一个完整厨房清理任务。模型收到的只是几个较宽泛的任务指令,内部会继续产生“拿起盘子”一类子任务,再输出关节、夹爪、升降机构和移动底盘的连续控制量。论文给出的长程演示可持续 10~15 分钟,但这不等于每次试验都一次成功;官方也明确说明模型仍会失败或重复无效动作。

2、完整模型由一个VLM和一个Action Expert组成

2.1、几个容易混淆的概念

名称 在 π0.5 中的含义 是否在测试时使用
VLA 从图像、语言和本体状态直接产生语义子任务或机器人动作的完整策略
PaliGemma VLM 约 2B 参数的视觉语言主干,处理 RGB 图像、文本和离散 token
Action Expert 约 300M 参数的小型 Transformer,通过 Flow Matching 生成连续动作块
FAST 将连续动作序列压缩为离散 token 的动作分词器 论文预训练使用;连续动作推理不使用 FAST 解码
High-Level action 语言形式的语义子任务,如“pick up the pillow” 论文完整系统使用
Low-Level action 关节、夹爪、底盘和升降机构的连续控制动作
World Model / WAM 显式预测未来状态、未来图像或环境动力学,再据此选动作 π0.5 不包含

π0.5 不是“一个 VLM 规划器 + 另一个独立动作模型”的松散级联。高层文本和低层动作共享同一个 VLA 主体:PaliGemma 负责理解场景并生成离散语义,高层结果随后成为 Action Expert 的条件。两种输出形式不同,但模型参数和上下文是连通的。

在这里插入图片描述

图 3 左侧是离散 token 预训练,右侧是后训练和推理。预训练先把不同数据统一成序列建模问题;后训练才加入连续动作专家。这样做兼顾了两件事:离散动作 token 训练效率高,适合大规模异构共训练;连续 Flow Matching 不需要逐 token 生成动作,适合实时控制。

2.2、输入、输出和注意力方向

单个时刻的观测可以写成 o t = [ I t 1 , … , I t n , q t ] o_t=[I_t^1,\ldots,I_t^n,q_t] ot=[It1,,Itn,qt],其中 I t i I_t^i Iti 是第 i i i 路 RGB 图像, q t q_t qt 是关节、夹爪、底盘和升降机构等本体状态。任务指令记为 ℓ \ell

完整策略把高层子任务 ℓ ^ \hat\ell ^ 和低层动作块 a t : t + H a_{t:t+H} at:t+H 分解为:

$$
\pi_\theta(a_{t:t+H},\hat\ell\mid o_t,\ell)

\pi_\theta(a_{t:t+H}\mid o_t,\hat\ell),
\pi_\theta(\hat\ell\mid o_t,\ell)
$$

符号 含义 在模型中的作用
θ \theta θ π0.5 的可训练参数 同时服务高层文本预测和低层动作生成
o t o_t ot 时刻 t t t 的多相机 RGB 与本体状态 当前环境与机器人状态
ℓ \ell 用户给出的总任务 例如“clean the bedroom”
ℓ ^ \hat\ell ^ 模型预测的语义子任务 例如“pick up the pillow”
a t : t + H a_{t:t+H} at:t+H t t t t + H t+H t+H 的动作块 论文中共 50 步,因此 H = 49 H=49 H=49

这个分解表达的是推理顺序,不表示两个完全独立的网络。论文的注意力掩码让图像、文本和本体状态构成共享前缀;Action Expert 能读取前缀和自身动作 token,但不能读取 FAST 动作 token,避免离散动作答案泄漏给连续动作分支。信息总体从 VLM 单向流向 Action Expert。

在这里插入图片描述

3、两阶段训练把异构数据真正用起来

3.1、第一阶段:离散 token 预训练

预训练持续 28 万个梯度步。模型作为标准自回归 Transformer,预测文本、目标框和 FAST 编码后的动作 token。论文使用五类核心数据:

缩写 数据类型 主要作用
MM 多环境移动机器人数据,约 400 小时、约 100 个家庭环境 锚定最终移动操作任务
ME 多环境非移动机器人数据 用更容易搬运的静态机械臂扩大真实家庭覆盖
CE 实验室跨本体数据,含 OXE 迁移抓取、收纳、折叠等通用动作技能
HL 高层子任务、相关目标框和动作联合标注 学会任务拆解以及子任务条件动作
WD 图像描述、视觉问答、目标定位等网页多模态数据 保持和扩展视觉语义知识

在这里插入图片描述

跨本体动作首先按各数据集每个动作维度的 1% 和 99% 分位数归一化到 [ − 1 , 1 ] [-1,1] [1,1];关节目标与末端目标通过 prompt 中的控制模式标记区分;低维机器人则把动作向量补零到统一维度。这里的动作对齐不是把所有机器人的物理结构强行改成一样,而是用控制模式、归一化和固定最大维度把它们装进统一接口。

HL 数据还做了两件容易被忽略的事。第一,长任务轨迹被人工标注语义子任务,模型同时学习“下一步是什么”和“怎样执行这一步”;第二,相关物体的目标框会在子任务之前预测,用显式视觉定位帮助后续语义判断。

3.2、第二阶段:连续动作后训练

后训练再进行 8 万个梯度步,目标是把预训练模型专门化到家庭移动操作,并加入随机初始化的 Action Expert。数据保留 MM、ME、WD 和对应的 HL 切片,去掉实验室 CE 数据,同时加入 verbal instruction(VI):专家不是直接遥操作关节,而是实时告诉已经学会低层动作的机器人下一步做什么,从而形成高层语言示范。

后训练同时优化文本交叉熵和 Flow Matching 损失。连续动作训练先将真实动作块与高斯噪声插值:

$$
a_{t:t+H}^{\tau,\omega}

\tau a_{t:t+H}+(1-\tau)\omega,
\qquad \omega\sim\mathcal N(0,I)
$$

符号 数学含义 数据来源或形态
a t : t + H a_{t:t+H} at:t+H 真实连续动作块 机器人示范,形状为动作块长度乘动作维度
ω \omega ω 与动作块同形状的高斯噪声 训练时随机采样
τ \tau τ Flow Matching 内部时间 不是机器人真实时间;取值在 [ 0 , 1 ] [0,1] [0,1]
a t : t + H τ , ω a_{t:t+H}^{\tau,\omega} at:t+Hτ,ω 插值后的带噪动作 Action Expert 的动作侧输入

模型要预测把动作沿流从数据分布推向噪声分布的向量场 ω − a t : t + H \omega-a_{t:t+H} ωat:t+H。联合目标为:

E D , τ , ω [ H  ⁣ ( x 1 : M , f θ ℓ ( o t , ℓ ) ) + α ∥ ω − a t : t + H − f θ a  ⁣ ( a t : t + H τ , ω , o t , ℓ ) ∥ 2 2 ] \mathbb E_{\mathcal D,\tau,\omega} \left[ H\!\left(x_{1:M},f_\theta^{\ell}(o_t,\ell)\right) + \alpha \left\| \omega-a_{t:t+H} -f_\theta^a\!\left(a_{t:t+H}^{\tau,\omega},o_t,\ell\right) \right\|_2^2 \right] ED,τ,ω[H(x1:M,fθ(ot,))+α ωat:t+Hfθa(at:t+Hτ,ω,ot,) 22]

符号 含义 具体作用
D \mathcal D D 混合训练数据分布 提供图像、语言、状态、文本标签和动作
H ( ⋅ ) H(\cdot) H() 文本 token 交叉熵 保留 VLM 的文本、目标框和离散动作预测能力
x 1 : M x_{1:M} x1:M 长度为 M M M 的离散输出序列 可包含文本或 FAST 动作 token
f θ ℓ f_\theta^{\ell} fθ 离散输出分支 预测文本 token logits
f θ a f_\theta^a fθa 连续动作分支 预测 Flow Matching 向量场
α \alpha α 连续动作损失权重 后训练取 10.0 10.0 10.0;预训练取 0 0 0

论文对 τ \tau τ 使用偏向低时间步的 Beta 分布,并设置截断阈值 s = 0.999 s=0.999 s=0.999。π0.5 与 π0 的一个结构差异,是不再把时间嵌入直接拼到带噪动作上,而是通过独立 MLP 和 adaptive RMSNorm 将 τ \tau τ 注入 Action Expert 的每一层。

4、推理流:先用语言定子任务,再生成1秒动作块

以“整理卧室”为例,完整推理过程可以落成下面五步:

  1. 读取前向、后向和双腕部 RGB 图像,以及机器人本体状态;高层推理使用四路相机,低层推理使用前向和腕部相机。
  2. PaliGemma 根据总任务“clean the bedroom”和当前场景,自回归输出语义子任务,例如“pick up the pillow”。
  3. 将这个子任务作为低层 command,与当前图像和状态共同送入 Action Expert。
  4. Action Expert 从高斯噪声开始做 10 次 Flow Matching 数值积分,生成 50 步连续动作块。官方项目页将其解释为约 1 秒动作,控制频率为 50 Hz。
  5. 简单 PD 控制器跟踪双臂、夹爪、升降机构和底盘目标;系统在后续观测上继续产生子任务和动作。

在这里插入图片描述

论文没有额外的轨迹规划器或碰撞检测模块,移动与操作均由策略端到端产生。它也不需要未来图像、深度图或世界模型的预测作为推理条件。这里的“高层思考”是语言子任务预测,不是环境动力学模拟。

在当前开源实现中,连续动作采样采用从噪声到动作的约定,内部时间从 1 走到 0。若默认积分步数为 K = 10 K=10 K=10,每一步可简化为:

x k + 1 = x k − 1 K v θ ( x k , τ k ∣ o t , ℓ ) x_{k+1}=x_k-\frac{1}{K}v_\theta(x_k,\tau_k\mid o_t,\ell) xk+1=xkK1vθ(xk,τkot,)

其中 x k x_k xk 是第 k k k 次积分时的动作块, v θ v_\theta vθ 是 Action Expert 预测的向量场, K K K 是去噪/积分步数。这里的 k k k 与机器人控制周期不同:10 次是模型内部生成动作的计算过程,最终动作块才对应 50 个真实控制步。

论文没有明确给出“50 个动作是否全部执行后才重新规划”的统一部署细节,因此不能仅根据动作块长度推断确切的重规划频率。

5、源码解析:开源的是Flow Matching动作分支,不是论文完整系统

本节检查的是 openpi 主分支 commit 15a9616a00943ada6c20a0f158e3adb39df2ccac,提交时间为 2026-06-16,检查日期为 2026-08-14。仓库 README 明确写明:当前 π0.5 训练和推理只支持 Flow Matching head。这意味着可以复现 π0.5 风格的连续动作模型和微调流程,但不能仅靠当前仓库复现论文的离散共训练、高层子任务生成与同模型两级推理。

5.1、与方法相关的目录

openpi/
├── src/openpi/models/
│   ├── pi0_config.py          # π0/π0.5结构、动作维度和冻结配置
│   ├── pi0.py                 # JAX模型、损失和Flow Matching采样
│   ├── tokenizer.py           # prompt与本体状态离散化
│   └── model.py               # Observation和统一模型接口
├── src/openpi/models_pytorch/
│   └── pi0_pytorch.py         # PyTorch版π0/π0.5
├── src/openpi/training/
│   ├── config.py              # 数据、模型、checkpoint与训练配置
│   └── data_loader.py         # 数据加载与变换链
├── src/openpi/policies/
│   ├── policy_config.py       # checkpoint、归一化统计与policy构建
│   └── policy.py              # infer接口与动作输出
├── src/openpi/transforms.py   # 重排、归一化、tokenize与动作变换
├── scripts/
│   ├── train.py               # JAX训练入口
│   ├── train_pytorch.py       # PyTorch训练入口
│   ├── compute_norm_stats.py  # 计算数据归一化统计
│   └── serve_policy.py        # 推理服务入口
└── examples/
    ├── droid/                 # DROID训练与推理示例
    └── libero/                # LIBERO训练和评测示例

5.2、论文模块与代码落点

论文模块 源码文件/类或函数 当前开源实现的实际作用
π0.5 配置 models/pi0_config.py::Pi0Config pi05=True 时启用离散状态输入、200 token 上限和 adaRMSNorm
VLM + Action Expert models/pi0.py::Pi0.__init__ 构建 PaliGemma、SigLIP、300M Expert、动作投影和时间 MLP
当前观测编码 Pi0.embed_prefix 各相机经 SigLIP 编码,prompt/state token 经语言嵌入后拼成前缀
带噪动作编码 Pi0.embed_suffix 动作线性投影,时间经 MLP 后作为 adaRMSNorm 条件
Flow Matching 损失 Pi0.compute_loss 采样噪声和 Beta 时间,回归目标向量场
动作生成循环 Pi0.sample_actions 缓存前缀 KV,默认进行 10 次 Euler 积分
状态离散化 tokenizer.py::PaligemmaTokenizer 将归一化状态分箱为 256 档,写入文本 prompt
数据接口 training/config.py::ModelTransformFactory 为不同模型选择 prompt/state/action 变换
训练入口 scripts/train.py::train_step 调用 compute_loss,反传并更新可训练参数
推理入口 policies/policy.py::Policy.infer 预处理观测、调用 sample_actions、反归一化输出

5.3、初始化和状态编码

下面是根据源码压缩后的核心逻辑:

config = Pi0Config(pi05=True)
llm = Gemma([vlm_config, action_expert_config], adarms=True)
image_encoder = SigLIP("So400m/14")

π0.5 仍复用 π0 的 Pi0 类,通过 pi05 开关改变两点:本体状态不再作为 Action Expert suffix 中的连续 token,而是离散化后进入语言前缀;Flow Matching 时间不再与动作拼接,而是经 MLP 后进入 Expert 的 adaptive RMSNorm。

PaligemmaTokenizer.tokenize() 将状态按 [ − 1 , 1 ] [-1,1] [1,1] 划分为 256 档,然后构造类似下面的序列:

Task: <任务文本>, State: <离散状态序列>;
Action:

当前仓库的 π0.5 默认 max_token_len=200action_dim=32action_horizon=50。具体微调配置可以覆盖这些值,例如 pi05_libero 使用 10 步动作块,DROID 配置使用 15 或 16 步;因此不能把论文的 50 步直接当成所有 release checkpoint 的固定设置。

5.4、损失与去噪循环

开源 compute_loss() 的主干可概括为:

noise = random_normal(actions.shape)
tau = random_beta(1.5, 1) * 0.999 + 0.001
x_tau = tau * noise + (1 - tau) * actions
target = noise - actions
loss = mean_square(model(x_tau, tau), target)

它只返回连续动作的均方误差,没有论文联合目标中的文本交叉熵。sample_actions() 则先对图像和 prompt 做一次前缀前向,缓存 KV;之后循环更新动作块,避免每个去噪步重复计算视觉语言前缀。这是当前代码中最直接的推理加速设计。

训练脚本没有额外的 detach 或论文图 18 所示 FAST/Action Expert 双动作分支隔离,因为当前 Pi0 路径根本没有 FAST 输出分支。LoRA 冻结通过 Pi0Config.get_freeze_filter() 控制;普通全量微调默认不冻结参数。

5.5、最小环境与官方入口

官方要求 Ubuntu 22.04,并使用 uv 管理依赖。README 给出的单卡显存估计为:推理大于 8 GB、LoRA 微调大于 22.5 GB、全量微调大于 70 GB。下面只是环境和入口,不代表已经完成真机复现。

git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi.git
cd openpi
GIT_LFS_SKIP_SMUDGE=1 uv sync
GIT_LFS_SKIP_SMUDGE=1 uv pip install -e .

以官方 DROID checkpoint 启动推理服务:

uv run scripts/serve_policy.py policy:checkpoint \
  --policy.config=pi05_droid \
  --policy.dir=gs://openpi-assets/checkpoints/pi05_droid

自定义数据微调前需要先计算归一化统计,再运行训练脚本。仓库提供 LIBERO 和 DROID 示例,但论文中新家庭、移动双臂长程任务的数据、评测脚本和完整 checkpoint 配方没有公开。

5.6、论文与当前开源实现的差异

项目 论文完整 π0.5 当前 openpi 主分支
离散 FAST 动作预训练 π0.5 路径未开放
文本/目标框交叉熵 与动作损失联合训练 Pi0.compute_loss 只有 Flow Matching 动作损失
高层子任务生成 同一模型自回归输出 未提供论文高层推理入口
两级推理链路 高层文本 → 低层连续动作 只提供 prompt 条件连续动作生成
论文家庭数据配方 MM、ME、CE、HL、WD、VI 未开放完整数据和配比
公开 checkpoint 论文内部移动机器人模型 提供 base、DROID、LIBERO 等 release checkpoint;README 还注明使用 knowledge insulation
论文 benchmark 新家庭、mock home、长程任务 公开示例主要是 DROID、ALOHA、LIBERO

因此,当前代码适合研究 π0.5 的 Action Expert、状态 token 化、adaRMSNorm 和连续动作微调,但不适合据此断言已经复现论文的开放世界泛化结果。

6、实验结果说明了什么

6.1、评测口径

论文在训练中未出现的新厨房和新卧室评测。可复现的定量比较使用 mock home,最终真实性评测使用 3 个真实家庭;标准家庭任务覆盖 3 个真实家庭和 3 个 mock 厨房/卧室,共 12 个位置。通常每个策略、每个任务做 10 次评测,并按任务 rubric 的得分比例统计 task progress;部分对比固定为 4 个位置,共 40 次评测。作者用双侧、方差不等的 t 检验报告显著性。

语言跟随评测在两个未见厨房中进行,包含域内物体的新实例和训练类别之外的 OOD 物体。指标分为:

  • Follow Rate:是否选中了指令指定的正确物体;
  • Success Rate:是否把该物体成功放到指定位置。

在这里插入图片描述

6.2、环境数量越多,泛化差距越小

论文把移动操作训练环境数从 3、12、22、53、82 增加到 104。图 8 显示,四个家庭任务的平均进度随环境覆盖总体上升;104 个训练环境的模型已经接近直接看过测试家庭数据的 in-domain 基线。相反,在测试家庭或 104 个训练家庭上直接训练、但不做完整共训练的两个浅色基线明显更差,说明“环境数量”和“异构预训练配方”缺一不可。

在这里插入图片描述

从图中读取,104 个环境的完整模型平均任务进度约 86%,看过测试家庭的 in-domain 基线约 83%;不做预训练的 104-location 基线约 39%,只用测试家庭数据且不预训练的基线仅约 5%。这些是图表读数,不应与不同任务、不同 rubric 的成功率直接横比。

6.3、跨本体数据负责动作迁移,网页数据主要帮助OOD语义

论文图 11 和官方项目页给出的语言跟随消融如下:

模型 域内 Follow 域内 Success OOD Follow OOD Success
完整 π0.5 86% 83% 94% 94%
no WD 86% 82% 80% 74%
no CE 74% 67% 67% 49%
no ME 66% 57% 33% 31%

去掉网页数据 WD 后,域内结果几乎不变,但 OOD Success 从 94% 降到 74%,说明网页语义知识主要用于识别和理解新类别。去掉 ME 或 CE 则在域内和域外都明显下降,说明跨本体数据不仅提供“更多样本”,还迁移了通用操作能力。

在这里插入图片描述

论文还把 π0.5 与 π0、π0-FAST+Flow 对比。完整 π0.5 在四个 mock home 任务上都更强;作者专门延长 π0 的训练步数,仍未消除差距。这里的结论应限定为论文给定数据和训练预算下,不能推广为所有 π0.5 checkpoint 都必然优于任何 π0 微调模型。

6.4、高层推理有效,但高层训练本身更重要

在这里插入图片描述

图 13 中,完整 π0.5 的平均任务进度约 78%,不显式输出高层子任务、但保留 HL 训练数据的 implicit HL 约 71%;完全去掉高层推理和 HL 训练的 no HL 约 62%。这说明显式子任务推理有增益,但更重要的基础来自训练阶段的高层语义监督。

另一个值得注意的结果是,零样本 GPT-4 高层策略和人工 high-level oracle 都没有超过完整 π0.5。作者据此认为,高层策略需要与机器人数据和低层执行能力对齐;“语言模型更强”不自动等价于“给机器人分解得更合适”。不过人工上界也受作者预定义子任务接口和低层策略能力限制,不能理解为模型规划普遍超过人类。

7、工程判断:π0.5的价值在训练配方,复现难点也在训练配方

π0.5 最值得借鉴的不是某个新网络层,而是数据工程与训练目标的组合方式。

第一,跨本体共训练不只是把 OXE 混进 batch。动作空间需要控制模式标识、分位数归一化、维度补齐和数据源采样配比;如果这些接口没有处理好,规模越大反而越容易让模型学到冲突分布。

第二,高层语义标注值得单独建设。论文结果表明,显式高层推理只贡献一部分收益,HL 数据本身已经改善了低层策略。这意味着即使部署时暂时不做两级推理,子任务级标注仍可能成为有效的辅助监督。

第三,网页数据不能替代机器人数据。WD 对 OOD 物体语义很重要,但去掉 ME/CE 的下降更大。VLM 知道“这是什么”,不代表机器人知道“怎样稳妥地抓起来并放进去”。

第四,论文结果暂时难以独立复现。当前仓库只开放 Flow Matching 头,家庭移动操作数据、高层/低层联合推理和论文评测环境都不完整。工程团队更现实的起点,是使用 pi05_base 或平台 checkpoint 做连续动作微调,同时在自己的数据链中补充子任务标签和多环境覆盖,而不是直接承诺复现“新家清理”能力。

8、局限与结论

论文自己列出的失败模式很具体:陌生抽屉把手可能持续打不开;机械臂遮挡污渍时会受部分可观测性影响;高层策略有时会被干扰,反复开关同一个抽屉。模型能处理的 prompt 仍较简单,上下文和记忆也有限,跨房间导航和物体位置记忆没有被真正解决。

所以,π0.5 不是一个已经解决家庭机器人的通用大脑。它更像一次有说服力的系统实验:当 VLA 能把多机器人动作、网页视觉语义、高层子任务和人类语言指导放进同一训练框架时,约 400 小时目标平台数据也可以支撑对新家庭的明显泛化。它把 VLA 的优化目标从“在训练分布里完成动作”向“在新环境里理解任务并持续执行”推进了一步。

对实际项目而言,最可迁移的结论可以概括为一句话:先用异构数据把模型的知识面和动作面铺开,再用目标平台数据、高层标签和连续动作后训练把能力收回来。网络结构只是载体,数据配方、监督层级和评测口径才是 π0.5 的主体。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐