《VLA 系列》π0.7 | 多模态提示可控机器人基座模型 | 组合泛化与跨本体迁移 | 论文与复现思路
π0.7 想解决的不是再做一个更大的 VLA,而是一个更棘手的数据问题:机器人数据一旦扩展到不同机器人、不同操作者、自动执行轨迹甚至失败样本,同一个任务会同时出现快慢不同、质量不同、策略不同的多种行为。若只给模型一句任务指令,模型很容易把这些模式平均在一起,学到一个哪种都不像的折中策略。
Physical Intelligence 的处理方式很直接:把怎么做也写进上下文。π0.7 在任务语言之外加入子任务语言、未来视觉子目标、速度/质量/失误等 episode metadata,以及控制模式;训练时再随机丢弃部分条件,让同一模型在测试时可以按需组合这些提示。论文的关键结论可以压缩为四点:
- π0.7 的主体仍是连续动作 VLA:约 4B 的 Gemma 3 VLM、MEM 风格历史视觉编码器和 860M 参数 Flow Matching 动作专家,总参数约 5B;
- 世界模型不是只在训练时做辅助监督。启用 goal conditioning 时,它会在测试阶段根据当前观测和子任务生成视觉子目标,并真正进入动作生成链路;
- episode metadata 让低质量示范、失败轨迹和自主 rollout 不再只是脏数据,模型可以学习区分这些行为,并在推理时指定高质量、无失误、较快的模式;
- 论文展示了无需任务专门微调的灵巧操作、复杂语言跟随、跨本体迁移,以及通过语言 coaching 组合出新任务的能力,但作者也承认大规模数据下很难严格证明一个任务从未见过。

读图时需要抓住中间和左右两侧的关系:左侧机器人示范、自主数据,右侧人类视频和多模态网页数据,并不是以同一种监督形式硬塞进策略;语言、视觉子目标和元数据把不同来源的数据对齐到可区分的行为条件上。推理时,高层策略、世界模型和期望元数据共同组成 prompt,动作专家再生成底层控制。
论文与官方资料:
- 论文:π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
- 官方介绍:A Steerable Model with Emergent Capabilities
- 官方项目页:pi.website/pi07
- 官方通用仓库:Physical-Intelligence/openpi
1、π0.7 解决的是异质数据中的行为歧义
通常的 VLA 训练样本可以写成观测、语言、动作。这在数据干净、策略单一时没有大问题,但大规模机器人数据天然是多峰的:同样是折衣服,熟练操作者可能动作短、抓点准;失败 rollout 可能中途重抓;另一种机器人又需要完全不同的关节轨迹。如果上下文只保留折衣服,这些动作在条件上看起来都正确,模型只能自己猜哪个模式值得模仿。
π0.7 的核心不是简单过滤掉坏数据,而是给每段数据增加更细的条件,使快但失败、慢但高质量、使用关节空间控制、下一步要抓把手等差异显式可见。这样一来,模型既能从失败状态和恢复过程里吸收覆盖度,又能在推理时要求它选择高质量模式。
| 容易混淆的概念 | 在 π0.7 中的含义 | 是否直接生成机器人动作 |
|---|---|---|
| π0.7 VLA | 读取历史观测、prompt 和本体状态,输出连续动作块的主策略 | 是 |
| 高层策略 | 根据任务、当前观测和历史子任务,生成下一条语义子任务 | 否,输出文本子任务 |
| 轻量世界模型 | 根据当前观测、子任务和元数据生成近未来多视角子目标图像 | 否,输出视觉条件 |
| 视觉子目标 | 表达当前子任务完成后场景应该变成什么样 | 否,但可进入动作专家条件 |
| episode metadata | 速度、质量、是否失误等行为属性 | 否,用于选择行为模式 |
| action expert | 通过 Flow Matching 生成 50 步连续动作块 | 是 |
这里也要明确 π0.7 与 World-Action Model 的边界。π0.7 的世界模型和动作策略是两个模型:世界模型先生成图像子目标,VLA 再基于该图像生成动作。它不是在一个统一生成过程里联合输出未来视频与动作。
2、模型架构:5B VLA 外接高层策略和世界模型

π0.7 主模型约 5B 参数,其中 VLM backbone 来自 Gemma 3 4B,包含约 400M 的视觉编码器;动作专家约 860M 参数。图中下方的高层策略同样基于 Gemma 3 4B,而视觉子目标生成器从 14B 的 BAGEL 初始化。论文称其为 lightweight world model,主要是相对更大的通用生成模型和完整视频预测系统而言;从实际部署看,它仍需要多卡优化,不能理解成单卡上几毫秒运行的小网络。
2.1、观测与历史记忆
主 VLA 最多接收 4 路相机:前视、左右腕部,以及可选后视。每路最多使用 6 帧历史图像,历史采样间隔为 1 秒。MEM 风格编码器在时间和空间上压缩历史,使不同历史长度最终得到固定数量的视觉 token。
输入图像和视觉子目标都会缩放到 448×448。最多使用 3 路子目标图像,不包含后视子目标。本体状态 q t q_t qt 及其历史不再像 π0.6 那样离散成文本 token,而是经线性层映射到 backbone 维度;每个历史状态对应一个 token。
训练时,全部历史观测以 0.3 概率丢弃,可选后视图也以 0.3 概率丢弃。这种设计不是为了追求随机正则化本身,而是让模型在历史缺失、摄像头配置变化时仍能工作。
2.2、Block-causal attention 与 knowledge insulation
当前观测 token 和子目标 token 各自在块内双向注意力,子目标还可以关注当前观测;后续文本使用因果注意力。动作专家的 50 个动作 token 彼此双向注意,并读取 VLM 的激活。
π0.7 延续 knowledge insulation:VLM backbone 用 FAST 离散动作 token 的交叉熵进行相对稳定的监督;连续动作专家可以读取 VLM 表征,但它的梯度不回流到 VLM。直观上,VLM 负责形成稳定的视觉—语言—动作语义表征,Flow Matching 专家负责连续控制,二者在前向信息流上相连,在反向梯度上隔离。

图中的重点不是每个小三角形,而是三类掩码:无图像目标时沿用 π0.5/MEM 的块因果结构;加入图像目标后多出一个可双向建模的视觉块;做 CFG 时,正条件和负条件被打包到同一序列,但两条分支不能互相泄漏信息。
2.3、动作专家与实时执行
动作专家固定生成 50 步连续动作块,并使用 adaptive RMSNorm 注入 Flow Matching 的生成时间。注意这里存在两种时间:
| 时间概念 | 含义 |
|---|---|
| 机器人时间 t t t | 真实环境中的控制步,20 Hz 或 50 Hz |
| 动作块长度 H = 50 H=50 H=50 | 一次预测覆盖 50 个真实控制步 |
| Flow Matching 时间 τ \tau τ | 从噪声到动作的生成插值时间,不是机器人时钟 |
| 子目标刷新间隔 Δ = 4 \Delta=4 Δ=4 秒 | 世界模型重新生成视觉子目标的最长间隔 |
训练阶段模拟 0 到 12 个控制步的推理延迟;在 50 Hz 机器人上对应最多 240 ms。推理时使用 5 个去噪/积分步生成 50 步动作块,但只执行其中 15 或 25 步,再异步滚动预测。RTC 用已开始执行的动作作为后续动作块条件,减轻动作块拼接时的跳变。
3、多模态 prompt:不仅告诉机器人做什么

π0.7 的完整上下文可以抽象为:
<多视角当前与历史观测><多视角视觉子目标>
Task: peel vegetables.
Subtask: pick up the peeler.
Speed: 8000.
Quality: 5.
Mistake: false.
Control Mode: joint.
<Proprioception>
3.1、子任务语言
总体任务 ℓ t \ell_t ℓt 可能是清理厨房,子任务 ℓ ^ t \hat{\ell}_t ℓ^t 则是打开冰箱门。子任务可以由人实时 coaching,也可以由训练后的高层策略产生。高层策略读取当前观测、总体任务以及过去的子任务历史,预测下一条语义子任务,因此它承担长时序任务分解,主 VLA 只负责当前语义阶段的底层执行。
3.2、视觉子目标
语言打开冰箱门没有说明抓哪个位置、门要开到什么角度。视觉子目标 g t = [ G t 1 , … , G t n ] g_t=[G_t^1,\ldots,G_t^n] gt=[Gt1,…,Gtn] 直接描述若干秒后各相机应该看到的状态:基座视角更适合表达物体与环境关系,腕部视角更适合表达手臂和夹爪落点。
训练世界模型时,分段末帧作为真实目标 g t ∗ = o t e n d g_t^*=o_{t_{end}} gt∗=otend。数据只选用具有高质量子任务标签的机器人片段,同时混合第一视角人类视频、开源视频和图像编辑数据,以保留 BAGEL 的语义知识。世界模型同时用 ViT token 表达语义,用 VAE token 保留细节;ViT 输入为 448×336,VAE 输入和目标图像为 512×384。
3.3、episode metadata 与控制模式
episode metadata 包含三类信号:
- 速度:用 episode 的控制步数表示,并以 500 步为区间离散;例如 1750 到 2250 步都标成 2000 steps。步数越小通常意味着越快;
- 质量:人工给出 1 到 5 分,5 为最好;
- 失误:人工粗标某个动作段是否出现抓取失败、错误子任务等问题。
控制模式 c ∈ { joint , ee } c\in\{\text{joint},\text{ee}\} c∈{joint,ee} 通过文本标识选择关节空间或末端空间动作。推理时可以根据任务切换;论文主跨本体实验使用关节空间控制,附录显示早期模型换成末端控制并没有带来稳定优势。
这些元数据不是世界模型在推理时估计出来的。论文的默认做法是人工设定期望值:质量恒为 5,失误为 false,速度取对应任务 episode 长度的第 15 百分位。也就是说,元数据是控制旋钮,而不是对当前轨迹的在线评价结果。
3.4、条件 dropout 让 prompt 可选
训练时并非每条数据都带齐全部条件:视觉子目标只加到每个 batch 的 25% 样本;带视觉子目标的样本中,子任务文本又以 30% 概率丢弃;整组 episode metadata 以 15% 概率丢弃,若未整组丢弃,速度、质量、失误各自再以 5% 概率丢弃;控制模式不做 dropout。
这套比例带来两个效果。第一,视觉目标不会让动作预测彻底退化成只看起点和终点的逆动力学;第二,测试时可以只给语言、语言加元数据,或者再叠加视觉子目标,而不需要为每种输入组合重新训练模型。
4、训练流与推理流
4.1、训练流
- 将机器人示范、较差示范、失败片段、自主评测 rollout、人工干预和开源机器人数据统一切成动作片段;另准备带高质量分段文本的人类视频和图像/视频数据。
- 为机器人片段标注总体任务、子任务、速度、质量、失误和控制模式。自主 rollout 也保留,依靠元数据区分其质量。
- 用分段末帧训练 BAGEL 初始化的世界模型,使其根据当前多视角观测、子任务和元数据生成未来视觉子目标。
- 为主 VLA 混合真实未来帧与离线生成的子目标图。真实目标中,25% 取片段末帧,75% 从未来 0 到 4 秒均匀采样,以覆盖不同时间距离。
- 随机丢弃 prompt 组件,训练 VLM/FAST 分支与连续 Flow Matching 动作专家;动作专家梯度不回传到 VLM。
- 加入训练期 RTC 延迟模拟,使模型学习在旧动作仍在执行时生成平滑的新动作块。
4.2、推理流
- 输入总体任务 ℓ \ell ℓ、初始观测 o 0 o_0 o0、期望 metadata m m m 和控制模式 c c c。
- 人或高层策略产生当前子任务 ℓ ^ \hat{\ell} ℓ^。
- 世界模型依据当前观测、子任务和 metadata 生成多视角子目标 g ∗ g^* g∗。
- 主 VLA 组合历史观测与 C = { ℓ , ℓ ^ , g ∗ , m , c } C=\{\ell,\hat{\ell},g^*,m,c\} C={ℓ,ℓ^,g∗,m,c},用 5 个生成步输出 50 步连续动作块。
- 机器人执行前 15 或 25 步;主 VLA、高层策略和世界模型在不同线程异步运行。
- 子任务改变或距离上次生成达到 4 秒时,异步刷新视觉子目标;随后用最新条件继续滚动生成动作。
因此,π0.7 推理时不需要真实未来图像,也不需要深度图。它需要当前/历史 RGB、多机器人本体状态、任务 prompt;视觉子目标是可选的,并由世界模型在线生成。论文中 π0.7 (GC) 表示启用了生成式 goal conditioning 的版本。
4.3、用把甜薯放进空气炸锅走一遍

这项任务没有对应的机器人动作示范。人先依次给出抓住空气炸锅把手、用左手打开、右手拿起甜薯、放入炸锅、关闭炸锅等子任务。每次子任务变化,世界模型都可以生成一个新的目标状态,例如打开后的抽屉、甜薯位于篮筐内的场景;主 VLA 则把当前图像变成达到该子目标的低层动作。
收集多次 coaching 后,作者只用这些观测和子任务指令训练高层策略,让它自动产生下一条语言子任务。低层 VLA 不需要新增人工遥操作动作,因此从 coaching 获得新能力并不等于 π0.7 自己在线更新了动作模型参数。

5、关键公式:条件决定动作分布的哪一个模式
5.1、VLA 条件动作目标
论文把主策略训练写成条件动作块的近似最大似然:
max θ E D [ log π θ ( a t : t + H ∣ o t − T : t , C t ) ] \max_{\theta}\;\mathbb{E}_{\mathcal{D}}\left[\log \pi_{\theta}\left(a_{t:t+H}\mid o_{t-T:t},C_t\right)\right] θmaxED[logπθ(at:t+H∣ot−T:t,Ct)]
| 符号 | 含义与作用 |
|---|---|
| θ \theta θ | π0.7 主 VLA 的参数 |
| D \mathcal{D} D | 异质训练数据混合,包括示范和自主执行片段 |
| a t : t + H a_{t:t+H} at:t+H | 从真实控制时刻 t t t 开始的动作块,论文固定 H = 50 H=50 H=50 步 |
| o t − T : t o_{t-T:t} ot−T:t | 当前及历史多视角 RGB 与本体状态 |
| C t C_t Ct | 总任务、子任务、视觉子目标、episode metadata 和控制模式组成的上下文 |
Flow Matching 动作专家实际优化的是这一对数似然的近似下界。为了直观看懂连续动作生成,可以把标准条件 Flow Matching 写成:
a τ = ( 1 − τ ) ϵ + τ a , u = a − ϵ a^{\tau}=(1-\tau)\epsilon+\tau a,\qquad u=a-\epsilon aτ=(1−τ)ϵ+τa,u=a−ϵ
L F M = E [ ∥ v θ ( a τ , τ , o , C ) − u ∥ 2 2 ] \mathcal{L}_{\mathrm{FM}}=\mathbb{E}\left[\left\|v_{\theta}\left(a^{\tau},\tau,o,C\right)-u\right\|_2^2\right] LFM=E[∥vθ(aτ,τ,o,C)−u∥22]
这里 a a a 是真实动作块, ϵ \epsilon ϵ 是与动作同形状的高斯噪声, τ ∈ [ 0 , 1 ] \tau\in[0,1] τ∈[0,1] 是生成模型内部时间, a τ a^{\tau} aτ 是噪声和真实动作之间的插值, u u u 是目标速度场, v θ v_{\theta} vθ 是动作专家预测的速度。推理时从噪声出发,数值积分 5 步得到动作块。需要强调:这组展开式用于解释论文采用的标准 Flow Matching 机制,论文正文没有公开 π0.7 的完整损失实现细节。
5.2、世界模型目标
世界模型记为 g ψ g_{\psi} gψ,其条件 Flow Matching 目标可概括为:
max ψ E D g [ L C F M ( g t ∗ , g ψ ( o t , ℓ ^ t , m ) ) ] \max_{\psi}\;\mathbb{E}_{\mathcal{D}_g}\left[\mathcal{L}_{\mathrm{CFM}}\left(g_t^*,g_{\psi}(o_t,\hat{\ell}_t,m)\right)\right] ψmaxEDg[LCFM(gt∗,gψ(ot,ℓ^t,m))]
| 符号 | 含义与作用 |
|---|---|
| ψ \psi ψ | BAGEL 初始化的世界模型参数 |
| D g \mathcal{D}_g Dg | 具有高质量子任务分段标签的数据子集,并混合外部图像/视频数据 |
| o t o_t ot | 当前多视角观测 |
| ℓ ^ t \hat{\ell}_t ℓ^t | 当前语义子任务 |
| m m m | 速度、质量、失误等 episode metadata |
| g t ∗ g_t^* gt∗ | 真实未来子目标,训练时取分段末帧 o t e n d o_{t_{end}} otend |
| g ψ ( ⋅ ) g_{\psi}(\cdot) gψ(⋅) | 生成的多视角未来目标图像 |
它学的不是完整长视频轨迹,而是当前子任务结束附近的目标画面。因此更准确的称呼是轻量视觉子目标世界模型,而不是能在 latent 中长时间滚动环境动力学的通用世界模型。
5.3、用 CFG 强化期望行为
因为各 prompt 组件在训练时会被 dropout,推理时可对 metadata 做 classifier-free guidance:
∇ a log π θ ( a ∣ o , C ) + β [ ∇ a log π θ ( a ∣ o , C ) − ∇ a log π θ ( a ∣ o , C u n c o n d ) ] \nabla_a\log\pi_{\theta}(a\mid o,C) +\beta\left[\nabla_a\log\pi_{\theta}(a\mid o,C)-\nabla_a\log\pi_{\theta}(a\mid o,C_{\mathrm{uncond}})\right] ∇alogπθ(a∣o,C)+β[∇alogπθ(a∣o,C)−∇alogπθ(a∣o,Cuncond)]
C C C 是带期望 metadata 的条件, C u n c o n d C_{\mathrm{uncond}} Cuncond 是移除相应条件的分支, β \beta β 是引导强度。论文使用 β ∈ { 1.3 , 1.7 , 2.2 } \beta\in\{1.3,1.7,2.2\} β∈{1.3,1.7,2.2} 的中等取值。增大差分项相当于把动作从平均可行行为推向更符合高质量、快速、无失误提示的行为,但过强 CFG 也可能牺牲多样性或稳定性。
6、实验结果:需要按四条能力轴来看
6.1、无需任务专门微调的灵巧操作

π0.7 用同一个通用模型测试折衣、制作意式咖啡、折纸箱、切西葫芦、削皮和更换垃圾袋等任务。对 π0.6* 的四项 RL 专家任务,论文同时报告成功率和归一化吞吐;对其他任务报告分阶段 task progress。结论不是每个数字都全面领先,而是一个未做任务专门后训练的 π0.7 能接近各任务专家,并在困难衣物和纸箱任务上取得更高吞吐。
去掉 episode metadata,或训练时去掉自主评测数据,四项任务都退化,吞吐差距尤其明显。这支撑了论文最重要的数据结论:自主 rollout 的价值不只是提供更多成功样本,它还覆盖失败、恢复和不同策略;但前提是用 metadata 把行为质量分开。
6.2、未见环境中的指令跟随

作者在 4 个未见厨房和 2 个未见卧室中设计 14 个场景,每个场景连续执行 3 到 6 条开放指令,指标是所有评测中正确完成的指令比例。π0.7 明显优于 π0.5 和 π0.6。更关键的是,复杂指代和违反数据偏置的指令也得到改善。
例如,拿起最大盘子上的水果要求同时理解对象、属性和空间关系;把餐具扔进垃圾桶、把垃圾放进餐具箱则故意反转训练数据中的固定规则。π0.7 在这些任务上更能听从语言而不是照搬场景先验,生成式视觉子目标在从微波炉放回冰箱这类反向任务中尤其关键。
6.3、零样本跨本体迁移

评测从简单物体整理逐步增加本体差异:多机器人数据到静态双臂、双 UR5e 到小型双臂、小型双臂到单 UR5e,最后是从轻量双臂到双 UR5e 的毛巾和 T 恤折叠。π0.7 并非只复制源本体动作:源机器人装袋需要一只手撑开袋口,较高的 UR5e 可以直接单臂放入;源机器人折衣采用倾斜夹爪压住布料,UR5e 则形成更适合其运动学的垂直抓取。
T 恤折叠的人类对照实验招募 10 名顶尖遥操作员,每人 3 次、共 30 次,双方都不允许在目标 UR5e 上预热。人类 task progress 为 90.9%、成功率为 80.6%;π0.7 (GC) 分别为 85.6% 和 80%。这说明其目标本体表现接近人类首次迁移,但样本量不大,也不能据此推导到任意新本体。
6.4、组合泛化与 coaching
短时序新任务如按压法压壶、向电饭煲舀米、擦拭办公物品和旋转铰接物体,可以直接用语言或视觉子目标提示。长时序新任务单凭一句话仍会失败,作者改用逐步语言 coaching 完成装载/卸载空气炸锅和烤贝果,再用 coaching 轨迹训练高层语言策略。
论文把这称为组合泛化,但并未掩盖评测边界:数据规模太大,很难证明某个底层技能从未在别的任务、别的标签或偶然动作中出现。更稳妥的表述是,π0.7 展示了把已学技能重新组合到新任务和新本体上的能力,而不是凭空获得全新的物理技能。
6.5、数据规模只有和细粒度条件一起增长才有效

折衣数据按质量和速度切成前 30%、50%、80% 和全部数据。无 metadata 的模型在继续加入低质量数据后反而下降;带 metadata 的模型随数据增多持续提高,尽管平均质量在降低。另一项消融把任务最多样的 20% 数据与随机 20% 数据分别删除:删除高多样性数据的退化明显更大,说明收益来自任务覆盖度,而不只是样本数量。
7、效率、部署成本与公开状态
| 项目 | 论文设置 |
|---|---|
| 主 VLA 参数量 | 约 5B:Gemma 3 4B backbone + 860M action expert |
| 动作生成 | 50 步动作块,5 个生成步,执行 15 或 25 步后滚动 |
| 控制频率 | 双 UR5e 为 20 Hz,其余平台为 50 Hz |
| 主 VLA 最快推理 | 单张 H100、3 相机、5 步生成、训练期 RTC:38 ms |
| MEM + 视觉子目标最坏推理 | 127 ms |
| 世界模型 | BAGEL 14B 初始化,4×H100 张量并行、8 bit 大矩阵乘、SageAttention |
| 子目标生成 | 25 个去噪步,约 1.25 s,异步每 4 s 或子任务变化时刷新 |
38 ms 不应被理解为完整系统端到端时延,它对应最小主 VLA 配置;加入历史记忆和视觉目标后可到 127 ms,世界模型生成本身约 1.25 秒。系统之所以还能连续控制,是因为动作块、RTC 和异步线程把慢速语义/视觉更新与快速动作执行解耦。
公开复现还有更现实的限制:官方没有发布 π0.7 代码、checkpoint、训练数据比例、metadata 标注工具和世界模型权重。openpi 可用于理解 π 系列的基础 Flow Matching VLA、数据转换和 policy server 接口,但它当前不是 π0.7 的官方实现,不能据此声称复现论文结果。
8、在没有官方代码时如何实现一个可验证的简化版
完整复制 5B VLA、14B 世界模型和内部大规模数据并不现实,更可行的是按先验证机制、再扩展规模拆成四阶段。
8.1、阶段一:在现有 VLA 上加入 metadata prompt
以公开的 π0/π0.5、OpenVLA 或自有 Flow Matching VLA 为底座,先不接世界模型。数据侧增加 episode_length_bin、quality_score、mistake、control_mode 和 subtask_text 字段,统一序列化到文本 prompt。至少准备同一任务中质量、速度和策略明显不同的数据,否则模型无法学习条件与动作模式的对应关系。
验证时做三组对照:只用高质量数据;混合全部数据但无 metadata;混合全部数据并有 metadata。测试固定质量 5/失误 false 与低质量提示是否产生可测的成功率、轨迹长度和恢复行为差异。
8.2、阶段二:加入历史编码和动作专家梯度隔离
将最近若干秒 RGB 和本体状态压成固定 token,先用 2 到 3 个相机、较短历史降低显存。连续动作分支读取 VLM 激活,但在接口处 stop_gradient/detach,VLM 侧保留 FAST 或其他离散动作辅助监督。重点验证的不是模型更大,而是混合质量数据训练时 VLM 表征是否更稳定。
8.3、阶段三:离线生成视觉子目标
先用现成图像编辑模型或较小视频扩散模型,输入当前前视/腕视图和子任务,生成 1 到 3 张目标图。用真实未来帧与生成目标混合训练 VLA,并复现论文的条件 dropout。评测语言歧义较高的任务,例如多个相似把手、相对位置指令、不同抓取姿态,比较语言 only 和语言 + goal image。
世界模型需要单独评测:目标物体是否保留、机器人结构是否一致、目标是否物理可达、跨视角是否一致。只看 FID 或图像美观度不足以判断它是否对控制有用。
8.4、阶段四:接入异步在线链路
高层策略低频输出子任务,世界模型以 2 到 4 秒周期异步更新,VLA 高频滚动生成动作块。工程上需要缓存带版本号的 subtask_id 与 goal_id,确保新子任务不会误用旧目标图;还要记录目标生成延迟、VLA 延迟、动作块重叠区和执行失败原因。
一个最小的模块接口可以是:
subtask = high_level_policy.predict(observation, task, subtask_history)
if subtask.changed or goal_timer.expired():
goal_worker.submit(observation.rgb, subtask.text, desired_metadata)
context = {
"task": task,
"subtask": subtask.text,
"goal_images": goal_worker.latest_valid(subtask.id),
"metadata": desired_metadata,
"control_mode": "joint",
}
action_chunk = vla.sample(
observation_history,
proprio_history,
context,
previous_actions=rtc_buffer,
num_flow_steps=5,
)
robot.execute(action_chunk[:execute_horizon])
这只是与论文数据流一致的工程骨架,不是官方代码。真正影响结果的细节包括相机标定、动作归一化、跨本体 action mask、目标图质量、metadata 分布、控制频率与 RTC 拼接策略。
9、方法价值、局限与工程判断
π0.7 最值得借鉴的地方不是又加了一个世界模型,而是把数据质量和行为策略从训练集清洗问题变成条件建模问题。对于机器人团队,这意味着失败 rollout、人工接管和旧策略数据不必全部丢弃;只要标签足够可靠,它们可以扩展状态覆盖并把专家能力蒸馏回通用模型。
它的局限同样明确:
- unseen 任务或 unseen 任务—本体组合的成功率通常在 60% 到 80%,低于 seen 任务常见的 90% 以上;
- metadata 中的质量和失误依赖人工粗标,标签成本和一致性没有消失,只是从动作示范转移到数据治理;
- 视觉子目标可以改善空间语义,但生成错误也会直接误导动作,且 14B 世界模型的部署成本很高;
- 未收集该任务的专门动作数据不等于底层技能完全未见,组合泛化的严格边界仍难测量;
- 官方尚未开放 π0.7 的代码、模型和数据配方,外部团队目前只能做机制级复现,无法公平复核论文的绝对结果。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)