摘要

本文解读 ICLR 2025 论文《FLIP: Flow-Centric Generative Planning as General-Purpose Manipulation World Model》。该论文提出以图像流为中心的生成式规划框架 FLIP,通过融合流生成动作模块(CVAE)流条件视频生成动力学模块(DiT)视觉语言价值模块(LIV),让机器人只依赖语言标注视频训练,就能在学到的交互式世界模型里做长程模型基规划,其特别之处在于把"动作"从自然语言或机器人末端位姿换成图像流——即像素点随时间变化的轨迹,可由现成的点跟踪器从任意视频中自动提取。实验表明 LIBERO-LONG 长程规划成功率由 UniPi 的 2% 提升到 100%,长程视频生成 FVD 由 206.28 降到 35.62、PSNR 由 10.852 升到 26.452,自采真实机器人倒茶与叠衣展开任务成功率分别达到 55% 与 50%,为通用操作世界模型提供了一条可扩展、可复用的技术路线。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)FLIP: Flow-Centric Generative Planning as General-Purpose Manipulation World Model
标题(中文)FLIP:以流为中心的生成式规划作为通用操作世界模型
作者Chongkai Gao, Haozhuo Zhang, Zhixuan Xu, Zhehao Cai, Lin Shao
机构新加坡国立大学(NUS)· 北京大学(PKU)
会议ICLR 2025
arXivarXiv:2412.08261
项目网站nus-lins-lab.github.io/flipweb

背景与动机:世界模型为什么需要一个"可扩展的动作表示"

通用机器人的智能包含两个层次的能力:一层是依据多模态输入做高层任务规划,另一层是与真实世界交互执行计划。FLIP 只解决第一层,并且选择用"世界模型 + 模型基规划"的方式来做。这就要求世界模型必须是交互式的——给定动作,它能模拟出世界的响应。于是问题落到一个更基础的点上:用什么当动作?

论文把这个问题称为寻找一个可扩展的动作表示(scalable action representation),并给出三条判据:能够表达多样物体、机器人与任务上的各种运动;容易从大规模数据中获得标注;能够连接高层规划与底层控制。

按这三条判据,已有方案都有硬伤。用自然语言当动作的代表工作是 UniPi 与 VLP,它们需要额外数据集或任务特定的高层动作标注流程,而且语言根本描述不了"灵巧手转笔"这种全场景的细微动作。用机器人末端轨迹当动作的代表工作是 IRASim 与 iVideoGPT,表示粒度直接受限于轨迹本身,并且需要机器人动作标注,数据获取成本高。用图像流当动作的工作如 ATM、Track2Act,虽然表示通用,但流只被当作单步策略的引导信号,从未进入长程搜索式规划。

动作表示代表工作数据来源主要短板
自然语言UniPi、VLP语言标注视频需任务特定高层动作标注;无法描述细微动作
机器人末端轨迹IRASim、iVideoGPT带动作标注的机器人数据需机器人标注;表示粒度受限
稀疏图像流ATM、Track2Act纯视频 + 跟踪器仅用于单步策略引导,未用于规划
密集图像流(FLIP)FLIP纯视频 + Co-Tracker规划速度慢;未建模物理与 3D

FLIP 的切入点正是最后一行:图像流既能描述像素级的细微运动,又能被现成跟踪器从任何语言标注视频里自动挖出来,天然满足"数据可得性"要求。论文进一步把流从"策略的输入"提升为"规划空间里的动作",并为此配齐了动作、动力学、价值三个模块,形成完整的搜索闭环。

研究主线:从问题到结论

FLIP 研究主线流程图:从长程操作规划难题到通用操作规划器

图 14:研究主线(Mermaid 流程图):长程操作任务 → 可扩展动作表示 → 密集图像流 → 三模块世界模型 → 模型基规划 → 通用操作规划器。

基准/方法设计:三模块如何组成一个可搜索的世界模型

论文把操作任务建模为目标条件的部分可观测马尔可夫决策过程,观测空间直接取图像空间,奖励是稀疏的目标奖励。整个框架由三部分组成:

  1. 动作模块 $\pi_f$:给定观测历史 $o_{t-h:t}$、语言目标 $g$ 和一组查询点,生成未来若干步的查询点轨迹 $\mathbf{p}{t:t+L}=\pi_f(o{t-h:t},\mathbf{p}_t,g)\in\mathbb{R}^{L\times K\times2}$。它必须是生成式的而非预测式,因为采样式规划需要多样化的动作候选。
  2. 动力学模块 $\mathcal{D}$:在流条件下生成短程未来视频 $\hat{o}_{t+1:t+L}$,让世界模型可以被"动作"驱动,从而支持逐步规划。
  3. 价值模块 $\mathcal{V}$:用图像与语言嵌入的相似度为每个候选未来打分,使搜索能够辨别哪条路线更接近目标。

三者在大规模语言标注视频上分别训练,规划时组合使用——这种解耦使"通用知识"与"具体任务"各归其位。

FLIP 方法总览图:跨任务跨本体的语言标注视频训练三个模块

图 1:方法总览。左——FLIP 只用每个视频一句语言描述作为目标,在跨任务、跨物体、跨机器人的视频数据上训练;右——交互式世界模型由动作(流生成)、动力学(视频生成)、价值三模块构成,可在流与视频空间做模型基规划。

分类全景:FLIP 的模块构成

FLIP 模块构成分类图:动作、动力学、价值三模块与低层策略

图 15:FLIP 的模块构成(Mermaid 分类图):动作模块(条件 VAE)、动力学模块(DiT 视频扩散)与价值模块(LIV 视觉语言表示)共同支撑模型基规划,规划结果再以流与视频条件喂给低层策略。

方法细节:四个设计决定与一处关键修正

第一,查询点的采样方式。 以往工作要么用分割模型挑"感兴趣区域",要么按预定义比例在活动区域与静止区域取点。前者对复杂场景不可靠,后者在长视频里会因为物体出现或消失而失效。FLIP 改成在每个时间步于整幅图像上采样均匀网格点,并且只跟踪短片段——即便某些物体中途出现或消失,其影响也被限制在短时域内。流的真值由 Co-Tracker 从视频中提取。

第二,预测位移而不是绝对坐标。 对第 $k$ 个点,模型预测 $\Delta p_t^k=p_{t+1}^k-p_t^k$,并进一步把它拆成位移尺度 $\delta_s$ 与位移方向 $\vec{\delta_d}$ 两部分,即 $\Delta p_t^k=\delta_s^{tk}\vec{\delta_d^{tk}}$,整条流轨迹由解码器逐步重构。消融实验显示,这一处表示改变带来的收益比更换骨干网络大得多。

第三,异质条件的混合注入机制。 原始 DiT 与轨迹条件视频扩散模型用 AdaLN-Zero 处理所有条件,但 AdaLN 会把条件压缩成标量,无法承载图像与流这样的稠密条件。FLIP 的做法是分层:图像与流通过交叉注意力做细粒度交互,扩散时间步与语言指令这类全局条件继续走 AdaLN-Zero,图像历史则直接与噪声帧拼接,且不加噪也不去噪。

第四,价值模块的"片段即状态"修正。 价值模块沿用 LIV 的时间对比表示,即 $\hat{V}_t=\frac{1}{1-\gamma}\cos(\psi_I(o_t),\psi_L(g))$。原版微调目标在约 50 帧的短程完美视频上表现良好,但迁移到长程不完美视频后,价值曲线出现大量锯齿尖峰——而采样式规划恰恰要求平滑的价值曲线。论文的诊断是:长程视频中任务并非平滑推进(机械臂可能在空中犹豫),"相邻帧"这一假设失效。修正办法是把损失里的相邻帧替换成相邻状态,也就是以固定长度的视频片段为最小单位。仅这一处替换,微调后的价值曲线就明显平滑。

FLIP 动作模块与动力学模块网络结构图

图 2:FLIP 的动作模块与动力学模块。左——训练数据各模态的 token 化流程;中——条件 VAE 生成流动作,分开预测每个查询点的位移尺度与方向;右——DiT 以时空注意力做流条件视频生成,流与观测历史走交叉注意力,语言与扩散时间步走 AdaLN-Zero。

FLIP 价值模块与价值曲线对比图

图 3:上——FLIP 的价值模块沿用 LIV 的时间对比学习,但把每个片段而非每一帧当作状态;下——原始 LIV 与 FLIP 微调后的价值曲线对比,锯齿尖峰被显著平滑。

低层策略的部分。 规划出的流与视频如何落到真实动作上?FLIP 训练一个与 Diffusion Policy 结构类似的去噪模型,输入包括观测历史、语言 token、预测流计划与预测视频计划,输出 16 步的动作分块,每次只执行 8 步就重新规划。论文对比三种条件配置:只用流、只用视频、以及两者同时使用。

FLIP 低层策略网络结构图

图 4:低层策略结构(Ours-FV)。输入为两路观测历史、本体状态历史、Llama 3.1 语言 token、两路预测流与两路预测未来视频;Ours-F 与 Ours-V 为去掉对应条件输入的同一架构。

规划算法本身。 由于目标未达成前每步奖励恒为 $-1$,在假设价值函数即最优价值函数的条件下,问题化简为每一步都寻找价值最高的下一个状态,这同时鼓励找到最短路径。求解用爬山搜索:初始化若干条计划束,每条束用动作模块采样多个流候选、用动力学模块生成对应短程视频、再由价值模块选出最好的候选推进;此外周期性地把价值最低的束替换成价值最高的束,防止在某条异常状态上过度开发。

实验设计与结果

评测范围。 实验覆盖四个长程任务套件:LIBERO-LONG(10 个长程桌面操作任务,$50\times10$ 段视频训练,$50\times10$ 个新随机初始化测试)、FMB(形状与外观变化的长程装配基准,1K 单物体多阶段 + 100 多物体多阶段视频)、布料折叠与展开(自采数据,各 40 段变视角视频训练、10 个新视角测试)、Bridge-V2(真实机器人数据,10k 视频训练、256 段测试)。规划结果由人工判定生成视频是否完成任务;视频生成质量用潜空间 L2、FVD 与 PSNR 三项指标衡量。

主结果:长程规划成功率。 UniPi 直接自回归生成整段长程视频,几乎全线失败;只保留流引导、去掉价值模块的 FLIP-NV 明显提升;完整方法再用价值函数引导搜索,把 LIBERO-LONG 推到 100%。

任务UniPiFLIP-NV(无价值模块)FLIP(本文)
LIBERO-LONG2%78%100%
FMB-S0%52%86%
FMB-M0%40%78%
布料折叠20%100%100%
布料展开10%70%90%

FLIP 在四个任务套件上的模型基规划结果

图 5:LIBERO-LONG、FMB、布料折叠与布料展开上的模型基规划结果。图中所有流、图像与价值曲线均由 FLIP 生成。

长程视频生成。 与文生视频方法 LVDM 和以末端轨迹为条件的 IRASim 相比,FLIP 在三个数据集上一致领先。以 LIBERO-LONG 为例,FVD 由 206.28 降到 35.62、PSNR 由 12.205 升到 26.452;FMB 上潜空间 L2 由 0.484 降到 0.264;Bridge-V2 上 PSNR 由 16.481 升到 33.485,其中 IRASim 的末端轨迹由 SAM2 标注。作者强调,长程视频质量来自"逐步搜索 + 短程生成",而非一次性生成长视频。

低层策略对比。 在 LIBERO-LONG 上,流与视频双条件的 Ours-FV 取得最高平均成功率;只用视频的 Ours-V 均值接近但方差明显更大——当机器人偏离训练轨迹时生成视频质量会下降,而叠加稠密流条件后方差下降。

LIBERO-LONG 上不同低层策略的成功率对比

图 6:LIBERO-LONG 上不同低层策略的成功率。流与视频双条件的 Ours-FV 取得最高平均成功率,仅视频条件(Ours-V)均值接近但方差显著更大。

预训练 LIV、原版 LIV 微调与 FLIP 微调的价值曲线

图 7:预训练 LIV、原版 LIV 微调与 FLIP 微调的价值曲线。FLIP 在 Language-Table 与布料折叠两类任务上都得到更平滑的价值曲线。

动作模块消融。 直接回归绝对坐标的结果与 ATM 相当(ADE 20.5 对 19.6),说明只换骨干网络没用;改成预测位移的尺度与方向后 ADE 降到 14.5;再加上图像重构辅助损失后降到 12.7,阈值内点比例(LTDR)同时从 73.2% 升到 76.5%。

方法ADE ↓(LIBERO-10)LTDR ↑ADE ↓(Bridge-V2)LTDR ↑
ATM19.653.8%18.466.1%
Ours-ABS(绝对坐标)20.557.3%17.959.3%
Ours-NoAUX(去辅助损失)14.573.2%12.775.6%
FLIP(本文)12.776.5%11.980.2%

通用性验证。 除了标准基准,论文还在 ALOHA 双臂操作、转笔、机器人剥菜、系塑料袋乃至人手剥蛋等场景上做定性演示——这些任务的机器人本体、物体类型和动作尺度差异极大,但系统都能生成合理的流与未来视频。

FLIP 在多样化操作任务上的生成结果

图 8:FLIP 是跨物体、跨机器人乃至人类手的通用框架。ALOHA 双臂、转笔、机器人剥菜、系塑料袋、人手剥蛋等任务均可生成流与视频——图中所有流与图像均为生成结果。

真实世界实验。 硬件是一台 6 自由度 X-arm 机械臂加两路 RealSense D435i 相机(第三视角与腕部眼在手),控制频率 10 Hz。倒茶任务要求夹起铁勺、从白碗舀取茶叶倒入空杯、再把勺子放回;叠衣展开任务要求把随机抛落的牛仔短裤铺平到最大投影面积的 85% 以上,且必须在 15 次抓取拖动内完成。两个任务分别只用 40 段与 50 段演示。

任务Diffusion PolicyATMFLIP(本文)
倒茶15.0%25%55%
叠衣展开0.0%0.0%50.0%

真实世界实验的硬件设置

图 9:真实世界实验设置。右侧 X-arm 作为执行臂,两路 RealSense D435i 分别提供第三视角与腕部眼在手视角。

倒茶与叠衣展开两个真实世界任务

图 10:两个真实世界任务。上——倒茶(夹勺、舀茶、倒茶、归位);下——牛仔短裤的展开,需在 15 次抓取拖动内把布料铺平。

补充消融与缩放。 附录进一步回答了两个问题。其一,用同架构扩散模型替换条件 VAE 做流生成,在 LIBERO-LONG 上 CVAE 更好(ADE 12.7 对 13.4)、在 Bridge-V2 上扩散更好(ADE 10.2 对 11.9),差距很小而扩散推理更慢,因此论文保留 CVAE。其二,数据缩放非常干净:每任务演示从 10 段增到 50 段,LIBERO-LONG 规划成功率依次为 0%、5%、40%、90%、100%,单调上升且没有平台。此外,人工在初始画面中加入苹果等干扰物后,流生成模块仍然稳健,视频生成模块才在若干规划步后失真——失效源头在动力学模块而非动作模块。

用扩散模型替代 CVAE 的动作模块结构

图 11:用扩散模型替代 CVAE 做动作模块。同样对每个查询点生成位移尺度与方向并重构完整流轨迹;两套实现在两个基准上各有胜负且差距很小。

LIBERO-LONG 上的更多低层策略结果

图 12:LIBERO-LONG 上的更多低层策略结果。OpenVLA 无论零样本还是微调均失败,Ours-90 与 Ours-F / Ours-FV 表现相近。

FLIP 动作与动力学模块的模型缩放曲线

图 13:模型缩放。动作模块的 ADE 与动力学模块的潜空间 L2 随模型规模增大持续下降(验证集平滑曲线),两个模块都是可缩放的。

结果对比总结

FLIP 结果对比总结图:规划成功率与视频生成指标的关键数字

图 16:结果对比总结(Mermaid 流程图):UniPi 规划成功率 2% → FLIP-NV 78% → FLIP 100%;同框架 FVD 35.62 对 IRASim 206.28;真实倒茶任务 55% 对 ATM 25%。

关键发现

  • 价值函数是长程规划的胜负手:同一个搜索框架下,去掉价值模块(FLIP-NV)后 LIBERO-LONG 从 100% 掉到 78%,说明"排除错误搜索路线"比"生成得更像"对成功率贡献更大。
  • 动作表示的收益可逐项归因:ADE 19.6(ATM)→ 20.5(回归绝对坐标)→ 14.5(改为预测位移尺度与方向)→ 12.7(加辅助重构损失),两步改动各自带来可测量的提升。
  • 流比视频更适合做执行条件:仅视频条件(Ours-V)的平均成功率接近双条件版本,但跨任务方差显著更大;流条件的加入降低了方差,稳定性更好。
  • 真实场景的演示效率极高:每个真实任务演示不超过 50 段,而扩散策略类方法通常需要 500 段以上;在叠衣展开任务上,Diffusion Policy 与 ATM 的成功率都是 0%,FLIP 达到 50%。
  • 数据缩放单调无平台:每任务演示 10 / 20 / 30 / 40 / 50 段对应规划成功率 0% / 5% / 40% / 90% / 100%,是论文主张"可扩展"的直接证据。
  • 失效源头可定位:加入视觉干扰后,动作模块(流生成)仍然稳健,而动力学模块(视频生成)在中途失真,说明后续改进应优先针对视频生成。

局限性

  • 规划速度慢:受规划阶段大量视频生成过程限制,方法目前只适用于准静态操作任务,作者承认实时(约 30 Hz)推理仍未解决。
  • 不使用物理与 3D 信息:二维图像流对"垂直于屏幕方向的运动"以及"像素占比极小的物体"天然失明;论文未建模场景的物理属性与三维结构。
  • 依赖专家演示:价值模块与语言目标对齐,训练视频必须是专家视频;若视频中混入随机行为,价值模块无法识别并给出正确进度。
  • 静态 MDP 假设:论文假定语言指令能明确指定目标、且环境动态在规划与执行期间不变,语言歧义与环境突变都在研究范围之外。
  • 硬件与场景仍有限:真实实验只覆盖两个桌面任务、单一机械臂平台,跨本体能力的验证目前以定性演示为主。

常见问题(FAQ)

FLIP 和 VLA(视觉-语言-动作)模型是什么关系?

两者解决的是不同层次的问题。OpenVLA 这类端到端 VLA 直接由图像和语言预测动作,在 LIBERO-LONG 上无论零样本还是用 50 段演示微调都未能完成任务;FLIP 只做高层规划,输出流与视频计划,再由一个只吃少量带动作标注演示的低层策略去执行。论文把"通用"与"专用"显式解耦。

为什么用图像流而不是语言或机器人动作当"动作"?

语言太粗,描述不了灵巧手转笔这类细微动作,还需要任务特定标注;机器人末端轨迹需要昂贵的动作标注,粒度也受限于轨迹本身。图像流是像素点的时空轨迹,既能表达细微运动,又能被 Co-Tracker 这类现成跟踪器从任意视频中自动提取,因此同时满足"表达力"与"数据可得性"。

为什么要单独训练一个价值模块?

规划需要在多个候选未来中做选择。论文把奖励设为常数 $-1$,于是问题化简为每步走向价值最高的状态。实验显示价值模块不是可有可无的装饰:去掉它之后 LIBERO-LONG 成功率从 100% 掉到 78%。它提供的是对"哪条路更接近目标"的判别力。

"片段即状态"这个改动解决的是什么问题?

原版 LIV 用逐帧的相邻帧关系做时间对比学习,这在约 50 帧的短程完美视频上有效。但长程视频里任务并非平滑推进,机械臂可能在空中犹豫,逐帧假设会失效,导致价值曲线出现大量锯齿尖峰。把最小单位从帧换成固定长度的片段后,曲线明显平滑,采样式规划才能稳定工作。

规划速度慢到什么程度,有解吗?

作者明确把规划速度列为主要局限,原因是规划阶段要做大量视频生成,因此方法目前只适用于准静态任务。论文给出的方向是结合更快的去噪技术(例如一致性模型一类的加速采样)把规划推进到近实时,同时发展融合物理与三维信息的世界模型。

FLIP 能直接用在新的机器人平台上吗?

原则上可以,因为流的定义与本体无关,论文也展示了 ALOHA 双臂、人手等跨本体的定性结果。但落地上有两层成本:高层世界模型需要目标领域的语言标注视频,低层策略需要少量带动作标注的演示;此外二维流对垂直于像平面的运动和小目标不敏感,需要在数据与相机布置上规避。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐