【星海图】Fast-WAM: Do World Action Models Need Test-time Future Imagination 译读笔记
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
摘要
世界行动模型(World Action Models, WAMs)作为一种有前景的替代方案,可以取代视觉-语言-行动(Vision-Language-Action, VLA)模型,用于实现具身控制,因为它们显式地对视觉观测在动作影响下将如何演变进行了建模。大多数现有的WAMs遵循“先想象,后执行”(imagine-then-execute)的范式,这会因迭代式的视频去噪而在测试阶段产生显著的延迟,然而,要获得强大的动作表现,显式的未来想象是否真的是必要的,目前仍不清楚。
本文探讨了 WAM 在测试阶段是否需要显式的未来想象,或者它们的优势是否主要来源于训练期间的视频建模。本文提出了一种 WAM 架构 Fast-WAM,它在训练期间保留了视频协同训练(video co-training),但在测试阶段跳过了未来预测,从而将训练期间视频建模的作用与推理期间显式的未来生成解耦。本文进一步实例化了几个 Fast-WAM 变体,以便对这两个因素进行对照比较。在这些变体中,本文发现 Fast-WAM 依然能与“先想象,后执行(imagine-then-execute)”的变体保持竞争力,而移除视频协同训练则会导致大得多的性能下降。从经验上看,在没有进行具身预训练的情况下,Fast-WAM 在仿真基准测试(LIBERO和RoboTwin)以及真实世界任务上都取得了与最先进方法相媲美的结果。它可以实时运行,延迟仅为190毫秒,比现有的 imagine-then-execute WAMs 快 4 倍以上。这些结果表明,WAM中视频预测的主要价值可能在于改进训练期间的世界表征,而不是在测试阶段生成未来的观测结果。
1 引言
构建通用具身智能体需要的策略不仅能将视觉观测映射为动作,还能推理物理世界在交互作用下将如何演变。这激发了人们对世界动作模型(World Action Models, WAMs)日益增长的兴趣,这些模型在一个统一的框架中结合了未来视觉预测与动作建模。与标准的视觉-语言-动作(d Vision-Language-Action, VLA)模型相比,WAM颇具吸引力,因为对未来观测进行建模可能有助于捕捉物理动力学以及与任务相关的时间结构。
大多数现有的WAMs遵循“先想象,后执行(imagine-then-execute)”的范式:它们首先生成未来的观测结果,然后以想象的未来为条件来预测动作。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)