写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

导读

折叠衣物看似只是“抓—放—再抓”,却是机器人操作中很难泛化的一类任务:布料会皱、滑、遮挡,初始状态和材质变化极大;双臂的微小配合误差还会在长轨迹中不断累积。许多现有 VLA 策略为单一衣物类别分别训练,直接把多类任务混在一起训练又容易相互干扰,最终得到一个什么都见过、却难以稳定完成任何一类折叠的策略。

DeMaVLA 把问题定位为“可泛化的柔性物体操作”。它以 Qwen3-VL 为视觉语言骨干,外挂一个专门处理机器人状态与连续动作的 Action Expert,用 flow matching 生成双臂动作块;预训练阶段使用约 5,000 小时真实双臂演示学习通用操作先验,后训练阶段用混合折叠数据、训练时 Real-Time Chunking(RTC)和人机协同 DAgger 处理部署时会遇到的失败状态。

论文的论证顺序是:Introduction 说明柔性物体折叠与单任务策略的矛盾,Related Work 回顾 VLA 与交互式模仿学习;Section 3 从数据、架构、训练和 DAgger 四部分构成模型主体;Section 4 依次在 RoboTwin 2.0、真实家庭折叠基准和预训练数据规模上验证;最后将结论收束到真实数据、动作效率与纠错数据的组合价值。

猫先生认为,这篇论文的可取之处在于没有把“泛化”归结为一个更大的模型。它把柔性操作拆成三种不同来源的能力:大规模真机数据提供常识,动作分支提供连续控制,失败纠正数据提供恢复能力。

  • 论文标题:DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation
  • 论文地址:https://arxiv.org/abs/2605.31286
  • 论文 PDF:https://arxiv.org/pdf/2605.31286
  • 论文源码:https://arxiv.org/e-print/2605.31286

原文脉络

原文 Figure 1 先给出预训练数据的构成,再在 Section 3.1 解释为什么宽泛的双臂操作数据能够迁移到折叠。Figure 2 将数据、模型、RTC、DAgger 与最终多衣物折叠连成闭环。随后 Section 4 分别检验仿真泛化、真机多任务成功率和数据规模效应;这种安排使“模型设计有效”与“真实数据规模有效”能够被分开观察。

1–2. Introduction 与 Related Work:折叠不是单一抓取技能的重复

刚性物体通常有稳定的几何边界和抓取点;衣物、毛巾等柔性物体的形状取决于前一步动作,视觉上还会产生遮挡、褶皱与自相似区域。一个策略若只在摆平的衬衫上训练,换成被随意丢进篮子的裙子或毛巾,很容易在取物、铺平、对齐任一环节偏离训练分布。

已有 VLA 基础模型证明了视觉、语言和动作可以在一个策略中对齐,但柔性操作往往仍被拆成类别专用策略。直接混合数据的另一个问题是任务干扰:不同衣物、不同折叠顺序和不同中间状态对同一动作条件提出冲突。DeMaVLA 的目标不是定义新的折叠算法,而是让一个双臂 VLA 在共享表示上获得跨类别的先验,并在真实失败处持续补数据。

Related Work 的另一条线是 DAgger。行为克隆只学习专家演示中出现过的状态;而真实机器人一旦偏离,之后的观察很可能没有对应示例。DAgger 让当前策略先执行,在它真正犯错的位置请求专家纠正,再把这类恢复轨迹并回训练集。论文采用 human-gated 版本:人只在不安全、不稳定或明显次优时接管,避免持续遥操作的高标注成本。

3. The DeMaVLA Model:数据、连续动作与失败恢复共同组成策略

3.1 Pre-training Dataset:宽泛双臂操作为折叠提供身体先验

预训练数据约 5,000 小时,来自真实世界的双臂人形机器人演示。它不只含折叠:还覆盖家庭整理、物体转移、工业搬运和长时程双臂协作。作者的假设是,伸手、接近、抓取、放置、双臂配合等基础技能可以跨任务复用;而其中的折衣、卷毛巾、整理衣物等子集再把这些先验拉回柔性物体场景。

图 1:DeMaVLA 预训练数据分布。总量约 5,000 小时,其中约 4,000 小时为其他双臂操作任务,折叠类任务构成面向下游的专门子集。

图 1:预训练数据同时保留广泛的双臂操作技能与折叠相关样本。来源:论文 Figure 1。

这张图也提示了一个容易被忽略的事实:折叠并非占据数据的大头。模型是否能迁移,不只取决于“看过多少衣物”,还取决于其余任务能否提供有效的双臂协调和接触操作先验。论文的规模实验能证明更多数据有效,但尚不能完全拆分“数据总量”和“数据配方”各自贡献多少。

3.2 Model Architecture:层对齐裁剪的 Action Expert

在时刻 t t t,模型接收三路操作视角图像、语言指令、机器人本体状态 q t q_t qt 与带噪的未来动作块。观察上下文可写为:

O t = [ I t 1 , I t 2 , I t 3 , ℓ t , q t ] O_t=[I_t^1,I_t^2,I_t^3,\ell_t,q_t] Ot=[It1,It2,It3,t,qt]

其中未来双臂连续控制序列为 A t = [ a t , … , a t + H − 1 ] A_t=[a_t,\ldots,a_{t+H-1}] At=[at,,at+H1]。Qwen3-VL 编码视觉语言上下文;Action Expert 将本体状态投影为 token,并与带噪动作 token 一起处理,预测将动作块去噪所需的向量场。这样做避免把连续控制硬离散成语言 token,保留了双臂轨迹的平滑性。

Action Expert 的设计是本文的工程核心。完整复制 VLM 的全部 Transformer 层,虽然能在每层与视觉语言表示对应,却会让 flow matching 的多次去噪非常昂贵。DeMaVLA 保留隔层的对应关系、裁掉约一半动作分支层:相邻保留层直接连接,仍可接收不同深度的 VLM 条件信息。最终模型包含 0.4B 视觉编码器、4.0B 语言模型和 2.2B Action Expert,共 6.6B 参数。

两条分支的职责也被刻意分开:视觉语言骨干负责理解“折哪件衣物、放到哪里、当前布料呈什么状态”,动作分支负责把这些条件与关节状态、连续控制噪声合并成未来轨迹。相比为每个任务单独训练视觉编码器或控制器,这种分工让预训练中的视觉语言知识能够保留;相比让通用 VLM 直接输出所有关节值,它又给机器人专用 token 留出独立的计算路径。层对齐的价值正是在两者之间建立稳定接口。

图 2:DeMaVLA 总览。真实双臂数据预训练、层对齐裁剪 Action Expert、flow matching、训练时 RTC 与人机协同 DAgger 被组织为同一闭环。

图 2:Action Expert 从 Qwen3-VL 的层结构中裁剪得到;下方展示了人机协同 DAgger 如何把失败修正重新聚合进训练数据。来源:论文 Figure 2。

猫先生认为,隔层裁剪不是单纯“模型瘦身”。它保留 VLM 与动作分支的层级对应,使动作 token 能在不重复运行完整语言模型的前提下获取多层语义条件;这正对准了 flow matching 在推理中反复调用动作网络的成本问题。

3.3 Model Training:Flow Matching 与训练时 RTC 面向异步执行

预训练采用条件 flow matching:Action Expert 学习在 O t O_t Ot 条件下将噪声动作块逐步还原为连续双臂轨迹,即建模 p ( A t ∣ O t ) p(A_t\mid O_t) p(AtOt)。与动作离散分类相比,这种生成式表述更适合多步、平滑且可能多模态的双臂控制。

真实部署时,模型计算下一动作块需要时间,机器人却不能停住等待。训练时 RTC 将动作块分成两段:已经承诺并将在等待期间执行的 prefix,以及仍可预测的 postfix。训练时 prefix 保持干净、仅对 postfix 加噪并计算损失;推理时策略据此生成与已执行动作连续衔接的后续轨迹。论文因此不依赖额外的推理时 inpainting 或梯度引导来处理异步动作块。

3.4 Human-in-the-Loop DAgger:只在策略偏离时收集高价值纠正

混合折叠策略上真机后,人类监控执行;发生失败风险时用二元门 g t g_t gt 接管,完成纠正后再交还策略。执行策略可概括为:

π e x e c ( o t ) = g t π H ( o t ) + ( 1 − g t ) π θ ( o t ) \pi_{\mathrm{exec}}(o_t)=g_t\pi_H(o_t)+(1-g_t)\pi_\theta(o_t) πexec(ot)=gtπH(ot)+(1gt)πθ(ot)

只记录接管区间内的人类动作,并在每轮后聚合回训练集。这样收集的数据集中在抓取失败、布料未对齐或中间折叠姿态异常等策略自己会访问、而离线演示较少覆盖的状态。代价是仍需人类专家在线判断何时接管;它减少标注量,并没有消除真机采集成本。

4. Experiments:泛化、真机与数据规模分别提供什么证据?

4.1 RoboTwin 2.0:先检查通用双臂操作是否受益

RoboTwin 2.0 包含 50 个双臂操作任务,分别在固定初始状态(clean)和物体姿态、场景布局变化的 randomized 设置下评测。DeMaVLA 在两种设置的平均成功率为 88.42% 与 86.78%,高于 π0、π0.5、X-VLA、ABot-M0 和 LingBot-VLA。随机化设置仍保持接近 clean 的成绩,支持其对姿态和布局扰动具有一定鲁棒性;但这仍是仿真基准,不能直接等同于布料在真实家庭环境中的泛化。

4.2 Household Folding Benchmark:一个 checkpoint 面对四类衣物

真机基准使用 ALOHA 风格双臂机器人,任务不从铺平衣物开始:目标会被随机丢进桌旁篮子,机器人须取出、放到桌面、展开、铺平并完成折叠。衬衫、裙子、裤子、毛巾各进行 20 次试验,每类包含两组不同物品;超过 5 分钟或衣物掉落桌面即失败。

单任务衬衫折叠中,DeMaVLA 达到 100.0% 成功率、平均 2:04,π0 为 80.0%、2:13。多任务设置下,同一个 DeMaVLA checkpoint 在四类衣物上的平均成功率为 92.5%,对比 π0 的 76.3%;平均完成时间为 2:18,对比 2:26。毛巾提升最明显:100.0% 对 55.0%。这些结果支持跨类别共享训练有正迁移,但总样本量仍是每类 20 次,置信区间和更大规模的材质、尺寸变化并未报告。

公平比较方面,论文说明两种方法在相同机器人硬件、控制频率、初始化协议与训练时 RTC 条件下评测,这减少了异步执行机制带来的混杂因素。但 DeMaVLA 同时改变了预训练规模、动作分支设计和 DAgger 数据来源,因此 π0 对比验证的是整套配方的优势,不能从表中单独归因到裁剪、flow matching 或人机协同中的某一项。

4.3 Pre-training Scaling Analysis:5,000 小时带来的增益并非只体现在成功率

为隔离预训练规模,作者将 500、2,500、5,000 小时的 checkpoint 用相同衬衫后训练数据再评测。成功率从 55.0% 升到 70.0%、再到 100.0%,平均完成时间从 3:34 缩短到 3:21、再到 2:04。它表明更大的真机预训练不仅提高任务是否完成,也让动作序列更少绕行或更少触发失败超时。

不过,该实验仍把数据质量、任务覆盖与训练步数绑定在“数据小时数”中。它说明这套扩展配方有效,却不能单独证明任何额外一小时演示都具有相同边际价值。

5. Conclusion:柔性操作的泛化需要“先验、效率与纠错”同时成立

DeMaVLA 将广泛真实双臂预训练、层对齐裁剪 Action Expert、连续 flow matching、RTC 和 human-gated DAgger 组合成柔性操作的 VLA 路线。其真机结果表明,一个策略可以在衬衫、裙子、裤子和毛巾之间复用部分折叠先验,而不是为每个类别单独训练。

猫先生认为,最值得带走的不是“5,000 小时数据足以解决折衣服”,而是柔性操作中的数据闭环应当分工:通用演示教会策略怎样使用双臂,任务数据教会它折什么,人机纠正则教会它从自己造成的坏状态中回来。下一步需要验证的是,这种闭环能否迁移到更多材质、更复杂衣物和不同机器人本体。

参考资料

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐