一、论文背景与动机

1.1 当前VLA模型的局限

  • 现有VLA模型(如OpenVLA、π₀、GR00T-N1)在语义理解和语言跟随上表现出色,但在接触丰富型任务(如擦拭、按压、装配)中表现不佳。

  • 主要原因:它们仅依赖视觉和语言,缺乏对交互力的显式建模和闭环调节能力。

  • 力觉在真实物理交互中至关重要,但现有方法要么忽略力,要么仅将其作为辅助感知输入,而非主动控制信号

1.2 人类操作的启示

  • 人类在接触操作中依赖高层视觉/语言推理(任务分解、空间估计)和低层力觉反馈(实时调节力度与位置)。

  • 作者受此启发,提出双层级架构

    • 长时推理:通过力提示(force prompt)构建力感知任务概念;

    • 短时反应:通过力信号直接驱动动作专家,实现快速闭环调节。

二、ForceVLA2 框架详解

2.1 总体架构

输入包括:

  • 多视角RGB图像(3个相机)

  • 任务文本提示

  • 力提示(subtask状态)

  • 本体感知状态(EE 6D位姿 + 6D力/力矩)

处理流程:

  1. VLM专家:融合视觉、任务、力提示,生成力感知的上下文表示;

  2. 多模态编码器:编码EE位姿和力信号;

  3. 跨尺度MoE(Mixture-of-Experts):动态选择主导模态(视觉/状态/力);

  4. Flow Matching策略头:生成混合力-位动作和子任务进度预测。

2.2 关键创新模块

(1) 长时力感知(Sec 3.1)
  • 引入力提示作为文本形式的子任务状态(如“开始按压”、“保持接触”)。

  • 力提示与视觉、任务提示一起输入VLM,使模型具备力感知的任务分解与阶段转换能力

  • 类似一个离散状态机,当预测的进度信号 stst​ 超过阈值时,自动切换子任务。

(2) 短时力-控闭环(Sec 3.2)
  • 力信号双路径

    • 路径1:与EE位姿一起编码,进入MoE进行高层融合;

    • 路径2:绕过跨模态交互,直接输入MoE,保留高频力反馈的梯度保真度。

  • Cross-Scale MoE

    • 包含三个专家(视觉、状态、力),由门控网络动态加权。

    • 在自由空间依赖视觉,在接触阶段依赖力/位姿专家。

  • Flow Matching策略
(3) 子任务进度建模

三、ForceVLA2-Dataset

3.1 数据采集

  • 硬件:Flexiv Rizon 4s(7自由度)+ DH AG-95夹爪 + 腕部6D力/力矩传感器。

  • 相机:2个静态(D455)+ 1个腕载(D435)。

  • 遥操作:使用力反馈GELLO系统,保证自然力交互。

3.2 任务与统计

  • 5类接触任务:按压瓶子、清洁花瓶、清洁板子、取盘子、装配齿轮。

  • 1000条轨迹,约50万同步时间步。

  • 每个任务分为3~5个子任务,基于力信号变化离线标注。

3.3 数据特色

  • 首个同时提供力提示(用于任务分解)和力控制监督(动作空间含力) 的数据集。

  • 填补了现有大规模数据集(如Open X-Embodiment)缺乏标准化力模态的空白。

四、实验分析

4.1 对比实验

  • 基线:ACP、π₀、π₀.5、ForceVLA、π₀ w/ naive force。

  • 结果

    • ForceVLA2 平均成功率 66%,远超 π₀(18%)和 π₀.5(31%)。

    • 在最具力敏感的装配齿轮任务上,成功率 70%,比ForceVLA(10%)提升60个百分点。

    • 简单拼接力输入(π₀ w/F)几乎无提升,说明需专门设计融合机制

4.2 力控优势

  • 抗过载:在清洁板、按压瓶等任务中,ForceVLA2主动调整力,避免臂过载。

  • 扰动鲁棒性:在按压时突然降低底座,ForceVLA2能迅速适应新接触,其他VLA则失效。

  • 重定向能力:在擦拭花瓶(表面法线变化)和取盘子(沙盒搜索)中,即使视觉失效,也能依赖力觉完成。

4.3 消融实验

  • 组件贡献

    • 力提示(FP):+9% 平均成功率;

    • +多模态编码器(ME):+13%;

    • +Cross-Scale MoE(CM):+26%,为最大增益。

  • 模态融合分析

    • 视觉和力模态在MoE中贡献相当,二者均不可缺失。

    • 在简单任务(按压瓶)中,额外力token可能轻微干扰,说明任务复杂度决定融合策略的重要性。

五、核心贡献总结

  1. 首个将力觉主动融入VLA的力-位混合控制框架,实现真正的闭环物理交互。

  2. 提出双层级力感知机制

    • 长时:力提示驱动任务分解;

    • 短时:力信号直接调节动作生成。

  3. 设计Cross-Scale MoE,动态选择最优模态,平衡视觉语义与力反馈。

  4. 构建首个带力提示和力控制监督的接触数据集,为后续研究提供基础。

  5. 实验验证在5个真实任务上显著优于SOTA,尤其在力敏感任务上提升巨大。


六、局限与展望

  • 力提示目前为人工预定义,未来可探索自动生成从演示中学习

  • MoE路由策略为token级,可能丢失时序连续性,可引入时序门控

  • 数据集规模(1000条)仍有限,可扩展更多任务和机器人平台。

  • 未涉及多指灵巧手柔软物体操作,这些场景对力控要求更高。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐