ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulati

一、论文背景与动机
1.1 当前VLA模型的局限
-
现有VLA模型(如OpenVLA、π₀、GR00T-N1)在语义理解和语言跟随上表现出色,但在接触丰富型任务(如擦拭、按压、装配)中表现不佳。
-
主要原因:它们仅依赖视觉和语言,缺乏对交互力的显式建模和闭环调节能力。
-
力觉在真实物理交互中至关重要,但现有方法要么忽略力,要么仅将其作为辅助感知输入,而非主动控制信号。
1.2 人类操作的启示
-
人类在接触操作中依赖高层视觉/语言推理(任务分解、空间估计)和低层力觉反馈(实时调节力度与位置)。
-
作者受此启发,提出双层级架构:
-
长时推理:通过力提示(force prompt)构建力感知任务概念;
-
短时反应:通过力信号直接驱动动作专家,实现快速闭环调节。
-
二、ForceVLA2 框架详解
2.1 总体架构

输入包括:
-
多视角RGB图像(3个相机)
-
任务文本提示
-
力提示(subtask状态)
-
本体感知状态(EE 6D位姿 + 6D力/力矩)
处理流程:
-
VLM专家:融合视觉、任务、力提示,生成力感知的上下文表示;
-
多模态编码器:编码EE位姿和力信号;
-
跨尺度MoE(Mixture-of-Experts):动态选择主导模态(视觉/状态/力);
-
Flow Matching策略头:生成混合力-位动作和子任务进度预测。
2.2 关键创新模块
(1) 长时力感知(Sec 3.1)
-
引入力提示作为文本形式的子任务状态(如“开始按压”、“保持接触”)。
-
力提示与视觉、任务提示一起输入VLM,使模型具备力感知的任务分解与阶段转换能力。
-
类似一个离散状态机,当预测的进度信号 stst 超过阈值时,自动切换子任务。
(2) 短时力-控闭环(Sec 3.2)
-
力信号双路径:
-
路径1:与EE位姿一起编码,进入MoE进行高层融合;
-
路径2:绕过跨模态交互,直接输入MoE,保留高频力反馈的梯度保真度。
-
-
Cross-Scale MoE:
-
包含三个专家(视觉、状态、力),由门控网络动态加权。
-
在自由空间依赖视觉,在接触阶段依赖力/位姿专家。
-
- Flow Matching策略:

(3) 子任务进度建模

三、ForceVLA2-Dataset

3.1 数据采集
-
硬件:Flexiv Rizon 4s(7自由度)+ DH AG-95夹爪 + 腕部6D力/力矩传感器。
-
相机:2个静态(D455)+ 1个腕载(D435)。
-
遥操作:使用力反馈GELLO系统,保证自然力交互。
3.2 任务与统计
-
5类接触任务:按压瓶子、清洁花瓶、清洁板子、取盘子、装配齿轮。
-
1000条轨迹,约50万同步时间步。
-
每个任务分为3~5个子任务,基于力信号变化离线标注。
3.3 数据特色
-
首个同时提供力提示(用于任务分解)和力控制监督(动作空间含力) 的数据集。
-
填补了现有大规模数据集(如Open X-Embodiment)缺乏标准化力模态的空白。
四、实验分析
4.1 对比实验

-
基线:ACP、π₀、π₀.5、ForceVLA、π₀ w/ naive force。
-
结果:
-
ForceVLA2 平均成功率 66%,远超 π₀(18%)和 π₀.5(31%)。
-
在最具力敏感的装配齿轮任务上,成功率 70%,比ForceVLA(10%)提升60个百分点。
-
简单拼接力输入(π₀ w/F)几乎无提升,说明需专门设计融合机制。
-
4.2 力控优势

-
抗过载:在清洁板、按压瓶等任务中,ForceVLA2主动调整力,避免臂过载。
-
扰动鲁棒性:在按压时突然降低底座,ForceVLA2能迅速适应新接触,其他VLA则失效。
-
重定向能力:在擦拭花瓶(表面法线变化)和取盘子(沙盒搜索)中,即使视觉失效,也能依赖力觉完成。
-

4.3 消融实验
-
组件贡献:
-
力提示(FP):+9% 平均成功率;
-
+多模态编码器(ME):+13%;
-
+Cross-Scale MoE(CM):+26%,为最大增益。
-

-
-
模态融合分析:
-
视觉和力模态在MoE中贡献相当,二者均不可缺失。
-
在简单任务(按压瓶)中,额外力token可能轻微干扰,说明任务复杂度决定融合策略的重要性。
-

五、核心贡献总结
-
首个将力觉主动融入VLA的力-位混合控制框架,实现真正的闭环物理交互。
-
提出双层级力感知机制:
-
长时:力提示驱动任务分解;
-
短时:力信号直接调节动作生成。
-
-
设计Cross-Scale MoE,动态选择最优模态,平衡视觉语义与力反馈。
-
构建首个带力提示和力控制监督的接触数据集,为后续研究提供基础。
-
实验验证在5个真实任务上显著优于SOTA,尤其在力敏感任务上提升巨大。
六、局限与展望
-
力提示目前为人工预定义,未来可探索自动生成或从演示中学习。
-
MoE路由策略为token级,可能丢失时序连续性,可引入时序门控。
-
数据集规模(1000条)仍有限,可扩展更多任务和机器人平台。
-
未涉及多指灵巧手或柔软物体操作,这些场景对力控要求更高。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)