具身智能半月谈No.2|北京人形&湖南大学提出 CRAFT:引入力觉,让 VLA 大模型真正拥有“手感”
导读
尽管当前的视觉-语言-动作模型(VLA,如 RT-2, OpenVLA 等)赋予了机器人出色的环境理解与指令遵循能力,但它们在执行精准插入 USB、擦拭白板等强接触操作任务(Contact-rich Manipulation)时仍然面临瓶颈。为此,北京人形机器人创新中心联合湖南大学王耀南院士团队提出了 CRAFT(Contact-Rich manipulation via force-Aware curriculum Fine-Tuning)框架。CRAFT通过引入基于变分信息瓶颈的课程微调机制,有效纠正了多模态学习中的特征依赖偏移,显著提升了 VLA 模型在复杂物理接触任务中的成功率与泛化能力,目前该工作已被 ICRA 2026 接收。

核心贡献与技术亮点
CRAFT 框架并非提出一个新的VLA模型结构,而是作为一个轻量级、模型无关的微调框架,具备以下三大核心优势:
-
基于变分信息瓶颈(VIB)的课程学习机制:框架在视觉和语言特征编码后引入 VIB 模块,在训练初期通过 KL 散度正则化限制感知特征的信息流,迫使策略网络优先拟合力觉信号,随后通过动态权重调度逐步恢复多模态融合。
-
模型无关的即插即用架构:无需修改底层视觉-语言编码器,CRAFT 可直接集成于现有的主流 VLA 模型(如基于流匹配的π0和基于扩散模型的 RDT)
-
高质量力反馈数据采集:研究团队使用低成本舵机搭建了一套“主从遥操作平台”,直接利用标准机械臂的关节力矩作为力反馈信号,在数据采集过程中实时可以感知机器人的操作力。
CRAFT 的核心逻辑可以归纳为两个关键机制:信息瓶颈(Information Bottleneck)与课程微调(Curriculum Fine-tuning)。

变分信息瓶颈(VIB):重塑模态特征分布
在接触丰富型任务中,视觉与语言信号的熵值远高于力觉信号(关节力矩)。为了打破神经网络天然倾向于拟合高熵特征的优化偏见,CRAFT 在视觉和语言特征提取后加入了 VIB 模块。该模块通过对特征空间施加强制性的信息压缩,有效抑制了冗余的视觉特征,迫使策略在执行插拔、按压等任务时,充分挖掘并利用关节力矩传来的交互阻力与动力学反馈。
微调策略:动态信息融合
单纯压制视觉信息会导致模型失去全局感知能力。因此,CRAFT 设计了指数衰减的 VIB 权重调度策略。在训练早期,VIB 施加极强的正则化惩罚,模型处于“力觉主导”状态,优先建立稳定接触的表征;随着训练步数增加,约束被逐渐放开,模型重新接纳高分辨率的视觉与语义特征,最终实现力觉与视觉-语言信息的平滑融合。

实验评估与泛化性能验证
为了验证 CRAFT 的实际效能,研究团队在真实物理世界中选择了5个极具挑战的强接触任务:USB 插入、翻转纸箱、擦白板、滚橡皮泥、轴孔装配。实验将 CRAFT 插件应用于目前性能比较领先的 π0 和 RDT 模型,并与纯视觉基线模型以及力感知基线模型(FACTR)进行了对比。

实验结果显示任务成功率显著提升,π0 + CRAFT 在五大任务上的平均成功率从25.32%提升至 60.68%,净增 35.36%。RDT + CRAFT平均成功率从 22.66% 提升至 48.32%(提升 25.66%)。尤其在需要连续力控的“滚橡皮泥”任务中,成功率从 8.3% 拉升到了 58.3%。在实际部署中,未搭载 CRAFT 的基线模型一旦出现视觉对齐偏差,极易引发刚性碰撞甚至任务失败;而增强后的模型能够根据末端反作用力实时微调空间姿态,表现出优异的柔顺控制能力。

在面对未见过的物体(比如换一种颜色的橡皮泥、不同材质的纸箱)或改变任务设置(插座的高度或角度变化)时,CRAFT 的平均成功率从基线的 22.50% 大幅提升到了 58.75%,展示出了其强大的 OOD(Out-of-Distribution)泛化能力。这证明了策略网络并未过拟合于特定轨迹,而是真正学习到了底层物理交互的动力学规律。
结语
CRAFT 框架为解决具身智能中长期被忽视的“视觉与力觉模态不平衡”问题,提供了一个极其优雅且高效的解法。最重要的是,其即插即用的特性有望快速赋能开源社区中的海量 VLA 模型,为工业精密装配及家庭柔性服务机器人解锁更广阔的落地场景
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)