灵巧手VLA真机均分71%,北大DeCAL用接触门控接入触觉
(1)《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!
(2)AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群,涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识,欢迎加入(https://t.zsxq.com/33pJ0)!
论文标题:DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
论文作者:北京大学与北京智源人工智能研究院
发表时间:2026年9月8日
本文要点
(1)DeCAL是北京大学和北京智源2026年9月放出的灵巧手VLA,权重从InternVLA-A1-3B初始化,GitHub标明CoRL 2026官方实现。
(2)六项真机任务平均成功率71%,进度成功率83.4%,摘要写比最强基线高出15个百分点以上。
(3)做法上两点最值得看,接触感知门控按接触状态放进触觉,以及视触潜在协同想象去联合预测未来画面和力。
(4)短板在拧灯泡,成功率只有40%,进度成功率还低于InternVLA-A1,也没有大规模视触预训练。
(5)文末附官方README的训练和离线评估命令。
北京大学和北京智源人工智能研究院在2026年9月8日把DeCAL挂上arXiv。GitHub仓库标明这是CoRL 2026的官方实现。
我把HTML版报告、项目页和README对着读了一遍。触觉进VLA现在还少见,这篇想讲一件具体的事。为什么触觉不能像多视角图像那样直接拼进模型。
六项接触密集的真机任务上,平均成功率71%,进度成功率83.4%。摘要写比最强基线高出15个百分点以上。

手把镜头挡住以后
灵巧操作和夹爪抓取不一样。五指手一合上,手腕相机经常只能看见手背。接触力、打滑、物体变形,画面里都没有。
现有VLA多半靠视觉和语言。报告点名π0.5、GR00T N1.6、InternVLA-A1这一路,语义理解强,接触动力学没有单独建模。
DeCAL的实验平台是一对6自由度UR5机械臂,加上两只22自由度的SharpaWave五指手,动作空间一共56维。视觉来自头顶和两个腕部的Intel RealSense D435,每个指尖有一块320乘240的视觉触觉传感器,整机30Hz采集。

指尖给出三种信号。原始触觉图、6维力与力矩、形变深度图。进策略的主要是形变图,力用来做潜变量监督。
触觉为什么不能直接拼进去
接触是一阵一阵的。手在空中够物体的时候,指尖传感器几乎没信息,硬灌进去会搅视觉注意力。报告把这种做法叫做同质多模态融合。
他们做了一个对照。InternVLA-A1触觉版把十指形变图和6维力,用额外的交叉注意力接到理解专家上,别的设置和原版一样。
吸管移液成功率从35%掉到20%。擦白板从50%掉到45%,拧灯泡从30%掉到25%。装配零件从15%升到45%,拧瓶盖从5%升到25%。有的任务升,有的任务掉。
DeCAL的办法是接触感知门控。共享ResNet从各指形变图抽出局部token和一个全局token。局部token当交叉注意力的K和V,全局token算出一个门控值σ,接触强的时候把触觉残差放大,没接触时压下去。

图6画了装配和拧瓶盖两个测试回合。没碰到物体时σ一直很低,碰到以后才抬起来。消融里去掉门控,装配成功率从65%掉到50%,拧瓶盖从80%掉到70%。
三个专家和一次共想象
骨架是混合Transformer,三个专家单向传信息。理解专家看懂当前场景,生成专家想象下一步的视触状态,动作专家再出动作。后面的专家能看见前面的token,反向看过去不行。

理解专家底座是Qwen3-VL,生成专家和动作专家用Qwen3。权重从InternVLA-A1-3B初始化。论文没有另报DeCAL自己的总参数量。
生成专家干的是世界模型那类活,预测接触之后画面和力会怎么变。视频生成模型像素级往前滚,跟不上高频控制。他们把多视角图像用Cosmos VAE编成潜变量,32乘32的特征再压到4乘4,平行解码。
触觉潜变量从当前6维力编进去,训练时还要重建未来的原始图、形变图和力。推理时重建解码器关掉,只把潜变量传给动作专家。论文把这套训练叫视触潜在协同想象。
装配任务上,未来画面和InternVLA-A1比,Cosmos特征相似度0.946对0.913,LPIPS 0.222对0.243。这项评测在验证集上做,不是真机执行。

手臂和手指动力学差得很远。动作专家用分解式流匹配,两套噪声分别初始化,再在同一个Transformer里一起去噪。去掉这一项,装配成功率只剩25%,拧瓶盖只剩35%。两项生成也全关的话,分别掉到20%和30%。
成绩单,挑几个要紧的数
六项任务各采100条遥操作示范,默认评20次。示范用Manus Metagloves Pro加VIVE定位器,手套重定向到灵巧手,定位器控臂。遥操作没有把指尖力反馈给操作员,报告自己把这件事写成了限制。
对照表里DeCAL的71和83.4来自摘要。其余模型的六项SR均分由表1逐项平均后四舍五入。进度成功率基线没有给总表,写未报告。
| 模型 | 路线 | 擦花瓶 | 擦白板 | 装配零件 | 拧瓶盖 | 吸管移液 | 拧灯泡 | 六项SR均分 | 六项PSR均分 |
|---|---|---|---|---|---|---|---|---|---|
| DeCAL | 门控视触VLA | 100 | 80 | 65 | 80 | 60 | 40 | 71 | 83.4 |
| DECO | 触觉专家策略 | 90 | 60 | 35 | 70 | 45 | 35 | 56 | 未报告 |
| ViTacFormer | 触觉专家策略 | 80 | 45 | 15 | 65 | 55 | 25 | 48 | 未报告 |
| InternVLA-A1触觉版 | 触觉直接接入VLM | 75 | 45 | 45 | 25 | 20 | 25 | 39 | 未报告 |
| InternVLA-A1 | 视觉VLA | 65 | 50 | 15 | 5 | 35 | 30 | 33 | 未报告 |
| GR00T N1.6 | 视觉VLA | 30 | 50 | 30 | 10 | 60 | 10 | 32 | 未报告 |
拧灯泡是全场最难看的一项。DeCAL成功率40%,进度成功率48.8%,进度这项还低于InternVLA-A1的53.8%。吸管移液上GR00T N1.6也到了60%,和DeCAL持平。论文说多数任务进度成功率最高,没有说每一项都第一。
分布外只在拧瓶盖上测了四种扰动。表6第三阶段成功率,未见背景60%,杂乱场景70%,未见光照65%,未见物体75%。未见物体比最强基线高出30个百分点,报告把原因归于视触动力学,外观变了还能靠接触模式迁移。
项目页把未见光照写成70%,和论文表6的65%对不上,本文以表6为准。

本地跑一遍
下面命令抄自官方README,环境要求写的是Python3.10和CUDA12.8。
conda create -y -n decal python=3.10
conda activate decal
pip install --upgrade pip
conda install -c conda-forge ffmpeg=7.1.1 svt-av1 -y
pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 \
--index-url https://download.pytorch.org/whl/cu128
pip install -e .
初始化权重下载的是InternRobotics/InternVLA-A1-3B,指定commit 19e953fb2d4b49d2b181c0b55981f2bd3444d546。装完还要把仓库里的transformers_replace拷进当前环境的transformers目录,README写明改过DeCAL和π0相关模块。
微调入口是launch/decal_finetune.sh。离线评估入口如下,checkpoint路径要自己填。
python src/lerobot/datasets/v30/convert_unitree_json_to_lerobot_v30.py \
--raw_dir "${RAW_DATA_DIR}" \
--repo_id "${DATASET_REPO_ID}" \
--robot_type Ur5_Sharpa \
--custom_task_description "${LANGUAGE_INSTRUCTION}"
python util_scripts/compute_norm_stats_single.py \
--action_mode abs \
--chunk_size 50 \
--repo_id "${DATASET_REPO_ID}"
bash launch/decal_finetune.sh "${DATASET_REPO_ID}" abs true
python tests/policies/decal/deploy_policy_tactile.py \
--checkpoint /path/to/checkpoint
转换脚本目前只实现了Ur5_Sharpa这一种特征表,别的本体直接NotImplementedError。数据在ModelScope的Aureleo/DeCAL_dataset,转成了Open-X-Tactile统一格式。
我没有找到单独托管的DeCAL权重链接。附录写单张RTX 4090上每个动作块平均0.27秒,动作块长度50。历史观测15帧,按30Hz大约0.5秒。这些数字来自报告,不是我实测。
几点看法
接触门控是我觉得最该被别的视触VLA抄的一块。InternVLA-A1触觉版已经说明,触觉接进去不等于变强,吸管这种任务会被噪声拖下水。门控把此刻有没有接触从特征里拆成一个开关,比再堆一个融合层实在。
潜在协同想象和世界模型是同一类监督。差别在推理时不把像素解码出来,只把未来视触潜变量送给动作专家。装配验证集上的Cosmos相似度和LPIPS比InternVLA-A1好一截,可这仍然是离线帧预测,不能直接等同于真机里的规划能力。
短板也很硬。拧灯泡成功率40%,进度成功率48.8%,还输给纯视觉的InternVLA-A1。附录失败案例写了两类,双手交接对不齐,以及头部相机视野不够,物体出画以后状态估计会漂。
遥操作没有力反馈,示范质量本身就有上限。再加上没有大规模视触预训练,这套方法目前还是在六项自采任务上微调出来的专家策略。换到别的平台或传感器上,报告没有给出证据。
参考链接
- 技术报告原文 arXiv 2609.09119 v1,2026年9月,HTML版
- 代码 AureleoPKU/DeCAL,本文命令出处,项目页 DeCAL
- 数据 ModelScope Aureleo/DeCAL_dataset,格式来自 Open-X-Tactile
- 初始化权重 InternRobotics/InternVLA-A1-3B,报告 InternVLA-A1,arXiv 2601.02456
- 对比方案 GR00T N1,arXiv 2503.14734、ViTacFormer,arXiv 2506.15953、DECO,arXiv 2602.05513
- 生成专家用的视觉编码器 Cosmos,arXiv 2501.03575,理解专家底座 Qwen3-VL
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)