(1)《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍,独家资源见 WeThinkIn/AIGC-Interview-Book,欢迎 Star!
(2)AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群,涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识,欢迎加入(https://t.zsxq.com/33pJ0)!


论文标题:DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
论文作者:北京大学与北京智源人工智能研究院
发表时间:2026年9月8日


本文要点
(1)DeCAL是北京大学和北京智源2026年9月放出的灵巧手VLA,权重从InternVLA-A1-3B初始化,GitHub标明CoRL 2026官方实现。
(2)六项真机任务平均成功率71%,进度成功率83.4%,摘要写比最强基线高出15个百分点以上。
(3)做法上两点最值得看,接触感知门控按接触状态放进触觉,以及视触潜在协同想象去联合预测未来画面和力。
(4)短板在拧灯泡,成功率只有40%,进度成功率还低于InternVLA-A1,也没有大规模视触预训练。
(5)文末附官方README的训练和离线评估命令。


北京大学和北京智源人工智能研究院在2026年9月8日把DeCAL挂上arXiv。GitHub仓库标明这是CoRL 2026的官方实现。

我把HTML版报告、项目页和README对着读了一遍。触觉进VLA现在还少见,这篇想讲一件具体的事。为什么触觉不能像多视角图像那样直接拼进模型。

六项接触密集的真机任务上,平均成功率71%,进度成功率83.4%。摘要写比最强基线高出15个百分点以上。

DeCAL总览,多模态输入、任务与结果

手把镜头挡住以后

灵巧操作和夹爪抓取不一样。五指手一合上,手腕相机经常只能看见手背。接触力、打滑、物体变形,画面里都没有。

现有VLA多半靠视觉和语言。报告点名π0.5、GR00T N1.6、InternVLA-A1这一路,语义理解强,接触动力学没有单独建模。

DeCAL的实验平台是一对6自由度UR5机械臂,加上两只22自由度的SharpaWave五指手,动作空间一共56维。视觉来自头顶和两个腕部的Intel RealSense D435,每个指尖有一块320乘240的视觉触觉传感器,整机30Hz采集。

双臂灵巧手平台、指尖触觉和遥操作手套

指尖给出三种信号。原始触觉图、6维力与力矩、形变深度图。进策略的主要是形变图,力用来做潜变量监督。

触觉为什么不能直接拼进去

接触是一阵一阵的。手在空中够物体的时候,指尖传感器几乎没信息,硬灌进去会搅视觉注意力。报告把这种做法叫做同质多模态融合。

他们做了一个对照。InternVLA-A1触觉版把十指形变图和6维力,用额外的交叉注意力接到理解专家上,别的设置和原版一样。

吸管移液成功率从35%掉到20%。擦白板从50%掉到45%,拧灯泡从30%掉到25%。装配零件从15%升到45%,拧瓶盖从5%升到25%。有的任务升,有的任务掉。

DeCAL的办法是接触感知门控。共享ResNet从各指形变图抽出局部token和一个全局token。局部token当交叉注意力的K和V,全局token算出一个门控值σ,接触强的时候把触觉残差放大,没接触时压下去。

装配零件和拧瓶盖测试回合里,门控值在接触阶段抬升

图6画了装配和拧瓶盖两个测试回合。没碰到物体时σ一直很低,碰到以后才抬起来。消融里去掉门控,装配成功率从65%掉到50%,拧瓶盖从80%掉到70%。

三个专家和一次共想象

骨架是混合Transformer,三个专家单向传信息。理解专家看懂当前场景,生成专家想象下一步的视触状态,动作专家再出动作。后面的专家能看见前面的token,反向看过去不行。

理解、生成、动作三个专家的整体结构

理解专家底座是Qwen3-VL,生成专家和动作专家用Qwen3。权重从InternVLA-A1-3B初始化。论文没有另报DeCAL自己的总参数量。

生成专家干的是世界模型那类活,预测接触之后画面和力会怎么变。视频生成模型像素级往前滚,跟不上高频控制。他们把多视角图像用Cosmos VAE编成潜变量,32乘32的特征再压到4乘4,平行解码。

触觉潜变量从当前6维力编进去,训练时还要重建未来的原始图、形变图和力。推理时重建解码器关掉,只把潜变量传给动作专家。论文把这套训练叫视触潜在协同想象。

装配任务上,未来画面和InternVLA-A1比,Cosmos特征相似度0.946对0.913,LPIPS 0.222对0.243。这项评测在验证集上做,不是真机执行。

未来画面生成的定性结果

手臂和手指动力学差得很远。动作专家用分解式流匹配,两套噪声分别初始化,再在同一个Transformer里一起去噪。去掉这一项,装配成功率只剩25%,拧瓶盖只剩35%。两项生成也全关的话,分别掉到20%和30%。

成绩单,挑几个要紧的数

六项任务各采100条遥操作示范,默认评20次。示范用Manus Metagloves Pro加VIVE定位器,手套重定向到灵巧手,定位器控臂。遥操作没有把指尖力反馈给操作员,报告自己把这件事写成了限制。

对照表里DeCAL的71和83.4来自摘要。其余模型的六项SR均分由表1逐项平均后四舍五入。进度成功率基线没有给总表,写未报告。

模型路线擦花瓶擦白板装配零件拧瓶盖吸管移液拧灯泡六项SR均分六项PSR均分
DeCAL门控视触VLA10080658060407183.4
DECO触觉专家策略90603570453556未报告
ViTacFormer触觉专家策略80451565552548未报告
InternVLA-A1触觉版触觉直接接入VLM75454525202539未报告
InternVLA-A1视觉VLA6550155353033未报告
GR00T N1.6视觉VLA30503010601032未报告

拧灯泡是全场最难看的一项。DeCAL成功率40%,进度成功率48.8%,进度这项还低于InternVLA-A1的53.8%。吸管移液上GR00T N1.6也到了60%,和DeCAL持平。论文说多数任务进度成功率最高,没有说每一项都第一。

分布外只在拧瓶盖上测了四种扰动。表6第三阶段成功率,未见背景60%,杂乱场景70%,未见光照65%,未见物体75%。未见物体比最强基线高出30个百分点,报告把原因归于视触动力学,外观变了还能靠接触模式迁移。

项目页把未见光照写成70%,和论文表6的65%对不上,本文以表6为准。

六项灵巧操作任务的可视化

本地跑一遍

下面命令抄自官方README,环境要求写的是Python3.10和CUDA12.8。

conda create -y -n decal python=3.10
conda activate decal
pip install --upgrade pip
conda install -c conda-forge ffmpeg=7.1.1 svt-av1 -y
pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 \
  --index-url https://download.pytorch.org/whl/cu128
pip install -e .

初始化权重下载的是InternRobotics/InternVLA-A1-3B,指定commit 19e953fb2d4b49d2b181c0b55981f2bd3444d546。装完还要把仓库里的transformers_replace拷进当前环境的transformers目录,README写明改过DeCAL和π0相关模块。

微调入口是launch/decal_finetune.sh。离线评估入口如下,checkpoint路径要自己填。

python src/lerobot/datasets/v30/convert_unitree_json_to_lerobot_v30.py \
  --raw_dir "${RAW_DATA_DIR}" \
  --repo_id "${DATASET_REPO_ID}" \
  --robot_type Ur5_Sharpa \
  --custom_task_description "${LANGUAGE_INSTRUCTION}"

python util_scripts/compute_norm_stats_single.py \
  --action_mode abs \
  --chunk_size 50 \
  --repo_id "${DATASET_REPO_ID}"

bash launch/decal_finetune.sh "${DATASET_REPO_ID}" abs true

python tests/policies/decal/deploy_policy_tactile.py \
  --checkpoint /path/to/checkpoint

转换脚本目前只实现了Ur5_Sharpa这一种特征表,别的本体直接NotImplementedError。数据在ModelScope的Aureleo/DeCAL_dataset,转成了Open-X-Tactile统一格式。

我没有找到单独托管的DeCAL权重链接。附录写单张RTX 4090上每个动作块平均0.27秒,动作块长度50。历史观测15帧,按30Hz大约0.5秒。这些数字来自报告,不是我实测。

几点看法

接触门控是我觉得最该被别的视触VLA抄的一块。InternVLA-A1触觉版已经说明,触觉接进去不等于变强,吸管这种任务会被噪声拖下水。门控把此刻有没有接触从特征里拆成一个开关,比再堆一个融合层实在。

潜在协同想象和世界模型是同一类监督。差别在推理时不把像素解码出来,只把未来视触潜变量送给动作专家。装配验证集上的Cosmos相似度和LPIPS比InternVLA-A1好一截,可这仍然是离线帧预测,不能直接等同于真机里的规划能力。

短板也很硬。拧灯泡成功率40%,进度成功率48.8%,还输给纯视觉的InternVLA-A1。附录失败案例写了两类,双手交接对不齐,以及头部相机视野不够,物体出画以后状态估计会漂。

遥操作没有力反馈,示范质量本身就有上限。再加上没有大规模视触预训练,这套方法目前还是在六项自采任务上微调出来的专家策略。换到别的平台或传感器上,报告没有给出证据。


参考链接

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐