【ICML 2026】D&R 论文解读:把演示拆成技能-动作对,零样本重组到未见任务|从机器人技能表征视角
摘要
本文解读 ICML 2026 论文《Decompose and Recompose: Reasoning New Skills from Existing Abilities for Cross-Task Robotic Manipulation》。该论文提出 Decompose and Recompose 技能推理框架,把已见任务的演示拆解成原子技能-动作对作为上下文的中间表示,通过动态演示库完成视觉与计划双路检索、再用覆盖感知静态库补齐缺失的技能模式,让大语言模型在上下文中对未见任务做组合式技能推理,其特别之处在于输出端只保留可执行的离散动作、全程不更新任何模型参数。实验表明在 AGNOSTOS 的 23 个未见任务上总体成功率达 26.4%(Level-1 32.5%、Level-2 18.5%),高于最接近的跨任务上下文学习基线 X-ICM 的 23.5%,并在 xArm6 真机五个任务上取得 36% 的平均成功率,为跨任务机器人操作提供了一种可直接复用的中间表示。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Decompose and Recompose: Reasoning New Skills from Existing Abilities for Cross-Task Robotic Manipulation |
| 标题(中文) | 拆开再重组:用技能-动作对推理未见任务的操作能力 |
| 作者 | Xitie Zhang, Aming Wu, Yahong Han |
| 机构 | Tianjin University · Hefei University of Technology |
| 会议 | ICML 2026 |
| arXiv | arXiv:2605.01448 |
| 项目网站 | 论文未提供项目主页(提示词模板与实现细节见论文附录) |
背景与动机
为什么跨任务泛化是 VLA 的下一道坎
视觉-语言-动作模型在已知任务内抗视觉扰动已经做得很好,但真实部署不可避免地遇到没见过的物体、全新的目标函数以及从未出现过的动作组合。跨任务泛化要求机器人把这些迁移知识用到完全没见过的任务上,而且不允许更新参数——这比任务内的视觉鲁棒性难得多,因为它要求的是可迁移的技能理解,而不是对固定任务语义的拟合。
已有工作卡在哪里
- 端到端 VLA(OpenVLA、$\pi_0$、RDT、3D-LOTUS++、SAM2Act):把动作序列学进权重,泛化主要停留在任务内的视觉扰动,跨任务时迁移能力有限;论文中 $\pi_0$ 在 AGNOSTOS 上的总体成功率只有 17.5%。
- 模块化方法(VoxPoser、MOKA、COP、ReKep):把感知、语言理解、规划与执行拆成独立模块,往往需要任务级的提示工程或手工设计,VoxPoser 的总体成绩是 15.6%。
- 任务内训练方法(PerAct、RVT、RVT2、Sigma-Agent、Instant Policy):在特定任务分布上训练,PerAct 总体 14.0%,Instant Policy 只有 3.7%。
- 人类视频预训练(R3M、D4R 及其对齐变体):借助大规模人类活动视频学习交互先验,但跨任务零样本迁移依然吃力,D4R 总体 12.6%。
- 最相关:X-ICM:它在 AGNOSTOS 上确立了跨任务零样本设定,用动力学相似度检索演示并提示大语言模型预测动作,但检索模块需要在特定任务分布上训练,削弱了跨域可迁移性;更关键的是它只把低层连续动作序列放进上下文。
论文对最后这一点的批评很直接:只给数值动作序列,模型无法知道"这一步在执行什么技能、为什么执行、如何与下一歩衔接",于是只能做轨迹形状匹配而不是技能推理,遇到技能组合全新的任务就失效。这正是本文要修掉的那一环。
技能表示的历史脉络
把技能从"名字"变成"可推理的中间表示"并不是一步到位的。2019 到 2024 年,技能从无监督发现的基元逐步走到可执行的技能库:DIAYN 用互信息发现技能,SayCan 用 affordance 过滤语言技能,Code as Policies 把技能做成可复用函数,Voyager 让技能库自我生长。2023 到 2025 年,技能发现走向规模化:XSkill 从无标注视频里自监督发现跨具身技能原型,SkillDiffuser 把技能抽象接到扩散策略,UniSkill 干脆去掉标签、学出无标注的跨本体潜在技能。2026 年,本文把技能标签与可执行动作显式对齐,让技能第一次成为上下文里可推理的中间表示。
研究主线:从问题到结论

图 9:研究主线——问题、动机、设计、方法、实验与结论的完整推理链路(Mermaid 流程图)
基准/方法设计
用三类事件把演示切成原子技能
演示先按三类事件切段:夹爪开合(由开到合、由合到开)、运动停止(关节速度低于阈值)与回合终止。每一段 $(o_k, o_{k+1}, a_k)$ 被视为一个连贯的原子动作;视觉语言模型读入起止关键帧、夹爪状态转移、分割掩码给出的物体名与任务指令,把这一段标注成 $\texttt{Verb}[\texttt{obj}]$ 或 $\texttt{Verb}[\texttt{obj}_1, \texttt{obj}_2]$ 的形式,动词集包括 Reach、Move、Grasp、Release 等。
物理约束与规则后处理
标注并不放任模型自由发挥。夹爪由开到合时标签强制为 Grasp,由合到开强制为 Release,把物理一致性直接写进标签;关系类动词(Close、Insert、Place)统一按(可动对象, 目标对象)的参数顺序组织;若夹爪全程张开却出现关系动作,则降级为 Move。经过这层约束,技能标签与低层动作的对齐噪声明显下降,得到的 ${(s_k, a_k)}$ 才能既保持物理可实现、又保留可组合的语义结构。
图 1:跨任务机器人操作概览。(a) 零样本跨任务设定要求把已见任务的知识迁移到含新物体、新目标的未见任务;(b) 本文框架从已见演示抽取原子技能,用规划智能体预测技能序列,结合视觉编码做场景感知检索,再由大语言模型推理出可执行动作序列
分类全景

图 10:方法分类全景——三大组件与双库检索的两条分支(Mermaid 图)
方法细节
动态库:视觉相似度叠加计划相似度
动态库解决的是任务相关。用预训练 DINOv3 抽取查询观测的全局特征并做 $L_2$ 归一化,与每条演示计算余弦相似度;同时由规划智能体根据指令与场景状态(离散化的物体坐标与夹爪状态)预测一条技能序列,把它与演示的技能标签按动词集合与动词二元组分别计算 Jaccard 相似度,内部权重 $\lambda = 0.7$。两路分数归一化后按 $\alpha = 0.5$ 线性融合,取前 $k_{\text{sim}} = 17$ 条构成动态库。
静态库:把"技能覆盖"变成可计算的量
只靠相关性检索会漏技能:检索到的演示整体相似度可以很高,却缺少完成任务必需的关键技能模式。覆盖感知静态库离线构建,把每条演示抽象成对象无关的 token——动词 token 与动词转移 token——再按 $w_t = (\log\frac{N+1}{\text{df}(t)+1}+1)^{\beta}$ 赋 IDF 权重,让稀有技能拿到更高分。选择时用 $\text{Score}(d) = \frac{\sum_{t} w_t}{1+\gamma |\mathcal{S}d|}$ 在覆盖收益与演示长度之间取得平衡,长度惩罚 $\gamma = 0.03$。推理阶段先算出预测技能序列相对动态库的覆盖缺口,再贪心补 $k{\text{cov}} = 3$ 条。
技能增强的上下文学习
检索到的演示被组织成"指令、观测、计划对应技能-动作对序列"的形式,技能标签解释每一步在执行什么、如何接续,但系统提示明确要求模型只输出动作序列。这样技能语义进入推理过程,输出端仍与机器人控制器直接兼容——因为最终产物是离散动作,而不是标签。
图 2:方法总览。(1) 原子技能收集;(2) 覆盖感知静态库用 IDF 词权保证技能模式覆盖;(3) 动态演示库按视觉与计划相似度检索;(4) 技能增强上下文学习让大模型做组合式推理并预测动作序列
动作怎么交给大语言模型
低层控制命令 $\mathbf{u} = [\mathbf{p}, \mathbf{q}, g]$ 由末端位置、四元数姿态与夹爪开关组成。为了让语言模型能直接输出动作,平移被离散成每轴 $V = 100$ 个体素格点,索引由位置减去工作空间下界再除以分辨率取整得到;旋转把四元数转成欧拉角后以 $\Delta = 5^\circ$ 量化;夹爪保持二值。最终每个动作是一个 7 元组 $\mathbf{a} = [i_x,i_y,i_z,i_r,i_p,i_\psi,g]$;解码时取体素中心恢复位置,把欧拉角还原成四元数并归一化,再交给 RLBench 的末端位姿加离散夹爪模式执行。
图 3:原子技能收集。(a) 已见演示中的原子技能频次分布;(b) 原子技能词表词云;(c) 示例演示的关键帧检测与技能标注过程
实验设计与结果
评测协议
仿真使用 AGNOSTOS 基准,它是首个专门面向跨任务零样本操作的测试台:23 个未见任务分两档,Level-1 有 13 个(马桶、冰箱、微波炉、座椅、台灯开关、垃圾桶等),Level-2 有 10 个(USB、盖子、盘子、烤箱、充电器等)。每个任务跑 3 个随机种子、每种子 25 回合,合计 75 回合。上下文共 20 条演示(动态检索 17 条 + 覆盖补全 3 条),超参为 $\lambda = 0.7$、$\alpha = 0.5$、$\beta = 0.5$、$\gamma = 0.03$。
| 类别 | 方法 | Level-1 (%) | Level-2 (%) | 平均 (%) |
|---|---|---|---|---|
| ICL 跨任务 | Decompose and Recompose(本文) | 32.5 ± 1.5 | 18.5 ± 1.0 | 26.4 ± 1.3 |
| ICL 跨任务 | X-ICM | 28.6 ± 1.9 | 16.9 ± 1.3 | 23.5 ± 1.6 |
| 基础 VLA | $\pi_0$ | 21.7 ± 0.4 | 12.0 ± 0.9 | 17.5 ± 0.4 |
| 基础 VLA | VoxPoser | 18.1 ± 0.4 | 12.1 ± 0.4 | 15.6 ± 0.2 |
| 基础 VLA | 3D-LOTUS++ | 13.6 ± 1.0 | 15.1 ± 1.1 | 14.4 ± 1.0 |
| 基础 VLA | SAM2Act | 13.1 ± 0.4 | 15.9 ± 1.3 | 14.0 ± 0.7 |
消融:四个组件逐级增益
以随机选择演示为基线(BS),逐步打开三个组件(DDL 动态演示库、CDL 覆盖感知演示库、SA-ICL 技能增强上下文学习),每一层都有正收益:
| DDL | CDL | SA-ICL | Level-1 (%) | Level-2 (%) | 平均 (%) |
|---|---|---|---|---|---|
| 26.9 | 14.8 | 21.6 | |||
| ✓ | 29.5 | 17.2 | 23.3 | ||
| ✓ | ✓ | 30.2 | 18.1 | 24.9 | |
| ✓ | ✓ | ✓ | 32.5 | 18.5 | 26.4 |
上下文里放几条演示最合适
演示数量的消融给出很干净的趋势:不放演示时成功率是 0.0%,模型连合法的动作序列都生成不出来;从 5 条增加到 20 条,总体成功率从 19.8% 单调升到 26.4%,没有饱和迹象。覆盖感知演示则存在一个最优点:补 0 条是 24.9%,补 1、2、3 条分别是 25.5%、26.0% 与 26.4%,补到第 4 条回落到 26.1%。
| 配置 | Level-1 (%) | Level-2 (%) | 平均 (%) |
|---|---|---|---|
| 0 条演示 | 0.0 | 0.0 | 0.0 |
| 5 条演示 | 27.3 | 13.1 | 19.8 |
| 10 条演示 | 30.0 | 15.5 | 23.7 |
| 15 条演示 | 31.2 | 16.8 | 24.9 |
| 20 条演示 | 32.5 | 18.5 | 26.4 |
| 覆盖库 3 条 | 32.5 | 18.5 | 26.4 |
| 覆盖库 4 条 | 32.3 | 18.1 | 26.1 |
真机实验:xArm6 上的五个操作任务
真机平台是 UFACTORY xArm6 机械臂加夹爪,配一台 RealSense L515 采集 RGB 与深度;每个任务采集 20 条演示,测试时用其余四个任务的演示构造跨任务上下文,实现零样本迁移,每个任务执行 25 次取平均成功率,骨干模型为 Qwen2.5-7B-Instruct。
| 任务 | 成功率 (%) |
|---|---|
| 把一串葡萄放到盘子上 | 70 |
| 把垃圾扔进垃圾桶 | 40 |
| 叠杯 | 30 |
| 把勺子放到餐盘上 | 20 |
| 叠积木 | 20 |
| 平均 | 36 |
图 4:AGNOSTOS 四个代表性未见任务上的组合式技能推理过程
图 5:真机实验。(a) 六自由度 xArm6 加夹爪与 RGB-D 相机的实验平台;(b) 真实操作任务上的执行结果
图 6:真机实验成功案例——模型生成的技能序列与实际执行过程的对应关系
图 7:真机实验失败案例——叠杯倾斜抓取、勺柄夹持失败、末端悬于桶口边缘三类典型失效
六个未见任务上的推理链条
在 AGNOSTOS 的六个代表性未见任务上,可以逐帧看到技能序列与低层动作的对应关系。技能标签在这里充当可解释的中间层:每一步在做什么技能、如何与下一步衔接都清晰可见,失败时也更容易定位到具体是哪一步技能或参数出了问题。不同未见任务共享同一批原子技能,例如抓取、移动、释放构成的复合链,只是组合顺序与参数由大语言模型根据场景重新推理。
图 8:AGNOSTOS 六个代表性未见任务上的组合式技能推理过程
结果对比总结

图 11:结果对比总结——四个消融阶段与真机平均成功率的递进关系(Mermaid 流程图)
关键发现
- 两层难度同时最优:23 个未见任务上总体成功率 26.4%,Level-1 32.5%、Level-2 18.5%;比 X-ICM 的 23.5% 高 2.9 个百分点,比 $\pi_0$ 的 17.5% 高 8.9 个百分点。
- 四个任务突破 60%:微波炉 62.7%、座椅 72.0%、关灯 67.0%、USB 96.0%,而其他任何单个基线最多只能在 3 个任务上越过这条线。
- 消融逐级可归因:随机基线 21.6%,加动态库 23.3%(+1.7),加覆盖库 24.9%(+1.6),加技能对齐标注 26.4%(+1.5)。
- 演示数量是硬门槛:上下文 0 条演示时成功率 0.0%,5/10/15/20 条分别是 19.8%/23.7%/24.9%/26.4%,单调提升且未见饱和。
- 覆盖补全有最优配额:补 3 条时 26.4%,补到 4 条反而降到 26.1%,说明静态演示过多会稀释任务相关性。
- 真机迁移成立但水位偏低:五任务平均 36%,最高是把葡萄放到盘子上 70%,最低的勺子上盘与叠积木各 20%。
- 收益来自表示形式而非模型规模:视觉编码器 CLIP/DINOv2/DINOv3 分别是 24.8%/25.7%/26.4%,语言骨干 Ministral-8B 到 Qwen2.5-7B 是 20.2% 到 26.4%——换上下文表示比换更大的模型更有效。
从顶会写作研究的创新模式视角看,这篇论文命中的是"重新表述为可解对象"(把跨任务泛化从匹配低层动作序列重述为组合原子技能,是语料里程序委员会与社区评价两侧都为正的模式)、"统一异构输入到同一空间"(连续 7 自由度动作与离散技能标签对齐到同一个技能-动作空间,属于社区偏爱的可复用基础设施类型)以及"异构分解差异化处理"(演示池分解为任务相关与技能覆盖两个异构子集,各自用不同打分策略检索)。
局限性
- 域外未验证:作者明确指出尚未评估到其他领域,因为方法依赖任务专用的环境与 API,目前只覆盖桌面盒状物体任务。
- 绝对水位偏低:AGNOSTOS 总体 26.4%、Level-2 仅 18.5%,真机平均 36%、最低 20%,离实际可用还有明显距离。
- 技能标注依赖视觉语言模型:原子技能由 Qwen2.5-VL 离线标注加规则后处理得到,标注质量直接决定技能库的上限。
- 真机规模有限:只有 5 个任务、每任务 25 次试验、单一机械臂与单一骨干,统计置信度不足。
- 失败集中在几何而非技能选择:叠杯时杯子被抓成倾斜角度导致放置对不齐,勺子的细长手柄无法稳定夹持,扔垃圾时末端停在桶口边缘而非中心——三类失效都指向六自由度位姿理解与三维空间关系判断。作者提出的下一步正是把显式三维空间推理与物体可供性理解纳入框架。
常见问题(FAQ)
Decompose and Recompose 是什么方法?
它是一个零样本跨任务机器人操作框架,由天津大学与合肥工业大学提出。核心是把已见任务的演示拆解成原子技能-动作对(例如 Grasp[yellow_block] 对应一段抓取动作),再让大语言模型在上下文里对这些技能做组合式推理,为未见任务生成可执行的动作序列,全程不更新任何模型参数。
为什么技能-动作对比原始动作序列更好?
原始的低层数值动作序列无法表达"这一步在执行什么技能、为什么执行、如何接续",模型只能做轨迹形状匹配;一旦未见任务需要新的技能组合就失效。技能标签把迁移的度量从轨迹形状相似提升到可组合的技能结构,消融显示仅这一步显式对齐就带来 24.9% 到 26.4% 的提升。
需要训练吗?需要多少演示?
不需要训练,也不需要参数更新。整套流程只用到预训练的视觉编码器(DINOv3)、规划智能体与语言模型,全部通过 in-context learning 工作。上下文里放 20 条演示(动态检索 17 条 + 覆盖补全 3 条)效果最好;不放演示时成功率是 0.0%,说明演示是这套方法的硬前提。
在 AGNOSTOS 上比 X-ICM 强多少?
总体成功率 26.4% 对 23.5%,Level-1 是 32.5% 对 28.6%,Level-2 是 18.5% 对 16.9%。本文方法的突出之处在于同时越过两层难度,并且在微波炉、座椅、关灯、USB 四个任务上成功率超过 60%,而其他任何单个基线最多只有 3 个任务能越过这条线。
真机上表现如何?主要失败在哪里?
xArm6 平台五个任务平均 36%:把葡萄放到盘子上 70%、扔垃圾 40%、叠杯 30%、把勺子放到餐盘上与叠积木各 20%。失败集中在几何层面——杯子被倾斜抓取、细长勺柄夹不稳、末端停在桶口边缘而不是中心——而不是技能序列选错了。
这篇论文的写作有哪些值得留意的地方?
叙事弧线是让步开场、缺口命名、承诺兑现三步:先承认 VLA 在已知任务上的进展,再指出真实部署必然遇到未见物体与新动作组合,随后把前人问题命名为"表层轨迹模仿",最后用实验兑现承诺。证据框架的头号杠杆用得不差(超过 60% 的四个任务对比基线最多三个任务,数字前置),但摘要收束句完全没有数字,贡献列表用了 competitive performance 这类自我降调的说法,范围框架把主张绑定在五个具体任务上,与正文里 general-purpose robots in open-world environments 的宽松表述相互矛盾。源码里还留有三处未清理的占位注释(Placeholder sections、Placeholder for visual/LLM ablation table、Placeholder for real-world results),两位通讯作者的声明被注释掉,并存在 experiments.(a)、six unseen task 之类的小语法疏漏。
参考链接
- 论文 arXiv 摘要页:https://arxiv.org/abs/2605.01448
- 最直接的对比方法 X-ICM(AGNOSTOS 跨任务泛化基准):https://arxiv.org/abs/2505.15660
- Code as Policies(策略代码控制机器人的起点):https://arxiv.org/abs/2209.07753
- VoxPoser(语言模型加三维价值图):https://arxiv.org/abs/2307.05973
- $\pi_0$(视觉-语言-动作流匹配模型):https://arxiv.org/abs/2410.24164
- OpenVLA(开源 VLA 代表):https://arxiv.org/abs/2406.09246
- DINOv3(本文使用的视觉编码器):https://arxiv.org/abs/2508.10104
- 技能级表示的后续工作 UniSkill:https://arxiv.org/abs/2505.08787
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)