第一部分 Facet-0: A Robotic Foundation Model forContact-Rich Precise Manipulation

1.1 引言与相关工作

1.1.1 引言

如原论文所述,精密装配检验的是:机器人基础模型能否将广泛的能力转化为可靠的物理执行。现代VLA策略可以在不同任务和不同机体之间按照指令行动 [7,8,26]

  1. 然而,在制造场景中,识别与接近只是在空间上将机器人带到接口附近。真正的成败取决于最后那一毫米:在这一阶段,细微的位姿误差会转化为侧向力、摩擦或卡死
  2. 因而,从视觉上看相似的运动,物理结果却可能截然相反。在亚毫米级间隙和链式操作的条件下,只要有一次接触失败,就可能导致整个任务失效[23,32,45]

先前的研究在一定程度上弥补了这一差距。具备力觉感知的策略能够暴露交互信号,而顺应性控制器则用于稳定接触 [21,22,42,49,52]。真实机器人上的强化学习通过部署过程中的经验来改进行为 [28,31,33]

然而,接触通常被视为对既成事实的记录,或仅作为低层级反馈,而不是被看作附着于某个候选动作、并由其结果赋值的未来后果

因此,作者提出问题:通用型机器人能否在保持语义广度的同时,预见、评估并适应其行动所带来的物理后果?

对此,来自的研究者提出 Facet-0 来回答这一问题,其核心做法是将接触视为动作的可预测结果,以及一种通过部署而获得价值的量

  • 其paper地址为
  • 其项目地址为
    其github地址为

具体而言

  1. 其从一个配备流匹配(flow-matching)动作专家的 PaliGemma 视觉–语言骨干网络出发 [6,29],使策略能够对齐多视角图像和任务指令,与机器人的运动学状态以及已测得的腕部扭矩(wrist wrench)的因果历史

    由此得到一种语义–接触(semantic–contact)表征,策略在该表征的基础上联合生成笛卡尔空间的动作片段(Cartesian action chunk)以及在这些动作执行之后所期望的未来腕部扭矩。系统在执行时只下发动作,而扭矩则保持为预测性后果
  2. 该表征在 ManuFacet-1K 数据集上进行学习;ManuFacet-1K 是作者构建的一个时长 1,000小时、力信息同步的语料库,涵盖三种机器人形态、两个底盘家族以及多个制造单元,将大规模机器人数据进一步扩展到高精度接触场景 [2,25,38]

进一步而言

  1. 预测使接触变得显式,但要实现可靠的部署,还必须区分“有用的交互”和“代价高昂的交互”
    部署阶段的 rollout 通过训练一个分布式的 Action–Wrench Critic 来评估每个候选动作及其预期的扳动力(wrench)[4,28,33],从而改善由表示所表达的行为
  2. 因此,即便两种运动在几何推进上类似,当一种运动能干净对齐而另一种发生卡滞时,它们也会被赋予不同的价值

    接触选择性回传(contact-selective credit)将这一价值导向那些起决定性作用的交互,并用来细化同一个生成式策略
    当部件的动力学特性发生变化时,有界的局部自适应利用冻结的表示生成可执行的笛卡尔目标,同时保持对动作–接触耦合关系的预测能力
    相关的策略细化方法同样在限制机器人在线更新范围的同时,保留强有力的行为先验[3,47,50]

1.1.2 相关工作

1.2 ManuFacet-1K 数据集

1.3 语义—接触对齐

高精度装配将任务语义与仅在接近插入力程时才部分可见的接触动力学相结合。由于腕部力/矩传感只能在动作执行后反馈交互信息,作者对每一个候选运动及其预期扳手(wrench)进行联合建模,从而将语义意图与接触后果对齐

1.3.1 多模态语义落地(Multimodal Grounding):含模型架构

基础策略将PaliGemma 视觉-语言骨干网络[6] 与flow-matching 动作专家[29] 进行配对。在控制步t ,观测包含三个同步的RGB 视角I_{t}^{1: 3}、语言指令\ell 以及式(1) 中的机器人状态

作者将该状态分解为

  1. 末端执行器位姿x_{t} \in \mathbb{R}^{6}
    夹爪开合度g_{t} \in \mathbb{R}
    以及测得的腕部扭矩w_{t}=\left[f_{t} ; m_{t}\right] \in \mathbb{R}^{6},其中f_{t}m_{t} 分别为三轴力和力矩
  2. 运动学输入为
    s_{t}^{\mathrm{kin}}=\left[x_{t} ; g_{t}\right] \in \mathbb{R}^{7}



    W_{t-K+1: t}=\left[w_{t-K+1}, \ldots, w_{t}\right] \in \mathbb{R}^{K \times 6}存储最近的K 个扭矩

且作者使用K = 10,以便接触开始、持续的离轴力矩以及在运动停滞时上升的扭矩可以被表示为时间事件而非孤立样本

\begin{aligned} h_{t}^{\mathrm{VL}} & =E_{\mathrm{VL}}\left(I_{t}^{1: 3}, \ell\right) \\ h_{t}^{c} & =F_{\text {fuse }}\left(h_{t}^{\mathrm{VL}}, E_{s}\left(s_{t}^{\mathrm{kin}}\right), E_{w}\left(W_{t-K+1: t}\right)\right) \end{aligned}

这里E_{\mathrm{VL}}, E_{s}E_{w} 分别是视觉-语言运动学状态力矩历史编码器F_{\text {fuse }}是学习得到的跨模态融合映射;h_{t}^{c} 是语义接触表示

  • 在以h_{t}^{c}为条件的情况下,具有参数θ 的流匹配策略\pi_{\theta} 在已知h_{t}^{c} 的条件下采样一个时间范围为H 的联合提议

    Y_{t} \sim \pi_{\theta}\left(\cdot \mid h_{t}^{c}\right)
  • 作者将该提议写为
    Y_{t}=\left[A_{t: t+H-1}, \widehat{W}_{t+1: t+H}\right] \in \mathbb{R}^{H \times 13}
    其中
    \rightarrow  A_{t: t+H-1} \in \mathbb{R}^{H \times 7}包含笛卡尔位姿和夹爪指令
    \rightarrow  而\widehat{W}_{t+1: t+H} \in \mathbb{R}^{H \times 6}包含在这些指令执行后预测的腕部扭矩,并在反归一化训练数据后用物理单位表示

    因此,第k 行将a_{t+k} 与其预期结果\widehat{w}_{t+k+1} 配对
    作者使用H = 50。只有A 是可执行的;\widehat{W}是预期的接触结果,而不是力指令

如图3(a) 所示

动作专家以5-10 Hz 生成一个粗略的动作-力矩块,而细化专家在不改变关节参数化的情况下以20 Hz 对其进行更新

图3(b) 中的结构化掩码在没有目标泄露的情况下对齐了两条学习路径——视觉和语言/问题token 形成它们共享的前缀;

  1. 动作-力矩路径额外读取W_{h}=E_{w}\left(W_{t-K+1: t}\right)以及下面定义的加噪关节块X_{\tau}
  2. 而VQA 路径因果地关注先前的答案token

它们目标之间的交叉注意力被阻断,且机器人状态仅被注入到动作专家中,如带阴影的状态行和列所示

1.3.2 预测式交互学习

  1. 每个示例提供一个干净的数据目标

    Y_{t}^{\text {data }}=\left[A_{t: t+H-1}^{\text {data }}, W_{t+1: t+H}^{\text {data }}\right] \in \mathbb{R}^{H \times 13}

    其列包含已执行的动作以及随之产生的测量扭矩
  2. 条件流匹配[29] 使用具有相同形状的高斯噪声\epsilon \sim \mathcal{N}(0, \mathbf{I})对该目标进行插值,其中\mathbf{I} 是单位协方差

    对于采样的插值时间\tau \in[0,1],令
    X_{\tau}=(1-\tau) Y_{t}^{\text {data }}

    U_{\tau}=\epsilon-Y_{t}^{\text {data }}

    学习到的速度场v_{\theta} 通过以下方式进行优化

    \begin{aligned} \mathcal{L}_{\mathrm{AW}}(\theta)= & \mathbb{E}\left[\left\|v_{\theta}^{a}\left(X_{\tau}, \tau \mid h_{t}^{c}\right)-U_{\tau}^{a}\right\|_{2}^{2}\right] \\ & +\lambda_{\mathrm{pre}} \mathbb{E}\left[\left\|v_{\theta}^{w}\left(X_{\tau}, \tau \mid h_{t}^{c}\right)-U_{\tau}^{w}\right\|_{2}^{2}\right] \end{aligned}

    上标 aw 分别选取 7 个动作列和 6 个力扭矩(wrench)列;对每个切片中可用的条目分别独立地进行有效性归一化
    标量\lambda_{\text {pre }} 用于在力扭矩预测与动作学习之间进行预平衡,期望是对示范 \tau\epsilon 取期望

在推理阶段,将 v_{\theta}\tau=1的噪声向后积分到\tau=0的数据,会生成上文定义的联合提议Y_{t};因此,要降低力扭矩误差,策略必须编码其所提出的运动如何改变接触

语义目标\mathcal{L}_{\text {VQA }}是针对两个问题(整体/当前子任务以及下一条指令)的答案 token 交叉熵。对 \mathcal{L}_{\mathrm{AW}}\mathcal{L}_{\text {VQA }} 采用不同的优化器交替优化,而不是将其量级差异很大的目标混合在一起。结合结构化掩码,这种方式在训练共享的语义前缀的同时,为交互和语言监督保留了不同的因果路径。保留集上的优化诊断结果见附录 D.1.1

1.4 价值引导的策略细化

对齐后的策略能够给出合理的交互方式,但无法按照任务效用对它们进行排序。部署时的rollout 通过子目标完成度、接触质量以及从失败中恢复的能力,为这些交互提供了排序依据

  1. 在对齐策略内部,粗粒度专家在长时间跨度上给出联合提案,而细化专家在接触附近对同一个动作–扭矩对象进行更新
    作者在这些提案之上学习一个价值函数,并用它来细化共享的生成式策略
  2. 对于零件特定的迁移,下游的局部执行体则改为消费冻结的表征和策略引用;其评论者(critic)只作用于七维可执行动作本身,而不改变全局的提案空间

1.4.1 交互估值

// 待更

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐