【IROS 2025】Ag2x2:协调感知的智能体无关视觉表征,零样本双臂操作|从人类视频驱动机器人技能视角
摘要
本文解读 IROS 2025 论文《Ag2x2: Robust Agent-Agnostic Visual Representations for Zero-Shot Bimanual Manipulation》。该论文提出 Ag2x2 协调感知的智能体无关视觉表征,通过融合人手 2D 坐标、时间对比学习与倾斜式奖励塑形,让机器人在既没有专家示范、也没有人工奖励的条件下零样本学会双臂操作,其特别之处在于把「智能体无关」从抹去人手重新表述为只保留手的坐标这一个可迁移接口。实验表明 Ag2x2 在 13 个双臂任务上平均成功率达到 73.5%,比同族 Ag2Manip 高 17.1 个百分点,甚至超过人工设计奖励的 63.2%,为人类视频驱动的机器人技能获取提供了重要借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Ag2x2: Robust Agent-Agnostic Visual Representations for Zero-Shot Bimanual Manipulation |
| 标题(中文) | 协调感知的智能体无关视觉表征:零样本双臂操作 |
| 作者 | Ziyin Xiong, Yinghan Chen, Puhao Li, Yixin Zhu, Tengyu Liu†, Siyuan Huang†(* 共同一作,† 通讯) |
| 机构 | 北京通用人工智能研究院(BIGAI)· 北京大学 · 剑桥大学 |
| 会议 | IROS 2025(IEEE/RSJ International Conference on Intelligent Robots and Systems) |
| arXiv | https://arxiv.org/abs/2507.19817 |
| 项目网站 | https://ziyin-xiong.github.io/ag2x2.github.io/ |
背景与动机
用两只手协同完成一件事,对人类来说是再自然不过的日常能力;但对机器人来说,双臂操作至今仍是难题。论文开篇把这件事说得很直白:机器人操作今天依然被一个人类习以为常的技能卡住——把两只手一起用起来。
困难来自两个瓶颈。第一是对专家监督的依赖:行为克隆类方法要采集大量双臂遥操作示范,成本极高;结构化表征方法如 Bi-KVIL 与 PerAct² 虽然提升了泛化,但共享同一个示范瓶颈,无法真正规模化。第二是双臂协调本身:两只手必须在空间与时序上配合,才谈得上开门、递物、整直绳索这类任务。
现有的第三条路是强化学习。Bi-DexHands 展示了令人印象深刻的灵巧度,但它依赖精心设计、任务专用的奖励函数,这些奖励需要大量专家知识,且很难跨任务泛化。用大语言模型自动生成奖励的 Eureka 缓解了人工设计成本,但论文的实验显示,它只在目标状态容易描述的任务上有效。
在视觉表征这一侧,任务专用的对比学习(CURL、DeepMDP)难以跨任务泛化;通用预训练表征 RRL、R3M 与 VIP 在单臂场景表现不错,但迁移到双臂就明显失效——它们要么只做单臂,要么把两只手当成彼此独立的智能体,要么根本不建模手与手之间的空间关系。
最直接的对照是前作 Ag2Manip(IROS 2024)。它首次提出「智能体无关」的思路:把人类区域整块抹掉,让表征只关注物体状态的变化,从而跨过人机之间的形态差。但论文指出,这个做法把具身信息整体删掉了——包括两只手的相对位置,而这恰恰是双臂协调的承重信息。
于是本文的问题被精确定位成一件事:抹掉人之后,到底该留下什么?
研究主线:从问题到结论

图 5:研究主线(Mermaid 流程图)。从「双臂操作缺协调信号」出发,经过「前作抹掉人手也删掉手间关系」「只保留双手 2D 坐标」「位置 token + 时间对比学习」「倾斜式奖励塑造 PPO 策略」,最终收敛到「13 任务 73.5%,超过人工奖励」。
基准/方法设计
Ag2x2 的核心是一套协调感知(coordination-aware)的智能体无关视觉表征。它的做法是把 RGB 图像与双手的二维坐标拼在一起再编码,让表征在保持智能体无关的同时,显式具备双臂空间推理能力。
具体的数据流向是:原始输入是图像的三通道加上双手各自的两个坐标,编码器把它映射成一个 K 维隐层表征。关键取舍只有一句——只保留手的位置,仍然丢弃人类的外形与运动学细节。手在哪里可以跨过人机形态差,手长什么样不行。
支撑这个设计的数据管线完全是自动化的:用换掉骨干网络的 HaMeR 检测手部,把三维关键点投影到二维,取每只手 21 个关键点的均值作为该手的位置;同时用 ODISE 做分割、用 E²FGVI 做视频修复,生成智能体无关的帧。由此得到的样本既保留了手的位置,又抹去了人的外观。

图 1:Ag2x2 概览。左:从人类操作视频中学习协调感知表征——抹去人体外形但保留高亮的双手位置;右:用该表征在仿真中自主获取多种双臂技能,多台 Franka 机械臂依次完成开柜、开门与绳索操作。
分类全景
这篇论文要解决的问题,可以放进一张「双臂技能获取方法」的全景图里看。四条既有路线各缺一角,Ag2x2 是第五条。

图 6:双臂技能获取方法全景(Mermaid 图)。智能体感知表征(R3M · VIP)、智能体无关表征(Ag2Manip)、LLM 生成奖励(Eureka)、人工奖励工程(expert reward)四条路线各缺一角,Ag2x2 是第五条。
方法细节
方法由两个组件构成:一个协调感知的视觉编码器,以及一套基于该表征的策略学习与奖励塑形机制。
编码器的两阶段训练。 第一阶段只微调 ViT-Large:它预训练于 ImageNet-21k,这里只用修复后的图像作为输入,并采用 LoRA(秩 $r=4$,作用于所有自注意力层的 query 与 value 矩阵)来保住预训练知识、同时保持训练高效。第二阶段引入手部位置:每只手的二维坐标经一个两层 MLP(隐藏维 $[16, 32]$,ReLU 激活)编码成位置 token,与图像 token 拼接;对被遮挡或出画的手,用一个手特有的可学习变量占位,避免缺失值破坏表征。两个阶段都优化同一个时间对比目标。
时间对比目标。 正负样本的定义是核心:同一段视频内时间上相近的两帧是正样本,同一时刻来自不同视频的帧是负样本。损失写作 $\mathcal{L} = \mathcal{L}{tcn} + \mathcal{L}{reg}$,其中 $\mathcal{L}{tcn} = -\log \frac{e^{S(z_i,z_j)}}{e^{S(z_i,z_j)} + e^{S(z_i,z_k)} + e^{S(z_i,z_l)}}$,正则项 $\mathcal{L}{reg} = \lVert \mathcal{F}\phi(o) \rVert_1 + \lVert \mathcal{F}\phi(o) \rVert_2$。这样学到的表征刻画的是任务进展,而不是场景身份。
策略学习与奖励塑形。 两条手臂被表示为两个自由浮动的代理球:球的碰撞半径是 2 cm,交互半径是 5 cm;先用 GraspNet 找出物体的可行抓取位姿,当代理与该位姿的距离小于 5 cm 时判定抓取成功。动作被拆成两部分:位置目标 $a_p^t \in \mathbb{R}^6$ 与意图力 $a_f^t \in \mathbb{R}^6$,由 PD 控制器转成代理的实际运动,最后用逆运动学映射回两条 Franka 机械臂的关节指令。
奖励函数是这篇论文最值得琢磨的一处设计。它不是「比上一帧更好就给分」,而是以初始状态与目标的相似度 $\beta = S(z_0,z_g)$ 为基准线,要求当前状态超过初始条件:$\mathcal{R} = \exp((1+\alpha \cdot \mathbf{1}_{S>\beta}) \cdot (S(z_t,z_g)-\beta)/\beta) - 1$,其中 $\alpha > 0$ 控制奖励缩放,消融实验给出的取值是 $\alpha = 3.0$。这样做的收益是:在训练早期策略行为还接近随机时,只要状态比起点更接近目标就能获得正奖励,探索信号不会断。
训练成本。 表征学习分两段:视觉适配阶段在 4 张 NVIDIA A100 上跑 40 小时,手部位置整合阶段在 8 张 A100 上跑 20 小时。策略侧用的是 PPO,每个操作技能在单张 3090 工作站上约需 3 小时。

图 2:Ag2x2 框架。(a) 表征学习:在保留手部位置信息的智能体无关人类示范上做时间对比学习;(b) 技能学习:用智能体无关的动作表示做强化学习,机器人从失败尝试逐步学会把方块放进微波炉。
实验设计与结果
任务与评测协议
实验覆盖 13 个双臂操作任务,全部是单阶段、机械夹爪可完成的任务。其中 6 个来自 Bi-DexHands:关门向外、关门向内、开笔帽、举锅、挥杯、合剪刀;另外 7 个来自 PerAct²:推箱、方块入抽屉、方块入微波炉、举托盘、按按钮、扫灰尘、整直绳索。多阶段任务需要中间目标定义,超出了当前框架,被直接排除。
评测协议上,每个任务组合 3 个随机种子 × 3 个相机视角(中/上/下),共 9 次评测;训练时使用 68 个并行环境,每个任务跑 200 个 episode。仿真平台是 NVIDIA IsaacGym,机器人是两条 9 自由度 Franka Emika 机械臂。表征在 EpicKitchen 上自学习。
对照方法包括智能体感知的 R3M 与 VIP、智能体无关的 Ag2Manip、关闭人类反馈的 Eureka、以及人工设计的奖励函数;消融版本是去掉手部特征的 Ag2x2-H。
主结果
| 方法 | Bi-DexHands | PerAct² | 总体 |
|---|---|---|---|
| Eureka(LLM 生成奖励) | 14.8% | 15.9% | 15.4% |
| VIP(智能体感知) | 25.9% | 27.0% | 26.5% |
| Ag2Manip(智能体无关) | 66.7% | 47.6% | 56.4% |
| 人工奖励(expert reward) | 85.2% | 44.4% | 63.2% |
| Ag2x2-H(去手部坐标) | 70.4% | 46.0% | 57.3% |
| Ag2x2(本文) | 85.2% | 63.5% | 73.5% |
Ag2x2 在 Bi-DexHands 上达到 85.2%,在 PerAct² 上达到 63.5%,整体平均 73.5%。相比同族的 Ag2Manip 提升 17.1 个百分点,相比需要人工设计奖励函数的专家方案高出 10.3 个百分点——而它既没有用到专家示范,也没有任何奖励工程。
逐任务成功率
Bi-DexHands 六个任务(每格满分 9,共 54 次评测):
| 任务 | Ag2x2-H | Ag2x2 | 人工奖励 | Ag2Manip |
|---|---|---|---|---|
| 关门向外 | 7 | 7 | 8 | 6 |
| 关门向内 | 4 | 6 | 9 | 9 |
| 开笔帽 | 7 | 9 | 6 | 7 |
| 举锅 | 7 | 8 | 6 | 4 |
| 挥杯 | 4 | 7 | 8 | 3 |
| 合剪刀 | 9 | 9 | 9 | 7 |
六个任务合计成功 46 次,占 85.2%,与人工奖励持平;去掉手部坐标后掉到 38 次,仅 70.4%。值得注意的是「关门向内」:人工奖励与 Ag2Manip 都能拿满分 9,Ag2x2 只有 6 分——这个任务更依赖奖励函数的精确设计,而不是表征质量。
PerAct² 七个任务(每格满分 9,共 63 次评测):
| 任务 | Ag2x2-H | Ag2x2 | 人工奖励 | Ag2Manip |
|---|---|---|---|---|
| 推箱 | 5 | 6 | 5 | 2 |
| 方块入抽屉 | 4 | 5 | 0 | 3 |
| 方块入微波炉 | 3 | 2 | 6 | 3 |
| 举托盘 | 5 | 7 | 3 | 3 |
| 按按钮 | 8 | 9 | 5 | 9 |
| 扫灰尘 | 3 | 6 | 3 | 6 |
| 整直绳索 | 3 | 5 | 6 | 4 |
七个任务合计成功 40 次,占 63.5%。失败集中在两类模式上:一类是客体干扰,容器的运动在视觉上压过了物体放置与手部运动,方块入抽屉与方块入微波炉就是典型;另一类是协调不同步,比如关门向内时一只手提前把门关上,或者整直绳索时一只手已经到位、另一只还差一点点。
消融:手部坐标到底值多少
论文的消融版本 Ag2x2-H 去掉了手部相关特征。结果相当干净:Bi-DexHands 从 85.2% 掉到 70.4%,PerAct² 从 63.5% 掉到 46.0%,整体掉 16.2 个百分点。更关键的是,Ag2x2-H 的总体表现(57.3%)与 Ag2Manip(56.4%)几乎相同——这说明增益来自手部信息本身,而不是架构改动。
控制实验:增益到底来自预训练还是本体感受
一个容易被忽略的疑问是:Ag2x2 的优势,究竟来自预训练阶段的视觉表征,还是来自策略学习阶段拿到的本体感受信号?论文做了一个控制实验:在同一个视觉骨干下对比三个模型,并额外加入一项显式的本体感受奖励,鼓励末端执行器对齐目标位置。
| 方法(同一视觉骨干) | Bi-DexHands | PerAct² | 总体 |
|---|---|---|---|
| Ag2Manip(本体感受有限) | 68.5% | 41.3% | 53.8% |
| Ag2x2-H(部分整合) | 70.4% | 46.0% | 57.3% |
| Ag2x2(完整整合) | 88.9% | 52.4% | 69.2% |
加不加本体感受奖励,三者的排序与主表完全一致。这干净地说明:增益来自预训练期注入的手部信息,而不是策略学习期的本体感受。
轨迹质量
论文还用两个指标刻画生成轨迹的质量:
| 方法 | 平滑度 $\gamma_s$(越低越平滑) | 进度一致性 $\rho$(越高越单调) |
|---|---|---|
| VIP | 1.58 | 0.210 |
| Ag2Manip | 1.36 | 0.504 |
| 人工奖励 | 1.11 | — |
| Ag2x2-H | 1.23 | 0.514 |
| Ag2x2 | 1.15 | 0.516 |
平滑度数值是两条末端执行器加速度的累积量,越低表示运动越平滑。Ag2x2 的 1.15 仅次于人工奖励的 1.11,明显优于最强基线 Ag2Manip 的 1.36。进度一致性用时间序列与目标状态相似度之间的斯皮尔曼秩相关衡量,Ag2x2 以 0.516 居首。这里也有一个需要注意的边界:按按钮任务的成功率是 100%,相关系数却是负的,原因是按钮变色这类离散状态跳变会让相关性指标失真。
定性结果与模仿学习

图 3:双臂操作定性结果。六类代表性任务(挥杯、合剪刀、推箱、方块入微波炉、按按钮、扫灰尘)自左向右的时间序列;方法为两条末端执行器生成协调轨迹,再经逆运动学转为两条 Franka 的关节指令。

图 4:模仿策略的泛化。仅用 Ag2x2 自主采集的 12 条绳整直轨迹训练模仿策略,即可在未见过的初始构型(绳索弯曲方向与训练相反)上完成整直,并适应可变形物体的持续形变。
结果对比总结

图 7:结果对比总结(Mermaid 图)。Ag2Manip 的 56.4% 与人工奖励的 63.2% 汇聚到 Ag2x2 的 73.5%;去掉手部坐标后掉到 57.3%,而整体比人工奖励高出 10.3 个百分点。
关键发现
- 手部坐标是承重项,不是锦上添花。 去掉双手的 2D 坐标后,平均成功率从 73.5% 掉到 57.3%,正好 16.2 个百分点;而消融版(57.3%)与 Ag2Manip(56.4%)几乎持平,说明这部分增益来自信息本身,而非架构变化。
- 零样本可以超过人工奖励。 Ag2x2 的 73.5% 高于人工设计奖励函数的 63.2%(+10.3 个百分点),也高于同族 Ag2Manip 的 56.4%(+17.1 个百分点)——而它不需要任何示范或奖励工程。
- 可变形物体不再需要专用设计。 在「整直绳索」这类传统难题上,Ag2x2 无需专用奖励或示范即可学会;13 个任务里只有「方块入微波炉」低于 50% 成功率。
- 增益来自预训练,不来自本体感受。 在加入显式本体感受奖励的控制实验中,Ag2Manip 53.8%、Ag2x2-H 57.3%、Ag2x2 69.2%,排序与主表完全一致,把两个混淆变量干净拆开。
- 轨迹质量同步提升。 平滑度 1.15 仅次于人工奖励的 1.11、优于最强基线 Ag2Manip 的 1.36;进度一致性 0.516 为全部方法最高。
- 表征还能反过来生成数据。 仅用 12 条自主采集的绳整直轨迹训练模仿策略,就能泛化到弯曲方向与训练样本相反的未见构型。
局限性
论文自己把边界说得很清楚,主要有四点:
- 目标被压成一张静态图。 缺少中间轨迹状态,因此无法支撑「中间动力学关键」的任务。比如「把球扔进桶里」,如果目标图只显示球在桶中,系统会试图直接把球放进去而不是抛投。
- 不可观测动力学的任务仍然无解。 例如微波炉内部状态没有视觉反馈时,任务依旧困难。
- 只建模末端执行器位置。 因此只适用于简单夹爪,无法覆盖多指灵巧手的关节级手指协调。
- 任务范围受限。 13 个任务全部是单阶段、夹爪可完成的仿真任务,多阶段任务被直接排除在框架之外。
作者提出的缓解路径是用高层规划器生成中间的视觉与运动学步骤;而把表征扩展到灵巧手,则需要重新理解手指之间的协同——作者认为「预训练于现成人类视频」这条路仍然是更省数据的方向。
常见问题(FAQ)
Ag2x2 和 Ag2Manip 的核心区别是什么?
Ag2Manip 把人类区域整块抹掉,让表征只关注物体状态变化,同时把具身信息一并删除;Ag2x2 同样抹掉人的外观,但保留双手的 2D 坐标。区别只有这一处,但它把平均成功率从 56.4% 拉到 73.5%。
为什么「只留手的位置」就能跨过人机形态差?
因为可迁移的是坐标,而不是外观。手在哪里、如何相对运动,这类空间关系对夹爪同样成立;手长什么样、关节怎么配置,则完全绑定人类形态。论文的取舍正是切在这条分界线上。
这个方法需要专家示范或者奖励函数吗?
都不需要。手部坐标由现成的人类视频管线自动产出(HaMeR 检手、ODISE 分割、E²FGVI 修复),策略的奖励直接来自视觉表征的相似度。整条流程里唯一的「监督」是时间对比学习本身。
训练一个技能要多少算力?
表征学习分两段:视觉适配 40 小时 × 4 张 A100,手部位置整合 20 小时 × 8 张 A100。策略侧用 PPO,每个操作技能在单张 3090 上约 3 小时即可完成。
为什么不直接用 LLM 生成奖励?
论文对比了 Eureka(关闭人类反馈),它的总体成功率只有 15.4%。LLM 生成的奖励只在目标状态容易描述的任务上有效,比如合剪刀、按按钮;一旦任务需要两只手在时序上配合,就迅速失效。
这个方法目前学不会什么?
三类任务:需要中间动力学过程的(比如抛投)、内部状态不可观测的(比如微波炉)、以及需要多指灵巧手关节级协调的。此外,多阶段任务被框架直接排除。
阅读原文时有哪些容易踩的坑?
有两处值得留意。第一是表格数字自相矛盾:主表中 Ag2x2-H 在 PerAct² 上的逐项成功次数合计 31(对应 49.2%),但印刷的平均值写的是 46.0%;而本体感受对照表里同一行的逐项次数是 29,恰好对应 46.0%。两表的逐项数据不一致,引用时应以各自表格的逐项数值为准。第二是公式符号笔误:轨迹平滑度公式用的是 $\gamma_s$,但正文叙述里写成了 $\gamma$ 加花括号 s。这两处都不影响结论,但在做复现或引用时容易被绊住。
参考链接
- 论文 arXiv 摘要页:https://arxiv.org/abs/2507.19817
- 项目网站(含视频、代码与预训练检查点):https://ziyin-xiong.github.io/ag2x2.github.io/
- 代码仓库:https://github.com/ziyin-xiong/Ag2x2
- 前作 Ag2Manip(IROS 2024,智能体无关表征的上一棒):https://arxiv.org/abs/2404.17521
- R3M(CoRL 2022,智能体感知人类视频表征):https://arxiv.org/abs/2203.12601
- VIP(ICLR 2023,价值隐式预训练视觉奖励与表征):https://arxiv.org/abs/2210.00030
- Eureka(ICLR 2024,用大语言模型生成奖励):https://arxiv.org/abs/2310.12931
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)