VLAff:用于统一可操作Affordance的视觉-语言-Affordance模型
26年8月来自东京大学的论文“VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances”。
一、 论文介绍 (Introduction)
1.1 研究背景与动机
机器人的扩展性难题:从人类示范视频中学习机器人操控(Manipulation Skills)是实现大规模扩展机器人学习的潜在路线。然而,人类与机器人的物理结构(Embodiment)差异巨大,难以将视频动作直接映射为机器人控制信号。
Affordance作为桥梁:以物体为中心(Object-centric)的Affordance不依赖于具体机器形态(Embodiment-agnostic)。过去的方法多依赖静态实验室的专用传感器,或者仅预测单一模态(如仅预测 2D 接触热图、仅预测手势抓取或仅预测 3D 轨迹)。
核心挑战:目前缺乏一个能统一结合视觉(Where to interact)、抓取(How to grasp)和轨迹(How to move)三大可操作(Actionable)Affordances的统一表达与通用基础大模型。
1.2 主要贡献
构建大规模数据集 EgoAffordance:利用最新的 3D SfM(Structure-from-Motion)、手部网格重建及图像修复技术,从大规模第一视角(Egocentric)人类视频中自动化提取包含 20.4万个 Episode、560万个视觉热图、1160万个抓取姿态与轨迹的高质量数据集。
提出统一大模型 VLAff:基于多模态的视觉-语言模型(VLM,基座为 Qwen2.5-VL),引入专门的 、 和离散化轨迹 Token(<p*>),在一个统一的框架内多任务联合预测视觉、抓取姿态和 3D 轨迹Affordance。
实现高效的机器人下游应用:
零样本操控(Zero-Shot Manipulation):在仿真与真实环境中无需任何任务特定训练直接部署执行。
Affordance引导的强化学习(Affordance-Guided RL):将预测出的Affordance作为强先验奖励函数,加速机器人自适应策略的闭环学习。
如图 1 所示:VLAff,一种视觉-语言- affordance模型,从大规模以自我为中心的人类视频中学习可操作的affordance,例如视觉、抓取、轨迹,从而使机器人能够在各种任务中进行操作。

二、 论文深度分析 (Analysis)
2.1 EgoAffordance 数据集构建管线
该管线通过多步骤自动化处理第一视角视频,消除人类手臂的视觉遮挡,并转换出以物体交互点为中心的 3D Affordance:
交互定位与去人体(Inpainting):利用大模型提取接触关键帧,结合手部-物体检测器(Hand-Object Detector)、SAM 2 分割与 3D 手部姿态(MANO)估计。对人体手臂区域进行遮挡分割与图像修复(Inpainting)。
第一视角 3D 结构重建 (Ego-centric SfM):利用 单目深度(MoGe-2)和单目 SLAM(DROID-SLAM)重建场景 3D 结构及相机位姿,并利用 TAPIP3D 跟踪手部的 3D 交互前后轨迹。
物体中心化坐标转换(Object-Centric Transformation):寻找视觉热图峰值作为 2D 接触点,结合深度图反投影到 3D 空间形成锚点(3D Anchor Point)。将抓取 pose 和轨迹对齐(Alignment)转换到以该锚点为原点的局部坐标系中。
2.2 VLAff 模型架构与设计
模型整体分为统一的文本/视觉 Encoder、多模态 LLM 主干以及三个专门的解码器:
多模态主干与新增 Token:
Token:配合视觉解码器输出 2D 像素级概率热图 A_v。
Token:输出 96 维 MANO 手部参数 A_g(含手腕及15个关节的 6D 旋转表达)。
~ Trajectory Tokens:利用空间分箱(Spatial Binning)将 6D 轨迹(3D 平移 + 3D 旋转)离散化,使 VLM 能以自回归方式逐个生成轨迹 Waypoints。
密集视觉增强(DINOv2 双编码器设计):标准 VLM 缺乏精细的局部空间语义。论文额外接入 DINOv2 视觉编码器提取部分-觉察(Part-aware)特征,与 VLM 的 Token 融合,极大提升精细接触点的定位精度。
物理合理性轨迹采样策略(Inference Guidance & Selection):
上下文轨迹引导:使用 GPT 等高阶 VLM 针对任务提示词生成粗粒度的 3D 动作方向向量(如 [0,0,1] 推进、[1,0,-1] 后撤拉开),约束初始轨迹 Token 的采样区间。
碰撞规避采样:利用核采样(Nucleus sampling)生成 K 条候选轨迹,结合场景点云和深度图构建的体素(Voxel)进行碰撞检测与重合度打分,选取最优无碰撞轨迹。
如图 2 所示 VLAff 模型架构展示视觉编码器、VLM 和专用解码器的集成,用于视觉、抓取和轨迹affordance预测。

2.3 实验结果与分析
(1) 视觉Affordance预测
在 IoU、NSS、SIM 和 KLD 评估指标上,VLAff 全面超越 VRB、UAD、3DOI 和 LISA 等 SOTA 方法。
原因分析:VRB 只能预测离散点而非密集热图;UAD 在复杂真实场景泛化较差;LISA 倾向于分割整个物体(如整个冰箱)而非特定交互部位(如冰箱门把手);而 VLAff 引入 DINOv2 局部语义与三模态联合学习的归纳偏置(Inductive Bias)。
(2) 零样本操控(Zero-Shot Manipulation)
仿真环境 (IsaacGym / Ag2Manip):VLAff 取得 83.0% 的平均成功率,接近输入深度图等显式 3D 信息的 VidBot (85.0%)。
真实世界环境 (Fetch & PR2 移动机器人):VLAff 达到 68.0% 的平均成功率,显著领先 VidBot (52.0%) 16 个百分点。这表明在杂乱的真实厨房环境(如开抽屉、拿烧水壶、开锅盖等)中,从真实人类视频学习的统一Affordance具备更强的鲁棒性和跨形态泛化能力。
(3) Affordance引导强化学习(消融实验)
在真实机器人“开冰箱”任务中:
全模态(All Modalities):收敛最快,成功率最高。
移除热图 (w/o heatmap):训练完全崩溃,成功率为 0%。证明视觉热图(Where)是机器人交互中最关键的先验基础。
移除抓取姿态 (w/o grasp pose):对成功率影响相对较小。作者指出这是由于人类手掌(Dexterous hand)与机器人夹爪(Parallel-jaw gripper)的形态差异导致的,简单的双指夹爪并不完全依赖复杂的 96 维手部关节控制。
移除轨迹 (w/o trajectory):收敛明显变慢且上限受限,说明 3D 移动轨迹(How to move)为策略探索提供了极佳的方向引导。
如图4 所示可视化生成的affordance及其在实际机器人操作任务中的应用。

三、 论文总结 (Summary)
3.1 核心结论
VLAff 成功地填补人类视频学习与机器人动作控制之间的“身体跨越 gap”。它证明无需直接依赖高成本的机器人轨迹数据,仅依靠对第一视角人类视频的深度affordance挖掘,并借助 VLM 强大的跨模态表征能力,即可构建出一个具备高级操控先验的机器人通用“大脑”。
3.2 优势与亮点
完整性与统一性:首次将affordance学习扩展为“视觉 localization + 手部姿态 + 3D 轨迹”的全流程统一模型。
高质量开放数据集:EgoAffordance 为机器人和计算机视觉社区提供极其丰富的真实 3D 人类交互标注。
现实落地可行性强:在真实环境中的零样本表现优秀,且能无缝接入强化学习进行二次微调。
3.3 局限性与未来改进
轨迹的物理约束性不足:仅凭 2D 图像自回归生成的 3D 轨迹有时仍可能违反物理碰撞约束(因此论文引入后处理采样与 VLM 矢量引导)。
未来方向:可以结合显式的 3D 场景感知模型架构(如 PointLLM),直接在三维点云与场景几何约束下统一生成affordance,从而完全解决轨迹不合物理常理的问题。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)