摘要

本文解读 CVPR 2025 论文《CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models》。该论文提出以子目标图像作为视觉思维链的视觉-语言-动作模型(VLA)框架,通过融合自回归图像生成混合注意力机制动作块预测,让机器人在动手之前先在像素空间里"想"出未来状态,其特别之处在于子目标预测不需要动作标注,因而可以把 EPIC-KITCHENS-100、Something-Something V2 等无动作视频纳入预训练。实验表明LIBERO 仿真平均成功率 81.1%、Franka-Tabletop 真机平均 78.8%,分别超过 OpenVLA 的 76.5% 与 67.3%(相对提升约 17%),并让 Long 长时序套件从 53.7% 提升到 69.0%,为具身智能的推理式策略与数据配方提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
标题(中文)CoT-VLA:把「子目标图像」变成 VLA 的视觉思维链
作者Qingqing Zhao、Yao Lu、Moo Jin Kim、Zipeng Fu、Zhuoyang Zhang、Yecheng Wu、Zhaoshuo Li、Qianli Ma、Song Han、Chelsea Finn、Ankur Handa、Ming-Yu Liu、Donglai Xiang†、Gordon Wetzstein†、Tsung-Yi Lin†(† 为共同指导)
机构NVIDIA、Stanford University、MIT
会议CVPR 2025(pp. 1702–1713)
arXivhttps://arxiv.org/abs/2503.22020
项目网站https://cot-vla.github.io/

背景与动机

视觉-语言-动作模型(VLA)在过去两年成为机器人学习的默认范式:以预训练的视觉语言模型为骨干,在机器人演示数据上微调,把当前的画面观测与自然语言指令直接映射成机械臂动作。OpenVLA 用 700 万条 Open X-Embodiment 轨迹训练出 7B 的开源策略,Octo 证明了通用策略可以在没有视觉语言模型初始化的情况下跨本体工作,Diffusion Policy 则把动作生成写成扩散过程。这些方法的共同点是只做输入到输出的直接映射:给一张图、一句话,立刻回归动作。

问题也正出在这里。真实的操作任务是长时序的:把玉米放进碗里,需要先靠近、再对准、再闭合夹爪,每一步都取决于上一步的结果。缺少中间推理步骤,策略就没有时序规划能力,容易被画面里的视觉线索牵着走。论文在失败案例分析里发现,当不同任务的初始画面高度相似时(例如 LIBERO-Spatial 套件),基线方法会"照着画面执行"而不是按照语言指令执行——它看到了什么就做什么,而不是听懂要求再动手。

语言模型早就给出了答案:思维链(Chain-of-Thought)让模型先写出中间推理步骤,再给出最终答案。把这个思路搬到机器人上,已有工作用的是语言计划、关键点轨迹或目标边框,这些表示都需要额外的预处理管线,而且抽象程度高、信息有损。CoT-VLA 的选择更直接:用未来的图像作为中间推理步骤。子目标图像本身就存在于每一条机器人演示和每一段人类视频里,不需要额外标注,也不需要额外模型——它只需要模型学会"预测未来的自己"。

更关键的是数据侧的动机。机器人演示数据的规模受限于采集成本,而互联网上的第一人称与第三人称操作视频是海量的。子目标图像预测不依赖动作标注,因此这类无动作视频可以进入预训练——这正是论文标题里"Visual Chain-of-Thought"落到工程上的实际价值。

研究主线:从问题到结论

基准/方法设计

CoT-VLA 的设计原则可以用一句话概括:把中间推理放进像素空间,放进同一个 Transformer,再把它接上无标注视频。这三件事分别对应它的三个设计决策——子目标图像作为中间变量、混合注意力作为系统级机制、无动作视频作为数据杠杆。

具体到生成过程,模型先根据当前观测与语言指令预测未来第 $n$ 帧的子目标图像 $\hat{s}_{t+n}$,再以观测、指令和这张子目标图像为条件,生成一段长度为 $m$ 的动作块 ${\hat{a}_t, \dots, \hat{a}_{t+m}}$,其中动作块长度取 $m=10$。执行完这段动作后重新观测,进入下一轮——这是一个闭环的视觉伺服过程,而不是开环地预测一整条轨迹。

四个设计要素可以横向对照:

设计要素具体做法带来的收益
视觉思维链自回归生成未来第 $n$ 帧的子目标图像中间推理可解释,且不需要动作标注
混合注意力文本/图像 token 走因果注意力,动作 token 走全注意力生成保持时序一致,动作可并行解码
动作表示每个动作维度分 256 桶、动作块长度 10把推理频率与图像生成开销压到可控范围
数据配方OpenX 7-DoF 子集 + EPIC-KITCHENS-100 + Something-Something V2把无动作视频变成可用的预训练信号

分类全景

方法细节

骨干模型。CoT-VLA 建立在 VILA-U 之上——一个统一理解与生成的多模态基础模型。VILA-U 的统一视觉塔把图像编码成离散 token,并用残差量化配合深度 Transformer 逐层预测残差 token,因此同一个自回归语言模型既能生成图像 token,也能生成动作 token。论文在此之上优化三个部分:语言模型骨干、投影器和深度 Transformer,而视觉塔保持冻结。

训练目标。总损失是动作损失与视觉损失之和:$\mathcal{L} = \mathcal{L}_{action} + \mathcal{L}_{visual}$。视觉损失只作用在子目标图像对应的位置上,动作损失只使用机器人演示数据。训练序列有两种形式:$(l, s_t, s_{t+n})$ 用来学习视觉预测;$(l, s_t, s_{t+n}, a_t, \dots, a_{t+m})$ 用来学习动作生成。这意味着模型在同一套参数里同时承担"想象未来"和"生成动作"两件事。

混合注意力。文本与图像 token 使用因果注意力,保证自回归生成的时序一致性;动作 token 使用全注意力,让 7 个动作维度一次性并行解码。论文用 $[x]$、$[\theta]$、$[g]$ 等特殊 token 标记动作维度,两套注意力共存于同一个 Transformer,而不是拆成两个模型再拼接。

动作表示与数据配方。每个动作维度独立离散化成 256 个桶,桶宽由训练数据动作分布的第 1 到第 99 百分位均匀划分,并复用词表中最低频的 256 个 token。预训练数据方面,机器人演示取自 Open X-Embodiment 的 7 自由度单臂、第三人称子集,另外混入两份无动作视频,各占 3.45%。预训练在 12 个节点、每个节点 8 张 A100 上共消耗 11000 GPU 小时,而下游任务的微调只需要单节点 10 到 24 小时。

实验设计与结果

评测覆盖三个平台:LIBERO 仿真(Spatial / Object / Goal / Long 四个套件,每套件 10 个任务、每任务 50 条人类遥操作演示,每套件 500 次试验 × 3 个随机种子)、Bridge-V2 真机(6 自由度 WidowX,45000 条语言标注轨迹,考察视觉、运动、语义、语言四类泛化,每类 10 次试验)、Franka-Tabletop 真机(桌上 Franka Panda,6 个任务,每任务仅 10 到 150 条演示)。基线包括 Diffusion Policy、Octo、OpenVLA 与 SUSIE。

方法平均 ↑Spatial ↑Object ↑Goal ↑Long ↑
Diffusion Policy72.478.392.568.350.5
Octo(微调)75.178.985.784.651.1
OpenVLA(微调)76.584.788.479.253.7
CoT-VLA-7B81.187.591.687.669.0

上表为 LIBERO 主结果,数值是成功率百分数(3 个种子 × 每个套件 500 次试验的均值,标准误最大 1.4pp)。CoT-VLA 在平均、空间、目标和长时序四个口径上都取得最好成绩,其中 Long 套件比 OpenVLA 高出 15.3 个百分点;物体套件上 Diffusion Policy 的 92.5% 仍然是最好成绩。

真机结果同样清晰。Bridge-V2 上,CoT-VLA 在运动泛化(高度变化场景)拿到 60%、在语义泛化(未见物体)拿到 50%,都是最高;视觉泛化(杂乱环境)65%、语言泛化(指令跟随)70%,仅次于 OpenVLA 的 75%。Franka-Tabletop 上平均 78.8%,相对先前最好的 VLA 提升约 17%;值得注意的是 Diffusion Policy 在部分单指令任务上很强(例如"把玉米放进碗里"达到 93.3%),但在多指令任务上明显退化,说明少样本条件下的语言泛化是通用策略真正的分水岭。

消融实验给出三条独立结论。第一,动作块、混合注意力与视觉思维链每一步都带来提升:LIBERO-Spatial 从 67.5% 依次升到 73.3%、81.8%、87.5%,LIBERO-Goal 从 54.9% 依次升到 74.9%、79.7%、87.6%,说明三个组件各自在起负载作用。第二,预训练把 Franka-Tabletop 的成功率从 53.7% 提升到 78.8%,相对提升 46.7%,而这份预训练数据里包含没有动作标注的视频。第三,把模型自己生成的子目标换成人工演示里的真值子目标,两个分布外长时序任务的成功率从 20% 和 0% 提高到 60% 和 40%,各自提升 40 个百分点——视觉推理的质量直接决定了动作执行的质量。

附录还给出了预训练数据的完整配比与超参数,可以对照着看这套"无动作视频杠杆"的实际规模:

数据权重子目标间隔 $n$
Bridge24.14%5–10
RT-16.90%5–10
TOTO10.34%20–24
VIOLA10.34%15–20
RoboTurk10.34%1–2
Jaco Play / UR5 / Fanuc各 10.34%10–15 / 5–10 / 10–15
Something-Something V23.45%5–7
EPIC-KITCHENS-1003.45%5–7

结果对比总结

关键发现

  • 推理质量决定执行上限:真值子目标让两个分布外任务从 20%/0% 提升到 60%/40%,各 +40pp,这是全文最强的因果证据。
  • 三个组件各自独立起负载:动作块、混合注意力、视觉思维链在 LIBERO-Spatial 上依次贡献 67.5 → 73.3 → 81.8 → 87.5。
  • 无动作视频真的有用:预训练把 Franka-Tabletop 从 53.7% 提升到 78.8%(相对 +46.7%),而预训练数据里有 6.9% 来自无动作视频(SSv2 3.45% + EPIC-KITCHENS 3.45%)。
  • 语言泛化仍是短板:Bridge-V2 语言泛化 70% 低于 OpenVLA 的 75%,视觉泛化 65% 低于 75%,说明像素级推理并不自动带来更强的指令跟随。
  • 代价明确:生成 256 个图像 token 带来平均 7 倍推理减速,动作块 $m=10$ 与并行解码只是部分缓解。
  • 规模效率:7B 参数、11000 A100 GPU 小时的预训练即可在三平台上取得 SOTA,下游微调仅需单节点 10–24 小时。

局限性

论文自己列出了四条边界。推理开销:动作生成之前要先自回归生成 256 个图像 token,在动作块长度为 10 时平均造成 7 倍减速,图像生成仍是主要瓶颈。图像质量:自回归生成的子目标在视觉上不如扩散模型漂亮,但论文强调画质高不等于有用——SUSIE 生成的目标图更好看,在语言理解和需要新物体组合的任务上反而更差。动作块不连续:块与块之间可能出现动作跳变,执行过程中缺少高频反馈,作者建议用时序平滑或逐步预测来缓解。分布外子目标:真值子目标实验说明瓶颈就在没见过的任务上,而受算力限制,目前还无法靠更大规模的无动作视频解决。未来方向包括快速图像生成与快速推理(一致性模型、推测解码)、块间时序平滑,以及借助视频生成与世界模型提升视觉推理的泛化能力。

常见问题(FAQ)

CoT-VLA 的"视觉思维链"和语言思维链有什么区别?

语言思维链生成的是文本推理步骤,CoT-VLA 生成的是未来某一帧的图像。好处有两个:中间状态落在像素空间,人可以直接检查模型"打算去哪";而且子目标图像天然存在于原始视频里,不需要额外标注或额外的标注模型。

为什么子目标图像预测可以不用动作标注?

因为它的训练目标只是"预测未来第 $n$ 帧长什么样",输入是当前观测与语言描述,与机器人动作无关。EPIC-KITCHENS-100 和 Something-Something V2 这类第一人称或第三人称操作视频因此可以直接参与预训练,把数据来源从"机器人演示"扩展到"互联网视频"。

混合注意力解决了什么问题?

它让两件性质不同的事在同一个 Transformer 里共存:文本和图像 token 需要因果注意力来保证自回归生成的时序一致性;动作 token 需要全注意力,让 7 个动作维度互相可见、一次性并行解码。如果只用因果注意力,动作维度之间无法交互,解码也会变慢。

7 倍推理开销可以接受吗?

论文承认这是主要瓶颈:生成 256 个图像 token 的开销远大于生成动作 token。缓解手段是长度为 10 的动作块(降低重新推理的频率)与动作并行解码。作者给出的长期方向是快速图像生成与快速 LLM 推理技术。

这个方法在真机上到底比 OpenVLA 强多少?

在 Franka-Tabletop 的六个任务上平均 78.8% 对 67.3%,相对提升约 17%;在 LIBERO 仿真上平均 81.1% 对 76.5%,长时序套件提升最明显(69.0% 对 53.7%)。但在 Bridge-V2 的视觉泛化与语言泛化两类上,OpenVLA 仍然更好,说明优势集中在需要时序与运动泛化的场景。

复现需要多少算力?

预训练在 12 个节点、每节点 8 张 A100 上共 11000 GPU 小时,用 1e-4 学习率、余弦衰减、全局批大小 2048、256×256 分辨率跑 10 个 epoch;下游微调用 1e-5 恒定学习率跑 150 个 epoch,单节点 10 到 24 小时。模型为 7B 参数,视觉塔在训练中冻结。

参考链接

  • 论文 arXiv 摘要页:https://arxiv.org/abs/2503.22020
  • 项目主页(含视频与 rollout):https://cot-vla.github.io/
  • OpenVLA(主要对照基线):https://arxiv.org/abs/2406.09246
  • VILA-U(本文骨干模型):https://arxiv.org/abs/2409.04429
  • Octo(通用策略基线):https://arxiv.org/abs/2405.12213
  • SuSIE(扩散子目标相关工作):https://arxiv.org/abs/2311.01455

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐