写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

导读

VLA(Vision-Language-Action)模型常把“更强的鲁棒性”与更大的视觉语言骨干绑定在一起:3B 到 7B 参数的模型在仿真机器人基准上表现很好,却很难直接放进内存与功耗受限的机器人端侧设备。CoTinyVLA 要验证的是另一条路径:不继续堆参数,而是为一个 0.8B 骨干补上更有针对性的时序、推理和语言监督。

它以 Qwen3.5-0.8B 为底座,加上控制模块后约 0.9B 参数。每一步输入第三视角和腕部相机各 8 帧历史、8 维本体感觉与自然语言指令;35B 教师为演示数据生成两层推理标签:整段任务只生成一次的 Plan,以及每个动作块更新一次的 Think。Plan 描述子目标顺序,Think 固定描述当前阶段、夹爪状态和下一子动作。学生同时预测这些推理 token 与 8 步动作块。

在 LIBERO-Plus 的 10,030 个扰动任务上,CoTinyVLA 的 Spatial、Object、Goal、Long 成功率分别为 90.8%、87.3%、86.6%、80.7%,均高于论文比较中最强的 7B 基线 OpenVLA-OFT+。其中 Goal 套件的优势达到 15.9 个百分点。作者的消融也没有把三项设计混成一个笼统的“配方”:时序双视角主要改善运动学扰动,CoT 主要改善物理状态相关扰动,指令释义扩增主要改善语言扰动。

猫先生认为,CoTinyVLA 的价值不在于证明“小模型天然比大模型强”,而在于把 VLA 的容量问题拆成了三个可补的缺口:看不出运动状态,就补时序;缺少任务与阶段约束,就补结构化推理;容易记住指令表面形式,就补语言覆盖。 这种结论在 LIBERO-Plus 上很有力,但它仍是单一 Franka Panda 仿真平台上的结果,不能直接外推到真实机器人或开放场景。

  • 论文标题:CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
  • 论文地址:https://arxiv.org/abs/2607.25487
  • GitHub:https://github.com/BrainJellyPie/CoTinyVLA

原文脉络

论文第 1 节提出紧凑 VLA 的鲁棒性问题,第 2 节将工作定位在 VLA、具身 CoT 和指令扩增三条研究线上。第 3 节依次定义输入架构、分层 Plan–Think 推理、35B 教师蒸馏、释义扩增、训练与推理流程。第 4 节比较 LIBERO-Plus 与标准 LIBERO 的成绩;第 5 节按扰动维度分析失败来源;第 6 节讨论仿真、单一机体和推理延迟等边界。补充材料进一步给出消融、运行时统计和测试时干预。

1-2. 从“做大骨干”到“补齐监督”:紧凑 VLA 缺什么?

VLA 将图像、语言和机器人状态映射为动作序列。大骨干通常带来更强的视觉语言先验,但参数规模不是唯一缺失项。LIBERO-Plus 专门将同一任务沿七个维度扰动:相机视角、机器人初始状态、语言指令、光照、背景纹理、传感器噪声和物体布局。视觉扰动、运动学扰动、语言改写并不要求同一种能力。

CoTinyVLA 因而没有提出一个“通用鲁棒模块”,而是将三种训练信号对准三类误差:

鲁棒性缺口 CoTinyVLA 的对应设计 期望补上的信息
单帧无法判断接近方向与夹取进度 第三视角 + 腕部视角各 8 帧 运动、相对位姿、接触细节
动作回归缺少任务阶段约束 Plan–Think 分层 CoT 蒸馏 长程意图与当前执行状态
训练指令表述过少 40 条指令扩增到 800 个释义 词汇与措辞变化

这也是它相对于单纯“缩小 VLA”的区别。紧凑模型并非只把大模型蒸馏为动作,而是让教师提供可被固定 schema 约束的中间任务状态,再把动作监督留给人类演示。

3. Method:同一模型里同时预测 Plan、Think 与动作

CoTinyVLA 的整体架构

图 1:CoTinyVLA 将双视角 16 帧历史、本体感觉和经释义的指令编码为统一 token 流;0.9B VLM 输出 episode 级 Plan、chunk 级 Think 与 8 步动作。虚线表示 35B 教师只在训练阶段提供推理监督。来源:原论文 Figure 1。

Figure 1 将方法拆为四段:输入与提示组装、token 化、Qwen3.5-0.8B 骨干及控制头、结构化输出。控制侧额外增加了约 1M 参数的本体感觉投影器与动作头,因此最终总参数量约 0.9B。

3.1 双视角时序输入:把相机与时间索引显式写进 token 流

一次前向输入由四部分组成:

  • 第三视角从 t − 7 t-7 t7 t t t 的 8 帧;
  • 腕部相机从 t − 7 t-7 t7 t t t 的 8 帧;
  • 末端执行器位姿与两个夹爪关节构成的 8 维 proprioception;
  • 一条自然语言任务指令。

图像统一以 224 × 224 224\times224 224×224 进入视觉编码器。每张图像之前还会插入如 [Third frame 3][Wrist frame 3] 的文本标记。时间顺序和相机来源因此不只依靠视觉 token 的隐式位置,而是成为语言模型可直接读取的上下文。

每个视角的 8 帧在 LIBERO 常见 20 Hz 控制频率下覆盖约 0.4 秒。第三视角提供全局布局,腕部视角提供夹爪与物体接触的近景;固定图像预算下,把帧分给两个视角优于把所有图像都塞给其中一个视角。论文的前向 profiling 显示,16 图像输入把峰值分配显存从 1.76 GiB 提升到 2.20 GiB,每多一张图约增加 32 MiB 激活和 6.5 ms 前向时间。

3.2 Plan 管任务意图,Think 管当前动作块

CoTinyVLA 在词表中加入 <plan></plan><think></think> 四个控制标记,并在动作前生成两层文字推理。

层级 生成频率 内容 控制角色
Plan 每个 episode 一次 按顺序列出子目标 保持整段任务的意图与步骤顺序
Think 每个 8 步动作块一次 PhaseGripperNext 表示当前阶段、夹爪状态与下一子动作
Action 每个动作块一次 8 × 7 8\times7 8×7 动作 6 维末端增量 + 1 维夹爪命令

Think 并非自由作文,而是固定三个槽位:

Phase: <第 k 个子步骤及简述>
Gripper: <OPEN | CLOSED | PARTIALLY_CLOSED>
Next: <下一动作简述>

固定格式限制了 token 长度,也把监督集中到最直接影响操作的变量。更关键的是,动作头读取的是推理 span 之后的隐藏状态,Plan 和 Think 不只是可读的旁注,而在模型计算图中位于动作生成路径上。

猫先生认为,Plan–Think 的拆分对应了操作控制里的两种时间尺度:Plan 是相对稳定的“我要完成什么”,Think 是持续变化的“我现在做到哪一步”。这种结构比每个控制步都重新生成整段推理更适合紧凑模型,因为 Plan 可以缓存,而 Think 保留状态更新能力。

3.3 教师只教“如何解释”,动作仍由演示轨迹提供

35B 的 Qwen3.5-35B-A3B MoE 教师以 4-bit 量化运行,用于离线生成标签。每条演示只调用教师一次以得到 Plan,并在 episode 中均匀位置生成 10 个 Think 标签;未被直接标注的 action chunk 复用最近一次 Think。

教师看到对应时刻的 proprioception,还会拿到由手指关节间距计算出的夹爪提示。这使 Gripper 标签锚定物理状态,减少仅看静态图像时“正在张开还是正在闭合”的歧义。动作标签则完全来自演示轨迹,不由教师生成。

训练目标为动作 L1 回归与推理 token 语言建模的加权和:

L = α L act ( a ^ , a ) + β L lm ( y ^ cot , y cot ) , \mathcal{L}=\alpha\mathcal{L}_{\text{act}}(\hat{\mathbf a},\mathbf a)+\beta\mathcal{L}_{\text{lm}}(\hat{\mathbf y}_{\text{cot}},\mathbf y_{\text{cot}}), L=αLact(a^,a)+βLlm(y^cot,ycot),

其中 α = 1.0 \alpha=1.0 α=1.0 β = 0.1 \beta=0.1 β=0.1,动作损失仍是主项。四个 LIBERO-Plus 套件合计约 240 万 action-chunk 样本,论文在 8 张 H100 上微调两个 epoch。这说明“0.9B”描述的是部署模型,而非全部训练成本:高质量 CoT 标注依赖更大的教师和昂贵离线生成。

3.4 指令释义扩增:只针对语言轴加监督

训练集只有 40 条基础指令。作者为每条指令构造 20 个释义,总计 800 个版本,覆盖动词替换、物体同义词和礼貌表达。训练时以 0.8 概率将原指令换成随机释义,保留 0.2 原文以维持对基准标准措辞的覆盖。

这不是泛化正则器,而是很有针对性的语言鲁棒信号:去掉释义扩增后,Language Instructions 维度下降 12.3 个百分点,而其余六个非语言扰动几乎不变。作者没有额外验证这些自动生成释义与原任务的严格语义等价性,这也是数据质量上的一个保留点。

3.5 推理时的收益与代价:省显存,不等于已经实时

部署时,Plan 在 episode 开始生成一次并缓存;之后每次前向只生成 Think 和 8 步动作块,动作块在环境中开环执行 8 步。L40S 上的稳态中位延迟为 1.37 秒/动作块,显存峰值为 2.25 GiB;其中 76% 的时间花在自回归生成而非视觉编码或动作头。缓存 Plan 后,稳态生成 token 从约 70 降至约 26,延迟下降 48.5%,成功率不变。

这组数字需要分开看:2.25 GiB 的确降低了显存门槛,但以 20 Hz 为例,8 个环境步只有约 0.4 秒控制窗口,1.37 秒同步生成仍不构成现成的实时闭环方案。论文也明确没有测试真实机器人上的端到端延迟或把生成与执行重叠后的时序表现。

4. Experiments:10,030 个扰动任务在验证什么?

LIBERO-Plus 将原始 LIBERO 的 40 个基础任务沿 7 个维度、每维 5 个难度等级系统扰动,合计 10,030 个任务实例,分属 Spatial、Object、Goal、Long 四套任务。每个扰动实例只执行一次 rollout;但每套约 2,500 个实例,汇总成功率仍有较小的抽样误差。所有实验都在 Franka Panda 仿真环境中进行。

主结果与论文比较中最强 7B 基线 OpenVLA-OFT+ 的差距如下:

LIBERO-Plus 套件 CoTinyVLA 0.9B 最强 7B 基线 差值
Spatial 90.8 86.1 +4.7
Object 87.3 84.5 +2.8
Goal 86.6 70.7 +15.9
Long 80.7 77.7 +3.0

标准、无扰动的 LIBERO 上,CoTinyVLA 四套平均为 97.5%,与 RIPT-VLA 的 97.5% 持平。这表明它没有以鲁棒训练为代价显著损伤正常分布下的基本操作能力;但标准 LIBERO 已接近饱和,更能区分模型的仍是 LIBERO-Plus。

4.1 真正困难的不是光照,而是初始运动学状态

视觉轴在四个套件上大多保持很高成功率;Robot Initial States 和 Objects Layout 更难,因为它们要求模型重新定位夹爪、物体和运动轨迹。在 Goal 套件的 Robot Initial States 维度,CoTinyVLA 得到 73.6%,而最强已发表基线为 39.9%。在 Spatial 套件中,这一维度的难度从 Level 1 到 Level 5 时,成功率从 94.4% 降到 7.1%,说明它仍是整套基准最主要的瓶颈。

双视角时序窗口对这个维度有直接证据:保留两路相机、把历史从 8 帧替换为单帧,Robot Initial States 成功率下降 16.0 个百分点;把最近一帧复制填满历史窗口、保持 token 数不变,标准 LIBERO 的成功率从 100% 降至 60%。下降来自时间变化本身,而非仅仅多输入了一些图像 token。

5. Analysis:三项组件如何对应七个扰动轴?

论文的消融并非简单报告“全部模块有效”,而是指出它们的失效模式不同:

移除或干预 主要影响 证据
移除时序双视角 运动学状态扰动 单帧设置使 Robot Initial States 明显下降;固定图像预算下,帧在双视角和时间上的分配本身价值 8.6 分
移除分层 CoT 物理状态与布局 总分下降 3.4 分,Robot Initial States 降 10.8 分、Objects Layout 降 5.7 分
移除释义扩增 语言改写 Language Instructions 从 86.9 降至 74.6,其他六轴基本不变
移除 Think、只留 Plan chunk 级控制 比只移除 Plan 更伤,分别为 -2.2 与 -1.3 分

测试时干预进一步回答了“推理 token 是否只是一段好看的解释”。在 Spatial 与 Goal 共 80 条参考 episode 上,原模型成功 100%;将 Plan 换为空文本,汇总成功率降至 60%,换成相反任务的 Plan 则降至 55%。移除整段 reasoning span 后,成功率为 0%,但该操作也改变了动作头读取隐藏状态的位置,因此它只能证明推理条件化的读取路径是关键,不能单独量化“文字内容”的全部因果贡献。

CoTinyVLA 输出的结构化 Think 与成功、失败轨迹

图 2:前五行是四类任务的成功轨迹和一个 Spatial 扰动下的成功案例,后三行是扰动下失败的 Spatial、Goal、Long 轨迹。成功时 Phase 大致按操作步骤单调推进;失败时 Phase 会在已抓取、放置等阶段间反复跳转,或与场景状态不一致。来源:原论文 Figure 2。

这张定性图不能替代成功率指标,但它揭示了一个可能用于运行时诊断的信号:正常 Spatial 轨迹的 Phase 回退率是 0.8%,将历史替换为重复帧后升至 15.2%,将 Plan 置空后为 13.0%。输出的推理状态在任务失败前已出现不稳定,不过论文没有证明这种信号能可靠预测失败或驱动在线恢复。

6. Discussion:哪些结论可以带走,哪些还不能?

CoTinyVLA 支持的结论相当具体:在 LIBERO-Plus 的既定数据、单一机器人和对比协议下,面向扰动轴设计的时序、结构化 CoT 与释义监督,可以让 0.9B VLA 超过该论文收录的 3B–7B 强基线。它并不支持“紧凑 VLA 已解决真实机器人部署”或“CoT 一定让任何 VLA 更强”这样的外推。

几个边界尤其重要:

  • 仿真与单一机体。 没有真实机器人、跨机械臂或 sim-to-real 验证;
  • 教师依赖。 35B 教师的标签质量、提示和量化方式都可能影响学生,较弱教师是否仍有效尚未测量;
  • 语言覆盖有限。 释义增强对应的是有限的词汇和礼貌表达,复杂歧义指令、长上下文或开放词汇对象并未验证;
  • Long 仍是最弱套件。 80.7% 的总体分数低于其余三套,且 Language Instructions 在 Long 上只有 68.9%;
  • 实时性尚未闭环。 推理显存较小,但主要瓶颈是 token 生成,实体部署还需并行生成、动作重叠、量化或更短推理预算。

总结:小 VLA 的能力,可以由更匹配的训练信号换来

CoTinyVLA 将 0.9B 参数的 VLA 组织成一条明确的控制链:双视角历史补足运动线索,Plan 保存跨 episode 的任务意图,Think 对齐 action chunk 的阶段和夹爪状态,释义扩增降低对 40 条原始指令措辞的记忆。35B 教师只提供结构化推理标签,动作仍由演示监督;Plan 又可在 episode 内缓存,减少重复生成。

论文最扎实的证据是,三个组件对不同扰动轴产生可分离影响,并且 Plan 的内容在固定模型上的干预中会实质改变动作与成功率。它把“VLA 变小会失去什么”从模糊的模型容量问题,改写成时序、状态结构和语言覆盖三个可测、可补的训练问题。

从工程角度看,接下来的问题同样清楚:能否用更便宜的教师生成可靠标签,能否将结构化推理压缩到实时控制预算,以及这些收益能否跨出 LIBERO 的仿真厨房,迁移到真实机器人和更多机体。

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐