τ₀-VLA 完整项目信息与论文核心解读

一、官方资源链接汇总

  1. 项目主页:https://tau0-vla.github.io/

  2. 论文 PDF:https://tau0-vla.github.io/tau0-vla.pdf

  3. GitHub 开源代码:https://github.com/sii-research/tau-0-vla

  4. Hugging Face 模型权重:https://huggingface.co/sii-research/tau-0-vla

二、τ₀-VLA 整体概述

τ₀-VLA 是由上海创新研究院、Agibot Finch、香港中文大学联合推出的分层机器人基础 VLA 模型,核心解决长时序家庭机器人操作难题(打扫、做饭、制作奶茶等多步骤任务),核心创新是世界模型引导的测试时计算(TTC, Test-Time Computation),让机器人在执行前推演多条子任务分支、预判视觉结果再决策,大幅提升长流程任务成功率。

图片

核心痛点(现有分层 VLA 缺陷)

传统分层视觉语言动作模型仅单次前向推理生成下一步子任务,无法对比多方案、预判执行后果,错误子任务只能执行后才能发现,环境已被改动,纠错成本极高;同时缺乏可自动修正的执行记忆,容易丢失 / 超前记录任务进度。

三、双尺度分层系统架构

系统分为高层规划策略(慢时序,负责子任务决策)、底层执行 VLA 策略(快时序,负责机器人运动控制)两大模块,形成闭环。

在这里插入图片描述

1. 高层策略(带自适应测试时计算 TTC)

高层由 4 个子模型协同工作,基于可修正执行记忆跟踪全任务进度:

  1. 提案模型 Proposal:输入任务指令、多视角观测、历史记忆,生成基础候选子任务;通过 token 置信度判断是否需要额外推理(置信低则启动 TTC 搜索)。

  2. 世界模型 World Model:输入当前画面 + 候选子任务,预测执行完成后的终端视觉图像,模拟物理执行结果。

  3. 价值模型 Value Model:结合全局任务、子任务、预测画面,打分评估该分支任务推进质量。

  4. 反思模型 Reflective:对 beam search 筛选后的多条最优推演分支综合判断,输出最终执行子任务。

TTC 推理流程(置信不足时触发)
  1. 对每条保留分支采样 N 个候选子任务;

  2. 世界模型预判每个子任务执行后的画面,价值模型打分;

  3. 按累计分数保留 Top-B 分支,递归拓展至设定搜索深度 D;

  4. 反思模型融合所有推演路径,输出最优子任务交给底层执行。

可自校正执行记忆

训练时构造记忆扰动样本(记忆滞后、超前、记录错误),让模型自动对比真实视觉画面,回滚 / 重试 / 更新进度记录,无需额外人工标注数据,子任务预测准确率提升 11%。

2. 底层通用 VLA 执行策略

面向多机器人本体跨形态通用控制,核心特性:

  1. 统一 40 维状态 / 动作空间:兼容固定基座 Franka、移动双臂 ARX、轮式人形 AGIBOT G1;不同机器人通过掩码屏蔽无效控制维度,一套模型适配所有硬件。

  2. 模型基座:视觉语言主干基于 Qwen3.5,搭配 MoT(混合 Transformer)动作专家,采用条件流匹配生成连续动作块(单次输出 30 步动作)。

  3. 训练数据规模:40115 小时异构真实机器人轨迹(示教 + 自主运行 + UMI 数据集),搭配多模态图文数据联合预训练,再针对具体机器人微调。

四、实验评测体系

1. 四大长时序真实机器人任务(AGIBOT G1 人形)

在这里插入图片描述

任务 步骤数 流程简介
打扫房间 25 步 收纳衣物、挂包、递毯子、清理桌面垃圾,最长单任务 12 分钟
备菜(番茄炒蛋前置) 14 步 取番茄鸡蛋、打蛋搅拌、归还厨具
番茄炒蛋 22 步 切菜、翻炒、调味、装盘、收纳锅具
制作奶茶 13 步 加配料、倒奶茶、封杯、插吸管
基线对比结果(每组 10 次真机测试)
模型 平均任务成功率 说明
GR00T N1.7 2.5% 纯底层直推,无分层规划
LingBot-VLA 0.0% 无记忆与前瞻推理
π₀.5 22.5% 通用 VLA,简单分层无世界模型推演
τ₀-VLA(直执行,无分层) 27.5% 底层模型本身强于基线
τ₀-VLA(分层 Plan Once,单次推理) 45.0% 仅增加进度记忆,无 TTC 搜索

2. 测试时计算 TTC 增益实验

在这里插入图片描述

以奶茶、整理书籍、打扫房间为测试场景,对比三种高层推理方式:

  1. Plan Once:单次直接预测,无搜索;

  2. Best-of-N:采样多候选、单步打分,无多步分支拓展;

  3. TTC(本文方法):多深度 beam 搜索 + 世界模型预判 + 反思融合。

关键结论:

  • 分布外场景(未见过的书籍摆放)差距最大:TTC 74% > Best-of-N 57.5% > Plan Once 50%;

  • 真机闭环成功率提升:奶茶 5/10→7/10,书籍整理 6/10→9/10,打扫房间 5/10→7/10;

  • 算力 - 准确率曲线:低算力区间收益极快,达到中等计算量后准确率逐步饱和,支持置信度路由按需开启搜索,平衡速度与精度。

在这里插入图片描述

3. 跨机器人短任务泛化验证

底层策略单独在 ARX 移动机器人、Franka 固定臂测试:收纳衣物、整理化妆台,τ₀-VLA 底层在全部子任务上成功率优于 GR00T、LingBot、π₀.5,验证统一动作空间的跨形态泛化能力。

五、代码仓库使用说明(GitHub)

环境依赖

Python 3.11 + CUDA 12.8 + PyTorch 2.7.1

# 克隆项目
git clone https://github.com/sii-research/tau-0-vla
cd tau-0-vla
# 一键配置环境
bash scripts/setup.sh

训练与评估

  1. 基于提供的 Agibot 示例数据微调:
bash scripts/train.sh configs/example_agibot_world_gong/train.yaml \
 --model_name_or_path 你的HuggingFace模型本地路径
  1. 开启模型推理服务:
python -m deploy.server --model outputs/训练输出文件夹
  1. 开环高层子任务预测评估:
python deploy/openloop.py --ckpt outputs/训练输出文件夹 --no-plot

仓库目录结构

src/tau0_vla/    # 模型、数据加载、训练核心代码
configs/         # 训练配置模板
deploy/          # 推理服务、评估脚本
example_data/    # LeRobot格式示例机器人数据集
scripts/         # 环境、训练工具脚本

开源协议

代码与模型权重采用 Apache 2.0 开源协议。

六、核心创新总结

  1. 世界模型驱动的测试时分支搜索:区别于仅事后生成子目标的 π₀.7,τ₀-VLA 在决策前推演多条子任务未来视觉状态,择优再执行;

  2. 自适应置信路由:高置信度快速单步推理,难决策场景自动开启多分支搜索,算力按需分配;

  3. 可自校正执行记忆:自动修复进度记录偏差,解决长时序任务状态跟踪难题;

  4. 统一跨机器人底层控制接口:一套 VLA 模型适配移动人形、双臂、固定机械臂,降低多机器人部署成本;

  5. 完整真机验证闭环:覆盖烹饪、家务、饮品制作等真实长流程家庭任务,有明确的定量真机成功率指标。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐