τ₀-VLA 完整项目信息与论文核心解读
τ₀-VLA 完整项目信息与论文核心解读
一、官方资源链接汇总
-
GitHub 开源代码:https://github.com/sii-research/tau-0-vla
-
Hugging Face 模型权重:https://huggingface.co/sii-research/tau-0-vla
二、τ₀-VLA 整体概述
τ₀-VLA 是由上海创新研究院、Agibot Finch、香港中文大学联合推出的分层机器人基础 VLA 模型,核心解决长时序家庭机器人操作难题(打扫、做饭、制作奶茶等多步骤任务),核心创新是世界模型引导的测试时计算(TTC, Test-Time Computation),让机器人在执行前推演多条子任务分支、预判视觉结果再决策,大幅提升长流程任务成功率。

核心痛点(现有分层 VLA 缺陷)
传统分层视觉语言动作模型仅单次前向推理生成下一步子任务,无法对比多方案、预判执行后果,错误子任务只能执行后才能发现,环境已被改动,纠错成本极高;同时缺乏可自动修正的执行记忆,容易丢失 / 超前记录任务进度。
三、双尺度分层系统架构
系统分为高层规划策略(慢时序,负责子任务决策)、底层执行 VLA 策略(快时序,负责机器人运动控制)两大模块,形成闭环。

1. 高层策略(带自适应测试时计算 TTC)
高层由 4 个子模型协同工作,基于可修正执行记忆跟踪全任务进度:
-
提案模型 Proposal:输入任务指令、多视角观测、历史记忆,生成基础候选子任务;通过 token 置信度判断是否需要额外推理(置信低则启动 TTC 搜索)。
-
世界模型 World Model:输入当前画面 + 候选子任务,预测执行完成后的终端视觉图像,模拟物理执行结果。
-
价值模型 Value Model:结合全局任务、子任务、预测画面,打分评估该分支任务推进质量。
-
反思模型 Reflective:对 beam search 筛选后的多条最优推演分支综合判断,输出最终执行子任务。
TTC 推理流程(置信不足时触发)
-
对每条保留分支采样 N 个候选子任务;
-
世界模型预判每个子任务执行后的画面,价值模型打分;
-
按累计分数保留 Top-B 分支,递归拓展至设定搜索深度 D;
-
反思模型融合所有推演路径,输出最优子任务交给底层执行。
可自校正执行记忆
训练时构造记忆扰动样本(记忆滞后、超前、记录错误),让模型自动对比真实视觉画面,回滚 / 重试 / 更新进度记录,无需额外人工标注数据,子任务预测准确率提升 11%。
2. 底层通用 VLA 执行策略
面向多机器人本体跨形态通用控制,核心特性:
-
统一 40 维状态 / 动作空间:兼容固定基座 Franka、移动双臂 ARX、轮式人形 AGIBOT G1;不同机器人通过掩码屏蔽无效控制维度,一套模型适配所有硬件。
-
模型基座:视觉语言主干基于 Qwen3.5,搭配 MoT(混合 Transformer)动作专家,采用条件流匹配生成连续动作块(单次输出 30 步动作)。
-
训练数据规模:40115 小时异构真实机器人轨迹(示教 + 自主运行 + UMI 数据集),搭配多模态图文数据联合预训练,再针对具体机器人微调。
四、实验评测体系
1. 四大长时序真实机器人任务(AGIBOT G1 人形)

| 任务 | 步骤数 | 流程简介 |
|---|---|---|
| 打扫房间 | 25 步 | 收纳衣物、挂包、递毯子、清理桌面垃圾,最长单任务 12 分钟 |
| 备菜(番茄炒蛋前置) | 14 步 | 取番茄鸡蛋、打蛋搅拌、归还厨具 |
| 番茄炒蛋 | 22 步 | 切菜、翻炒、调味、装盘、收纳锅具 |
| 制作奶茶 | 13 步 | 加配料、倒奶茶、封杯、插吸管 |
基线对比结果(每组 10 次真机测试)
| 模型 | 平均任务成功率 | 说明 |
|---|---|---|
| GR00T N1.7 | 2.5% | 纯底层直推,无分层规划 |
| LingBot-VLA | 0.0% | 无记忆与前瞻推理 |
| π₀.5 | 22.5% | 通用 VLA,简单分层无世界模型推演 |
| τ₀-VLA(直执行,无分层) | 27.5% | 底层模型本身强于基线 |
| τ₀-VLA(分层 Plan Once,单次推理) | 45.0% | 仅增加进度记忆,无 TTC 搜索 |
2. 测试时计算 TTC 增益实验

以奶茶、整理书籍、打扫房间为测试场景,对比三种高层推理方式:
-
Plan Once:单次直接预测,无搜索;
-
Best-of-N:采样多候选、单步打分,无多步分支拓展;
-
TTC(本文方法):多深度 beam 搜索 + 世界模型预判 + 反思融合。
关键结论:
-
分布外场景(未见过的书籍摆放)差距最大:TTC 74% > Best-of-N 57.5% > Plan Once 50%;
-
真机闭环成功率提升:奶茶 5/10→7/10,书籍整理 6/10→9/10,打扫房间 5/10→7/10;
-
算力 - 准确率曲线:低算力区间收益极快,达到中等计算量后准确率逐步饱和,支持置信度路由按需开启搜索,平衡速度与精度。

3. 跨机器人短任务泛化验证
底层策略单独在 ARX 移动机器人、Franka 固定臂测试:收纳衣物、整理化妆台,τ₀-VLA 底层在全部子任务上成功率优于 GR00T、LingBot、π₀.5,验证统一动作空间的跨形态泛化能力。
五、代码仓库使用说明(GitHub)
环境依赖
Python 3.11 + CUDA 12.8 + PyTorch 2.7.1
# 克隆项目
git clone https://github.com/sii-research/tau-0-vla
cd tau-0-vla
# 一键配置环境
bash scripts/setup.sh
训练与评估
- 基于提供的 Agibot 示例数据微调:
bash scripts/train.sh configs/example_agibot_world_gong/train.yaml \
--model_name_or_path 你的HuggingFace模型本地路径
- 开启模型推理服务:
python -m deploy.server --model outputs/训练输出文件夹
- 开环高层子任务预测评估:
python deploy/openloop.py --ckpt outputs/训练输出文件夹 --no-plot
仓库目录结构
src/tau0_vla/ # 模型、数据加载、训练核心代码
configs/ # 训练配置模板
deploy/ # 推理服务、评估脚本
example_data/ # LeRobot格式示例机器人数据集
scripts/ # 环境、训练工具脚本
开源协议
代码与模型权重采用 Apache 2.0 开源协议。
六、核心创新总结
-
世界模型驱动的测试时分支搜索:区别于仅事后生成子目标的 π₀.7,τ₀-VLA 在决策前推演多条子任务未来视觉状态,择优再执行;
-
自适应置信路由:高置信度快速单步推理,难决策场景自动开启多分支搜索,算力按需分配;
-
可自校正执行记忆:自动修复进度记录偏差,解决长时序任务状态跟踪难题;
-
统一跨机器人底层控制接口:一套 VLA 模型适配移动人形、双臂、固定机械臂,降低多机器人部署成本;
-
完整真机验证闭环:覆盖烹饪、家务、饮品制作等真实长流程家庭任务,有明确的定量真机成功率指标。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)