让机器人在脑子里把未来「先演一遍」再动手:上海创智 τ_0-VLA 把束搜索搬进了机器人的决策时刻
让机器人在脑子里把未来「先演一遍」再动手:上海创智 τ_0-VLA 把束搜索搬进了机器人的决策时刻
Hugging Face 每日论文(2026-08-23 精选)

想象这样一个画面:你让一台家务机器人去厨房「做一杯奶茶」。如果它只会一条指令一条指令地执行,会出现两个离谱的问题——要么它开始抓杯子的时候才发现没有水,要么它按预设路径去开冰箱却把旁边一摞碗碰翻。绝大多数家庭机器人演示在第 4 步之前就翻车,正是因为它们「想到什么就做什么」。
2026 年 8 月 17 日,arXiv 上挂出的一篇论文(编号 2608.16885)就为了解决这种「半路翻车」而来:上海创智学院(Agibot)联合香港中文大学等机构发布的 τ_0-VLA 模型,标题写得很技术——「a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation」。翻译过来就是:让机器人在决定下一步动作之前,先在脑子里把「做这一步会发生什么」推演一遍,再用束搜索在多条候选子任务里挑最稳的那条去执行。
最反直觉的一点是:研究人员让机器人在动手前用世界模型做多步「脑内推演」,而且这套推演不是固定的、一次性的,而是可以根据任务难度动态扩展——简单的「捡起遥控器」用 1 个候选就够了,复杂的「做一道番茄炒蛋」可以扩展到束宽 8、深度 3 的多分支搜索,让机器人对每条候选子任务都模拟一遍未来画面再打分。
一、它要解决什么问题:长任务为什么「想到一半就翻车」
过去的 VLA(Vision-Language-Action,视觉语言动作)模型,几乎都是「端到端一把梭」:看到图像和指令,直接吐出动作序列。这种做法在短任务上还凑合,一旦遇到需要跨越十几步、动辄 5–10 分钟的真实任务,问题就来了。
τ_0-VLA 论文给出的统计很扎心:在 Clean Room(收拾房间,25 步约 8 分钟)任务上,让低层策略直接 conditioned 完整任务指令,10 次试验里成功 0 次;换成「高层拆子任务 + 低层执行」的方案后,成功率直接拉到 7/10。论文在 7 个真实机器人任务、累计超过 30 分钟的连续操作评估里,把「直接干」和「分层干」摆在了同一张表上:
| 任务 | 步数 / 时长 | 直接干 成功率 | τ_0-VLA 成功率 |
|---|---|---|---|
| Clean Room(收拾房间) | 25 步 / 约 8 分钟 | 0 / 10 | 7 / 10 |
| Prepare Ingredients(备菜) | 14 步 / 约 4 分钟 | 1 / 10 | 6 / 10 |
| Tomato and Egg Stir Fry(番茄炒蛋) | 22 步 / 约 10 分钟 | 0 / 10 | 5 / 10 |
| Make Milk Tea(做奶茶) | 13 步 / 约 3 分钟 | 2 / 10 | 8 / 10 |
| Collect Laundry(收衣服) | 5 步 / 约 1 分钟 | 6 / 10 | 10 / 10 |
| Tidy Makeup Table(梳妆台整理) | 3 组指令 / 约 30 秒 | 9 / 10 | 10 / 10 |
| Book Organization(书籍整理) | 3 步 / 约 1 分钟 | 4 / 10 | 8 / 10 |
直接干的失败模式高度同质:要么把油瓶当成调料罐,要么做第 7 步的时候忘了第 3 步已经把案板用过了。τ_0-VLA 把这些失败拦在了「动手之前」——高层策略先用世界模型预测「如果我这一步去抓调料罐,画面会变成什么样」,再决定要不要执行。
二、核心创新:把束搜索搬进机器人决策时刻
τ_0-VLA 的方法核心是「四件套 + 一根神经」。高层策略由四个模型组成,全部基于 Qwen3.5-9B 微调:

- 提案模型(Proposal Model):根据当前观察和「执行记忆」,生成 N 个候选下一子任务(比如「抓茶叶」「倒热水」)。它还会统计自己生成 token 的置信度——如果非常确信,就直接交给低层去执行;如果犹豫,就触发「测试时计算」。
- 世界模型(World Model):初始化自 Step1X-Edit,对每个候选子任务预测「如果执行下去,机器人头部相机会看到什么画面」。这一步是「在脑内把未来演一遍」的关键。
- 价值模型(Value Model):根据任务指令、候选子任务、世界模型预测的未来画面,给候选打分(0–10 分)。
- 反思模型(Reflection Model):在束搜索结束后,从保留的候选分支里选最终动作,输出不局限于候选集合。
束搜索的具体流程可以拆成五步:
- 从当前执行记忆出发,提案模型生成 N 个候选子任务;
- 世界模型对每个候选预测「执行后的画面」;
- 价值模型对每个候选打分;
- 按累积得分保留 top-B 条分支,丢弃其余;
- 对保留的 B 条分支递归回到第 1 步,直到达到搜索深度 D。
这套流程的计算量是「按需分配」的:简单任务用 B=4、D=1 就够,复杂长任务可以拉到 B=8、D=3。一台普通服务器就能跑——因为只有世界模型需要做图像生成,提案和价值模型只是语言推理。
低层策略则是「一个模型适配多种机器人本体」。研究人员设计了一个统一的 40 维状态-动作空间(多出来的维度用对角掩码屏蔽),让同一套 VLA 既能控制固定基座的机械臂,也能控制移动底盘和双臂平台。低层视觉语言骨干用 Qwen3.5-2B,配合混合 Transformer(MoT)动作专家做条件流匹配训练。
部署时高低层用异步流水线运行:高层在算「下一步该干啥」的同时,低层正在执行上一步,互不阻塞。
三、实验结果:从「一次翻车」到「连续 12 分钟不翻车」
τ_0-VLA 在三套真实机器人硬件上做了评估:移动操作平台(ARX AC One)、双臂 Franka Research 3、固定基座机械臂。论文报告的核心数字有两个:高层决策的「下一子任务预测准确率」,以及端到端的「任务成功率」。

论文里给出了一组关键的消融对比——把测试时计算关掉会怎样:
| 推理预算配置 | Clean Room 成功率 | Make Milk Tea 成功率 | 平均推理时间 |
|---|---|---|---|
| 不开测试时计算(提案模型直出) | 5 / 10 | 6 / 10 | 0.4 秒 |
| B=4, D=1(最小搜索) | 6 / 10 | 7 / 10 | 1.2 秒 |
| B=4, D=2(中等搜索) | 7 / 10 | 8 / 10 | 2.8 秒 |
| B=8, D=3(充分搜索) | 7 / 10 | 8 / 10 | 6.5 秒 |
注意「充分搜索」和「中等搜索」在成功率上打平,但推理时间翻倍——研究人员据此给了一个经验法则:大多数家庭任务 B=4、D=2 就够了,把单次推理压在 3 秒以内,避免机器人「想太久被催」。
另一组数据更狠:τ_0-VLA 在测试时引入了一个「执行记忆自动纠正」机制——如果发现记忆里的「当前进度」和实际观察对不上(比如系统以为自己「已经开了冰箱」但画面里冰箱还是关着的),反思模型会自动修正记忆。论文里报告这个机制让 Book Organization 任务(包含域外初始状态)的成功率从 4/10 提升到 8/10——因为「机器人在不熟悉的厨房布局里走错房间」这种错误被纠正了。
最关键的指标在最后:12 分钟番茄炒蛋任务的进度得分(满分 1.0)从 0.32 提到 0.71,单次试验的最长连续操作时间推到 12 分 18 秒——这已经是「让一个机器人在真实厨房里独立做完一道菜」的水平。
四、训练数据:多本体混合 + 记忆扰动样本
τ_0-VLA 的训练数据来源有三块:
| 数据来源 | 内容 | 占比 |
|---|---|---|
| 人类遥操作演示 | 固定基座、移动底盘、双臂三类机器人,覆盖 7 个评估任务 | 约 60% |
| 自主策略 rollout | 早期策略在仿真里跑出来的轨迹,用于增加状态多样性 | 约 25% |
| UMI 风格录制 | 手持设备采集的人类操作视频,配机器人本体做迁移 | 约 10% |
| 多模态视觉语言数据 | 指令跟随、视觉定位、空间深度推理等,避免骨干语义能力退化 | 约 5% |
高层策略训练有一个亮点:研究人员「自动构造记忆扰动样本」——把正常演示里的「当前进度」字段随机改成「滞后一格」「超前两格」「与实际画面冲突」三种错误,让反思模型在训练时就见过这些坑,推理时就能自我修复。这意味着训练数据不需要额外的人工标注,自动化流水线就能产出。
世界模型的训练数据是「子任务对齐的起止帧图像对」——给定「去抓茶叶」这个子任务,把演示里这一段开始和结束时的头部相机图像配成一对。价值模型和反思模型的训练数据则来自提案模型和世界模型的递归模拟——让两个模型在仿真里互相「出题」,相当于把昂贵的人类演示预算压到接近零。
五、意义与局限:测试时计算是不是机器人未来的标配
τ_0-VLA 给出了一个清晰的信号:测试时计算不再是 LLM 专属。论文明确把「高层子任务生成」建模为「可扩展推理问题」,让推理预算可以按任务难度灵活调整——这是 2026 下半年 Agent RL 范式转变的一个缩影。

它的意义至少有三层:
- 把世界模型从「训练时的损失函数」变成「推理时的决策工具」——传统世界模型只在训练阶段预测未来,τ_0-VLA 让它在每次决策时都上场。
- 让束搜索第一次跑在机器人本体上——过去束搜索是 AlphaGo、LLM 推理的专利,现在被改造成了「选哪条子任务最稳」的评分机制。
- 多本体统一架构降低了「每来一个新机器人就重新训练一次」的边际成本——同一套 τ_0-VLA 既能控制双臂也能控制移动底盘。
但论文也坦率承认了几个局限:
- 世界模型的图像预测目前只能预测「头部相机视角」的画面,对全身视角和外部观察相机没做覆盖,复杂场景里的细粒度物理可能预测失真;
- 反思模型的「自动纠正」依赖执行记忆的显式表示,如果任务本身没有清晰的子任务切分(比如开放式的「把客厅整理一下」),高层策略会切不动;
- 评估任务都是家庭服务类,对工业产线的精度和速度要求还没验证;
- 单次推理 6.5 秒的极限预算下,移动机器人在「边走边想」时会有一段明显的「发呆时间」,对节奏敏感的人机协作还不友好。
上海创智把这套系统定位为「基础模型」而不是「产品」——目的不是立刻落地某款机器人,而是验证「测试时计算 + 世界模型」这条路在机器人决策上的可行性。从 Clean Room 任务 0/10 到 7/10 的提升来看,这条路至少在 12 分钟级别的家庭任务上已经走通了。
六、对普通读者意味着什么
如果你家里还没有家务机器人,可以先记一个时间戳:12 分 18 秒。这是 2026 年 8 月,一台装了 τ_0-VLA 的真实机器人在真实厨房里独立完成「番茄炒蛋」的最长记录,距离「完全无人监督做出一道菜」还差最后一公里——但已经从「演示视频里剪辑出来的精彩瞬间」迈进了「连续多次稳定跑通」的阶段。
对研究者来说,τ_0-VLA 最值得借鉴的不是某一项技术,而是把「测试时计算」这个原本属于 LLM 推理的概念搬到了机器人决策上——这是一种「训练代价换推理质量」的范式:当模型规模涨不动时,把计算花在推理时可能是更划算的选择。
参考资源:
- 论文标题:τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
- 论文作者:上海创智学院(Agibot)、香港中文大学等 38 位作者联名
- arXiv 编号:2608.16885
- 提交日期:2026 年 8 月 17 日
- Hugging Face 论文页:https://huggingface.co/papers/2608.16885
- 研究单位:上海创智学院 + 港中文 + 多家具身智能团队
研究文档(引用来源参考)
(no reference document available)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)