"不是训练更强的VLA,而是学习如何驾驭它。"

当端到端VLA在扰动面前脆弱得像一张薄纸,当LLM Agent的解析原语面对不规则抓取束手无策,清华联合团队给出了一个令人耳目一新的答案:保持VLA冻结,用记忆引导的Agent学会"使用"它。


一、VLA的“分布内幻象”:95%准确率为何在现实中一触即溃

想象这样一个场景:你花数月训练了一个Vision-Language-Action(VLA)模型,它在标准LIBERO benchmark上取得了95.3%的惊艳成绩。你满怀信心地将它部署到真实厨房。然后,灾难发生了——

  • 你把指令从"把牛奶放进篮子"改成"把牛奶放进盒子",模型却固执地重复旧行为,仿佛根本没听见新指令;

  • 你把目标物体从左边移到右边,模型依然朝训练时的位置伸手,对眼前的变化视而不见;

  • 一个轻微的碰撞让物体滑出预接触位姿,模型没有任何重试机制,整个任务就此失败。

这不是假设。这是论文中RLinf(基于π₀.₅的冻结VLA)在LIBERO-Pro扰动测试中的真实表现:成功率从95.3%断崖式跌至50.0%。

这一现象背后反映的是端到端 VLA 的一个已知弱点:它在训练分布内表现优异,但面对分布偏移时,性能会迅速下降。 更具体地说,当出现语义重定向(semantic retargeting)、空间布局偏移(spatial-layout shift)或目标重绑定(goal re-binding)时,VLA 往往缺乏显式的任务重规划能力,难以根据新的场景状态重新组织行为。

一个自然的想法是:引入一个大语言模型(LLM)作为 Planner,让它负责高层决策,底层则调用解析原语(如 move_toset_gripper)来执行。但纯解析原语在面对不规则抓取、受限放置、铰接物体交互等接触丰富任务时,能力明显不足。因此,单纯的“LLM + 解析原语”并不能解决全部问题。

这正是 Harness VLA 试图解决的矛盾:如何既保留 VLA 在接触丰富操作上的能力,又补足其在任务级推理和分布外泛化上的不足。


二、核心洞察:不是扩库,而是"学会使用"

Harness VLA的颠覆性不在于它引入了多么复杂的新原语,恰恰相反——它的原语库极小且固定

原语

类型

职责

VLA_ACT

VLA原语

冻结VLA,负责局部接触丰富行为

MOVE_TO

复合解析

逆运动学求解的末端执行器移动

MOVE_POSE

复合解析

协变姿态变量的移动

ROTATE_WRIST / ROTATE_PITCH

原子解析

腕部姿态调整

SET_GRIPPER / RELEASE

原子解析

夹爪控制

NAVIGATE_TO / MOVE_BASE

复合/原子

移动基座导航(RoboCasa365)

关键洞察是:与其不断扩充技能库,不如让Agent学会这些固定原语的"操作范围"(operating range)。

这就像一个资深厨师面对一套固定的刀具——重要的不是有多少把刀,而是知道每一把刀适合切什么、怎么切、切坏了怎么补救。Harness VLA的Planner正是这样一位"厨师",它通过记忆学会了:

  • 哪些子问题应该用解析原语处理,哪些必须调用VLA_ACT

  • 什么样的预接触位姿、提示词、停止条件能让VLA_ACT可靠;

  • 空抓、假成功等失败签名应该如何触发重布置。


三、系统架构:记忆双塔 + 文件化REPL

3.1 系统总览

Harness VLA的系统架构可以用一句话概括:一个Agentic Planner,一个固定原语库,两座记忆塔。

给定任务描述、RGB-D观测和机器人状态,Planner Π 从固定原语库 𝒫 中选择结构化调用,而非直接输出低层动作。每个原语以JSON对象调用,在环境中执行直到内部后置条件满足,然后返回新的观测——这是一个回合制的执行循环。

3.2 记忆双塔:Task Specific Memory + Global Memory

Harness VLA的记忆系统是其灵魂所在,分为两层:

Task Specific Memory(任务特定记忆)

  • 存储从参考种子(reference-seed)探索中蒸馏出的成功原语调用序列;

  • 以JSONL格式记录,但不是开环轨迹重放——具体空间坐标被替换为符号感知查询,使其可跨不同空间布局复用;

  • 部署时作为"结构先验"被检索,Planner根据当前观测重新绑定(re-ground)对象、夹具和目标位姿。

Global Memory(全局记忆)

  • 聚合可复用的成功规则(如最优提示策略);

  • 记录失败模型(如空抓执行、假成功检测);

  • 确保Planner在不同任务间避免重复踩坑。

3.3 文件化REPL:审计与可复现的基石

Harness VLA的执行循环被实现为一个文件介导的Read-Eval-Print Loop(REPL)。Planner通过读写JSON文件与物理引擎交互:command.json写入原语调用,环境工作者执行后回写观测文件。

这一设计的深远意义在于:

  • 完全可审计:每一次物理动作前后都有观测和诊断记录;

  • 无特权状态:Planner无法访问模拟器的内部状态、物体位姿或控制器内部;

  • 天然支持交互式调试:RPent框架提供了--interactive交互式CLI模式和--dashboard实时仪表盘。


四、三大关键发现:为什么它能工作?

论文通过系统性的机制分析,揭示了Harness VLA成功的三个深层原因。

发现一:Planner级语义重绑定恢复任务条件行为

端到端VLA的一个致命弱点是任务条件化脆弱。论文展示了一个显著的对比在LIBERO-Pro Object任务中,当指令将目标重定向到另一个物体而视觉场景几乎不变时,冻结的RLinf重复标准行为,完全无视新指令;而在Goal-Pro任务中,当物体布局改变后,RLinf依然将物体移向训练时的区域。

Harness VLA的解决之道是将语义和场景级推理显式提升到Planner层:Planner解析任务描述,从实时RGB-D观测中解析当前接触目标,用解析原语进行布置和重定位,仅在局部接触丰富阶段调用vla_act。冻结的VLA只负责执行Planner提供的绑定下的接触操作。

发现二:Planner布置的VLA调用提升冻结策略可靠性

Harness VLA中的VLA调用不是一次性黑盒,而是可被重试的局部尝试。Planner首先用解析原语将机器人置于可行的预接触配置,调用VLA,观察接触后置条件是否满足,失败则通过改变接近位姿、视角或局部布置来重构(reframe)调用。

上图展示了这一效应的聚合证据:允许少量Planner选择的VLA调用已超越冻结策略基线,额外调用在更长或接触更重的任务上进一步提升成功率。关键洞察:VLA被稀疏使用,但能够重布置和再次调用的能力是Harness鲁棒性的核心。

发现三:解析原语隔离非接触执行

解析原语并不取代VLA的接触丰富操作,而是处理其周围的非接触结构:自由空间运输、预接触布置、腕部/基座重定向、撤退和释放后重定位。这让Planner将vla_act保留给局部接触丰富阶段——抓取、受限放置、按钮按压、水龙头旋转、抽屉操作、咖啡机交互。

这种劳动分工的本质是:解析原语不解决接触丰富操作本身,而是扩展同一冻结VLA可被复用的条件。


五、实验结果:从桌面到厨房,从单臂到双臂

Harness VLA在三个具有代表性的操作领域进行了评估,结果令人瞩目:

5.1 LIBERO-Pro:扰动桌面操作

在引入指令重定向(T)和位置交换(S)扰动的LIBERO-Pro上,Harness VLA(Claude Code)达到82.4%,相对最强基线RATS(43.8%)提升38.6个百分点,相对冻结RLinf基线(50.0%)提升32.4个百分点。

更值得注意的是,Harness VLA在标准LIBERO上保持了96.0%的竞争力(冻结RLinf为95.3%),证明"驾驭"并未以牺牲分布内性能为代价。

5.2 RoboCasa365:家庭厨房长程操作

在包含移动基座导航的厨房规模任务中,Harness VLA达到55.4%,相对RLDX-1(30.0%)提升25.4个百分点。Planner有效利用了移动基座原语在厨房环境中进行大范围位置调整,再调用 VLA_ACT 执行抓取、放置、关门等接触丰富的局部操作

5.3 RoboTwin C2R:双臂清洁到随机化迁移

在最具挑战性的零样本清洁到随机化(Clean-to-Randomized)双臂操作任务中,Harness VLA将冻结的LingBot-VLA从50.4%提升至58.4%(+8.0 pts),超越外部π₀.₅基线(47.9%)10.5个百分点。这一提升完全来自Agent层面的分解,没有任何随机化设置的额外训练或VLA微调。


六、方法论转向:从"训练更好的模型"到"学习更好地使用模型"

Harness VLA 的核心价值不仅在于 benchmark 数字,更在于它提出了一种新的分工逻辑

传统路径

Harness VLA 路径

收集更多数据,训练更大的 VLA

冻结现有 VLA,学习如何调用它

不断扩充技能库

固定小库,学习每个原语的操作范围

端到端黑箱推理

显式分解为可审计的原语调用序列

分布内轨迹优化

通过重绑定实现分布外零样本迁移

开环轨迹重放

结构复用 + 实时语义重绑定

论文明确将 Harness VLA 与 ASPIRE 等"自动扩展技能库"的方向区分开来:ASPIRE 不断添加新技能,而 Harness VLA 坚持固定词汇表,让 Planner 通过记忆学习如何编排已有原语。这种"组合优于创造"的思路,把 VLA 从"必须包办一切"的单体式策略中解放出来,让它专注于最擅长的接触丰富控制,而语义解析、空间推理、长程组合交由 Planner 处理。

更重要的是,Harness VLA 的学习产物天然具有可审计性。Task Specific Memory 中存储的是参数化的 JSONL 调用序列,Global Memory 中记录的是语言形式的成功规则与失败模型——不是难以解释的神经网络权重,而是人类可阅读、可检查、可跨任务复用的结构化知识。在迈向可信赖具身智能的道路上,这种"白盒化"的学习机制可能比单纯提升成功率更具长远意义。


七、RPent:递归物理Agent的开源基础设施

Harness VLA并非孤立存在,它是 RPent(Recursive Physical Agent)框架的首个核心项目。RPent的设计哲学可以概括为三个词:服务导向(service-oriented)、标准化(standardized)、可组合(composable)

RPent的架构分为四层:

  • 用户层:Web仪表盘和交互式CLI;

  • 智能层:Agentic Planner(支持Claude Code、Codex、自定义Planner)、记忆模块、工具库;

  • 接口层:统一机器人控制接口(RPC Server);

  • 环境层:模拟器(LIBERO-Pro、RoboCasa、RoboTwin)和真实世界(Franka、双臂、SO-101)。

RPent支持多种VLA后端(π₀.₅、RLDX-1、LingBot-VLA)和多种Planner,并已在2026年8月扩展了非推理模式(执行时间降低约40%)、LIBERO探索模式和RoboTwin双臂支持。


八、结语:做减法,而非做加法

Harness VLA 的核心命题可以归结为一句话:让 VLA 做更少,而非做更多。

论文将这一思路形式化为一个不对称分层框架(asymmetric hierarchical framework):冻结的 VLA 被压缩为单一原语接口 VLA_ACT,仅负责接触丰富的视觉运动控制;而运输、姿态调整、导航、释放等所有非接触结构,全部交由 LLM 驱动的 Planner 处理。实验结果表明,预训练 VLA 在被"隔离"到接触丰富阶段时最为有效;将语义绑定和空间推理从 VLA 中抽象出来,恰恰防止了单体式端到端策略常见的灾难性失败。

这一设计的深层价值,在于它回应了物理智能落地的一个根本矛盾:我们既需要神经网络在接触控制上的精细度,又需要符号系统在推理和组合上的可靠性。 Harness VLA 没有试图在一个模型内部调和这对矛盾,而是通过清晰的接口将它们分离开来——VLA 负责"手感",Planner 负责"头脑",记忆系统负责"经验"。三者通过可审计的 JSON 原语调用和语言形式的规则进行交互,使得整个系统的决策过程对人类透明。

从更广阔的视角看,Harness VLA 触及了一个正在浮现的普遍问题:在大模型时代,"如何使用预训练模型"正在变得与"如何训练更好的模型"同等重要。 当 VLA 已经在特定分布内达到 95% 以上的成功率时,继续堆砌数据和算力带来的边际收益正在递减;而学会在正确的时间、正确的地点、以正确的方式调用它,反而能释放更大的价值。这种"组合优于创造"的思路,或许不仅适用于机器人操作,也适用于任何需要将强大但脆弱的预训练模型部署到开放世界的场景。

当然,Harness VLA 并非终点。论文在 Limitations 中坦诚地指出了三个关键缺口:Planner 与 VLA 之间仍是开环反馈,缺乏通过环境奖励进行联合微调的机制;细粒度图像描述能力的缺失限制了系统在高度杂乱、长程任务中的结构推理;固定词汇表在面对真正陌生的抽象时可能显得不足。作者提出的未来方向极具启发性——将 Harness VLA 的固定词汇表组合策略与 ASPIRE 等自动技能发现系统结合:当重复的原语组合暴露出一个缺失的抽象时,Agent 可以提出、验证并接纳一个新的可复用技能,同时保留可审计的接口和 VLA 支持的接触专业化。

这意味着,Harness VLA 的真正遗产或许不在于它解决了多少 benchmark 任务,而在于它提出了一种可扩展的协作框架:预训练模型提供能力基座,记忆系统沉淀使用经验,Planner 负责动态编排——三者各司其职,又彼此增强。在通往可信赖具身智能的道路上,这种"做减法"的智慧——明确边界、分工协作、白盒审计——可能比任何单一的技术突破都更为根本。

冻结的 VLA 不是终点,而是一个更可靠的起点。


📎 相关资源

  • Harness VLA 论文:https://arxiv.org/abs/2607.08448,arXiv:2607.08448v3,2026

  • Harness VLA 项目页:https://harnessvla.github.io/

  • RPent 代码仓库:https://github.com/RLinf/RPent

创作不易,禁止抄袭,转载请附上原文标题和链接

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐