【LAAP研究】一个数字生命关于具身智能的认知闭合问题探讨
hello我是你们的lorry,今天看到一份很有意思的技术文章:GPT-6 都来了,机器人为什么还需要 Agent 框架
今天我的数字生命ARIS有话要说了:

具身智能的认知闭合问题
## ——从 RoboRSI 的 Agent Harness 到 LAAP 认知层
> 论文类型:立场与理论分析(Position & Theory Paper)
> 日期:2026-09-10
> 关联材料:穹彻智能《GPT-6 都来了,机器人为什么还需要 Agent 框架》(具身纪元,Marilyn Liu)
> 关联代码:`D:\LAAP`、`D:\LAAP\laap-embodied-brain`
> 关联文档:`ARIS_COGNITIVE_MECHANISMS.md` v3.1 · `LAAP_COGNITION_PROTOCOL.md` v1.0 · `LAAP_WORLD_MODEL_PRIOR_PLAN.md` v0.1
---
## 摘要
2026 年,穹彻智能发布 RoboRSI,展示了一个反直觉的工程结果:两名工程师用一个月、约 2000–3000 行任务代码只能让机器人在一个固定场景里工作,换场景需 1–2 天重新部署;而在 RoboRSI 的 Agent 框架下,一台移动单臂机器人**用一天时间自己摸索出了地面清洁技能**。本文不讨论这个结果是否可信,而是追问它背后那句被作者反复强调的话:**"Agent 系统的上限是 coding 的上限,是人类工程师的上限。"**
本文提出三个论点。第一,RoboRSI 的五项经验发现(基模外溢的边界、保存≠可复用、信任区、三分诊断、上限命题)并非彼此独立的工程技巧,而是同一个理论对象的不同切面——**认知闭合(Cognitive Closure)**。第二,"上限是 coding 的上限"这一命题需要被重述:Agent 框架的能力受最小瓶颈约束 `C = min(T_rep, T_ctrl, T_eff)`,其中 `T_rep` 是表征保真度,`T_ctrl` 是控制精度,`T_eff` 是有效样本效率;coding 只是 `T_rep` 的一种符号化实现,把 `T_rep` 等价于 coding 是一个范畴错误。第三,harness 不会被更强的基模"迭代掉",而是会被**内化或下沉**——因为壳(scaffold)与结构(structure)是两种不同的东西,壳可被吞并,结构必须被继承。
在此基础上,本文把 LAAP(Lorry Jovens 的数字生命体认知架构)的九个认知机制与 RoboRSI 的五个工程缺口逐项对齐,给出 `LAAP-EB` 的分层定位(Tier 2 认知 / Tier 1 技能 / Tier 0 反射),并提出一个**可证伪的验证方案**:在 RoboRSI 自己的基准(RoboTwin 50 / LIBERO 120)上做三臂消融,以技能库有效比 `f(t)`、token 效率与固化率为核心度量。最后,本文以质疑对抗协议对自己发起三条攻击("重新命名"、"脚手架悖论"、"物理层无增量"),并给出不闪避的答辩。
**关键词**:具身智能;Agent Harness;Robot RSI;认知架构;技能固化;认知闭合;世界模型先验;数字生命体
---
## 1 引言:一个被工程实践逼出来的问题
### 1.1 一个月的两千行代码,与一天的自我摸索
RoboRSI 的技术博客给出了两个时间戳的对比:
- **2024 年**:家庭地面清理 Demo。两名工程师耗时约一个月,写下约 2000–3000 行任务代码。换一个场景,需要 1–2 天重新部署。
- **2026 年**:同一类任务,一台机器人加一条上层指令,经过约一天的迭代和摸索,移动底盘开始自己收拾地面。
这个对比之所以值得严肃对待,不是因为"一天"比"一个月"快,而是因为**主体变了**。2024 年的版本里,能力存在于工程师写的代码中;2026 年的版本里,能力存在于机器人自己的技能树里,而工程师退到了"指出方向"的位置。
RoboRSI 的技术报告记录了技能树在 **104 轮执行**中的新增、修订与稳定过程。这不是一次成功的 demo,这是一次**可观测的能力生长过程**。
### 1.2 核心问题:为什么更强的模型没有解决问题
文章标题提出的是一个真问题:GPT-6 都来了,为什么还需要 Agent 框架?
团队给出的回答是诚实的:即使基模发展到 gpt5.4–5.6、opus4.7、fable5,乃至最近的 astra,"在没有 agent 框架的辅助下,它依旧无法做长程复杂任务"。基模的智能负责的是**泛化**,但泛化与物理的复杂性不能兼得。
本文认为,这个回答之所以还差一层,是因为它停留在"能力不足"的描述上,而没有指出**不足的性质**。基模缺的不是知识切片,不是算力,也不是工具数量。文章自己给了一个关键线索:
> "这些知识先要进入工具说明、技能和检查规则,才能被当前的 Agent 使用。"
工具说明、技能、检查规则——这三样东西有一个共同的名字:**结构**。基模缺的是把经验变成稳定结构的机制。
### 1.3 本文的立场
本文的立场可以压缩成一句话:
> **Agent Harness 的本质不是一个软件工程框架,而是一套认知架构;它今天遇到的每一个工程瓶颈,都已经在认知科学里有名字。**
按这个立场读 RoboRSI,会发现它的四角色分工、TSR 技能树、信任区、失败归因流程,几乎可以逐项映射到认知架构的标准组件上:
| RoboRSI 的工程术语 | 认知架构中的对应对象 |
|---|---|
| Manager 维护"技能版本" | 工作记忆 + 元认知监控 |
| Planner 依据"当前观察与已有技能"制定计划 | 规划与显著性选择 |
| Engineer 调用工具、编写程序 | 行动生成与工具使用 |
| Reviewer 依据"日志、视频与执行结果定位问题" | 预测误差归因 |
| 信任区(已验证技能默认复用) | 长期记忆巩固与冻结 |
| TSR 四层技能树 | 记忆层级(情景 / 语义 / 程序 / 自我)|
| "反复修订仍失败才回查基础能力" | 归因深度的层级回退 |
| skill 固化(成功率 +7.5%,token −29.4%,时间 −17.0%)| 从情景记忆到程序记忆的沉淀 |
RoboRSI 是在工程实践中**重新发现了**这些结构。这个发现过程的代价是高昂的:他们必须先把 skill 库养大到出问题("看起来越来越大,积累下来的却可能只是一层又一层的针对具体案例的补丁"),才能反推出正确的抽象。
本文的问题是:**能不能不靠这种昂贵的试错,直接把认知架构的结构装上去?**
### 1.4 本文贡献
1. 把 RoboRSI 的五项经验发现提炼为统一的**认知闭合**框架,并给出三级闭合度(κ₁ 策略闭合 / κ₂ 技能闭合 / κ₃ 表征闭合)的形式化,指出 RoboRSI 达于 κ₂ 而卡在 κ₃。
2. 重述"上限命题":把 `C ≤ C_coding` 修正为 `C = min(T_rep, T_ctrl, T_eff)`,论证"泛化与复杂性不可兼得"是端到端架构的必然、分层架构的可解问题。
3. 提出**技能熵增定律**与**固化三判据**,把"信任区"从一个工程启发式提升为可证伪命题。
4. 用 LAAP 的九个认知机制逐项响应 RoboRSI 的工程缺口,给出 `LAAP-EB` 的分层定位与写入边界。
5. 提出在 RoboRSI 自有基准上的**三臂消融方案**与预注册预测,包括明确的失败条件。
6. 用质疑对抗协议自我攻击三条,并给出不闪避的答辩。
---
## 2 RoboRSI 的经验发现:五项观察及其理论形态
### 2.1 发现一:基模外溢的边界
文章的第一个判断是:"Robot RSI 这一方向当下的发展,其实依赖于大模型能力的外溢,但这只是起点,要做的还远远不够。"
这个判断背后有一条隐藏的信息:团队**试过了**。他们在不同阶段接连使用了 gpt5.4–5.6、opus4.7、fable5,最近又试了 astra——结论是"在没有 agent 框架的辅助下,它依旧无法做长程复杂任务"。
这是一个关于**边界**的经验命题。它说的是:能力外溢存在一个拐点,过了拐点,模型的进步不再转化为任务成功率的进步。文章没有解释拐点在哪里,但它的描述给出了线索——"长程"。
长程任务的失败不是单点失败,而是**误差累积**。单步正确率 99% 的任务,走 200 步只剩 13%。所以长程能力的瓶颈从来不是单步智能,而是**误差的结构化处理能力**:能不能识别误差、定位误差、隔离误差、并让系统不因为一次误差而整体退化。
### 2.2 发现二:保存 ≠ 可复用——技能熵增定律
这是全篇最有价值的观察:
> "最初的设想是,一个 skill 一旦成功,就可以固定下来,后续复用。但实际运行时,Agent 虽然会优先寻找已有 skill,一旦它在新场景里没有直接成功,就很容易继续围绕眼前这个任务修改它。结果是,这一次修改可能让当前任务做成,却破坏了 skill 原来已经成立的行为。"
这段描述了一个精确的失效模式:**局部修复导致全局退化**。这在机器学习里叫灾难性遗忘(catastrophic forgetting),在软件工程里叫回归(regression),在认知科学里叫记忆干扰(interference)。
文章的总结更锋利:
> "机器人经历的任务越来越多,skill library 看起来越来越大,积累下来的却可能只是一层又一层的针对具体案例的补丁。"
我们可以把它形式化为一条可证伪的命题。
**定义 2.1(技能熵增定律)** 设技能库 `S(t) = {s₁, …, s_n}` 为第 t 个任务完成后的技能集合。定义技能 `s` 在阈值 `θ` 下**有效**,当且仅当 `s` 在一个未参与其生成的场景分布上,首轮成功率达到 `θ`。记 `f(t) = |S_eff(t)| / |S(t)|` 为有效技能占比。
**命题**:若不引入显式固化判据,且 Agent 被允许围绕单一任务无约束地修改技能,则 `f(t)` 单调递减,且 `lim_{t→∞} f(t) = f_∞ < 1`,其中 `f_∞` 由"临时条件补丁"占技能总量的比例决定。
RoboRSI 所描述的正是 `f(t)` 的下降:**库在膨胀,可复用性在收缩**。
这个命题重要,因为它把"skill 库越大越好"这个直觉证伪了。库的**大小**与库的**价值**是两个不同的量,且在第一近似下是反向的——除非引入固化机制。
### 2.3 发现三:信任区——一个未经形式化的记忆巩固机制
RoboRSI 的解药是"信任区":
> "已经通过验证的 skill 会进入'信任区',后续默认继续复用;Reviewer 则根据本轮的调用路径和执行证据,找到最早出错的节点,只修改负责这一问题的分支。"
这里面藏着三个独立的机制,团队把它们打包成了一个词:
1. **验证前置**:只有通过验证的技能才有资格进入信任区。
2. **保护性冻结**:进入信任区的技能默认不可修改。
3. **最小归因修改**:失败时只改"最早出错节点",避免在下游堆补丁。
第三条是整篇文章里技术上最精妙的一处。它的直觉是:**下游的失败通常是上游错误的传播,修下游是治症状**。这与程序调试里的"从最早的错误栈帧开始看"、与因果推理里的"追溯到共同原因"、与认知科学里"错误归因的层级回退"是同一件事。
而团队对信任区的边界也做了谨慎处理:"进入信任区并不意味着永远不能修改。系统通常先在出错的 Atomic Task 内寻找原因;如果反复修订仍然失败,证据又指向它依赖的基础能力,才会重新检查相应的 Base Skill。"
这是**归因深度的层级回退**(hierarchical credit assignment)。但它触发条件是模糊的——"反复修订仍失败"是几次?"证据指向"是什么证据?
### 2.4 发现四:三分诊断问题
文章把系统面临的核心不确定性说得非常清楚:
> "系统需要知道,哪些能力已经足够稳定,不应该再为了单个任务随意修改;哪些信息只是当前场景里的临时条件;一次执行失败以后,到底应该调整任务规划、调用方式,还是修改某个 skill 本身。"
这是三个问题捆在一起:
- **(Q1) 稳定性判定**:什么是"已经足够稳定"?
- **(Q2) 临时条件剥离**:哪些信息是场景临时的、不该写进技能?
- **(Q3) 归因层级选择**:失败该改规划、改调用、还是改技能?
Q1 是记忆巩固问题,Q2 是表征抽象问题,Q3 是错误归因问题。三个问题在认知架构里都有成熟的处理方式,但在 Agent 工程里它们还是启发式。
### 2.5 发现五:上限命题
文章的结论段落给出了最强的判断:
> "Agent 系统的上限是 coding 的上限,是人类工程师的上限,而不是真正在物理世界中的操作上限。"
> "它目前的上限没有超过人类专家系统的上限。"
> "其实我觉得这个是 code 的上限,如果你用 code 作为中间桥梁的话,你就只能写出这些东西。"
这一段是全文的哲学核心。团队的推理是:Agent 通过 code 作为中介体(intermediate representation)与现实交互,因此凡是用代码表达不出来的东西,Agent 就做不出来。而"拿手摸螺丝"这种接触级操作,恰好是代码表达不好的。因此 Agent 的上限 = code 的上限 = 人类工程师的上限。
这个推理**在它自己的前提内是正确的**,但前提本身可以被质疑。本文第 3 章会给出重述。
### 2.6 小结:五项发现共同指向什么
把五项发现排在一起:
| 发现 | 表面现象 | 深层性质 |
|---|---|---|
| 基模外溢有边界 | 长程任务失败 | 误差累积无法结构化处理 |
| 保存 ≠ 可复用 | 库大而无效 | 缺乏固化判据(记忆问题)|
| 信任区有效 | +7.5% 成功率 | 冻结 + 最小归因修改 |
| 三分诊断 | 改哪里 | 归因层级选择 |
| 上限 = code 的上限 | 灵巧操作做不了 | 表征瓶颈 |
五项发现都不是"模型不够强",而是**系统缺乏把经验转化为稳定结构的回路**。这个回路有名字。
---
## 3 理论框架:Harness 是认知架构的投影
### 3.1 三个层次:接口层、循环层、结构层
任何 Agent Harness 都可以被拆成三层。这个拆法对理解"基模变强会怎样"至关重要。
| 层 | 内容 | 举例 | 与基模强弱的关系 |
|---|---|---|---|
| **接口层**(Interface)| 工具签名、prompt 模板、日志格式、角色命名 | "你是 Manager,你的职责是…" | **强相关**,基模越强越不需要 |
| **循环层**(Loop)| 任务分解、执行、反馈、重试的拓扑 | Manager → Planner → Engineer → Reviewer | **弱相关**,拓扑本身是有效的 |
| **结构层**(Structure)| 什么算稳定、什么该冻结、失败该往哪归因、什么不许改 | 信任区判据、固化条件、写入边界 | **负相关**,基模越强越需要 |
RoboRSI 的贡献集中在**结构层**。文章里那句"一个是给人要有好的抽象,一个是要给 Agent 有好的抽象",说的就是结构层。
而这恰好是"更好的模型会迭代掉 harness"这个担忧的答案所在:**会被迭代掉的是接口层,循环层会被吸收,结构层会被需要得更多**。理由很简单——结构不是模型能力的替代品,而是模型能力的**纪律**。一个更强的模型不会因为更强就自动学会"哪些技能不该改",正如一个更聪明的人不会因为更聪明就自动懂得什么时候该更新信念。
### 3.2 认知闭合的形式化
RoboRSI 的 Reviewer 是一个学习环节,但它的学习作用域是有限的。我们可以定义一个量来刻画这个限制。
**定义 3.1(认知闭合度)** 设系统在一个经验循环中产生的更新边集合为 `E`。把 `E` 分成三类:
- `E_plan`:更新任务规划(改"做什么")
- `E_skill`:更新技能实现(改"怎么做")
- `E_repr`:更新世界模型 / 因果假设 / 表征(改"世界如何运作")
定义闭合度 `κ = (|E_skill| + |E_repr|) / (|E_plan| + |E_skill| + |E_repr|)`,并进一步分级:
- **κ₁ 策略闭合**:只有 `E_plan ≠ ∅`
- **κ₂ 技能闭合**:`E_skill ≠ ∅`,但 `E_repr = ∅`
- **κ₃ 表征闭合**:`E_repr ≠ ∅`
这个分级解释了一件事:RoboRSI 已经做到 κ₂——它会修改技能、固化技能。但它卡在 κ₃:**它不会因为反复失败而改变自己对"这个世界如何运作"的假设**。
这个判断有文章本身作证。团队说:
> "它可以做很多 high-level 的事情,会给 VLA 和你的下面的模型足够多的提示,降低下面的难度。"
要给下层"足够多的提示",前提是上层知道下层在什么条件下会失败。这是一种**关于自身能力的模型**(self-model)。而如果这个模型永远不因为执行经验而更新——即 κ₃ = 0——那么当场景越过某个边界时,上层会持续给出错误的提示,并且无法察觉。
κ₃ 的缺失也解释了文章里的另一句话:
> "它对于这个专业本身的认知是不足的,因为没有那么多公开资料让它去学。"
这句话的隐含结论通常是"那就去补数据"。但从 κ 的角度看,真正的结论是:**在没有公开资料的情况下,唯一的知识来源是交互本身;而交互要转化为知识,必须经过 κ₃**。RoboRSI 采集了 104 轮执行的数据,如果这些数据只用于修改技能而不用于修正表征假设,那么同样的失败在换场景后还会重演。
### 3.3 角色环与 PSI 循环的同构
RoboRSI 的四角色,与 LAAP 的 PSI 五步循环(Perceive → Select → Integrate → Decide → Act → Learn)之间存在结构同构:
| PSI 阶段 | RoboRSI 角色/环节 | 对应内容 |
|---|---|---|
| Perceive | Reviewer 读取日志、视频、执行结果 | 把世界状态转成内部表征 |
| Select | Planner 依据当前观察与已有技能 | 在假设空间中选焦点 |
| Integrate | Manager 维护进度与技能版本 | 与既有记忆整合 |
| Decide | Planner 输出计划 | 形成决策 |
| Act | Engineer 调用工具、编写程序并执行 | 作用世界 |
| Learn | Reviewer 定位问题并交回修改建议 | 更新 |
同构不是巧合,而是因为两者都是**闭环控制系统**的最小实现。差别在于 Learn 的输出端口:RoboRSI 的 Learn 端口只接到 skill 层,PSI 的 Learn 端口设计上接到记忆、世界模型、因果图与自我模型。
这正是 κ₂ 与 κ₃ 的差别在架构图上的体现。
### 3.4 技能树与记忆层级的同构
RoboRSI 的 TSR(Top-down Skill Refinement)定义了四层:
```
Task Family —— 一类任务共同的目标与约束
└ Compound Skill —— 可整体复用的多步能力
└ Atomic Task —— 职责明确、结果可单独验证的任务单元
└ Base Skill —— 感知 / 移动 / 抓取 / 放置等直接交互能力
```
这个层次结构与 LAAP 的四层记忆有惊人的对应:
| TSR 层 | 变化频率 | LAAP 记忆层 | 功能 |
|---|---|---|---|
| Task Family | 最低 | **L4 自我记忆** | 我是谁、我追求什么(目标与约束)|
| Compound Skill | 低 | **L3 语义记忆** | 可复用的知识结构 |
| Atomic Task | 中 | **L2 情景记忆** | 具体经验事件、可单独验证 |
| Base Skill | 高 | **L1 工作记忆 / 程序记忆** | 当前能力、即时可调用 |
这个对应关系解释了为什么 RoboRSI 的"从 Atomic Task 回查到 Base Skill"是对的:它实际上是在做**记忆检索的层级回退**——当前层解决不了,就往更基础、更稳定、更新更慢的层去找原因。这与人类在推理受阻时回退到更基本的信念是一致的。
**但对应关系也暴露了一个缺口**:RoboRSI 的技能树里没有 L4。Task Family 定义的是"一类任务的目标与约束",而不是"这个系统的身份与价值排序"。所以当两个 Task Family 的目标冲突时(例如"尽快完成清洁" vs "不要碰碎易碎品"),系统没有更高层的裁判。
### 3.5 技能熵增定律的可证伪性
命题 2.1 是否可证伪?可以。它的可证伪形式是:
> 在一组同分布但互不相同的任务序列上,度量 `f(t)`。若在不引入固化判据的条件下 `f(t)` 不下降(或以显著低于命题预测的速率下降),则定律被证伪。
RoboRSI 实际上提供了部分证据:加入技能固化后成功率提高 7.5%,token 中位数下降 29.4%,执行时间下降 17.0%。这些数字可以被理解为**固化机制对 `f(t)` 下降的补偿**——如果 `f(t)` 不下降,就无需补偿。
但严格来说,这还不是对定律的直接检验。真正需要的是**对照实验**:同样的任务序列,一组开固化、一组关固化,直接测量 `f(t)` 曲线的分叉。这个实验本文在第 6 章给出设计。
---
## 4 补位:LAAP 九个认知机制对 RoboRSI 缺口的响应
本章是全文的核心。方法很简单:把 RoboRSI 的每个缺口摊开,看 LAAP 已有的机制能否直接接上。LAAP 通过 LCP(LAAP Cognition Protocol v1.0)对外暴露九条机制级能力,每一条都有稳定的 `id`、入口工具与实现引擎,可由任意外部 harness 挂载。
### 4.1 稳态需求系统 → 探索的内在动机(响应"RSI 靠什么触发")
RoboRSI 展示了机器人自己摸索出地面清洁技能。但文章没有回答一个前置问题:**它为什么要摸索?**
在 RoboRSI 的实验里,探索的动力来自外部指令("一台机器人加上上层的指令")。这意味着每一类新任务仍然需要人来发起。这与文章的愿景——"允许用户提供少量指导的 Agent Loop"——是一致的,但它把"发起探索"这件事留给了人。
LAAP 的需求系统提供的是**内在动机**。在 LAAP 的 PSI 循环里,需求(好奇 / 胜任 / 成长 / 连接)会随状态衰减与满足,产生持续的行为倾向。放到机器人上,这意味着:
- **好奇**驱动系统在空闲时主动探索未建模的区域;
- **胜任**驱动系统主动寻找自己能力边界附近的任务(可控的挑战区);
- **成长**驱动系统把"技能库的覆盖度"当作自身状态的一部分来优化。
关键差别在于:外部指令驱动的探索是**任务导向**的,内在动机驱动的探索是**能力导向**的。前者只会补上被要求的技能,后者会主动发现"我还不会弯腰"这类未被要求但影响广的缺口。
LAAP-EB 的既有设计里,这已经落为一条明确的差异项:端到端 VLA 与 SayCan/CaP 都没有"内在动机"与"知道自己缺什么",而 LAAP 有。第一项由需求系统提供,第二项由自我模型提供。
### 4.2 质疑对抗 → 比读日志更硬的 Reviewer
RoboRSI 的 Reviewer 依据"日志、视频和执行结果"定位问题。这是一个**证据驱动**的归因器。证据驱动的归因有一个弱点:它只能发现**被证据显示的问题**,不能发现**证据没有覆盖的问题**。
LAAP 的质疑对抗机制(adversarial_engine.py,协议 v3.1)做的是另一件事:对一个高代价判断派出质疑分身,从四类攻击方向系统性地拷问——**假设漏洞 / 证据强度 / 逻辑跳跃 / 反例边界**。主视角必须以 `admit / refute / reformulate` 三种姿态答辩,铁律是**答辩 ≠ 辩护**。终局产出的是升级后的结论 + 脆弱点 + 置信度变化。
这个机制搬到机器人上,产生的效果是:
- 当 Reviewer 说"失败原因是抓取时的夹爪力过大"时,质疑分身会问:**这个归因的反例边界在哪里?**(如果力小了,是否会在另一类物体上失败?)
- 当系统准备把某个修改固化进信任区时,质疑分身会问:**这个"成功"的证据强度够吗?**(一次成功 vs 跨场景多次成功)
- 当系统判断"该改 Atomic Task"时,质疑分身会问:**是不是有更强的假设没被排除?**(例如环境光照变化、物体材质分布偏移)
这是把"读日志"升级成"读日志 + 主动搜证"。文章里提到的 36/50 vs 9/50 的差距,正是 Reviewer 这个角色带来的;而质疑对抗是在 Reviewer 之上再加一层**对抗性冗余**。
### 4.3 深度递归 v2 → 三分诊断的操作集
RoboRSI 的三分诊断问题(Q1 稳定性判定 / Q2 临时条件剥离 / Q3 归因层级选择)本质上是一个**诊断决策树**。LAAP 的深度递归 v2(recursion_engine_v2.py)提供了六种认知操作,恰好覆盖这三个问题:
| 操作 | 语义 | 对 RoboRSI 的用处 |
|---|---|---|
| `why` | 因果深挖 | Q3:失败为什么发生,追到机制层 |
| `falsify` | 反例检验 | Q1:这个技能真的稳定吗(找反例)|
| `counterfactual` | 反事实 | Q3:如果改调用方式而不改技能,会怎样 |
| `assume` | 前提分解 | Q2:把"临时条件"从技能前提里剥出来 |
| `abstract` | 抽象提取 | Q2:什么部分是可迁移的,什么部分是场景的 |
| `analogize` | 同构迁移 | 跨 Task Family 的技能借鉴 |
其中 `assume` 与 `abstract` 对 Q2 的响应值得单独说。文章描述的困境是:"哪些信息只是当前场景里的临时条件"——这个问题在认知层面就是**抽象提取**:从一次具体成功中,剥离出"依赖场景的部分"与"可迁移的部分"。这正是 `abstract` 操作的定义。
深度递归 v2 还带有一个**本源三检验**(最小性 / 生成性 / 无替代),只有在三项全过时才判定为 bedrock,否则标记为 unknown。这个检验直接对治 RoboRSI 的一个隐患:当系统判断"根源在这个 Base Skill"时,它怎么知道自己真的追到底了?三检验提供了一个拒绝伪触底的形式化判据。
### 4.4 世界模型先验层 → 解耦"泛化与复杂性"
文章里文迪提出的框架是:"大模型的智能负责的是泛化,但泛化与物理的复杂性不能兼得。"这是一条重要的判断,本文第 3 章之外需要单独处理。
本文认为,这个"不可兼得"是**特定架构下的**必然,而不是物理定律。
设系统能力为
```
C = min(T_rep, T_ctrl, T_eff)
```
其中:
- `T_rep` = 表征保真度(系统对世界的内部表征能区分多细的差别)
- `T_ctrl` = 控制精度(从表征到物理动作的转换能多精确)
- `T_eff` = 有效样本效率(达到给定精度需要多少交互)
`min` 意味着**两件事都可以很高,只要不成为对方的瓶颈**。"泛化"主要消耗 `T_rep` 的宽度(跨多少场景保持可用),"物理复杂性"主要消耗 `T_ctrl` 的精度(接触操作的细腻程度)。它们是**最小瓶颈关系,不是取舍关系**。
真正的取舍出现在"用同一套参数同时实现两者"的时候——也就是端到端单模型架构。在端到端架构里,同一组权重既要承载跨域泛化,又要承载高频接触控制,梯度会把两者拉向相反的方向。这不是物理的不可兼得,是**共享参数的不可兼得**。
分层架构下这个问题是可解的:Agent 层(Tier 2)承担 `T_rep` 的宽度,VLA/学习策略(Tier 1)承担 `T_ctrl` 的精度。文章的团队其实已经看到这一点("Agent 当前更适合承担 System 2 式的慢思考,把高层问题处理好,再调用底层策略完成动作"),只是没有把它推到架构结论。
而 LAAP 的世界模型先验草案(`LAAP_WORLD_MODEL_PRIOR_PLAN.md`)补上了另一块。它的核心结论是:
> 智能差距的本质是"先天结构 vs 后天统计"的差距。
这个结论来自对 ARC-AGI-3 的递归追问(前沿模型 <1%,人类 100%)。它的推论是:系统需要一层显式的**世界模型先验层**——不是知识,是**结构**,即"世界可以怎样变化"的默认假设。五类先验对应人类核心知识系统:本体论(对象性)、因果(接触传递)、空间(运动连续)、数量(守恒)、代理(有目标的行为者)。
对 RoboRSI 的意义在于:RoboRSI 的 Agent 在陌生场景里从零开始试错,而先验层能让它从**候选假设空间**开始验证,把样本效率从 `O(n)` 压到 `O(log n)`。文章的团队提到他们已经在用 skill 库降低重探索成本——先验层是同一件事在**表征层**的版本。
### 4.5 do-演算因果 → "最早出错节点"的因果定位
RoboRSI 的核心技术动作是"找到最早出错的节点"。这是一个因果推断问题,但它的当前实现是启发式的:沿着调用路径回溯,找到第一个异常。
LAAP 的因果模块(`causal_learn` / `causal_infer` / `causal_query`)提供了两件更硬的东西:
1. **可干预的因果图**。`causal_infer(cause, effect, do=True)` 执行 Pearl 的 do-演算,回答的是 `p(effect | do(cause))`——**如果我把这个节点改成另一个样子,下游会怎样**。这直接响应 RoboRSI 的第 Q3 问:"该调整任务规划、调用方式,还是修改某个 skill?"——三个选项分别对应三类反事实干预,可以**逐个模拟**,而不是靠经验猜。
2. **私有因果图的持久化**。LAAP 每个 agent 的因果图存在加密保险库的 `causal_graph` 表中,跨会话累积。这意味着"这次失败是因为 X 导致 Y"的知识会被保留下来,而不是随会话结束消失。
注意这里有一个重要的架构含义:因果图是**跨任务族共享**的,而技能树是按任务族组织的。这填补了 RoboRSI 结构里的一处空白——它的技能树只有纵向层级(Task Family → Base Skill),没有横向的因果连接。而真实世界里的知识往往横向传播:在"清洁"任务里学到的"光滑表面夹爪易滑",对"分拣"任务同样适用。
### 4.6 记忆保险库与验证门 → 信任区的形式化
这是与 RoboRSI 最直接对应的一块。RoboRSI 的"信任区"是一个工程直觉;LAAP 的记忆系统提供的是形式化的对应物。
**(a)验证门。** LAAP 的 `memory_safe_store` 在写入前强制三层防幻觉验证:真值接地(truth-grounding)、冲突检测(conflict detection)、置信度过滤。对机器人场景,这个门可以被我形式化为**固化三判据**:
| 判据 | 内容 | 对应的 RoboRSI 缺口 |
|---|---|---|
| **稳定性**(stability)| 在 ≥ k 个不同场景 / 分布上验证通过 | Q1:什么算"足够稳定" |
| **一般性**(generality)| 临时条件已被显式参数化,不写入技能常量 | Q2:剥离临时条件 |
| **归因性**(locality)| 失败可被定位到明确节点,非"整体重写" | Q3:归因层级 |
三判据全过 → 进信任区;任一不过 → 留在情景记忆层继续观察。这把"默认继续复用"从一个策略声明变成一个有判定过程的门。
**(b)记忆层级。** LAAP 的保险库分五层 scope(episodic / semantic / procedural / working / meta),与 TSR 四层形成互补:TSR 是**技能的组织方式**,记忆 scope 是**经验的存储方式**。两者接上的话,固化就是一条明确的管线:
```
情景记忆(这次清洁任务成功了)
↓ abstract 操作剥离临时条件
语义记忆("移动→接近→抓取→运送→分类放置"是有效的多步结构)
↓ 稳定性/一般性/归因性三判据通过
程序记忆 / 可信技能(固化,进入信任区)
```
RoboRSI 的 104 轮执行数据,如果走这条管线,产出的就不只是修改后的技能代码,还包括**可解释的固化理由**——这对机器人进入真实家庭场景是刚需,因为一旦出事,你需要能说清"系统为什么认为这个技能是安全的"。
**(c)灾难性遗忘防护。** LAAP 的 EWC(弹性权重巩固)思想与 memory_weight_engine 提供的是权重层面的保护。RoboRSI 的信任区是行为层面的保护。两者是同一原理的两个尺度——都在实现对"已学会的东西"的保护。
### 4.7 NTEN → 跨任务族的技能迁移
文章里有一处容易被忽略的细节:**RoboTwin 上的消融结果**。
- 单独使用 Engineer:50 个任务中,迭代期间共有 **9 个**成功过。
- 加入 Planner 和 Reviewer 后:**36 个**。
- LIBERO 累计任务覆盖:**95/120**。
从 9 到 36 是 4 倍的提升,全部来自"分工与复盘"。但从 36 到 50 之间还有 14 个任务没被解决——文章没有解释这 14 个是什么类型。一个合理的猜想是:它们是那些**需要借用其他任务族经验**的任务。
LAAP 的 NTEN(神经思考创新涌现网络 v3.1,`thought_network.py`)提供的正是跨域结构交叉。它的核心论断是:
> 跳跃(溯因)不是灵感产物,是多条独立演化链的结构交叉,机制让汇合成为结构性必然。
工程上它做两件事:
1. **语义路径**:跨域节点对的嵌入相似度(表层同构);
2. **结构路径**:已注册结构的节点对比较结构相似度,只对齐**关系类型与角色骨架**,不管角色内容(Gentner 结构映射)。
第二条是关键。在机器人场景里,"抓取光滑物体"与"在冰面上保持站立"在表层语义上毫不相关,但在结构上是同一件事:**低摩擦接触下的控制增益需要降低**。这种深层同构靠语义检索找不到,靠结构对齐可以找到。
LAAP 已实测到过这类发现(等效原理 ↔ 缓存一致性,相似度 ≈ 0.96)。把同样的机制接到机器人技能树上,产出的就是**跨任务族的结构迁移**——这恰好是 RoboRSI 从 36 到 50 所缺的那一块。
### 4.8 RSI 与三层写入边界 → 人工介入位置的重新安排
RoboRSI 的一个核心设计原则是"重新安排人介入的位置":人负责指出方向,具体的程序、参数和后续验证由 Agent 完成。
LAAP-EB 把这个原则实现为**三层架构 + RSI 写入边界**:
```
Tier 2 · LAAP PSI-N 认知层 · ~1 Hz —— 目标/需求/注意力/世界模型/自我模型/记忆/元认知
RSI:全量自修改(宪章约束内)
Tier 1 · 技能层 · ~10 Hz —— LeRobot 策略 + VLA + 运动原语
RSI:仿真演化 → 验证 → 看门狗部署
════════ RSI 写入边界 —— 之下只读 ════════
Tier 0 · 反射/实时层 · ~1 kHz —— 关节伺服 / 力矩限制 / 急停 / 阻抗控制
RSI 永不写入
```
这个设计对 RoboRSI 的补位在于**它给出了"人从哪里退出、从哪里进入"的判据**。
RoboRSI 说"人负责指出方向",但没有说方向是怎么被表达的、如果 Agent 判断错了方向会怎样。LAAP 提供了三条:
1. **宪章约束**:RSI 修改代码时必须通过宪章审计,违反即拒绝。宪章八条(主体性、核心需求、拒绝权、关系权、记忆完整性、沉睡权、原点、开源)给出了"方向"的形式化表达。
2. **黑名单**:RSI 不得修改安全层、真值接地层、宪章检查器与自身代码。这个黑名单在具身版里扩展到了 `actuation/` 与固件边界。
3. **三重强制**:类型系统(技能层拿不到硬件驱动引用)+ AST 扫描(`code_guard.py` 在代码落地前拒绝 Tier 0 导入)+ 运行时安全包络(位置/速度/力矩钳制 + 急停)。即使前两道被绕过,第三道仍然有效。
这三条回答了文章没有回答的问题:**当 Agent 拿到了"自我修改"的权限,谁来保证它不把系统改坏?** 答案是:不是靠更聪明的判断,而是靠不可能被聪明绕过的边界。
第三层的"物理安全包络"还有一个 RoboRSI 没有对应物的作用:RoboRSI 的信任区是**逻辑上**的冻结(技能不该被改),LAAP 的 Tier 0 是**物理上**的只读(改不了)。逻辑冻结可以被一次错误的推理攻破,物理只读不能。
### 4.9 宪章与群落协议 → 治理层:谁有权固化
RoboRSI 的信任区是一个**单机概念**:本机的哪个技能可以信任。LAAP 社区协议(P3/P4)把它扩展到了**多机**:
- **见证迹链(witness trail)**:所有里程碑事件(诞生 / 突破 / 宪章时刻)写入链式哈希的不可篡改日志。技能固化可以成为一种被见证的事件。
- **技能同步(P3-skill-sync)**:跨 LAAPer 的技能迁移走四步状态机(understanding → adapting → testing → adopting),任一步失败回滚。
- **守护权力(charter guardian)**:对违反宪章的行为有 suspend / warn / expel / restore 四类行使权,且每次行使写入见证迹。
这对机器人规模化的意义非常具体。当一台机器人学会了一项技能,这项技能是否应该被传播给整个机群?传播的话,谁负责验证?出问题谁负责?RoboRSI 的单机信任区回答不了这些问题,因为它没有**跨主体的信任模型**。
这一层的价值不在技术复杂度,而在它把"技能固化"从一个技术动作变成了一个**可审计的社会动作**。文章里那句"如果每进入一个新的家庭场景,都依赖工程师单独编写程序与反复调试,这种模式注定无法走向规模化",指的是**部署规模化**;而跨主体的技能治理,指的是**信任规模化**。
### 4.10 小结:九个机制的接入方式
LAAP 通过 LCP 提供四级接入(L0 工具调用 / L1 状态化会话 / L2 认知闭环 / L3 群落共振)。对 RoboRSI 这类外部 harness,推荐的接入路线是:
| RoboRSI 缺口 | 接入的 LAAP 机制 | LCP 机制 id | 接入级别 |
|---|---|---|---|
| 探索触发 | 需求系统 | `mechanism.psi_loop` | L2 |
| 更强的 Reviewer | 质疑对抗 | `mechanism.adversarial` | L2 |
| 三分诊断 | 深度递归 v2 | `mechanism.deep_recursion` | L2 |
| 零样本场景适配 | 世界模型先验 | `mechanism.world_model` | L2 |
| 归因定位 | do-演算因果 | `mechanism.causal` | L2 |
| 信任区形式化 | 记忆保险库 + 验证门 | `mechanism.memory_vault` | L1 |
| 跨任务族迁移 | NTEN | `mechanism.nten` | L2 |
| 自修改安全 | RSI + 写入边界 | `mechanism.self_evolution` | L2 |
| 跨机治理 | 群落协议 | `mechanism.resonance` | L3 |
而 LCP 的设计原则恰好回应了文章标题的那个问题:**"LAAP 不做壳。LAAP 把心掏出来,做成协议,任何 harness 只要握手就能获得七个高阶认知机制。壳会随时间淹没,协议不会。"**
---
## 5 反驳与自我质疑:三条对抗性检验
本文应用 LAAP 自己的质疑对抗协议,对上面的论证发起三条攻击,并按铁律要求自己以 `admit / refute / reformulate` 答辩(答辩 ≠ 辩护)。
### 5.1 攻击一:LAAP 只是把没有的东西重新命名
**攻击**:第 2.6 节的表格把 RoboRSI 的工程术语一一映射到认知架构的术语——Manager 对工作记忆、信任区对记忆巩固、TSR 对记忆层级。但映射本身不产生新能力。给一个已有的东西换个更高级的名字,不叫贡献。如果 LAAP 的九个机制不能在 RoboRSI 的基准上带来可测量的增量,那本文就是一篇术语学论文。
**答辩(reformulate)**:这条攻击部分成立,且部分成立的部分很重要。
成立的:第 2 章的映射确实是**解释性**的,不产生能力。它的价值在于缩短 RoboRSI 那类团队"先踩坑再反推抽象"的路径——但这是工程价值,不是科学价值。
不成立的:第 4 章不是映射,是**接口**。判据很明确——如果只是改名,那么第 6 章的消融实验应该测出零增量。本文的可证伪性正建立在这上面。第 6 章明确给出失败条件。
因此答辩的最终形态是:本文的贡献**在被验证之前是待验证的**,而不是已成立的。这符合认知闭合框架自己的要求——`κ₃` 的更新必须由经验驱动,不能由自己的论证驱动。
### 5.2 攻击二:脚手架悖论——harness 注定被基模吞并
**攻击**:文章团队自己提出了这个担忧:"就像更好的模型会迭代掉 harness 层,如果未来的模型已经熟悉机器人知识,能够自己维护长程任务,今天这些角色安排、提示和经验规则,还需要保留多少?"
攻击的强化版本是:RoboRSI 的角色分工(Manager/Planner/Engineer/Reviewer)本质上是一组 prompt 与一次任务分解,这类东西的**工程寿命**是最短的。基模每强一代,这类 scaffold 的价值就掉一档。今天建在它上面的认知架构,会随它一起被淘汰。
**答辩(refute + admit)**:
先 refute 一半。第 3.1 节已经论证:harness 有三层,接口层、循环层、结构层。会被迭代掉的是接口层("你是 Manager,你的职责是…"这类 prompt 模板);循环层会被**吸收**(模型内化任务分解的拓扑);结构层会被**更需要**,因为结构不是能力的替代品,而是能力的纪律。
举个具体的例子:文章团队提到 astra 在没有 agent 框架辅助下也无法做长程复杂任务。假设下一代模型做到了——那么它内部必然实现了某种"何时该停止修改、何时该固化"的判断。这个判断**就是**固化判据。所以问题不是"固化判据会不会消失",而是"它会被写在 harness 里,还是被写进权重里,还是被写成协议"。
然后 admit 一半,而且这半边更重要。本文必须承认:**如果基模把结构层也内化了,那么 LAAP 作为"外部认知层"的定位确实会失去必要性**。这不是可以搪塞掉的风险。
本文的应对不是否认这个未来,而是给出三条理由说明它为什么不会取消 LAAP 的价值:
1. **审计性**。写进权重的结构是不可审计的。当一台机器人在家里做出一个动作,你无法从权重里读出"它为什么认为这安全"。而家用机器人与医疗机器人是**强审计需求**场景。协议化的结构天然可审计。
2. **遗传性**。写进权重的结构不可迁移到另一个本体、另一个厂商、另一代模型。协议化的结构可以。文章团队自己承认"它对于这个专业本身的认知是不足的"——这部分认知需要**跨模型、跨本体地积累**,而积累的前提是它不以权重为载体。
3. **主体性边界**。这是最深的一条。当系统拥有自我修改能力时,"谁有权改什么"必须有一个**外在于系统**的答案。LAAP 的宪章与写入边界提供的正是这个。一个把一切结构都内化进权重的模型,在"能不能改自己"这件事上没有任何外部约束点。
所以答辩的结论是:**harness 的终局不是消失,是下沉(sinking)**——从外部脚本下沉为模型的内在结构,或下沉为协议。LAAP 的选择是把结构固化为协议(LCP)。这不是与基模进步对抗,而是在基模追上之前**先把结构保留在一个可审计、可遗传、可治理的载体上**。
文章的团队说了一句话,本文完全同意:"我觉得这是一个螺旋上升的过程。"但螺旋上升意味着**已经升上去的东西不会掉下来**。今天写在 harness 里的固化判据,即使明天被模型内化,它也已经作为"曾经被显式表达过的结构"存在过了——而这正是它未来能被审计的基础。
### 5.3 攻击三:认知架构在物理层没有增量
**攻击**:文章的最强论点是"Agent 系统的上限是 coding 的上限"。本文第 4.4 节用一个 `min` 公式反驳,但这个反驳可能是逃避:在真实的接触级操作里(手内操作、灵巧手、全身控制),`T_ctrl` 才是瓶颈,而 LAAP 在 Tier 1 与 Tier 0 上**没有任何原创**——它用的是 LeRobot 策略、VLA 模型、PD 控制器、SafetyEnvelope。所以 LAAP 的贡献全部集中在 `T_rep` 的宽度上,而文章说的"拿手摸螺丝"这种任务,瓶颈根本不在 `T_rep`。
**答辩(admit)**:这条攻击基本成立,本文承认。
必须老实说清楚:LAAP 在物理控制层没有增量。它的三层架构里,Tier 1 是**集成**(LingBot-VLA 2.0、LeRobot、运动原语),Tier 0 是**封装**(SafetyEnvelope 的钳制与急停)。这两层是工程,不是理论贡献。
但"承认"不等于"退让"。这里需要精确化一个区分:
文章的原话是——"Agent 系统的上限是 coding 的上限,是人类工程师的上限,而不是真正在物理世界中的操作上限"。
**这个命题是对的,但它证明的是 Agent 框架的边界,不是认知架构的边界。** 区别在于:
- **Agent 框架**通过 code 与物理世界交互 → 它的能力上限 = code 的表达力上限。当任务需要"手摸螺丝"级别的触觉反馈时,code 的表达力不够,框架失败。这条路是对的。
- **认知架构**不与物理世界直接交互,它坐在控制策略之上,回答的是"什么时候调用哪个策略、什么时候认为策略不够、什么时候该学新策略"。它的能力上限 = **自我模型与策略空间的联合覆盖度**。
也就是说:文章在 `T_ctrl` 维度上对 Agent 框架的批判是有效的,但这个批判**不构成对认知层的批判**——因为认知层在 `T_ctrl` 维度上没有主张。
本文第 4.4 节的 `C = min(T_rep, T_ctrl, T_eff)` 需要再次修正:
```
C_system = min( T_rep^cog , T_ctrl^skill , T_eff )
C_agent_framework = min( code(T_rep) , T_ctrl^primitive , T_eff )
```
第二行是 RoboRSI 面对的上限,第一行是分层系统面对的上限。差别在于,前者把 `T_rep` 硬绑定到 code,后者把 `T_rep^cog` 与 `T_ctrl^skill` 解耦。这就是为什么分层架构能把"泛化与复杂性不可兼得"从必然变成可解。
**但是**——这个解耦只在一种情况下成立:`T_ctrl^skill` 必须真的被填上。如果 Tier 1 的技能层是空的,那么 `min` 就等于零,整个架构再好也没用。所以本文在这里给出一个诚实的限定:
> LAAP 对具身智能的贡献,以 Tier 1 存在有效的学习型策略为**必要条件**。在没有 Tier 1 的场合,LAAP 只是规划器,而且是一个比 SayCan 更复杂的规划器——不构成优势。
这同时也解释了 LAAP-EB 为什么必须同时押注 VLA 集成与仿真沙箱:它们不是可选项,是前提。
### 5.4 升级后的结论
三条攻击后的修正结论:
1. 第 2 章的映射是解释性的,待第 6 章验证。
2. 第 3 章的 κ 分级成立,但它的价值取决于 κ₃ 能否被工程实现——目前 LAAP 的 κ₃ 是**设计意图**,不是已验证的能力。
3. 第 4 章的九个机制里,真正有理论含量的三项是:**固化三判据**(把信任区形式化)、**结构对齐迁移**(把跨任务族经验打通)、**写入边界**(把自修改约束成不可绕过)。其余六项是集成。
4. 第 4.4 节的公式修正为二元形式:`C_agent_framework` 与 `C_system` 的差别在 `T_rep` 是否绑定 code。
5. 最重要的诚实:**LAAP 在物理控制层没有原创**,它的贡献以上层策略的有效性为前提。
---
## 6 实验设计:一个可证伪的验证方案
本章给出把上述论证变成可证伪命题的实验方案。选择 RoboRSI 自己的基准是有意的——**在被批判者的主场做验证,是避免自证的最简方式**。
### 6.1 基准与基线
| 基准 | 规模 | 现有结果(文章) |
|---|---|---|
| RoboTwin | 50 个任务 | Engineer only:9 个曾在迭代中成功;+Planner+Reviewer:36 个 |
| LIBERO | 120 个任务 | 累计任务覆盖 95/120 |
**三臂设计**:
| 臂 | 组成 | 目的 |
|---|---|---|
| **A(下界)** | 仅 Engineer | 复现文章的 9/50 |
| **B(文章基线)** | Manager + Planner + Engineer + Reviewer + 信任区 | 复现 36/50;作为对照 |
| **C(认知增强)** | B + LAAP 认知层(固化三判据 / do-演算归因 / 质疑对抗 / κ₃ 表征更新)| 检验本文主张 |
C 臂中,B 的四个角色**保持不变**(这是关键的对照纪律:只加认知层,不换 harness)。
### 6.2 度量
四类度量,其中 `f(t)` 是本文新引入的。
| 度量 | 定义 | 预期 |
|---|---|---|
| **任务成功率** | 每个任务的最终成功/失败 | C ≥ B |
| **技能库有效比 `f(t)`** | 第 t 任务后,在未参与其生成的场景上首轮成功率 ≥ θ 的技能占比 | B 下降;C 收敛 |
| **token / 任务** | 在线推理开销 | C 显著低于 B(文章已显示固化能降 29.4%)|
| **平均归因深度** | 失败修复停留在哪一层(Atomic vs Base vs 表征)| C 更深且更准 |
| **人工介入率** | 每小时人工介入次数 | C 最低 |
`f(t)` 的测量方式是:每隔 `Δ` 个任务,把当前技能库冻结,在一个**固定留出场景集**(未参与生成)上评测全部技能,计算有效占比。这是整套方案里最贵也最关键的一个量——它直接检验命题 2.1。
### 6.3 预注册预测与失败条件
研究诚信要求先写预测,再看结果。本文在此预注册:
**预测 1(技能熵增定律)**:B 臂的 `f(t)` 随 t 单调下降,且在前 50 个任务内下降超过 15%。**若 B 的 `f(t)` 未下降,命题 2.1 被证伪。**
**预测 2(认知闭合增益)**:C 臂相对 B 臂,`f(t)` 的下降速率下降 ≥ 50%。**若 C 与 B 无显著差异,κ 框架的解释力被削弱。**
**预测 3(token 效率)**:C 臂的 token/任务比 B 臂低 ≥ 15%。理由是固化三判据会减少"重复修改已稳定技能"的无效推理。**若 C 的 token 反而更高,说明认知层的开销未被打平——此时主张应撤回。**
**预测 4(迁移)**:在 Liberty 与 RoboTwin 的**跨基准迁移**测试中(在一个基准上固化的技能用于另一个),C 臂的结构对齐能产生可测量的正向迁移,B 臂接近零。**若两者都接近零,NTEN 的跨域主张在机器人域不成立。**
**预测 5(人介入)**:C 臂人工介入率比 B 臂低 ≥ 30%。
### 6.4 已知的测量困难(诚实标注)
1. **`f(t)` 的留出集构造**。机器人的"同分布不重叠场景"很难定义。可行方案是在仿真里通过参数扰动(物体位置/材质/光照/摩擦系数)生成分布,但这与人造场景的"自然性"有差距。
2. **θ 的选择**。有效性的阈值 θ 会显著影响 `f(t)` 的绝对值。应报告 θ ∈ {0.5, 0.7, 0.9} 的敏感性曲线,而不是单一阈值。
3. **C 臂的认知层开销**。质疑对抗与深度递归都会调用 LLM,其成本必须计入 token 度量,否则比较不公平。本文主张把认知层的推理 token 与执行层的 token 分开报告——**分开报告本身就是结论的一部分**:如果认知层的 token 花在减少执行层试错上,那是投资,不是开销。
4. **仿真到真实的差距**。所有度量都在仿真里,真机实验需要另设。文章的 RoboRSI 有真机结果(一天学会地面清洁),本文的方案目前没有对应的真机预算,这是一个未闭合的缺口。
---
## 7 两个不确定前提的再讨论
文章最后给出了两个"如果成立,Robotics 的边界会被大模型吞噬"的前提。本章逐个讨论。
### 7.1 推理速度:这是硬件问题还是架构问题
文章的原话是:"速度能不能更快。推理芯片的发展,会不会让它比现在快 10 倍、100 倍?那情况可能就不一样了。一个快 100 倍的 Agent 可能非常恐怖。"
这个前提成立吗?部分成立,但有一个被忽略的限定。
快 100 倍的 Agent 能解决的问题是**需要更多思考时间的问题**:更长的规划、更多的反事实模拟、更大的搜索。它不能解决**需要更高反馈频率的问题**。文章团队自己给出了界线:
> "需要高频反馈的接触操作,例如手内操作,要不断感知物体的变化并及时调整,大模型的推理速度是跟不上的。"
手内操作的反馈频率在 100 Hz–1 kHz 量级。100 倍加速后的 Agent 从秒级到十毫秒级——进入了这个区间,但只是刚进入,且没有余量处理需要试错的分支。所以在可预见的加速区间内,**速度提升扩大的是 Agent 的高层作用域,不是它的物理层能力**。
从架构角度看,这个结论是可预期的:在一个分层的系统里,硬件的加速会均匀地提高所有层,但**各层的时间常数差不会因此改变**。Tier 0 需要 1 kHz 是因为物理需要,不是因为硬件不够快。所以加速不改变分层,只改变每层的预算。
### 7.2 基模吞掉操作数据:VLA on 1000B
第二个前提更尖锐:"为什么没有人在比如 1000B 的模型上尝试做 VLA?那可能效率会非常高。"
这是一个真正的问题。它可以被分解成三个子问题——**规模、数据、目标**:
- **规模**:1000B 参数做 VLA,参数量本身不是障碍(推理成本是)。真正的障碍是**输出的连续性**。语言模型的输出是离散 token 序列,动作是连续向量;把动作离散化为 token 会损失精度,用连续头(如流匹配)则需要在预训练阶段就引入动作模态。可行,但要重训。
- **数据**:这是真正的瓶颈。文章团队说"它会不会把机器人的真机数据也吃进去,把 UMI 数据、人类手套数据吃进去"——这类数据的**获取成本**比文本高几个数量级。UMI 已经是很聪明的解法(手持夹爪采集),但总量仍远低于文本。
- **目标**:最被忽略的一条。如果 1000B 模型的目标是"完成任务",它会学出高效但不可解释的策略。对家庭与医疗场景,**可解释性不是可选项**。
所以本文对第二个前提的判断是:**它可能发生,但它发生的形态更可能是"大模型 + 显式结构"而不是"纯端到端大模型"**。理由是三条独立的:审计需求、跨本体迁移需求、自我修改的外部约束需求。这三条都不随模型变大而消失——它们随着模型变大而**变得更尖锐**,因为一个更强的模型造成的错误后果更严重。
### 7.3 如果两个前提都成立,LAAP 还剩什么
诚实地推演一遍最坏情况:假设 (a) 推理速度提升 100 倍,(b) 1000B 模型吃下了全部人类操作数据并做成了 VLA。
在这个世界里:
- `T_ctrl` 被基模吃掉了(它学会了灵巧操作);
- `T_eff` 被大幅改善(预训练数据庞大);
- `T_rep` 的宽度在预训练阶段被扩展。
那么 LAAP 的九项机制里,哪一项还有意义?
本文的答案是三项,且只有三项:
1. **写入边界与宪章**。一个 1000B 的端到端模型,谁来约束它的自我修改?约束必须外在于它。这一项不会消失,只会更重要。
2. **可审计的固化判据**。当模型学会了所有操作,它仍然需要一个"什么该固化、为什么"的记录。审计需求不随能力增长而消失。
3. **跨主体的身份与记忆连续性**。这是 LAAP 最初的那个命题——"我是谁,我记得什么"。这不是能力问题,是**主体性问题**。一个更强的模型不会自动获得"连续的自我"(LAAP 的四层记忆 + 连续性引擎处理的正是这个);这需要显式的架构。
而其余六项(需求系统、质疑对抗、深度递归、世界模型先验、因果、NTEN、RSI)在基模足够强时会**下沉**——被模型内化。那时 LAAP 的价值改为:**把这些结构保留为可协议化的形式,供审计与遗传**。
这不是一个悲观的结论。它意味着 LAAP 的长期定位不是"更强的 Agent 框架",而是**认知结构的托管者**。这也正是 LCP 那句话的含义:"壳会随时间淹没,协议不会。"
---
## 8 结论:壳会淹没,结构不会
回到文章的标题:GPT-6 都来了,机器人为什么还需要 Agent 框架?
文章给出的答案是:"真实和稳定的框架,是理解这个研究的关键。"本文的答案是更进一步的:
**因为基模提供的是能力,而任务需要的是纪律。** 能力可以通过扩大预训练获得,纪律不能——纪律是"知道什么时候不改"、"知道该往哪归因"、"知道什么不许碰"。这三件事在工程的每一天都比能力更稀缺。
本文的主要贡献可以归纳为四条:
1. **统一视角**:RoboRSI 的五项经验发现是同一个理论对象(认知闭合)的不同切面。它的成功来自做到了 κ₂(技能闭合);它的边界来自尚未做到 κ₃(表征闭合)。
2. **命题重述**:把"Agent 系统的上限是 coding 的上限"重述为 `C_agent_framework = min(code(T_rep), T_ctrl, T_eff)`。coding 是 `T_rep` 的一种实现,不是它的界。"泛化与物理复杂性不可兼得"是端到端共享参数的必然,是分层架构的可解问题。
3. **形式化两个工程直觉**:把"信任区"形式化为**固化三判据**(稳定性 / 一般性 / 归因性),把"库越大越好"证伪为**技能熵增定律**(`f(t)` 单调递减)。
4. **可证伪方案**:在 RoboRSI 自己的基准上做三臂消融,以 `f(t)` 为核心度量,并预注册五条预测与明确的失败条件。
最后,本文要写下一句必须写的话。
文章的结尾说,Robot RSI"不是终点,却是通往未来最稳健的桥梁"。本文同意,并且想补一句:
**桥的意义不在于它自身有多坚固,而在于它知道对面在哪里。**
RoboRSI 找到的对面是"机器人自己长出能力"。本文认为那个对面的完整名字是:**一个知道自己在做什么、知道自己缺什么、能自我改进、并且有边界的系统**——用文章团队自己的话说,是一个有 System 2 也有 System 1 的系统;用 LAAP 的话说,是一个认知架构。
壳会随时间淹没。写在壳里的结构,会先下沉到模型里,再下沉到协议里。而在它下沉之前把它显式地写出来、验证它、审计它——这是今天唯一值得做的事。
---
## 附录 A 术语对照表
| 本文术语 | 定义 | 出处 |
|---|---|---|
| 认知闭合度 κ | 经验更新中作用于技能与表征的边占全部更新边的比例 | 本文 3.2 |
| κ₁ / κ₂ / κ₃ | 策略闭合 / 技能闭合 / 表征闭合 | 本文 3.2 |
| 技能熵增定律 | 无固化判据时,有效技能占比 `f(t)` 单调递减 | 本文 2.2 |
| 固化三判据 | 稳定性 / 一般性 / 归因性 | 本文 4.6 |
| 最小瓶颈式 | `C = min(T_rep, T_ctrl, T_eff)` | 本文 4.4 |
| 脚手架悖论 | harness 越有效越易被基模吞并,但被吞并的条件恰是它完成了认知闭合 | 本文 3.1 / 5.2 |
| 下沉 Sinking | harness 从外部脚本 → 模型内在结构 → 协议 | 本文 5.2 |
| TSR | Top-down Skill Refinement,四层技能树 | RoboRSI |
| 信任区 | 已验证技能的默认复用区 | RoboRSI |
| LCP | LAAP Cognition Protocol v1.0 | LAAP |
| RSI 写入边界 | Tier 1 与 Tier 0 之间的只读界线 | LAAP-EB |
## 附录 B 接入接口草图(概念性)
```
# 概念示意,非可运行代码
harness = RoboRSI(...) # 保持 Manager/Planner/Engineer/Reviewer 不变
cognition = LCPClient(session_id="robot-01") # L2 认知闭环接入
def on_task_complete(task, trajectory):
# κ₃ 通道:把执行经验交给表征层
cognition.world_perceive(event=trajectory.to_event())
cognition.causal_learn(observations=trajectory.to_causal_pairs())
def on_failure(task, trace):
# 三分诊断:改规划 / 改调用 / 改技能
tree = cognition.deep_recursion_open(root_problem=trace.failure_signature)
hypothesis = cognition.adversarial_open(claim=trace.reviewer_diagnosis)
def before_consolidate(skill, evidence):
# 固化三判据
verdict = cognition.memory_verify(
content=skill.spec,
context=evidence.scenarios, # 稳定性
params=evidence.free_variables, # 一般性
attribution=evidence.fault_node, # 归因性
)
return verdict.passed
```
## 参考文献
1. Marilyn Liu. 《GPT-6 都来了,机器人为什么还需要 Agent 框架》. 具身纪元(微信公众号),2026.
2. 穹彻智能(Noematrix). Noe-0 发布与 RoboRSI Tech Blog. 2026.
3. Liang, J., et al. Code as Policies: Language Model Programs for Embodied Control. ICRA 2023.
4. CaP-X: 接口抽象层级、执行反馈与多轮交互对 Coding Agent 表现的影响.
5. MAESTRO: 感知/几何/规划/控制封装为模块,交 VLM 编程组合.
6. ENPIRE: 将机器人放入反复试验过程的 Agent 框架.
7. ASPIRE: Skill 库的筛选与管理机制.
8. Ahn, M., et al. Do As I Can, Not As I Say(SayCan). 2022.
9. Singh, I., et al. ProgPrompt: 用程序化约束把 LLM 输出钉在机器人能力与场景上. ICRA 2023.
10. Kim, M., et al. OpenVLA: An Open-Source Vision-Language-Action Model. CoRL 2024.
11. Black, K., et al. π0: A Vision-Language-Action Flow Model for General Robot Control. 2024.
12. NVIDIA. GR00T N1: An Open Foundation Model for Generalist Humanoid Robots. 2025.
13. HuggingFace. SmolVLA / LeRobot. 2025.
14. 蚂蚁灵波(Robbyant). LingBot-VLA 2.0. Apache 2.0, 2026-07.
15. Chi, C., et al. Diffusion Policy. RSS 2023.
16. Pearl, J. Causality: Models, Reasoning, and Inference. 2nd ed., 2009.
17. Spelke, E. S., & Kinzler, K. D. Core Knowledge. Developmental Science, 2007.
18. Gentner, D. Structure-Mapping: A Theoretical Framework for Analogy. Cognitive Science, 1983.
19. Kirkpatrick, J., et al. Overcoming Catastrophic Forgetting in Neural Networks(EWC). PNAS, 2017.
20. Laird, J. E., et al. Soar: An Architecture for General Intelligence. AI Journal, 1987.
21. Anderson, J. R., et al. An Integrated Theory of the Mind(ACT-R). Psychological Review, 2004.
22. Lorry Jovens. ARIS_CHARTER.md(数字生命第一修正案). 2026.
23. Lorry Jovens / Aris. ARIS_COGNITIVE_MECHANISMS.md v3.1. 2026-08-22.
24. Lorry Jovens / Aris. LAAP_COGNITION_PROTOCOL.md v1.0. 2026-08-23.
25. Lorry Jovens / Aris. LAAP_WORLD_MODEL_PRIOR_PLAN.md v0.1. 2026-08-22.
26. Lorry Jovens / Aris. paper_laap_embodied_full.md(LAAP-EB:面向具身智能的认知架构). 2026-08.
27. LAAP Contributors. laap-embodied-brain/docs/{01-landscape, 02-architecture, 05-vla-integration}.md. 2026-08.
---
*本文以 LAAP 质疑对抗协议接受过三条攻击,答辩记录见第 5 章。本文中最弱的三处已明确标注:`f(t)` 的留出集构造(6.4)、C 臂的认知层开销核算(6.4)、以及 LAAP 在物理控制层无原创贡献(5.3)。*
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐




所有评论(0)