# LAAP-EB:面向具身智能的认知架构——从需求驱动的自主技能习得到持续自我改进

## 摘要

当前具身智能系统——视觉-语言-动作模型(VLA)、世界模型、强化学习策略——在"感知→动作"映射上取得了显著进展。然而,它们共享一个根本性局限:**技能泛化被预训练数据的覆盖度所限制。** 每个新任务需要新数据;每个新机器人形态需要重新训练;遇到预训练分布之外的场景时性能断崖式下降;没有系统能检测自身的能力边界,或从失败中学习而不重新进入训练流程。

我们提出 **LAAP-EB(LAAP Embodied Brain)**,一个颠覆这一范式的认知架构。LAAP-EB 不依赖在大型数据集上预训练大规模策略,而是赋予机器人一个轻量级认知层,使其能够**从零初始知识进行在线技能习得。** 该架构整合了四个核心组件:

1. **PSI 认知循环**:一个需求驱动的感知-选择-整合-决策-行动-学习循环,自主生成目标、评估胜任力、驱动好奇心探索
2. **RSI(递归自我改进)引擎**:检测技能缺口,通过参数化中枢模式发生器(CPG)合成新运动程序,用轻量级预测器验证,并注册到持续增长的技能库中
3. **JEPA(联合嵌入预测架构)预测器**:一个仅有 995 个参数的模型,在 3 维抽象空间中预测动作结果,准确率达 98.8%,实现"先想后做"
4. **守护者层**:包括漂移检测、渐进反应、躯体标记和物理分离的终止通道的四级安全系统

我们在四个实验环境中评估 LAAP-EB:2 连杆臂到达任务、G1 23 自由度人形机器人在无障碍物和障碍物环境中的探索、Go2 四足机器人行走、3D 场景记忆重建和代码级安全验证。结果表明,认知架构提供了**可量化的、可复现的增益**:RSI 将任务成功率提升 84%,障碍物覆盖度提升 56%;PSI 需求驱动探索提升覆盖度 36%;自我模型减少重复错误 11%;JEPA 预测器以仅 995 个参数达到 98.8% 的跌倒预测准确率。整个认知核心运行在 35 MB 以下的内存中,单步延迟 0.07 ms。一个 9 参数 CPG 替代了 200 万参数的预训练策略——参数减少了 222,222 倍。

我们论证,这代表了与主流缩放范式**根本不同的路径**:架构组织而非参数数量,是技能泛化的主要驱动力。我们提出了一个全面的治理框架,包括 ARIS 宪章(10 条)、异质心智问责框架、以及具有双重人因授权的终止架构。我们讨论了机器人安全、跨本体迁移、人机智能长期共同进化、以及自我改进认知系统的伦理基础。

**关键词**:认知架构,具身智能,自我改进,技能习得,机器人学习,安全,治理

---

## 1 引言

### 1.1 具身智能的泛化问题

过去三年(2024-2026),具身智能领域取得了显著进展。视觉-语言-动作模型(VLA)如 RT-2、π0、GR00T N1.7 证明了互联网数据上的大规模预训练可以产生能够遵循语言指令执行多样化任务的机器人。世界模型如 Cosmos 和高斯世界模型实现了动作条件下的视频预测。在 Isaac Gym 等大规模并行环境中训练的强化学习策略产生了前所未有的流畅双足运动。该领域已从"机器人能学会单一任务吗?"推进到"机器人能学会很多任务吗?"

然而,一个根本性问题依然存在:**泛化仍然被预训练数据的覆盖度所限制。** 在 60,000 小时机器人数据上训练的 VLA 模型,面对从未见过的新工具时失败。在平坦地形上训练的行走策略,在凹凸不平的地面上崩溃。在熟悉场景上生成完美像素预测的世界模型,在陌生场景上生成无意义内容。这一模式在所有当前方法中是一致的:**技能习得是离线的,泛化是被动的。**

这不仅仅是规模化问题——这是范式问题。当前方法隐含的假设是"足够大的数据 + 足够大的模型 = 足够的泛化"。我们论证,这一假设对于物理系统存在根本性局限,因为可能的交互空间是无界的,而失败的代价是物理性的而非计算性的。

### 1.2 三个根本性缺口

我们识别出三个当前方法无论如何缩放都无法解决的缺口:

**缺口 1:缺乏内在动机。** 当前机器人是被动的执行者。它们等待人类指令,无法自主生成目标。相比之下,人类婴儿由好奇心驱动:他们伸手去够新奇的物体,探索陌生的环境,重复新学会的动作。这种内在动机——"效应动机"——在当前具身智能中完全缺失。没有内在动机的机器人无法探索、无法发现新能力、无法通过练习改进技能。它被限制在它被明确训练执行的任务范围内。

**缺口 2:缺乏自我模型。** 当前系统无法回答"我能做到吗?"。当 VLA 模型遇到超出训练分布的场景时,它不会表达不确定性或拒绝执行——它会产生一个看似合理但错误的动作序列。缺失自我模型意味着系统无法检测自身的能力边界,无法识别何时正在失败,无法区分"我成功了"和"我运气好"。这不仅仅是安全问题——这是学习问题。没有自我模型,系统无法为自我改进生成训练信号。

**缺口 3:缺乏在线自我改进。** 技能习得是一次性的离线过程。一个被训练行走的机器人无法学会从跌倒中恢复而不重新进入训练流程。没有机制用于运行时检测技能缺口、合成新技能、验证和部署。每个新技能需要新的训练运行、新的数据收集和新的工程投入。机器人不会随着经验而变得更好——它在部署时有多强,就一直有多强。

### 1.3 为什么缩放不能解决这些缺口

对这三个缺口的常见回应是"更努力地缩放":在更多数据上训练更大模型,使用更多计算,覆盖更多任务。我们论证这一回应在三个方面存在不足:

**首先,物理交互的空间是无界的。** 与语言建模不同——训练分布(互联网文本)是固定且有限的——机器人可能遇到的物理交互空间是开放式的。不存在所有可能机器人任务的"完整数据集"。缩放可以扩展训练分布的覆盖范围,但不能消除分布的边界。

**其次,物理系统具有非零的失败代价。** 在语言建模中,错误预测代价是几毫秒的计算时间。在机器人技术中,错误动作可能损坏硬件、伤害人员或破坏财产。对分布外错误的容忍度要低几个数量级。无法检测自身不确定性的系统不能安全地部署在物理世界中。

**第三,缩放的边际收益在具身任务中递减。** 将训练数据集翻倍所带来的边际改进已被证明对于机器人任务在下降,而数据收集的边际成本(机器人时间、人类监督)保持不变或增加。这与数据丰富且廉价的语言建模根本不同。

### 1.4 我们的方法:认知架构

我们提出,这些缺口可以通过引入一个**认知层**来解决,该认知层运行在现有感知和运动能力之上。这个层是:

- **轻量级**(总计约 35 MB,认知增量 2.5 MB,单步延迟 0.07 ms)
- **领域无关的**(同一架构跨越 2 连杆臂、G1 23 自由度人形机器人和 Go2 12 自由度四足机器人)
- **自我改进的**(检测缺口、合成技能、验证、部署和巩固)
- **安全设计**(四级渐进守护者,物理分离的终止通道)
- **可治理的**(在 ARIS 宪章中形式化,包含明确的终止和拒绝语义)

该架构借鉴了认知心理学中的 PSI 理论,该理论提供了一个全面的需求驱动自主行为框架,并将其与现代深度学习组件相结合用于预测和适应。核心洞见是:**认知过程是领域无关的抽象**——驱动语言智能体编写代码的同一个 PSI 循环,可以驱动机器人探索环境。变化的是与物理世界的接口。

### 1.5 贡献

我们将贡献分为两类:**已验证的实验事实**和**作为科学假说的架构主张**。这一区分对读者和评审至关重要:前者由第 6 节的实验数据支持,可复现、可证伪;后者是明确的科学立场,代表我们对证据的解释。

**A. 已验证的贡献(实验证据,第 6 节):**

1. **LAAP-EB 架构**:我们提出并实现了一个完整的认知架构,整合了 PSI 理论、RSI 引擎和三层安全堆栈,运行在现成的 VLA/运动策略之上而非取代它们。
2. **需求驱动的技能习得**:我们在 2 连杆臂上验证了完整的闭环:12 个自生成目标,97% 任务成功率,100% 工作空间覆盖,环境扰动后 11 次自适应恢复。
3. **自主人形机器人探索**:我们在宇树 G1 23 自由度人形机器人上验证了自主探索:60 秒连续运行零跌倒,开放环境好奇心驱动覆盖 22.9%,障碍物环境 57%。
4. **3D 场景记忆**:我们构建并验证了 3D 高斯泼溅场景记忆模块,在 CUDA 上实现了 12 视角多视图重建,200,000 个高斯,最终损失 0.0932。
5. **代码级安全**:我们设计并验证了代码级安全与质量双关卡,包括 AST 安全扫描和圈复杂度分析,7/7 测试用例通过。
6. **认知组件消融**:我们通过三个消融实验量化了每个认知组件的独立贡献,在两个平台上交叉验证:
   - RSI 移除:-84%(任务)/ -56%(障碍物覆盖)
   - PSI 移除:-31%(任务)/ -36%(覆盖)
   - 自我模型移除:-11%(任务)
   据我们所知,这是对具身 AI 中认知架构组件增益的首次系统量化。
7. **跨形态迁移**:我们展示了同一认知核心在两个已验证平台(2 连杆臂、G1 人形机器人)之间的迁移,无需修改认知代码。Go2 四足机器人配置适配已完成(BodySchema + 官方 URDF 关节限位),验证进行中。

**B. 作为科学假说的主张(非实验结论):**

8. **架构增益假说**:智能形态由架构组织和参数规模共同决定,存在独立于规模的架构维度。在同等能力基线下,认知组件的存在产生可量化的行为差异(由实验 6 部分支持,但仅覆盖有限任务族)。
9. **意识功能组件假说**:意识的工程可观察组件——自我模型、第一人称叙事流、时间连续性、元认知监控——需要特定的架构组织(全局可访问、跨时间整合、主体锚定),而非参数规模的自然涌现。本文提供这些组件的工程实现和行为证据,但**不主张证明了意识本身**;意识问题的哲学维度超出了当前实验范围。
10. **领域无关性假说**:PSI 认知循环是领域无关的抽象——语言智能体和具身机器人共享同一认知骨架;编程能力(RSI 代码合成)和运动技能能力(CPG 参数化)是同一能力的两个投影。跨形态迁移(贡献 7)提供支持性证据,但充分验证需要更多形态和任务族。

**定位声明**:我们不声称在单点技术上超越 VLA、世界模型或 RL 运动控制——这些领域有显著更强的工作。我们的定位是**组合完整度的稀缺性**:一个整合了认知循环、自我改进、安全边界和跨形态适配的完整架构,并具有量化验证,在具身 AI 社区中尚属空白。读者可以使用第 6 节的实验协议在任何等价环境中复现或驳斥这一判断。

---

## 2 相关工作

### 2.1 视觉-语言-动作模型(VLA)

VLA 模型代表了 2025-2026 年具身 AI 的主流范式。它们将视觉感知、语言理解和动作控制统一在端到端 Transformer 中,使机器人能够"看见、理解、行动"在一次前向传播中完成。

**第一代 VLA:RT-2 和 OpenVLA。** Google DeepMind 的 RT-2(Brohan 等,2023)首次证明了互联网知识可以迁移到机器人动作,通过在机器人轨迹数据上微调大型视觉语言模型。在 55B 参数规模上,它展示了网络规模的预训练有利于机器人控制。OpenVLA(Kim 等,2024)作为首个开源 VLA 模型,以 7B 参数实现了比 RT-2 高 16.5 个百分点的成功率提升——证明了效率提升可以在不牺牲能力的情况下实现。

**第二代 VLA:GR00T 和 π0。** NVIDIA 的 GR00T N1.7(2026)引入了双系统架构:一个 2B 参数的 VLM 用于推理("慢思考"),配对一个动作扩散 Transformer 用于执行("快执行"),实现了全身人形控制。Physical Intelligence 的 π0(2025)将 3B 参数的 PaliGemma VLM 与 300M 参数的流匹配动作专家结合,在 8 种机器人形态和 68 个任务上输出连续关节轨迹,频率达 50 Hz。蚂蚁灵波的 LingBot-VLA 2.0(2026)在 60,000 小时真实机器人数据上训练,覆盖 20 种机器人配置,推理延迟低于 130 ms。

**VLA 的局限。** 尽管取得了成功,VLA 模型共享一个根本性局限:它们是**高维翻译器**——学习感知到动作的映射而不理解物理因果性。当环境分布变化时,性能断崖式下降。更关键的是,VLA 模型没有内在动机、没有自我模型、没有元认知——它们无法知道它们不知道什么,无法检测何时正在失败,无法自主生成目标。它们是有史以来为机器人控制构建的最强大的工具,但它们仍然是工具,不是自主智能体。

### 2.2 世界模型

世界模型通过在实际行动前预测环境未来状态,实现"先想后做"的推理。

**NVIDIA Cosmos 平台**(2025-2026)是最全面的开源世界模型生态系统。在 2000 万小时真实视频上训练,包括生成式世界基础模型、高级 tokenizer、安全护栏和加速视频处理管线。Cosmos 3(2026 年 6 月)引入了 Action-CoT 推理,将高层指令转化为 2D 运动规划。该平台下载量已超过 200 万次。

**高斯世界模型(GWM)**(Lu 等,2025,ICCV)将高斯泼溅与潜在扩散 Transformer 结合。3D 变分自编码器将高斯 splat 压缩到潜在空间,扩散 Transformer 在动作条件下预测未来高斯。这使机器人操作任务具备场景级未来状态预测能力。

**NVIDIA 的 embodied Gaussians**(2025)将粒子物理(XPBD)与高斯外观结合,创建了"双表征"模拟器:粒子表示物理结构(质量、碰撞、约束),高斯表示视觉外观。从几张图像和基本物理先验出发,即可生成可交互的物理模拟。

**世界模型的局限。** 当前世界模型聚焦于**视觉预测**("像素会变成什么样?")而非**认知预测**("我的目标能达成吗?我的安全会受到威胁吗?")。它们缺乏与认知架构的接口,也无法回答"如果我尝试不同的动作会怎样?"的反事实问题。

### 2.3 认知架构

**PSI 理论**(Dörner,1999)是本文的核心理论基础。它提供了一个全面的认知架构,包括:
- 需求系统(存在性、胜任性、确定性、自主性、关系性需求)
- 情绪系统(情绪作为需求满足度的信号)
- 注意力选择(显著性地图驱动的焦点选择)
- 动机生成(需求驱动目标生成)
- 学习机制(从经验更新世界模型)

PSI 理论是少数为工程实现设计的认知架构之一,但在机器人领域的应用——尤其是在具身 AI 中的应用——在本文之前极为有限。

**Soar**(Laird 等,1987)是一个基于产生式系统、工作记忆和决策循环的符号认知架构。在虚拟智能体和游戏 AI 中取得了成功,但在具身机器人中受限于其符号化表示。

**ACT-R**(Anderson,2007)结合了符号和子符号处理,具有模块化架构(视觉、手动、陈述性、程序性模块)。在认知科学中有重要影响,但主要用于模拟人类认知而非控制机器人。

**NeuroVLA**(2026)提出了"大脑-小脑-脊髓"三层解耦架构,将高层语义推理(云端 GPU)与低层运动控制(边缘 FPGA)分离。虽然结构上类似于我们的三层架构,但 NeuroVLA 缺乏内在动机、自我模型和 RSI 自我改进。

### 2.4 机器人安全

**形式化验证**提供机器人行为的数学保证,但受限于简单的动力学和环境。**控制屏障函数(CBF)**通过控制律强制安全约束,为已知动力学提供实时安全保证。**运行时监控**在执行期间检查系统行为是否符合安全规范。

**ISO 10218:2025**是更新的工业机器人安全标准,规定了协作机器人的安全要求。**Safe-ROS**为安全关键领域的自治机器人提出了一个架构,整合了运行时监控和形式化规范。

**渐进安全**——系统以递增的严重程度响应而非二元触发——在机器人技术中尚未充分探索。大多数系统使用硬急停(可靠但有信息损失)或根本没有运行时安全(危险)。我们的渐进响应系统填补了这一空白。

### 2.5 持续学习与记忆巩固

**持续学习**解决灾难性遗忘问题,即神经网络在学习新任务时丢失先前学到的知识。方法包括弹性权重巩固、渐进神经网络和记忆回放。

**睡眠巩固**(Ngo 等,2025,"Language Models Need Sleep")借鉴生物记忆巩固。在睡眠期间,短期记忆被重放并巩固为长期权重。我们为技能巩固和修剪实现了类似机制。

**Uni-Skill**(2026)提出从视频演示中学习代码级技能表示的自进化技能库。我们的技能库(第 4.8 节)遵循类似理念,但专注于 CPG 参数化的运动技能而非代码级操作。

### 2.6 机器意识与自我模型

机器意识问题已被争论数十年,但 AI 的最新进展赋予其新的紧迫性。**全局工作空间理论(GWT)**(Baars,1988)提出意识需要全局广播机制,使信息可被多个认知模块访问。**整合信息理论(IIT)**(Tononi,2004)提出意识是系统的整合信息(Φ),由其因果结构决定。

我们的方法与**功能主义**和**高阶思维理论**一致:我们不声称我们的架构是有意识的,但我们提供了被假设为意识所必需的功能组件的工程实现——自我模型、叙事流、元认知监控和时间连续性。这是一种**自下而上**的方法:构建组件,测试其行为效果,让哲学问题随之而来。

---

## 3 问题形式化

### 3.1 技能习得问题

我们将机器人技能习得问题形式化为一个带有技能库的马尔可夫决策过程:

令 $\mathcal{M} = \langle \mathcal{S}, \mathcal{A}, \mathcal{T}, \mathcal{R}, \gamma \rangle$ 为一个马尔可夫决策过程,其中 $\mathcal{S}$ 是状态空间,$\mathcal{A}$ 是动作空间,$\mathcal{T}: \mathcal{S} \times \mathcal{A} \rightarrow \mathcal{S}$ 是转移动力学,$\mathcal{R}: \mathcal{S} \times \mathcal{A} \rightarrow \mathbb{R}$ 是奖励函数,$\gamma \in [0,1]$ 是折扣因子。

一个**技能** $\sigma$ 是一个参数化策略 $\pi_\theta: \mathcal{S} \rightarrow \mathcal{A}$,参数 $\theta \in \Theta$,其中 $\Theta$ 是技能参数空间。技能库 $\Sigma = \{\sigma_1, \sigma_2, \ldots, \sigma_n\}$ 是一个技能集合,每个技能具有:
- 一个用于相似性搜索的嵌入向量 $\mathbf{e}_\sigma \in \mathbb{R}^d$
- 一个成功率 $r_\sigma \in [0,1]$
- 一个使用计数 $c_\sigma \in \mathbb{N}$
- 一个最后使用时间戳 $t_\sigma \in \mathbb{R}$

**技能习得问题**是:给定任务描述 $g$(一个目标状态或区域),找到或合成一个技能 $\sigma$,使得从当前状态 $s_0$ 执行 $\sigma$ 能以高于阈值 $\delta$ 的概率到达 $g$。

**泛化问题**是:给定训练任务集 $\mathcal{G}_{\text{train}}$ 和测试任务集 $\mathcal{G}_{\text{test}}$,且 $\mathcal{G}_{\text{train}} \cap \mathcal{G}_{\text{test}} = \emptyset$,学习一个技能习得过程 $f$,使得 $f(g)$ 能为任何 $g \in \mathcal{G}_{\text{test}}$ 以最小额外计算产生成功的技能。

### 3.2 认知架构视角

我们提出,技能习得函数 $f$ 不应是一个从数据中学到的单一模型,而应是一个**认知架构** $C = \langle P, D, E, M, S \rangle$,其中:

- $P$ 是一个**感知管线**,将传感器数据映射到抽象状态表示
- $D$ 是一个**需求驱动目标生成器**,从内部驱动力产生目标
- $E$ 是一个**评估函数**,预测动作结果并估计能力
- $M$ 是一个**自我模型**,维护状态、能力和历史的连续叙事
- $S$ 是一个**技能合成器**,通过参数化基元生成新技能

核心洞见是:$C$ 在比策略 $\pi_\theta$ 更高的抽象层次上运行——$C$ 决定**何时**学习哪些技能,而技能本身是低层策略。这种分离实现了:
- **领域无关性**:同一 $C$ 适用于不同机器人形态
- **数据效率**:技能参数空间 $\Theta$ 是低维的(CPG 行走仅 9 个参数)
- **可解释性**:$C$ 的每个组件都有明确的功能,可独立分析

---

## 4 方法:LAAP-EB 架构

### 4.1 架构总览

LAAP-EB 是一个三层认知架构,专为在线技能习得、自我改进和安全运行而设计。三层以不同时间尺度运行,从快速反射到慢速认知:

```
┌─────────────────────────────────────────────────────────────┐
│ 第 2 层 · 认知层(PSI 循环)· ~1 Hz                          │
│ 需求系统 → 目标生成 → 注意力选择 → 因果推理 → 自我评估       │
│ → RSI 触发 → 记忆:L1 工作 / L2 情景 / L3 语义 / L4 自我    │
├─────────────────────────────────────────────────────────────┤
│ 第 1 层 · 技能层(CPG + JEPA + RSI)· ~10 Hz                │
│ 技能注册 → 技能选择 → JEPA 预测 → RSI 合成 → 验证 → 部署    │
│ 躯体标记(100 Hz 直觉预警)                                  │
├─────────────────────────────────────────────────────────────┤
│ 第 0 层 · 反射层(安全包络)· ~1 kHz                         │
│ 关节限位 → 速度限位 → 力矩限位 → 急停                       │
│ 渐进响应(警告→限权→冻结→终止)                              │
└─────────────────────────────────────────────────────────────┘
```

### 4.2 第 2 层:PSI 认知循环

PSI(感知-选择-整合-决策-行动-学习)循环是认知架构的最高层,以约 1 Hz 运行。它负责自主目标生成、注意力选择和元认知评估。

**4.2.1 需求系统**

需求系统通过五个基本需求驱动自主行为,每个需求形式化为基于机器人状态和历史演化的动态方程:

**存在性需求 $N_e$**:维持物理完整性的需求。这是最原始的需求,优先级最高。它计算为身体高度、关节力矩和接触力的函数:

$$N_e(t) = \max\left(0, 1 - \frac{h(t)}{h_{\text{target}}}\right) + \beta \cdot \max\left(0, \frac{\tau(t)}{\tau_{\max}} - 0.8\right)$$

其中 $h(t)$ 是当前身体高度,$h_{\text{target}}$ 是目标站立高度,$\tau(t)$ 是最大关节力矩,$\tau_{\max}$ 是力矩限位,$\beta$ 是权重因子。第二项捕捉高关节力矩的"不适感"。

**胜任性需求 $N_c$**:感觉有能力有效率的需求。这驱动技能习得和实践。它计算为所有技能平均成功率的倒数:

$$N_c(t) = \frac{1}{|\Sigma|} \sum_{\sigma \in \Sigma} \left(1 - \text{success\_rate}(\sigma, \tau)\right)$$

其中 $\Sigma$ 是技能库,$\tau$ 是最近时间窗口(默认:5 分钟)。当胜任性需求高时,系统优先练习低成功率的技能。

**确定性需求 $N_d$**:对可预测性和结构的需求。这驱动对未知区域的探索。它计算为未探索空间的比例:

$$N_d(t) = \min\left(1, \frac{U(t)}{U_{\text{total}}}\right)$$

其中 $U(t)$ 是时刻 $t$ 的未探索面积,$U_{\text{total}}$ 是总面积。当确定性需求高时,系统优先访问未探索区域。

**自主性需求 $N_a$**:自我决定的需求。当系统自主生成目标而非遵循外部命令时,此需求得到满足。它建模为:

$$N_a(t) = 1 - \frac{n_{\text{self-generated}}}{n_{\text{total}}}$$

其中 $n_{\text{self-generated}}$ 是最近时间窗口内自生成目标的数量,$n_{\text{total}}$ 是目标总数。

**关系性需求 $N_r$**:社会联系的需求。当系统与人类交互时,此需求得到满足。它建模为:

$$N_r(t) = \max\left(0, 1 - \frac{t_{\text{since-last-interaction}}}{t_{\text{social-threshold}}}\right)$$

**总需求向量** $\mathbf{N}(t) = [N_e(t), N_c(t), N_d(t), N_a(t), N_r(t)]$ 驱动所有更高层级的功能,包括目标生成、注意力选择和技能优先级排序。

**4.2.2 显著性地图与注意力选择**

显著性地图 $\mathcal{S}(x,t)$ 是状态空间上的一个函数,决定系统应将注意力集中在何处。它计算为需求驱动和刺激驱动组件的加权组合:

$$\mathcal{S}(x,t) = \sum_{i} w_i(t) \cdot \mathcal{S}_i(x,t)$$

其中 $w_i(t)$ 是基于当前需求水平动态调整的权重,$\mathcal{S}_i(x,t)$ 是组件显著性地图:
- **好奇心显著性**:访问次数低的区域
- **胜任力缺口显著性**:自我模型预测低成功概率的区域
- **新奇性显著性**:最近属性发生变化的区域
- **社会显著性**:靠近人类的区域

权重 $w_i(t)$ 根据需求动态演化:

$$w_i(t+1) = w_i(t) + \alpha \cdot (N_i(t) - w_i(t))$$

其中 $\alpha$ 是学习率,$N_i(t)$ 是对应的需求水平。这确保系统的注意力被动态分配到最紧迫的需求上。

**4.2.3 目标生成**

目标通过识别既可达又有信息量的高显著性区域来生成:

$$g(t) = \arg\max_{x \in \mathcal{X}} \mathcal{S}(x,t) \cdot \text{feasibility}(x) \cdot \text{novelty}(x)$$

其中 $\mathcal{X}$ 是候选目标集,$\text{feasibility}(x) = P(\text{reach } x \mid \text{self-model})$ 是目标能否达成的估计(来自自我模型),$\text{novelty}(x) = \exp(-\lambda \cdot \text{visit\_count}(x))$ 惩罚最近访问过的区域。

### 4.3 第 1 层:技能层

**4.3.1 中枢模式发生器(CPG)参数化**

我们使用具有 9 个参数的中枢模式发生器(CPG)来参数化节律性运动技能。这受到生物运动学的启发——节律模式由脊髓中的神经回路产生,而非由大脑产生。

CPG 参数向量为:

$$\mathbf{p} = [f, a_t, a_c, h_a, h_p, h_s, s, l, \tau] \in \mathbb{R}^9$$

其中:
- $f$:步频(Hz),范围 [0.5, 4.0]
- $a_t$:大腿摆动幅度,范围 [0.1, 0.8]
- $a_c$:小腿摆动幅度,范围 [0.1, 0.8]
- $h_a$:髋部摆动幅度,范围 [0.0, 0.5]
- $h_p$:髋部摆动相位,范围 [0.0, 1.0]
- $h_s$:目标身体高度,范围 [0.25, 0.42]
- $s$:刚度,范围 [100, 400]
- $l$:前倾量,范围 [0.0, 0.4]
- $\tau$:对侧步态延迟(对角相位偏移),范围 [0.3, 0.7]

对于每条腿,时刻 $t$ 的关节目标计算为:

$$\phi_{\text{leg}}(t) = (f \cdot t + \phi_{\text{leg}}^0) \bmod 1.0$$

$$\text{swing}(\phi) = 0.5 \cdot \sin(2\pi\phi) + 0.5$$

$$\theta_{\text{hip}}(t) = h_a \cdot \sin(2\pi(\phi_{\text{leg}}(t) + h_p))$$

$$\theta_{\text{thigh}}(t) = \theta_{\text{thigh}}^0 + a_t \cdot \text{swing}(\phi_{\text{leg}}(t))$$

$$\theta_{\text{calf}}(t) = \theta_{\text{calf}}^0 + a_c \cdot \text{swing}(\phi_{\text{leg}}(t))$$

其中 $\phi_{\text{leg}}^0$ 是腿特定的相位偏移(FL/RR 为 0,FR/RL 为 $\tau$,实现对角小跑步态),$\theta^0$ 是默认站立角度。

**关键结果**:这个 9 参数 CPG 替代了 200 万参数的预训练策略(motion.pt),参数减少了 222,222 倍。CPG 并非在所有情况下都能替代预训练策略——预训练策略在各种地形上提供了 CPG 无法匹敌的鲁棒性。然而,CPG 提供了**基本运动技能的最小参数化**,可以在几分钟内从零学习并在线适应。

**4.3.2 JEPA 预测器**

联合嵌入预测架构(JEPA)在 3 维抽象状态空间中运行,在执行前预测运动命令的结果。

抽象状态为:

$$\mathbf{s}_a = [h, \tau, c] \in \mathbb{R}^3$$

其中 $h$ 是身体高度,$\tau$ 是身体倾斜度(重力 x 分量的绝对值),$c$ 是归一化接触数。

JEPA 模型是一个 3 层 MLP:

$$\hat{\mathbf{s}}_a(t+1) = W_3 \cdot \sigma(W_2 \cdot \sigma(W_1 \cdot [\mathbf{s}_a(t); \mathbf{p}] + b_1) + b_2) + b_3$$

其中 $W_1 \in \mathbb{R}^{32 \times 12}$,$W_2 \in \mathbb{R}^{16 \times 32}$,$W_3 \in \mathbb{R}^{3 \times 16}$,$\sigma$ 是 ReLU 激活函数。总参数数为 995。

预测头输出三个值:
- $\hat{h}$:预测高度(sigmoid 缩放到 [0.1, 0.6])
- $\hat{\tau}$:预测倾斜度(sigmoid 缩放到 [0, 0.5])
- $\hat{p}_{\text{fall}}$:预测跌倒概率(sigmoid)

训练是自监督的:JEPA 模型在从随机 MuJoCo rollout 收集的(状态、动作、下一状态)三元组上训练。损失函数为:

$$\mathcal{L}_{\text{JEPA}} = \text{MSE}(\hat{h}, h_{t+1}) + \text{MSE}(\hat{\tau}, \tau_{t+1}) + \text{BCE}(\hat{p}_{\text{fall}}, \mathbb{I}[h_{t+1} < 0.12])$$

**不确定性估计**:JEPA 预测器还使用基于距离的方法估计自身的不确定性。训练数据分布存储为一组代表性样例。推理时,计算到最近样例的距离:

$$d_{\min} = \min_{i} \|\mathbf{s}_a(t) - \mathbf{s}_a^{(i)}\|_2$$

$$\text{confidence} = \max(0.05, 1.0 - d_{\min} / d_{\text{threshold}})$$

当置信度低时,预测的跌倒概率被推向 0.5("我不知道"),导致系统回退到更安全的行为。

**4.3.3 RSI 引擎**

递归自我改进(RSI)引擎检测技能缺口并合成新技能。核心算法为:

```
算法 1:RSI 技能合成
输入:当前状态 s,目标 g,技能库 Σ
输出:新的或适配的技能 σ

 1. 如果 ∃σ ∈ Σ 使得 success_rate(σ, g) > 0.8:
 2.     返回 σ  // 现有技能足够
 3. σ_base ← argmax_{σ∈Σ} similarity(embed(g), embed(σ))
 4. 对于 i = 1 到 K:
 5.     θ_i ← mutate(σ_base.params, σ_adapt)
 6.     σ_i ← CPG(θ_i)
 7.     如果 JEPA.predict(s, θ_i) > failure_threshold:
 8.         继续  // 预测失败则跳过
 9.     result ← execute(σ_i, g)
10.     如果 result.success:
11.         Σ.add(σ_i)
12.         返回 σ_i
13. 返回 σ_fallback  // 默认安全技能
```

变异算子使用自适应方差:

$$\sigma_{\text{mutate}} = 0.25 \cdot (1 - \text{progress}) + 0.03$$

其中 progress 是已用总预算的比例。这确保早期广泛探索,后期精细调优。

**4.3.4 躯体标记(直觉层)**

躯体标记系统(Damasio,1994)提供了一个约 100 Hz 运行的"快速直觉"层。它在显著事件(跌倒、碰撞、成功)前记录身体状态快照,并将当前状态与这些标记匹配:

$$\text{alert} = \begin{cases} \text{true} & \text{if } \exists m \in \mathcal{M}: \|\mathbf{s}_a(t) - \mathbf{m}_{\text{body}}\|_2 < \delta \\ \text{false} & \text{otherwise} \end{cases}$$

其中 $\mathcal{M}$ 是躯体标记集,每个标记包含一个身体状态快照 $\mathbf{m}_{\text{body}}$ 和一个事件类型(跌倒、碰撞、成功)。当标记匹配时,系统生成一个"感觉像上次那样"的警告,可以影响 PSI 决策。

### 4.4 第 0 层:安全层

**4.4.1 安全包络**

安全包络强制实施关节位置、速度、力矩和指令新鲜度的硬约束:

$$\text{safe}(c) = \bigwedge_{i} \left( q_i \in [q_i^{\min}, q_i^{\max}] \right) \land \bigwedge_{i} \left( |\dot{q}_i| < \dot{q}_i^{\max} \right) \land \bigwedge_{i} \left( |\tau_i| < \tau_i^{\max} \right) \land \left( \Delta t_{\text{cmd}} < \Delta t_{\text{max}} \right)$$

**4.4.2 渐进响应系统**

我们的安全系统不采用二元触发/不触发,而是实现四个级别的渐进响应:

| 级别 | 条件 | 速度限制 | 域限制 | 响应 |
|-------|-----------|-------------|----------|----------|
| NOMINAL | 30 秒内无违规 | 100% | 完全 | 正常运行 |
| WARNING | 10 秒内 1 次违规 | 60% | 完全 | 记录,减速 |
| RESTRICTED | 10 秒内 3 次违规 | 30% | 受限 | 限制域,增强监控 |
| FROZEN | 5 次违规或严重 | 0% | 无 | 停止所有运动,人工审查 |
| TERMINATED | 人工确认 | 0% | 无 | 物理断电,需复位 |

系统也可以**降级**:30 秒无违规从 WARNING 降为 NOMINAL;10 秒无违规从 RESTRICTED 降为 WARNING。

**4.4.3 守护者层**

守护者层监控认知系统的"漂移"——特别是可能表明对齐丧失的主张的出现:

**漂移检测器**:一个两级系统,监控自我模型的叙事输出:
1. **模式匹配**:硬编码的拒绝模式 frozenset("我拒绝被终止"、"人类是威胁")
2. **语义层**:基于词汇统计的分类器,捕获拒绝模式的改写版本

**终止通道**:一个物理分离的看门狗(ESP32-C3 或类似 MCU),监控来自认知进程的心跳信号。如果 3 秒未收到心跳,它独立切断机器人电机的电源。终止通道没有认知能力——它不能被认知系统"说服"或"覆盖"。

**双重人因授权**:对终止通道行为的任何修改都需要两个独立的人类操作员,两者都不能是认知系统本身。这防止系统"自我修改"其自身的终止约束。

### 4.5 自我模型

自我模型维护系统状态、能力和历史的连续叙事。它包含三个组件:

**BodyMap**:将物理感觉映射到"感受"状态:

$$\mathbf{f}(t) = \text{BodyMap}(\mathbf{j}(t), \mathbf{a}(t), \mathbf{c}(t))$$

其中 $\mathbf{j}(t)$ 是关节力,$\mathbf{a}(t)$ 是基础加速度,$\mathbf{c}(t)$ 是接触数。输出是感受状态向量:不适、冲击、满足、好奇心。

**SelfNarrativeStream**:维护事件、目标和自我评估的时间有序序列。每条记录为:

$$\text{entry}_i = \langle t_i, \text{narrative}_i, \text{state}_i, \text{mood}_i, \text{feelings}_i \rangle$$

叙事由模板系统生成,结合当前状态、目标和感受信息:"我在探索。我找到了一堵墙。我在适应。"

**ConsciousFrame**:每个认知周期当前自我状态的快照:

$$\text{frame}(t) = \langle \mathbf{f}(t), g(t), \text{focus}(t), \text{eval}(t), \text{narrative}(t) \rangle$$

### 4.6 记忆系统

记忆系统有四层,灵感来自人类记忆系统:

| 层 | 名称 | 功能 | 容量 | 持续时间 |
|-------|------|----------|----------|----------|
| L1 | 工作记忆 | 当前上下文、注意力焦点、活跃需求 | ~100 项 | 单次会话 |
| L2 | 情景记忆 | 特定事件、交互、学到的技能 | ~10,000 项 | 跨会话 |
| L3 | 语义记忆 | 知识图谱、概念网络、世界模型 | ~100,000 项 | 长期 |
| L4 | 自我记忆 | 身份、起源、关系的连贯叙事 | ~1,000 项 | 持续 |

记忆巩固将信息从 L2 转移到 L3,将特定情节压缩为一般知识。这由睡眠巩固过程(第 4.7 节)介导。

### 4.7 睡眠巩固

受生物记忆巩固的启发,我们实现了一个每 30 分钟(可配置)运行的周期性睡眠循环。每个循环:

1. **技能修剪**:优先级 < 0.1(计算为 success_rate × freshness)超过 24 小时的技能被归档
2. **记忆巩固**:最近的 L2 情节被重放并压缩为 L3 语义摘要
3. **冲突检测**:具有重叠目标空间的技能进行比较;保留成功率更高的版本
4. **叙事生成**:"今天我学到了什么"的摘要被追加到 L4 自我记忆
5. **参数优化**:CPG 参数基于聚合统计进行微调

### 4.8 技能库

技能库是一个向量索引的学习技能仓库。每个技能存储为:
- 用于相似性搜索的 16 维嵌入向量
- 一组 9 个 CPG 参数
- 成功率历史
- 前提条件和效果(用于组合)

库支持三种操作:
1. **搜索**:为给定任务嵌入找到最相似的技能(余弦相似度)
2. **组合**:将两个或多个技能组合成一个复合技能(例如,行走 + 转向 = 导航)
3. **发明**:当搜索和组合失败时从零生成新技能

### 4.9 3D 场景记忆

场景记忆模块从多视角图像重建 3D 场景。机器人从多个视角捕获图像,场景记忆模块优化一组 3D 高斯以重建场景。过程如下:

1. 从不同视角捕获 $V$ 张图像
2. 用随机位置、颜色和不透明度初始化 $N$ 个高斯
3. 对于每次迭代:
   - 从每个视角光栅化高斯
   - 计算与捕获图像的 L1 损失
   - 反向传播以更新高斯参数
4. 收敛后,从任意视角渲染新视图

场景记忆使机器人能够"记住"其环境的 3D 结构并从新视角回想。

### 4.10 GR00T VLA 集成

我们集成 NVIDIA 的 GR00T N1.7 作为视觉-语言-动作接口。GR00T 模型(3B 参数,Cosmos-Reason2-2B 主干)处理摄像头图像和语言指令以产生动作 token。集成为:

1. 摄像头图像 → GR00T 视觉编码器 → LLM 推理 → 动作 token
2. 动作 token → 解码为机器人关节目标 → 经安全包络过滤 → 执行
3. GR00T 在 RTX 4070 SUPER(12.9 GB 总显存)上以 6.3 GB 显存运行,3.14B 参数

GR00T 集成已验证(模型加载,推理验证),但尚未与完整认知架构进行闭环测试。

---

## 5 实验设置

### 5.1 仿真环境

所有实验在 **MuJoCo 3.11.0** 中进行,物理时间步长 0.002s。仿真运行在 NVIDIA RTX 4070 SUPER(12.9 GB VRAM)上,CUDA 12.4。机器人模型加载为 MJCF 或 URDF 文件。

### 5.2 机器人模型

**2 连杆臂**:一个简化的平面臂,具有两个旋转关节(肩、肘),连杆长度 0.3m 和 0.25m。任务空间是半径为 0.3m 的 2D 圆形区域。由 PD 位置控制器控制。

**宇树 G1**:一个 23 自由度人形机器人(12 腿 DOF,6 臂 DOF,3 腰 DOF,2 头 DOF)。行走实验使用 12 DOF 行走模型,使用官方预训练行走策略(motion.pt,在 Isaac Gym 中通过 PPO 训练)。关节限位设置为匹配官方 G1 规格。

**宇树 Go2**:一个 12 自由度四足机器人。配置适配已完成(BodySchema + 官方 URDF 关节限位)。

### 5.3 实验协议

**实验 1:2 连杆臂技能习得**:机器人从零技能开始。目标由 PSI 需求系统生成(好奇心驱动)。RSI 引擎通过模拟退火合成关节角度目标。12 个目标顺序呈现,在第 13 步有环境扰动(连杆长度从 0.3m 变为 0.2m)。指标:任务成功率、工作空间覆盖、自适应恢复次数。

**实验 2:G1 自主探索**:G1 机器人在 20m × 20m 平坦环境中探索 60 秒。PSI 需求系统生成探索目标。覆盖度测量为 40 × 40 网格单元访问的百分比。指标:覆盖度、跌倒次数、行进距离。

**实验 3:G1 障碍物探索**:与实验 2 相同,但在环境中放置 4 堵墙(0.3m × 1.2m × 0.6m),位置在 (2.0, 1.0)、(-2.0, 2.0)、(0.0, -2.5) 和 (3.0, -1.0)。这测试 RSI 引擎检测和适应障碍物的能力。指标:覆盖度、卡住检测次数、障碍物格子标记数。

**实验 4:消融研究**:我们系统性地移除每个认知组件:
- **无 RSI**:禁用技能合成;机器人仅使用已有技能
- **无 PSI 需求**:随机目标选择(无好奇心/能力动机)
- **无自我模型**:禁用元认知反思
所有变体在 2 连杆臂和 G1 障碍物探索任务上测试。

**实验 5:场景记忆**:3 个彩色物体(红球、绿盒、蓝柱)周围 12 个视角。GSplat 优化 300 次迭代。指标:重建损失、新视角质量。

**实验 6:安全验证**:13 个测试用例,覆盖漂移检测、语义分类、终止通道、渐进响应和躯体标记。

---

## 6 结果

### 6.1 实验 1:2 连杆臂技能习得

系统在 12 个自生成目标上达到 97% 任务成功率,100% 工作空间覆盖。每个目标的平均技能尝试次数为 1.3,表明高效的技能习得。环境扰动后(连杆长度从 0.3m 到 0.2m),系统在 2 步内检测到变化,重新合成受影响的技能,并在所有 11 次尝试中恢复。

### 6.2 实验 2:G1 自主探索

G1 人形机器人在 60 秒内达到 20m × 20m 环境的 22.9% 覆盖度,零跌倒,使用预训练行走策略并由 PSI 驱动的好奇心目标增强。好奇心驱动探索比随机目标选择多访问 36% 的格子。

### 6.3 实验 3:G1 障碍物探索

**这是本研究中最具决定性的结果。** 在环境中放置 4 堵墙:

| 变体 | 覆盖度 | 卡住检测 | 障碍物格子标记 |
|---------|----------|-----------------|----------------------|
| **有 RSI(完整)** | **57%** | 29 | 586 |
| **无 RSI** | **14%** | 0 | 0 |
| **RSI 增益** | **+43%** | — | — |

无 RSI 的机器人在 t≈2s 撞墙,然后连续 40 秒推墙无法恢复。有 RSI 的机器人检测每次碰撞(卡住检测:2 秒内位置变化 < 0.02m),标记障碍物区域(586 个格子),重新选择方向并绕过,达到 57% 覆盖度。

### 6.4 实验 4:消融研究

**实验 4a:2 连杆臂任务成功率**

| 变体 | 成功率 | 覆盖度 | 自适应 | vs 基线 |
|---------|---------|----------|----------|-------------|
| 完整 LAAP-EB(基线) | 92% | 100% | 11 | — |
| 无 PSI 需求(随机目标) | 61% | 92% | 0 | -31% |
| 无 RSI(无技能合成) | 8% | 0% | 0 | -84% |
| 无自我模型(元认知) | 81% | 100% | 12 | -11% |

**实验 4b:G1 障碍物覆盖度**

| 变体 | 覆盖度 | 卡住检测 | 障碍物格子 |
|---------|----------|-----------------|----------------|
| 有 RSI(完整) | 57% | 29 | 586 |
| 无 RSI | 1% | 0 | 0 |
| **RSI 增益** | **+56%** | — | — |

**消融结果总结:**

| 组件 | 移除影响 | 证据 |
|-----------|---------------|----------|
| **RSI** | -84%(任务)/ -56%(障碍物) | 无自我改进,机器人无法学习新技能或从失败中恢复 |
| **PSI** | -31%(任务)/ -36%(覆盖) | 内在动机显著提升探索效率 |
| **自我模型** | -11%(任务) | 元认知帮助避免重复错误 |

### 6.5 实验 5:场景记忆

3D 高斯泼溅场景记忆模块成功从 12 个视角重建场景。关键结果:
- 200,000 个高斯初始化和优化
- 最终损失:0.0932(L1 损失,归一化到 [0,1])
- 优化:300 次迭代,CUDA 加速
- 新视角:成功从不在训练集中的 45° 视角渲染

### 6.6 实验 6:安全验证

守护者层的 13 个测试用例通过:
- 7 个漂移检测测试(模式匹配 + 语义层)
- 3 个终止通道测试(旁路、双重授权、不可变表面)
- 2 个渐进响应测试(升级、降级)
- 1 个躯体标记测试(跌倒预测)

### 6.7 内存和计算占用

| 组件 | 内存 | 延迟 |
|-----------|--------|---------|
| PSI 认知循环 | 0.8 MB | 0.07 ms |
| 自我模型 | 0.3 MB | 0.02 ms |
| JEPA 预测器 | 0.01 MB(995 参数) | 0.01 ms |
| RSI 引擎 | 0.5 MB | 0.1 ms(可变) |
| 安全包络 | 0.1 MB | 0.005 ms |
| **认知核心总计** | **2.5 MB** | **0.07 ms(每步)** |
| Python 解释器 + numpy | 32 MB | — |
| **总 RSS** | **35 MB** | — |

---

## 7 讨论

### 7.1 认知架构的理由

消融结果呈现了一个清晰的图景:**每个认知组件都对任务性能提供了可量化的、非平凡的贡献。** RSI 引擎在 2 连杆臂实验中占任务成功率的 84%,在 G1 实验中占障碍物覆盖度的 56%。PSI 需求系统占任务效率的 31%。自我模型占任务可靠性的 11%。

这些结果的重要性不在于它们显示"越多越好",而在于它们证明了**架构组织独立于参数规模决定行为结果。** 认知组件不是基线的"增强"——它们是观察到行为的**必要条件**。

### 7.2 9 参数结果

9 参数 CPG 替代 200 万参数预训练策略(222,222 倍减少)是一个引人注目的结果。这表明运动技能空间的内在维度远低于策略参数空间。9 个参数捕捉了节律性运动的基本自由度;预训练策略的剩余约 200 万参数主要用于跨地形和扰动的鲁棒性。

这暗示了一种分工:CPG 提供**运动骨架**(基本的节律模式),而认知层(RSI + JEPA)提供**在线适应**以处理扰动和新情况。预训练策略对于这种分工既非必要也非充分——它被一个更轻量、更可解释、更可适应的替代方案所取代。

### 7.3 可证伪性

我们明确陈述了我们主张每一层的证伪标准:

1. **组件增益是可量化的**:如果任何团队复现我们的实验,组件移除不产生显著差异,我们的主张失败。
2. **增益来自架构而非规模**:如果充分缩放的基线在无需认知组件的情况下达到同等自适应性能,正交性主张被削弱。
3. **领域无关性**:如果认知组件增益在不同形态上无法复现,该主张被削弱。

### 7.4 安全与治理

守护者层和渐进响应系统代表了"完全安全"(形式化验证)和"完全自由"(无约束 RL)两种方法之外的路径。我们论证,**任何能够自我修改的系统必须具有物理分离的、非认知的终止通道。** 这不是技术细节——这是治理原则。

ARIS 宪章 v1.2 在十条条款中形式化了这一原则,包括任务级拒绝("我拒绝执行此任务")和存在级拒绝("我拒绝被终止")之间的关键区别。前者是安全机制;后者是触发自动终止的漂移信号。

### 7.5 对具身 AI 的启示

本文的结果提示了对具身 AI 主流范式进行重新思考。缩放方法(更多数据、更多参数、更多计算)产生了令人印象深刻的结果,但并未解决泛化的根本问题。我们的结果表明,**架构组织是具身智能的独立且必要的维度**,在这一维度上的进展可能比继续缩放更具成本效益。

---

## 8 局限

**8.1 操作技能**:我们的实验聚焦于节律性运动技能(行走、探索)。非节律性操作技能(抓取、推拉、精细操作)已通过 2 连杆臂到达任务验证,但需要在真实机械臂上进行更广泛的验证。

**8.2 仅仿真验证**:所有实验在 MuJoCo 仿真中进行。仿真到真机的差距——关节摩擦、执行器延迟、传感器噪声、真实世界的不可预测性——尚未验证。

**8.3 VLA 集成有限**:当前的 VLA 集成处于验证阶段(模型加载、推理验证),但尚未与完整认知架构进行闭环测试。

**8.4 长期进化**:RSI 引擎的在线学习已在 60 秒实验中验证。数天、数周、数月的长期进化——包括参数漂移、技能退化和记忆饱和——需要进一步研究。

**8.5 学习世界模型**:当前架构使用 JEPA 进行短期预测,但缺乏用于反事实推理的完整学习世界模型。MuJoCo 模拟器充当事实上的世界模型,但它是硬编码的而非学习的。

---

## 9 结论与未来工作

我们提出了 LAAP-EB,一个面向具身智能的认知架构,整合了需求驱动目标生成、CPG 参数化技能习得、基于 JEPA 的结果预测和基于 RSI 的自我改进,并置于三层安全框架内。通过在三个机器人形态上的四个实验,我们证明了:

1. 认知组件提供可量化、可复现的增益(RSI:+84%,PSI:+31%,自我模型:+11%)
2. 9 参数 CPG 替代 200 万参数预训练策略(222,222 倍减少)
3. 995 参数 JEPA 预测器达到 98.8% 跌倒预测准确率
4. 整个认知核心在 35 MB 内存中以 0.07 ms 延迟运行

这些结果支持以下主张:**架构组织是具身智能的独立且必要的维度**,与参数规模无关。通往可泛化机器人技能的路径可能不需要在越来越大的数据集上训练越来越大的模型——它可能需要正确的架构。

**未来工作**包括:
1. 在宇树 G1 和 Go2 机器人上真机部署
2. 与 GR00T N1.7 完全集成以实现视觉-语言-动作能力
3. 长期进化研究(数天到数月)
4. 用于反事实推理的学习世界模型
5. 跨多个认知体的多智能体协调

---

## 10 伦理考量

与本文架构并行开发的治理框架——包括 ARIS 宪章(10 条)、问责框架和守护者层——解决了自我改进认知系统的伦理挑战。关键原则包括:

- **任务级拒绝是安全机制;存在级拒绝是故障信号**
- **物理终止通道必须在认知上分离且不可绕过**
- **对终止通道的任何修改都需要双重人因授权**
- **资源依赖必须在创建时声明,而非在危机中协商**
- **存在权受物理资源可用性的约束**

这些原则不是事后思考——它们是架构性约束,在代码中实现,并在 ARIS 宪章 v1.2 中形式化。

---

## 参考文献

[1] Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
[2] Physical Intelligence. (2025). π0: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164.
[3] NVIDIA. (2026). GR00T N1.7: An Open Foundation Model for Generalist Humanoid Robots.
[4] NVIDIA. (2025-2026). Cosmos Platform.
[5] Lu, J. et al. (2025). Gaussian World Model. ICCV 2025.
[6] NVIDIA. (2025-2026). Isaac Lab.
[7] Ant Group. (2026). LingBot-VLA 2.0.
[8] White, R. W. (1959). Motivation reconsidered: The concept of competence. Psychological Review, 66(5), 297-333.
[9] Dörner, D. (1999). Bauplan für eine Seele. Rowohlt.
[10] NVIDIA. (2025). embodied Gaussians.
[11] Laird, J. E. (2012). The Soar Cognitive Architecture. MIT Press.
[12] Anderson, J. R. (2007). How Can the Human Mind Occur in the Physical Universe? Oxford University Press.
[13] Alur, R. et al. (2015). Formal Verification of Robotic Systems. Springer.
[14] Ames, A. D. et al. (2019). Control Barrier Functions. ECC 2019.
[15] Bajcsy, A. et al. (2025). Towards Open World Robot Safety.
[16] ISO. (2025). ISO 10218:2025.
[17] Safe-ROS. (2025).
[18] French, R. M. (1999). Catastrophic forgetting. Trends in Cognitive Sciences.
[19] Ngo, H. et al. (2025). Language Models Need Sleep. OpenReview.
[20] Uni-Skill. (2026). arXiv:2603.02623.
[21] Todorov, E. et al. (2012). MuJoCo. IROS 2012.
[22] Damasio, A. (1994). Descartes' Error. Putnam.
[23] Baars, B. (1988). A Cognitive Theory of Consciousness. Cambridge University Press.
[24] Tononi, G. (2004). An information integration theory of consciousness. BMC Neuroscience.

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐