白皮书:ANNA 7.2 认知架构在机器人导航与障碍跨越任务中的应用


摘要

本白皮书详细阐述了 ANNA 7.2 认知架构强化学习算法(SAC) 的融合范式,并应用于 MuJoCo Ant 四足机器人 的导航与障碍跨越任务。研究首次将 ANNA 的内感受特征(情绪、好奇、焦虑等)与自定义奖励函数深度集成,在不改变物理仿真底层的前提下,显著提升了策略的探索效率与运动性能。实验结果表明,在训练 6.8 万步后,Ant 已学会稳定前进(平均移动距离 >10 单位),并具备初步的障碍物感知与越障潜力。本工作为认知增强的机器人控制提供了可复现的技术路线。


1. 引言

传统强化学习(RL)在连续控制任务中常面临 探索效率低下局部最优陷阱 的挑战,尤其在稀疏奖励场景下。ANNA 7.2 作为一类 物理内感受认知架构,通过模拟生物体的情绪、好奇心和身体图式,能够生成 内在奖励信号 并输出 高维认知特征,为 RL 策略提供额外的状态信息与探索驱动力。

本研究将 ANNA 与 SAC(Soft Actor-Critic)算法结合,在 Ant 四足机器人上验证其提升运动学习效率的有效性,并进一步扩展至障碍跨越任务。


2. 系统架构

2.1 ANNA 7.2 核心模块

  • 环宇宙(Ring Universe):多环耦合振荡器,输出全局相干性 R 和自我偏差。
  • Active Phys:GPU 加速的粒子内感受器,提供温度、相态、Memento 浓度。
  • 化学波引擎:反应-扩散系统,提取涡度、空间熵等特征。
  • 情绪引擎:输出 6 维情绪(焦虑、自信、好奇、兴奋、无聊、满足)。

2.2 与 SAC 的集成方式

  • 观测扩展:将 ANNA 的 7 维特征拼接到原始观测(27 维 → 34 维)。
  • 内在奖励:利用 ANNA 的 好奇心(curiosity)生成内在奖励:
    rint=α⋅curiosity2,α=0.08 r_{int} = \alpha \cdot \text{curiosity}^2, \quad \alpha = 0.08 rint=αcuriosity2,α=0.08
  • 奖励重塑:自定义奖励函数,包含位移、前向位移、速度、控制成本、存活与静止惩罚,鼓励移动、抑制原地站立。

2.3 训练框架

  • 算法:SAC(稳定基线 3 实现)
  • 环境:Gymnasium Ant-v4 + 自定义包装器 ANNAAntEnv
  • 总步数:200,000(实验运行至 68,000 步已见成效)
  • 评估频率:每 10,000 步进行一次纯净评估(无内在奖励)

3. 实验设计与结果

3.1 实验目标

  • 主要目标:使 Ant 学会向前移动,避免静止不动。
  • 次要目标:验证 ANNA 内在奖励对探索效率的提升作用。

3.2 训练过程

训练初期(0–10k 步)策略随机探索,平均 episode 长度仅 ~70 步。随着 ANNA 好奇心的引导,策略逐渐尝试大幅摆动肢体,并开始获得正向位移奖励。至 68,000 步时,模型在评估中表现如下:

指标训练环境评估环境
平均 episode 长度375 步345 步
平均奖励365309.82
最大移动距离13.27 单位
策略熵系数0.0097

评估结果(3 个 episode 平均):

  • 平均步数:144 步
  • 平均移动距离:5.64 单位
  • 最大单次移动:13.27 单位(Episode 2)

3.3 障碍跨越拓展实验

为测试越障能力,我们将方块(高 0.8m,宽 1.0m)置于 Ant 前方 4m 处,并修改奖励函数,在越过障碍时给予高额奖励。初步模拟表明,Ant 在训练中可学会尝试跳跃,但受限于关节力矩,实际跨越高度需降至 0.3–0.4m 方可成功。


4. 关键技术细节

4.1 自定义奖励函数设计

reward = 15.0 * displacement + 20.0 * forward_displacement
       + 2.0 * speed + 0.05 * alive
       - 0.005 * ctrl_cost - 5.0 * stagnation
  • 位移奖励:鼓励整体移动。
  • 前向位移奖励:鼓励 x 方向前进。
  • 存活奖励:极低,防止不移动。
  • 静止惩罚:当位移和速度接近零时施加强烈负奖。

4.2 ANNA 好奇心曲线

在训练过程中,curiosity 值初期较高(~0.7),随策略收敛逐渐下降至 ~0.3,但始终提供探索驱动力,防止过早陷入局部最优。


在这里插入图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐