当下人形机器人、具身智能快速迭代,很多人疑惑:为什么大模型智商很高,落地到机器人躯体却频繁摔倒、动作卡顿、响应迟缓?

核心症结只有一个:大模型是秒级慢思考,机器人躯体需要毫秒级实时控制。单一模型无法同时兼顾高层语义推理和底层物理稳定控制。
为此,行业在传统认知科学双系统理论基础上,演化出了适配机器人工程落地的系统0/系统1/系统2 三层分层异步架构。目前 Figure
AI、逐际动力、智元机器人等主流厂商,均已采用这套架构作为新一代具身智能的核心范式。
本文从零拆解三层系统的定位、运行逻辑、技术栈、落地价值,同时对比传统架构、厘清行业误区,帮你彻底搞懂具身智能的底层运行逻辑。

一、架构起源:从心理学双系统到机器人三系统

  1. 经典理论基础
    诺贝尔经济学奖得主卡尼曼在《思考,快与慢》中提出人类认知双系统:
  • 系统1(快思考):直觉、反射、无意识、极速响应
  • 系统2(慢思考):逻辑、推理、规划、有意识、低响应
    这套理论仅适用于认知层面,无法解决机器人的物理躯体控制问题——机器人需要维持平衡、抵御环境扰动、保障硬件安全,这是纯认知模型无法覆盖的底层能力。
  1. 行业创新:新增系统0,补齐物理层能力
    2025年起,头部机器人企业统一补充系统0(本能运控层),形成完整的三层架构:系统2(认知规划)→ 系统1(动作执行)→ 系统0(躯体稳控)。
    核心设计思想:分层异步、独立闭环、故障隔离,让“慢思考的AI大脑”和“超快响应的机器躯体”完美适配。

二、三层系统深度拆解:定位、频率、职责、技术栈

  1. 系统2|认知规划层(指挥官·大脑皮层)
    运行频率:7–10Hz(秒级/数百毫秒级)
    核心定位:负责“想明白做什么”,全局语义与任务规划
    作为整个机器人的最高决策层,系统2不参与具体动作生成,只专注高层认知任务,是机器人的“智慧大脑”。
    核心能力:
  • 理解自然语言指令、解析场景语义、识别物体与环境关系
  • 长序列任务拆解、多步骤逻辑规划、常识推理与决策
  • 世界模型推演、记忆调用、复杂场景策略调整
  • 输出抽象高层目标,而非具体电机、关节指令
    落地示例:接收指令“收拾桌面”,拆解为「走到桌前→识别杂物→抓取物品→放入收纳盒→整理桌面」完整任务链。
    核心技术栈:大语言模型LLM、多模态视觉语言模型VLM、世界模型、任务规划算法
  1. 系统1|动作执行层(士官·小脑)
    运行频率:100–200Hz
    核心定位:负责“规划怎么做”,将抽象目标转化为连贯动作
    系统1是承上启下的核心枢纽,承接系统2的抽象任务,结合实时视觉传感数据,生成连续、平滑的全身动作轨迹,是机器人的“运动中枢”。
    核心能力:
  • 将高层任务目标拆解为逐帧全身关节姿态轨迹
  • 实时感知环境变化,微调动作路径,规避静态障碍
  • 封装各类运动技能:行走、抓取、开关门、搬运等
  • 输出标准化姿态目标,下发给系统0执行
    落地示例:接收“抓取水杯”目标,实时生成手臂伸展、手部开合、躯干适配的连续动作序列。
    核心技术栈:视觉-语言-动作模型VLA、运动模仿学习、行为策略模型
  1. 系统0|躯体稳控层(本能·脊髓反射)
    运行频率:500–1000Hz(1kHz 毫秒级闭环)
    核心定位:负责“稳住身体”,保障物理安全与动作落地
    系统0是机器人最底层、优先级最高的核心层级,也是区别于传统AI模型的关键。它不理解任务、不分析语义,只专注躯体物理稳定,属于本能式硬闭环控制。
    核心能力:
  • 全身动力学解算、重心实时调控、行走平衡维持,防摔倒
  • 力控柔顺交互、碰撞检测、突发扰动应急反射
  • 将系统1的姿态轨迹,转化为精准电机扭矩指令
  • 独立闭环、自主容错:上层系统卡顿、失效、断电时,依然维持躯体稳定
    落地示例:机器人行走脚底打滑、手臂触碰障碍物,系统0毫秒级调整关节扭矩、修正姿态,避免摔倒、硬件损坏,全程无需大脑参与思考。
    核心技术栈:传统MPC模型预测控制、WBC全身控制、人体运动先验模型、高频力控算法

三、完整工作链路:从一句话到一个动作

以用户指令“走到餐桌旁,拿起水杯喝水”为例,三层系统协同全流程:

  1. 系统2(秒级思考):理解指令语义,规划完整路径,输出高层目标:移动至餐桌、定位水杯、执行抓取、模拟喝水动作
  2. 系统1(百毫秒级执行):结合视觉识别水杯位置,生成行走、抬手、抓取的连续关节轨迹,实时微调动作姿态
  3. 系统0(毫秒级稳控):高频跟踪动作轨迹,实时调整重心、抵消地面颠簸、控制抓取力度,保障动作平稳、安全落地
    整个过程三层异步并行:系统2慢慢思考后续任务,系统1持续优化动作,系统0始终守住躯体底线,互不阻塞、互不干扰。

四、架构核心优势:为什么成为行业标配?

  1. 解决“快慢矛盾”,适配机器人物理特性
    大模型推理存在延迟,无法适配机器人毫秒级控稳需求。三层架构通过分级频率闭环,让认知、动作、稳控各司其职,彻底解决“思考太慢、动作不稳”的行业痛点。
  2. 故障隔离,大幅提升机器人安全性
    传统单模型架构,一旦大模型卡顿、推理出错,机器人直接失控倒地。而三层架构中,系统0独立运行、优先级最高,上层AI失效不影响底层躯体稳定,极大降低硬件损坏风险。
  3. 解耦迭代,研发效率翻倍
    三层系统技术栈完全解耦,可独立迭代优化:
  • 升级系统2大模型,提升智能理解能力,无需改动底层控制
  • 优化系统0运动控制算法,提升平衡、柔顺度,无需调整上层规划
  1. 适配真实复杂物理场景
    真实环境存在颠簸、摩擦、突发扰动,纯端到端模型泛化性差。系统0的物理动力学闭环,能精准适配真实物理规则,让机器人动作更贴合人类、更稳定可靠。

五、主流厂商落地方案对比

  1. Figure AI Helix 02(行业标杆)
  • 系统2:拓展长序列复杂场景规划,支持多步骤家居、工业连续任务
  • 系统1:200Hz VLA模型,实现像素到关节姿态的快速映射
  • 系统0:基于海量人体运动数据训练的全身控制模型,替代传统手工奖励函数,动作更自然、柔顺
  1. 国内厂商(逐际动力、智元机器人)
  • 沿用三层核心架构,部分厂商新增系统0.5作为运动先验层,补充动作约束与姿态先验
  • 侧重优化工业场景稳控、室内复杂环境适配,强化系统0的抗扰动能力
  1. 英特尔算力适配方案
    针对三层架构异构特性,定制算力分配:系统2/1依赖AI算力做推理,系统0依赖高精度实时CPU算力,实现算力与任务的精准匹配,最大化边缘落地效率。

六、常见认知误区澄清

误区1:系统0/1/2是心理学原生理论

正解:心理学仅含系统1/2,系统0是机器人具身智能的工程创新扩展,专为物理躯体控制设计。

  • 误区2:三层系统需要同步运行、互相等待

正解:核心是异步独立闭环,各层级自有运行频率,互不阻塞。

  • 误区3:端到端单模型可以替代三层架构

正解:单模型无法兼顾秒级推理与毫秒级稳控,泛化性、安全性、稳定性远不如分层架构,无法落地工业级场景。

七、行业趋势:三层架构是具身智能的终极底座?

当前具身智能的核心演进方向,已经从“堆大模型参数”转向认知+动作+物理控稳的分层协同。
未来行业迭代将聚焦两点:

  1. 上下层打通:优化三层系统的信息交互效率,减少层级延迟,让规划更贴合物理执行特性
  2. 先验增强:系统0持续积累人体运动、物理交互先验,系统1强化通用动作技能,系统2升级世界模型推理能力
    可以确定:系统0/1/2分层架构,将成为未来人形机器人、通用具身智能的标准基础架构。

八、全文总结

用一句通俗的话总结三层系统的核心价值:

  • 系统2:帮机器人看懂世界、想明白要做什么;
  • 系统1:帮机器人把想法变成一套流畅的动作流程;
  • 系统0:帮机器人稳住身体、扛住环境扰动,守住安全底线。
    脱离三层架构的具身AI,只是“只会思考的代码”;只有完整落地0/1/2分层体系,机器人才能真正实现像人一样思考、像人一样运动、稳定安全落地。

原创总结:本文完整拆解具身智能三层架构的理论起源、技术细节、落地案例与行业趋势,适合AI从业者、机器人开发者、技术爱好者入门与深度学习。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐