读懂具身智能三层架构:系统0/1/2,机器人从“思考”到“行动”的底层逻辑
·
当下人形机器人、具身智能快速迭代,很多人疑惑:为什么大模型智商很高,落地到机器人躯体却频繁摔倒、动作卡顿、响应迟缓?
核心症结只有一个:大模型是秒级慢思考,机器人躯体需要毫秒级实时控制。单一模型无法同时兼顾高层语义推理和底层物理稳定控制。
为此,行业在传统认知科学双系统理论基础上,演化出了适配机器人工程落地的系统0/系统1/系统2 三层分层异步架构。目前 Figure
AI、逐际动力、智元机器人等主流厂商,均已采用这套架构作为新一代具身智能的核心范式。
本文从零拆解三层系统的定位、运行逻辑、技术栈、落地价值,同时对比传统架构、厘清行业误区,帮你彻底搞懂具身智能的底层运行逻辑。
一、架构起源:从心理学双系统到机器人三系统
- 经典理论基础
诺贝尔经济学奖得主卡尼曼在《思考,快与慢》中提出人类认知双系统:
- 系统1(快思考):直觉、反射、无意识、极速响应
- 系统2(慢思考):逻辑、推理、规划、有意识、低响应
这套理论仅适用于认知层面,无法解决机器人的物理躯体控制问题——机器人需要维持平衡、抵御环境扰动、保障硬件安全,这是纯认知模型无法覆盖的底层能力。
- 行业创新:新增系统0,补齐物理层能力
2025年起,头部机器人企业统一补充系统0(本能运控层),形成完整的三层架构:系统2(认知规划)→ 系统1(动作执行)→ 系统0(躯体稳控)。
核心设计思想:分层异步、独立闭环、故障隔离,让“慢思考的AI大脑”和“超快响应的机器躯体”完美适配。
二、三层系统深度拆解:定位、频率、职责、技术栈
- 系统2|认知规划层(指挥官·大脑皮层)
运行频率:7–10Hz(秒级/数百毫秒级)
核心定位:负责“想明白做什么”,全局语义与任务规划
作为整个机器人的最高决策层,系统2不参与具体动作生成,只专注高层认知任务,是机器人的“智慧大脑”。
核心能力:
- 理解自然语言指令、解析场景语义、识别物体与环境关系
- 长序列任务拆解、多步骤逻辑规划、常识推理与决策
- 世界模型推演、记忆调用、复杂场景策略调整
- 输出抽象高层目标,而非具体电机、关节指令
落地示例:接收指令“收拾桌面”,拆解为「走到桌前→识别杂物→抓取物品→放入收纳盒→整理桌面」完整任务链。
核心技术栈:大语言模型LLM、多模态视觉语言模型VLM、世界模型、任务规划算法
- 系统1|动作执行层(士官·小脑)
运行频率:100–200Hz
核心定位:负责“规划怎么做”,将抽象目标转化为连贯动作
系统1是承上启下的核心枢纽,承接系统2的抽象任务,结合实时视觉传感数据,生成连续、平滑的全身动作轨迹,是机器人的“运动中枢”。
核心能力:
- 将高层任务目标拆解为逐帧全身关节姿态轨迹
- 实时感知环境变化,微调动作路径,规避静态障碍
- 封装各类运动技能:行走、抓取、开关门、搬运等
- 输出标准化姿态目标,下发给系统0执行
落地示例:接收“抓取水杯”目标,实时生成手臂伸展、手部开合、躯干适配的连续动作序列。
核心技术栈:视觉-语言-动作模型VLA、运动模仿学习、行为策略模型
- 系统0|躯体稳控层(本能·脊髓反射)
运行频率:500–1000Hz(1kHz 毫秒级闭环)
核心定位:负责“稳住身体”,保障物理安全与动作落地
系统0是机器人最底层、优先级最高的核心层级,也是区别于传统AI模型的关键。它不理解任务、不分析语义,只专注躯体物理稳定,属于本能式硬闭环控制。
核心能力:
- 全身动力学解算、重心实时调控、行走平衡维持,防摔倒
- 力控柔顺交互、碰撞检测、突发扰动应急反射
- 将系统1的姿态轨迹,转化为精准电机扭矩指令
- 独立闭环、自主容错:上层系统卡顿、失效、断电时,依然维持躯体稳定
落地示例:机器人行走脚底打滑、手臂触碰障碍物,系统0毫秒级调整关节扭矩、修正姿态,避免摔倒、硬件损坏,全程无需大脑参与思考。
核心技术栈:传统MPC模型预测控制、WBC全身控制、人体运动先验模型、高频力控算法
三、完整工作链路:从一句话到一个动作
以用户指令“走到餐桌旁,拿起水杯喝水”为例,三层系统协同全流程:
- 系统2(秒级思考):理解指令语义,规划完整路径,输出高层目标:移动至餐桌、定位水杯、执行抓取、模拟喝水动作
- 系统1(百毫秒级执行):结合视觉识别水杯位置,生成行走、抬手、抓取的连续关节轨迹,实时微调动作姿态
- 系统0(毫秒级稳控):高频跟踪动作轨迹,实时调整重心、抵消地面颠簸、控制抓取力度,保障动作平稳、安全落地
整个过程三层异步并行:系统2慢慢思考后续任务,系统1持续优化动作,系统0始终守住躯体底线,互不阻塞、互不干扰。
四、架构核心优势:为什么成为行业标配?
- 解决“快慢矛盾”,适配机器人物理特性
大模型推理存在延迟,无法适配机器人毫秒级控稳需求。三层架构通过分级频率闭环,让认知、动作、稳控各司其职,彻底解决“思考太慢、动作不稳”的行业痛点。 - 故障隔离,大幅提升机器人安全性
传统单模型架构,一旦大模型卡顿、推理出错,机器人直接失控倒地。而三层架构中,系统0独立运行、优先级最高,上层AI失效不影响底层躯体稳定,极大降低硬件损坏风险。 - 解耦迭代,研发效率翻倍
三层系统技术栈完全解耦,可独立迭代优化:
- 升级系统2大模型,提升智能理解能力,无需改动底层控制
- 优化系统0运动控制算法,提升平衡、柔顺度,无需调整上层规划
- 适配真实复杂物理场景
真实环境存在颠簸、摩擦、突发扰动,纯端到端模型泛化性差。系统0的物理动力学闭环,能精准适配真实物理规则,让机器人动作更贴合人类、更稳定可靠。
五、主流厂商落地方案对比
- Figure AI Helix 02(行业标杆)
- 系统2:拓展长序列复杂场景规划,支持多步骤家居、工业连续任务
- 系统1:200Hz VLA模型,实现像素到关节姿态的快速映射
- 系统0:基于海量人体运动数据训练的全身控制模型,替代传统手工奖励函数,动作更自然、柔顺
- 国内厂商(逐际动力、智元机器人)
- 沿用三层核心架构,部分厂商新增系统0.5作为运动先验层,补充动作约束与姿态先验
- 侧重优化工业场景稳控、室内复杂环境适配,强化系统0的抗扰动能力
- 英特尔算力适配方案
针对三层架构异构特性,定制算力分配:系统2/1依赖AI算力做推理,系统0依赖高精度实时CPU算力,实现算力与任务的精准匹配,最大化边缘落地效率。
六、常见认知误区澄清
误区1:系统0/1/2是心理学原生理论
正解:心理学仅含系统1/2,系统0是机器人具身智能的工程创新扩展,专为物理躯体控制设计。
- 误区2:三层系统需要同步运行、互相等待
正解:核心是异步独立闭环,各层级自有运行频率,互不阻塞。
- 误区3:端到端单模型可以替代三层架构
正解:单模型无法兼顾秒级推理与毫秒级稳控,泛化性、安全性、稳定性远不如分层架构,无法落地工业级场景。
七、行业趋势:三层架构是具身智能的终极底座?
当前具身智能的核心演进方向,已经从“堆大模型参数”转向认知+动作+物理控稳的分层协同。
未来行业迭代将聚焦两点:
- 上下层打通:优化三层系统的信息交互效率,减少层级延迟,让规划更贴合物理执行特性
- 先验增强:系统0持续积累人体运动、物理交互先验,系统1强化通用动作技能,系统2升级世界模型推理能力
可以确定:系统0/1/2分层架构,将成为未来人形机器人、通用具身智能的标准基础架构。
八、全文总结
用一句通俗的话总结三层系统的核心价值:
- 系统2:帮机器人看懂世界、想明白要做什么;
- 系统1:帮机器人把想法变成一套流畅的动作流程;
- 系统0:帮机器人稳住身体、扛住环境扰动,守住安全底线。
脱离三层架构的具身AI,只是“只会思考的代码”;只有完整落地0/1/2分层体系,机器人才能真正实现像人一样思考、像人一样运动、稳定安全落地。
原创总结:本文完整拆解具身智能三层架构的理论起源、技术细节、落地案例与行业趋势,适合AI从业者、机器人开发者、技术爱好者入门与深度学习。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)