摘要

具身智能系统并不是一个先在内部形成完整世界模型、再由中央决策器选择动作的封闭计算系统。它必须通过身体与环境持续交互,在不完整、异步甚至相互矛盾的信息基础上生成行动,并根据行动结果不断修正对当前情境的理解。丹尼尔·丹尼特提出的“多重草稿模型”虽然最初用于解释人类意识,却为理解这种分布式、动态和行动导向的智能提供了一个有价值的理论视角。

本文首先说明什么是多重草稿模型以及什么是具身智能系统,继而分析二者之间的结构对应关系。本文认为,具身智能可以被理解为一个以活动为组织骨架、以多重场景草稿为解释结构、以预测模型为前瞻机制、以身体行动为检验手段的动态运行系统。在这一系统中,智能不依赖一份唯一、完整的世界表征,而产生于多个局部解释的并行形成、相互竞争、协同传播和持续修订。

关键词: 多重草稿模型;具身智能;场景驱动;世界模型;可供性;活动模型;语义运行架构


一、问题的提出

传统人工智能系统经常被描述为一条从输入到输出的计算链条:

[
感知 -> 世界建模 -> 任务规划 -> 动作执行
]

按照这种理解,智能系统首先通过传感器获得环境信息,然后在内部建立一幅相对完整的世界图景,再由某个中央决策模块根据目标选择动作。

这种架构在结构化程度较高、环境变化较小的场景中具有工程价值。但是,当智能系统真正进入开放的物理世界,它就会面临一系列更复杂的问题:

  • 不同传感器获得的信息并不同步;

  • 感知结果可能不完整或相互矛盾;

  • 环境会在计算过程中持续变化;

  • 物体的意义取决于任务和身体能力;

  • 动作不仅改变环境,也改变系统可以获得的信息;

  • 很多判断只有在接触和行动之后才能得到验证。

例如,机器人在抓取一个软包装之前,很难只靠视觉确定它的刚度、重量、重心和摩擦特性。这些属性必须在接近、接触、施力和调整过程中逐步显现。因此,机器人不是先完全认识物体再采取行动,而是在行动中形成和修正对物体的认识。

这意味着,具身智能需要的可能不是一份静态、统一和最终完成的世界模型,而是一种能够同时容纳多个暂时解释,并通过身体行动持续检验这些解释的运行结构。

丹尼特的多重草稿模型,为理解这种结构提供了一个重要入口。

二、什么是多重草稿模型

1. 模型的理论背景

多重草稿模型由美国哲学家丹尼尔·丹尼特提出,主要用于解释意识经验如何由大脑的分布式信息加工活动产生。

丹尼特所反对的是一种根深蒂固的意识观:外界信息经过感觉器官进入大脑,经过加工之后被送到某个中央位置,并在那里形成一幅完整的意识画面;一个内在的“自我”则观看这幅画面并作出决定。

丹尼特把这种想象称为“笛卡尔剧场”。

在这个剧场中,大脑仿佛是一座电影院:

  • 感官负责拍摄素材;

  • 神经系统负责剪辑;

  • 意识是最终放映的电影;

  • 自我是坐在影院中的观众。

问题在于,如果大脑内部还存在一个观看信息的观察者,那么又是什么机制使这个观察者能够理解它所看到的内容?这种解释实际上只是把意识问题转移到了一个更小的内部主体上,并没有真正解决问题。

2. 没有中央剧场,也没有唯一终稿

多重草稿模型认为,大脑中并不存在一个负责接收所有信息的中央意识位置。外界事件进入神经系统以后,会在不同区域中引发大量并行、局部和异步的信息加工活动。

例如,一个人看到车辆驶来时,大脑中可能同时发生:

  • 视觉系统识别物体轮廓;

  • 运动系统判断车辆速度和方向;

  • 记忆系统调用道路经验;

  • 情绪系统产生紧张反应;

  • 语言系统形成“有车过来了”的表达;

  • 身体控制系统准备后退。

这些加工过程并不需要首先汇总成一份完整报告,再交给一个中央自我。它们会相互影响、彼此修正,并分别作用于注意、记忆、语言和行动。

丹尼特将这些不断形成和变化的局部解释称为“草稿”。“草稿”不是大脑中真实存在的文字文档,而是对暂时性认知加工结果的比喻。

所谓“多重”,表示同一事件可以同时形成多个不完全相同的解释;所谓“草稿”,表示这些解释都不是不可修改的最终版本。

3. 意识是一种系统影响力

在传统解释中,一个信息似乎必须先“进入意识”,然后才能影响记忆、语言和行为。多重草稿模型则反过来认为,一个内容之所以被称为有意识,正是因为它对认知系统产生了足够广泛和持续的影响。

某个局部解释可能很快消失,也可能:

  • 改变注意方向;

  • 进入工作记忆;

  • 引起情绪反应;

  • 控制身体动作;

  • 成为语言报告内容;

  • 参与后续推理;

  • 被写入长期记忆。

因此,意识不是大脑中的一个特殊地点,也不一定对应一个精确的发生时刻。它更像是某些信息加工结果在整个系统中获得传播能力和行为影响力的过程。

多重草稿模型的核心可以概括为:

系统内部不存在一份被中央观察者观看的唯一终稿;所谓统一经验,是多个并行解释经过竞争、传播、修订和使用之后形成的动态效果。

三、什么是具身智能系统

1. 智能并不只存在于“大脑”或算法中

具身智能系统是指具有某种物理身体,能够通过身体感知环境、作用于环境,并在持续交互中形成适应性行为的智能系统。

这里的“身体”可以是:

  • 移动机器人的底盘和传感器;

  • 机械臂及其末端执行器;

  • 人形机器人的关节和触觉表面;

  • 无人车辆的车身、轮胎和动力系统;

  • 自主设备的各种物理执行机构。

具身智能强调,智能并不仅仅来自一个抽象算法。系统的身体结构、传感能力、动作能力以及所处环境,共同决定了系统能够认识什么和完成什么。

同一个台阶对不同身体具有不同意义:

  • 对轮式机器人可能是障碍;

  • 对足式机器人可能是可攀爬结构;

  • 对无人机可能几乎没有通行意义;

  • 对搬运机器人则可能是货物滑落风险。

因此,环境中的对象并不天然具有固定的行动意义。对象的意义来自它与系统身体、任务目标和当前情境之间的关系。

2. 具身智能的基本闭环

具身智能的基本结构不是单向的信息处理链,而是一个持续运行的闭环:

[
感知 -> 解释 -> 行动 -> 环境变化 -> 再感知
]

在这个闭环中,行动具有双重作用。

第一,行动用于改变环境、推进任务。例如移动、抓取、装配和搬运。

第二,行动也是一种认识世界的方法。例如机器人轻触物体可以判断其刚度,调整视角可以减少遮挡,试探性抓取可以估计重量和摩擦力。

因此,在具身智能中,感知和行动不能被完全分开。行动不是认知完成之后的输出,而是认知形成过程的组成部分。

3. 具身智能不同于一般的自动控制系统

并非所有具有传感器和执行器的自动化设备都属于强意义上的具身智能系统。传统控制系统通常运行在明确的对象、固定的状态空间和预定义的控制规则中。

具身智能系统则更强调:

  • 对开放环境的感知;

  • 对不确定情境的解释;

  • 对行动可能性的发现;

  • 对行动结果的预测;

  • 在交互中修正认知;

  • 面对变化时调整策略;

  • 将身体能力纳入决策过程。

因此,具身智能的关键不只是“能够动作”,而是能够在身体—环境循环中形成、检验和更新行动依据。

四、多重草稿模型与具身智能的结构对应

多重草稿模型最初并不是机器人设计方法,但它揭示了一种适合具身智能的认知组织原则:系统不需要先形成一份唯一、完整的世界描述,也可以产生连贯、有目标的行为。

具身系统中的不同模块,可以同时形成关于当前情境的多种“草稿”。

草稿类型 典型内容
视觉草稿 前方物体可能是一个可抓取容器
空间草稿 目标处于机械臂可达区域边缘
接触草稿 夹爪已经接触,但可能尚未稳定夹紧
对象草稿 物体可能是柔性而非刚性结构
任务草稿 当前抓取活动接近完成
风险草稿 继续增加夹持力可能损坏物体
动作草稿 应降低速度并调整抓取角度
解释草稿 本次抓取失败可能由物体滑移引起

这些草稿并不一定能够立即合并成一份完全一致的世界模型。它们可以分别服务于不同功能:

  • 视觉草稿引导注意;

  • 空间草稿约束运动规划;

  • 风险草稿限制动作范围;

  • 接触草稿触发控制调整;

  • 任务草稿更新活动进度;

  • 解释草稿支持经验学习和人机沟通。

因此,具身系统中的智能不一定来自某个无所不知的中央决策器,而可以来自多个局部解释之间的协调。

五、从“世界草稿”进一步走向“行动草稿”

如果只是把草稿理解为多份环境描述,仍然没有充分体现具身智能的特点。具身系统真正需要的不是单纯说明“世界是什么”,而是判断“在当前条件下可以做什么”。

例如,“桌面上有一个红色圆柱体”只是对象描述。对于准备抓取它的机器人,更重要的问题包括:

  • 它是否可抓取;

  • 从哪个方向抓取;

  • 当前夹爪能否适配;

  • 抓取路径是否被遮挡;

  • 需要施加多大夹持力;

  • 动作失败可能产生什么后果。

这类判断可以用“可供性”概念来说明。可供性不是对象孤立的属性,而是对象、身体能力和行动目标之间形成的关系。

因此,具身系统中的一份草稿可以表示为:

[
D_i = (C_i, A_i, P_i, R_i, Conf_i)
]

其中:

  • (C_i) 表示对当前情境的判断;

  • (A_i) 表示可能采取的动作;

  • (P_i) 表示动作结果预测;

  • (R_i) 表示风险和约束;

  • (Conf_i) 表示当前置信度。

这种草稿不是静态的世界表征,而是一种暂时的“情境—行动假设”。

例如:

当前物体可能是柔性包装;如果降低夹持速度并增加接触面积,抓取成功率可能提高;但如果从顶部施加过大压力,包装可能变形。

这比单纯识别物体类别更接近具身智能真正需要的语义。

六、身体如何检验和筛选草稿

多重草稿模型强调不同解释之间的竞争和传播;在具身智能中,身体与环境的实际交互为这种竞争增加了一个关键筛选机制。

一份草稿是否有效,不仅取决于内部推理是否一致,还取决于:

  • 动作是否能够执行;

  • 任务是否得到推进;

  • 预测是否符合实际反馈;

  • 是否满足安全约束;

  • 时间和能耗是否可接受;

  • 接触结果是否符合预期;

  • 环境变化是否超出假设。

系统可以按照下式对行动草稿进行动态评价:

[
Score(D_i)=
w_gG_i+w_fF_i+w_pP_i-w_rR_i-w_cC_i
]

其中:

  • (G_i) 是目标推进程度;

  • (F_i) 是身体可执行性;

  • (P_i) 是预测与反馈的一致性;

  • (R_i) 是风险;

  • (C_i) 是时间、能耗等成本。

但这不意味着系统最后只能保留一份草稿。不同草稿可以同时发挥作用:

  • 动作草稿决定运动方向;

  • 风险草稿限制速度和作用力;

  • 任务草稿判断阶段是否完成;

  • 预测草稿监测结果偏差;

  • 解释草稿记录失败原因。

多重草稿之间因而既有竞争关系,也有协同关系。

七、机器人抓取过程中的多重草稿

假设机器人需要抓取一个外观不规则的软包装。

在尚未接触物体时,系统可能形成以下草稿:

  • 草稿A:物体看起来像刚性盒体,可以直接夹取;

  • 草稿B:表面形状表明它可能发生变形;

  • 草稿C:正面抓取路径最短;

  • 草稿D:侧面抓取虽然较慢,但可能更稳定;

  • 草稿E:当前视觉信息不足,需要主动改变观察角度。

机器人改变摄像头或身体位置后,新的视觉信息可能强化草稿B和草稿D。夹爪接触物体后,压力传感器检测到表面发生明显形变,“刚性盒体”的解释便被削弱。

系统随即可能:

  1. 降低夹持力;

  2. 调整抓取角度;

  3. 增加接触面积;

  4. 修订对象属性模型;

  5. 更新后续运动预测;

  6. 将此次经验写入情景记忆。

在整个过程中,并不存在一个时刻,机器人突然获得了关于物体的完整真相。对物体的认识是在行动中逐步形成的,后续草稿不断重写早期草稿。

由此可以得到一个重要结论:

具身智能不是根据完整知识采取行动,而是通过行动逐步获得足以继续行动的知识。

八、场景驱动:草稿生成的组织背景

多重草稿并不是在没有边界的认知空间中任意产生。对于工程系统来说,必须由当前场景限制草稿的生成范围。

场景可以表示为:

[
Scene =
Goal + Activity + Body + Environment + Constraint + History
]

即:

  • 当前目标是什么;

  • 正在进行什么活动;

  • 身体处于什么状态;

  • 环境中存在哪些关系;

  • 必须满足哪些约束;

  • 此前发生了什么。

同一个物体在不同场景中可能形成完全不同的草稿。一块金属板可以是:

  • 搬运活动中的目标对象;

  • 移动活动中的障碍物;

  • 装配活动中的待安装零件;

  • 检测活动中的测量对象;

  • 安全管理中的坠落风险;

  • 视觉系统中的标定参照物。

系统不需要首先确定金属板在所有条件下“本质上是什么”,而应判断它在当前活动中意味着什么,以及它提供或限制了哪些行动可能性。

因此,场景驱动不是简单地为算法增加背景数据,而是为多重草稿提供生成条件、解释边界和评价标准。

九、活动模型与多重草稿的分工

具身智能的工程实现不能让所有情境因素都进入一个无限复杂的状态空间。一个更可行的办法,是把“活动执行状态”和“场景解释草稿”分开。

1. 活动层保持状态简单

系统首先把任务分解为足够细的活动。例如,抓取过程可以分解为:

[
目标定位 -> 接近 -> 接触
-> 夹紧 -> 提升 \-> 搬运
]

每个活动只维护少量清晰、可验证的状态。例如“接触”活动可以具有:

[
Ready -> Running -> Completed
]

或者更具体地表示为:

[
未接触 -> 初始接触 -> 稳定接触
]

这种细粒度活动分解可以避免用一个高度复杂的多维状态描述整个任务。

2. 草稿层容纳不确定解释

在“初始接触”这个简单状态周围,可以同时存在多种解释:

  • 已经接触,但位置可能偏移;

  • 已经接触,但物体可能滑动;

  • 已经接触,但当前压力可能过大;

  • 已经接触,但接触面积可能不足。

这些判断不是执行状态本身,而是关于状态意义、风险和后续行动的不同草稿。

由此可以形成一项重要的架构原则:

活动状态应尽可能简单、单义和可验证;场景解释则允许多重、暂时、概率化和可修订。

活动模型为系统提供稳定的运行骨架,多重草稿为系统提供适应不确定环境所需的认知弹性。

十、一个多重草稿式具身智能架构

从系统架构上看,可以将多重草稿式具身智能划分为六类相互连接的能力。

1. 多模态感知

从视觉、听觉、触觉、力觉、位置、速度和设备状态中获得信息。不同感知通道不必先强制融合为一份完整描述。

2. 草稿生成

针对当前活动生成多个局部解释,包括对象假设、关系判断、可供性、风险和候选动作。

3. 预测与评价

预测不同动作可能导致的结果,并根据目标推进、可执行性、安全性和资源成本评价草稿。

4. 活动组织

通过活动模型、任务网络或者行为结构维护任务进程,决定当前哪些草稿具有实际相关性。

5. 动作执行与反馈

通过控制器执行动作,采集动作结果和预测误差。行动既推进任务,也为草稿选择提供证据。

6. 记忆与修订

把成功模式、失败原因和情境变化写入经验记忆,用于修正后续草稿生成和评价机制。

其运行关系可以表示为:

flowchart TD
    A["身体—环境交互"] --> B["多模态感知"]
    B --> C["多重场景草稿"]
    C --> D["预测、约束与评价"]
    D --> E["活动选择与动作控制"]
    E --> A
    E --> F["结果与预测误差"]
    F --> C
    F --> G["记忆与学习"]
    G --> C

图中不存在一个“中央观察者”。活动控制也不是读取一份已经完成的世界报告,而是在多个局部草稿和现实反馈之间持续形成暂时稳定的行动依据。

十一、与世界模型和JEPA的关系

多重草稿模型并不排斥世界模型。它改变的是我们对世界模型的理解。

传统观点容易把世界模型理解为系统内部唯一、完整的现实副本。多重草稿视角下的世界模型则可以是:

  • 局部的;

  • 多尺度的;

  • 面向任务的;

  • 具有不同置信度的;

  • 可以相互竞争的;

  • 随行动持续更新的。

JEPA一类预测架构可以在其中承担重要作用。它不必逐像素重建整个未来世界,而可以在抽象表征空间中预测某个动作将如何改变与任务有关的状态。

二者可以形成如下分工:

  • 多重草稿机制负责生成“当前情境可能是什么”;

  • 世界模型或JEPA负责预测“采取某个动作以后可能发生什么”;

  • 活动模型负责说明“系统目前为什么要采取行动”;

  • 身体反馈负责检验“此前的解释和预测是否有效”。

因此,预测模型不必充当全知的中央模型,而可以成为不同草稿调用的前瞻性能力。

十二、从多重草稿到动态语义运行

从语义运行架构的角度看,具身智能中的草稿可以采用如下形式:

[
D_i =
(Activity,\ State,\ ObjectRelation,\ Affordance,
Prediction,\ Risk,\ Confidence)
]

其中:

  • (Activity):当前活动;

  • (State):活动的简单执行状态;

  • (ObjectRelation):身体、对象和环境之间的关系;

  • (Affordance):当前可采取的行动;

  • (Prediction):行动可能产生的结果;

  • (Risk):安全、质量和资源约束;

  • (Confidence):解释的可信程度。

这种结构的意义在于,语义不再只是对现实对象的静态分类,而成为系统在当前场景中组织行动的依据。

系统维护的不是一幅凝固的“现实地图”,而是现实与目标之间不断变化的多种行动解释。某些解释会进入控制环路,某些解释会触发安全限制,某些解释会成为记忆,另一些解释则会因为缺乏证据而消失。

因此,具身智能可以被视为一种动态语义运行系统:

系统围绕当前活动持续生成关于身体—环境关系的多重解释,并通过预测、行动和反馈对这些解释进行选择与修订。

十三、多重草稿视角的工程价值

这一视角至少能够为具身智能系统带来五方面启发。

第一,避免对完整世界模型的过度依赖

系统只需形成与当前活动相关、足以支持下一步行动的局部模型,不必等待全局建模完成。

第二,容纳多传感器之间的不一致

视觉、触觉和力觉可以暂时保留不同解释,通过后续行动和反馈消除矛盾,而不必过早强制融合。

第三,支持不确定条件下的渐进式行动

系统可以采用试探性动作获取更多信息,在行动过程中逐步提高判断可信度。

第四,增强系统的可解释性

如果草稿具有显式结构,系统就可以说明:

  • 当前存在哪些候选解释;

  • 哪些证据支持这些解释;

  • 为什么选择某个动作;

  • 哪些风险限制了动作;

  • 新反馈如何改变了判断。

第五,为场景驱动架构提供认知基础

场景决定哪些草稿值得生成,活动决定哪些草稿与当前目标有关,身体反馈决定哪些草稿具有现实有效性。三者共同避免系统陷入无边界的通用推理。

十四、模型的局限与实现边界

多重草稿模型是一种认知解释框架,并不是完整的机器人算法。它不能直接回答以下工程问题:

  • 草稿采用什么数据结构;

  • 草稿如何生成、评分和淘汰;

  • 不同时间尺度如何协调;

  • 实时控制如何满足确定性要求;

  • 安全规则如何获得不可被竞争机制覆盖的优先级;

  • 学习模型如何与传统控制器集成;

  • 多个机器人之间如何共享草稿。

工程实现仍需结合其他方法:

工程问题 可采用的方法
活动分解与组织 分层任务网络、行为树、活动模型
状态预测 世界模型、JEPA、预测编码
动作规划 运动规划、模型预测控制
连续动作学习 强化学习、模仿学习
可行动性表达 可供性模型
风险控制 安全状态机、控制屏障函数
草稿传播 注意力机制、工作空间机制
经验修订 情景记忆、在线学习
显式语义治理 本体模型、事件模型、语义契约

尤其需要强调:安全约束不能仅仅作为一份普通草稿参与竞争。在工业机器人、无人车辆等安全关键系统中,速度限制、碰撞防护和紧急停止等机制必须拥有明确的架构优先级和确定性的控制边界。

十五、结论

多重草稿模型为具身智能提供的最重要启发,并不是让机器人模仿人类意识,而是帮助我们摆脱一种过度中心化的智能想象。

具身智能系统不必先构造一份完整、统一、最终正确的世界模型,再由一个中央决策器读取这份模型并发出命令。它可以围绕当前活动,同时形成多个局部、暂时和可修订的情境解释,让这些解释分别参与预测、行动、安全控制、记忆和语言表达,并通过身体与环境的实际交互持续检验它们。

从这一视角出发,具身智能可以被概括为:

一个以活动模型为组织骨架、以多重场景草稿为解释结构、以预测模型为前瞻机制、以身体行动为认知手段、以环境反馈为检验依据的动态语义运行系统。

这一解释同时保留了两个重要原则:

一方面,执行层的活动和状态应尽可能细化、简单和可验证;另一方面,认知层应允许多个场景解释并行存在,容纳不确定性、局部冲突和持续修订。

具身智能的统一性并不一定来自一个全知的中央控制者,而可能来自大量局部过程围绕共同活动形成的动态协调。智能也不只是系统内部对世界进行计算的能力,而是系统借助身体,在行动中不断形成世界意义的能力。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐