机器人为什么需要两个大脑?从 WRC 主论坛谈具身智能的组织层
今年具身智能的技术叙事,几乎全部压在同一层:VLA、端到端、抓取成功率、轨迹泛化。视觉模型看得准不准,动作模型抓得稳不稳,论文和demo都在回答一个问题——单台机器人"自己"够不够聪明。
但有一个问题被系统性地忽略了:一台机器人足够聪明之后,它怎么和另一台机器人、和企业里跑了十年的排班系统、和后台那群数字Agent一起干活?
2026年8月20日世界机器人大会主论坛上,明略科技创始人吴明辉抛出了一个跟主流叙事方向不同的判断:机器人下半场需要两个大脑,一个是单体推理大脑,负责感知和动作;另一个是组织大脑,负责协作和调度。第一个大脑很多团队在做,第二个大脑,谈的人不多。
这篇想把第二个大脑单独拎出来讲:它的技术定义是什么、为什么VLA scale up解决不了这层问题、这套判断背后的框架从哪来、以及现阶段能落地到什么程度。
单体VLA解决不了任务分派:感知控制和编排是两类完全不同的问题
先把分工说清楚。
第一个大脑是个体智能。技术上是VLM+VLA这条链路:摄像头画面进,关节角度和末端执行器动作出。它解决的是"单台机器人怎么把一个动作做对"——识别桌上的杯子、规划一次抓取、控制力度不把杯子捏碎。OpenVLA、π0、VLA-JEPA,这些工作都在往这个方向使劲。
第二个大脑是组织智能。它不关心某个动作准不准,它关心的是多个执行者之间怎么分工:仓库里分拣机器人、搬运机器人、盘点系统谁先动谁后动,出了异常转给谁,新订单怎么插进现有作业队列。这些问题不发生在某个模型内部,发生在模型和模型之间、机器人和企业既有IT系统之间。
为什么说这层靠"把VLA做得更大"补不上?原因不在参数量,在于问题的输入输出结构根本不一样。
感知控制有明确的输入输出对:画面进去,动作出来,可以端到端训练,数据闭环在物理世界里就能转。组织协调的输入端连着企业的排班系统、库存系统、工单系统,接口格式千差万别,不属于任何一个训练集能穷举的范围;更关键的是这些系统天然带着企业自己的业务规则——谁优先级高、什么情况要人工介入,这些规则随实际运营不断调整,不是一次训练能固化下来的。
数字Agent领域这几年其实已经替具身世界踩过这个坑。早期大家也试过用一个足够强的通用模型覆盖所有业务逻辑,后来发现把业务规则用结构化方式显式表达出来,再让模型在这套结构里做决策,比让模型隐式学会所有规则要稳定得多,可调试性也好得多。具身世界大概率会重走这条路,只是现在大部分团队还在死磕第一个大脑。
一个已经在发生的例子:洗碗机器人卖给餐厅,硬件到位了,VLA模型到位了,餐厅没减人也没提效。原因不是机器人洗不干净碗,是没人告诉它什么时候该洗、碗从哪拿、洗完放哪、后厨有人挡路的时候该等还是该绕——这些都是编排问题,不是感知问题。单个VLA模型练得再强也回答不了"这个任务该派给哪台机器人",因为这从来不是感知问题,是调度问题。
HAO框架:八年前就为"人机协作"搭好了骨架,现在外延第一次扩展到物理设备
"组织智能"不是这次WRC现场造的概念。
早在2018年,HAO的框架就被提出来了:H是Human(人),A是AI,O是Organization(组织)。核心设想是:人、Agent、机器人接入同一张协作网络,靠分工产生组织级生产力,不指望某一个体把所有能力都长在自己身上。
关键在那个"A"。八年前提出HAO的时候,物理机器人这条线还远没成熟,"A"主要指数字世界的软件Agent,落地场景是人和数字Agent协作做流程自动化。这几年VLA快速成熟,机器人第一次具备了基本的感知和动作能力,HAO框架里的"A"才真正把外延扩展到了物理设备。
这也是为什么"两个大脑"这个判断不是拍脑袋的类比,而是HAO框架在具身场景的自然延伸:HAO里的"O"(组织层)在数字世界已经被验证过一遍,现在要回答的问题是——这套编排逻辑能不能原样延伸到物理世界,把机器人作为一种新的执行者角色接进来。
明略在数字世界做Octo,本质上是在把HAO的数字半跑通:多个数字Agent怎么分工、怎么共享上下文、怎么把每次执行的反馈沉淀成可复用的经验。WRC上和海康机器人的联合探索,验证的就是这套编排能力往物理世界走的第一步。软件与模型归明略,硬件本体归海康,现在的阶段是联合探索,不是已经有了成熟方案。
CoALA四层记忆搬到机器人身上:能对上两层半,剩下的两层要重新长
组织大脑要跑起来,记忆架构是绕不开的一环。
数字Agent领域这两年有个被广泛引用的记忆框架叫CoALA,把Agent记忆拆成四层:工作记忆、情景记忆、语义记忆、程序性记忆。
把这套框架直接往机器人身上套,能对上和对不上的地方都很清楚:
程序性记忆对应机器人的技能库,VLA本身就是技能的一种编码方式,现成的,不用新做。
语义记忆对应机器人的概念知识——"垃圾"和"可回收物"是两个分类,"玻璃杯摔了会碎"是物理常识,和数字Agent的知识表示是同一类问题,理论上可以共用一套表示层。
工作记忆对应当前任务的临时状态,两边都需要,结构上大体能对上。
真正对不上的,是情景记忆往下要拆出两个新东西,数字Agent的记忆框架里原本根本不存在。
第一个是空间记忆。数字Agent的情景记忆记的是"发生过什么"——哪个API调了、哪步操作失败了。机器人还要多记一层"发生在哪个位置":桌子在哪、门在哪、上次抓取失败是手臂角度问题还是光线问题、充电座在走廊的哪一端。这些空间坐标和物理状态的编码方式,跟文本/结构化日志完全不是一回事。
第二个是时序任务轨迹记忆。一个多步物理任务,每一步跟上一步之间有严格的时空依赖:你得先拉开抽屉才能拿里面的东西,杯子得先放到桌子边缘才好抓。数字Agent一步做错大不了重试回滚,机械臂一步做错可能已经把东西碰倒了,物理世界没有undo。这要求记忆系统不仅要记录"做了什么",还要记录"在什么物理状态下做的、做完之后世界变成什么样了"。
还有一个更隐蔽的问题:"本体"这个词在数字世界和具身世界指的根本不是一回事。
数字世界说的本体(Ontology),是概念和关系的抽象结构——Palantir Foundry里那套objects/links语义层、知识图谱里的schema都属于这一类。机器人工程师说的本体,指的是物理结构本身:一个关节、一段连杆、一个执行器的运动学参数。两边用同一个词,说着完全不同的东西。要让机器人真正听懂人和数字Agent在说什么,这两种"本体"最终要打通到同一套语义层——这件事现在还没有成熟方案,也是组织大脑往具身延伸必须解决的基础问题之一。
L1到L5:具身智能的组织层会有一条跟数字Agent同构的演化路径,但答案还没写完
数字Agent的组织层演化大致经历了五级:L1 token ready(模型能对话)→ L2 工作在线(能接API执行任务)→ L3 共享结构化记忆(多个Agent能读写同一个上下文)→ L4 加杠杆(经验沉淀复用,不用每次从头教)→ L5 水涨船高(组织级智能随使用持续提升)。具身世界大概率会走一条同构的路:先让机器人能可靠执行单个指令(L1-L2),再解决多机器人共享空间记忆和任务状态(L3),然后把维修经验、故障处理流程沉淀成可复用的技能库(L4),最终走向整个物理作业系统的持续优化(L5)。
但具体到每一级怎么实现——空间记忆用什么编码、物理任务的回滚机制怎么设计、异构机器人之间的任务描述用什么协议——这些问题现在都还在探索阶段,没有标准答案。
写这篇的目的不是宣布一个已经解决的问题,而是把这个判断和它背后的技术逻辑摆出来,给同样在做这件事的人一个可以检验、可以反驳、可以继续讨论的起点。
数字世界的多Agent编排这几年踩过的坑——上下文窗口不够用、Agent之间消息协议不统一、业务规则硬编码难维护、经验无法有效沉淀——具身世界大概率都会再踩一遍,只是踩坑的成本从"API调用失败"变成了"机械臂撞坏东西"。提前把这些坑在数字世界踩一遍,把编排框架和记忆架构的工程经验攒下来,再往物理世界延伸的时候至少不用从零开始。
Octo目前在GitHub开源,核心是多Agent编排、上下文共享和经验沉淀这套组织层能力。如果你在做多机器人协作、具身记忆架构、或者数字/物理混合编排方向的工作,代码和Issue都在:
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)