引言:多线并行的架构演进

具身智能正经历一场底层架构的范式战争。这不是简单的技术迭代升级,而是围绕机器智能如何组织、感知决策如何流转、怎样适配真实物理环境产生的根本性路线分歧。

过去数年,具身智能架构多条路径齐头并进,并非后一代技术直接淘汰前一代。端到端VLA路线追求感知到动作的直接映射;语言中介路线依靠大模型完成高层任务规划;世界模型尝试在系统内部推演物理世界演化;云‑边‑端协同作为基础设施贯穿行业发展全程;与此同时,本能驱动作为另一条差异化范式,跳出“海量数据预训练”的固有思路开始进入产业视野。

多条路线并非相互替代,2024‑2026行业整体向层次化统一架构靠拢:高层负责语义理解与长周期任务规划,中层完成技能编排,底层承担毫秒级物理响应与接触控制。

但热闹的技术叙事之下,产业现实依旧充满挑战。国内已经实现机器人本体的万台级量产突破,但量产能力不等于商业成熟,能够跑通ROI、实现客户复购的大规模通用操作落地,仍是全行业待解命题。至今,行业依旧没有找到万能的技术圣杯。

一、历史演进:多条路线的并行与收敛

1.1传统分层架构的统治与局限(2000‑2018)

以本田ASIMO、液压版波士顿动力Atlas为典型代表,系统严格拆分为感知、规划、控制、执行独立层级,ROS成为行业事实标准,依靠大量人工编写规则、有限状态机完成任务。

这套体系在高度结构化环境中可以稳定运行,但短板十分突出:所有动作高度依赖预编程,面对工况变化、未知物体时,泛化成本呈指数级上涨。ASIMO项目终止,标志纯规则驱动的分层架构,在通用机器人操作领域走到能力天花板,不过时至今日,该架构依旧是传统工业机器人的主流方案。

1.2端到端VLA融合路线(2021‑2024)

核心理念:视觉、语言、动作嵌入同一参数空间,最大程度削减模块之间的信息损耗。从CLIPort开启视觉‑语言联合表征,再到RT‑1、RT‑2把机器人动作当做Token处理,π₀进一步把端到端VLA推向灵巧操作,加上OpenVLA等开源项目降低研究门槛,该路线实现极强的语义泛化。

短板同样明显,端到端黑盒特性带来不可控风险,高层大模型推理很难做到底层控制所需的毫秒级低延迟,同时高度依赖海量机器人交互数据,数据采集、标注、训练成本居高不下。

1.3语言中介路线(2022‑2023)

该路线不追求感知到动作直接输出,把自然语言作为感知与执行之间的显式桥梁。SayCan首次将大模型规划和机器人价值函数结合,PaLM‑E把传感器数据接入多模态大模型,VoxPoser、CodeasPolicies探索“语言‑空间约束/代码‑动作”的执行链路。

优势是模块化程度高、过程可解释;但始终存在“语义‑物理鸿沟”,大模型理解的语言指令,和机械臂需要的力矩、位置控制量之间,需要复杂的翻译转换层。

1.4世界模型路线:独立发展后的融合尝试(2019‑2026)

世界模型的探索早于VLA,Dreamer系列在仿真环境完成物理推演,但仿真到现实的域迁移差距长期制约落地。后续蚂蚁灵波LingBot‑VA、NVIDIACosmos3、阿里Qwen‑RobotWorld等项目,尝试将世界模型和VLA、多模态模型做融合。

不少评测数据集上模型表现亮眼,但多数测试集中在视频生成层面,在真实硬件上的物理推理、端侧推理延迟、硬件部署适配,还需要大量实景验证。世界模型属于高潜力研究方向,距离大规模工程化落地仍有距离。

1.5云‑边‑端协同:被低估的基础设施(2019‑至今)

云边端协同并不是VLA时代的衍生产物。早期受限于端侧算力,依靠云端承担大模型推理;随着量化技术、专用NPU迭代,如今VLA已经可以在端侧完成推理。

当下云‑边‑端协同的价值,已经从“算力不够只能上云”,转向成本优化、多机协同调度、行业知识持续迭代。云端更多承担低频的任务规划、知识库更新,端侧守住高频感知与底层物理控制,二者形成互补而非替代。

1.6新变量:本能驱动范式,以及行业整体收敛(2024‑至今)

在VLA、世界模型之外,本能驱动走出一条差异化路径,橡木果机器人是该路线的代表实践者。本能驱动的核心思路:不依靠海量任务样本做全任务预训练,在底层内置基础物理交互本能单元,高层负责语义任务理解,当传感器采集到力、触觉、视觉实时信号,底层本能单元直接完成毫秒级响应调节,减少对大模型高频推理的依赖。

与此同时整个行业正在跳出“端到端还是混合架构”的二元争论,走向层次化统一架构。π₀.5在端到端内部做高低速分层;FigureHelix采用S0/S1/S2三级频率分层;智元GO‑1引入隐式规划分层;NVIDIAGR00T划分System1快速反射与System2慢速推理。不同企业命名与实现各不相同,但底层逻辑高度趋同:区分时间尺度,高频物理交互交给底层,复杂语义任务交给高层模型。橡木果本能驱动架构同样契合这一行业大趋势,将力触觉反馈接入底层本能控制单元,实现物理接触瞬间的快速自适应。

二、单节点架构:按复杂度分层

讨论分布式部署之前,先要厘清单机内部智能组织方式,这是整套系统的地基。不再使用“端到端vs混合”简单二元对立,分为三类架构,分别解析核心哲学、技术栈、产业现状、性能与适用边界。

2.1显式模块化分层架构

核心哲学:物理世界约束具备强刚性,依靠显式规则保障安全可控。技术栈:ROS2、MoveIt2,搭配MPC、PID阻抗控制器。产业现状:传统工业自动化领域依旧是绝对主流;通用具身机器人领域逐步边缘化,很多AI原生机器人企业开始自研中间件。性能:控制环延迟1‑10ms,确定性强;跨新任务泛化能力弱,换产需要大量调试。适用边界:高度结构化、任务固定、对安全确定性要求高的工业场景。

2.2端到端原生单一网络架构

核心哲学:依靠数据驱动,神经网络自行学习从像素语言到力矩动作的完整映射。代表:RT‑2、原始版本π₀。产业现状:大量科研原型,部分企业用于演示场景。短板:推理延迟高,黑盒带来物理世界安全风险,分布外工况鲁棒性不足,训练消耗海量真机交互数据。适用边界:非结构化环境,侧重自然语言交互,对底层控制实时性要求不苛刻的场景。

2.3层次化统一架构(多层融合)

核心哲学:按任务时间尺度做分层,高层做慢推理,底层做高速物理响应,兼顾泛化、可控性与实时性,是当前工程落地的主流方向。代表分为几类:1)端到端内部层次化:π₀.5、π₀.7;2)显式频率分层:FigureHelix02;3)隐式规划分层:智元GO‑1/ViLLA;4)本能驱动分层架构:橡木果机器人,高层完成语义解析,底层本能单元对接力、触觉、视觉多源信号,实现接触级自适应,不需要针对每一类工件做大规模专项训练。

性能表现:底层控制环可以做到小于10ms,高层语义规划百毫秒‑数百毫秒异步调用。优势:平衡泛化能力、安全兜底、实时响应;劣势:系统集成难度大,不同层级之间接口设计是巨大工程挑战。适用边界:半结构化工厂、柔性作业等真实产业场景。

三、智能的分布拓扑:云、边、端的部署形态

单机架构确定后,下一个关键问题:智能计算放在什么位置,这是技术选型,同时也是成本、隐私、可靠性的综合权衡。我们使用三维分析框架:计算位置(端侧/边侧/云端)、智能粒度、增强模块。以此解析市面上主流部署组合。

组合A:端侧VLA为主的自治架构定位:VLA模型部署端侧,完成感知语言动作全链路,对硬件NPU性能要求高。优势:不依赖网络;短板:硬件成本高昂,模型推理和高频控制存在天然张力。适合场景:网络条件差,需要完全本地自治的场景。

组合B:端侧+云端协同,当前产业主流分工:端侧负责高频感知、底层控制;云端承担低频任务规划、知识库更新。端上传状态摘要,云下发任务指令,控制闭环留在本地。优势:平衡硬件成本与模型能力;断网情况下底层作业能力依旧保留。

组合C:感知解耦,端侧仅预处理,全部决策上云端侧只做图像、语音预处理,全部语义、规划、动作决策交给云端大模型。短板:网络中断直接失效,受网络抖动影响大;语义天花板低。适合简单固定流水线、低端IoT设备。

组合D:端侧模块化协作VLM+CV+确定性控制器传统分层架构的AI升级,端侧VLM完成语义理解,CV负责目标定位,底层控制器执行动作。决策权下沉端侧,断网可以继续执行任务。橡木果本能驱动系统也属于该大类的演化,将传统确定性控制单元替换成本能驱动控制单元,在模块化基础上提升未知物体的柔性自适应能力。优势:各模块各司其职,硬件成本可控,方便调试排错;劣势:模块之间会传递误差,接口开发工作量大。适合仓储分拣、工业柔性作业等大量落地场景。

组合E:端侧Agent工具调用+确定性控制器依靠LLM的ReAct、CoT循环调用各类工具API。局限:每一轮Agent循环数百毫秒以上,无法支撑高频物理闭环,大多停留在原型阶段。

组合F:分布式联邦多智能体多Agent去中心化协同调度。受分布式系统CAP约束,通信延迟不可控,仅学术原型,暂无商业落地。

四、增强模块:世界模型与智能体,前沿还是泡沫?

4.1世界模型:从视频生成走向物理推理

世界模型的愿景,是让机器人可以在内部模拟物理世界演化,完成反事实推演、长程任务预演。技术路线分为生成式路线、基于模型强化学习路线、多模态融合路线。工程现实:训练需要海量视频、交互数据;推理开销大、延迟高。可以区分两类落地思路:模块化世界模型,作为外部预演、数据增强工具;一体化融合世界模型直接参与动作输出。前者落地难度远低于后者。客观判断:世界模型属于重要的未来方向,但2026年,还不适合作为工业落地的核心依赖模块。

4.2智能体:单智能体与多智能体的工程现实

单智能体是现在具身智能主流形态,分为VLA驱动、LLM+工具调用驱动两条路线。VLA泛化强,但是黑盒风险;LLM‑Agent可解释,但循环推理延迟高,物理场景幻觉会带来安全隐患。

多智能体协作理论收益很高,但会遭遇端侧资源竞争、Agent通信延迟、行为不可预测等难题。目前没有大规模商业项目,以学术研究为主。

本能驱动范式并不排斥智能体、世界模型,可以将其放置在高层,用来做任务规划;底层物理交互依旧交给本能控制单元,二者可以组合使用,不是非此即彼。

五、产业现实:量产突破不等于商业成熟

三条审慎判断:第一,大量公开性能指标属于工程估算,真实硬件部署会受量化、散热、负载影响,实际指标波动区间很大。第二,ROS生态正在分化,传统机器人企业持续使用ROS2,AI原生企业更多选择自研中间件。第三,本体万台级量产已经实现,但通用操作机器人万台级商业成熟尚未验证。量产是必要条件,不是充分条件。

不同厂商所处阶段差异明显:部分企业实现本体万台下线,但大多落地在文娱、导览以及高度结构化产线;开放域、高柔性的非标作业,大多处于试点、小批量交付阶段。橡木果机器人依托本能驱动方案,聚焦工厂柔性作业场景,完成多类产线POC验证与小批量标准化单元交付,持续迭代模型与硬件,推进实景工况测试。

评判商业化的标尺,不只是样机数量,更要看产线任务成功率、投资回报率、客户复购。到今天,所有架构都还在接受实景工况的筛选,企业选择技术路线,本质上是做面向产业现实的工程赌注。

六、技术版图:数据策略与架构形态两个维度

我们可以用两个独立维度,看懂整个赛道不同方案。

维度一:数据策略

1.私有海量数据驱动:依靠大规模机器人真机交互数据集训练模型,泛化上限高,但采集标注成本极高。

2.开源数据驱动:依托公开数据集,降低研发门槛,但会面临数据质量参差不齐的问题。

3.低数据依赖的本能驱动路线(橡木果):不需要针对每一类工件采集大量专项交互样本。底层内置基础交互本能,依靠实时传感器反馈在线调整行为,对离线训练数据集的规模依赖大幅降低,但依旧需要一定数据做本能单元调优。

维度二:架构形态

  • 端到端原生

  • 端到端内层次化

  • 显式频率分层

  • 隐式规划分层

  • 本能驱动分层架构

一套系统可以同时归属于多个分类。行业可以看到一个明显趋势:各家方案正在向“高层慢速推理+底层高速物理响应”趋同,但底层模块的实现手段各有选择:有纯神经网络、有传统控制算法,也有橡木果的本能驱动单元。

七、架构选型决策树:不确定性下的落地建议

面向产业从业者,给出工程选型建议:

1.优先选择层次化架构,工程鲁棒性优先,不要盲目追求优雅的纯端到端方案。

2.无论高层使用VLA、世界模型还是Agent,底层必须保障控制环实时性能;优先保留物理层面的安全兜底。本能驱动架构的价值,就是把快速响应能力固化到底层,不依赖大模型高频推理。

3.理性看待世界模型、多智能体概念,它们是前沿研究方向,不要直接当做成熟产品方案。

4.纸面参数仅供参考,所有延迟、响应速度指标,务必在目标硬件、真实工况下实测。

5.区分本体量产和商业成熟,评估一套机器人方案,重点考察产线成功率、ROI、复购案例。

6.半结构化工厂柔性场景,本能驱动、层次化模块化架构更适配产线频繁换产、工件非标多变的现实痛点。

结语:架构只是手段,物理交互才是最终目的

具身智能架构之争,本质是人类还没有完全理解物理世界的智能该如何实现。端到端VLA、语言中介、世界模型、本能驱动,多条路线并行竞争。

行业逐渐达成共识:未来的机器人系统大概率是一套动态分层系统。底层负责毫秒级物理接触与反射,中层完成技能编排,高层做长周期任务规划。不同路线的差异,更多体现在每一层用什么方式实现。

没有哪一条路线可以宣称自己是标准答案。技术概念需要放到工厂真实工况中接受检验,尊重工程现实,正视物理世界的复杂性,才是具身智能走向商业化的必经之路。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐