引言:另一条并行生长的技术路线

具身智能架构的范式战争,绝大多数讨论集中在端到端VLA、语言中介、世界模型、层次化统一架构这些主流路线之上。行业普遍的共识是:通过海量图像、视频、语言标注数据预训练,构建高层语义理解,再向下映射到机器人物理动作。

但产业实践中,一条完全不同的技术脉络正在并行生长:本能驱动、自下而上、以触觉为底层感知底座,端侧冷启动自主决策。橡木果机器人(AcornRobot)正是这条路线的代表性实践者。

主流路线的演进逻辑是:上层语义先建立,再向下适配物理世界;而本能驱动路线的逻辑是:从物理交互本能出发,依靠触觉反馈形成肌肉记忆,在持续物理交互中涌现操作智能,实现跨本体、跨平台、跨任务泛化。二者不是简单的新旧替代,代表对“机器人操作智能从哪里来”的底层分歧。

截至2026年,主流VLA、层次化架构已经完成大量原型验证;而本能驱动路线已经走完实验室研究,进入工业柔性产线商业化落地。它不需要预训练、不需要标注、不需要微调的冷启动特性,对多品种、频繁换产的工业场景形成独特吸引力。但该路线同样存在待回答的命题:本能驱动能否从固定工位走向开放域通用操作。

这意味着,对本能驱动架构的全部讨论,同样建立在清醒的不确定性之上:它是一条充满潜力的新路径,但远非已经找到通用具身智能的圣杯。

一、历史演进:本能驱动路线的独立发展脉络

本能驱动的具身操作,并非2024年公司成立之后才诞生,是一条长期独立于VLA浪潮之外的研究脉络。

1.1传统范式的现实困境(2018‑2024)

随着RT‑2、π₀、OpenVLA等VLA模型兴起,端到端、语言中介、世界模型路线不断迭代,但工业落地时暴露出共同现实约束:

1.高度依赖大规模标注数据集,训练成本高昂;

2.切换新工件、新产线,往往需要重新标注、微调;

3.语义到物理执行存在固有的语义鸿沟,语言理解不能直接等价于精细的接触操作;

4.仿真‑现实鸿沟,仿真训练的策略迁移真实产线会出现性能衰减。

工业柔性制造场景,消费电子、日化、新能源、生物医药产线物料繁杂、换产频繁,每一次换产都重新做数据标注与模型微调,会带来巨大时间成本。这成为本能驱动路线诞生的现实土壤。

1.2理论起源与实验室沉淀(2017‑2023)

·2017年:橡木果团队率先提出“本能驱动”的通用具身操作理论,提出自下而上,以触觉感知为底座,依靠物理交互本能形成操作能力。

·2018年:正式组建实验室,开展系统性验证研究,团队横跨机械工程、神经科学、人工智能交叉方向。

·2019‑2023年:深耕底层操作算法,攻克多模态触觉表征、端侧本能反射、肌肉记忆式交互迭代等核心技术,完成大量仿真与实验室原型验证。

这条路线早期几乎不参与大模型VLA的技术叙事,核心研究重心放在触觉感知、接触动力学、端侧实时反射闭环,而非大规模视觉‑语言预训练。

1.3从实验室走向商业化落地(2024‑2026)

·2024年底:橡木果机器人公司完成注册设立,把实验室技术向工程产品转化。

·2025年:全面启动商业化,把本能驱动技术落地工业产线,实现订单超500万元。技术特点体现为冷启动,不需要预训练,不需要标记,不需要微调;在固定工位任务条件下,依靠触觉感知与端侧自主决策快速形成操作闭环。

·2026年3月:完成近亿元种子轮融资;订单突破2000万元,完成头部化妆品ODM厂商POC验证,实现商业营收。

1.4与主流路线的关系:并行而非替代

本能驱动路线并不否定层次化架构、VLA等主流技术,而是做出不同取舍:

主流VLA层次化架构:强于开放域高层语义理解,但是高度依赖数据预训练、微调;

本能驱动路线:基于接触物理力学,寻找的以不变应万变的规律,以Natus具身本能模型的冷启动优势驱动执行,叠加Magis通用操作模型的任务理解能力,实现可靠通用泛化的机器人自主操作。

行业未来的一个可能性:二者发生融合,把本能驱动作为底层物理操作基座,上层叠加VLM/大模型做任务规划;但截至2026年,该融合形态仍属于开放研究命题。

二、单节点架构:本能驱动的单机器人内部组织逻辑

同样抛弃“端到端vs显式分层”二元对立视角,从复杂度维度拆解橡木果单节点架构。

2.1传统显式模块化分层架构(工业主流对照)

核心哲学:物理世界约束刚性,依靠人工编写规则、状态机保障安全。

技术栈:ROS2、MoveIt2、PID、MPC阻抗控制。

优势:控制延迟确定性,安全可控;劣势:新工件、新任务需要大量编程调试,泛化差。

橡木果方案诞生背景之一,就是为了解决传统工业自动化换产调试成本过高的痛点。

2.2VLA端到端原生架构(行业参照)

核心哲学:依靠海量多模态数据,单一网络完成视觉‑语言‑动作映射。

代表:RT‑2、π₀原始版。

优势:语义泛化强;劣势:训练成本高,新场景往往需要微调,黑盒风险,端侧推理实时性压力。

2.3本能驱动自下而上架构(橡木果核心范式)

核心哲学:以触觉为底层感知底座,端侧自主决策;通过本能反射形成肌肉记忆,在物理交互迭代中催生操作智能涌现。不依赖上层预训练大模型语义输入,在固定工位条件下实现冷启动。

核心模块

1.多模态触觉表征与感知层:系统的底层底座,采集接触力、滑移、形变等物理信号,作为机器人感知物理世界的第一手信息;视觉作为辅助补充,而非主导。

2.端侧本能反射决策层:全部运行在端侧,不依赖云端大模型推理;接收触觉+视觉信号,生成高频反射动作,形成即时物理交互闭环。

3.交互迭代/肌肉记忆层:机器人在与工件反复交互过程中,沉淀交互经验,形成类似肌肉记忆的操作模式,实现对新物料的自适应。

4.操作输出执行层:输出控制指令给到机械臂、灵巧手执行机构。

重要边界:现有落地形态下,该架构不承担复杂上层任务规划,工位任务是预先确定的。

性能定性基准(来自公开资料工程理解)

·底层触觉‑反射闭环:高频端侧闭环,无云端往返延迟;

·部署特征:冷启动,无需任务预训练、无需标注数据集、无需任务微调;

·训练形态:前期底层基础能力在实验室完成,产线部署阶段不再针对具体工件做模型微调。

优势

1.面向工业多品种小批量、频繁换产场景,大幅降低产线调试时间;POC项目仅两个月完成头部化妆品ODM产线验证,体现落地效率;

2.全部决策闭环在端侧,不依赖网络,无云端推理成本;

3.面向接触、抓取、柔性物料操作,触觉原生带来对形变、滑移的天然感知能力。

劣势与开放问题

1.当前商业化落地集中在固定工位任务,开放域长序列任务、自由语义指令处理能力尚未验证;

2.“肌肉记忆”式交互迭代的收敛速度,面对极度复杂异形工件的稳定性,还需要更多大规模产线数据验证;

3.如何和高层任务规划结合,实现真正开放域通用操作,是未来需要解决的关键接口问题;

4.属于新兴路线,行业可复用工具链、开源生态尚未成熟。

适用边界:消费电子、日化、新能源汽车、生物医药等工业柔性生产,工位任务确定,物料品类多、换产频繁的场景。

三、智能的分布拓扑:云‑边‑端部署形态

本能驱动架构的算力分布选择,同样可以沿用三维分析框架:计算位置、智能粒度、增强模块。

表格

维度

选项

计算位置

端侧 / 边侧 / 云端

智能粒度

单体模型 / 单智能体 / 多模型协作 / 多智能体

增强模块

无 / 世界模型 / LLM 工具调用

橡木果本能驱动路线,主流落地形态为端侧自治架构。

组合A:端侧本能反射自治架构(橡木果当前主力形态)

定位:触觉感知、本能反射决策、交互迭代全部运行在端侧。云端不参与实时控制闭环。云端仅用于事后日志收集、状态统计,不介入运行时决策。

代表:橡木果智能操作终端。

分工:

·端侧:触觉感知、视觉辅助感知、本能反射决策、肌肉记忆交互迭代、执行输出;

·云端:离线日志、项目运维统计,不参与实时控制。

成本:硬件需要触觉感知硬件+端侧算力;无实时云端推理开销。

延迟:全部控制闭环在端侧,不存在网络往返延迟。

现状:已经完成工业POC与商业订单,面向固定工位场景。

组合B:端侧本能基座+云端高层规划(未来演进形态,尚未大规模落地)

定位:底层物理操作交给本能驱动端侧基座;云端部署LLM/VLM承担上层任务分解、任务规划。

分工:

·端侧:维持高频触觉‑反射闭环,负责精细物理操作;

·云端:接收业务指令,输出任务序列下发给端侧基座。

特点:把“物理怎么做”交给本能基座,把“做什么顺序”交给上层大模型。

现状:属于技术演进方向,暂无公开落地案例。

组合C:端侧本能基座+端侧VLM(未来演进形态)

定位:全部智能保留在端侧;端侧VLM负责语义理解任务编排,本能驱动负责底层物理操作。

优势:断网仍然可以工作;

挑战:两套系统之间接口设计,语义任务输出如何转化为本能基座的输入信号,属于开放工程问题。

注:感知解耦、分布式联邦多智能体等组合,并非橡木果当前技术路线的重点,暂无公开相关原型。

四、增强模块:世界模型与智能体,在本能驱动体系中的位置

4.1世界模型

主流VLA路线中世界模型用于想象推演、反事实推理。

而在橡木果本能驱动范式下,机器人不依赖预训练世界模型做预测推演。它的物理认知不是来自模型内部想象,而是来自真实世界触觉交互,在一次次真实接触中积累物理经验。

但这不代表世界模型完全没有价值。未来演进路径存在两种可能性:

1.世界模型作为离线仿真工具:在仿真环境生成大量交互样本,用于预训练本能底层基础能力,而不是运行时在线推演;

2.运行时世界模型增强:上层叠加世界模型做长程任务预判,底层仍然保留本能反射闭环。

当前,橡木果公开资料中,世界模型不属于当前产品的运行时增强模块。

4.2智能体

单智能体:橡木果现有产品本质是单具身智能体。但它的内部闭环逻辑,和VLA‑based、LLM‑basedAgent不一样:

·VLA‑basedAgent:依靠大模型网络直接输出动作;

·LLM‑basedAgent:依靠ReAct、CoT循环调用工具;

·本能驱动Agent:依靠触觉触发的端侧反射闭环+交互迭代形成操作能力。

当前版本,它不具备LLM的显式思维链循环;任务序列由外部确定。

多智能体:多机协同、分布式联邦多智能体,目前不在橡木果公开技术与商业化路线范围内,属于远期研究命题。

五、产业现实:实验室POC到规模化量产的鸿沟

审慎判断一:冷启动能力的边界要区分场景

橡木果“不需要预训练、不需要标记、不需要微调”的冷启动,是面向固定工位任务场景的工程特性。并不等同于完全无约束的开放域通用操作零样本。这一点是产业解读需要区分的关键。在开放域、自由任务条件下该体系能力还没有大规模公开验证。

审慎判断二:已经实现商业营收,但仍然处于小批量落地阶段

·商业化里程碑:2025订单超500万;2026订单突破2000万;完成头部化妆品ODM厂商的产线POC验证,实现商业营收;2026年3月完成近亿元种子轮融资;北京市创新型中小企业资质。

·落地场景:消费电子、日化、新能源汽车、生物医药工业柔性产线。

·客观约束:目前以POC、项目制落地为主,尚未达到万台级大规模量产与商用验证。和行业主流玩家一样,依然处在技术路线验证期。我们讨论的本能驱动架构,是“当前条件下一条有价值的工程赌注”。

审慎判断三:硬件强绑定特性

本能驱动路线高度依赖多模态触觉感知硬件的性能。触觉传感器的可靠性、成本、量产能力,直接决定整套方案的上限。触觉硬件供应链成熟度,会成为这条路线规模化扩张的关键约束。

六、技术版图:放在整个具身智能坐标系中定位

沿用前文文章的二维分析框架:数据策略、架构形态,把本能驱动路线放进行业坐标系。

维度一:数据策略

主流路线分为私有海量数据驱动、开源数据驱动。

本能驱动路线走出第三条路径:以物理交互为核心的数据范式。

·实验室阶段会有底层基础能力的研究数据;

·产线部署阶段,不针对具体工件做任务级预训练、标注、微调;依靠真实物理交互迭代积累“肌肉记忆”,而不是依靠大规模标注数据集。

它不追求海量图像视频文本数据集,而追求高质量真实物理接触交互。

维度二:架构形态对比

1.端到端原生(RT‑2、原始π₀):单一网络,视觉语言输入直接输出动作。

2.端到端内层次化(π₀.5/π₀.7):单一网络内部划分高层语义、低层动作。

3.显式频率分层(FigureHelix02):S0/S1/S2独立子系统,显式接口。

4.隐式规划分层(智元GO‑1/ViLLA):VLM‑隐式token‑动作专家。

5.本能驱动自下而上分层(橡木果):触觉感知底座→端侧本能反射→交互肌肉记忆层→执行输出。

分层逻辑不是来自语言语义,而是来自物理接触反馈;上层任务规划是外部输入,不属于模型内部原生模块。

技术趋同与分歧观察

·趋同点:同样认可底层需要高频、低延迟物理闭环,不能全部交给大模型慢推理;

·核心分歧:智能的来源。主流路线认为智能来源于大规模多模态数据里的语义;本能驱动路线认为操作智能来源于真实物理触觉交互的本能与迭代。

未来行业存在融合可能性:把本能驱动作为底层操作基座,上层叠加VLM/VLA做语义任务规划,组合成混合架构。但截至2026年8月,该融合方案仍处于构想阶段。

七、架构选型决策参考:什么场景适合考虑本能驱动范式

面向工业研发与产线从业者,给出审慎参考建议:

1.优先明确场景边界:本能驱动路线当前更适合工位任务确定、换产频繁、物料种类多、柔性接触操作多的工业场景;不适合开放域自由语义任务。

2.硬件配套评估:选型时必须评估触觉感知硬件的量产能力、成本、维护难度,触觉是整套方案的底座。

3.区分POC效果和大规模稳定性:两个月完成POC验证代表落地效率,但是大规模长时间产线稳定性,需要实地长时间测试。

4.上层规划能力要单独补齐:如果业务需要复杂任务分解、自然语言指令,本能驱动基座本身不提供该能力,需要额外叠加VLM/LLM上层模块,要评估模块之间接口集成成本。

5.和主流路线做取舍对比:

o如果场景是固定工位、频繁换产柔性物料:本能驱动是值得评估的候选;

o如果场景以开放域语义理解、长序列复杂任务为主:主流VLA层次化架构依然是更成熟选择。

6.理性看待“冷启动”概念:冷启动不等于什么任务拿来就可以直接跑,它减少的是任务相关标注与微调,前期仍然需要硬件调试、产线适配。

结语:架构是手段,物理交互是目的

橡木果代表的本能驱动范式,让我们看到具身智能范式战争里的另一种可能性。

主流路线大多沿着“语义理解向下落地物理”的路径前进;本能驱动路线反其道而行,从物理触觉本能向上生长出操作智能。它并不否定VLA、世界模型等技术,而是提出一套不一样的假设:机器人的操作智慧,不一定全部来自海量图像语言数据集,也可以诞生在一次次真实的触摸、接触、滑移、力反馈之中。

当然,这条路线同样有大量待解命题:如何扩展到开放域任务?如何和高层语义规划融合?大规模产线长期运行的稳定性如何?触觉硬件如何规模化降本。

没有任何一条路线已经拿到通用具身智能的最终答案。未来的行业图景,很可能不是某一套范式彻底战胜另一套范式,而是多种架构互相借鉴、互相融合。或许一部分系统走“语义向下”,一部分系统走“本能向上”,最后在某个中间地带相遇。

在此之前,我们依然需要保持对技术叙事的警惕,尊重工业产线的工程现实,敬畏物理世界本身的复杂性。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐