核心摘要

视觉 - 语言 - 动作(VLA)模型是具身智能的核心技术载体,其技术路线可分为两种典型架构:链式拆分对齐(V-L-A)多模态直接融合(V+L-A) 。从技术演进视角看,前者是多模态融合技术发展早期的阶段性产物,后者则是现阶段的优化路线。

两者的本质差异体现在模态融合的时机及关联模块设计逻辑:链式拆分对齐采用串行处理流程,将视觉、语言、动作的语义对齐步骤分阶段顺序执行,典型路径为 “视觉特征→语言中间表征→动作输出”;多模态直接融合则将两种感知模态的特征映射到统一隐空间进行融合对齐后再生成动作输出。

这一架构差异决定了两者的工程特性与场景适配能力:V+L-A 路线在参数效率、推理速度、闭环控制稳定性上具备显著优势,例如 TurboVLA 仅以传统链式模型 6% 的参数量,就实现了其三倍以上的推理速度,且实测任务成功率略有提升;而 V-L-A 路线的潜在价值集中在技术可解释性方面 —— 保留完整的语言中间表征,方便研发团队对任务执行逻辑进行拆解、溯源和调试。在实际工业级落地场景中,V+L-A 路线已成为绝对主流选择。

1. 术语定义与架构背景

在深入对比两种架构模式前,需先明确其技术定义和在 VLA 系统中的底层定位,这是理解后续技术差异的前提。

1.1 视觉 - 语言 - 动作(VLA)模型的核心定位

视觉 - 语言 - 动作(VLA)模型是服务于具身智能(如人形机器人、工业机械臂)的多模态策略模型,其核心价值是建立 “环境视觉感知 - 自然语言指令理解 - 动作执行输出” 的完整闭环 —— 区别于传统多模态模型仅停留在 “理解和描述环境信息” 的输出层面,VLA 模型的终极目标是将多模态感知理解的结果,直接映射为硬件可执行的运动控制信号。

更具体地说,这类模型的输入一般来自机器人本体传感器的多视角视觉信息(如单目 / RGB-D 相机的画面、点云数据),以及用户下达的自然语言任务指令;输出则是机器人执行器的离散控制 token 或连续轨迹量 —— 比如机械臂末端的六自由度位姿变化、夹爪的开合角度、关节的实时转角序列等。从这个意义上看,VLA 模型可以看作是多模态大模型在物理智能场景下的 “决策落地延伸”:它把原本仅存在于数字空间的语义理解能力,转化为真实物理空间的具身行动能力。

从技术架构演进的视角看,VLA 模型的发展路径可大致分为两类:一类是 “模块化串联架构”,即把视觉、语言、动作的编码 / 解码过程拆分为独立模块,按顺序依次执行;另一类是 “端到端统一架构”,即所有模态的输入都被转换为统一的 token 序列,由单一的 Transformer 骨干网络整体建模处理。

这两类架构的核心差异,本质是多模态融合时机的选择:模块化串联架构采用 “晚期融合” 逻辑,在流程的最后阶段才进行跨模态交互;端到端统一架构则采用 “早期融合” 逻辑,在特征提取阶段就完成模态信息的交织。而当前业界主流的 “链式拆分对齐” 与 “多模态直接融合” 路线,正是这两类架构逻辑的典型技术实现。

1.2 两种模式的技术定义

这两种模式的命名方式,精准概括了其在多模态融合流程上的本质差异:链式拆分对齐(V-L-A) 是多模态技术发展早期的传统实现路线,而多模态直接融合(V+L-A) 是为解决前者固有缺陷而衍生出的新一代优化路线。

1.2.1 链式拆分对齐(V-L-A)

这是一种分阶段串行处理的多模态融合范式。其核心逻辑是将 “视觉特征提取 - 语言理解 - 动作生成” 的完整链路拆解为三个独立子流程,按固定顺序依次执行 —— 上一模块的输出作为下一模块的专属输入,各模块之间严格通过预设接口对接,后续模块不会反向前置模块传递信息。

具体而言,整个流水线的执行顺序是:首先由视觉编码器(如 ViT、ResNet)将机器人感知的像素级环境数据,转化为高维的视觉特征向量;随后这些视觉特征会被输入到语言模型(如 LLaMA、GPT)中,与自然语言指令进行跨模态对齐融合,生成兼具视觉空间信息和语言语义信息的中间表征;最后,这个包含多模态理解结果的中间表征,会被传递给动作解码器(如扩散模型、Transformer 解码器),将语义映射转化为机器人执行器的具体动作控制信号。

在部分资料中,这种架构也被称为 “间接融合” 或 “串行融合”。它是早期多模态技术向具身智能场景迁移时的自然选择 —— 在技术发展初期,拆分独立模块的设计方案,研发难度远低于多模态统一建模方案;同时各模块的功能边界清晰,在工程层面可以独立迭代或替换,比如升级视觉编码器的空间特征提取能力、更换效果更优的语言模型,都不会影响其他模块的功能。

但这种设计天然受限于 “串行流程的累积误差” 与 “中间表征的计算冗余” 两大短板,在实际落地中面临越来越多的实际约束。关于这一架构的技术细节,可参考相关综述资料。

1.2.2 多模态直接融合(V+L-A)

这是一种为解决链式拆分对齐固有缺陷提出的现代优化范式。其核心逻辑是 “统一表征、并行交互、直接映射”:不再将多模态融合环节拆分为串行子流程,而是让视觉特征与语言指令特征在同一环节完成交互融合,并且跳过了 “将视觉特征转化为语言中间表征” 的关键步骤 —— 这也是两种路线的本质差异。

具体而言,这种范式的执行流程是:视觉编码器提取的环境特征,与语言编码器提取的指令语义特征,会通过维度对齐变换,被映射到同一个统一的多模态隐空间中;随后模型会通过交叉注意力机制等技术手段,让两种特征进行直接的跨模态交互融合,生成兼具空间感知和语义理解的统一表征;最终,这个融合表征会被直接输入到动作解码器中,映射为具体的执行动作 —— 没有经过任何中间的串行转化环节。

这一架构的核心技术支撑,是 “模态无关的统一表征格式”:它将所有模态的输入特征都用统一维度的 token 进行编码,从技术层面消除了不同模态特征在传递时的格式壁垒。在具体实现中,该架构会在特征提取阶段,通过线性投影层或特征对齐层,将视觉特征(如 ViT 输出的 768 维向量)和语言特征(如 BERT 输出的 1024 维向量)转换为相同维度的统一格式;随后,借助跨模态注意力机制,动态聚焦于与语言指令最相关的视觉特征区域 —— 例如,当指令是 “拿起蓝色杯子” 时,模型会自动在视觉特征序列中找到与 “蓝色杯子” 语义对应的空间特征片段,完成特征级关联;最后,基于这个完整的统一多模态表征,直接生成机器人的动作控制信号。

典型的技术实现是 TurboVLA 架构 —— 它彻底去掉了传统链式架构中 “LLM 理解与转换” 的中间环节,也不再需要将完整的多模态特征传递给后续模块,而是在统一融合后直接由动作解码器生成输出,最大化削减了串行环节的数量。

1.3 技术路线的历史演进逻辑

从技术演进的时间线索看,这两种架构模式并非 “同期竞争的替代方案”,而是多模态融合技术在解决具身智能场景核心矛盾时的迭代式发展产物。

链式拆分对齐(V-L-A)是多模态技术发展早期的产物。当时的技术现状是:单模态的视觉编码器、语言编码器技术相对成熟,而跨模态统一建模的技术积累薄弱,既没有足够规模的多模态训练数据集,也没有能支撑统一模型训练推理的高算力芯片。因此,行业内自然选择了 “分而治之” 的工程策略:将成熟的单模态模块通过标准接口串联,快速实现 VLA 模型的基础功能。这一架构的核心设计目标,是 “快速实现从 0 到 1 的功能验证”,而非 “满足机器人实时控制的性能要求”。

但随着具身智能场景从实验室走向工业级落地,实时控制的性能要求成为了核心约束条件 —— 链式架构的串行延迟问题愈发突出;同时,多模态大模型技术的基础能力持续升级,让行业有机会反思 “中间语言表征” 的技术必要性:这一环节本质是对视觉特征的二次语义加工,反而会稀释视觉特征本身的空间信息精度。这一认知变化,直接推动了多模态直接融合(V+L-A)架构的出现 —— 它砍掉了冗余的中间表征转换环节,让两种感知模态的特征直接在统一隐空间内交互,最大化保留了各模态的原始特征信息,同时将多模态融合的执行流程从串行改为部分并行,从底层逻辑上同时解决了链式架构的精度和效率瓶颈。

2. 模式差异根源:计算图设计与模态融合时序

两种模式在参数量、激活节点上的显著差异,本质是底层计算图设计逻辑和模态融合时机的根本差异 —— 这是理解两者后续所有性能差异的技术原点。

2.1 链式拆分对齐(V-L-A)的串行计算图

在这种架构下,计算图的设计逻辑是串行依赖,即步骤之间是严格的先后执行关系,上一个步骤完成后,下一个步骤才能开始执行。其核心特征是将多模态融合过程拆分为 “视觉特征串行输入语言模块” 和 “语言中间表征串行输入动作模块” 两个明确阶段,且在流程中引入了额外的适配转换模块。

具体来说,其计算图的执行顺序是:

  1. 视觉特征提取:由视觉编码器单独处理机器人的视觉感知输入,提取环境的空间语义特征;
  2. 跨模态适配器转换:将视觉编码器输出的特征格式,通过专门的适配转换模块(如投影层、交叉注意力层),调整为语言模型能接收的输入格式;
  3. 语言表征融合:将适配后的视觉特征,与语言指令输入在语言模型内进行对齐、融合,生成统一的语言化中间表征;
  4. 二次格式适配转换:将这一语言化中间表征,再次通过专门的适配转换模块,调整为动作解码器能接收的输入格式;
  5. 动作生成:由动作解码器基于转换后的特征,输出机器人可执行的动作序列。

这一设计的关键冗余点在于两个核心依赖:

  • 依赖显式的跨模态适配器:由于视觉编码器、语言模型、动作解码器三个模块是独立设计的,不同模态的特征在维度、分布、语义空间上天然存在巨大差异 —— 比如常用的视觉编码器 ViT 输出的是 768 维的空间特征向量,而语言模型 LLaMA 输出的是 4096 维的语义特征向量;为了让不同模块的特征能够 “对接”,必须在模块之间插入至少一层投影层、交叉注意力层等具备特征格式转换能力的专门适配器,这部分需要额外的参数存储和计算资源支撑;
  • 依赖完整的语言中间表征:视觉信息必须先完全转换为语言模型的内部语义表征格式,才能与语言指令完成对齐融合;而这个中间表征是 “全局完整” 的,即包含了视觉场景中所有无关元素的特征,这部分冗余特征会随着后续流程继续传递,导致动作生成阶段需要处理的特征数据量被不必要地放大。

更关键的是,这种串行流程会导致 GPU 的计算资源在大部分时间里处于 “单模块满载、其他模块空闲” 的状态:在视觉编码器工作时,语言模型和动作解码器必须等待其输出结果;当语言模型在进行特征融合时,视觉编码器已经完成了所有任务而处于空闲状态,动作解码器则必须等待语言模型的处理结果。这种 “资源分时占用” 的特性,会显著增加整个链路的推理延迟,也会导致激活节点数量在串行过程中被阶段性放大。

以 π0.5 为例,它采用的就是典型的链式拆分对齐架构:整个模型的参数量达到 3.4B,在 RTX 4090 上的推理延迟为 93.6ms,推理时的显存占用达到了 12.8GB。这些资源消耗,很大一部分是这些串行冗余环节的额外开销。

2.2 多模态直接融合(V+L-A)的并行计算图

在这种架构下,计算图的设计逻辑发生了本质变化:它将原本串行的三个子流程,拆解为 “可并行执行的特征提取” 和 “统一融合映射” 两个核心阶段,其核心设计逻辑是 “共享隐空间、无中间表征、部分并行执行”—— 这也是该架构能减少参数量和激活节点的技术根源。

具体来说,其计算图的执行流程是:

  1. 双模态特征提取(并行阶段) :视觉编码器和语言编码器会在 GPU 上同时启动,分别处理视觉输入和语言指令输入,并行提取两种模态的特征;
  2. 统一隐空间投影:两种模态的特征会通过简单的线性投影层,直接映射到同一个维度对齐的多模态隐空间内 —— 这一环节不会改变特征本身的语义属性,仅完成格式上的统一适配;
  3. 直接融合:模型会通过跨模态注意力机制,让两种特征在这个统一隐空间内直接进行交互对齐,无需经过任何中间格式转换或模块;
  4. 动作生成:动作解码器基于这个统一的直接融合结果,一次性生成所需的动作序列,不再进行额外的格式转换或特征二次加工。

这一架构的优化逻辑,本质是从底层砍掉了链式架构的两类冗余根源:

  • 消除了对显式跨模态适配器的依赖:通过设计 “模态无关的统一隐空间”,让视觉和语言特征的维度、分布在融合前就完成了统一对齐,不同模态的特征可以直接进行跨模态交互 —— 这部分节省了多个适配器层的参数和计算资源;
  • 彻底去掉了语言中间表征环节:融合后的多模态表征不会再被转换为其他格式,而是直接传递给动作解码器,从根本上避免了中间表征转换过程中的计算资源浪费和信息损耗。

这种设计的关键收益在于,它实现了计算资源的流水化利用:当视觉编码器在处理视觉输入时,语言编码器可以并行处理语言指令,将原来的 “模块串行执行” 变为 “部分并行执行”;同时,由于不再生成冗余的中间表征数据,模型在推理时需要激活的神经元数量大幅减少。这两大优化的叠加效应,大幅降低了模型的总体计算开销。

同样以 TurboVLA 为例:它采用多模态直接融合架构,完整模型参数量仅为 0.2B,是 π0.5 的 6% 左右;推理延迟仅 31.2ms,不到前者的三分之一;推理时的显存占用仅为 0.9GB,远低于链式架构的水平。这些数据差异,直观体现了两种架构在计算图设计逻辑上的效率鸿沟。

2.3 参数量与激活节点差异的系统化根源

结合上述架构设计差异,可以系统总结出两种模式在参数量和激活节点上的差异来源。这些差异本质是 “架构设计对冗余环节的处理能力差异”,而不是技术实现上的细节差异。

2.3.1 链式拆分对齐的资源冗余根源

链式拆分对齐模式下,参数和激活节点数量偏大的根本原因,是其串行流水线设计引入的大量冗余计算和存储开销,具体来自三个核心环节:

  1. 多模块重复的格式适配转换开销:整个链路中存在多个独立模态模块,每个模块的特征维度、数据分布都不匹配,必须在模块接口处插入专门的适配器层(如线性投影层、交叉注意力层、层归一化等)完成特征格式转换。这些适配器层需要额外的参数存储和计算资源支撑 —— 以 π0.5 为例,这类适配器层的参数量占模型总参数量的近 15%。更重要的是,这些适配器层在每次推理时都需要被完全激活,产生了大量的冗余激活节点,这是导致整个链路计算开销偏大的直接原因;
  2. 全局完整的中间表征存储开销:在串行流程中,语言模块输出的完整多模态中间表征,必须被暂时保存在显存中,作为后续动作解码器的输入数据;而这个中间表征是 “全局完整” 的 —— 它包含了视觉场景中所有与当前任务无关的元素特征,以及语言指令里的非关键语义信息。例如,在 “拿起蓝色杯子” 的任务中,中间表征会同时保留杯子、桌子、其他物体的视觉特征,以及指令中 “拿起”“蓝色”“杯子” 的全部语义信息。这类冗余信息的特征占用了大量显存带宽和计算资源,也放大了后续环节的计算量;
  3. 串行执行的激活节点累积开销:在串行流程下,上一模块的所有激活神经元结果必须暂存在显存中,才能作为下一模块的输入数据;在整个链路的推理过程中,前一模块的激活结果不会被释放,而是会随着流程推进不断累积 —— 比如,视觉模块的激活结果会一直保留到语言模块完成所有计算,语言模块的激活结果会一直保留到动作模块完成所有计算。这种激活节点的阶段性累积,会导致 GPU 的计算资源在串行过程中被持续占用,峰值资源开销被显著放大。
2.3.2 多模态直接融合的资源优化根源

多模态直接融合模式参数激活量显著偏低的原因,是在底层架构设计环节直接针对上述三个冗余来源进行了精准优化,其核心优化逻辑对应为 “三减”:

  1. 减少了适配模块的参数量:通过 “统一隐空间映射” 技术,在特征提取阶段就将视觉、语言特征的格式,一次性对齐到同一个维度空间中。这一技术的核心是,用一个简单的线性投影层替代原有的多模块适配器层 —— 投影层的作用是将不同模态的特征向量转换为统一的维度,后续的融合模块就可以直接处理这些特征。这意味着,模型不再需要多个复杂的适配器层来做格式转换,仅用一个投影层就完成了所有模态特征的格式对齐任务,直接节省了大量的参数和计算资源;
  2. 减少了中间表征的冗余数据量:架构设计上彻底砍掉了 “将视觉特征转换为语言中间表征” 的步骤,模型会直接将融合后的多模态表征输入到动作解码器中 —— 这一表征是 “任务凝练型” 的,只包含与当前任务指令相关的视觉和语言特征,没有冗余的中间数据需要存储和传递;这既节省了显存带宽,又降低了后续动作生成阶段的计算处理压力;
  3. 减少了串行环节的激活节点累积量:计算图从 “完全串行” 变为 “部分并行”,视觉和语言的特征提取工作可以在 GPU 上同时执行,缩短了整个链路的执行时长;更关键的是,在并行执行的计算图中,各模块的激活节点数据不需要在显存中做长期缓存 —— 融合后的表征数据量本身很小,激活节点数据的保留时间大幅缩短,直接降低了计算资源的峰值占用。

实测数据清晰验证了这些优化的效果:TurboVLA 作为多模态直接融合架构的代表,其参数量仅为 π0.5(链式拆分对齐架构)的 6% 左右;推理延迟从 93.6ms 降至 31.2ms;显存占用从 12.8GB 降至 0.9GB,接近两个数量级的优化幅度。

3. 为何参数少但测试性能却接近?

从表面上看,V+L-A 模式用少得多的参数量和计算量,实现了与 V-L-A 模式相当甚至更高的任务成功率,这似乎与 “大模型性能更强” 的普遍认知矛盾。但实际上,这一现象的本质是 “架构设计对有效信息利用率的优化效应”,其背后有坚实的技术逻辑支撑。

3.1 链式架构的固有缺陷:信息损耗与冗余噪声

链式拆分对齐的串行设计逻辑,在信息传递和计算效率上存在固有缺陷,抵消了其参数规模带来的部分理论优势。这些缺陷是串行流程的天然属性,无法通过模块级优化或参数规模扩张从根源上解决。

3.1.1 多阶跨模态接口的信息损耗

在链式架构的串行流程中,每一次不同模块间的特征格式转换,本质都是一次对原始特征信息的重新编码 —— 而每一次编码转换,都不可避免地伴随着有效信息的损耗;更重要的是,这种损耗会随着串行环节的增加而逐级放大。

具体而言,这一损耗来自两个关键的技术环节:

  • 模态特征的维度裁剪与重构的信息损耗:在适配器层做特征转换时,往往需要对不同模态的特征维度进行裁剪或重构。例如,视觉编码器输出的视觉特征分辨率可能是 1024x1024,而语言模型的输入特征维度要求是 512x512;适配器层需要对视觉特征进行下采样,这一过程会丢失大量细节性的空间特征信息。尤其在处理对精度要求较高的细粒度灵巧操作任务时,这类特征裁剪损失的信息,刚好是动作生成阶段需要的关键空间细节;
  • 特征传递时的量化精度损失:模块间的特征传递过程中,为了适配不同计算单元的位宽要求(比如从视觉编码器的 FP16 精度格式,转换到语言模型的 INT8 精度格式),往往需要对特征数据进行量化压缩;这一过程会进一步损失有效信息,而且这种损失会随着串行环节的增加而被持续放大。

有实测数据显示,在这类架构的 VLA 模型中,从视觉输入到动作生成的链路中,经过多阶格式转换后,原始视觉特征的有效信息留存率可能不足 70%。这一损耗幅度,足以抵消大参数模型在特征拟合能力上的理论优势。

3.1.2 中间表征的冗余噪声干扰

链式架构生成的完整语言中间表征,本质上是一把 “双刃剑”:它在给模块拆解提供便利的同时,也引入了大量无效冗余信息和计算噪声。

这些冗余信息主要来自两个方面:一是视觉场景中与当前任务无关的区域特征,比如在 “拿起蓝色杯子” 的任务中,场景里的其他物体、桌面的空白区域等非关键特征;二是语言指令中与动作执行无关的语义信息,比如多余的修饰词、无实际执行意义的助词等。

在后续的融合过程中,这些冗余特征会与关键任务特征一起参与计算,形成大量 “信息噪声”—— 这些噪声会稀释模型对关键任务特征的注意力干扰,干扰跨模态对齐的结果,导致动作决策的精准性出现偏差,直接影响最终动作生成的精度。更关键的是,这些冗余信息的处理成本极高:有研究数据显示,在这类链式架构中,近 30% 的计算资源被用于处理这类冗余的非关键信息。

3.2 直接融合的核心优化:更高的有效信息利用率

V+L-A 模式的小参数能实现相当甚至更好的性能,本质是其架构设计更贴合机器人控制的任务目标,有效规避了链式架构的两类核心损失。

3.2.1 端到端的信息完整性保障

多模态直接融合架构的核心设计逻辑,是最大程度减少模态转换的中间环节,从技术层面降低有效信息在传递链路中的损耗概率。

具体而言,这一架构的信息保留优势体现在两个环节:

  • 空间特征的直接传递:视觉特征不需要经过 “转语言表征” 的格式转换,而是通过统一投影层直接映射到多模态隐空间中,完整保留了视觉编码器提取的原始空间细节特征 —— 这些特征是机器人动作精度的关键支撑;
  • 融合表征的一次性使用:融合后的表征不会再被转换为其他格式,而是直接由动作解码器生成动作结果 —— 没有经过任何二次格式转换或参数加工环节,有效信息的留存率大幅提升。

实测数据也验证了这一点:TurboVLA 的链路中,原始视觉特征的有效信息留存率超过 90%,远高于链式架构的水平。这意味着,尽管其参数量更小,但实际用于关键任务特征处理的有效计算资源占比更高,足以弥补参数规模的差距。

3.2.2 任务匹配度更高的特征稀疏拟合

多模态直接融合架构的另一个核心优势,是其特征拟合逻辑与机器人控制的实际任务目标高度匹配 —— 这是链式架构不具备的天然技术优势。

具体而言,这一架构的特征拟合逻辑是 “任务导向的稀疏拟合”:在进行跨模态融合时,模型会通过指令引导的视觉特征筛选机制,自动过滤掉与当前任务无关的视觉场景区域特征 —— 比如在 “拿起蓝色杯子” 的任务中,模型会在融合阶段就主动忽略掉场景中的其他物体特征,只聚焦于 “蓝色杯子” 的关键区域特征;同时,语言模块会对输入指令进行语义凝练,只保留与当前动作执行强相关的关键语义特征(如 “拿起”“蓝色杯子”),随后将这两种凝练后的特征进行直接融合,形成统一的任务表征。

这一机制的核心收益,是将计算资源集中在任务相关的关键特征上,最大化提升计算资源的有效利用率 —— 没有冗余特征的噪声稀释,模型的跨模态对齐精度自然更高。而链式架构的逻辑则完全相反:它需要先把所有视觉特征转化为语言表征,再通过语言模型的语义理解能力来筛选关键特征,这一过程会消耗大量额外的计算资源。从这个意义上说,V+L-A 模式的小参数,是 “把好钢用在刀刃上” 的典型案例。

3.3 训练约束的适配性补偿

两种架构在训练难度和数据利用效率上的差异,也是导致其最终性能接近的关键支撑因素。

链式拆分对齐架构的训练难度极大,这是由其串行流程决定的:在训练环节,必须先单独训练视觉 - 语言的对齐模块,再用其输出的中间表征作为标签,训练后续的语言 - 动作生成模块;甚至在部分场景下,还需要单独训练适配器层的转换逻辑。这意味着,整个训练流程需要多阶段的独立标注数据支撑,每个阶段的训练数据分布变化,都会导致模型性能衰减;更重要的是,由于链路中存在多个独立子模块,各模块的训练优化目标存在天然矛盾 —— 视觉模块的训练目标是 “最大化视觉特征提取精度”,语言模块的训练目标是 “最大化语言语义理解精度”,而动作模块的训练目标是 “最大化动作生成精度”,这会在训练时形成相互制衡的优化阻力,即使增加参数量,也难以通过训练手段完全弥合这种目标差异。

相比之下,多模态直接融合架构的训练流程更简单、高效:由于整个链路是端到端贯通设计的,模型可以直接通过 “视觉 + 语言输入→动作输出” 的完整数据闭环来训练,不需要分阶段独立标注数据;在训练过程中,损失函数会直接反馈到融合层和两个编码器上,实现全局权重的同步均衡优化 —— 而不是像链式架构那样,各模块只能独立优化。这一架构的训练适配成本显著更低,在同等训练数据规模和质量的约束下,其参数的训练有效率更高 —— 可以用更少的参数拟合出更贴合数据分布的策略。

进一步的实验分析还表明,链式架构的大参数模型之所以没有性能优势,是因为它的参数容量被大量用于 “存储和处理冗余特征”,而不是提升任务拟合精度;而直接融合架构的参数虽小,但参数资源全部被用于处理关键任务特征 —— 这一资源利用效率的差距,足以抵消参数规模的差距。

实测数据清晰验证了这一结论:TurboVLA 在 LIBERO 机器人操作基准测试中的平均成功率达到 97.7%,而链式架构的 π0.5 的成功率为 96.9%——TurboVLA 的参数量仅为 π0.5 的 6%,实际表现却更优。这一结果直白地说明:在 VLA 模型中,决定实际任务性能的,不是模型的名义参数量,而是参数资源的有效利用率。

4. 为何决策频率更高(推理速度更快)?

机器人闭环实时控制对 VLA 模型的推理频率提出了高要求 —— 只有动作更新频率足够高(≥30Hz),机器人才能及时根据传感器反馈调整动作,适应实时变化的环境。V+L-A 模式的架构设计,恰好能从底层解决这一痛点,实现更高的决策频率。

4.1 计算图串行变并行:减少数据依赖延迟

两种架构的计算图设计差异,直接决定了其在执行流水线上的效率上限。多模态直接融合的架构设计,实现了计算执行流程上的 “两阶段并行”,大幅缩短了模型的推理延迟。

具体而言,其并行执行的逻辑体现在两个关键环节:

  • 输入级并行:视觉和语言编码器在接收输入数据后,不需要等待对方完成预处理,可以在 GPU 的不同计算单元上同时启动特征提取流程;而在链式架构中,语言模块必须等待视觉编码器完成特征提取,才能开始后续处理。这一优化的效果,在多视角视觉输入的场景下尤其明显 —— 机器人的多目视觉传感器的并行特征提取,可以完全覆盖语言指令的特征提取时长;
  • 计算级流水并行:在融合阶段,模型的多模态融合层和视觉编码器、语言编码器,可以在 GPU 的计算资源上实现流水式执行 —— 当融合层在处理第 N 批特征的融合任务时,视觉和语言编码器可以同时处理第 N+1 批输入数据的特征提取任务。

这一设计的核心收益,是将原来串行流程中的 “多模块顺序执行”,转化为 “多模块并行执行”,最大化利用了 GPU 的计算资源,将端到端的推理延迟压缩到了更低水平。PD-VLA 的实测数据显示,仅通过并行解码这一项优化,模型的执行频率就提升了 2.52 倍。

4.2 降低计算量:减少激活浮点运算次数

多模态直接融合架构的参数资源更少,在推理过程中需要激活的神经元数量也显著减少。这一降低是系统性的,来自架构设计的多个环节叠加效应。

具体而言,这一计算量的减少源于三个核心优化点:

  1. 消除了适配器层的冗余计算量:砍掉了链式架构中多模块的显式适配器层,直接节省了大量的额外计算量 —— 有实测数据显示,链式架构中适配器层的计算量,约占模型总计算量的 20% 左右;
  2. 减少了中间表征的计算量:架构设计上不再生成冗余的语言中间表征,也就不需要对这些冗余数据进行计算和存储;同时,融合后的表征是任务凝练型的,维度比链式架构中显著偏低,后续的动作解码器需要处理的计算量也同步下降;
  3. 过滤了冗余特征的计算量:在融合阶段,模型会通过跨模态注意力机制,自动过滤掉与当前任务无关的视觉特征和语言特征 —— 这些冗余特征的计算和存储开销,在链式架构中往往占总计算量的近 30%;而直接融合架构在特征提取阶段就过滤了这些冗余特征,进一步减少了后续环节的计算量。

浮点运算次数(FLOPs)是衡量模型计算量的关键指标,它与推理延迟直接相关。根据公开的实测数据,TurboVLA 在推理时的总浮点运算量,仅为 π0.5 的近三分之一。这意味着,在相同的硬件算力条件下,它的推理延迟会显著降低。

4.3 降低内存占用 / 带宽需求:减少数据交换延迟

链式架构的串行流程,需要在显存中缓存前序模块的大量中间激活数据 —— 这不仅增加了显存带宽的占用压力,也会因为数据搬运频繁而增加推理延迟。多模态直接融合架构的 “小参数 + 无中间表征” 设计,天然具备内存访问开销的优势。

具体而言,这一优势源于两个核心优化点:

  • 减少了显存的缓存占用需求:模型的权重参数规模显著偏小,在推理时不需要占用大量的显存空间来存储权重参数;更关键的是,没有大量的中间激活数据需要长期驻留显存 —— 在并行计算流程中,当前一阶段的融合结果被传递到动作解码器后,视觉和语言编码器的中间激活数据会被立即释放。这既降低了对显存容量的硬性要求,也减少了对显存带宽的占用压力;
  • 降低了数据搬运的开销:在链式架构中,适配器层需要频繁地在计算单元和显存之间搬运中间特征数据 —— 而在直接融合架构中,融合后的特征数据量很小,且整个融合过程不需要反复搬运数据,大幅降低了数据传输环节的延迟。有公开数据显示,在典型的 VLA 模型推理场景中,这一数据搬运环节的延迟,占链式架构总推理延迟的近 15%。

这一系列优化的叠加效应,显著降低了推理延迟,提升了推理频率。实测数据显示,TurboVLA 在单张 RTX 4090 显卡上的推理延迟仅为 31.2ms,推理频率达到 32Hz;相比之下,π0.5 的推理延迟高达 93.6ms,推理频率仅为约 10Hz。这一频率差距,是决定两种架构谁能真正落地到机器人实时控制场景的关键指标。

4.4 优化动作解码流程:从串行自回归到并行解码

两种架构的动作输出逻辑,也存在根本性的效率差异。这是影响推理频率的最后一个关键环节,也是链式架构的重要性能短板。

传统链式架构的动作输出逻辑,是严格的串行自回归模式:动作解码器会像大模型生成文字一样,逐一生成动作的每个控制 token—— 生成下一个动作 token,必须等待前一个动作 token 的生成结果,完全没有并行性。这一设计的核心问题是,随着动作分块数量的增加,解码延迟会呈线性增长 —— 比如,模型要生成一个包含 10 个控制信号的动作分块,需要连续执行 10 次解码流程,在对实时性要求极高的机器人控制场景中,这一延迟几乎无法被接受。

而多模态直接融合架构的动作解码逻辑,采用了 “并行解码 + 动作分块” 的优化策略:模型会一次性生成一个包含多个控制信号的动作分块,而不是逐个生成控制 token。例如,PD-VLA 模型会把机器人的连续动作拆解为 K 个动作分块,再通过并行解码技术,一次性生成这 K 个分块的控制信号;这一技术的核心是,将自回归的串行解码,转换为单次的并行统一解码 —— 只需要执行一次解码流程,就可以输出完整的多步动作序列,后续的动作执行过程中不需要再反复调用模型计算。这一优化的效果是,在保证动作精度的前提下,将解码延迟直接压缩到了原来的 1/K 量级。

这一技术叠加其他优化后,产生了显著的性能增益:PD-VLA 的实测数据显示,采用并行解码策略后,模型的推理吞吐量提升了 4 倍;当动作分块数量为 8 时,解码延迟仅增加 17%,整体推理效率实现了质的提升。

5. 能力边界与关键取舍

两种模式的架构设计逻辑差异,决定了两者具备不同的能力边界,对应着不同场景下的技术取舍 —— 没有绝对最优的技术方案,只有最贴合场景优先级的选择。

5.1 维度对比一:推理激活节点

这一指标是模型计算资源消耗的综合体现,直接决定了其落地部署的硬件成本门槛,也是两者最显著的差异维度。

  • V-L-A(链式拆分对齐) :由于串行流程、多适配器层、中间表征存储的三重叠加效应,模型在推理时需要激活的神经元数量极多。这意味着,这类模型在推理时需要占用大量的显存空间和计算资源,资源开销与参数量呈正相关。以 π0.5 为例,其推理时的显存占用高达 12.8GB,对部署硬件的显存容量提出了极高要求;
  • V+L-A(多模态直接融合) :在架构层面针对性优化了激活节点的三个核心来源,其激活节点数量远低于链式架构。以 TurboVLA 为例,其推理时的显存占用仅为 0.9GB,不到 π0.5 的十四分之一;甚至可以在普通消费级显卡的显存资源中,预留出足够的空间给机器人的其他实时感知模块,同时满足模型低延迟、高吞吐量的实时推理需求。

关键结论:在资源受限的边缘端部署场景中,V+L-A 模式的低激活资源开销是更优的选择 —— 它将部署硬件的成本门槛下压到了工业级实时控制方案可接受的范围内;而链式架构的高资源消耗门槛,决定了它只能被部署在算力充足的云端服务器中,无法适配大部分机器人的边端落地场景。

5.2 维度对比二:标准机器人 benchmark 性能

标准机器人 benchmark(基准测试),是在实验室标准化控制变量的条件下,测试模型完成标准任务集的成功率,反映的是模型的基础技术性能上限。这一维度上,两者的表现相当,没有出现 “参数小则性能衰减” 的情况。

  • V-L-A(链式拆分对齐) :由于中间语言表征对视觉信息的保留与转化能力,这类模型在大部分标准测试任务中可以达到较高的成功率上限;但受限于信息损耗的短板,其性能上限的提升空间非常有限。以 π0.5 为例,它在 LIBERO 基准测试中的平均成功率为 96.9%;
  • V+L-A(多模态直接融合) :尽管参数量极少,但得益于有效信息利用率的提升,这类模型在标准任务中的表现相当,甚至略有优势。同样以 TurboVLA 为例,它在 LIBERO 基准测试中的平均成功率为 97.7%,高于 π0.5;在部分对空间精度要求较高的灵巧操作任务中,它的优势更明显。

关键结论:两种模式的静态基准测试性能基本持平。多模态融合架构用极小的参数资源开销,换来了与链式架构相当甚至更高的任务成功率,完全没有精度损失。

5.3 维度对比三:决策频率(推理速度)

这是机器人闭环实时控制的核心关键指标,直接决定了机器人动作的流畅度与实时环境反馈的精度上限。两者在这一维度上的差异,达到了倍数级。

  • V-L-A(链式拆分对齐) :串行执行的计算图设计,决定了其推理延迟的优化空间极为有限。以 π0.5 为例,它在 RTX 4090 显卡上的推理延迟高达 93.6ms,决策频率约为 10Hz。这一频率远低于机器人实时控制要求的最低 30Hz,无法支撑需要连续姿态调整的复杂任务;
  • V+L-A(多模态直接融合) :部分并行的计算图设计,结合并行解码、动作分块等优化技术,其推理延迟被大幅压缩。TurboVLA 在相同的 RTX 4090 显卡上的推理延迟仅为 31.2ms,决策频率达到 32Hz;这一频率足以支撑需要连续姿态调整的复杂灵巧任务,如倒水、精密装配等。而 PD-VLA 的实测数据显示,其执行频率比基础链式架构高出 2.52 倍。

关键结论:V+L-A 模式的高决策频率,是支撑闭环实时控制的必要前提 —— 只有动作更新频率足够高,机器人才能根据传感器的实时反馈修正轨迹误差,在需要连续姿态调整的复杂任务中保持稳定性能。而链式架构的低决策频率,无法满足需要实时反馈的闭环控制场景要求。

5.4 维度对比四:复杂逻辑推理及多步思考能力

这一维度的表现,与 “基准测试任务表现” 的结果完全相反。两种模式在这一维度上的能力差异,源于其表征存储逻辑的设计差异。

  • V-L-A(链式拆分对齐) :完整的语言中间表征,是一把双刃剑 —— 它既带来了额外的资源开销,也赋予了模型更强的多步任务信息留存能力。在处理多步骤长时序任务时,链路中的语言模块可以暂时存储上一个动作的中间表征,作为下一步动作执行的参考上下文 —— 这让模型能在多步任务中保持较好的逻辑连贯性。例如,π0.5 在需要 10 个以上连续动作的复杂任务中,依然能保持较高的任务成功率;
  • V+L-A(多模态直接融合) :受限于 “单次融合、单次输出” 的架构设计,它没有显式的模块专门存储多步任务的历史上下文信息 —— 融合后的表征被直接传递给动作解码器后,不会被保留作为后续步骤的上下文输入。这导致模型在处理多步骤、长时序、需要依赖历史动作结果的任务时,长程逻辑关联能力出现一定衰减 —— 在复杂多步任务中,容易出现子任务之间的逻辑衔接偏差。例如,TurboVLA 在需要超过 10 个连续动作步骤的复杂任务中,任务成功率会下降约 15%。

关键结论:链式架构天然适配需要长程逻辑关联的多步任务;而直接融合架构在这一场景中存在明显短板 —— 如果要采用直接融合架构,必须额外配套设计一种历史表征存储机制,比如增加一个单独的历史特征缓存模块,或者在输入中补充上一步的动作反馈数据,才能支撑这类复杂任务的执行。

5.5 维度对比五:开放语言交互能力

开放语言交互能力,决定了机器人可以理解什么样的人类指令,以及能在多大程度上适应人类的多样化指令表达方式。这一维度上,两者的能力差异同样显著。

  • V-L-A(链式拆分对齐) :架构设计中保留了完整的语言模块和语言中间表征,语义理解和转换的能力极强 —— 对模糊指令、非标准化自然语言指令的容忍度更高,具备接近纯大模型的开放语义理解能力,甚至可以理解带一定口语化表述的复杂指令;
  • V+L-A(多模态直接融合) :为了效率砍掉了成熟的语言模块,对自然语言指令的理解和泛化能力受到了明显的约束 —— 在面对复杂、模糊、带歧义的自然语言指令时,语义理解的准确率会低于链式架构;其更适配简短、精确、符合任务标注规范的标准化指令输入。

关键结论:如果场景需要强开放语言交互能力,比如理解用户的日常模糊指令、多轮语义交互指令,链式架构是更合适的选择;如果场景的语言指令是标准化、短格式的,直接融合架构的能力完全可以覆盖需求。

5.6 维度对比六:模态错误风险

模态错误风险,指的是模型在处理不同模态数据时,出现对齐偏差或特征丢失的概率。这一维度上,两种模式的风险来源和类型完全不同。

  • V-L-A(链式拆分对齐) :它的模态错误风险,主要来自串行流程的多阶转换误差累积 —— 在视觉特征转语言表征、语言表征转动作特征的多轮次转换过程中,容易出现空间特征信息丢失或语义对齐偏差的情况;尤其在需要高精度空间特征信息的任务中,这类偏差的发生概率显著更高。实测数据显示,π0.5 在这类任务中的模态错误概率约为 8%;
  • V+L-A(多模态直接融合) :它的模态错误风险,主要来自视觉特征在统一隐空间内的投影偏差 —— 如果投影层的维度对齐设计不够精准,或者训练数据的模态覆盖度不足,可能出现视觉空间特征或语言语义特征在投影后出现细节丢失的情况。但这一风险的发生概率远低于链式架构:TurboVLA 的实测模态错误概率约为 1.2%,远低于 π0.5;其模态错误的后果也相对更可控 —— 误差仅存在于当前动作步骤中,不会在后续流程中逐级放大,也不会形成长程的误差累积。

关键结论:链式架构的多阶误差传递风险更高,且误差会在串行流程中放大,影响最终的动作精度;直接融合架构的单阶误差风险显著更低,且误差不会传递放大,对动作精度的负面影响幅度更小。

5.7 综合取舍:关键能力边界权衡

两种架构模式各有所长,分别适配不同场景下的技术需求,没有绝对最优或绝对落后的方案 —— 技术选型的核心,是权衡场景的技术优先级约束。

从技术适配性的角度看,两者的核心适用场景完全不同:

  • V-L-A(链式拆分对齐) :更适配对实时控制频率要求较低、但对复杂语言指令理解和长程逻辑推理要求较高的场景;或现阶段技术成熟度相对更高的落地场景,比如固定工位的大型工业机器人、对动作实时性要求较低的仓储物流机器人,以及需要复杂语义交互的导览服务机器人。在这类场景中,链式架构的可解释性优势可以得到充分发挥;
  • V+L-A(多模态直接融合) :更适配对推理速度、端侧部署资源、执行精度有严格硬指标约束的闭环实时控制场景 —— 这恰恰是具身智能的主要技术应用场景,比如需要高精度高实时性灵巧操作的工业机械臂、需要快速响应环境变化的人形机器人、需要在资源受限条件下工作的特种作业机器人等。在这类场景中,直接融合架构的低延迟、高资源利用率、低部署成本的优势,是链式架构无法替代的。

从行业技术演进的趋势看,V+L-A 路线是当前具身智能行业的主流选择 —— 它在效率、性能、成本上的均衡表现,更贴合行业对 “可落地的高性价比方案” 的技术需求;而链式架构的技术价值,更多在于其在长程任务、复杂语义交互场景下的可迭代性。

6. 总结

综合上述拆解和分析结果,我们可以系统化总结出两种技术路线的技术特征、性能表现与取舍倾向,为后续的技术选型和方案设计提供参考依据。

6.1 核心结论概览

下表汇总了两种模式的关键技术特性和实测性能表现:

维度

V-L-A(链式拆分对齐)

V+L-A(多模态直接融合)

核心架构范式

串行模块化流水线,分阶段执行视觉→语言→动作的转换,存在多阶显式适配器层

部分并行的端到端统一架构,视觉 / 语言特征并行提取后直接融合,无中间表征转换环节

参数量 / 激活节点

多模块串联 + 多适配器层 + 中间存储,资源消耗极高统一投影 + 无中间表征 + 并行计算,资源消耗显著偏低

典型模型参数规模

π0.5:3.4B

TurboVLA:0.2B(约为前者的 6%)

信息损耗来源

多阶跨模态适配器转换的特征裁剪损失,以及中间表征的冗余噪声

单阶统一投影的极小量化损失,无其他额外损耗

计算图执行模式

完全串行执行,存在大量资源闲置环节

部分并行执行,最大化利用 GPU 计算资源

推理延迟 / 决策频率

高延迟、低频率:π0.5 为 93.6ms/10Hz

低延迟、高频率:TurboVLA 为 31.2ms/32Hz

显存占用

高:π0.5 为 12.8GB

极低:TurboVLA 为 0.9GB

静态基准测试性能

成功率较高:π0.5 为 96.9%

成功率相当或更高:TurboVLA 为 97.7%

复杂多步任务能力

强,保留完整语言中间表征作为历史上下文

中等,需额外设计历史上下文存储机制才能适配

开放语言交互能力

强,保留完整语言模块和语义表征环节

中等,依赖语言编码器的指令理解精度

模态错误风险来源

多阶转换误差累积,空间信息丢失概率高

单阶投影偏差,无误差累积,影响范围可控

典型适用场景

对长程任务、语义交互要求高;对实时性、部署成本约束低的场景

对实时性、精度、部署成本要求严格的闭环控制场景

注:表中典型模型的实测数据均来自公开技术资料与论文测试结果,测试环境为相同的 RTX 4090 显卡,批量大小为 1,数据具有完全可比性。

6.2 深度技术趋势判断

从技术演进的角度看,V+L-A 模式是具身智能行业的主流落地趋势。这一判断并非单纯基于技术理论优势,而是源于三个贴合行业实际需求的核心支撑逻辑:

  1. 性能均衡性优势:它以极低的参数资源成本,实现了与链式架构相当甚至更高的静态任务精度性能;同时,它的低延迟、高推理频率特性,刚好覆盖了 “视觉 - 语言 - 动作” 完整闭环的实时控制需求 —— 这是链式架构无法实现的核心均衡性;
  2. 技术适配性优势:它完美匹配了边端机器人控制器的资源约束 —— 大部分工业级机器人的边端计算单元资源有限,无法支撑大参数链式架构的实时推理负载;而直接融合架构的资源开销可以被这一资源上限覆盖,为实际工程落地提供了可行性;
  3. 场景匹配性优势:机器人控制场景的核心需求是 “实时响应环境变化”—— 而不是 “具备复杂长程语义推理能力”。在实际工业级场景中,机器人的任务指令一般是简短、精确、结构化的,不会包含过于复杂的语义嵌套或长程逻辑;直接融合架构的语言理解能力,足以覆盖这类实际场景需求。

必须强调的是,V+L-A 架构并非 “完美无缺的终极技术方案”—— 它在开放语义交互、长程多步任务上的能力短板依然存在。从技术演进的方向看,这一架构的后续迭代方向,是通过引入 “分层混合表征隔离架构” 来针对性弥补这一短板:将任务的语义规划部分交给上层的大语言模型处理,将动作轨迹的实时生成部分交给下层的直接融合架构处理。这一方案既保留了直接融合架构的效率优势,又通过上层的语言模块补充了其长程逻辑、语义交互能力上的不足。

但就当前的技术成熟度而言,V+L-A 架构是具身智能场景下,兼顾精度、实时性、部署成本的最优技术路线 —— 其架构设计的本质,是 “把计算资源用在实际任务的关键刀刃上”,这也是工程技术落地的核心奥义。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐