一、引言:具身智能为什么需要一颗"大脑"

过去几年,大语言模型(LLM)在数字世界里展现了惊人的推理与生成能力,但它始终被困在屏幕里——能"说",却不能"做"。具身智能(Embodied AI)要解决的正是这个问题:让智能体拥有物理身体,在真实世界中感知、决策并行动。而连接"感知-认知-行动"这三者的关键枢纽,就是视觉-语言-动作模型(Vision-Language-Action Model,VLA)。

如果把具身智能体比作一个人,传感器是它的眼睛和皮肤,执行器是它的手和脚,那么VLA模型就是它的"大脑"。这颗"大脑"要同时理解摄像头看到的画面、听懂人类下达的自然语言指令,还要输出精确的电机控制信号。本文将从架构层面系统拆解VLA模型的设计思路,梳理其从RT-1到OpenVLA的演进脉络,并结合作者在多模态动态加权方向的前期研究工作,讨论模态融合这一核心难题。

二、VLA是什么:从视觉-语言到视觉-语言-动作

VLA并不是凭空出现的概念,它的技术血脉来自两条路线的汇合。第一条是视觉-语言模型(VLM):以CLIP为代表的双塔对比学习打通了图像与文本的语义空间,此后BLIP、LLaVA等模型把视觉特征"嫁接"到语言模型上,让LLM具备了看图说话的能力。第二条是机器人策略学习:从早期的模仿学习、强化学习,到Decision Transformer把轨迹建模为序列预测问题,机器人控制逐渐被纳入"下一个token预测"的统一范式。

VLA的本质,就是把这两条线拧成一股:将视觉观测、语言指令、机器人本体状态统一编码为token序列,送入一个共享的Transformer主干,再从中解码出动作。它带来的最大改变是"知识迁移"——模型在互联网规模的图文数据上学到的常识(比如"苹果是红色的、圆形的、可以抓握的"),可以直接服务于物理世界的操作任务,而不必从零学习每一个物体。

三、架构拆解:VLA的三大核心组件

尽管各家实现细节不同,主流VLA模型在宏观架构上高度一致,可以拆成"三路输入编码—统一主干—动作解码头"三段式结构。在这里插入图片描述

3.1 多模态输入编码

VLA的输入通常有三路。视觉一路最重的计算来自视觉编码器,主流选择是CLIP或SigLIP预训练的ViT,把图像切成patch后提取语义特征;部分工作(如RT-1)使用EfficientNet这类轻量卷积网络换取实时性。语言一路直接复用LLM的分词器与嵌入层。本体状态一路(关节角度、末端位姿、夹爪开合度、力触觉等)维度低但信息密度高,一般用简单的MLP投影到统一的嵌入空间。

3.2 统一主干网络

主干通常是一个预训练好的大型Transformer。RT-2直接采用PaLI-X与PaLM-E的VLM权重,OpenVLA基于Llama 2改造,PaLM-E则把连续模态的嵌入"注入"到PaLM语言模型中。把所有模态拉平成token序列后,自注意力机制天然地完成了跨模态信息交换——这正是VLA架构的优雅之处:不需要为每对模态设计专用的融合模块,注意力本身即是融合。

3.3 动作解码头

动作输出是当前架构分化最明显的环节,主要有三种路线。其一是离散token化:RT-2把每个动作维度离散化为256个bin,当作特殊词表让模型"说"出动作,实现与语言生成的完全统一,但精度受bin粒度限制。其二是连续回归头:直接在主干输出上接一个MLP回归连续动作,OpenVLA即采用此方案。其三是生成式动作头:以π0(Pi-Zero)为代表的流匹配(Flow Matching)方法和Diffusion Policy的扩散方法,用迭代去噪生成动作轨迹块(action chunk),在高频精细操作上表现更好,代价是推理时延增加。

四、代表性模型演进路线

下表梳理了VLA发展史上六个里程碑式工作的关键设计选择,可以清晰地看到"大脑"的进化逻辑:规模越来越大、动作表示越来越精细、开放程度越来越高。

模型 年份 视觉编码 主干 动作表示
RT-1 2022 EfficientNet TokenLearner+Transformer 离散token(256 bin)
PaLM-E 2023 ViT-22B PaLM-540B 多模态嵌入注入
RT-2 2023 ViT(PaLI-X) PaLI-X / PaLM-E 动作即token,联合微调
Octo 2024 轻量ViT Transformer(93M) 扩散动作头,开源
OpenVLA 2024 SigLIP+DINOv2 Llama 2-7B 连续回归,完全开源
π0 2024 SigLIP PaliGemma+动作专家 流匹配,50Hz高频控制

表1:代表性VLA模型架构对比(据各论文公开资料整理)

从这条演进线可以看出三个趋势:第一,视觉编码从单塔走向"语义+细节"双塔融合,OpenVLA把SigLIP的语义特征与DINOv2的空间细节特征拼接,显著提升了空间推理能力;第二,主干从闭源巨模型走向开源中等规模模型,7B量级已成为学术界复现与微调的主流基座;第三,动作生成从粗粒度离散化走向连续化、块化、高频化,流匹配等生成式方法正在取代简单的分bin回归。

五、模态融合的核心难题:从静态拼接到动态加权

架构图里的"统一主干"看起来一劳永逸,但真正的魔鬼藏在细节里:三路模态的信息量并不对等,且随场景剧烈变化。机器人在光线充足的桌面抓取物体时,视觉特征贡献最大;在黑暗环境或物体被遮挡时,本体状态与触觉才是可靠依据;而当指令本身包含歧义(“把那个拿过来”)时,语言模态需要视觉上下文来消解指代。用固定方式拼接或等权融合所有模态,等于假设世界永远不变——这在真实机器人场景中是站不住脚的。

这正是作者前期研究工作的切入点。在作者已发表并被Scopus检索的论文中,提出了一种多模态动态加权融合机制(MQN-DWG):不再让各路特征以静态权重进入融合层,而是引入一个轻量的质量评估网络,根据当前各模态输入的置信度实时计算归一化权重——视觉清晰时视觉主导,视觉退化时自动切换到状态与语言主导。该思路与多模态融合领域的MulT(多模态Transformer)一脉相承,但针对具身场景的实时性与鲁棒性做了重构。

作者注:关于MQN-DWG机制的完整数学定义、质量查询网络结构与消融实验数据,可参考相关Scopus检索论文。本文侧重架构层面的论述,不再展开公式细节。

把视角拉回VLA主线,国际上的最新工作也在向同一方向收敛。CLIP式的静态对齐在具身任务中频繁失效,催生了多种自适应融合尝试:有工作在注意力层引入模态门控(gating),有工作用Mixture-of-Experts让不同专家处理不同模态组合,π0的"动作专家"设计本质也是一种权重的结构化分配。可以说,"动态加权"正在从一种可选优化变成VLA走向真实环境的必修课——这与作者在MQN-DWG中论证的核心判断完全一致。

六、挑战与展望

尽管进展迅猛,VLA距离真正通用的具身"大脑"仍有四道坎。第一是数据:互联网图文数据以百亿计,而最大的机器人操作数据集Open X-Embodiment也只有百万级轨迹,数据规模的差距限制了模型的泛化上限,仿真合成数据与世界模型生成数据是两条突围路线。第二是实时性:7B模型在边缘设备上跑到50Hz控制频率几乎不可能,模型蒸馏、动作块缓存与"大脑-小脑"分层架构(高层低频规划、底层高频执行)是当前的主流折中。第三是长时序任务:现有VLA大多擅长几十秒的原子技能,面对"做一顿饭"这类需要几十个子任务串联的场景,还需要上层任务规划器与记忆机制配合。第四是安全与评测:物理世界的试错代价远高于数字世界,如何建立标准化的安全评测基准,是比刷榜成功率更迫切的议题。

展望下一步,作者认为有三个值得关注的方向:其一,动态加权与MoE架构的深度结合,让模态路由成为可学习、可解释的一等公民;其二,VLA与Agentic工作流的融合,大模型负责任务分解与工具调用,VLA负责底层执行,形成"规划脑+运动脑"的双层结构;其三,触觉、力觉等接触模态的规模化接入,这将是VLA从"会看会做"走向"会做精细活"的关键一跃。

七、结语

VLA模型的演进史,本质上是一部"大脑"不断打通感官与四肢的历史:CLIP打通了眼与脑,RT-2打通了脑与手,而接下来的竞争焦点,是让这颗大脑学会根据环境灵活分配注意力——知道什么时候该相信眼睛,什么时候该相信身体。作者在多模态动态加权方向的探索(MQN-DWG)正是这场大演进中的一块拼图。架构的统一让知识得以迁移,而融合的智慧将决定具身智能能走多远。

(本文为作者首发于CSDN的技术论述,转载请保留出处。)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐