1. 引言

目前具身智能中的 VLA(Vision-Language-Action,视觉-语言-动作)模型,核心演进主线是解决“语言/多模态大模型的通用认知”与“物理世界高频、连续动力学控制”之间的失配问题。随着通用视觉语言模型能力快速提升,如何把大模型强大的场景理解与语义推理能力,平滑地转化为机器人可执行的高频连续动作,成为这一领域的核心挑战。围绕这一问题,主流技术体系已经分化为三大技术路线:纯自回归文本离散化路线、VLM 骨干加连续扩散/流匹配头路线,以及双流解耦与分层双脑路线。

2. 路线一:纯自回归文本离散化路线(Tokenized VLM)

核心思想:把机器人的连续动作(如 7 维末端位姿、夹爪开闭)切分成有限区间(如 256 个 Bin 格子),映射为特殊的文本 Token,直接塞进自回归语言模型里像写字一样一个词一个词预测。

技术特征

  • 使用标准的交叉熵分类损失(Cross-Entropy Loss);
  • 模型结构极简,完全复用现有大语言模型(LLM/VLM)的基础设施。

局限性:动作缺乏连续物理平滑度,动作维度高时自回归解码延迟极大,高频控制容易顿挫。

代表模型

  • RT-2(Robotics Transformer 2):Google 提出的开山之作,首次验证了将动作作为特殊 Token 融入 VLM 的可行性。
  • OpenVLA(7B):斯坦福等机构开源的标杆模型,基于 Prismatic-VLM 与 Llama-2,在 Open X-Embodiment 数据集上微调,支持单卡 LoRA 微调,是目前开源社区最易上手的基座之一。

3. 路线二:VLM 骨干 + 连续扩散/流匹配头路线(Continuous Action Chunking)

核心思想:抛弃离散化动作切片,保留大模型对画面的高维空间与语义提炼,但把动作输出交给专门的连续生成模型(Diffusion 或 Flow Matching),直接预测未来的整段连续动作轨迹(Action Chunking)。

技术特征

  • 大模型输出高维 Embedding 作为条件(Conditioning);
  • 后端依靠连续向量场去噪,单步生成未来几十步(如 0.5 秒内)的高精度连续轨迹,支持 30Hz~50Hz 高频控制。

局限性:训练多步去噪网络需要极高计算开销与海量高质量真机/仿真轨迹。

代表模型

  • π₀(Physical Intelligence):具身领域的工业级标杆,采用 3B 级 VLM 骨干 + 连续流匹配(Flow Matching)动作解码器,原生支持双臂、非刚体(折衣服、纸箱包装)等极高精度物理装配。
  • Octo:伯克利等机构开源的早期基于扩散(Diffusion)解码头的通用机器人策略,支持多相机视角与任意目标/语言驱动。
  • RoboFlamingo / VLM4VLA 架构范式:冻结 VLM 视觉语义主干,后端替换为轻量级连续动作生成网络。

4. 路线三:双流解耦与分层双脑路线(Hierarchical / Twin-Brain)

核心思想:将“看懂想明白(Cognition)”与“动手做平滑(Motor Control)”在架构上进行显式解耦,解决单一端到端大模型带来的灾难性遗忘与推理时延过高两大死穴。

技术特征

  • 大脑/通才分支(Generalist):完全冻结的超大参数通用 VLM,负责场景感知、语义理解与空间关系推演;
  • 小脑/专才分支(Specialist):轻量级动作网络,仅利用非对称注意力单向吸纳大脑传来的意图特征,专注学习电机动力学控制;
  • 数据与知识单向流动,避免小脑微调反向破坏大脑通识。

代表模型

  • TwinBrainVLA:采用双流架构,冻结通用多模态主干,训练专才具身动作分支,结合非对称交叉注意力和 Flow-Matching 生成平滑动作。
  • ACoT-VLA(动作思维链体系):在吐出底层连续动作前,先自回归生成一段高层空间推理与子目标分解的“思考文本”,充当显式的大脑规划层。

5. 三大路线选型对比

评估维度路线一:纯自回归离散化(如 OpenVLA)路线二:连续流匹配/扩散(如 π₀)路线三:双流解耦/双脑(如 TwinBrainVLA)
动作平滑与精度较低(有量化误差与离散顿挫)极高(连续流场平滑)极高(专才控制网络驱动)
端侧推理控制频率慢(约 5Hz)快(约 30Hz~50Hz)极快(高低频异步协同,小脑可达 50Hz+)
泛化知识防遗忘易发生表征坍塌依赖海量多任务混合正则最好(物理阻断反向梯度)
开源可用性与上手难度最容易(单卡 LoRA 可跑)极高(算力开销大,权重多为企业闭源)中高(结构解耦设计要求较高)

6. 总结

三大技术路线反映了具身智能在通用认知与物理控制之间的不同权衡:路线一以最小改造代价复用语言模型基础设施,适合快速验证和轻量部署;路线二追求连续、高频、高精度的动作生成,代价是训练与推理算力显著上升;路线三则通过显式解耦保护通用知识,同时让专才控制网络获得平滑且低延迟的动作输出。三者并非简单替代关系,实际选型往往取决于任务精度要求、可用的真机数据规模、开源生态成熟度以及端侧算力预算。随着流匹配、动作思维链与双脑架构持续演进,未来 VLA 模型有望在保持通用认知能力的同时,以更低时延和更高平滑度实现复杂物理交互。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐