标签:#具身智能 #智能驾驶 #VLA #世界模型 #端到端 #大模型
数据口径:本文事实与数据综合自 2026-08 前公开的论文(arXiv)、官方技术报告(Wayve / NVIDIA / Waymo)与行业公开报道;涉及第三方引用处均单独标注口径,具体以各机构原文为准。文中的代码分为两类:标注"官方示例"的以对应开源仓库 README 为准(路径/接口可能随版本变化),标注"伪代码"的仅为理解架构用,不可直接运行

2026 年 8 月,世界机器人大会(WRC)在北京开幕,展台上的机器人不再炫跑跳翻跟头,而是开始叠衣服、炒菜、洗衣服——厂商们从"秀肌肉"转向"拼脑子"。同一个月,Wayve 发布 GAIA-4,把世界模型从"生成场景"推进到"闭环评测端到端驾驶模型"。两条看起来八竿子打不着的赛道,同时指向同一件事:VLA(视觉-语言-动作)负责"想",世界模型负责"预见",两者正在往一套统一架构上收敛。
这篇文章不站队,也不想吹"大一统"。只做一件事:把智能驾驶和具身智能各自的演进路线摆出来,找共同骨架,冷静讨论统一的架构到底是什么样、还差什么。后半部分给一条能实际动手的路径——数据下载、VLA 微调、世界模型推理、开环评测,每一步都有代码。

太长不看版(

  • 两个赛道的共同剧本:都是从"模块化管线"走向"端到端大模型"。驾驶已经走到 VLA 时代(小鹏、理想、华为、小米等),正在向"VLA + 世界模型"演进;具身智能正在经历 VLA 的爆发期(π0.5、GR00T、OpenVLA、GO-1 等)。
  • VLA 是什么:视觉编码器 + LLM 骨干 + 动作解码器,输入相机画面和指令,直接输出动作;核心价值是把"看、想、做"对齐进同一个语义空间。短板是"视觉→语言→动作"两次翻译引入误差、反应变慢。
  • 世界模型是什么:学会"环境如何随时间演化"的模型,能对动作的结果做预测和反事实想象,是解决 VLA"只会反应、不会预见"的关键。
  • 两条技术路线:像素级世界模型(细节好、雨雾天易漂移)vs 潜态/特征级世界模型(抗噪、算得快、精细场景退化)。比亚迪 HyWorldVLA 用两段式训练把两者揉进一套模型,不用二选一。
  • 统一架构的三个层次:表征层(统一 token 空间)→ 决策层(世界模型潜变量作为决策变量,支持因果 what-if 推理)→ 系统层(快慢双系统 + 闭环仿真,Wayve 称之为 Simulation 2.0)。
  • 为什么不能一套模型通吃:自由度、传感器、安全等级、数据形态差异太大;能共享的是"底座",不是"整机"。
  • 动手路径(附代码):LeRobot / nuScenes 数据下载 → OpenVLA / GR00T 微调 → Cosmos 世界模型推理 → NAVSIM 开环评测,最后再谈闭环。
  • 一句话结论:统一架构是有的,但它长在"底座"(token、世界模型、仿真)上,不长在"整机"(执行器、数据、安全)上。

一、引言:两个物理 AI 赛道,殊途同归

先说个数:2026 年上半年,国内具身智能融资总额超过 430 亿元,其中 50.8% 流向了做"大脑"的公司(据量子位统计,界面新闻转述)。资本已经认定,只造身体的机器人公司空间越来越窄。机器人大脑的核心就是具身大模型,而这条路的主流技术路线,正是 VLA。

另一边,自动驾驶已经走完"规则驱动 → 端到端 → VLA"三代(澎湃新闻报道的行业共识),主流车企的 VLA 在常规场景下表现趋同。华为、小米开始喊:VLA 不是终局,只是过渡,下一代是"世界模型"。

一个在实验室里搬杯子,一个在马路上开车,听起来风马牛不相及。但如果你把两边的技术栈摊开看,会发现骨架惊人地相似:

具身智能:  感知(相机/关节) → 理解(VLM/LLM) → 动作(关节控制)
智能驾驶:  感知(多目/雷达) → 理解(LLM 推理) → 动作(转向/油门)

共同问题: 只会"反应",不会"预见"——世界模型就是来解决这个的

这篇文章想聊的就是这个:VLA 给两个赛道统一了"决策的骨架",世界模型给两个赛道统一了"预见的能力"。拼在一起,就是一个跨机器人、自动驾驶的通用物理智能架构。


二、先把两个概念说清楚

2.1 VLA:让模型直接"看-想-做"

VLA(Vision-Language-Action,视觉-语言-动作)模型,输入是摄像头画面 + 一句自然语言指令,输出直接是动作(机械臂关节、车辆的转向和速度)。它由三块拼成:

组件职责典型实现
视觉编码器把多视角图像变成特征向量ViT / SigLIP 等
LLM 骨干决策中心,用世界知识做推理Qwen / LLAMA / Gemini 等
动作解码器把推理结果变成物理动作自回归离散 token / 流匹配 / 扩散

用伪代码理解它的输入输出,就一句话:

# 概念示意:VLA 的输入输出
输入 = {
    "图像":   [cam_0, cam_1, ...],   # 视觉:多视角画面
    "指令":   "把红色杯子放到托盘上",  # 语言:任务描述
    "历史":   [关节/轨迹序列, ...],   # 状态:过去几帧的动作与观测
}
输出 = "动作序列"   # 关节目标 / 横纵向轨迹

VLA 的源头可以追溯到 Google DeepMind 2023 年的 RT-2——第一次把机器人控制塞进视觉-语言模型。此后行业爆发式跟进:斯坦福/伯克利开源了 7B 的 OpenVLA(2024),Physical Intelligence 用流匹配(flow matching)做出 50Hz 实时控制的 π0(2024),英伟达推出双系统 GR00T 系列,智元开源 GO-1。

VLA 的价值在于把传统"感知→规划→控制"三段式压成一个端到端模型,误差不再层层累积;代价是那个被反复讨论的"两次翻译"问题:视觉要先翻译成语言、语言再翻译成动作,每次翻译都有信息损失,而且慢。

2.2 世界模型:学会"预见未来"

世界模型(World Model)的现代定义,最早来自 Ha & Schmidhuber 2018 年的论文:模型在脑子里建立一个对环境的动态预测,用来想象动作的后果。到了物理 AI 时代,世界模型主要指两类:

  1. 生成式世界模型:根据观测 + 动作/控制输入,生成未来的视频或场景。Wayve 的 GAIA 系列、NVIDIA Cosmos、DeepMind Genie 都属于这类,核心用途是合成数据 + 仿真;
  2. 潜态世界模型:不在像素层面"渲染"未来,而是预测未来状态的特征表示,直接把预测结果喂给决策。DriveWorld-VLA、Uni-World VLA 走的是这条路,核心用途是支持决策的反事实推理。

一句话区分:像素级世界模型是"画给你看",潜态世界模型是"直接算给你用"。这两条路线各有一堆坑,第三节和第五节会展开。


三、智能驾驶的技术演进:从规则到 VLA,再到世界模型

3.1 三代范式

自动驾驶过去十年走完了三次重构(据行业公开报道整理):

时代标志原理短板
第一代:规则驱动早期辅助驾驶工程师手写百万行规则,匹配-执行僵化,遇未预设场景直接失效
第二代:端到端特斯拉 FSD V12像素输入、动作输出的单网络只有感知没有理解,避险生硬
第三代:VLA小鹏、理想、华为、小米等(2025-2026)视觉感知 + 语言推理 + 动作输出两次翻译误差、推理慢,被认为是过渡

重点看第三代。2026 年主流车企的 VLA 在常规路况上表现已经趋同,行业开始内卷"VLA 之后是什么"。这条路上有两个绕不开的坐标:Waymo 和 Wayve。

时间机构事件
2018Wayve发布博客《Dreaming about driving》,展示从驾驶视频学习驾驶动态(据 Wayve 自述为最早之一,论文版 2021 年发表)
2023WayveGAIA-1:9B 参数,条件式驾驶视频生成,约 4700 小时伦敦驾驶数据训练
2024WaymoEMMA:基于 Gemini 的端到端多模态模型,相机→轨迹 + 语言解释,在 Waymo Open Motion 与 nuScenes 上刷到当时 SOTA
2025.03WayveGAIA-2:潜空间扩散,多相机可控生成(输入控制量、天气、时间、路线)
2025.12WayveGAIA-3:world-on-rails 反事实场景生成,把世界模型从"视频合成"推向"评测基础"
2026.08WayveGAIA-4:世界模型驱动的闭环仿真,即"Simulation 2.0"(相机+雷达联合生成,据 Wayve 称行业首创)

两家走的是同一条路:先拿世界模型造数据,再拿它做评测。下一节看它们为什么押注这个方向。

3.2 为什么 VLA 不够:缺的不是"逻辑",是"预见"

VLA 能理解"这个行人可能要过马路",但回答不了"如果我加速通过,三秒后会怎样"。纯模仿学习的端到端模型是"反应式"的——学的是轨迹的统计分布,不是因果。世界模型补的正是这一环:提供对动作结果的预测,把规划从"匹配数据"变成"反事实推演"。

2026 年上半年,这个方向密集出论文,四篇代表性工作:

工作团队思路亮点
DriveWorld-VLA北京交大 + 小米(2026.02)世界模型潜变量作为 VLA 决策变量NAVSIMv1 91.3 PDMS、NAVSIMv2 86.8 EPDMS、nuScenes 3 秒碰撞率 0.16,超过 LAW/Epona/HERMES-p 等基线
Uni-World VLA复旦 + 理想(2026.03)自回归交替预测未来帧与轨迹,闭环耦合世界建模与规划交替进行,避免"先预测后规划"的漂移
HyWorldVLA比亚迪新技术研究院像素+潜态双监督两段式训练655 例雨雾测试集 PDMS 86.87 vs 61.18(较 DriveVLA-W0 提升约 42%);据论文方表述为业界首个针对坏天气鲁棒性的评测基准
MindVLA-o1理想汽车(GTC 2026)单一 Transformer 联合感知-推理-控制离散 Action Tokens + MoE,快慢双系统推理,基于模型的 RL 闭环

口径说明:DriveWorld-VLA / Uni-World VLA 为 arXiv 论文口径;HyWorldVLA 数据引自 CSDN DAMO 开发者矩阵对论文的解读文章,属第三方转述,引用时建议回查论文原文;MindVLA-o1 信息来自 GTC 2026 演讲公开摘要。

HyWorldVLA 的定位比较少见:它系统回答了"世界模型在坏天气下到底还能不能用"——这是从论文走向量产绕不开的问题。第五节单独讲它的两段式设计。

3.3 开环与闭环:端到端模型逼出来的仿真革命

端到端模型(Wayve 称之为 AV2.0)有个让行业头疼的特性:它不可分割。没有中间感知输出可以打分,没有独立规划模块可以单测,唯一有意义的评价单元是"整个系统表现得怎么样"。

传统"仿真 1.0"(重放录制数据)对端到端模型是失效的——你把一段固定录像放给模型,模型预测什么都不会改变接下来的画面,等于考试只考"你说你会怎么开",不考"你真的怎么开"。Wayve 在 GAIA-4 里给出答案,他们称之为 Simulation 2.0:

  • 仿真器忠实还原模型实际驾驶所需的全部传感器输入;
  • 闭环:让模型的决策改变它接下来看到的画面(刹车→画面减速,转向→场景随动);
  • 用真实录制做"锚点",只让自车行为偏离,即 world-on-rails(世界在轨道上),生成真实世界从未发生、但物理一致的反事实场景;
  • GAIA-4 支持相机 + 雷达联合生成反事实场景(据 Wayve 称行业首创;"2.5 倍场景保真度"为官方自述,未经独立验证)。

用伪代码理解闭环评测和开环评测的区别:

# 伪代码:开环评测(重放)——模型预测不改变世界
for frame in replay_scene:
    obs = get_sensor(frame)          # 画面是录死的
    act = policy.forward(obs)        # 模型只管预测
    metric.update(act, frame.gt_traj)  # 和真值轨迹比

# 伪代码:Simulation 2.0 闭环评测(world-on-rails)
state = load_real_scene("scene_001")  # 锚点:一段真实录制
while not state.done:
    obs = renderer.sensors(state)     # 忠实还原传感器输入
    act = policy.forward(obs)         # 被测模型决策
    state = simulator.step(state, act)  # 自车行为改变世界(闭环)
    # 世界其余部分沿真实锚点推进,只允许自车偏离(反事实)
score = evaluate(state)               # PDMS / 安全指标

一句话:世界模型不只是"数据工厂",它正在变成端到端智能的"考试院"。这个角色转变,在具身智能那边同样发生。


四、具身智能的 VLA 浪潮

4.1 主流模型地图

2026 年能打的 VLA 大致分几派(据公开选型对比文章整理):

模型机构时间参数规模开源架构特点
OpenVLA / OFT斯坦福、伯克利等2024.06 / 2025.027B自回归离散动作
π0 / π0.5Physical Intelligence2024 / 2025流匹配动作生成,50Hz,基于预训练 VLM
GR00T N1 → N1.6/1.7NVIDIA2025.03 → 2025.122.2B(N1)双系统:System 1 为 DiT 动作生成(快,120Hz)+ System 2 为 VLM 语义理解(慢,10Hz)
GO-1智元机器人2025.03VLM 约 2B + MoEViLLA:隐空间规划器,可看人类视频学动作
HelixFigure2025.02双系统:System 2 为 7B VLM(7-9Hz,慢)+ System 1 为 80M 视觉运动策略(200Hz,快),35-DoF 上半身控制
Gemini RoboticsGoogle DeepMind2025基于 Gemini 多模态

挑三件事说:

  1. 数据是护城河。具身从业者有个共识:具身大模型的竞争,说到底拼的是数据。真机遥操作数据慢且贵,各家都在用合成数据补(GR00T 生态、Cosmos、遥操作方案)。
  2. 世界模型正在"杀回来"。GR-2 证明了"用海量网络视频做生成式预训练、再微调动作"能显著提升泛化;现在越来越多的 VLA 把世界模型当成预训练或协同组件。
  3. 快慢双系统成为共识。无论是 GR00T 的 System 1(快,动作)/System 2(慢,语义)分工,还是 MindVLA-o1 的快慢推理,都在模仿人类的"反射"和"深思"分工,这也是后面统一架构的关键部件。

口径说明:具身模型表格与"2025 年全球人形机器人出货约 1.7 万台、中国占比超八成"等数据引自 2026-08 公开选型对比文章,属第三方整理口径。

4.2 仿真:具身智能的另一块短板

驾驶行业有成熟的仿真体系(即便要重构),但具身智能的仿真长期是短板:机器人抓取一个杯子,物理仿真器里的接触、摩擦和现实差距巨大,sim-to-real gap 一直卡着行业。世界模型在这里的作用和驾驶完全同构——生成"看起来对、物理也对"的合成交互数据,再用闭环仿真评测策略。NVIDIA 的 GR00T 蓝图、Isaac Sim + Cosmos 的组合,做的就是这件事。


五、世界模型的两条技术路线

做世界模型的人都会撞上同一个选择题:像素还是潜态?

路线代表优点短板
像素级GAIA-2、Cosmos Predict、Genie视觉细节真实,可直接当仿真画面/合成数据雨雾等退化场景易漂移;推理贵,车载实时性差
潜态/特征级DriveWorld-VLA、Uni-World VLA抗噪、快,适合车载/嵌入式;直接服务决策精细场景细节退化,难以生成可看的画面

过去业界默认二选一:要细节就牺牲鲁棒,要抗噪就牺牲精细。比亚迪 HyWorldVLA 不想二选一,它的两段式设计单独说一下:

  1. 预训练阶段:像素监督 + 潜态监督同时作用。潜空间在训练期"见过"完整的像素信息,学会了在雨雾、光照退化下如何保持语义稳定;
  2. 微调阶段:只跑潜态推理,输入退化为特征级,部署时没有像素级生成的高成本,速度快、抗噪好;
  3. 坏天气验证:自建 655 例雨雾测试集,PDMS 86.87 vs 基线 61.18(提升约 42%),证明"训练期重、推理期轻"的设计确实把抗噪能力内化进了潜空间。

一句话总结这条路线:重活(像素)在训练期干完,轻活(潜态)留给部署期

潜态路线的代表想法来自 DriveWorld-VLA 的论文。他们把 VLA 与世界模型的结合方式归纳成三种:

结合方式做法问题
(a) 解耦交互世界模型当外部模拟器 / 数据源结构隔离,潜层知识传不进 VLA
(b) 特征共享两边共享表征缺动作因果推理,不会反事实想象
© 统一潜空间世界模型潜变量直接作为决策变量可控因果 what-if 推理(论文做法)

(a) 是今天大多数公司的做法(世界模型只负责产数据),© 是论文里的"完全体"——代价是训练和工程复杂度陡增。多数团队的现实路径是 (a) 起手、(b) 过渡、向 © 演进。


六、统一架构的三个层次(本文核心)

把驾驶和具身的技术栈对齐后,我认为"统一"发生在三个层次,而不是整机复用。

6.1 表征层:统一 token 空间

一切的起点是表征。视觉、语言、动作、世界状态,如果各说各话,模型就无法共享知识。今天的趋势是把四者都切成 token,塞进同一个 Transformer:

                   统一 Token 空间
   ┌────────────┬────────────┬────────────┬────────────┐
   │ 视觉 Token │ 语言 Token │ 动作 Token │ 世界 Token │
   │ (图像/视频) │ (指令/推理) │ (关节/轨迹) │ (未来状态)  │
   └────────────┴────────────┴────────────┴────────────┘
  • 视觉:Cosmos Tokenizer、视频 VAE 这类工具已经在把视频压成紧凑 token;
  • 动作:MindVLA-o1 用离散 Action Tokens,π0 用连续流匹配,OpenVLA 用离散动作 token——动作已被当成一种"语言"建模;
  • 世界:潜态世界模型输出的未来状态表征,就是"世界 token"。

车和机器人虽然物理形态不同,但在这个 token 空间里,它们是同一类序列问题。一个最小接口设计长这样(伪代码):

# 伪代码:一个"统一 token 空间"的最小接口设计
class UnifiedTokenizer:
    def encode_visual(self, frames):    # 视频/图像 -> 视觉 token
    def encode_language(self, text):    # 指令 -> 语言 token
    def encode_action(self, traj):      # 关节/轨迹 -> 动作 token
    def encode_world(self, latent):     # 世界模型未来状态 -> 世界 token
    def decode_action(self, tokens):    # 动作 token -> 物理动作

6.2 决策层:世界模型潜变量作为决策变量

统一表征之后,关键一跃是让"预见"参与"决策"。也就是前面说的 © 路线:世界模型预测的未来潜状态,直接作为 VLA 规划器的输入状态,模型可以针对候选动作推演"如果我这样开/抓,环境会变成什么样",再做选择。这比"先生成未来视频、再在上面规划"((a) 路线)快得多,也避免了开环想象和真实决策过程的漂移(Uni-World VLA 针对的正是这个漂移)。

用伪代码看 © 的训练循环长什么样:

# 伪代码:世界模型潜变量作为决策变量(DriveWorld-VLA 思路的极简示意)
for batch in train_loader:
    obs_tok  = tok.encode_visual(batch["cameras"])      # 历史观测
    lang_tok = tok.encode_language(batch["instruction"]) # 任务指令

    # 世界模型:给定已执行动作,预测未来潜状态(训练期用真值监督)
    z_future = world_model.forward_latent(obs_tok, batch["actions"])

    # VLA:把"未来状态"作为决策输入,输出当前动作
    fused      = fuse(obs_tok, lang_tok, z_future)
    pred_action = vla.action_decoder(fused)

    loss = action_loss(pred_action, batch["actions"]) + world_model.loss()
    loss.backward()

关键不在"世界模型有多准",而在"预测出来的未来状态要能影响决策"——这一点 (a) 路线做不到。

6.3 系统层:快慢双系统 + 闭环仿真

统一架构不是单模型,而是一套系统分工:

┌───────────────────────────────────────────────────────┐
│                    世界模型(离线底座)                   │
│    合成数据生成(Cosmos/GAIA)|闭环仿真(Simulation 2.0) │
└──────────────────────┬────────────────────────────────┘
                       ▼
┌───────────────────────────────────────────────────────┐
│                VLA 决策主干(统一 token 空间)            │
│   System 2(慢):VLM 语义推理、语言级规划(10Hz 量级)     │
│   System 1(快):动作级反射,流匹配/扩散直出动作(百 Hz)  │
└──────────────────────┬────────────────────────────────┘
                       ▼
┌───────────────────────────────────────────────────────┐
│    执行层:动作解码器 → 车(横纵向轨迹)/机器人(关节)     │
└───────────────────────────────────────────────────────┘
  • 世界模型在"训练-验证"环路里当底座:离线生成合成数据缓解长尾,在线做闭环评测(GAIA-4 的 Simulation 2.0、Isaac Sim + Cosmos);
  • VLA 在"感知-决策"环路里当主干:System 1 兜底高频实时控制,System 2 处理复杂场景的慢推理;
  • 两者的接口就是统一 token 空间——世界模型产出的未来状态 token,喂给 VLA 的规划器。

这个架构对车和机器人是同构的。NVIDIA 的布局一直在讲同一个故事:Omniverse(物理仿真)+ Cosmos(世界模型)+ DGX/Jetson(训练与车载/机载部署),同一套底座同时服务机器人和自动驾驶两个场景。

6.4 但先别乐观

统一架构在"底座"层成立,不等于"模型"层能通吃。差异在下一节。


七、差异:为什么不能一套模型通吃

如果直接拿一个机器人 VLA 去开车,或者反过来,会在这些地方撞墙:

维度具身智能(机器人)智能驾驶
运动学双臂 + 灵巧手,20+ 自由度,非完整约束6 自由度刚体,阿克曼转向约束
观测本体相机 + 关节编码器 + IMU多目相机 + 激光雷达 + 毫米波
交互对象桌面物体、家居、人车辆、行人、交通设施
物理尺度米级、低速、可随时停止十米级、高速、动量巨大
安全要求操作安全(碰撞力、权限)ISO 26262 功能安全 + SOTIF,监管认证
数据来源遥操作采集,慢而贵车队路采,天然海量
评价体系任务成功率、示教对齐PDMS/EPDMS、碰撞率、接管率
失败代价摔一个杯子一起事故

结论很直白:共享的是"底座"(tokenizer、世界模型、仿真范式、训练方法),定制的是"整机"(执行器、观测头、安全层、数据管线)。所以业界讲的是"world foundation model + 领域后训练",而不是"一个模型开天辟地"。


八、想上手?给一条现实路径(附代码)

这个方向没有"三分钟跑通"的捷径,但可以按下面这条线逐步建立体感。以下代码分三档:可直接复制的命令(官方仓库写法)、微调后推理(需先完成上一步)、以及只供理解架构的伪代码——每段都有标注,别拿伪代码去跑。

8.1 第一步:挑一个赛道,先摸数据

具身赛道:用 LeRobot 下一个现成数据集

LeRobot 是 Hugging Face 的开源机器人学习库,自带数据集下载和训练脚本。装好依赖、下载一个 10 万步的 pusht 示教数据集:

pip install lerobot

# 下载官方 pusht 数据集(含相机画面 + 关节动作 + 指令)
lerobot download lerobot/pusht

# 用默认 ACT 策略在这个数据集上训练(先跑通最小闭环)
python lerobot/scripts/train.py policy=act dataset_repo_id=lerobot/pusht env=pusht

跑通这一条命令,你对"示教数据长什么样、训练日志怎么读、checkpoint 在哪"就有了实感。

驾驶赛道:用 nuScenes 看一帧多模态数据

pip install nuscenes-devkit
from nuscenes import NuScenes

nusc = NuScenes(version="v1.0-mini", dataroot="./data/nuscenes", verbose=True)

sample = nusc.get("sample", nusc.first_sample_token)
sample_data_tokens = nusc.field2token("sample_data", "sample_token", sample["token"])
print("传感器:", [nusc.get("sample_data", tok)["channel"] for tok in sample_data_tokens])
# 输出类似: 传感器: ['CAM_FRONT', 'CAM_FRONT_LEFT', 'CAM_FRONT_RIGHT', 'LIDAR_TOP', ...]

把数据真正打开看过一遍,比读十篇博客都有用——你会直观理解"驾驶数据天生海量(车队路采)而机器人数据要靠人一帧帧遥操作"这个差异。

8.2 第二步:跑一个开源 VLA 的微调

方案 A:OpenVLA(自回归离散动作,门槛最低)

从 Hugging Face 拉 7B 权重,用 LoRA 在 bridge_orig 数据集上微调:

git clone https://github.com/openvla/openvla.git
cd openvla

python scripts/finetune.py \
  --data_root_dir datasets/ \
  --dataset_name bridge_orig \
  --pretrained_checkpoint openvla/openvla-7b \
  --use_lora \
  --lora_rank 32 \
  --run_id openvla_finetune_bridge

微调结束后,加载你微调得到的目录做一次推理(接口以官方 README 为准):

import torch
from transformers import AutoModelForVision2Seq, AutoProcessor
from PIL import Image

run_dir = "runs/openvla_finetune_bridge"          # 上一步的输出目录

processor = AutoProcessor.from_pretrained(run_dir)
vla = AutoModelForVision2Seq.from_pretrained(
    run_dir, torch_dtype=torch.bfloat16
).to("cuda")

image = Image.open("frame_0.jpg")
prompt = "pick up the red block"

inputs = processor(prompt, image).to("cuda", dtype=torch.bfloat16)
action = vla.predict_action(
    **inputs,
    unnorm_key="bridge_orig",   # 微调时学到的动作归一化统计量
    do_sample=False,
)
print(action)

方案 B:GR00T N1.x(双系统,接触世界模型的入口)

pip install isaac-gr00t
# 微调/预训练示例在官方仓库 Isaac-GR00T 的 examples/ 目录下,
# 先跑通默认 config(含真实机器人和仿真数据集),再换成你自己的数据

GR00T 建议跑一次:它内置了"System 1(快,动作)+ System 2(慢,语义)"双系统,和第三节 MindVLA-o1 的架构同一个思路,跑完你对"快慢双系统"就有体感了。

8.3 第三步:接触世界模型

想要"画给你看":跑一次 Cosmos 推理

Cosmos 的权重在 Hugging Face(nvidia/Cosmos-Predict1-7B 等),仓库在 GitHub(NVIDIA/Cosmos),下面是最小推理的示意(以官方示例为准):

git clone https://github.com/NVIDIA/Cosmos.git
cd Cosmos
pip install -e .   # 按官方 README 安装依赖
# 示意:加载 Cosmos-Predict1 生成式世界模型(以官方示例代码为准)
import torch
from cosmos_predict1.cosmos_predict1_autoregressive import CosmosPredict1ARModel

model = CosmosPredict1ARModel.from_pretrained("nvidia/Cosmos-Predict1-7B")
model.eval().to("cuda")

with torch.no_grad():
    # 输入:一段视频(prompt_video),输出:它"想象"出的后续帧
    future_video = model.generate(prompt_video=prompt_video, num_frames=24)

这段代码不是让你直接上车用的,而是让你直观看到两件事:世界模型的输入是"观测 + 控制意图",输出是"未来";以及为什么像素级生成这么贵——它每生成一帧都要过一遍扩散/自回归主干。

想要"算给你用":读 DriveWorld-VLA 的开源代码

重点不是复现分数,而是看它的 fuse 模块怎么写——世界模型潜变量到底以什么形式、在模型的哪一层进入 VLA。这直接对应第六节 6.2 的伪代码。读完你就会理解 (a) 和 © 的工程差距有多大。

8.4 第四步:建立你的评价闭环

开环指标用来快速迭代,闭环指标用来判断真水平。两套都要有。

开环:用 NAVSIM 给驾驶模型打分

NAVSIM(autonomousvision/navsim)是 DriveWorld-VLA 等工作的公开评测基准。用法示意(以官方 README 为准):

git clone https://github.com/autonomousvision/navsim.git
cd navsim
# 配置好数据集后,用仓库自带的评测脚本跑一个 planner 的开环分数
# 会输出 PDMS / EPDMS 等指标

记住:NAVSIM 的 PDMS / EPDMS 并非简单"开环打分",而是通过 4 秒非响应式(non-reactive)仿真计算——PDMS 由惩罚项(NC、DAC)与加权项(TTC、EP、C)组合而成,EPDMS 在其上叠加 DDC、TLC、LK、HC、EC 等项;v2 用两阶段 pseudo closed-loop 聚合来近似闭环。它便宜、可复现,但仍不是真闭环,别把它当实车水平。

闭环:用一个最小循环验证

# 伪代码:最小闭环验证(驾驶 / 机器人都适用)
env = make_env()                       # 仿真环境(CARLA / Isaac Sim / 自研)
policy = load_your_vla("best_ckpt.pt")

episode_scores = []
for ep in range(N):
    obs, info = env.reset()
    done = False
    while not done:
        act = policy.forward(obs)      # 决策
        obs, reward, done, info = env.step(act)  # 动作改变环境(闭环)
    episode_scores.append(ep_score(info))
print(mean(episode_scores))
指标类型内容注意
开环指标驾驶:PDMS / EPDMS / 碰撞率;机器人:任务成功率好开环 ≠ 好闭环,只做参考
闭环指标仿真闭环跑分(CARLA / Isaac Sim / GAIA-4 式仿真)、真机/实车测试成本高,但才是真水平

九、避坑指南(都是公开讨论过的坑)

说明
拿开环当闭环重放录像测"预测能力"≠真实驾驶/操作表现,compounding error 会累积,必须闭环验证
像素世界模型直接上车推理贵、实时性差;雨雾天漂移是公开短板,HyWorldVLA 论文专门治这个
只选一条路线像素 vs 潜态不是非此即彼,两段式混合(如 HyWorldVLA)是 2026 年的新答案
VLA 语言中间层迷信视觉→语言→动作两次翻译必有损耗,高频控制要设计 System 1 直出动作
仿真数据无脑堆世界模型生成的数据要过筛选(Cosmos Reason 就是干这个的),不然长尾更脏
忽视 sim-to-real gap具身抓取这类接触任务,仿真里的摩擦/形变和现实差很远,合成数据不能替代真机数据
复现 benchmark 高分直接上量NAVSIM 这类开环榜单被"刷爆"是常态,落地上路/上机前务必自建小样本闭环验证
拿 GPU 先跑伪代码文章里标注"伪代码"的段落只是架构示意,直接复制到训练脚本里会报错,动手前先分清代码档次

十、冷静看:还没解决的问题

  1. 世界模型的长期一致性:生成式世界模型在多步 rollout 中会漂移——预测三秒可以,预测三十秒就开始"忘物理"。这是从"数据工厂"走向"在线想象"要过的第一关。
  2. 因果 vs 相关:今天的大多数世界模型学的是"画面上的统计规律",不是"物理因果"。反事实推理(如果我做了 A 会怎样)要想可靠,需要更强的因果建模,而不是更多数据。
  3. 统一架构的工程代价:© 路线的"世界模型潜变量即决策变量"训练复杂、难调,目前只有论文验证,还没有量产级别的证明。行业多数还在 (a)。
  4. 安全与认证:端到端模型不可分割,天然和"逐模块验证"的汽车功能安全体系冲突。Wayve 用 Simulation 2.0 回答"怎么证明它安全",但监管侧的最终答案还没出现。具身智能更是连统一的安全标准都还在路上。
  5. 数据分层:机器人数据贵且慢,驾驶数据多但不含操纵语义——跨赛道共享数据这件事,目前只有"网络视频预训练"一条被证明有效(GR-2 路线),离端到端直用还很远。
  6. 评测仍不统一:驾驶的 NAVSIM、具身的任务成功率各自为政,两边没有一套"既能开环又能闭环、还带安全指标"的公共评测体系。Wayve 的 Simulation 2.0 只是迈出了第一步。

十一、总结与展望

回到标题的问题:从具身智能到智能驾驶,有没有统一架构?

我的结论是:有,但它长在底座上,不长在整机上。VLA 统一了两个赛道的"决策骨架",世界模型统一了它们的"预见能力";两者通过统一 token 空间耦合,配合快慢双系统与闭环仿真,构成一套对车和机器人都成立的物理智能架构。NVIDIA 的 Omniverse + Cosmos + Jetson 三件套,Wayve 的 AV2.0 + GAIA 路线,都在往这个方向走。

但也要清醒:运动学、传感器、安全等级、数据形态的差异决定了"共享底座、定制整机"是唯一现实的路径;世界模型的长期一致性和因果建模、端到端模型的安全认证,仍然是横在两个赛道面前共同的硬骨头。

给读者的建议

  1. 先想清楚自己是"底座玩家"还是"整机玩家"——前者卷世界模型和表征,后者卷数据和部署;
  2. 无论哪边,都从跑通一个开源 VLA 的最小闭环开始(第八节的三步走);
  3. 把"开环 + 闭环"两套评价体系都建起来再谈优化,别被单个榜单带节奏;
  4. 关注三件事的进展:世界模型的长期一致性、潜态世界模型进决策的量产案例、以及两个赛道的安全认证标准。

2026 年的物理 AI,正处在"秀肌肉"向"拼脑子"切换的当口。世界模型 + VLA 的统一架构思考,与其说是技术预言,不如说是给从业者的一张地图:资源应该花在底座(token、世界模型、仿真),还是整机(数据、部署、安全)?想清楚了,就知道该往哪使劲了。

参考资源

  • DriveWorld-VLA:arXiv:2602.06521(北京交大 + 小米)
  • Uni-World VLA:arXiv:2603.27287(复旦 + 理想)
  • GAIA-2 技术报告与 GAIA-4 博客(Wayve,2026-08)
  • Cosmos World Foundation Model Platform:arXiv:2501.03575 + NVIDIA 官方博客 + GitHub: NVIDIA/Cosmos
  • 《An Anatomy of Vision-Language-Action Models》:arXiv:2512.11362
  • OpenVLA:arXiv:2406.09246 + GitHub: openvla/openvla
  • LeRobot:GitHub: huggingface/lerobot;NAVSIM:GitHub: autonomousvision/navsim;nuScenes:GitHub: nutonomy/nuscenes-devkit
  • 澎湃新闻《自动驾驶技术竞争升级,VLA 之后是什么?》(2026-05)、界面新闻《这届机器人,开始从"秀肌肉"转向"拼脑子"》(2026-08)、CSDN 具身模型选型对比文章(2026-08)等公开报道
  • 本文为架构层面的思考梳理,不构成技术选型或投资建议;涉及的数据与结论请以各机构论文、官方文档为准;文中的命令与接口以对应开源仓库最新版本为准
    关注我,持续拆解 2026 年物理 AI 的关键技术——VLA、世界模型、端到端驾驶、具身大模型,用看得懂的方式讲清原理,用能上手的路径教你入门。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐