从具身智能到智能驾驶:世界模型 + VLA 的统一架构思考
标签:#具身智能 #智能驾驶 #VLA #世界模型 #端到端 #大模型
数据口径:本文事实与数据综合自 2026-08 前公开的论文(arXiv)、官方技术报告(Wayve / NVIDIA / Waymo)与行业公开报道;涉及第三方引用处均单独标注口径,具体以各机构原文为准。文中的代码分为两类:标注"官方示例"的以对应开源仓库 README 为准(路径/接口可能随版本变化),标注"伪代码"的仅为理解架构用,不可直接运行
2026 年 8 月,世界机器人大会(WRC)在北京开幕,展台上的机器人不再炫跑跳翻跟头,而是开始叠衣服、炒菜、洗衣服——厂商们从"秀肌肉"转向"拼脑子"。同一个月,Wayve 发布 GAIA-4,把世界模型从"生成场景"推进到"闭环评测端到端驾驶模型"。两条看起来八竿子打不着的赛道,同时指向同一件事:VLA(视觉-语言-动作)负责"想",世界模型负责"预见",两者正在往一套统一架构上收敛。
这篇文章不站队,也不想吹"大一统"。只做一件事:把智能驾驶和具身智能各自的演进路线摆出来,找共同骨架,冷静讨论统一的架构到底是什么样、还差什么。后半部分给一条能实际动手的路径——数据下载、VLA 微调、世界模型推理、开环评测,每一步都有代码。
太长不看版(
- 两个赛道的共同剧本:都是从"模块化管线"走向"端到端大模型"。驾驶已经走到 VLA 时代(小鹏、理想、华为、小米等),正在向"VLA + 世界模型"演进;具身智能正在经历 VLA 的爆发期(π0.5、GR00T、OpenVLA、GO-1 等)。
- VLA 是什么:视觉编码器 + LLM 骨干 + 动作解码器,输入相机画面和指令,直接输出动作;核心价值是把"看、想、做"对齐进同一个语义空间。短板是"视觉→语言→动作"两次翻译引入误差、反应变慢。
- 世界模型是什么:学会"环境如何随时间演化"的模型,能对动作的结果做预测和反事实想象,是解决 VLA"只会反应、不会预见"的关键。
- 两条技术路线:像素级世界模型(细节好、雨雾天易漂移)vs 潜态/特征级世界模型(抗噪、算得快、精细场景退化)。比亚迪 HyWorldVLA 用两段式训练把两者揉进一套模型,不用二选一。
- 统一架构的三个层次:表征层(统一 token 空间)→ 决策层(世界模型潜变量作为决策变量,支持因果 what-if 推理)→ 系统层(快慢双系统 + 闭环仿真,Wayve 称之为 Simulation 2.0)。
- 为什么不能一套模型通吃:自由度、传感器、安全等级、数据形态差异太大;能共享的是"底座",不是"整机"。
- 动手路径(附代码):LeRobot / nuScenes 数据下载 → OpenVLA / GR00T 微调 → Cosmos 世界模型推理 → NAVSIM 开环评测,最后再谈闭环。
- 一句话结论:统一架构是有的,但它长在"底座"(token、世界模型、仿真)上,不长在"整机"(执行器、数据、安全)上。
一、引言:两个物理 AI 赛道,殊途同归
先说个数:2026 年上半年,国内具身智能融资总额超过 430 亿元,其中 50.8% 流向了做"大脑"的公司(据量子位统计,界面新闻转述)。资本已经认定,只造身体的机器人公司空间越来越窄。机器人大脑的核心就是具身大模型,而这条路的主流技术路线,正是 VLA。
另一边,自动驾驶已经走完"规则驱动 → 端到端 → VLA"三代(澎湃新闻报道的行业共识),主流车企的 VLA 在常规场景下表现趋同。华为、小米开始喊:VLA 不是终局,只是过渡,下一代是"世界模型"。
一个在实验室里搬杯子,一个在马路上开车,听起来风马牛不相及。但如果你把两边的技术栈摊开看,会发现骨架惊人地相似:
具身智能: 感知(相机/关节) → 理解(VLM/LLM) → 动作(关节控制)
智能驾驶: 感知(多目/雷达) → 理解(LLM 推理) → 动作(转向/油门)
共同问题: 只会"反应",不会"预见"——世界模型就是来解决这个的
这篇文章想聊的就是这个:VLA 给两个赛道统一了"决策的骨架",世界模型给两个赛道统一了"预见的能力"。拼在一起,就是一个跨机器人、自动驾驶的通用物理智能架构。
二、先把两个概念说清楚
2.1 VLA:让模型直接"看-想-做"
VLA(Vision-Language-Action,视觉-语言-动作)模型,输入是摄像头画面 + 一句自然语言指令,输出直接是动作(机械臂关节、车辆的转向和速度)。它由三块拼成:
| 组件 | 职责 | 典型实现 |
|---|---|---|
| 视觉编码器 | 把多视角图像变成特征向量 | ViT / SigLIP 等 |
| LLM 骨干 | 决策中心,用世界知识做推理 | Qwen / LLAMA / Gemini 等 |
| 动作解码器 | 把推理结果变成物理动作 | 自回归离散 token / 流匹配 / 扩散 |
用伪代码理解它的输入输出,就一句话:
# 概念示意:VLA 的输入输出
输入 = {
"图像": [cam_0, cam_1, ...], # 视觉:多视角画面
"指令": "把红色杯子放到托盘上", # 语言:任务描述
"历史": [关节/轨迹序列, ...], # 状态:过去几帧的动作与观测
}
输出 = "动作序列" # 关节目标 / 横纵向轨迹
VLA 的源头可以追溯到 Google DeepMind 2023 年的 RT-2——第一次把机器人控制塞进视觉-语言模型。此后行业爆发式跟进:斯坦福/伯克利开源了 7B 的 OpenVLA(2024),Physical Intelligence 用流匹配(flow matching)做出 50Hz 实时控制的 π0(2024),英伟达推出双系统 GR00T 系列,智元开源 GO-1。
VLA 的价值在于把传统"感知→规划→控制"三段式压成一个端到端模型,误差不再层层累积;代价是那个被反复讨论的"两次翻译"问题:视觉要先翻译成语言、语言再翻译成动作,每次翻译都有信息损失,而且慢。
2.2 世界模型:学会"预见未来"
世界模型(World Model)的现代定义,最早来自 Ha & Schmidhuber 2018 年的论文:模型在脑子里建立一个对环境的动态预测,用来想象动作的后果。到了物理 AI 时代,世界模型主要指两类:
- 生成式世界模型:根据观测 + 动作/控制输入,生成未来的视频或场景。Wayve 的 GAIA 系列、NVIDIA Cosmos、DeepMind Genie 都属于这类,核心用途是合成数据 + 仿真;
- 潜态世界模型:不在像素层面"渲染"未来,而是预测未来状态的特征表示,直接把预测结果喂给决策。DriveWorld-VLA、Uni-World VLA 走的是这条路,核心用途是支持决策的反事实推理。
一句话区分:像素级世界模型是"画给你看",潜态世界模型是"直接算给你用"。这两条路线各有一堆坑,第三节和第五节会展开。
三、智能驾驶的技术演进:从规则到 VLA,再到世界模型
3.1 三代范式
自动驾驶过去十年走完了三次重构(据行业公开报道整理):
| 时代 | 标志 | 原理 | 短板 |
|---|---|---|---|
| 第一代:规则驱动 | 早期辅助驾驶 | 工程师手写百万行规则,匹配-执行 | 僵化,遇未预设场景直接失效 |
| 第二代:端到端 | 特斯拉 FSD V12 | 像素输入、动作输出的单网络 | 只有感知没有理解,避险生硬 |
| 第三代:VLA | 小鹏、理想、华为、小米等(2025-2026) | 视觉感知 + 语言推理 + 动作输出 | 两次翻译误差、推理慢,被认为是过渡 |
重点看第三代。2026 年主流车企的 VLA 在常规路况上表现已经趋同,行业开始内卷"VLA 之后是什么"。这条路上有两个绕不开的坐标:Waymo 和 Wayve。
| 时间 | 机构 | 事件 |
|---|---|---|
| 2018 | Wayve | 发布博客《Dreaming about driving》,展示从驾驶视频学习驾驶动态(据 Wayve 自述为最早之一,论文版 2021 年发表) |
| 2023 | Wayve | GAIA-1:9B 参数,条件式驾驶视频生成,约 4700 小时伦敦驾驶数据训练 |
| 2024 | Waymo | EMMA:基于 Gemini 的端到端多模态模型,相机→轨迹 + 语言解释,在 Waymo Open Motion 与 nuScenes 上刷到当时 SOTA |
| 2025.03 | Wayve | GAIA-2:潜空间扩散,多相机可控生成(输入控制量、天气、时间、路线) |
| 2025.12 | Wayve | GAIA-3:world-on-rails 反事实场景生成,把世界模型从"视频合成"推向"评测基础" |
| 2026.08 | Wayve | GAIA-4:世界模型驱动的闭环仿真,即"Simulation 2.0"(相机+雷达联合生成,据 Wayve 称行业首创) |
两家走的是同一条路:先拿世界模型造数据,再拿它做评测。下一节看它们为什么押注这个方向。
3.2 为什么 VLA 不够:缺的不是"逻辑",是"预见"
VLA 能理解"这个行人可能要过马路",但回答不了"如果我加速通过,三秒后会怎样"。纯模仿学习的端到端模型是"反应式"的——学的是轨迹的统计分布,不是因果。世界模型补的正是这一环:提供对动作结果的预测,把规划从"匹配数据"变成"反事实推演"。
2026 年上半年,这个方向密集出论文,四篇代表性工作:
| 工作 | 团队 | 思路 | 亮点 |
|---|---|---|---|
| DriveWorld-VLA | 北京交大 + 小米(2026.02) | 世界模型潜变量作为 VLA 决策变量 | NAVSIMv1 91.3 PDMS、NAVSIMv2 86.8 EPDMS、nuScenes 3 秒碰撞率 0.16,超过 LAW/Epona/HERMES-p 等基线 |
| Uni-World VLA | 复旦 + 理想(2026.03) | 自回归交替预测未来帧与轨迹,闭环耦合 | 世界建模与规划交替进行,避免"先预测后规划"的漂移 |
| HyWorldVLA | 比亚迪新技术研究院 | 像素+潜态双监督两段式训练 | 655 例雨雾测试集 PDMS 86.87 vs 61.18(较 DriveVLA-W0 提升约 42%);据论文方表述为业界首个针对坏天气鲁棒性的评测基准 |
| MindVLA-o1 | 理想汽车(GTC 2026) | 单一 Transformer 联合感知-推理-控制 | 离散 Action Tokens + MoE,快慢双系统推理,基于模型的 RL 闭环 |
口径说明:DriveWorld-VLA / Uni-World VLA 为 arXiv 论文口径;HyWorldVLA 数据引自 CSDN DAMO 开发者矩阵对论文的解读文章,属第三方转述,引用时建议回查论文原文;MindVLA-o1 信息来自 GTC 2026 演讲公开摘要。
HyWorldVLA 的定位比较少见:它系统回答了"世界模型在坏天气下到底还能不能用"——这是从论文走向量产绕不开的问题。第五节单独讲它的两段式设计。
3.3 开环与闭环:端到端模型逼出来的仿真革命
端到端模型(Wayve 称之为 AV2.0)有个让行业头疼的特性:它不可分割。没有中间感知输出可以打分,没有独立规划模块可以单测,唯一有意义的评价单元是"整个系统表现得怎么样"。
传统"仿真 1.0"(重放录制数据)对端到端模型是失效的——你把一段固定录像放给模型,模型预测什么都不会改变接下来的画面,等于考试只考"你说你会怎么开",不考"你真的怎么开"。Wayve 在 GAIA-4 里给出答案,他们称之为 Simulation 2.0:
- 仿真器忠实还原模型实际驾驶所需的全部传感器输入;
- 闭环:让模型的决策改变它接下来看到的画面(刹车→画面减速,转向→场景随动);
- 用真实录制做"锚点",只让自车行为偏离,即 world-on-rails(世界在轨道上),生成真实世界从未发生、但物理一致的反事实场景;
- GAIA-4 支持相机 + 雷达联合生成反事实场景(据 Wayve 称行业首创;"2.5 倍场景保真度"为官方自述,未经独立验证)。
用伪代码理解闭环评测和开环评测的区别:
# 伪代码:开环评测(重放)——模型预测不改变世界
for frame in replay_scene:
obs = get_sensor(frame) # 画面是录死的
act = policy.forward(obs) # 模型只管预测
metric.update(act, frame.gt_traj) # 和真值轨迹比
# 伪代码:Simulation 2.0 闭环评测(world-on-rails)
state = load_real_scene("scene_001") # 锚点:一段真实录制
while not state.done:
obs = renderer.sensors(state) # 忠实还原传感器输入
act = policy.forward(obs) # 被测模型决策
state = simulator.step(state, act) # 自车行为改变世界(闭环)
# 世界其余部分沿真实锚点推进,只允许自车偏离(反事实)
score = evaluate(state) # PDMS / 安全指标
一句话:世界模型不只是"数据工厂",它正在变成端到端智能的"考试院"。这个角色转变,在具身智能那边同样发生。
四、具身智能的 VLA 浪潮
4.1 主流模型地图
2026 年能打的 VLA 大致分几派(据公开选型对比文章整理):
| 模型 | 机构 | 时间 | 参数规模 | 开源 | 架构特点 |
|---|---|---|---|---|---|
| OpenVLA / OFT | 斯坦福、伯克利等 | 2024.06 / 2025.02 | 7B | 是 | 自回归离散动作 |
| π0 / π0.5 | Physical Intelligence | 2024 / 2025 | — | 否 | 流匹配动作生成,50Hz,基于预训练 VLM |
| GR00T N1 → N1.6/1.7 | NVIDIA | 2025.03 → 2025.12 | 2.2B(N1) | 是 | 双系统:System 1 为 DiT 动作生成(快,120Hz)+ System 2 为 VLM 语义理解(慢,10Hz) |
| GO-1 | 智元机器人 | 2025.03 | VLM 约 2B + MoE | 是 | ViLLA:隐空间规划器,可看人类视频学动作 |
| Helix | Figure | 2025.02 | — | 否 | 双系统:System 2 为 7B VLM(7-9Hz,慢)+ System 1 为 80M 视觉运动策略(200Hz,快),35-DoF 上半身控制 |
| Gemini Robotics | Google DeepMind | 2025 | — | 否 | 基于 Gemini 多模态 |
挑三件事说:
- 数据是护城河。具身从业者有个共识:具身大模型的竞争,说到底拼的是数据。真机遥操作数据慢且贵,各家都在用合成数据补(GR00T 生态、Cosmos、遥操作方案)。
- 世界模型正在"杀回来"。GR-2 证明了"用海量网络视频做生成式预训练、再微调动作"能显著提升泛化;现在越来越多的 VLA 把世界模型当成预训练或协同组件。
- 快慢双系统成为共识。无论是 GR00T 的 System 1(快,动作)/System 2(慢,语义)分工,还是 MindVLA-o1 的快慢推理,都在模仿人类的"反射"和"深思"分工,这也是后面统一架构的关键部件。
口径说明:具身模型表格与"2025 年全球人形机器人出货约 1.7 万台、中国占比超八成"等数据引自 2026-08 公开选型对比文章,属第三方整理口径。
4.2 仿真:具身智能的另一块短板
驾驶行业有成熟的仿真体系(即便要重构),但具身智能的仿真长期是短板:机器人抓取一个杯子,物理仿真器里的接触、摩擦和现实差距巨大,sim-to-real gap 一直卡着行业。世界模型在这里的作用和驾驶完全同构——生成"看起来对、物理也对"的合成交互数据,再用闭环仿真评测策略。NVIDIA 的 GR00T 蓝图、Isaac Sim + Cosmos 的组合,做的就是这件事。
五、世界模型的两条技术路线
做世界模型的人都会撞上同一个选择题:像素还是潜态?
| 路线 | 代表 | 优点 | 短板 |
|---|---|---|---|
| 像素级 | GAIA-2、Cosmos Predict、Genie | 视觉细节真实,可直接当仿真画面/合成数据 | 雨雾等退化场景易漂移;推理贵,车载实时性差 |
| 潜态/特征级 | DriveWorld-VLA、Uni-World VLA | 抗噪、快,适合车载/嵌入式;直接服务决策 | 精细场景细节退化,难以生成可看的画面 |
过去业界默认二选一:要细节就牺牲鲁棒,要抗噪就牺牲精细。比亚迪 HyWorldVLA 不想二选一,它的两段式设计单独说一下:
- 预训练阶段:像素监督 + 潜态监督同时作用。潜空间在训练期"见过"完整的像素信息,学会了在雨雾、光照退化下如何保持语义稳定;
- 微调阶段:只跑潜态推理,输入退化为特征级,部署时没有像素级生成的高成本,速度快、抗噪好;
- 坏天气验证:自建 655 例雨雾测试集,PDMS 86.87 vs 基线 61.18(提升约 42%),证明"训练期重、推理期轻"的设计确实把抗噪能力内化进了潜空间。
一句话总结这条路线:重活(像素)在训练期干完,轻活(潜态)留给部署期。
潜态路线的代表想法来自 DriveWorld-VLA 的论文。他们把 VLA 与世界模型的结合方式归纳成三种:
| 结合方式 | 做法 | 问题 |
|---|---|---|
| (a) 解耦交互 | 世界模型当外部模拟器 / 数据源 | 结构隔离,潜层知识传不进 VLA |
| (b) 特征共享 | 两边共享表征 | 缺动作因果推理,不会反事实想象 |
| © 统一潜空间 | 世界模型潜变量直接作为决策变量 | 可控因果 what-if 推理(论文做法) |
(a) 是今天大多数公司的做法(世界模型只负责产数据),© 是论文里的"完全体"——代价是训练和工程复杂度陡增。多数团队的现实路径是 (a) 起手、(b) 过渡、向 © 演进。
六、统一架构的三个层次(本文核心)
把驾驶和具身的技术栈对齐后,我认为"统一"发生在三个层次,而不是整机复用。
6.1 表征层:统一 token 空间
一切的起点是表征。视觉、语言、动作、世界状态,如果各说各话,模型就无法共享知识。今天的趋势是把四者都切成 token,塞进同一个 Transformer:
统一 Token 空间
┌────────────┬────────────┬────────────┬────────────┐
│ 视觉 Token │ 语言 Token │ 动作 Token │ 世界 Token │
│ (图像/视频) │ (指令/推理) │ (关节/轨迹) │ (未来状态) │
└────────────┴────────────┴────────────┴────────────┘
- 视觉:Cosmos Tokenizer、视频 VAE 这类工具已经在把视频压成紧凑 token;
- 动作:MindVLA-o1 用离散 Action Tokens,π0 用连续流匹配,OpenVLA 用离散动作 token——动作已被当成一种"语言"建模;
- 世界:潜态世界模型输出的未来状态表征,就是"世界 token"。
车和机器人虽然物理形态不同,但在这个 token 空间里,它们是同一类序列问题。一个最小接口设计长这样(伪代码):
# 伪代码:一个"统一 token 空间"的最小接口设计
class UnifiedTokenizer:
def encode_visual(self, frames): # 视频/图像 -> 视觉 token
def encode_language(self, text): # 指令 -> 语言 token
def encode_action(self, traj): # 关节/轨迹 -> 动作 token
def encode_world(self, latent): # 世界模型未来状态 -> 世界 token
def decode_action(self, tokens): # 动作 token -> 物理动作
6.2 决策层:世界模型潜变量作为决策变量
统一表征之后,关键一跃是让"预见"参与"决策"。也就是前面说的 © 路线:世界模型预测的未来潜状态,直接作为 VLA 规划器的输入状态,模型可以针对候选动作推演"如果我这样开/抓,环境会变成什么样",再做选择。这比"先生成未来视频、再在上面规划"((a) 路线)快得多,也避免了开环想象和真实决策过程的漂移(Uni-World VLA 针对的正是这个漂移)。
用伪代码看 © 的训练循环长什么样:
# 伪代码:世界模型潜变量作为决策变量(DriveWorld-VLA 思路的极简示意)
for batch in train_loader:
obs_tok = tok.encode_visual(batch["cameras"]) # 历史观测
lang_tok = tok.encode_language(batch["instruction"]) # 任务指令
# 世界模型:给定已执行动作,预测未来潜状态(训练期用真值监督)
z_future = world_model.forward_latent(obs_tok, batch["actions"])
# VLA:把"未来状态"作为决策输入,输出当前动作
fused = fuse(obs_tok, lang_tok, z_future)
pred_action = vla.action_decoder(fused)
loss = action_loss(pred_action, batch["actions"]) + world_model.loss()
loss.backward()
关键不在"世界模型有多准",而在"预测出来的未来状态要能影响决策"——这一点 (a) 路线做不到。
6.3 系统层:快慢双系统 + 闭环仿真
统一架构不是单模型,而是一套系统分工:
┌───────────────────────────────────────────────────────┐
│ 世界模型(离线底座) │
│ 合成数据生成(Cosmos/GAIA)|闭环仿真(Simulation 2.0) │
└──────────────────────┬────────────────────────────────┘
▼
┌───────────────────────────────────────────────────────┐
│ VLA 决策主干(统一 token 空间) │
│ System 2(慢):VLM 语义推理、语言级规划(10Hz 量级) │
│ System 1(快):动作级反射,流匹配/扩散直出动作(百 Hz) │
└──────────────────────┬────────────────────────────────┘
▼
┌───────────────────────────────────────────────────────┐
│ 执行层:动作解码器 → 车(横纵向轨迹)/机器人(关节) │
└───────────────────────────────────────────────────────┘
- 世界模型在"训练-验证"环路里当底座:离线生成合成数据缓解长尾,在线做闭环评测(GAIA-4 的 Simulation 2.0、Isaac Sim + Cosmos);
- VLA 在"感知-决策"环路里当主干:System 1 兜底高频实时控制,System 2 处理复杂场景的慢推理;
- 两者的接口就是统一 token 空间——世界模型产出的未来状态 token,喂给 VLA 的规划器。
这个架构对车和机器人是同构的。NVIDIA 的布局一直在讲同一个故事:Omniverse(物理仿真)+ Cosmos(世界模型)+ DGX/Jetson(训练与车载/机载部署),同一套底座同时服务机器人和自动驾驶两个场景。
6.4 但先别乐观
统一架构在"底座"层成立,不等于"模型"层能通吃。差异在下一节。
七、差异:为什么不能一套模型通吃
如果直接拿一个机器人 VLA 去开车,或者反过来,会在这些地方撞墙:
| 维度 | 具身智能(机器人) | 智能驾驶 |
|---|---|---|
| 运动学 | 双臂 + 灵巧手,20+ 自由度,非完整约束 | 6 自由度刚体,阿克曼转向约束 |
| 观测 | 本体相机 + 关节编码器 + IMU | 多目相机 + 激光雷达 + 毫米波 |
| 交互对象 | 桌面物体、家居、人 | 车辆、行人、交通设施 |
| 物理尺度 | 米级、低速、可随时停止 | 十米级、高速、动量巨大 |
| 安全要求 | 操作安全(碰撞力、权限) | ISO 26262 功能安全 + SOTIF,监管认证 |
| 数据来源 | 遥操作采集,慢而贵 | 车队路采,天然海量 |
| 评价体系 | 任务成功率、示教对齐 | PDMS/EPDMS、碰撞率、接管率 |
| 失败代价 | 摔一个杯子 | 一起事故 |
结论很直白:共享的是"底座"(tokenizer、世界模型、仿真范式、训练方法),定制的是"整机"(执行器、观测头、安全层、数据管线)。所以业界讲的是"world foundation model + 领域后训练",而不是"一个模型开天辟地"。
八、想上手?给一条现实路径(附代码)
这个方向没有"三分钟跑通"的捷径,但可以按下面这条线逐步建立体感。以下代码分三档:可直接复制的命令(官方仓库写法)、微调后推理(需先完成上一步)、以及只供理解架构的伪代码——每段都有标注,别拿伪代码去跑。
8.1 第一步:挑一个赛道,先摸数据
具身赛道:用 LeRobot 下一个现成数据集
LeRobot 是 Hugging Face 的开源机器人学习库,自带数据集下载和训练脚本。装好依赖、下载一个 10 万步的 pusht 示教数据集:
pip install lerobot
# 下载官方 pusht 数据集(含相机画面 + 关节动作 + 指令)
lerobot download lerobot/pusht
# 用默认 ACT 策略在这个数据集上训练(先跑通最小闭环)
python lerobot/scripts/train.py policy=act dataset_repo_id=lerobot/pusht env=pusht
跑通这一条命令,你对"示教数据长什么样、训练日志怎么读、checkpoint 在哪"就有了实感。
驾驶赛道:用 nuScenes 看一帧多模态数据
pip install nuscenes-devkit
from nuscenes import NuScenes
nusc = NuScenes(version="v1.0-mini", dataroot="./data/nuscenes", verbose=True)
sample = nusc.get("sample", nusc.first_sample_token)
sample_data_tokens = nusc.field2token("sample_data", "sample_token", sample["token"])
print("传感器:", [nusc.get("sample_data", tok)["channel"] for tok in sample_data_tokens])
# 输出类似: 传感器: ['CAM_FRONT', 'CAM_FRONT_LEFT', 'CAM_FRONT_RIGHT', 'LIDAR_TOP', ...]
把数据真正打开看过一遍,比读十篇博客都有用——你会直观理解"驾驶数据天生海量(车队路采)而机器人数据要靠人一帧帧遥操作"这个差异。
8.2 第二步:跑一个开源 VLA 的微调
方案 A:OpenVLA(自回归离散动作,门槛最低)
从 Hugging Face 拉 7B 权重,用 LoRA 在 bridge_orig 数据集上微调:
git clone https://github.com/openvla/openvla.git
cd openvla
python scripts/finetune.py \
--data_root_dir datasets/ \
--dataset_name bridge_orig \
--pretrained_checkpoint openvla/openvla-7b \
--use_lora \
--lora_rank 32 \
--run_id openvla_finetune_bridge
微调结束后,加载你微调得到的目录做一次推理(接口以官方 README 为准):
import torch
from transformers import AutoModelForVision2Seq, AutoProcessor
from PIL import Image
run_dir = "runs/openvla_finetune_bridge" # 上一步的输出目录
processor = AutoProcessor.from_pretrained(run_dir)
vla = AutoModelForVision2Seq.from_pretrained(
run_dir, torch_dtype=torch.bfloat16
).to("cuda")
image = Image.open("frame_0.jpg")
prompt = "pick up the red block"
inputs = processor(prompt, image).to("cuda", dtype=torch.bfloat16)
action = vla.predict_action(
**inputs,
unnorm_key="bridge_orig", # 微调时学到的动作归一化统计量
do_sample=False,
)
print(action)
方案 B:GR00T N1.x(双系统,接触世界模型的入口)
pip install isaac-gr00t
# 微调/预训练示例在官方仓库 Isaac-GR00T 的 examples/ 目录下,
# 先跑通默认 config(含真实机器人和仿真数据集),再换成你自己的数据
GR00T 建议跑一次:它内置了"System 1(快,动作)+ System 2(慢,语义)"双系统,和第三节 MindVLA-o1 的架构同一个思路,跑完你对"快慢双系统"就有体感了。
8.3 第三步:接触世界模型
想要"画给你看":跑一次 Cosmos 推理
Cosmos 的权重在 Hugging Face(nvidia/Cosmos-Predict1-7B 等),仓库在 GitHub(NVIDIA/Cosmos),下面是最小推理的示意(以官方示例为准):
git clone https://github.com/NVIDIA/Cosmos.git
cd Cosmos
pip install -e . # 按官方 README 安装依赖
# 示意:加载 Cosmos-Predict1 生成式世界模型(以官方示例代码为准)
import torch
from cosmos_predict1.cosmos_predict1_autoregressive import CosmosPredict1ARModel
model = CosmosPredict1ARModel.from_pretrained("nvidia/Cosmos-Predict1-7B")
model.eval().to("cuda")
with torch.no_grad():
# 输入:一段视频(prompt_video),输出:它"想象"出的后续帧
future_video = model.generate(prompt_video=prompt_video, num_frames=24)
这段代码不是让你直接上车用的,而是让你直观看到两件事:世界模型的输入是"观测 + 控制意图",输出是"未来";以及为什么像素级生成这么贵——它每生成一帧都要过一遍扩散/自回归主干。
想要"算给你用":读 DriveWorld-VLA 的开源代码
重点不是复现分数,而是看它的 fuse 模块怎么写——世界模型潜变量到底以什么形式、在模型的哪一层进入 VLA。这直接对应第六节 6.2 的伪代码。读完你就会理解 (a) 和 © 的工程差距有多大。
8.4 第四步:建立你的评价闭环
开环指标用来快速迭代,闭环指标用来判断真水平。两套都要有。
开环:用 NAVSIM 给驾驶模型打分
NAVSIM(autonomousvision/navsim)是 DriveWorld-VLA 等工作的公开评测基准。用法示意(以官方 README 为准):
git clone https://github.com/autonomousvision/navsim.git
cd navsim
# 配置好数据集后,用仓库自带的评测脚本跑一个 planner 的开环分数
# 会输出 PDMS / EPDMS 等指标
记住:NAVSIM 的 PDMS / EPDMS 并非简单"开环打分",而是通过 4 秒非响应式(non-reactive)仿真计算——PDMS 由惩罚项(NC、DAC)与加权项(TTC、EP、C)组合而成,EPDMS 在其上叠加 DDC、TLC、LK、HC、EC 等项;v2 用两阶段 pseudo closed-loop 聚合来近似闭环。它便宜、可复现,但仍不是真闭环,别把它当实车水平。
闭环:用一个最小循环验证
# 伪代码:最小闭环验证(驾驶 / 机器人都适用)
env = make_env() # 仿真环境(CARLA / Isaac Sim / 自研)
policy = load_your_vla("best_ckpt.pt")
episode_scores = []
for ep in range(N):
obs, info = env.reset()
done = False
while not done:
act = policy.forward(obs) # 决策
obs, reward, done, info = env.step(act) # 动作改变环境(闭环)
episode_scores.append(ep_score(info))
print(mean(episode_scores))
| 指标类型 | 内容 | 注意 |
|---|---|---|
| 开环指标 | 驾驶:PDMS / EPDMS / 碰撞率;机器人:任务成功率 | 好开环 ≠ 好闭环,只做参考 |
| 闭环指标 | 仿真闭环跑分(CARLA / Isaac Sim / GAIA-4 式仿真)、真机/实车测试 | 成本高,但才是真水平 |
九、避坑指南(都是公开讨论过的坑)
| 坑 | 说明 |
|---|---|
| 拿开环当闭环 | 重放录像测"预测能力"≠真实驾驶/操作表现,compounding error 会累积,必须闭环验证 |
| 像素世界模型直接上车 | 推理贵、实时性差;雨雾天漂移是公开短板,HyWorldVLA 论文专门治这个 |
| 只选一条路线 | 像素 vs 潜态不是非此即彼,两段式混合(如 HyWorldVLA)是 2026 年的新答案 |
| VLA 语言中间层迷信 | 视觉→语言→动作两次翻译必有损耗,高频控制要设计 System 1 直出动作 |
| 仿真数据无脑堆 | 世界模型生成的数据要过筛选(Cosmos Reason 就是干这个的),不然长尾更脏 |
| 忽视 sim-to-real gap | 具身抓取这类接触任务,仿真里的摩擦/形变和现实差很远,合成数据不能替代真机数据 |
| 复现 benchmark 高分直接上量 | NAVSIM 这类开环榜单被"刷爆"是常态,落地上路/上机前务必自建小样本闭环验证 |
| 拿 GPU 先跑伪代码 | 文章里标注"伪代码"的段落只是架构示意,直接复制到训练脚本里会报错,动手前先分清代码档次 |
十、冷静看:还没解决的问题
- 世界模型的长期一致性:生成式世界模型在多步 rollout 中会漂移——预测三秒可以,预测三十秒就开始"忘物理"。这是从"数据工厂"走向"在线想象"要过的第一关。
- 因果 vs 相关:今天的大多数世界模型学的是"画面上的统计规律",不是"物理因果"。反事实推理(如果我做了 A 会怎样)要想可靠,需要更强的因果建模,而不是更多数据。
- 统一架构的工程代价:© 路线的"世界模型潜变量即决策变量"训练复杂、难调,目前只有论文验证,还没有量产级别的证明。行业多数还在 (a)。
- 安全与认证:端到端模型不可分割,天然和"逐模块验证"的汽车功能安全体系冲突。Wayve 用 Simulation 2.0 回答"怎么证明它安全",但监管侧的最终答案还没出现。具身智能更是连统一的安全标准都还在路上。
- 数据分层:机器人数据贵且慢,驾驶数据多但不含操纵语义——跨赛道共享数据这件事,目前只有"网络视频预训练"一条被证明有效(GR-2 路线),离端到端直用还很远。
- 评测仍不统一:驾驶的 NAVSIM、具身的任务成功率各自为政,两边没有一套"既能开环又能闭环、还带安全指标"的公共评测体系。Wayve 的 Simulation 2.0 只是迈出了第一步。
十一、总结与展望
回到标题的问题:从具身智能到智能驾驶,有没有统一架构?
我的结论是:有,但它长在底座上,不长在整机上。VLA 统一了两个赛道的"决策骨架",世界模型统一了它们的"预见能力";两者通过统一 token 空间耦合,配合快慢双系统与闭环仿真,构成一套对车和机器人都成立的物理智能架构。NVIDIA 的 Omniverse + Cosmos + Jetson 三件套,Wayve 的 AV2.0 + GAIA 路线,都在往这个方向走。
但也要清醒:运动学、传感器、安全等级、数据形态的差异决定了"共享底座、定制整机"是唯一现实的路径;世界模型的长期一致性和因果建模、端到端模型的安全认证,仍然是横在两个赛道面前共同的硬骨头。
给读者的建议:
- 先想清楚自己是"底座玩家"还是"整机玩家"——前者卷世界模型和表征,后者卷数据和部署;
- 无论哪边,都从跑通一个开源 VLA 的最小闭环开始(第八节的三步走);
- 把"开环 + 闭环"两套评价体系都建起来再谈优化,别被单个榜单带节奏;
- 关注三件事的进展:世界模型的长期一致性、潜态世界模型进决策的量产案例、以及两个赛道的安全认证标准。
2026 年的物理 AI,正处在"秀肌肉"向"拼脑子"切换的当口。世界模型 + VLA 的统一架构思考,与其说是技术预言,不如说是给从业者的一张地图:资源应该花在底座(token、世界模型、仿真),还是整机(数据、部署、安全)?想清楚了,就知道该往哪使劲了。
参考资源:
- DriveWorld-VLA:arXiv:2602.06521(北京交大 + 小米)
- Uni-World VLA:arXiv:2603.27287(复旦 + 理想)
- GAIA-2 技术报告与 GAIA-4 博客(Wayve,2026-08)
- Cosmos World Foundation Model Platform:arXiv:2501.03575 + NVIDIA 官方博客 + GitHub: NVIDIA/Cosmos
- 《An Anatomy of Vision-Language-Action Models》:arXiv:2512.11362
- OpenVLA:arXiv:2406.09246 + GitHub: openvla/openvla
- LeRobot:GitHub: huggingface/lerobot;NAVSIM:GitHub: autonomousvision/navsim;nuScenes:GitHub: nutonomy/nuscenes-devkit
- 澎湃新闻《自动驾驶技术竞争升级,VLA 之后是什么?》(2026-05)、界面新闻《这届机器人,开始从"秀肌肉"转向"拼脑子"》(2026-08)、CSDN 具身模型选型对比文章(2026-08)等公开报道
- 本文为架构层面的思考梳理,不构成技术选型或投资建议;涉及的数据与结论请以各机构论文、官方文档为准;文中的命令与接口以对应开源仓库最新版本为准
关注我,持续拆解 2026 年物理 AI 的关键技术——VLA、世界模型、端到端驾驶、具身大模型,用看得懂的方式讲清原理,用能上手的路径教你入门。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)