汽车智驾领域大模型低精度训练分析报告

检索范围:arXiv / ICLR、GitHub、Hugging Face、NVIDIA ModelOpt / Transformer Engine / Dojo 白皮书、车企公开新闻与开源代码等(约 2024–2026)
整理日期:2026-08-31(含其他车企与端到端 E2E 专章;同日增补小鹏 FP8 / 特斯拉 CFloat8 一手链接与引用边界)
图例:★ = 原文/发布页明确写出;† = 按 BF16 混合精度 + AdamW/FSDP/ZeRO 惯例推断(非论文逐字段承诺)


1. 结论先行

公开智驾工作可分两层理解:(A) 狭义一段式端到端(传感→轨迹,亿级参数)训练侧以 FP16/BF16 为主、车端 INT8/FP16(B) VLA/世界模型增强的广义 E2E 进入 LLM 量级后,才出现 BF16 默认可核验(OneVL 等) 与车企罕见的 FP8 云端训练(小鹏★)。特斯拉 Dojo 在硬件格式层公开 CFloat8/CFloat16;华为 / 蔚来 / 吉利 / Momenta 等多数只谈架构与算力,不披露六元组。地平线强调 E2E 是 VLA 基石,并公开车端 int8/int16/fp16 部署量化。

阶段 主流精度 典型目标
训练(Pretrain / SFT / Co-training) BF16 混合精度 稳定收敛、工程成熟
大规模训练(Hopper+,≥7B,通用 LLM) BF16 + FP8 混合 吞吐提升约 30–40%
RL 后训练 BF16 为主;FP8 训推统一在探索 降低训推不一致
推理 / 部署 FP8 / W4A8 / NVFP4 / FP16 PTQ 延迟与显存

2. 数值类型一览

格式 位宽 指数/尾数 动态范围特点 智驾场景常见用途 主要来源
FP32 32 8 / 23 Master weights、Adam 状态、Loss/归约累加 Micikevicius et al., Mixed PrecisionNeMo AutoModel
TF32 19* 8 / 10 与 FP32 同量级 Ampere+ Tensor Core 默认矩阵乘模式 NVIDIA AMP 惯例
FP16 16 5 / 10 窄,易溢出 早期训练;现多被 BF16 取代;部分推理 同上
BF16 16 8 / 7 与 FP32 同指数范围 训练主流默认 见第 4–5 节模型表
FP8 E4M3 8 4 / 3 精度优先 前向权重/激活;推理 W8A8 arXiv:2209.05433TE FP8
FP8 E5M2 8 5 / 2 范围优先 反向梯度(Hybrid recipe) 同上
Tesla CFloat8 8 可配(1_4_3 / 1_5_2) 可配 bias Dojo 上权重/激活/梯度存储 Dojo Technology PDF
Tesla CFloat16 16 可配 SHP/UHP 扩范围 梯度等需更高精度时,避免回退 FP32 同上
INT8 / W4A8 8/4 定点 推理 Prefill/Decode 加速 FlashDrive
NVFP4 (E2M1) 4 2 / 1 极低精 Alpamayo 等 PTQ ModelOpt Alpamayo

TF32 多为计算路径,非独立存储格式。

BF16 为何成训练默认:与 FP32 同为 8-bit 指数,梯度不易溢出,通常不需要 GradScaler;代价是尾数仅 7 bit,需用 FP32 master weights / optimizer states 补偿(参见 NeMo 警告:长训勿把 Adam EMA 也存成 BF16)。

2.1 混合精度训练标准配方(通用)

前向/反向计算(大部分层)  →  BF16 或 FP8
矩阵乘累加(GEMM accumulator)→  FP32
Master Weights            →  FP32
Optimizer States (Adam)    →  FP32
Loss / Softmax / LayerNorm →  FP32 或 BF16
梯度 All-Reduce            →  FP32(reduce_dtype,常见)

2.2 张量类别含义

类别 含义 BF16 混合精度下的常见做法
权重 前向参数副本(及是否另有 FP32 master) 前向多为 BF16;更新用 master 常为 FP32
激活 中间激活 / 部分 buffer BF16
计算 MatMul/Conv 等算子主路径 BF16;累加器常 FP32
梯度 ∂L/∂w 多为 BF16;All-Reduce 前有时升到 FP32
优化器 Adam/AdamW 的 m、v 及 master 几乎一律建议 FP32
交换张量 DDP/FSDP/ZeRO 的 gather、reduce 参数 gather:BF16;梯度 reduce:常见 FP32

3. 模块级精度分配

3.1 训练期

模块 / 张量 典型精度 是否低精 说明
Transformer Linear(Q/K/V/O、MLP) BF16 计算 吞吐与显存收益主体
Attention 累加 / Softmax FP32 或 BF16 部分 FlashAttention 内部常 FP32 累加
LayerNorm / RMSNorm BF16 或 FP32 ⚠️ 慎 FP8 方差对量化敏感
Embedding / LM Head BF16 ⚠️ 慎 FP8 TE/工程实践白名单回退
Vision Encoder(ViT / ResNet) BF16 ✅(相对 FP32) 训练阶段与骨干同精度
BEV / Perception Token 提取 BF16 OpenDriveVLA 等
Action / Trajectory / Flow-Matching Head BF16 ✅ 训练;❌ 不建议 FP8 连续输出对误差敏感
Loss、梯度 All-Reduce、Master Weights、Adam FP32 稳定性底座

3.2 推理 / PTQ 期

模块 常见精度 低精? 证据
Vision Tower(ViT) 保持高精度 ❌ 通常不量化 ModelOpt AlpamayoBlock-wise FP8 for VLA
VLM / LLM Linear 骨干 FP8 或 W4A8 Alpamayo FP8/NVFP4;FlashDrive W4A8
小维度 Action Projection 高精度 维度非 16 倍数破坏 real-quant GEMM
Action Expert(连续轨迹) BF16 FlashDrive
KV Cache BF16 / FP8 可选 通用 vLLM 实践

架构示意:

相机/视频 ──► Vision Encoder ──► Token 对齐 ──► LLM Backbone ──► Action/Planner
                 │                    │              │                │
            训练: BF16           训练: BF16      训练: BF16        训练: BF16
            推理: 常保持高精      推理: 可 FP8    推理: FP8/W4A8    推理: 常 BF16

4. 智驾端到端(E2E)模型分析

本节梳理「经典 E2E / 一段式·两段式 / E2E+VLM 双系统 / VLA / 世界模型」谱系,并与低精度训练、车端部署的关系对照。E2E 与 VLA 并非对立:地平线等观点认为一段式 E2E 是基石,VLA 是其上叠加的模态与推理能力

4.1 概念与演进轴

代际 形态 输入→输出 典型代表 可导性 / 信息流
0 模块化规则+深度学习感知 传感→检测/地图→规则规划→控制 传统量产栈 分段;人工接口,误差累积
1 两段式端到端 传感→感知网 →(人工定义接口)→ 规划网 → 轨迹 早期量产「端到端」宣传;小鹏 XNet+XPlanner 阶段 两段各自可导,跨接口未必联合最优
2 一段式端到端(规划导向) 传感→统一 Transformer → 轨迹(可附带感知辅助头) UniAD、VAD/VADv2、DriveTransformer;地平线 HSD;博世+文远 Orin 方案;Tesla FSD V12 理念 全程可导(理想形态);HMI 感知可剥离
3 E2E + VLM 双系统(快慢) 快:E2E 轨迹;慢:VLM 语义/CoT 理想早期「一段式 E2E + VLM」叙事;DriveVLM-Dual 快路径实时;慢路径低频;联合训练难
4 VLA / 世界模型增强 视觉(+语言)→推理/隐状态→动作或轨迹 DriveVLM、MindVLA、小鹏 VLA、OneVL、Alpamayo、NWM、WEWA 仍属广义 E2E;增加语言/世界建模监督
模块化 ──► 两段式 E2E ──► 一段式 E2E(光子→轨迹)──► E2E+VLM 双系统 ──► VLA / 世界模型
              │                │                      │                    │
           人工接口残留      联合优化上限高           快慢协同            语义+物理先验

4.2 一段式 vs 两段式(工程对比)

维度 一段式 E2E 两段式 E2E
信息流 传感特征直达规划,少人工接口 感知结构化输出再进规划,存在信息瓶颈
训练 宜大规模模仿学习 / RL;对数据与算力要求极高 可分段训、分段验,迭代成本较低
可解释性 弱(黑箱);常靠辅助感知头做 HMI 较好(中间量可检)
实时性 / 车端 大模型时延挑战大;成功量产需强工程压缩 更易控延迟与算力
量产叙事 地平线、博世+文远、Tesla 路线强调「真一段式」 2024–2025 多数宣传「端到端」实为两段式
与 VLA 地平线:E2E 做不好则 VLA 做不好 VLA 可挂在两段式之上,但上限受接口损失制约

来源:OFweek 架构差异腾讯新闻 端到端演进地平线吕鹏访谈博世一段式

4.3 开源/学界代表 E2E 模型

模型 机构 架构要点 训练策略(公开) 精度相关 来源
UniAD OpenDriveLab 等 感知–预测–规划统一;多任务 query 两阶段:① track+map;② 全任务 E2E;Stage2 可冻 BEV encoder 官方强调 8×A100 显存;属 MMDet3D 生态,社区常用 FP16 AMP(需 loss scale),论文未强制 BF16 GitHub UniADTRAIN_EVAL
VAD / VADv2 矢量化场景表征;VADv2 概率规划 + 分布/冲突损失 端到端规划监督为主 公开材料少写 dtype;规模小于 LLM-VLA,多仍 FP16/BF16 惯例† VADv2
DriveTransformer 统一 Transformer;任务自注意力;单阶段联合训 相对 UniAD 多阶段更易扩展 未检索到强制 FP8 声明 arXiv:2503.07656
Transfuser / PARA-Drive 等 学界基准 传感融合→规划 IL / 闭环仿真评测 多为中小规模 CNN-Transformer,BF16/FP16† NAVSIM 等基准对比表见 VADv2 文
DriveVLM(-Dual) 清华 + 理想 VLM CoT + 可选传统感知规划 微调 Qwen-VL;Dual 为混合系统 未公开训练 dtype arXiv:2402.12289

UniAD 训练与精度启示:Stage1 峰值显存高(约 50GB/卡量级,8×A100),Stage2 冻编码器后显存下降——说明经典 E2E 对激活显存极度敏感,工业上天然驱动 FP16/BF16、梯度检查点、冻骨干等手段;但与 7B+ VLA 的 FP8 动机(吞吐/通信)不完全相同。

4.4 产业 E2E 路线对照(与 §6–§7 衔接)

厂商 / 方案 E2E 形态(公开口径) 与大模型关系 低精相关(已知)
Tesla FSD 一段式理念(传感→控制/轨迹) 自研大网;Dojo 训推一体 Dojo:CFloat8/BF16 硬件★;软件配方未公开
地平线 HSD 强调真一段式 + RL E2E 为基石,再谈 VLA/WM 车端 int8/int16/fp16 量化★
博世 + 文远 一段式量产(Orin-Y) 短期坚持 E2E,认为 VLA 上车需 7B–10B 与大带宽芯片 训练 dtype 未公开
Momenta 端到端大模型 + 数据飞轮;RL 与一段式/VLA 并行探索 未公开
小鹏 早期两段(XNet+XPlanner+XBrain)→ 第二代 VLA 云端超大 VLA + 蒸馏 云端 FP8 混合精度
理想 一段式 E2E + VLM → MindVLA 快慢系统→统一 VLA MindVLA dtype 未公开
华为 ADS GOD/PDP → WEWA 世界引擎+行为模型 云端仿真+在线 RL 未公开
蔚来 NADArch + NWM 世界模型 生成式推演+仿真 未公开
小米 OneVL VLA + 潜空间 + 世界模型辅助解码 开源可复现 训练 BF16

4.5 E2E 模型的模块与低精度落点

【经典一段式 E2E】
多相机/LiDAR ──► Backbone(CNN/ViT) ──► BEV/Token Encoder ──►
    Det/Map/Motion Heads(可选,可仅 HMI) ──► Planner Head ──► 轨迹/控制

低精倾向:
  Backbone + BEV Attention/MatMul  → 训练 BF16/FP16;部署 INT8/FP16
  Norm / 几何编码 / 轨迹回归头    → 常更高精(FP16/FP32 或 int16)
  多任务 loss 加权 / 匹配(Hungarian)→ 计算敏感,少见 FP8

【VLA 增强 E2E】
传感 ──► Vision Tower ──► LLM/MoE ──►(CoT/Latent)──► Action/Flow Head

低精倾向:见 §3(Vision 与 Action 保守;LLM Linear 可 FP8/W4A8)
模块类型 经典 E2E(UniAD 级) VLA 级 E2E
视觉骨干 FP16/BF16 训;INT8 部署常见 BF16 训;部署常不量化或轻量量化
BEV / 时序融合 显存大户 → 混合精度收益高 Token 压缩、蒸馏更关键(小鹏)
规划头 / 轨迹 连续量,部署慎 INT8 Action Expert 常 BF16
语言模型 无或仅辅助 VLM 可 FP8 训练/推理(小鹏云端 FP8★)
世界模型分支 训练可用辅助解码器;推理可丢弃(OneVL)

4.6 训练范式差异(对精度栈的影响)

范式 说明 对低精的含义
多阶段 IL(UniAD) 先感知再全任务;可冻编码器 Stage1 显存峰值 → FP16/BF16、减 queue_length;少见 FP8
单阶段统一 Transformer(DriveTransformer) 任务并行注意力,减误差累积 扩展性更好,更接近 LLM 训练栈,更可能上 BF16/FSDP/FP8
概率/扩散/流匹配规划 VADv2、DiffusionDrive、Flow matching action 连续场对数值误差敏感 → Action 路径忌过度量化
云端大模 + 蒸馏上车(小鹏) 云端不计成本训大 VLA,再压到车端 云端适合 FP8;车端适合 INT8/专用芯片量化
世界模型 + RL(蔚来/华为/小马) 仿真生成难例 + 在线/离线 RL 训练吞吐压力大;dtype 多未公开,工程上倾向 BF16/FP8 混用†
快慢双系统 E2E 高频 + VLM 低频 两套精度策略:E2E 车端定点;VLM 可云端或低频板载 BF16

4.7 小结:E2E 与「大模型低精」报告主线如何对齐

  1. 狭义一段式 E2E(亿级参数、BEV+规划):低精主战场是 FP16/BF16 训练 + INT8/FP16 车端量化,不是 FP8。
  2. 广义 E2E(含 VLA/世界模型):云端进入 LLM 量级后,才出现 BF16 默认、FP8 加速(小鹏★)、Dojo CFloat8(特斯拉硬件★)
  3. 量产争论焦点往往是一段式 vs VLA,而非 dtype;但地平线强调:E2E 基座不牢,VLA 难做好
  4. 报告前文章表中的 OneVL / MindVLA / Alpamayo / 小鹏 VLA,均应理解为 E2E 谱系上的语言/世界模型增强形态,其低精策略见表 §4.5 与 §6–§7。

5. 开源学界代表模型训练精度汇总

5.1 总览表(含机构 + 六类张量)

模型 提出者所属机构 训练总精度(公开) 权重 激活 计算 梯度 优化器状态 交换张量 来源
DriveVLA-W0 中科院自动化所 NLPR(CASIA)+ 引望智能(Yinwang) BF16 mixed-precision BF16† BF16† BF16(累加常 FP32)† BF16† AdamW:FP32 未公开;常见 BF16 gather + FP32 reduce† arXiv:2510.12796
OpenDriveVLA 慕尼黑工业大学(TUM)+ 慕尼黑大学(LMU) mixed-precision (bf16) BF16† BF16† BF16† BF16† 通常 AdamW→FP32† 未公开(4×H100)† arXiv:2503.23463
AutoVLA 加州大学洛杉矶分校(UCLA) FSDP + BF16 for parameters, gradients, and buffers BF16 BF16 BF16† BF16 AdamW 状态通常 FP32 FSDP:参数多为 BF16reduce_dtype 常见 FP32 arXiv:2506.13757
Counterfactual VLA NVIDIA + UCLA + Stanford bfloat16 + FSDP;FlashAttention-2 bf16 activations BF16† BF16 BF16† BF16† 通常 FP32† FSDP 未写;惯例同上† arXiv:2512.24426
DriveWAM 香港中文大学(深圳)+ 滴滴 Voyager Research bfloat16(GitHub/HF) BF16† BF16† BF16† BF16† AdamW;状态通常 FP32 48×H20;通信 dtype 未公开† GitHub · arXiv:2605.28544
Alpamayo-R1 / 1 NVIDIA 论文未逐项给出;发布权重为 BF16 存储/发布:BF16★;计算拷贝 BF16† 未公开→BF16† 未公开→BF16† 未公开 DeepSpeed 提及;opt 通常 FP32 未公开 HF · arXiv:2511.00088
FlashDrive UC San Diego / Z Lab(+ Princeton 等) 推理加速,非训练配方 训练同基座†;推理:VLM W4A8,Action BF16 推理:INT8 act(VLM)★ 推理:INT8 GEMM★ arXiv:2608.12932
EMMA Waymo(Google) 未公开 未公开 未公开 未公开 未公开 未公开 未公开 Waymo · arXiv:2410.23262

5.2 明确写出 vs 仅“bf16”一笔带过

模型 机构 论文对精度的原话(摘要) 可采信的逐项结论
DriveVLA-W0 CASIA + 引望 bfloat16 mixed-precision” + AdamW 仅确认整体 BF16;六类张量除计算侧外均需 †
OpenDriveVLA TUM + LMU mixed-precision (bf16) 同上;推理另报 A100 BF16
AutoVLA UCLA BFloat16 for parameters, gradients, and buffers” + FSDP 权重/梯度/buffer = BF16★;优化器与 reduce 仍 †
CF-VLA NVIDIA / UCLA / Stanford bfloat16” + “bfloat16 activations 激活 = BF16
DriveWAM CUHK-Shenzhen + 滴滴 GitHub:Precision = bfloat16 配置级 BF16;张量拆分未写
Alpamayo NVIDIA HF:Tensor type BF16 权重存储/发布 = BF16
FlashDrive UCSD Z Lab 部署:VLM W4A8,action expert BF16 推理混合精度
EMMA Waymo 无 dtype 披露 全表空白

6. 产业侧补充(小米 / 百度 / 理想 / 特斯拉)

6.1 总览表

模型 / 体系 提出者所属机构 训练总精度(公开) 权重 激活 计算 梯度 优化器 交换张量 证据强度 来源
Xiaomi OneVL 小米具身智能团队 Table 9:Precision = BF16;AdamW;ZeRO-2 BF16† BF16† BF16† BF16† AdamW;状态通常 FP32 ZeRO-2 分片通信† arXiv:2604.18486训练仓
OneVL 推理(非训练) 同上 车端常见 FP16(第三方) FP16 FP16 介绍文
Apollo ADFM 百度 Apollo 未公开 未公开 未公开 未公开 未公开 未公开 未公开 Apollo 新闻
Apollo 开源 BEV 工具链 百度 Apollo / 百舸 未见 BF16/FP8 明文 未公开 未公开 未公开 未公开 未公开 多卡 dist_train Apollo-BEV-Train
百度百舸 LoongForge FP8(GLM5,非智驾) 百度智能云 通用 LLMsft_glm5--bf16 + FP8 E4M3 blockwise FP8 param-gather + 部分 FP32 FP8/BF16 混合† FP8 GEMM★ BF16/FP8† exp-avg/exp-avg-sq=BF16 FP8 gather + overlap reduce★ 高(≠ADFM/≠VLA,仅作百度云 FP8 能力旁证) sft_glm5_group_fp8.sh
MindVLA-o1 理想汽车基座模型团队 GTC 发布:未披露 dtype 未公开 未公开 未公开 未公开 未公开 分布式 RL 提及,dtype 未写 央视网
DriveVLM / Dual 清华 IIIS + 理想汽车 论文未写 bf16/fp16 未公开 未公开 未公开 未公开 未公开 未公开 arXiv:2402.12289
Tesla FSD 训练(软件) Tesla 未公开 FSD 配方 未公开 未公开 未公开 未公开 未公开 未公开
Tesla Dojo(硬件/格式) Tesla 支持 BF16、FP32、CFloat8、CFloat16;峰值 BF16/CFloat8 CFloat8 可作权重存储★ CFloat8 可作激活存储★ 常扩到 BF16/FP32 CFloat8★;不足用 CFloat16 未写 Tile mesh;交换 dtype 未按张量公开 中高(硬件明确;软件未知) Dojo PDFHot Chips 2021

6.2 各家要点

小米 OneVL(产业侧最可核验)
  • 底座:Qwen3-VL-4B-Instruct;三阶段训练 + 双辅助解码器(语言 CoT + 视觉世界模型)。
  • 论文 Table 9:各 Stage Precision = BF16,Optimizer = AdamW,Parallelism = Zero-2。★
  • 权重/激活/计算/梯度未再拆开 → 按 BF16 混合精度 †。
  • 推理侧第三方材料常见 FP16,与训练 BF16 区分看待。
百度 Apollo
  • ADFM:产品与新闻完整,训练 dtype 未披露
  • 开源 BEV 工具链:偏感知训练/导出/部署,无 BF16/FP8 明文
  • 百舸 LoongForge:示例脚本为 GLM5 通用大模型 SFT 的 FP8examples/glm5/...),不是 VLA,也不能等同 Apollo ADFM;仅说明百度云训练栈具备 FP8 工程能力。
理想 MindVLA-o1 / DriveVLM
  • MindVLA-o1:原生多模态 MoE、隐世界模型三阶段、闭环 RL、Orin/Thor 软硬件协同;无 bf16/fp8 字段
  • DriveVLM(清华+理想):Qwen-VL 微调;论文未写精度
  • 不可把“业界多为 BF16”写成理想已公开事实。
特斯拉 Dojo
张量(白皮书能力) 数值类型 说明
权重/激活/梯度(存储) CFloat8(可配 bias)★ 降存储与带宽
计算 常扩到 BF16/FP32 CFloat8 可仅作 storage
梯度(更高精度存储) CFloat16 SHP/UHP 避免大量回退 FP32
舍入 stochastic rounding 小梯度可累积更新
峰值算力口径 BF16 或 CFloat8 D1 / Tile / ExaPod
优化器状态 / FSD 每层配方 未公开 勿写成“FSD 全网 CFloat8 训练”
特斯拉 CFloat8:一手链接与引用边界

公开材料是 Dojo 训练硬件 / 数值格式规范,不是「FSD 某层用 CFloat8 训练」的算法论文;场景为云端 Dojo 训练芯片,不是车端推理。

类型 链接 内容要点
格式白皮书(最完整)★ Tesla Dojo Technology PDF 定义 CFloat8_1_4_3 / CFloat8_1_5_2、可配置 6-bit bias、stochastic rounding;面向 weights / activations / gradients 的训练存储与带宽
Hot Chips 2021 微架构 slides★ HotChips_tesla_dojo_uarch.pdf 节点支持 CFP8、storage CFP16;D1 峰值标 BF16/CFP8;CFP16 用于更高精度(如 gradients)
专利(旁证) US11227029 Scalable matrix node engine with configurable data formats
格式对照(第三方) FPRox:8-bit FP taxonomy CFloat8 与 OCP OFP8 / IEEE P3109 对照,非特斯拉论文

引用注意:文中 8-bit 常写作 CFloat8 / CFP8,16-bit 为 CFloat16 / CFP16。无 NeurIPS/CVPR 级「Tesla trains FSD with CFloat8」方法文;勿把硬件峰值或格式能力写成已公开的 FSD 每层训练 recipe。


7. 其他车企与供应商补充

本节覆盖华为、小鹏、蔚来、吉利/极氪、地平线、Momenta、元戎/长城、小马等。除小鹏外,多数未公开权重/激活/计算/梯度/优化器/交换张量的逐字段 dtype。

7.1 总览表

企业 / 方案 机构属性 智驾大模型叙述(公开) 训练精度(公开) 权重 激活 计算 梯度 优化器 交换 证据 来源
小鹏世界基座模型 / VLA 小鹏汽车 云端 1B–72B VLA;Scaling Law;蒸馏上车;FSDP2 + FA3 FP8 混合精度训练 FP8†(GEMM 侧) FP8/BF16† FP8† FP8/BF16† 未公开(通常 FP32)† FSDP 2★;dtype 未写 (官方 CVPR 披露) 小鹏官网 CVPR
华为乾崑 ADS 4/5(WEWA) 华为智能汽车解决方案 云端世界引擎 + 车端世界行为模型;在线 RL;算力至约 60 EFLOPS 未公开 未公开 未公开 未公开 未公开 未公开 未公开 BitAuto ADS4新浪 ADS5
蔚来 NWM / NADArch 2.0 蔚来 世界模型 NWM;多元自回归;NSim 仿真;群体智能闭环 未公开 未公开 未公开 未公开 未公开 未公开 未公开 蔚来官网 NWMChinaEVHome WM2.0
吉利 WAM / 极氪千里浩瀚 吉利控股 / 极氪 / 千里科技 世界行为模型 WAM;跨域融合;宣称可调用约 23.5 EFLOPS 未公开 未公开 未公开 未公开 未公开 未公开 未公开 36氪 WAM极氪千里浩瀚
地平线 Journey J6 工具链 地平线(芯片/算法平台) 一段式端到端量产叙事;工具链面向部署量化 非云端训练披露;部署:int8/int16/fp16 混合★ 部署量化为主 部署 int8/16/fp16★ 同上 —(QAT 有) 高(部署侧) 平台差异精度调优
Momenta Momenta 端到端大模型;长短期记忆;强调 RL;数据飞轮 未公开 未公开 未公开 未公开 未公开 未公开 未公开 腾讯新闻 Momenta钛媒体
元戎启行 DeepRoute IO 元戎启行(长城等客户) 端到端;规划 Thor + VLA 未公开 未公开 未公开 未公开 未公开 未公开 未公开 36氪 长城注资元戎
长城 / 毫末智行 长城汽车 / 毫末 自研 + 元戎双供应;HP 等产品线 未公开 未公开 未公开 未公开 未公开 未公开 未公开 同上
小马智行 PonyWorld 小马智行 世界模型 + RL「虚拟驾校」;Thor 域控营销含 FP4 TFLOPS 训练 dtype 未公开;算力口径含 FP4(偏硬件峰值) 未公开 未公开 未公开 未公开 未公开 未公开 低(训练)/ 中(硬件口径) PonyWorld 2.0网易 Thor
文远知行 WeRide 文远知行 一段式端到端量产叙事;Robotaxi 未公开(勿与通用 LLM FP8 新闻混淆) 未公开 未公开 未公开 未公开 未公开 未公开 钛媒体
比亚迪 / 丰田 / 奔驰等 各自主机厂 多为合作供应商方案或传统辅助驾驶升级叙事 未检索到可引用的基模训练 dtype

7.2 小鹏(产业侧第二个「训练低精」硬证据)

CVPR 2025 WAD 官方报道中,小鹏明确列出云端训练 GPU 优化手段:

  • 使用 FSDP 2 实现模型分片 ★
  • 使用 FP8 混合精度训练
  • 利用 Flash Attention 3
  • 自定义 Triton 内核 ★

同时披露:万卡集群、约 10 EFLOPS、SM utilization ~85%、云端基模 + 蒸馏上车、量化友好架构与图灵芯片协同。

张量 公开程度 备注
计算 / 权重(GEMM) FP8 混合精度★ 未说明 E4M3/E5M2、是否 Hybrid、是否白名单层
激活 / 梯度 / 优化器 / 交换 未拆开 按通用 FP8+BF16 配方 †:敏感层与 master/opt 常仍 BF16/FP32
车端 Token 压缩、量化友好架构★ 具体 INT8/FP8 位宽未在该文给出

意义:在「车企官方口径」中,小鹏是目前除特斯拉 Dojo 硬件白皮书外,少数直接承认云端用 FP8 训练的案例;但六元组仍不如开源论文可核验。

小鹏 FP8:一手链接与引用边界

目前没有单独的小鹏 FP8 技术论文(无 arXiv / 无 E4M3·E5M2、layer whitelist、与 BF16 对比曲线)。可核实来源如下。

类型 链接 说明
官网新闻(中文,★ 明确写 FP8) xiaopeng.com/…/5478.html CVPR WAD 分享纪要;GPU 侧写明 FSDP 2、FP8 混合精度、FA3、Triton
英文新闻稿 xpeng.com 英文稿 同一场演讲;偏活动/G7,不一定逐条写 FP8
GlobeNewswire 通稿 同上英文通稿
WAD 日程 cvpr2025.wad.vision Xianming Liu,Scaling up Autonomous Driving via Large Foundation Models(约 4:30–5:00pm);公开 slides/录像未见单独发布
二手转载(对照用) 智源社区搜狐整理 内容与官网一致

勿混淆:后续 X-Mind / X-World 等论文或 PR(世界模型、Visual CoT、部署)不是上述「云端基座训练用 FP8」的原始出处。引用时应标注为 CVPR 2025 WAD 工业分享 + 公司新闻,而非 peer-reviewed 方法文。

7.3 华为 / 蔚来 / 吉利:架构与算力为主

企业 公开技术关键词 与低精训练的关系
华为 ADS 4/5 WEWA / WEWA 2.0;世界引擎难例生成;Multi-agent 博弈;在线 RL;安全风险场 bf16/fp8 字段;只能确认大规模分布式训练存在
蔚来 NWM 世界模型;0.1s 推演多轨迹;NSim;群体智能数据 训练 dtype;勿把第三方科普文中的 bf16 当成蔚来官方
吉利 WAM / 极氪 世界行为模型;沃尔沃安全数据;23.5 EFLOPS 算力叙事 训练 dtype;算力≠数值格式

7.4 地平线:部署量化谱系(≠云端基模训练)

地平线公开文档针对 Journey J6 上车部署

平台 常见量化策略(部署)★
J6E/M int8 + int16 混合为主;少量 fp16
J6H/P int8 + int16 + fp16;可全局 fp16 起步再回退 int8/int16
敏感算子 Sin/Cos 等可 fp32;GEMM/Conv 按敏感度升降

这与「云端 BF16/FP8 预训练」是不同阶段:地平线材料证明车端混合定点/半精推理成熟,不能据此推断其客户云端训练用 INT8。

7.5 Momenta / 元戎 / 小马等

  • Momenta:端到端 + RL 叙事清晰,训练精度未公开。
  • 元戎 / 长城:端到端量产与 Thor/VLA 路线,dtype 未公开。
  • 小马 PonyWorld:RL 世界模型闭环;Thor 宣传中的 FP4 TFLOPS 是芯片峰值算力口径,不等于已公开「全网 FP4 训练」。
  • 文远:端到端量产与 Robotaxi;检索未见可采信的训练 dtype(注意勿把通义千问等 LLM 的 FP8 新闻误挂到文远)。

7.6 产业侧「训练低精」披露对比(更新)

等级 企业 / 方案 内容
A. 训练低精明确写出 小鹏(FP8 混合精度★);小米 OneVL(BF16★) 可直接引用
B. 硬件格式明确 特斯拉 Dojo(CFloat8/BF16/CFloat16★) 软件配方仍未知
C. 部署量化明确 地平线 J6(int8/int16/fp16★) 非云端训练
D. 仅架构/算力 华为、蔚来、吉利/极氪、理想、百度 ADFM、Momenta、元戎、小马、文远 六元组空白

8. FP8:通用 LLM 成熟,智驾训练滞后

维度 通用 LLM 汽车智驾大模型(公开)
训练默认 Hopper+ 上 FP8 Hybrid 渐成选项 开源仍以 BF16 为主小鹏官方承认云端 FP8 混合精度;多数车企未披露
吞吐收益 相对 BF16 约 +30–50% 小鹏未公布相对 BF16 加速比;开源 AD 论文少作主实验
敏感层 Linear 用 FP8;Norm/Embed/LM Head 回退 同理,且 Vision + Action 更保守;车端另有 int8/int16(地平线)
主要障碍 outlier、scale 同步 多模态误差级联、连续动作、小 batch;披露意愿低

参考:arXiv:2209.05433Towards Fully FP8 GEMM LLM TrainingTE docs

8.1 智驾侧「训练 8-bit」两家一手来源对照

小鹏 FP8 特斯拉 CFloat8 / CFP8
性质 软件栈声明(Hopper 类 GPU + FSDP2 + FA3) 自研 Dojo 硬件数值格式
证据形态 公司新闻转述 WAD 演讲;独立 arXiv 方法文 Dojo Technology PDF + Hot Chips slides; FSD 训练 recipe 论文
最稳引用 官网 5478 Dojo PDF
可写什么 云端 VLA 基座用 FP8 混合精度训练 硬件支持权重/激活/梯度 CFloat8 存储、算力口径含 CFP8★
不可写什么 E4M3/E5M2 Hybrid、敏感层白名单、相对 BF16 加速比 「FSD 全网已用 CFloat8 训练」或车端推理用 CFloat8
与 OCP FP8 未说明是否对齐 E4M3/E5M2 可配 bias,与固定 bias 的 OFP8 不等同(见 FPRox 对照)

详见 §6「特斯拉 Dojo」、§7.2「小鹏」下的链接表。


9. 工程建议(基于公开证据)

  1. 训练基线:BF16 混合精度 + FP32 optimizer states(避免长训 Adam EMA 存 BF16)。
  2. FP8 训练:开源 AD 仍以 BF16 为主;小鹏已官方承认云端 FP8 混合精度,落地时需 Hopper+、TE/等价栈、敏感层白名单,并以 BF16 对齐评测。
  3. 推理优先模块拆分:Vision 高精 + LLM FP8/W4A8 + Action BF16;车端可参考地平线 int8/int16/fp16 混合量化谱系。
  4. 评测门禁:规划指标(L2 / ADE / PDMS / 碰撞率)与 BF16 基线对比。
  5. 对内汇报合规:★ only 可作事实;† 须标注推断;华为/蔚来/吉利等未披露项不得臆造。

10. 可采信排序(训练数值类型)

  1. 小米 OneVL(BF16★,超参表可核验)
  2. 小鹏世界基座(FP8 混合精度★,官方 CVPR;六元组未拆开)
  3. 开源学界 AutoVLA / CF-VLA / DriveVLA-W0 等(BF16★,部分六元组★/†)
  4. 特斯拉 Dojo 硬件格式(CFloat8/BF16/CFloat16★,FSD 软件未知)
  5. 地平线 J6 部署量化(int8/int16/fp16★,≠云端训练)
  6. 百度百舸 LoongForge FP8(脚本★:针对 GLM5 LLM,≠ ADFM、≠ VLA;仅旁证云栈能力)
  7. 华为 / 蔚来 / 吉利 / 理想 / Apollo ADFM / Momenta / 元戎 / 小马 / 文远 / FSD 软件(未公开)

11. 主要信息来源索引

# 类型 链接
1 DriveVLA-W0 https://arxiv.org/abs/2510.12796
2 OpenDriveVLA https://arxiv.org/html/2503.23463v2
3 AutoVLA https://arxiv.org/html/2506.13757v3
4 Counterfactual VLA https://arxiv.org/html/2512.24426v1
5 DriveWAM https://github.com/chenshi3/DriveWAM
6 FlashDrive https://arxiv.org/abs/2608.12932
7 Alpamayo ModelOpt https://github.com/NVIDIA/Model-Optimizer/blob/main/examples/alpamayo/README.md
8 Alpamayo HF https://huggingface.co/nvidia/Alpamayo-R1-10B
9 FP8 原始论文 https://arxiv.org/abs/2209.05433
10 Transformer Engine FP8 https://nvidia.github.io/TransformerEngine/features/low_precision_training/fp8_current_scaling/fp8_current_scaling.html
11 VLA Block-wise FP8 PTQ https://ai-infrastructure.net/blockwise-fp8-quantization-vla/
12 Waymo EMMA https://waymo.com/research/emma/
13 NeMo 混合精度注意点 https://docs.nvidia.com/nemo/automodel/development/mixed-precision-training
14 OneVL 论文(BF16 Table 9) https://arxiv.org/html/2604.18486
15 OneVL 训练代码 https://github.com/GeorgeLuImmortal/OneVL_training
16 OneVL 推理/权重 https://github.com/xiaomi-research/onevl
17 Apollo ADFM https://www.apollo.auto/news/11327
18 Apollo BEV Train https://cloud.baidu.com/doc/AIHC/s/ymkavkpm8
19 百舸 LoongForge FP8(GLM5,非智驾 VLA) https://github.com/baidu-baige/LoongForge/blob/master/examples/glm5/finetuning/sft_glm5_group_fp8.sh
20 MindVLA-o1 https://auto.cctv.com/2026/03/18/ARTImEaLg0G2OMk9ZybCcEnx260318.shtml
21 DriveVLM https://arxiv.org/html/2402.12289
22 Tesla Dojo 格式白皮书(CFloat8★) https://digitalassets.tesla.com/tesla-contents/image/upload/tesla-dojo-technology.pdf
23 Tesla Dojo Hot Chips 2021(CFP8★) https://hc34.hotchips.org/assets/program/conference/day2/Machine%20Learning/HotChips_tesla_dojo_uarch.pdf
23b Tesla Dojo 概述 https://en.wikipedia.org/wiki/Tesla_Dojo
23c Tesla 可配置格式专利(旁证) https://patents.justia.com/patent/11227029
23d 8-bit FP 格式对照(含 CFloat8) https://fprox.substack.com/p/partial-taxonomy-of-8-bit-floating
24 小鹏官网 CVPR(FP8 训练★,一手) https://www.xiaopeng.com/news/company_news/5478.html
24b 小鹏英文通稿(同场 WAD) https://www.xpeng.com/news/0197e4a0ad5f97aacf548a02872a0090
24c CVPR 2025 WAD 日程(刘先明演讲) https://cvpr2025.wad.vision/
24d 智源转载(对照官网) https://hub.baai.ac.cn/view/46568
25 华为乾崑 ADS 4 https://www.bitauto.com/article/100399965840/
26 华为乾崑 ADS 5 https://finance.sina.com.cn/jjxw/2026-04-28/doc-inhwaicu8457444.shtml
27 蔚来 NWM https://www.nio.cn/smart-technology/20241120002
28 吉利 WAM https://www.36kr.com/p/3631859469305096
29 极氪千里浩瀚 https://www.zeekrgroup.com/posts/introducing-zeekr-g-pilot-intelligent-autonomy-you-can-use
30 地平线 J6 平台差异 https://doc.oe.horizon.auto/guide/platform_diff.html
31 地平线精度调优 https://doc.oe.horizon.auto/guide/tuning_guide/accuracy_tune.html
32 Momenta 端到端 https://news.qq.com/rain/a/20240731A04X9K00
33 元戎 / 长城 https://m.36kr.com/p/3017043935880449
34 小马 PonyWorld 2.0 https://news.qq.com/rain/a/20260410A04Y1800
35 中国智驾决赛圈综述 https://www.tmtpost.com/7844137.html

| 36 | UniAD | https://github.com/OpenDriveLab/UniAD |
| 37 | UniAD 训练说明 | https://github.com/OpenDriveLab/UniAD/blob/v2.0/docs/TRAIN_EVAL.md |
| 38 | VADv2 | https://arxiv.org/html/2402.13243v2 |
| 39 | DriveTransformer | https://ar5iv.labs.arxiv.org/html/2503.07656 |
| 40 | 端到端架构差异(OFweek) | https://www.ofweek.com/ai/2025-05/ART-201700-8500-30662490.html |
| 41 | 端到端演进(腾讯) | https://news.qq.com/rain/a/20260323A03H4O00 |
| 42 | 地平线:E2E 是 VLA 基石 | https://www.21jingji.com/article/20251222/herald/be6d53d4e0ec78a99079818d5d6451c8.html |
| 43 | 博世一段式 + 文远 | https://chedongxi.com/p/350055.html |
| 44 | 地平线 VLA vs E2E 博客 | https://developer.horizon.auto/blog/13075 |
| 45 | 蔚小理端到端形态(36氪) | https://36kr.com/p/2913900674816649 |


12. 一句话总结

汽车智驾大模型 / 端到端当前是 “狭义一段式 E2E(亿级)靠 BF16/FP16 训 + INT8 车端;广义 VLA/世界模型进 LLM 量级后才上 FP8(小鹏★)与 Dojo CFloat8(硬件★);E2E 是基石、VLA 是增强;多数车企仍不披露六元组”——分析低精时务必先分清模型代际,避免把部署量化或芯片峰值直接写成云端训练配方。


本文档由会话分析整理生成,引用以公开网页/论文为准;† 标注内容仅为工程惯例推断,引用时请注明。小鹏 FP8 / 特斯拉 CFloat8 一手链接与「可写/不可写」边界见 §6、§7.2、§8.1。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐