汽车智驾领域大模型低精度训练分析报告
汽车智驾领域大模型低精度训练分析报告
检索范围:arXiv / ICLR、GitHub、Hugging Face、NVIDIA ModelOpt / Transformer Engine / Dojo 白皮书、车企公开新闻与开源代码等(约 2024–2026)
整理日期:2026-08-31(含其他车企与端到端 E2E 专章;同日增补小鹏 FP8 / 特斯拉 CFloat8 一手链接与引用边界)
图例:★ = 原文/发布页明确写出;† = 按 BF16 混合精度 + AdamW/FSDP/ZeRO 惯例推断(非论文逐字段承诺)
1. 结论先行
公开智驾工作可分两层理解:(A) 狭义一段式端到端(传感→轨迹,亿级参数)训练侧以 FP16/BF16 为主、车端 INT8/FP16;(B) VLA/世界模型增强的广义 E2E 进入 LLM 量级后,才出现 BF16 默认可核验(OneVL 等) 与车企罕见的 FP8 云端训练(小鹏★)。特斯拉 Dojo 在硬件格式层公开 CFloat8/CFloat16;华为 / 蔚来 / 吉利 / Momenta 等多数只谈架构与算力,不披露六元组。地平线强调 E2E 是 VLA 基石,并公开车端 int8/int16/fp16 部署量化。
| 阶段 | 主流精度 | 典型目标 |
|---|---|---|
| 训练(Pretrain / SFT / Co-training) | BF16 混合精度 | 稳定收敛、工程成熟 |
| 大规模训练(Hopper+,≥7B,通用 LLM) | BF16 + FP8 混合 | 吞吐提升约 30–40% |
| RL 后训练 | BF16 为主;FP8 训推统一在探索 | 降低训推不一致 |
| 推理 / 部署 | FP8 / W4A8 / NVFP4 / FP16 PTQ | 延迟与显存 |
2. 数值类型一览
| 格式 | 位宽 | 指数/尾数 | 动态范围特点 | 智驾场景常见用途 | 主要来源 |
|---|---|---|---|---|---|
| FP32 | 32 | 8 / 23 | 宽 | Master weights、Adam 状态、Loss/归约累加 | Micikevicius et al., Mixed Precision;NeMo AutoModel |
| TF32 | 19* | 8 / 10 | 与 FP32 同量级 | Ampere+ Tensor Core 默认矩阵乘模式 | NVIDIA AMP 惯例 |
| FP16 | 16 | 5 / 10 | 窄,易溢出 | 早期训练;现多被 BF16 取代;部分推理 | 同上 |
| BF16 | 16 | 8 / 7 | 与 FP32 同指数范围 | 训练主流默认 | 见第 4–5 节模型表 |
| FP8 E4M3 | 8 | 4 / 3 | 精度优先 | 前向权重/激活;推理 W8A8 | arXiv:2209.05433;TE FP8 |
| FP8 E5M2 | 8 | 5 / 2 | 范围优先 | 反向梯度(Hybrid recipe) | 同上 |
| Tesla CFloat8 | 8 | 可配(1_4_3 / 1_5_2) | 可配 bias | Dojo 上权重/激活/梯度存储 | Dojo Technology PDF |
| Tesla CFloat16 | 16 | 可配 SHP/UHP | 扩范围 | 梯度等需更高精度时,避免回退 FP32 | 同上 |
| INT8 / W4A8 | 8/4 | — | 定点 | 推理 Prefill/Decode 加速 | FlashDrive |
| NVFP4 (E2M1) | 4 | 2 / 1 | 极低精 | Alpamayo 等 PTQ | ModelOpt Alpamayo |
TF32 多为计算路径,非独立存储格式。
BF16 为何成训练默认:与 FP32 同为 8-bit 指数,梯度不易溢出,通常不需要 GradScaler;代价是尾数仅 7 bit,需用 FP32 master weights / optimizer states 补偿(参见 NeMo 警告:长训勿把 Adam EMA 也存成 BF16)。
2.1 混合精度训练标准配方(通用)
前向/反向计算(大部分层) → BF16 或 FP8
矩阵乘累加(GEMM accumulator)→ FP32
Master Weights → FP32
Optimizer States (Adam) → FP32
Loss / Softmax / LayerNorm → FP32 或 BF16
梯度 All-Reduce → FP32(reduce_dtype,常见)
2.2 张量类别含义
| 类别 | 含义 | BF16 混合精度下的常见做法 |
|---|---|---|
| 权重 | 前向参数副本(及是否另有 FP32 master) | 前向多为 BF16;更新用 master 常为 FP32 |
| 激活 | 中间激活 / 部分 buffer | BF16 |
| 计算 | MatMul/Conv 等算子主路径 | BF16;累加器常 FP32 |
| 梯度 | ∂L/∂w | 多为 BF16;All-Reduce 前有时升到 FP32 |
| 优化器 | Adam/AdamW 的 m、v 及 master | 几乎一律建议 FP32 |
| 交换张量 | DDP/FSDP/ZeRO 的 gather、reduce | 参数 gather:BF16;梯度 reduce:常见 FP32 |
3. 模块级精度分配
3.1 训练期
| 模块 / 张量 | 典型精度 | 是否低精 | 说明 |
|---|---|---|---|
| Transformer Linear(Q/K/V/O、MLP) | BF16 计算 | ✅ | 吞吐与显存收益主体 |
| Attention 累加 / Softmax | FP32 或 BF16 | 部分 | FlashAttention 内部常 FP32 累加 |
| LayerNorm / RMSNorm | BF16 或 FP32 | ⚠️ 慎 FP8 | 方差对量化敏感 |
| Embedding / LM Head | BF16 | ⚠️ 慎 FP8 | TE/工程实践白名单回退 |
| Vision Encoder(ViT / ResNet) | BF16 | ✅(相对 FP32) | 训练阶段与骨干同精度 |
| BEV / Perception Token 提取 | BF16 | ✅ | OpenDriveVLA 等 |
| Action / Trajectory / Flow-Matching Head | BF16 | ✅ 训练;❌ 不建议 FP8 | 连续输出对误差敏感 |
| Loss、梯度 All-Reduce、Master Weights、Adam | FP32 | ❌ | 稳定性底座 |
3.2 推理 / PTQ 期
| 模块 | 常见精度 | 低精? | 证据 |
|---|---|---|---|
| Vision Tower(ViT) | 保持高精度 | ❌ 通常不量化 | ModelOpt Alpamayo;Block-wise FP8 for VLA |
| VLM / LLM Linear 骨干 | FP8 或 W4A8 | ✅ | Alpamayo FP8/NVFP4;FlashDrive W4A8 |
| 小维度 Action Projection | 高精度 | ❌ | 维度非 16 倍数破坏 real-quant GEMM |
| Action Expert(连续轨迹) | BF16 | ❌ | FlashDrive |
| KV Cache | BF16 / FP8 | 可选 | 通用 vLLM 实践 |
架构示意:
相机/视频 ──► Vision Encoder ──► Token 对齐 ──► LLM Backbone ──► Action/Planner
│ │ │ │
训练: BF16 训练: BF16 训练: BF16 训练: BF16
推理: 常保持高精 推理: 可 FP8 推理: FP8/W4A8 推理: 常 BF16
4. 智驾端到端(E2E)模型分析
本节梳理「经典 E2E / 一段式·两段式 / E2E+VLM 双系统 / VLA / 世界模型」谱系,并与低精度训练、车端部署的关系对照。E2E 与 VLA 并非对立:地平线等观点认为一段式 E2E 是基石,VLA 是其上叠加的模态与推理能力。
4.1 概念与演进轴
| 代际 | 形态 | 输入→输出 | 典型代表 | 可导性 / 信息流 |
|---|---|---|---|---|
| 0 | 模块化规则+深度学习感知 | 传感→检测/地图→规则规划→控制 | 传统量产栈 | 分段;人工接口,误差累积 |
| 1 | 两段式端到端 | 传感→感知网 →(人工定义接口)→ 规划网 → 轨迹 | 早期量产「端到端」宣传;小鹏 XNet+XPlanner 阶段 | 两段各自可导,跨接口未必联合最优 |
| 2 | 一段式端到端(规划导向) | 传感→统一 Transformer → 轨迹(可附带感知辅助头) | UniAD、VAD/VADv2、DriveTransformer;地平线 HSD;博世+文远 Orin 方案;Tesla FSD V12 理念 | 全程可导(理想形态);HMI 感知可剥离 |
| 3 | E2E + VLM 双系统(快慢) | 快:E2E 轨迹;慢:VLM 语义/CoT | 理想早期「一段式 E2E + VLM」叙事;DriveVLM-Dual | 快路径实时;慢路径低频;联合训练难 |
| 4 | VLA / 世界模型增强 | 视觉(+语言)→推理/隐状态→动作或轨迹 | DriveVLM、MindVLA、小鹏 VLA、OneVL、Alpamayo、NWM、WEWA | 仍属广义 E2E;增加语言/世界建模监督 |
模块化 ──► 两段式 E2E ──► 一段式 E2E(光子→轨迹)──► E2E+VLM 双系统 ──► VLA / 世界模型
│ │ │ │
人工接口残留 联合优化上限高 快慢协同 语义+物理先验
4.2 一段式 vs 两段式(工程对比)
| 维度 | 一段式 E2E | 两段式 E2E |
|---|---|---|
| 信息流 | 传感特征直达规划,少人工接口 | 感知结构化输出再进规划,存在信息瓶颈 |
| 训练 | 宜大规模模仿学习 / RL;对数据与算力要求极高 | 可分段训、分段验,迭代成本较低 |
| 可解释性 | 弱(黑箱);常靠辅助感知头做 HMI | 较好(中间量可检) |
| 实时性 / 车端 | 大模型时延挑战大;成功量产需强工程压缩 | 更易控延迟与算力 |
| 量产叙事 | 地平线、博世+文远、Tesla 路线强调「真一段式」 | 2024–2025 多数宣传「端到端」实为两段式 |
| 与 VLA | 地平线:E2E 做不好则 VLA 做不好 | VLA 可挂在两段式之上,但上限受接口损失制约 |
来源:OFweek 架构差异;腾讯新闻 端到端演进;地平线吕鹏访谈;博世一段式
4.3 开源/学界代表 E2E 模型
| 模型 | 机构 | 架构要点 | 训练策略(公开) | 精度相关 | 来源 |
|---|---|---|---|---|---|
| UniAD | OpenDriveLab 等 | 感知–预测–规划统一;多任务 query | 两阶段:① track+map;② 全任务 E2E;Stage2 可冻 BEV encoder | 官方强调 8×A100 显存;属 MMDet3D 生态,社区常用 FP16 AMP(需 loss scale),论文未强制 BF16 | GitHub UniAD;TRAIN_EVAL |
| VAD / VADv2 | — | 矢量化场景表征;VADv2 概率规划 + 分布/冲突损失 | 端到端规划监督为主 | 公开材料少写 dtype;规模小于 LLM-VLA,多仍 FP16/BF16 惯例† | VADv2 |
| DriveTransformer | — | 统一 Transformer;任务自注意力;单阶段联合训 | 相对 UniAD 多阶段更易扩展 | 未检索到强制 FP8 声明 | arXiv:2503.07656 |
| Transfuser / PARA-Drive 等 | 学界基准 | 传感融合→规划 | IL / 闭环仿真评测 | 多为中小规模 CNN-Transformer,BF16/FP16† | NAVSIM 等基准对比表见 VADv2 文 |
| DriveVLM(-Dual) | 清华 + 理想 | VLM CoT + 可选传统感知规划 | 微调 Qwen-VL;Dual 为混合系统 | 未公开训练 dtype | arXiv:2402.12289 |
UniAD 训练与精度启示:Stage1 峰值显存高(约 50GB/卡量级,8×A100),Stage2 冻编码器后显存下降——说明经典 E2E 对激活显存极度敏感,工业上天然驱动 FP16/BF16、梯度检查点、冻骨干等手段;但与 7B+ VLA 的 FP8 动机(吞吐/通信)不完全相同。
4.4 产业 E2E 路线对照(与 §6–§7 衔接)
| 厂商 / 方案 | E2E 形态(公开口径) | 与大模型关系 | 低精相关(已知) |
|---|---|---|---|
| Tesla FSD | 一段式理念(传感→控制/轨迹) | 自研大网;Dojo 训推一体 | Dojo:CFloat8/BF16 硬件★;软件配方未公开 |
| 地平线 HSD | 强调真一段式 + RL | E2E 为基石,再谈 VLA/WM | 车端 int8/int16/fp16 量化★ |
| 博世 + 文远 | 一段式量产(Orin-Y) | 短期坚持 E2E,认为 VLA 上车需 7B–10B 与大带宽芯片 | 训练 dtype 未公开 |
| Momenta | 端到端大模型 + 数据飞轮;RL | 与一段式/VLA 并行探索 | 未公开 |
| 小鹏 | 早期两段(XNet+XPlanner+XBrain)→ 第二代 VLA | 云端超大 VLA + 蒸馏 | 云端 FP8 混合精度★ |
| 理想 | 一段式 E2E + VLM → MindVLA | 快慢系统→统一 VLA | MindVLA dtype 未公开 |
| 华为 ADS | GOD/PDP → WEWA 世界引擎+行为模型 | 云端仿真+在线 RL | 未公开 |
| 蔚来 | NADArch + NWM 世界模型 | 生成式推演+仿真 | 未公开 |
| 小米 OneVL | VLA + 潜空间 + 世界模型辅助解码 | 开源可复现 | 训练 BF16★ |
4.5 E2E 模型的模块与低精度落点
【经典一段式 E2E】
多相机/LiDAR ──► Backbone(CNN/ViT) ──► BEV/Token Encoder ──►
Det/Map/Motion Heads(可选,可仅 HMI) ──► Planner Head ──► 轨迹/控制
低精倾向:
Backbone + BEV Attention/MatMul → 训练 BF16/FP16;部署 INT8/FP16
Norm / 几何编码 / 轨迹回归头 → 常更高精(FP16/FP32 或 int16)
多任务 loss 加权 / 匹配(Hungarian)→ 计算敏感,少见 FP8
【VLA 增强 E2E】
传感 ──► Vision Tower ──► LLM/MoE ──►(CoT/Latent)──► Action/Flow Head
低精倾向:见 §3(Vision 与 Action 保守;LLM Linear 可 FP8/W4A8)
| 模块类型 | 经典 E2E(UniAD 级) | VLA 级 E2E |
|---|---|---|
| 视觉骨干 | FP16/BF16 训;INT8 部署常见 | BF16 训;部署常不量化或轻量量化 |
| BEV / 时序融合 | 显存大户 → 混合精度收益高 | Token 压缩、蒸馏更关键(小鹏) |
| 规划头 / 轨迹 | 连续量,部署慎 INT8 | Action Expert 常 BF16 |
| 语言模型 | 无或仅辅助 VLM | 可 FP8 训练/推理(小鹏云端 FP8★) |
| 世界模型分支 | 少 | 训练可用辅助解码器;推理可丢弃(OneVL) |
4.6 训练范式差异(对精度栈的影响)
| 范式 | 说明 | 对低精的含义 |
|---|---|---|
| 多阶段 IL(UniAD) | 先感知再全任务;可冻编码器 | Stage1 显存峰值 → FP16/BF16、减 queue_length;少见 FP8 |
| 单阶段统一 Transformer(DriveTransformer) | 任务并行注意力,减误差累积 | 扩展性更好,更接近 LLM 训练栈,更可能上 BF16/FSDP/FP8 |
| 概率/扩散/流匹配规划 | VADv2、DiffusionDrive、Flow matching action | 连续场对数值误差敏感 → Action 路径忌过度量化 |
| 云端大模 + 蒸馏上车(小鹏) | 云端不计成本训大 VLA,再压到车端 | 云端适合 FP8;车端适合 INT8/专用芯片量化 |
| 世界模型 + RL(蔚来/华为/小马) | 仿真生成难例 + 在线/离线 RL | 训练吞吐压力大;dtype 多未公开,工程上倾向 BF16/FP8 混用† |
| 快慢双系统 | E2E 高频 + VLM 低频 | 两套精度策略:E2E 车端定点;VLM 可云端或低频板载 BF16 |
4.7 小结:E2E 与「大模型低精」报告主线如何对齐
- 狭义一段式 E2E(亿级参数、BEV+规划):低精主战场是 FP16/BF16 训练 + INT8/FP16 车端量化,不是 FP8。
- 广义 E2E(含 VLA/世界模型):云端进入 LLM 量级后,才出现 BF16 默认、FP8 加速(小鹏★)、Dojo CFloat8(特斯拉硬件★)。
- 量产争论焦点往往是一段式 vs VLA,而非 dtype;但地平线强调:E2E 基座不牢,VLA 难做好。
- 报告前文章表中的 OneVL / MindVLA / Alpamayo / 小鹏 VLA,均应理解为 E2E 谱系上的语言/世界模型增强形态,其低精策略见表 §4.5 与 §6–§7。
5. 开源学界代表模型训练精度汇总
5.1 总览表(含机构 + 六类张量)
| 模型 | 提出者所属机构 | 训练总精度(公开) | 权重 | 激活 | 计算 | 梯度 | 优化器状态 | 交换张量 | 来源 | |
|---|---|---|---|---|---|---|---|---|---|---|
| DriveVLA-W0 | 中科院自动化所 NLPR(CASIA)+ 引望智能(Yinwang) | BF16 mixed-precision | BF16† | BF16† | BF16(累加常 FP32)† | BF16† | AdamW:FP32† | 未公开;常见 BF16 gather + FP32 reduce† | arXiv:2510.12796 | |
| OpenDriveVLA | 慕尼黑工业大学(TUM)+ 慕尼黑大学(LMU) | mixed-precision (bf16) | BF16† | BF16† | BF16† | BF16† | 通常 AdamW→FP32† | 未公开(4×H100)† | arXiv:2503.23463 | |
| AutoVLA | 加州大学洛杉矶分校(UCLA) | FSDP + BF16 for parameters, gradients, and buffers | BF16★ | BF16★ | BF16† | BF16★ | AdamW 状态通常 FP32† | FSDP:参数多为 BF16;reduce_dtype 常见 FP32† |
arXiv:2506.13757 | |
| Counterfactual VLA | NVIDIA + UCLA + Stanford | bfloat16 + FSDP;FlashAttention-2 bf16 activations | BF16† | BF16★ | BF16† | BF16† | 通常 FP32† | FSDP 未写;惯例同上† | arXiv:2512.24426 | |
| DriveWAM | 香港中文大学(深圳)+ 滴滴 Voyager Research | bfloat16(GitHub/HF) | BF16† | BF16† | BF16† | BF16† | AdamW;状态通常 FP32† | 48×H20;通信 dtype 未公开† | GitHub · arXiv:2605.28544 | |
| Alpamayo-R1 / 1 | NVIDIA | 论文未逐项给出;发布权重为 BF16 | 存储/发布:BF16★;计算拷贝 BF16† | 未公开→BF16† | 未公开→BF16† | 未公开 | DeepSpeed 提及;opt 通常 FP32† | 未公开 | HF · arXiv:2511.00088 | |
| FlashDrive | UC San Diego / Z Lab(+ Princeton 等) | 推理加速,非训练配方 | 训练同基座†;推理:VLM W4A8,Action BF16★ | 推理:INT8 act(VLM)★ | 推理:INT8 GEMM★ | — | — | — | arXiv:2608.12932 | |
| EMMA | Waymo(Google) | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | Waymo · arXiv:2410.23262 |
5.2 明确写出 vs 仅“bf16”一笔带过
| 模型 | 机构 | 论文对精度的原话(摘要) | 可采信的逐项结论 |
|---|---|---|---|
| DriveVLA-W0 | CASIA + 引望 | “bfloat16 mixed-precision” + AdamW | 仅确认整体 BF16;六类张量除计算侧外均需 † |
| OpenDriveVLA | TUM + LMU | “mixed-precision (bf16)” | 同上;推理另报 A100 BF16 |
| AutoVLA | UCLA | “BFloat16 for parameters, gradients, and buffers” + FSDP | 权重/梯度/buffer = BF16★;优化器与 reduce 仍 † |
| CF-VLA | NVIDIA / UCLA / Stanford | “bfloat16” + “bfloat16 activations” | 激活 = BF16★ |
| DriveWAM | CUHK-Shenzhen + 滴滴 | GitHub:Precision = bfloat16 | 配置级 BF16;张量拆分未写 |
| Alpamayo | NVIDIA | HF:Tensor type BF16 | 仅权重存储/发布 = BF16★ |
| FlashDrive | UCSD Z Lab | 部署:VLM W4A8,action expert BF16 | 属推理混合精度 |
| EMMA | Waymo | 无 dtype 披露 | 全表空白 |
6. 产业侧补充(小米 / 百度 / 理想 / 特斯拉)
6.1 总览表
| 模型 / 体系 | 提出者所属机构 | 训练总精度(公开) | 权重 | 激活 | 计算 | 梯度 | 优化器 | 交换张量 | 证据强度 | 来源 |
|---|---|---|---|---|---|---|---|---|---|---|
| Xiaomi OneVL | 小米具身智能团队 | Table 9:Precision = BF16;AdamW;ZeRO-2 | BF16† | BF16† | BF16† | BF16† | AdamW;状态通常 FP32† | ZeRO-2 分片通信† | 高 | arXiv:2604.18486;训练仓 |
| OneVL 推理(非训练) | 同上 | — | 车端常见 FP16(第三方) | FP16 | FP16 | — | — | — | 中 | 介绍文 |
| Apollo ADFM | 百度 Apollo | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | Apollo 新闻 |
| Apollo 开源 BEV 工具链 | 百度 Apollo / 百舸 | 未见 BF16/FP8 明文 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 多卡 dist_train |
低 | Apollo-BEV-Train |
| 百度百舸 LoongForge FP8(GLM5,非智驾) | 百度智能云 | 通用 LLM:sft_glm5;--bf16 + FP8 E4M3 blockwise |
FP8 param-gather + 部分 FP32★ | FP8/BF16 混合† | FP8 GEMM★ | BF16/FP8† | exp-avg/exp-avg-sq=BF16★ |
FP8 gather + overlap reduce★ | 高(≠ADFM/≠VLA,仅作百度云 FP8 能力旁证) | sft_glm5_group_fp8.sh |
| MindVLA-o1 | 理想汽车基座模型团队 | GTC 发布:未披露 dtype | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 分布式 RL 提及,dtype 未写 | 低 | 央视网 |
| DriveVLM / Dual | 清华 IIIS + 理想汽车 | 论文未写 bf16/fp16 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | arXiv:2402.12289 |
| Tesla FSD 训练(软件) | Tesla | 未公开 FSD 配方 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | — |
| Tesla Dojo(硬件/格式) | Tesla | 支持 BF16、FP32、CFloat8、CFloat16;峰值 BF16/CFloat8 | CFloat8 可作权重存储★ | CFloat8 可作激活存储★ | 常扩到 BF16/FP32★ | CFloat8★;不足用 CFloat16★ | 未写 | Tile mesh;交换 dtype 未按张量公开 | 中高(硬件明确;软件未知) | Dojo PDF;Hot Chips 2021 |
6.2 各家要点
小米 OneVL(产业侧最可核验)
- 底座:Qwen3-VL-4B-Instruct;三阶段训练 + 双辅助解码器(语言 CoT + 视觉世界模型)。
- 论文 Table 9:各 Stage Precision = BF16,Optimizer = AdamW,Parallelism = Zero-2。★
- 权重/激活/计算/梯度未再拆开 → 按 BF16 混合精度 †。
- 推理侧第三方材料常见 FP16,与训练 BF16 区分看待。
百度 Apollo
- ADFM:产品与新闻完整,训练 dtype 未披露。
- 开源 BEV 工具链:偏感知训练/导出/部署,无 BF16/FP8 明文。
- 百舸 LoongForge:示例脚本为 GLM5 通用大模型 SFT 的 FP8(
examples/glm5/...),不是 VLA,也不能等同 Apollo ADFM;仅说明百度云训练栈具备 FP8 工程能力。
理想 MindVLA-o1 / DriveVLM
- MindVLA-o1:原生多模态 MoE、隐世界模型三阶段、闭环 RL、Orin/Thor 软硬件协同;无 bf16/fp8 字段。
- DriveVLM(清华+理想):Qwen-VL 微调;论文未写精度。
- 不可把“业界多为 BF16”写成理想已公开事实。
特斯拉 Dojo
| 张量(白皮书能力) | 数值类型 | 说明 |
|---|---|---|
| 权重/激活/梯度(存储) | CFloat8(可配 bias)★ | 降存储与带宽 |
| 计算 | 常扩到 BF16/FP32★ | CFloat8 可仅作 storage |
| 梯度(更高精度存储) | CFloat16 SHP/UHP★ | 避免大量回退 FP32 |
| 舍入 | stochastic rounding★ | 小梯度可累积更新 |
| 峰值算力口径 | BF16 或 CFloat8★ | D1 / Tile / ExaPod |
| 优化器状态 / FSD 每层配方 | 未公开 | 勿写成“FSD 全网 CFloat8 训练” |
特斯拉 CFloat8:一手链接与引用边界
公开材料是 Dojo 训练硬件 / 数值格式规范,不是「FSD 某层用 CFloat8 训练」的算法论文;场景为云端 Dojo 训练芯片,不是车端推理。
| 类型 | 链接 | 内容要点 |
|---|---|---|
| 格式白皮书(最完整)★ | Tesla Dojo Technology PDF | 定义 CFloat8_1_4_3 / CFloat8_1_5_2、可配置 6-bit bias、stochastic rounding;面向 weights / activations / gradients 的训练存储与带宽 |
| Hot Chips 2021 微架构 slides★ | HotChips_tesla_dojo_uarch.pdf | 节点支持 CFP8、storage CFP16;D1 峰值标 BF16/CFP8;CFP16 用于更高精度(如 gradients) |
| 专利(旁证) | US11227029 | Scalable matrix node engine with configurable data formats |
| 格式对照(第三方) | FPRox:8-bit FP taxonomy | CFloat8 与 OCP OFP8 / IEEE P3109 对照,非特斯拉论文 |
引用注意:文中 8-bit 常写作 CFloat8 / CFP8,16-bit 为 CFloat16 / CFP16。无 NeurIPS/CVPR 级「Tesla trains FSD with CFloat8」方法文;勿把硬件峰值或格式能力写成已公开的 FSD 每层训练 recipe。
7. 其他车企与供应商补充
本节覆盖华为、小鹏、蔚来、吉利/极氪、地平线、Momenta、元戎/长城、小马等。除小鹏外,多数未公开权重/激活/计算/梯度/优化器/交换张量的逐字段 dtype。
7.1 总览表
| 企业 / 方案 | 机构属性 | 智驾大模型叙述(公开) | 训练精度(公开) | 权重 | 激活 | 计算 | 梯度 | 优化器 | 交换 | 证据 | 来源 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 小鹏世界基座模型 / VLA | 小鹏汽车 | 云端 1B–72B VLA;Scaling Law;蒸馏上车;FSDP2 + FA3 | FP8 混合精度训练★ | FP8†(GEMM 侧) | FP8/BF16† | FP8† | FP8/BF16† | 未公开(通常 FP32)† | FSDP 2★;dtype 未写 | 高(官方 CVPR 披露) | 小鹏官网 CVPR |
| 华为乾崑 ADS 4/5(WEWA) | 华为智能汽车解决方案 | 云端世界引擎 + 车端世界行为模型;在线 RL;算力至约 60 EFLOPS | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | BitAuto ADS4;新浪 ADS5 |
| 蔚来 NWM / NADArch 2.0 | 蔚来 | 世界模型 NWM;多元自回归;NSim 仿真;群体智能闭环 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | 蔚来官网 NWM;ChinaEVHome WM2.0 |
| 吉利 WAM / 极氪千里浩瀚 | 吉利控股 / 极氪 / 千里科技 | 世界行为模型 WAM;跨域融合;宣称可调用约 23.5 EFLOPS | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | 36氪 WAM;极氪千里浩瀚 |
| 地平线 Journey J6 工具链 | 地平线(芯片/算法平台) | 一段式端到端量产叙事;工具链面向部署量化 | 非云端训练披露;部署:int8/int16/fp16 混合★ | 部署量化为主 | 部署 int8/16/fp16★ | 同上 | —(QAT 有) | — | — | 高(部署侧) | 平台差异;精度调优 |
| Momenta | Momenta | 端到端大模型;长短期记忆;强调 RL;数据飞轮 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | 腾讯新闻 Momenta;钛媒体 |
| 元戎启行 DeepRoute IO | 元戎启行(长城等客户) | 端到端;规划 Thor + VLA | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | 36氪 长城注资元戎 |
| 长城 / 毫末智行 | 长城汽车 / 毫末 | 自研 + 元戎双供应;HP 等产品线 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | 同上 |
| 小马智行 PonyWorld | 小马智行 | 世界模型 + RL「虚拟驾校」;Thor 域控营销含 FP4 TFLOPS | 训练 dtype 未公开;算力口径含 FP4(偏硬件峰值) | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低(训练)/ 中(硬件口径) | PonyWorld 2.0;网易 Thor |
| 文远知行 WeRide | 文远知行 | 一段式端到端量产叙事;Robotaxi | 未公开(勿与通用 LLM FP8 新闻混淆) | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 | 低 | 钛媒体 |
| 比亚迪 / 丰田 / 奔驰等 | 各自主机厂 | 多为合作供应商方案或传统辅助驾驶升级叙事 | 未检索到可引用的基模训练 dtype | — | — | — | — | — | — | 无 | — |
7.2 小鹏(产业侧第二个「训练低精」硬证据)
CVPR 2025 WAD 官方报道中,小鹏明确列出云端训练 GPU 优化手段:
- 使用 FSDP 2 实现模型分片 ★
- 使用 FP8 混合精度训练 ★
- 利用 Flash Attention 3 ★
- 自定义 Triton 内核 ★
同时披露:万卡集群、约 10 EFLOPS、SM utilization ~85%、云端基模 + 蒸馏上车、量化友好架构与图灵芯片协同。
| 张量 | 公开程度 | 备注 |
|---|---|---|
| 计算 / 权重(GEMM) | FP8 混合精度★ | 未说明 E4M3/E5M2、是否 Hybrid、是否白名单层 |
| 激活 / 梯度 / 优化器 / 交换 | 未拆开 | 按通用 FP8+BF16 配方 †:敏感层与 master/opt 常仍 BF16/FP32 |
| 车端 | Token 压缩、量化友好架构★ | 具体 INT8/FP8 位宽未在该文给出 |
意义:在「车企官方口径」中,小鹏是目前除特斯拉 Dojo 硬件白皮书外,少数直接承认云端用 FP8 训练的案例;但六元组仍不如开源论文可核验。
小鹏 FP8:一手链接与引用边界
目前没有单独的小鹏 FP8 技术论文(无 arXiv / 无 E4M3·E5M2、layer whitelist、与 BF16 对比曲线)。可核实来源如下。
| 类型 | 链接 | 说明 |
|---|---|---|
| 官网新闻(中文,★ 明确写 FP8) | xiaopeng.com/…/5478.html | CVPR WAD 分享纪要;GPU 侧写明 FSDP 2、FP8 混合精度、FA3、Triton |
| 英文新闻稿 | xpeng.com 英文稿 | 同一场演讲;偏活动/G7,不一定逐条写 FP8 |
| GlobeNewswire | 通稿 | 同上英文通稿 |
| WAD 日程 | cvpr2025.wad.vision | Xianming Liu,Scaling up Autonomous Driving via Large Foundation Models(约 4:30–5:00pm);公开 slides/录像未见单独发布 |
| 二手转载(对照用) | 智源社区;搜狐整理 | 内容与官网一致 |
勿混淆:后续 X-Mind / X-World 等论文或 PR(世界模型、Visual CoT、部署)不是上述「云端基座训练用 FP8」的原始出处。引用时应标注为 CVPR 2025 WAD 工业分享 + 公司新闻,而非 peer-reviewed 方法文。
7.3 华为 / 蔚来 / 吉利:架构与算力为主
| 企业 | 公开技术关键词 | 与低精训练的关系 |
|---|---|---|
| 华为 ADS 4/5 | WEWA / WEWA 2.0;世界引擎难例生成;Multi-agent 博弈;在线 RL;安全风险场 | 无 bf16/fp8 字段;只能确认大规模分布式训练存在 |
| 蔚来 NWM | 世界模型;0.1s 推演多轨迹;NSim;群体智能数据 | 无训练 dtype;勿把第三方科普文中的 bf16 当成蔚来官方 |
| 吉利 WAM / 极氪 | 世界行为模型;沃尔沃安全数据;23.5 EFLOPS 算力叙事 | 无训练 dtype;算力≠数值格式 |
7.4 地平线:部署量化谱系(≠云端基模训练)
地平线公开文档针对 Journey J6 上车部署:
| 平台 | 常见量化策略(部署)★ |
|---|---|
| J6E/M | int8 + int16 混合为主;少量 fp16 |
| J6H/P | int8 + int16 + fp16;可全局 fp16 起步再回退 int8/int16 |
| 敏感算子 | Sin/Cos 等可 fp32;GEMM/Conv 按敏感度升降 |
这与「云端 BF16/FP8 预训练」是不同阶段:地平线材料证明车端混合定点/半精推理成熟,不能据此推断其客户云端训练用 INT8。
7.5 Momenta / 元戎 / 小马等
- Momenta:端到端 + RL 叙事清晰,训练精度未公开。
- 元戎 / 长城:端到端量产与 Thor/VLA 路线,dtype 未公开。
- 小马 PonyWorld:RL 世界模型闭环;Thor 宣传中的 FP4 TFLOPS 是芯片峰值算力口径,不等于已公开「全网 FP4 训练」。
- 文远:端到端量产与 Robotaxi;检索未见可采信的训练 dtype(注意勿把通义千问等 LLM 的 FP8 新闻误挂到文远)。
7.6 产业侧「训练低精」披露对比(更新)
| 等级 | 企业 / 方案 | 内容 |
|---|---|---|
| A. 训练低精明确写出 | 小鹏(FP8 混合精度★);小米 OneVL(BF16★) | 可直接引用 |
| B. 硬件格式明确 | 特斯拉 Dojo(CFloat8/BF16/CFloat16★) | 软件配方仍未知 |
| C. 部署量化明确 | 地平线 J6(int8/int16/fp16★) | 非云端训练 |
| D. 仅架构/算力 | 华为、蔚来、吉利/极氪、理想、百度 ADFM、Momenta、元戎、小马、文远 | 六元组空白 |
8. FP8:通用 LLM 成熟,智驾训练滞后
| 维度 | 通用 LLM | 汽车智驾大模型(公开) |
|---|---|---|
| 训练默认 | Hopper+ 上 FP8 Hybrid 渐成选项 | 开源仍以 BF16 为主;小鹏官方承认云端 FP8 混合精度;多数车企未披露 |
| 吞吐收益 | 相对 BF16 约 +30–50% | 小鹏未公布相对 BF16 加速比;开源 AD 论文少作主实验 |
| 敏感层 | Linear 用 FP8;Norm/Embed/LM Head 回退 | 同理,且 Vision + Action 更保守;车端另有 int8/int16(地平线) |
| 主要障碍 | outlier、scale 同步 | 多模态误差级联、连续动作、小 batch;披露意愿低 |
参考:arXiv:2209.05433、Towards Fully FP8 GEMM LLM Training、TE docs
8.1 智驾侧「训练 8-bit」两家一手来源对照
| 小鹏 FP8 | 特斯拉 CFloat8 / CFP8 | |
|---|---|---|
| 性质 | 软件栈声明(Hopper 类 GPU + FSDP2 + FA3) | 自研 Dojo 硬件数值格式 |
| 证据形态 | 公司新闻转述 WAD 演讲;无独立 arXiv 方法文 | Dojo Technology PDF + Hot Chips slides;无 FSD 训练 recipe 论文 |
| 最稳引用 | 官网 5478 | Dojo PDF |
| 可写什么 | 云端 VLA 基座用 FP8 混合精度训练★ | 硬件支持权重/激活/梯度 CFloat8 存储、算力口径含 CFP8★ |
| 不可写什么 | E4M3/E5M2 Hybrid、敏感层白名单、相对 BF16 加速比 | 「FSD 全网已用 CFloat8 训练」或车端推理用 CFloat8 |
| 与 OCP FP8 | 未说明是否对齐 E4M3/E5M2 | 可配 bias,与固定 bias 的 OFP8 不等同(见 FPRox 对照) |
详见 §6「特斯拉 Dojo」、§7.2「小鹏」下的链接表。
9. 工程建议(基于公开证据)
- 训练基线:BF16 混合精度 + FP32 optimizer states(避免长训 Adam EMA 存 BF16)。
- FP8 训练:开源 AD 仍以 BF16 为主;小鹏已官方承认云端 FP8 混合精度,落地时需 Hopper+、TE/等价栈、敏感层白名单,并以 BF16 对齐评测。
- 推理优先模块拆分:Vision 高精 + LLM FP8/W4A8 + Action BF16;车端可参考地平线 int8/int16/fp16 混合量化谱系。
- 评测门禁:规划指标(L2 / ADE / PDMS / 碰撞率)与 BF16 基线对比。
- 对内汇报合规:★ only 可作事实;† 须标注推断;华为/蔚来/吉利等未披露项不得臆造。
10. 可采信排序(训练数值类型)
- 小米 OneVL(BF16★,超参表可核验)
- 小鹏世界基座(FP8 混合精度★,官方 CVPR;六元组未拆开)
- 开源学界 AutoVLA / CF-VLA / DriveVLA-W0 等(BF16★,部分六元组★/†)
- 特斯拉 Dojo 硬件格式(CFloat8/BF16/CFloat16★,FSD 软件未知)
- 地平线 J6 部署量化(int8/int16/fp16★,≠云端训练)
- 百度百舸 LoongForge FP8(脚本★:针对 GLM5 LLM,≠ ADFM、≠ VLA;仅旁证云栈能力)
- 华为 / 蔚来 / 吉利 / 理想 / Apollo ADFM / Momenta / 元戎 / 小马 / 文远 / FSD 软件(未公开)
11. 主要信息来源索引
| 36 | UniAD | https://github.com/OpenDriveLab/UniAD |
| 37 | UniAD 训练说明 | https://github.com/OpenDriveLab/UniAD/blob/v2.0/docs/TRAIN_EVAL.md |
| 38 | VADv2 | https://arxiv.org/html/2402.13243v2 |
| 39 | DriveTransformer | https://ar5iv.labs.arxiv.org/html/2503.07656 |
| 40 | 端到端架构差异(OFweek) | https://www.ofweek.com/ai/2025-05/ART-201700-8500-30662490.html |
| 41 | 端到端演进(腾讯) | https://news.qq.com/rain/a/20260323A03H4O00 |
| 42 | 地平线:E2E 是 VLA 基石 | https://www.21jingji.com/article/20251222/herald/be6d53d4e0ec78a99079818d5d6451c8.html |
| 43 | 博世一段式 + 文远 | https://chedongxi.com/p/350055.html |
| 44 | 地平线 VLA vs E2E 博客 | https://developer.horizon.auto/blog/13075 |
| 45 | 蔚小理端到端形态(36氪) | https://36kr.com/p/2913900674816649 |
12. 一句话总结
汽车智驾大模型 / 端到端当前是 “狭义一段式 E2E(亿级)靠 BF16/FP16 训 + INT8 车端;广义 VLA/世界模型进 LLM 量级后才上 FP8(小鹏★)与 Dojo CFloat8(硬件★);E2E 是基石、VLA 是增强;多数车企仍不披露六元组”——分析低精时务必先分清模型代际,避免把部署量化或芯片峰值直接写成云端训练配方。
本文档由会话分析整理生成,引用以公开网页/论文为准;† 标注内容仅为工程惯例推断,引用时请注明。小鹏 FP8 / 特斯拉 CFloat8 一手链接与「可写/不可写」边界见 §6、§7.2、§8.1。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)