Paper · CVPR 2026 · arXiv v2

25.5 DriveMoE:面向端到端自动驾驶 VLA 的混合专家模型

DriveMoE 在 PaliGemma + flow matching 的 Drive-π0 基线上加入两个稀疏路由器:Vision MoE 先选出当前最相关的额外相机,Action MoE 再按整条轨迹选择驾驶技能专家。它在 Bench2Drive 闭环评测中达到 74.22 DS / 48.64% SR,但“MoE 缓解模式平均并提升长尾能力”仍是系统级证据,不是完全隔离的机制证明。

作者:Zhenjie Yang、Yilin Chai、Xiaosong Jia、Qifeng Li、Yuqian Shao、Xuekai Zhu、Haisheng Su、Junchi Yan · Shanghai Jiao Tong University / Fudan University / AnyScale AI · CVPR 2026 · arXiv:2505.16278v2(2026-05-18;首次提交 2025-05-22) · 阅读日期:2026-07-30 · 摘要页 · PDF · 项目页

1. 执行摘要

一句话判断:这是一篇结构直观、闭环结果强、工程上有启发的 VLA 驾驶论文;它最可信的结论是“带显式场景监督的动态视角选择 + 轨迹级专家路由”能显著强化 Drive-π0,而不是“稀疏 MoE 已被严格证明解决了驾驶多模态和长尾问题”。
  1. 问题。多相机、多时刻图像让 VLA token 数量和算力迅速增长;统一动作头又容易被高频直行样本主导,稀释并线、超车、急刹等稀有行为(第 1、2.2 节)。
  2. 基线。Drive-π0 把具身模型 π0 迁移到驾驶:PaliGemma 处理连续两帧前视图、固定文本 prompt 和车辆状态,flow-matching action model 输出 10 个未来 waypoint(第 2.1 节、附录 6-7)。
  3. Vision MoE。轻量 router 根据前视 embedding 与 route planner 给出的目标 waypoint,在昂贵视觉 backbone 之前 Top-1 选择一个额外相机;训练标签由未来轨迹、包围框和地图规则生成(第 2.3 节、式 1-2、附录 9)。
  4. Action MoE。flow-matching decoder 的 FFN 被共享专家与技能专家替换;默认方案先对整条 token 序列求平均,再 Top-3 激活 1 个共享专家和 6 个非共享专家中的子集,并用场景技能标签监督 router(第 2.4 节、式 3-6、附录 7)。
  5. 主要结果。Bench2Drive 220 条路线、三次运行平均下,trajectory-level DriveMoE 得到 74.22 DS / 48.64% SR,高于 Drive-π0 的 55.85 / 30.00,也高于表中 Raw2Drive 的 71.36 / 50.24(DS 更高、SR 略低;表 2)。
  6. 证据边界。DriveMoE 相比基线同时改变了输入视角、监督信号、模型参数和训练成本;论文没有同参数 dense FFN、随机/启发式 camera selector、长尾重采样或 skill-conditioned dense head 等关键对照,因而无法把全部增益归于 MoE 稀疏专家机制。

DriveMoE 总体框架与 Vision MoE

原文图 2-3:固定输入是两帧前视图,Vision router 在其余相机中动态选择一个视角;视觉 token、prompt 和车辆状态进入 PaliGemma 与 Action MoE,最终由 PID 执行预测轨迹。

2. 问题与建模假设

作者把端到端驾驶 VLA 的瓶颈拆成“看什么”和“怎么行动”两个路由问题。前者假设在多数时刻只有少数相机真正影响决策,因此可以在视觉编码之前按整幅图像选择视角;后者假设驾驶轨迹可以按有限技能分组,专家隔离能减轻高频行为对稀有行为的梯度干扰。

这两个假设都带有人类先验。Vision router 不仅看前视特征,还接收 route planner 的未来目标点;Action router 的监督来自 Bench2Drive 场景到五类技能的人工映射,另加 ParkingExit 专家。于是 DriveMoE 并非从纯视觉中无监督发现视角和技能,而是把地图、路线与 benchmark taxonomy 编入学习过程。

3. 方法与数据流

3.1 Drive-π0 基线

输入包含连续两帧前视图、固定 prompt(如 “Please predict future trajectory”)以及当前和历史位置、速度、加速度、航向。预训练 Paligemma-3b-pt-224 提供视觉语言 backbone;动作模块用 conditional flow matching 从噪声动作向真实轨迹学习速度场,预测 10 个 waypoint。PID 以第 7 个点计算目标速度、第 10 个点计算转向。

A^τ = τA + (1-τ)ε,网络学习 vθ(A^τ,o) ≈ ε-A(附录式 7)。自然语言解释:给真实轨迹逐步混入噪声,模型学习把当前噪声状态沿正确方向推回目标轨迹;推理时从噪声积分得到连续轨迹分布。

3.2 Scene-Specialized Vision MoE

router 用前视 embedding 与目标 waypoint 对 N 个相机输出概率,Top-1 相机才进入昂贵视觉编码;每个视角另有可学习位置 embedding。交叉熵监督来自规则标签:路口转弯选出口方向相机,变道选相应侧后/侧前相机,并线选汇入侧相机,避让紧急车辆选来车方向相机;无关键视角时默认后视(第 2.3 节、附录 9)。

这种设计真正减少的是“相对于全部六视角”的计算,而非相对于两前视基线:附录表 10 中,DriveMoE 为 3896 GFLOPs / 260 ms,Drive-π0 两视角为 3400 GFLOPs / 240 ms,六视角版本才是 7576 GFLOPs / 700 ms。

3.3 Skill-Specialized Action MoE

作者比较两种粒度:token-level router 允许不同时间步选不同专家;trajectory-level router 先平均整条 token 序列,再为整条轨迹选择专家。后者与“一个场景对应一种驾驶技能”的标签结构更一致,最终结果也更好(表 5:73.88/48.64 对 65.62/32.27)。

默认配置为 1 个共享专家、6 个非共享专家、Top-3 激活。损失由 flow matching 和 action-router 交叉熵组成;router 训练时加噪以降低 expert collapse 风险。两阶段训练先 teacher-forcing 使用真实专家标签 12 epochs,再使用 router 自己的预测选择视角与专家 6 epochs(第 2.5 节、附录 7)。

4. 实验与证据

Bench2Drive 主结果和 Vision MoE 消融

原文表 2-3:DriveMoE 在闭环 DS 上领先所列方法;动态选择一个额外视角比固定堆叠多视角更有效,但额外监督、视角数量和路由机制的贡献并未完全解耦。

4.1 Bench2Drive 主结果

方法 DS ↑ SR ↑ Efficiency ↑ Comfort ↑ Avg. L2 ↓
DriveTrans 63.46 35.01 100.64 20.78 0.62
DiffAD 67.92 38.64 1.55
Raw2Drive 71.36 50.24 214.17 22.42
Drive-π0 55.85 30.00 173.63 35.70 1.13
DriveMoE (token) 66.94 35.45 158.80 6.86 0.96
DriveMoE (trajectory) 74.22 48.64 175.96 15.31 1.01

来源:表 2,官方 220 routes,三次运行均值。DS 是 Route Completion 与 Infraction Score 的乘积;SR 是无违规且限时完成的路线比例。表中 Comfort 数值方向与常见“越高越好”直觉不一致,但论文表头标为 ↑ 且未给出足够定义,无法从当前证据确认 6.86 与 15.31 的可比含义。

相对 Drive-π0,DriveMoE 的 DS 增加 18.37 个绝对点(作者报告相对提升约 22.8%),SR 增加 18.64 个百分点(相对约 62.1%)。五类能力均值从 33.37 升至 47.91,其中急刹从 45.00 升至 65.45、交通标志从 38.95 升至 59.44(表 1)。这些结果支持“系统改善复杂场景”,但各类样本数、方差和逐场景失败分布没有报告。

4.2 消融与效率

  • 动态视角确实重要:两帧前视基线为 55.85/30.00;增加固定后视为 63.26/31.82;无显式监督的动态视角为 69.71/44.09;带监督达到 74.22/48.64(表 3)。
  • 两个模块互补:去掉 Vision MoE 为 68.68/42.45,去掉 Action MoE 为 67.31/40.56,完整模型为 74.22/48.64(表 7)。
  • 技能监督有效:6 个非共享专家无监督为 70.38/45.00,有监督为 74.22/48.64;但这同时说明收益依赖 benchmark 场景标签,而非纯粹自组织专家(表 6)。
  • 专家不是越多越好:6、13、44 个非共享专家分别得到 DS 74.22、70.88、68.22;作者归因于负载不平衡,但未展示 expert usage、load-balancing loss 或梯度冲突数据(表 6)。
  • 路由准确率有限:Vision router 为 88.85%,Action router 仅 65.40%;论文没有按路由正确/错误分组闭环表现,也没有给出安全关键误路由的代价(表 4)。
  • 成本:参数从 2606M 增至 3008M;相对两视角 Drive-π0,FLOPs 从 3400G 增至 3896G、延迟从 240 ms 增至 260 ms。论文表 3 又给基线 100 ms,两个延迟表口径明显不一致,原文未解释清楚。

4.3 nuScenes 补充实验

在真实采集的 nuScenes 上仅做 open-loop:DriveMoE 平均 L2 0.74 m、碰撞率 0.17%,优于 Drive-π0 的 0.78 m / 0.24%,接近 UniAD 的 0.76 m / 0.17%(表 9)。作者也承认 open-loop 不能代表真实驾驶表现,因此这只能支持轨迹拟合迁移,不能支持真实世界闭环泛化。

5. 主张与证据边界

主张 类型 定位 证据 支持强度
DriveMoE 在 Bench2Drive 取得强闭环性能 作者主张 表 1-2 220 routes,三次运行均值,多基线对比
动态选择相机优于固定堆叠视角 作者主张 表 3 固定 2-6 视角与动态 Top-1 消融 中高
Action MoE 缓解模式平均并改善稀有技能 作者主张 表 1、5-7 技能分数、模块移除、router 粒度比较 中:缺同容量 dense/重采样对照
方法显著提升计算效率 作者主张 表 3、10 明显优于六视角输入 中:相对两视角基线更慢且延迟口径冲突
对真实世界场景具有强泛化 作者主张 表 9 nuScenes open-loop L2/碰撞率 低:没有真实世界闭环
性能增益全部来自 MoE 不受支持的推断 表 3、6、10 同时增加视角、标签、参数与成本

5.1 实验到结论

实验 检验的主张 是否充分 缺失控制/证据
Bench2Drive 220 routes 闭环系统性能 较充分 标准差、显著性、逐路线失败
固定/动态相机消融 视角选择有效 部分充分 随机选择、规则 selector、等算力 token pruning
去 Vision/Action MoE 两个模块分别有贡献 部分充分 同参数 dense head、同输入和标签的非 MoE 对照
技能级能力表 改善长尾行为 部分充分 技能频次、置信区间、尾部风险和 class-balanced baseline
nuScenes open-loop 现实数据泛化 不足 closed-loop、控制执行、分布漂移

6. 局限与复现风险

  • 监督依赖较强。Vision 标签来自未来轨迹、地图和包围框,Action 标签来自场景 taxonomy;线上只用 router,但训练依赖结构化标注与 route planner。
  • 公平归因不足。完整模型比 Drive-π0 多约 402M 参数,并处理额外相机。没有同参数 dense 模型,因此“专家分工”与“更大容量”的作用未解耦。
  • 长尾证据不完整。论文按五类能力报告均值,却没有各类路线数、置信区间和最坏场景。Give Way 只有两个场景族,其 40% 结果尤其可能不稳定。
  • 路由错误缺少安全分析。Action router 准确率 65.40%,但错误路由是否造成碰撞、是否由共享专家兜底、Top-3 如何分配都没有单独报告。
  • “模式平均”未直接测量。没有轨迹多样性、mode coverage、专家互信息、专家特征可视化或与 mixture-density/dense flow head 的比较。
  • 仿真到现实仍有缺口。闭环结果仅来自 CARLA Bench2Drive;nuScenes 只做 open-loop。PID、感知噪声、真实延迟和硬件闭环均未验证。
  • 复现信息尚有歧义。正文 token-level 描述为 Top-1/Top-2,附录默认实现写 Top-3;表 3 与表 10 的延迟也不一致。代码和模型在摘要中写“将发布”,本次未进一步审计项目仓库的可用状态。

材料状态:本笔记基于 16 页 arXiv v2 全文与补充材料。训练设置、专家数量、PID 参数和标签规则可见,但缺少随机种子方差、逐场景结果、真实车闭环和完整硬件测量口径。

7. 工程与研究启发

7.1 工程层面

  • 在多相机 VLA 中,先做 image-level gating 再进视觉 backbone,能真正跳过未选视角;这比 backbone 后 token pruning 更早节省算力,但必须为路由器保留足够便宜且可靠的上下文。
  • 轨迹级 router 与驾驶技能标签天然对齐,也比逐 waypoint 路由稳定;如果控制目标存在快速阶段切换,则可考虑分段路由,而非完全 token-level 或整轨迹单标签。
  • teacher-forcing 到自主路由的两阶段训练能缓和 train-inference mismatch,但上线前应注入系统性的路由错误并测故障退化,而不只是随机噪声。
  • 专家数需要匹配数据量。小规模 Bench2Drive base set 只有 950 个训练 clips,44 个场景专家明显过细;共享专家和负载约束应与每类有效样本数共同设计。

7.2 研究层面

  • 最关键的对照是固定 PaliGemma、输入视角、参数量、训练时长和技能标签,只比较 dense FFN、skill-conditioned FFN 与 sparse MoE。
  • Vision MoE 应加入 random Top-1、oracle Top-1、纯规则 Top-1 和 learned unsupervised Top-1,才能测出监督 router 的上限、学习增益与标签成本。
  • 要证明长尾改善,应按技能频率绘制收益,报告 per-scenario success、CVaR/最坏分位数,并与重采样、reweighting、focal loss 和独立技能 head 比较。
  • 专家专门化需要可观测证据:router confusion matrix、expert utilization、不同技能的激活互信息、梯度相似度,以及移除某专家后的定向退化。

8. 阅读地图

  • 架构前置:π0 提供 flow-matching VLA 动作生成范式,PaliGemma 提供 3B 视觉语言 backbone;理解这两者能分清 DriveMoE 的新模块与继承部分。
  • 驾驶评测:Bench2Drive 定义 220 条 closed-loop corner-case 路线及五类能力,是本文主要证据来源;阅读其指标定义有助于解释 DS、SR、Efficiency 和 Comfort。
  • 直接对照:DriveTrans、DiffAD、Raw2Drive 是主表中较强基线;需核对它们的输入模态、预训练、参数量和是否使用额外监督,才能做严格横向判断。
  • 推荐后续:优先审计公开代码中的 Top-K 实现、router 标签生成、表 3/10 延迟脚本与三次运行日志;再做同容量 dense baseline 和路由错误压力测试。

9. My Thoughts

My Summary

MoE 分类强依赖于人工定义。

AI 整理:这个判断抓住了 DriveMoE 的关键边界。Vision MoE 的相机类别由基于未来轨迹、地图和包围框的人工规则监督;Action MoE 的技能类别则直接沿用 Bench2Drive 的场景 taxonomy,并额外加入 ParkingExit 专家。因此,论文展示的“专家专门化”更接近人工先验指导下的条件路由,而不是模型从数据中自主发现稳定、可迁移的驾驶技能。它的效果可能同时来自类别划分本身、额外监督和专家容量,不能仅归因于 MoE。

2026-08-03 · 用户原始总结

MoE分类强依赖于人工定义

10. 来源与参考

  1. DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving(arXiv v2,2026-05-18;CVPR 2026)。
  2. 论文 PDF(正文与补充材料;本笔记配图裁自原文图 2-3、表 2-3)。
  3. DriveMoE project page(论文给出的项目页;本次未审计代码与 checkpoint 的完整可复现性)。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐