比亚迪首篇VLA+世界模型论文:补齐端到端最大短板

「恶劣路况规划能力大幅跃升」
目录
做端到端智驾的人都知道:像素世界模型细节好但雨雾天一跑就偏,潜态世界模型抗噪好但精细场景退化。
两条路线只能选一个,选哪个都有量产落地时的硬伤。
比亚迪新技术研究院团队推出HyWorldVLA混合VLA框架,首次用两段式训练把两种路线优势整合进一套模型,不用二选一。

两段式训练,预训练时像素+潜态双监督把潜空间"喂饱",微调时只跑潜态推理自动获得对雨雾光照的免疫力。
NAVSIM v1/v2超越DriveVLA-W0等一众SOTA,655例雨雾测试集上PDMS 86.87 vs DriveVLA-W0 61.18,提升超42%。
这篇工作的真正价值不是又刷了一个仿真高分,而是第一次系统性回答了"世界模型在坏天气下到底还能不能用"。

图 | 三类世界建模范式对比图
01 HyWorldVLA完整技术架构拆解
整套框架分为视频VAE预训练、模型预训练、联合微调三大流程,搭配语言引导可学习查询Token动作专家三大配套模块,全程基于Emu3多模态大模型作为主干。

图 | HyWorldVLA完整架构总览图
1.1 文本引导视频VAE:统一图像压缩与重建底座
框架底层依靠带文本交叉注意力的视频变分自编码器完成图像编解码:
1.空间编码器完成8倍下采样提取空间特征,轻量时序编码器做4倍时序压缩,去除帧间冗余信息,输出紧凑潜特征;
2.编码块内嵌入Flan-T5文本交叉注意力,输入驾驶场景文字描述,抑制画面拖影边缘模糊时序闪烁,大幅提升重建画面真实度;
3.训练损失,融合重建(
、
)对抗KL正则三项损失,保证压缩后的潜特征保留驾驶关键语义。
这个VAE相当于“图像翻译器”,既能还原高清路面画面,又能产出干净带语义信息的隐向量,是混合建模的基础载体。
1.2 预训练阶段:像素+潜特征双重监督(核心创新)
这一阶段是HyWorldVLA区别于所有基线的关键,同步执行两项预测任务,双向约束模型表征学习:
-
多模态离散化:图像用VQ量化动作序列用FAST工具离散导航指令用Emu3分词器,统一离散Token输入序列;
-
引入可学习查询
,作为潜特征预测载体,输入MLP网络输出未来视频潜向量
;
-
双损失约束训练目标:

损失分为语言预测(、
)、动作预测、像素视觉Token预测、潜特征对齐四项。
控制像素重建权重,
约束潜向量和真实编码对齐。消融实验证明
为最优组合:像素监督充当正则项,防止潜表征坍塌,潜特征学习过滤无关像素噪声,一举两得。
1.3 联合微调阶段:仅保留潜特征推理,适配实车部署
预训练完成后,模型不再重建完整像素画面,仅输出预测潜特征送入动作专家模块生成轨迹:
1. 历史图像导航指令预测潜特征通过共享注意力层交互,提取全局驾驶上下文;
2. 支持两类动作专家:流匹配生成模型轨迹选择模型,分别对应不同损失函数;
a. 流匹配:
b. 轨迹筛选:
3. 消融显示平衡潜特征约束强度,权重过高会限制动作灵活性,过低丢失环境先验。
简单区分两阶段分工:预训练是“打基础”,用像素细节校准潜空间;微调是“上路跑”,只用抗噪潜特征做规划,兼顾精度与部署效率。
1.4 配套辅助机制
语言引导:场景描述文本嵌入交叉注意力,让模型优先关注车道障碍物红绿灯等规划相关语义,过滤天空建筑等无关背景;
- 潜条件动作专家:动作生成全程绑定预测潜特征,给轨迹输出提供环境前瞻先验,避免短期视野带来急刹压线等错误决策。
- 潜条件动作专家:动作生成全程绑定预测潜特征,给轨迹输出提供环境前瞻先验,避免短期视野带来急刹压线等错误决策。
02 实验表现
实验分为基准综合性能、模块消融、恶劣场景鲁棒性三部分,客观区分纸面指标与真实落地价值。
2.1 NAVSIM基准综合横向对比
NAVSIM v1核心指标PDMSv2扩展指标EPDMS用来综合衡量碰撞风险车道合规通行效率乘坐舒适性。
1. NAVSIM v1:HyWorldVLA PDMS得分90.59,超越DriveVLA-W0(90.2)CoWorld-VLA(89.8)等像素SOTA,同时大幅领先纯潜态模型OneVL(88.8);单目相机输入条件下,通行效率EP指标全场最高,代表车辆不会过度保守减速;

图 | NAVSIM v1基准性能表
2. NAVSIM v2:扩展场景EPDMS达到89.71,在车道保持红绿灯合规长时间舒适性新增维度保持领先。

图 | NAVSIM v2基准性能表
2.2 模块消融:验证每部分不可替代性

图 | 组件消融实验结果
- 去掉像素监督(纯潜模型):PDMS暴跌至87.5,证明像素锚点是潜空间不退化的关键;
- 去掉潜特征预测(纯像素模型):得分降至89.91,恶劣环境稳定性直接失效;
- 移除语言引导动作潜条件微调潜监督任意一项,性能均出现明显下滑,整套混合架构不存在冗余模块。
损失权重消融同样验证设计合理性:预训练超过
,
超过
,微调
大于$0.1$都会出现性能衰减,参数区间贴合实车场景需求。
2.3 业内首个自动驾驶世界模型噪声鲁棒性完整评测

图 | 光照雨雾噪声轨迹对比图
论文构建655例雨雾逆光画面模糊测试集,横向对比主流像素基线:

图 | NAVSIM 基准下各方法场景噪声鲁棒性对比
1. 量化数据:HyWorldVLA恶劣场景PDMS 86.87,DriveVLA-W0仅61.18WoTE低至60.65;去掉潜监督的消融版本仅73.18,直接证明混合建模是抗噪核心来源;
2. 定性可视化:
a. 光照波动:纯像素基线明暗切换后轨迹大幅偏移,HyWorldVLA行驶路线保持稳定;
b. 雨雾遮挡:DriveVLA出现过度减速原地缓行,本文模型维持合理车速,贴合人类驾驶习惯;

图 | 未来画面生成效果图
额外可视化验证像素重建能力:单目摄像头视野受限的右转路口,模型能预测画面外车道线;会车场景精准预判校车行驶轨迹,证明像素分支保留精细时空推理能力。
2.4 模型现存失效场景(客观短板)
论文公开两类典型失败案例:

图 | 模型失效案例图
- 微小目标识别不足:排队车辆刹车灯小型路桩等像素占比极低的物体容易漏检,误判前车正常行驶;
- 单目视野局限:左转右转弯道缺少侧向视野,无法预判横向来车,容易压线,未来需要搭配环视多相机方案优化。
03 智驾VLA的三条主线
当前自动驾驶VLA世界模型分三条主流路线:
- 纯像素路线(DriveVLA-W0FSDrive):细节强抗噪弱,适合仿真测试,量产车环境适应性不足;
- 纯潜态路线(Latent-WAMOneVL):推理快恶劣场景稳,但细节丢失,复杂路口规划容易出错;
- 混合双监督路线(本文HyWorldVLA):预训练融合两者优势,推理阶段轻量化仅用潜特征,是唯一兼顾精度与落地稳定性的单目VLA方案。
同类混合架构目前极少,比亚迪这套方案填补“像素细节+潜态鲁棒”的中间空白,相比多激光融合方案硬件成本更低,仅依靠前视单相机就能实现均衡表现,对量产车型成本控制更友好。
同时,论文搭建的噪声鲁棒评测数据集,给后续世界模型研发提供统一量化标准,解决行业此前只看仿真高分忽略真实恶劣路况的评测盲区。
04 总结
HyWorldVLA跳出像素潜态二选一的行业固有思维,用分阶段双监督混合世界建模打通两类路线优势。预训练阶段像素重建校准潜表征,规避表征退化;推理阶段仅使用抗噪潜特征生成轨迹,适配车载实时部署。
除基准榜单刷新外,该工作最大贡献是建立了自动驾驶世界模型噪声鲁棒性标准化评测体系,补齐以往研究只看重仿真纸面分数忽略真实行车恶劣环境的短板。
从量产视角看,这套单目混合VLA方案给低成本智驾车型提供均衡可行的端到端规划路线;后续拓展多传感器融合多环视输入后,有机会进一步解决弯道视野远距离障碍物识别等现存缺陷,成为全场景端到端智驾的核心底座方案。
Ref
论文标题:HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
论文链接:https://arxiv.org/pdf/2607.20988
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)