轻量化修正长尾场景

目录

01    整套框架两大核心阶段

1.1 离线阶段:批量挖掘失效场景,构建结构化潜记忆库

1.2 在线推理:检索相似失败案例,解耦LoRA实时修正

2.2 在线推理:检索相似失败案例,解耦LoRA实时修正

02    实验数据

2.1 主基准定量结果

2.2 消融实验,验证各模块必要性

2.3 推理效率实测(单H20显卡)

03    总结


当前端到端 VLA 自动驾驶模型普遍存在一个硬伤:遇到曾经规划失误的同类场景会重复犯错,无法复用过往失败经验,面对道路拓扑变化、周边车辆动态变化时泛化能力薄弱。

中科院自动化所联合长安科技推出 DriveVLA-M0,提出一套失败感知潜记忆 + 解耦 LoRA 测试时训练(TTT)的 VLA 框架:

不改动主干 VLM 模型,仅在推理阶段调取历史失效案例做针对性轨迹修正,在NAVSIM两套仿真基准达成同期SOTA。推理阶段TTT反向传播仅增加26.44ms延迟,内存扩容还能零训练持续提升规划效果,记忆库扩容还能零训练持续涨点——为长尾危险路口、匝道等失效场景提供轻量化优化方案,代码已开源。

01    整套框架两大核心阶段

整套工作拆分为离线记忆生成、在线推理+TTT微调两大流程,全程冻结InternVL3 VLM主干,仅改造检索模块与动作解码器,改动范围极小,工程移植门槛低。

图| DriveVLA-M0完整两阶段总览图

1.1 离线阶段:批量挖掘失效场景,构建结构化潜记忆库

对应图上方[M]模块,核心目标筛选所有模型规划失败样本,并拆分道路、车辆双维度特征存入记忆池。

图| 离线记忆生成阶段:通过仿真打分筛选基础模型失效场景,将场景中间特征存入潜记忆库 M

1. 失效场景判定规则

基础模型在仿真中输出轨迹后,通过PDM打分器评估规划质量,综合碰撞风险、车道合规、通行效率多维度打分,分数低于阈值β=0.5的样本直接判定为失败案例,排除正常行驶样本,只留存有修正价值的数据。

2. 解耦双分支特征提取(检索模型核心创新)

设计基于LoRA微调DINOv2的专用检索模型,并行输出两类独立嵌入特征:

  • 地图嵌入(Map Embed):聚焦静态道路边界、车道线、路口拓扑;
  • 智能体嵌入(Agent Embed):捕捉前车、行人等动态障碍物位置、运动趋势。

训练时用占据网格(Occupancy Grid)监督,分别预测道路、车辆栅格,损失由两部分二分类交叉熵加权组成,天然实现静态、动态信息解耦,规避传统单特征检索混淆道路与车流的问题。

3. 记忆单元存储结构

每条记忆条目包含三类数据:检索键(地图+Agent双嵌入)、解码器中间特征、专家标准轨迹+打分标签,后续推理可分别调取道路/车流两类相似失败案例,分开优化规划头,不会互相干扰。同时内置去重机制,相似度过高样本自动过滤,控制内存体积。

1.2 在线推理:检索相似失败案例,解耦LoRA实时修正

对应图下方[I]模块,也是这套方案最具工程价值的部分,不需要预微调、不需要重训主干,仅推理时按需激活轻量化TTT:

2.2 在线推理:检索相似失败案例,解耦LoRA实时修正

对应图下方[I]模块,也是这套方案最具工程价值的部分,不需要预微调、不需要重训主干,仅推理时按需激活轻量化TTT:

图| 带 TTT 的在线推理阶段:推理时基于当前场景特征检索记忆库相似样本,采用解耦 LoRA 微调动作解码器;地图特征检索样本优化静态地图 LoRA 分支,车辆智能体样本优化动态 LoRA 分支,实现针对性规划修正

1. 相似度触发开关(Trigger)

当前画面输入检索模型,同步输出地图、Agent特征,和记忆库做余弦相似度匹配,仅当相似度高于λ=0.9才启动TTT微调;匹配为空则直接输出原始轨迹,无额外耗时,正常直道场景不会产生冗余计算。

2. 双分支解耦LoRA微调逻辑

两套独立LoRA分支完全分开优化:

图| 检索模型整体网络架构

  • 地图LoRA:调取道路结构相似失败样本,优化车道保持、可行驶区域合规相关打分项;
  • 智能体LoRA:调取车流交互相似失败样本,优化碰撞时间(TTC)、跟车安全相关打分项。

动作解码器分为轨迹头、打分头,微调仅作用于解码器,VLM大模型全程冻结,反向传播延迟仅26.44ms,单帧完整推理总耗时可控。

3. 轨迹融合输出

两条LoRA分支独立输出各安全维度分数,静态道路约束取地图分支结果,动态防撞约束取Agent分支结果,融合后筛选综合得分最高的轨迹作为最终输出。

图| TTT 注入前后轨迹分布可视化。上图:未注入记忆修正的原始模型输出;下图:记忆 TTT 修正后输出。红色轨迹为模型高概率候选路线,绿色为人类专家标准轨迹;右侧打分密度图右移代表轨迹整体质量提升

图直观展示优化效果:TTT注入前红色高风险轨迹占比极高,打分分布整体偏低;注入后绿色专家轨迹成为主流,分数分布整体右移,大幅降低压线、冲出道路等失效概率。

02    实验数据

实验基于NAVSIMv1、NAVSIMv2两大自动驾驶仿真基准,前者为开环简单道路,后者是双阶段闭环复杂路况(多红绿灯、多车道、连续转弯),指标不盲目吹捧刷榜,客观分析数据边界。

2.1 主基准定量结果

图| Navtest(NAVSIMv1)各方案PDMS对比表

图| Navhard(NAVSIMv2)EPDMS对比表

Navtest(NAVSIMv1):基础版 DriveVLA-M0-Base 取得 92.3 PDMS;将记忆池从 4000 条扩容到 10000 条后(DriveVLA-M0-Scale),直接涨到 94.1,超过此前最优的 DriveSuprim(93.5)0.6 分,登顶 SOTA。值得注意的是这 1.8 分提升全部来自记忆扩容、零额外训练,其中碰撞时间(TTC)单项提升 3.5,安全裕度改善最明显。

Navhard(NAVSIMv2):这套更贴近真实城市路况的伪闭环仿真新增红绿灯、逆行、车道偏离惩罚,行业多数方法在此指标大幅缩水(DriveSuprim 44.7、Mimir 34.6、GoalFlow 28.7),DriveVLA-M0 达到 47.0,领先第二名 GTRS-Dense(45.3)1.7 分,失效场景记忆修正的价值在难例集上体现得更充分。

指标局限:PDMS/EPDMS 均为仿真内打分,仿真动态车辆行为简化,真实道路突发行人、非机动车场景的提升效果无法完全等效;仅衡量单步规划,长时序连续决策的稳定性未做长期闭环验证。

2.2 消融实验,验证各模块必要性

图| 检索策略消融对比表

检索策略消融给出了全文最有说服力的证据:

用语言特征做检索,分数(90.7)反而低于完全不用记忆的基线(91.0)——语义相似的画面对驾驶结构匹配毫无价值,甚至会引入误导样本;仅地图特征 91.7,仅能优化静态道路;解耦双特征检索(Map + Agent)达 92.3,比基线高 1.3。驾驶场景检索必须拆道路、动态车辆双特征,这不是锦上添花,是方向对错问题。

图| 知识注入方式消

注入方式消融则揭示落地关键取舍:

离线后训练仅涨 0.2 分(91.0→91.2),存在分布不匹配;TTT 全量微调 92.4、TTT LoRA 92.3,LoRA 只牺牲 0.1 分,反向传播耗时却从 55.42ms 降到 26.44ms、省近一半,更适配车载低算力芯片。

2.3 推理效率实测(单H20显卡)

检索耗时15.19ms,主干前向传播30.79ms,LoRA反向仅26.44ms;整套激活TTT流程总耗时72ms左右,不触发微调时仅45ms,满足车载实时规划帧率要求。

图| 推理延迟分解,含 Retrieve 15.19 / Forward 30.79 / Backward-LoRA 26.44 / Backward-Full 55.42 四行)

03    总结

DriveVLA-M0跳出传统VLA“单次推理无历史经验”的固有框架,把人类驾驶“记住过往失误规避同类危险”的认知逻辑移植到自动驾驶模型,核心创新是道路/动态车辆解耦检索记忆+推理时解耦LoRA轻量化修正

整套方案兼容现有主流VLM主干,改动极小、算力开销可控,在仿真基准实现明显精度提升,还支持无训练扩容优化。

从行业角度看,该工作给纯视觉端到端自动驾驶提供了低成本迭代新思路:不用频繁重训大模型,依靠积累失效案例的记忆库,在推理阶段动态修正长尾危险场景。但仿真验证的局限性决定,该方案距离量产上车还需要实车大规模闭环测试,解决真实路况失效判定、车载算力适配两大工程问题。

Ref

论文标题:DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving

论文链接:https://arxiv.org/pdf/2608.10413 

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐