本推文介绍计算机视觉顶级会议CVPR 2026收录的一篇论文《Think Before You Drive:World Model-Inspired Multimodal Grounding for Autonomous Vehicles》。当乘客说“跟随斑马线后的那辆白色SUV”时,自动驾驶系统不能只做一次静态识别,它还要判断哪辆车更近、谁会进入盲区,以及场景下一刻可能怎样演化。来自澳门大学等机构的研究提出ThinkDeeper,将世界模型引入自动驾驶视觉定位(visual grounding),模型先把当前道路场景压缩为与指令相关的状态,再向前推演一串未来潜状态,最后结合视觉、语言与深度线索定位目标。论文同时发布多源数据集DrivePilot,用于检验复杂真实交通环境中的指令理解与目标定位能力。

论文链接:

https://openaccess.thecvf.com/content/CVPR2026/html/Liao_Think_Before_You_Drive_World_Model-Inspired_Multimodal_Grounding_CVPR_2026_paper.html

本推文由龚裕涛撰写,审核为王一鸣和黄忠祥

一、研究背景和主要贡献

自动驾驶视觉定位要求车辆把自然语言指令映射到画面中的具体对象或区域。现实道路并不具备通用视觉数据集中的清晰、静态条件,夜间、雨雾、运动模糊、目标距离差异和多个相似车辆都会放大歧义。现有方法往往缺少三维空间感知,也较少把“接下来会怎样”作为定位证据,而直接使用大规模视觉语言模型又面临推理成本和实时性压力。ThinkDeeper因而把定位过程设计成一次面向未来的场景推理。

论文主要贡献:

(1)世界模型式的视觉定位框架。提出Spatial-Aware World Model(SA-WM),从当前图像、文本指令与深度线索中构建与指令相关的潜状态,并递推生成未来潜状态,为最终定位提供前瞻性的中间证据。

(2)面向真实交通的空间感知。模型将单目深度估计引入视觉编码,使近处、远处和背景区域获得不同的空间先验,从而更容易排除不可能的候选目标。

(3)跨模态超图解码器。通过超图而非只用成对关系,联合建模文本短语、视觉区域与预测状态之间的高阶依赖,增强对多车交互和复杂指令的理解。

(4)DrivePilot数据集。论文构建多源视觉定位数据集,引入RAG与CoT提示驱动的大模型语义标注,覆盖天气、信号灯、道路条件、情感语境等14个语义维度,并由领域专家交叉核验。

二、研究方法

2.1 框架概览

如论文框架图1所示,ThinkDeeper由多模态骨干网络、空间感知世界模型(SA-WM)和多模态超图解码器三部分组成。它的处理顺序可以概括为先从前视图和自然语言指令中抽取“当前有哪些对象、指令在说什么、它们离得多远”的信息,再把这些信息压缩为与指令相关的状态,并向前滚出若干可能的未来状态,最后在视觉区域与语言短语之间建立高阶联系,输出被指令指向的目标区域。与传统直接对候选框打分的方案相比,核心变化是把“未来会怎样”也纳入定位依据。

图1 ThinkDeeper框架概览

2.2 多模态骨干网络

如图2,视觉编码器以Vision Transformer(ViT)为主干,将前视图转换为稠密视觉特征图,文本编码器使用BERT的WordPiece词元化与编码机制,将乘客指令表示为语言向量。与此同时,CenterNet提供场景中候选目标的对象向量,ZoeDepth估计单目深度图,补足“谁在近处、谁在远处”的三维空间线索。随后,双向跨模态注意力让视觉特征主动查询语言信息、语言特征也反向查询视觉区域,从而把“白色SUV”“斑马线后”“跟随”等词语与图像中的对象、相对位置建立初步对应。

2 多模态骨干网络

2.3 空间感知世界模型

空间感知世界模型是全文最核心的模块,分为当前状态构造和未来状态滚出两个阶段。如图3,第一阶段使用跨模态特征计算每个视觉块的细粒度显著性分数;深度先验会提升物理上更可能相关的近处区域、抑制天空和远处建筑等背景。模型再通过区域池化汇总候选区域,利用加权得分门控对象特征,获得命令感知的当前潜状态。这个状态并不保存全部画面细节,而是保留目标、几何关系和交互意图等定位所需的信息。

第二阶段以z0为起点,采用门控残差MLP在潜空间递推生成未来状态序列。每一步都接受语言条件的约束,因此它不是像素级的视频预测,而是面向定位任务的“想象”:哪些对象会更显著、哪些空间关系会变得关键、指令中的动作语义会如何影响关注区域。论文的消融结果说明静态场景理解难以替代前瞻式推理。

3 空间感知世界模型

2.4 多模态超图解码器

如图4,在解码阶段,模型把未来潜状态视作视觉节点,把指令中的词元视作文本节点。对于每个视觉节点,系统选择相关性最高的若干文本节点组成超边;因此一个视觉区域可同时关联“follow”“SUV”“after the crosswalk”等多个短语,而非只与单一词元建立配对关系。超图卷积在节点与超边之间反复传递信息,随后多层动态注意力将更新后的视觉和文本特征解码为目标区域概率。该模块的意义在于显式表达多对象、动作、空间约束和未来状态之间的联合关系,在多个相似车辆同时出现时更容易锁定真正被指代的目标。

4 多模态超图解码器

2.5 两阶段训练与DrivePilot数据构建

训练采用“先预演、后定位”的两阶段策略,第一阶段以世界模型滚出损失监督潜状态对未来场景变化的表示,第二阶段以定位监督联合优化目标分类和区域回归,避免模型在追求定位精度时遗忘前一阶段学到的时空先验。配套的DrivePilot数据集则遵循RAG检索增强、CoT分步语义标注和人工交叉核验的流程:Qwen2-VL先基于检索到的交通知识生成场景描述、交通信号、道路条件和指令情绪等14类语义信息,再由自动驾驶安全工程师、认证教练和研究人员核验。这使数据集不只是“图像—框—文本”三元组,也保留了真实道路决策所需的上下文。

三、实验结果

3.1 多基准与高难场景表现

如表1,论文在Talk2Car、DrivePilot和MoCAD三个真实道路数据集上评估,并进一步测试低能见度、多主体交互、语义模糊与长文本指令等困难场景;同时在RefCOCO、RefCOCO+、RefCOCOg上检验泛化能力。按论文报告,ThinkDeeper在Talk2Car、DrivePilot与MoCAD上均优于对比方法,其中完整模型在Talk2Car测试集取得76.64,在DrivePilot测试集取得77.27,在MoCAD测试集取得75.76。

高难情形:在Corner-case测试集上,模型达到74.19;在长文本指令集上达到74.08。作者将其归因于深度空间线索与未来潜状态共同缓解了多目标、遮挡和语言歧义。

数据效率:即使仅使用50%训练数据,论文中的ThinkDeeper(50%)仍在多项测试中超过多数完整数据训练的基线,说明这一架构对数据规模具有一定适应性。

1 ThinkDeeper与现有最优基线模型的性能对比

3.2效率与消融实验

如表2,在Talk2Car的效率测试中,ThinkDeeper使用ViT骨干、135.81M参数,平均推理时间为39ms,论文报告为78.93。消融实验尤为关键,如表3,去除深度先验会使DrivePilot从77.27降至72.33;不再滚出未来状态则降至68.27;完全移除SA-WM时降至62.70。也就是说,真正拉开差距的不只是更强的编码器,而是把当前场景变成可供后续推理使用的、面向未来的结构化证据。

2 ThinkDeeper 与各基线方法在Talk2Car数据集上的效率对比

3 消融实验

四、总结

ThinkDeeper的启发在于自动驾驶中的视觉定位不应被视为单帧图文匹配,而应成为结合距离、语义和未来演化的决策前推理。其多模态骨干网络先把图像、指令和深度统一编码。SA-WM再从当前状态滚出未来潜状态,为指令歧义提供新的消解线索。超图解码器最终把文本、视觉与时空证据组织为高阶关系。DrivePilot进一步将数据集从“物体—指令”配对扩展到更丰富的道路语境。对于需要在真实道路中理解乘客意图的系统,这种“先预演、再定位”的思路提供了一条兼顾鲁棒性与效率的路径。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐