探索多模态大语言模型的视觉 - 空间智能:VSI - Bench 视角

在人工智能领域,多模态大语言模型(MLLMs)的发展日新月异。它们整合了语言和视觉能力,在诸多任务中展现出强大的潜力。然而,其视觉 - 空间智能的程度究竟如何?在面对真实世界的空间理解和推理任务时,它们能否像人类一样 “思考空间”?今天,我们将深入探讨一篇关于此主题的论文,该论文通过构建 VSI - Bench 基准,对 MLLMs 的视觉 - 空间智能进行了全面评估。

项目地址Thinking in Space: How Multimodal Large Language Models See, Remember and Recall Spaces

开源地址https://github.com/vision-x-nyu/thinking-in-space

数据集https://huggingface.co/datasets/nyu-visionx/VSI-Bench

研究背景与视觉 - 空间智能的重要性

人类在日常生活中频繁运用视觉 - 空间智能,例如在购买家具时想象其是否适合客厅空间,仅凭一次观察就能在脑海中重建空间布局,回忆起房间内物体的位置和大小。视觉 - 空间智能涉及感知和心理操作空间关系,涵盖视觉感知、语言智能、时间处理和空间推理等多个方面,对于机器人、自动驾驶和增强现实 / 虚拟现实等领域至关重要。尽管大型语言模型(LLMs)在语言智能方面取得了长足进步,但视觉 - 空间智能仍有待深入探索。MLLMs 的出现为发展视觉 - 空间智能带来了新的契机,然而,其在真实世界场景中的视觉 - 空间理解能力仍面临诸多挑战。

VSI - Bench 基准:评估视觉 - 空间智能的新工具

(一)基准概述

为了定量评估 MLLMs 从以自我为中心的视频中获取的视觉 - 空间智能,作者引入了 VSI - Bench 基准。该基准包含超过 5000 个问答对,这些问答对源自 288 个真实室内场景视频,这些视频取材于 ScanNet、ScanNet++ 和 ARKitScenes 等公共室内 3D 场景重建数据集的验证集,涵盖了住宅、办公和工厂等多种环境,具有丰富的多样性。VSI - Bench 包括配置、测量估计和时空三类共八项任务,配置任务如对象计数和相对距离测试模型对空间配置的理解;测量估计任务涉及对象大小、房间大小和绝对距离的估计,对具身智能体具有重要价值;时空任务如外观顺序则考察模型对视频中空间记忆的能力。

(二)基准构建流程

  1. 数据集收集与统一:作者精心挑选并整合了来自不同数据集的视频,将其转换为统一的格式,包括标准化的分辨率、帧率等,并提取了丰富的元信息,如房间大小、对象类别和边界框等。同时,对类别进行了筛选和重映射,以确保基准的一致性和有效性。
  2. 问答对生成:问答对主要通过基于元信息和问题模板的自动注释生成,其中路线规划任务由人工注释。针对每个任务精心设计了问题模板,并为人工注释者提供了详细的指南,以确保生成的问题具有高质量和多样性。生成的问答对经过了严格的筛选和验证,以去除模糊或错误的问题。
  3. 人工循环质量审查:在基准构建的各个阶段实施了人工质量审查,包括对数据集的手动筛选和对问答对的审核。审查人员通过回答问题并标记可能存在问题的问答对,确保了基准的准确性和可靠性。通过多次迭代审查,不断优化基准的质量,以满足研究的需求。

实验评估与结果分析

(一)实验设置

  1. 模型选择:作者全面评估了 15 个支持视频的 MLLMs,涵盖了不同的模型家族、参数规模和训练方法,包括专有模型 Gemini1.5 和 GPT - 4o,以及开源模型如 InternVL2、ViLA 和 LLaVA 系列等。所有模型在零样本设置下使用默认提示进行评估,并采用贪婪解码策略以确保结果的可重复性。
  2. 指标设计:根据问题答案的类型(文本或数字),分别采用准确率(ACC)和平均相对准确率(MRA)作为评估指标。MRA 的引入是为了更准确地评估模型在预测连续数值时的性能,通过考虑相对误差率,能够更细致地衡量模型预测与真实答案之间的接近程度。
  3. 基线设置:为了更好地评估模型性能,设置了两个基线。随机基线(Chance Level (Random))用于表示随机选择答案的准确率,频率基线(Chance Level (Frequency))则代表模型始终选择每个任务中最频繁答案的性能。此外,还通过让人类评估者回答 400 个问题(VSI - Bench (tiny))来确定人类水平的性能,作为对比的参考。

(二)实验结果

  1. 模型整体表现
    • 与人类水平对比:人类评估者在基准测试中平均准确率达到 79%,在配置和时空任务上表现尤为出色,而在测量任务上与最佳 MLLM 的差距相对较小。这表明 MLLMs 在需要定量估计的任务上具有一定优势,但与人类的视觉 - 空间智能仍存在显著差距。
    • 专有模型与开源模型对比:领先的专有模型 Gemini1.5 Pro 在性能上超越了随机基线和频率基线,在绝对距离和房间大小估计等任务中接近人类水平。开源模型中,顶级模型如 LLaVA - NeXT - Video - 72B 和 LLaVA - OneVision - 72B 表现出与专有模型相当的竞争力,但多数开源模型仍低于基线水平,表明其视觉 - 空间智能存在较大局限性。
  2. 视觉输入的影响:通过对比视觉启用(w/video)和视觉禁用(w/o video)模型的性能,发现视频输入对模型在 VSI - Bench 上的表现至关重要。视觉启用模型在多个任务上的表现明显优于视觉禁用模型,而视觉禁用模型在某些任务上甚至低于随机基线,凸显了视觉信息对解决这些任务的重要性。
  3. 模型错误分析
    • 错误类型分布:对 Gemini1.5 Pro 在 VSI - Bench (tiny) 上的错误进行分析,发现约 71% 的错误源于空间推理能力,包括关系推理错误(如空间关系判断不准确)和自我中心 - 他中心转换错误(如视角转换不当)。视觉感知错误(如对象识别错误)和语言智能错误(如逻辑推理缺陷)占比较小。
    • 思维链方法的局限性:令人惊讶的是,在 VSI - Bench 上,三种常用的语言提示技术(零样本思维链、自一致性思维链和思维树)均未提高模型性能,甚至在某些情况下导致性能下降。这表明在视觉 - 空间任务中,单纯改进语言推理能力可能不足以提升模型性能,视觉 - 空间推理能力的瓶颈需要通过其他方式解决。

多模态大语言模型的空间思考方式

  1. 语言层面的思考分析
    • 自我解释探究:通过让 Gemini1.5 Pro 对预测答案进行自我解释,发现模型在思考空间时展现出了较强的视频理解能力,能够准确描述视频中的时间戳信息,并形成一定的推理过程,如在相对方向任务中构建全局坐标系。然而,错误案例分析表明,模型在自我中心 - 他中心转换和关系推理等视觉 - 空间能力方面仍存在缺陷。
    • 思维链方法的失效原因:尽管思维链等提示技术在一般语言推理和视觉任务中有效,但在 VSI - Bench 上却未发挥作用。进一步分析发现,VSI - Bench 中的任务与语言智能的关联性较弱,而与视觉 - 空间推理的相关性更强,这使得单纯依靠语言提示难以提升模型在这些任务上的性能。
  2. 视觉层面的思考分析
    • 认知地图的生成与评估:通过提示模型生成认知地图,发现 MLLMs 在记忆空间时能够形成局部世界模型,对相邻对象的定位具有一定准确性,但在处理远距离对象时准确性明显下降。这表明模型在构建全局空间表示方面存在困难,可能是由于从离散视频帧中形成统一的全局模型具有挑战性。
    • 认知地图对距离推理的影响:实验表明,生成和使用认知地图能够提高 MLLMs 在相对距离任务中的准确性,尽管提升幅度有限。这说明认知地图作为一种内部表示形式,有助于模型进行空间推理,但仅靠认知地图不足以完全解决视觉 - 空间推理问题,还需要进一步探索其他方法来提升模型的全局空间理解能力。

研究成果总结与展望

  1. 研究成果总结:通过构建 VSI - Bench 基准,对 MLLMs 的视觉 - 空间智能进行了全面评估,发现 MLLMs 在视觉 - 空间智能方面展现出一定潜力,但与人类水平相比仍有较大差距。模型在视觉感知和语言理解方面表现较好,但空间推理能力尤其是自我中心 - 他中心转换和关系推理方面存在明显瓶颈。此外,常用的语言提示技术在视觉 - 空间任务中效果不佳,而生成认知地图在一定程度上有助于提升模型的空间距离推理能力。
  2. 未来研究方向:未来研究可考虑针对视觉 - 空间任务对 MLLMs 进行特定任务的微调,开发用于空间推理的自监督学习目标,或探索适合视觉 - 空间任务的定制提示技术。此外,进一步研究如何帮助模型构建更准确的全局空间表示,以及如何将视觉 - 空间智能更好地融入到实际应用中,如机器人导航、虚拟现实等领域,也是未来的重要研究方向。通过这些研究方向的探索,有望提升 MLLMs 在视觉 - 空间智能方面的性能,使其更好地应对复杂的现实世界任务。

这篇论文为我们深入理解 MLLMs 的视觉 - 空间智能提供了重要的见解和研究方向,相信在未来的研究中,我们将看到 MLLMs 在这一领域取得更大的突破。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐