作者|李宗钊,阿里巴巴达摩院实习生

 

摘要

 

 

图片

图表1:与仅依赖监督微调的方法相比,STAR-R1能更系统地建立跨视角目标对应关系,从而在多视角空间推理任务中给出更准确答案。

 

近年来,多模态大模型(MLLM)在图像理解、视频理解和通用问答等任务上持续取得突破,但在一个关键能力上,距离人类仍有明显差距——多视角空间推理(multi-view spatial reasoning)。所谓多视角空间推理,是指模型需要同时观察来自不同视角的图像,识别“同一个物体”在不同视图中的对应关系,并进一步理解整个场景的空间结构。例如:从左视角、右视角和正视角分别看同一间房间,模型需要知道哪些物体其实是同一个,哪些只是因为视角变化看起来位置不同,最终回答“某个物体在另一个物体的左边还是后边”这样的问题。

 

然而,现有多模态大模型在这类任务上经常出现两类问题:1. 无法稳定建立跨视角对应关系,模型容易把不同视角下位置相近但并非同一物体的目标错误匹配起来;2. 缺乏一致性的空间语义重建能力,即使局部识别对了,也难以将多个视角整合成统一的场景理解。

 

为了解决这一问题,中国人民大学、中科院自动化所、阿里巴巴达摩院等机构的研究团队提出了一个新的框架:STAR-R1(Multi-View Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs)。该方法通过一个两阶段训练框架,将过程监督的SFT与面向参照物选择的强化学习结合起来,让模型不仅“会看图”,更能像人一样通过锚定关键物体、建立跨视角映射,完成更加鲁棒的空间推理。实验表明,STAR-R1 在 TVR、MMSI-Bench、MindCube-Tiny 和 SPAR-Bench 等多个多视角空间理解基准上显著超越当前主流开源/闭源模型,展现出极强的泛化能力与类似人类的推理行为。

 

 

图片

背景介绍 & 研究动机

 

在空间智能逐渐成为多模态模型研究热点的当下,单张图像的识别已经不再足够。现实世界中的机器人、智能体和视觉助手,往往需要从多个视角来理解同一个场景。比如:一个机器人绕着桌子移动,需要知道不同视角看到的杯子是不是同一个杯子;一个智能体观察房间的多个摄像头画面,需要判断沙发相对于桌子的真实空间位置;一个模型在前后左右不同视图下分析场景,需要理解视角变化带来的投影变化,而不是简单比较图像中“哪里像哪里”。这类任务的难点不在于“识别出物体是什么”,而在于识别同一物体在不同视角中的身份一致性,并进一步构建统一的空间语义。

 

论文以一个代表性任务TVR(Transformation-Driven Visual Reasoning) 为切入点进行了分析。这个任务要求模型根据两张图像判断:初始图像中的哪些物体发生了属性变化,以及变化是什么。看起来像是“目标属性识别”问题,但一旦两张图来自不同视角,任务本质就变成了:先搞清楚谁和谁是同一个物体,再去判断它变了什么。

 

而现有方法在这里暴露出明显短板:

 

(一)SFT擅长记模式,但不擅长跨视角泛化

 

监督微调(SFT)可以学会训练集中的常见变化模式,比如“颜色从灰色变青色”“材质从金属变玻璃”,但它常常只是做浅层模式匹配。一旦视角变化导致物体在图像中的相对位置发生改变,SFT就容易把不同物体错配。

 

(二)纯RL有潜力,但没有冷启动时容易“找不准锚点”

 

强化学习(RL)能够鼓励模型主动探索更有效的推理路径,甚至自发形成类似人类的“先找关键参照物,再做整体匹配”的行为。但如果一开始没有一个合理的推理骨架,模型也可能出现漏看关键物体、推理结构混乱等问题。

 

因此,我们的核心研究动机是:能否让多模态大模型先学会结构化地做多视角空间分析,再通过强化学习激励其形成更鲁棒、更像人的跨视角推理策略?

 

 

图片

主要贡献

 

本研究的主要贡献可以概括为以下三个方面:

 

(一) 提出了面向多视角空间推理的两阶段框架STAR-R1

 

首次系统揭示了:RL在多视角空间理解中能够诱导模型形成“锚定关键物体—建立跨视角对应—重建场景语义”的类人行为模式。在此基础上,提出 STAR-R1,将过程监督SFT与参照物感知RL结合,实现更强的泛化能力。

 

(二)设计了面向“参照物选择”的强化学习范式

 

不同于只对最终答案是否正确进行奖励,STAR-R1的RL阶段还对关键参照物选择是否正确进行奖励,从而显式鼓励模型先找准锚点,再做空间推理。

 

(三)在多个基准上取得显著SOTA结果

 

STAR-R1在TVR、MMSI-Bench、MindCube-Tiny、SPAR-Bench等多个多视角空间理解任务上均显著优于现有方法,尤其在复杂视角变化、真实场景和跨任务泛化上表现突出。

 

 

图片

STAR-R1框架:两阶段学习“空间推理之道”

 

 

图片

图表2:STAR-R1整体框架。作者首先在TVR任务中分析SFT与RL在多视角推理上的差异,进一步提出STAR-R1:通过过程监督SFT建立结构化空间推理能力,再利用面向参照物的强化学习提升跨视角泛化能力。

 

这篇工作的核心并不是单纯提出一个“训练技巧”,而是围绕一个更本质的问题展开:多模态大模型为什么在多视角空间推理中容易出错,应该如何训练它学会更像人的推理方式? 为了回答这个问题,我们先在一个相对可控的任务上做了深入分析,再把得到的洞察推广到更真实、更复杂的多视角空间理解场景中。整个STAR-R1框架也正是在这样的逻辑下逐步建立起来的。

 

(一)从TVR任务出发:为什么多视角空间推理需要RL?

 

首先,选择一个代表性任务TVR(Transformation-Driven Visual Reasoning)作为切入点。这个任务要求模型根据初始图像和最终图像,判断哪些物体发生了属性变化,以及变化是什么。在视角不发生变化时,这个任务看起来更像一个“属性比对”问题;但当最终图像来自左视角或右视角时,问题就不再是简单地对比颜色、材质或形状,而是要求模型先解决一个更基础的问题:初始图中的哪个物体,对应最终图中的哪个物体?

 

围绕这个任务,我们比较了SFT与RL两种训练方式的行为差异。结果发现,SFT确实能较好地学习标注数据中的变化模式,但它往往只是在做较为粗浅的图像对比,一旦视角发生变化,就容易把图中位置相近但并非同一物体的目标错误匹配起来。

 

相比之下,RL虽然在没有冷启动时未必能在简单场景上达到最高精度,但它会自发形成一种更接近人类的策略:逐个检查图中的关键物体,确认它们在不同视角下的对应关系,再据此判断发生了哪些变化。 这也是论文最重要的观察之一:在多视角空间推理中,RL的价值不只是优化答案,而是帮助模型形成“跨视角对齐”的推理习惯。

 

(二)STAR-R1的核心思路:先建立结构化空间推理过程,再通过RL强化

 

基于在TVR上的观察,我们进一步提出:如果想让模型真正具备稳定的多视角空间理解能力,就不能只依赖最终答案监督,而需要把推理过程本身结构化。为此,STAR-R1 将多视角空间推理归纳为三个连续步骤。

 

第一步单视角参照物分析(Per-View Referential Analysis)。对于每一张输入图像,模型首先识别一组关键参照物,并描述这些物体之间的空间关系,例如谁在谁前面、后面、左侧或右侧;

 

第二步跨视角空间映射(Cross-View Spatial Mapping)。模型需要在不同视角之间建立这些关键物体的对应关系,将多个局部视角整合为统一的场景布局;

 

第三步是空间推理与答案生成(Spatial Reasoning and Answer Inference),即基于构建出的全局空间语义,完成具体问题的判断与作答。

 

这一过程非常重要,因为多视角任务的难点并不只是“读懂一张图”,而是要在多个视角之间保持物体身份和空间关系的一致性。STAR-R1的目标,就是让模型从“直接答题”转向“先建图、再推理”。

 

(三)两阶段训练策略:SFT负责冷启动,RL负责泛化提升

 

为了让模型学会上述结构化过程,STAR-R1采用了一个两阶段训练策略。第一阶段是过程监督的SFT冷启动。我们从MindCube和SPAR-7M中采样多视角空间理解数据,并借助Gemini-2.5-Pro构造高质量的长链式思维(CoT)推理过程。这些CoT严格遵循前面提到的三步范式:先分析每张图中的关键物体及其局部关系,再做跨视角映射,最后给出答案。通过这一阶段,模型获得了较为规范的空间推理“骨架”。

 

第二阶段是在此基础上进行 强化学习优化。与一般只根据最终答案是否正确来打分不同,STAR-R1设计了两个奖励项:一部分奖励最终答案正确性,另一部分奖励模型是否正确识别和使用了关键参照物。这样做的目的,是让模型不仅学会“答对”,还学会“通过正确的空间锚点去答对”。作者将这一奖励形式写作

图片

。实验表明,这种设计能够有效提升模型在复杂视角变化场景中的稳定性和泛化能力。

 

 

图片

实验结果:STAR-R1在多个基准上显著领先

 

 

图片

图表3:STAR-R1在TVR、MMSI-Bench、MindCube-Tiny和SPAR-Bench等多个多视角空间理解基准上均取得领先结果。

 

在实验部分,我们首先展示了STAR-R1在多个基准上的整体表现。基础模型采用Qwen2.5-VL-7B,训练在单节点8×H20 GPU上完成。结果显示,STAR-R1不仅在合成任务TVR上取得了显著提升,也在真实世界多视角空间理解数据集上展现出很强的竞争力。

 

在TVR上,STAR-R1的TAcc达到61.4,明显优于STAR-SFT的48.7,也显著超过GPT-4o、o3、Gemini等闭源模型。在真实场景基准上,STAR-R1在MMSI-Bench上达到31.4,在MindCube-Tiny的Rotation、Among、Around三个子任务上分别达到98.5、82.0、82.8,在SPAR-Bench的ObjRel-OC-MV和ObjRel-OO-MV上分别达到86.0和76.7,整体上持续超过现有开源方法。

 

从结果可以看出,STAR-R1的优势并不只体现在某一个特定任务上,而是贯穿于不同类型的多视角空间推理问题之中。尤其是在Rotation这类跨视角线索较弱、非常依赖“参照物锚定”的任务上,STAR-R1相比SFT和以往方法的提升最为明显,这与论文方法设计的出发点是高度一致的。

 

(一)关键发现:SFT更擅长记忆,RL更擅长泛化

 

表格1:在TVR任务中,SFT在无视角变化的ID场景中更占优,但在存在视角变化的OOD场景中,RL展现出明显更强的泛化能力。

 

 

图片

 

为了更清楚地说明RL的作用,作者在TVR上进一步将测试划分为ID(无视角变化) 和 OOD(有视角变化) 两类场景。结果很有代表性:在ID场景中STAR-SFT的TAcc为84.2,高于STAR-R1的76.3;但在OOD场景中,STAR-R1达到53.9,显著高于STAR-SFT的 30.9。这说明SFT更擅长拟合训练分布中的已有模式,而RL则更能在面对新视角、新布局时形成稳定的应对策略。

 

更有意思的是,作者还分析了模型在推理过程中的行为模式。RL模型在OOD情况下会更频繁地显式建立跨视角物体对应关系,也就是说,它更倾向于“把所有关键物体重新核对一遍”。这正是其能够在复杂视角变化下保持鲁棒性的原因。论文用一句话概括这个现象:SFT memorizes, RL generalizes。

 

(二)训练动态与消融实验:结构化奖励确实有效

 

 

图片

图表4:训练动态显示,模型最终会收敛到一种既简洁又覆盖多对象的推理策略

 

除了主结果外,论文还分析了训练过程中模型响应长度的变化。作者发现,随着RL训练推进,模型的回答长度会先快速下降,再逐步回升并趋于稳定。这意味着模型一开始会压缩掉冗长但低效的描述,但如果过于简短,又容易只关注少数物体,导致跨视角匹配不完整。最终收敛得到的是一种更平衡的策略:在保持表达简洁的同时,系统地比较所有关键物体,从而提高整体准确率。这个现象也从侧面说明,RL学到的不只是“更短”或“更长”的回答,而是一种更高效的空间推理组织方式。

 

表格2:消融实验则验证了参照物奖励和两阶段训练的必要性。

 

 

图片

 

消融实验进一步验证了STAR-R1中各个设计的重要性。在真实世界基准上,纯RL虽然已经优于部分基线,但整体仍不如完整的两阶段STAR-R1;而去掉参照物奖励Rref后,MMSI-Bench和MindCube-Tiny Rotation等任务表现明显下降,表明“先找准关键物体,再进行空间映射”确实是提升多视角推理能力的关键因素。

 

 

图片

案例分析:STAR-R1为什么更像人在做空间判断?

 

 

图片

图表5:在真实多视角案例中,STAR-R1能够稳定识别关键物体并建立一致的空间关系,而其他模型更容易出现幻觉和错配。

 

一个典型现象是:现有模型即使能识别图中出现了哪些物体,也未必能在多个视角之间保持一致的“物体身份追踪”,因此经常在判断左右、前后、远近关系时出现幻觉。而STAR-R1的推理过程则更加稳定,它会先在每个视角中识别关键物体,再显式描述这些物体之间的相对关系,最后进行跨视角映射并作答。也正因此,它在Rotation、Among、Around以及SPAR-Bench的对象关系任务中都表现出了更强的可靠性。

 

从这些案例可以看出,该框架的改进并不仅仅是数值上的提升,更重要的是它表现出了一种更加接近人类的推理方式:面对多张不同视角的图像,不是直接凭表面位置“猜答案”,而是先锁定关键参照物,再一步步恢复整个场景的空间结构。

 

 

图片

总结

 

这篇工作围绕一个非常具体但又十分重要的问题展开:如何让多模态大模型真正具备多视角空间推理能力。我们并没有直接从复杂真实场景切入,而是先在TVR任务上分析SFT与RL的本质差异,进而提出一个结构化的三步推理范式,并通过“两阶段训练 + 参照物奖励”的方式把这一范式落到模型训练中。

 

最终,STAR-R1在多个基准上取得了显著领先结果,也展现出更加稳定、更加类人的跨视角推理行为。如果说很多现有多模态模型仍然停留在“看懂单张图”的阶段,STAR-R1让模型进一步学会在多个视角之间对齐物体、重建场景,并基于统一空间语义进行推理。这不仅对空间理解任务本身重要,也为未来具身智能、机器人和更强的视觉推理系统提供了值得关注的方向。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐