机构: Intern Robotics,上海人工智能实验室(Shanghai AI Laboratory)
日期: 2025-09-11
原文 PDF: InternVLA_N1.pdf
代码 / 模型 / 数据 / 主页: InternNav · InternVLA-N1 · InternData-N1 · Homepage

说明:本文为论文全文中文翻译,尽量保留原文结构、公式、表格与图示。图示以原论文对应页渲染图嵌入(见 internvla_n1_assets/)。贡献者名单见附录 A。


摘要

我们提出 InternVLA-N1——首个开放的双系统视觉-语言导航(Vision-Language Navigation, VLN)基础模型。与以往只能从有限离散动作空间中输出短期动作的导航基础模型不同,InternVLA-N1 将任务解耦为:System 2 的像素目标(pixel-goal)规划,以及 System 1 的敏捷执行。我们为此框架设计了课程式两阶段训练范式:首先,以显式像素目标作为监督或条件,分别预训练两个系统;随后冻结 System 2,并以异步端到端方式微调新引入的潜在规划(latent plans)与 System 1。该范式以潜在规划作为中间表示,消除了像素目标规划的歧义,并为基于视频预测的预训练扩展提供了新可能。为支持可扩展训练,我们开发了高效的仿真导航数据生成流水线,并发布迄今最大规模的导航数据集 InternData-N1:包含来自 3000+ 场景的超过 5000 万张第一人称图像,对应约 4839 公里 的机器人导航经验。我们在 6 个具有挑战性的导航基准上评估 InternVLA-N1,其持续取得 SOTA 表现,提升幅度约 3%–28%。尤其值得注意的是,尽管仅用仿真数据训练,它仍可在多种本体(轮式、四足、人形)与野外环境中 零样本泛化,并在真实世界中展现长时程规划(>150 m)与实时决策(>30 Hz)的协同能力。全部代码、模型与数据均已公开。


图 1. InternVLA-N1 的亮点特性与推理示例

在这里插入图片描述

1. 引言

导航是机器人学的基础任务。实践中,导航系统通常以语言指令与视觉观测为输入,并据此执行规划轨迹。近年来该领域持续进展:从基于离散目标规划的基准构建(Anderson et al., 2018a; Ku et al., 2020),到连续动作空间(Krantz et al., 2020b),再到结合运动控制器的物理真实仿真(Cheng et al., 2025; Wang et al., 2025b)。另一方面,多模态大语言模型(MLLM)凭借强大先验知识,为“在仿真中训练、在开放真实世界中泛化”提供了新可能。研究社区兴趣日益增长(Cheng et al., 2025; Wei et al., 2025; Zhang et al., 2025a; Zheng et al., 2024),并已在四足与人形等多样本体上做出初步成功尝试。

然而,尽管这些模型在 VLN-CE(Krantz et al., 2020b)等连续环境基准上发展,其动作空间仍被简化为离散选择,并以端到端方式预测。结果是:它们只能从有限空间中输出短期动作步,且在推理速度与导航行为连贯性方面存在困难。直观上,相比“视觉观测 + 语言指令 → 直接动作”的硬映射,更自然的目标类型应是中期目标,尤其是图像像素上的目标——它指示机器人应前往何处,并可与多模态 LLM 的视觉定位(visual grounding)能力对齐。与此同时,再用一个高频局部规划器朝该中期目标执行路径规划,并具备规避动态障碍的敏捷性。最终,整体框架呈现出类似人类认知理论(Kahneman, 2011)中的 “System 1 执行 & System 2 思考” 机制。已有若干工作在 VLA 模型上尝试类似思想,例如 Helix(FigureAI, 2025)、GR00T(Bjorck et al., 2025)、Hi Robot(Shi et al., 2025)与 OneTwoVLA(Lin et al., 2025b)。

本文提出 InternVLA-N1:首个以可学习潜在规划作为中间表示的开放双系统视觉-语言导航基础模型。与桌面操作等完全可观测设定不同,InternVLA-N1 的 System 2 需要在部分可观测与移动外感受视角条件下,依据语言指令进行多轮、精确规划;同时 System 1 负责在真实环境中执行这些规划,并稳健处理行人等动态扰动。

为应对上述挑战,我们将 System 2 形式化为像素目标规划器,以多模态 LLM 为骨干,利用其常识知识与多模态感知能力。像素目标被定义为偏好导航航点在二维图像平面上的投影。相应地,System 1 被设计为轻量、基于扩散的视觉导航策略,可在 System 2 生成目标条件下进行实时路径规划。两系统首先分别预训练以形成基础导航能力:System 2 将像素定位能力对齐到 VLN 领域;System 1 以显式目标(含像素目标坐标)为条件,生成通向目标的无碰撞导航路径。

尽管预训练后可将两系统级联为完整 VLN 框架,该设计仍带来若干关键挑战。其一,同步化 System 2 规划与 System 1 执行会显著增加整体延迟——System 1 必须等待多模态 LLM 响应,从而削弱实时响应能力,降低动态环境可行性。其二,用二维像素坐标表示导航目标会产生歧义,常导致 System 1 出现次优或混乱行为。

为解决这些问题,我们引入额外微调阶段,以实现异步推理,并增强两系统间中间目标接口的空间表示。具体地,微调时 System 1 持续接收最新观测,而 System 2 运行于延迟输入上,从而促使 System 1 动态估计目标完成度并适应异步执行节奏。进一步地,我们用可学习潜在 token 取代显式像素目标,通过联合调优获得信息更丰富的隐式规划参考。为增强并验证潜在表示,我们训练基于潜在规划的世界模型,以预测后续第一人称观测序列作为扩展。实验表明,该世界模型可想象出朝向规划目标、一致且高质量的第一人称观测序列。视频预测目标有助于从潜在 token 中提取空间信息、加速联合调优,并导向可扩展的真实世界视频数据训练范式。

为支持上述预训练与联合微调,我们开发了高效仿真数据生成流水线:单机每天可产生约 5 万条导航轨迹。结合自动指令标注与数据过滤,构建了大规模导航数据集 InternData-N1:超过 5350 万张第一人称图像观测、80 万条语言指令,覆盖 3000+ 室内场景,约合 4839 公里机器人导航经验。

实验表明,InternVLA-N1 在六个具有挑战性的基准上持续超越以往 SOTA,提升约 3%–28%。真实世界评估进一步显示:其在多样场景的多机器人平台上具备强长时程规划(>150 m)与实时决策(>30 Hz)能力,凸显在动态开放世界中的适应性。


2. 相关工作

视觉-语言导航(VLN)

VLN 是需要机器人精确规划与跟随的长时程指令跟随任务。早期方法采用离散设定(Anderson et al., 2018a; Ku et al., 2020; Qi et al., 2020),智能体在导航图预定义节点间“瞬移”,从而绕过避障与路径规划等真实挑战。为更好逼近现实,连续环境中的 VLN-CE(Krantz et al., 2020b; Savva et al., 2019)被提出,智能体使用低级离散控制动作。随后涌现大量方法(An et al., 2022, 2023; Hong et al., 2022; Irshad et al., 2022; Krantz and Lee, 2022; Krantz et al., 2021; Raychaudhuri et al., 2021; Wang et al., 2023b)稳步提升仿真导航精度。然而,对任务专用网络结构与有限训练数据的依赖,仍阻碍零样本泛化与 sim-to-real 迁移。为此,近期智能体方法(Chen et al., 2024, 2025; Lin et al., 2025a; Long et al., 2024c,d; Qiao et al., 2024; Zhang et al., 2025b; Zhou et al., 2023, 2024)借助通用基础模型,在真实 VLN 任务上展现更强性能与鲁棒性。但若缺少面向下游任务微调的多样化数据,这类通用模型仍难以与导航领域良好对齐。针对此,我们提出高效仿真数据生成流水线,得到高质量数据集 InternData-N1;结合先进训练配方与精炼网络结构,InternVLA-N1 在多个 VLN 基准上达到 SOTA,并对真实世界展现强零样本泛化。

视觉导航策略学习

视觉导航技能负责到达显式目标并实时避障。传统模块化方法(Fox et al., 1997; Karaman and Frazzoli, 2011; Kramer and Stachniss, 2012; Williams et al., 2015; Zhou et al., 2020)依赖显式定位与建图,但常受级联模块误差累积与延迟困扰,且需大量超参调优以适应不同平台。为此,近期工作探索端到端学习:例如 GNM(Shah et al., 2023a)、X-Nav(Wang et al., 2025a)、RING(Eftekhar et al., 2024)、X-Mobility(Liu et al., 2024)关注跨本体零样本策略泛化;iPlanner(Yang et al., 2023)、ViPlanner(Roth et al., 2024)、FDM(Roth et al., 2025)、S2E(He et al., 2025)研究高效训练范式并增强点目标导航的 sim-to-real;SLING(Wasserman et al., 2023)、ViNT(Shah et al., 2023b)、NoMad(Sridhar et al., 2024)、NaviDiffuser(Zeng et al., 2025)则聚焦图像目标导航。我们的模型对双系统架构的两个组件均进行强预训练。值得注意的是,预训练后的 System 1 是首个在统一框架中同时支持无目标探索、点目标与图像目标导航的 sim-to-real 视觉导航策略。

面向导航的视觉-语言-动作(VLA)模型

近期研究越来越多以多模态大模型作为导航任务预训练骨干,以期利用其常识知识提升性能。常见做法是将导航动作形式化为文本,从而在 LLM 中统一为 next-token 预测问题。例如一系列工作(Gao et al., 2025; Wang et al., 2025c; Wei et al., 2025; Zhang et al., 2024, 2025a; Zheng et al., 2024)采用与 VLN-CE 相同的离散动作空间并定义对应词表,作为 LLM 的响应标签。相对地,RoboPoint(Yuan et al., 2025)与 NaviMaster(Luo et al., 2025)通过将导航建模为像素定位任务来规避离散动作空间限制,但动作执行仍需额外模块(如相机标定与点目标导航策略)。UniVLA(Bu et al., 2025)与 TrackVLA(Wang et al., 2025d)采用端到端范式,直接将 LLM 提取的潜特征映射为机器人可执行连续轨迹;但这些方法通常依赖同步框架,限制了在动态开放世界中进行高频决策的能力。尽管近期已有慢-快双系统架构探索(Bu et al., 2024; FigureAI, 2025; Shi et al., 2025),它们主要面向桌面操作,尚未充分解决未知场景中的长上下文记忆建模与探索问题。我们提出的 InternVLA-N1 是首个能够在未见环境中进行长时程指令跟随、精确规划与跨建筑导航的异步双系统架构。


3. InternData-N1 数据集

对导航任务而言,多数真实世界数据集(Hirose et al., 2018, 2023; Karnan et al., 2022; Shah et al., 2021)受场景多样性与规模限制;互联网视频数据集(Lin et al., 2023; Liu et al., 2025)则因定位与建图信息不精确,难以作为可靠的轨迹预测导航数据。相比之下,我们提出三条高效的仿真导航数据生成流水线以支持可扩展训练。InternData-N1 包含互补子集 VLN-N1、VLN-CE、VLN-PE

  • VLN-N1:来自大规模开源 3D 资产,并做广泛域随机化,以增强对多样真实场景的泛化。
  • VLN-CE:提供高质量细粒度指令标注,提升长时程下游导航任务表现。
  • VLN-PE:在基于物理的仿真中引入低层运动控制器,通过建模真实机器人动力学支持有效 sim-to-real。

表 1. InternData-N1 与其他导航数据集对比

在这里插入图片描述

类别 数据集 场景数 距离 (Km) 时长 (Hour) 图像数 指令数 动作 采集方式
真实世界 GoStanford (Hirose et al., 2018) 27 25.5 16.7 178K N/A Trajectory 遥操作
真实世界 RECON (Shah et al., 2021) 9 152.5 40 610K N/A Trajectory 自主
真实世界 SCAND (Karnan et al., 2022) 1 40 8.7 100K N/A Trajectory 遥操作
真实世界 SACSoN (Hirose et al., 2023) 5 58 75 241K N/A Trajectory 自主
互联网视频 Youtube-HT (Chang et al., 2020) 1387 - 119 550K N/A Trajectory 互联网
互联网视频 Youtube-VLN (Lin et al., 2023) 4078 - 433 587K 14K Trajectory 互联网
仿真 AMR (Meng et al., 2025) 54 - N/A 7.5M N/A Trajectory 自主
仿真 REVERIE (Qi et al., 2020) 86 - N/A 10.6K 21.7K Discrete 自主
仿真 Habitat-Web (Ramrakhya et al., 2022) 81 - N/A 19.5M N/A Discrete 遥操作
仿真 R2R-CE (Hong et al., 2022) 61 103.9 N/A 647K 10.8K Discrete 自主
仿真 RxR-CE (Anderson et al., 2018b) 59 303.3 N/A 1.9M 20K Discrete 自主
仿真 R2R-EnvDrop-CE (Tan et al., 2019) 60 1630.5 N/A 146.2K 21.6K Discrete 自主
仿真 ScaleVLN (Yu et al., 2023) 800 - N/A - 4.9M Discrete 自主
仿真(本文) InternData-N1 3154 4839.9 1344 53.5M 0.8M Trajectory + Joint 自主

3.1 VLN-N1

丰富的开源场景资产为生成室内导航轨迹提供了理想试验场。我们使用 Replica(Straub et al., 2019)、Matterport3D(Chang et al., 2017)、Gibson(Xia et al., 2018)、3D-Front(Fu et al., 2021)、HSSD(Khanna et al., 2024)与 HM3D(Ramakrishnan et al., 2021)作为场景库。为生成具有第一人称观测的逼真导航过程,我们以多阶段路径规划生成一批无碰撞且平滑的轨迹:先基于网格结构为每层构建欧氏符号距离场(ESDF),再按与 Cai et al.(2025)类似的三步全局路径规划进行:(1)用 A* 为随机采样起终点初始化全局路径;(2)基于 ESDF 优化轨迹航点;(3)轨迹平滑。随后在 BlenderProc(Denninger et al., 2020)中渲染 RGB 与深度观测。

为生成细粒度或长时程任务语言指令,我们首先基于轨迹几何信息提取关键帧(如急转弯对应帧),据此将整条轨迹切分为若干子片段;再用开源多模态大模型 LLaVa-OneVision(Li et al., 2024)为每个子片段生成细粒度语言指令。由于生成指令的语言风格有限,我们再用 Qwen3-72B(Yang et al., 2025)改写各片段指令,并将所有子片段汇总为一条长时程任务指令。按图 3 所示流水线,我们得到大规模导航数据集 VLN-N1;数据占比与统计指标见图 2。

在这里插入图片描述

图 2. VLN-N1 数据集概览:左图为数据占比,右图为标注指令中的关键词。

在这里插入图片描述
图 3. VLN-N1 数据集处理流水线。

3.2 VLN-CE

VLN-CE 子集源自既有视觉-语言导航基准,包括 VLN-CE(Krantz et al., 2020b)、EnvDrop(Tan et al., 2019)与 ScaleVLN(Wang et al., 2023a),面向通用室内导航模型训练。我们使用 Habitat 仿真器(Szot et al., 2021)从 Matterport3D 与 HM3D 渲染场景,并回放 episode 采集数据。具体地,利用 Habitat 内置 ShortestPathFollower,按预定义参考路径生成轨迹,每条路径对应对齐的细粒度自然语言指令。动作空间遵循 Habitat 默认 VLN 配置,包含四个离散动作:MOVE_FORWARD(0.25 m)、TURN_LEFT(15°)、TURN_RIGHT(15°)与 STOP。对每个 episode 记录 RGB 观测及其对应动作序列。共采集 332,179 个 episode,覆盖 Matterport3D 与 HM3D 上 856 个独特场景。为适配 System 2 训练,我们将原始轨迹切分为多个片段,并把智能体位置投影到二维图像平面作为像素目标标签(详见第 4.2 节)。

3.3 VLN-PE

VLN-PE 旨在通过在物理仿真平台 InternUtopia(Wang et al., 2024a)中采集反映真实机器人运动的数据,弥合 VLN 的 sim-to-real 差距。与 VLN-N1、VLN-CE 不同,VLN-PE 在数据采集中显式纳入机器人本体与运动策略。我们使用多样平台:四足(Unitree AlienGo)、人形(Unitree H1、G1)与轮式(Jetbot),并以既有基于学习的运动控制器(Long et al., 2024a,b; Pan et al., 2025)驱动运动。每个机器人按与自然语言指令对齐的预定义导航路径执行,得到对应第一人称观测。语言指令与路径主要来自 R2R(Anderson et al., 2018a)并经修改:排除当前运动策略尚无法稳健处理的楼梯穿越(上下楼)episode。最终 VLN-PE 包含来自 Matterport3D 的 61 个场景、8,679 个 episode。


4. 方法

4.1 总览

如图 4 所示,InternVLA-N1 采用组合式双系统架构,协同融合高层指令理解与低层动作执行:

  • System 2:基于视觉-语言模型(VLM)的规划模块,通过图像 grounding 推理解释导航指令并预测中期航点目标。通过在图像空间预测像素坐标,有效连接指令理解与空间推理,支撑长时程导航指令跟随。
  • System 1:由潜在规划或显式目标引导的多模态目标条件扩散策略,基于当前观测与来自 System 2 的异步潜特征生成可执行短时程轨迹,实现复杂环境中的稳健实时控制与局部决策。

为充分释放双系统架构的开放世界泛化与异步推理能力,我们设计课程训练方案:先在同步设定下用显式目标分别训练各系统以获得基础导航技能;再引入联合微调阶段——向 System 2 注入可学习 token 作为隐式中期目标以降低像素目标歧义,同时向 System 2 喂入延迟观测,迫使 System 1 适应异步执行。

在这里插入图片描述

图 4. InternVLA-N1 框架总览。System 2 感知长时程多模态输入,并以约 2 Hz 翻译为中期潜在规划;System 1 处理异步潜在规划与短期视觉观测,实现实时决策。

4.2 System 2:基于像素定位的 VLM 规划

我们将目标规划模块建立在 Qwen2.5-VL(Bai et al., 2025)之上——一个强大的开源视觉-语言模型,具备空间定位能力。Qwen2.5-VL 包含视觉编码器、语言模型与轻量多模态连接器三部分,可直接预测像素坐标以响应空间查询,特别适合指代表达理解与视觉问答等细粒度定位任务。

为将 Qwen2.5-VL 适配 VLN,我们将高层规划形式化为最远像素目标预测问题:模型以第一人称图像序列与语言指令为输入,预测图像中对应下一偏好导航航点的二维坐标。我们在 InternData-N1 的 VLN-CE 子集上微调 Qwen2.5-VL。通过度量智能体位置与相机视野之间的可见性,将每条原始 VLN-CE 轨迹划分为多个最远像素预测训练样本,最终生成超过 500 万 样本以对齐导航规划任务。此外,System 2 还负责在任务完成时决定何时停止,以及在图像中未检测到合适导航航点时进行原地旋转。相较直接动作预测,该方法为多模态理解与空间决策架起了更高效的桥梁。

4.3 System 1:多目标条件扩散策略

System 1 是面向实时避障与路径规划的扩散局部导航策略,架构类似我们先前工作 NavDP(Cai et al., 2025):同时预测导航轨迹及其安全性分数以供轨迹选择。为提升不同目标类型下的导航性能,我们引入显式目标嵌入对齐作为额外训练目标。

我们将点目标(point-goal)视为通用且无歧义的目标规约形式,加入两个辅助预测头:分别以图像目标与像素目标嵌入为输入,并以点目标为标签监督。目标对齐损失与动作损失、critic 损失共同构成总体训练目标。通过目标对齐,各类导航任务被隐式转化为点目标导航,从而显著降低学习复杂度。System 1 使用 VLN-N1 子集训练。

4.4 分层联合训练

阶段 1:单系统预训练。
System 2 的训练始于已在大规模图文语料上预训练的 Qwen2.5-VL 7B。我们通过任务自适应监督微调将其适配为导航专用规划:使用由导航指令、第一人称观测与中期航点构成的成对轨迹;每个中期航点表示为当前观测图像像素空间中的二维坐标。训练时,视觉编码器、跨模态连接器与语言模型在我们整理的 SFT 数据上联合优化 1 个 epoch,学习在上下文中解释指令并预测与预期导航航点对齐的像素级目标位置。

System 1 除 DepthAnything(Yang et al., 2024)RGB 编码器外均从零训练,主要目标有三:不同目标间的嵌入对齐、扩散策略的噪声预测、以及 critic 预测。对嵌入对齐,我们增加两个辅助点目标预测任务,分别以图像目标编码或像素目标编码为输入,帮助从零训练的目标编码器捕获导航关键表示。记图像目标为 (I_g \in \mathbb{R}^{C \times H \times W}),像素目标为 (c_g=(u,\nu)),当前 RGB 观测为 (I_t \in \mathbb{R}^{C \times H \times W}),点目标为 (p_g=(x,y,\theta))。为编码像素目标 (c_g),先将其转换为图像掩码 (M_g):仅在 ((u,\nu)) 附近局部置 1,其余为 0。再用两个从零训练的 ViT 编码器分别融合 ((I_g,I_t)) 与 ((M_g,I_t))。编码嵌入 (z_i=f_{img}(I_g,I_t)) 与 (z_p=f_{pix}(M_g,I_t)) 再经额外 MLP 预测估计的点目标。目标对齐损失为:

[
\mathcal{L}^{\text{goal}} = \frac{1}{N}\sum_{i=1}{N}\left|\mathrm{MLP}(z_{img})-p_g\right|2 + \frac{1}{N}\sum_{i=1}{N}\left|\mathrm{MLP}(z_{pix})-p_g\right|2 \tag{1}
]

扩散过程与 critic 预测的训练损失遵循 NavDP。我们联合优化动作损失、critic 损失与目标对齐损失,并用权重系数平衡,设置为 (\alpha=0.8)、(\beta=0.2)、(\gamma=0.5)。总体目标为:

[
\mathcal{L}^{\text{system1}} = \alpha\cdot\mathcal{L}^{\text{act}} + \beta\cdot\mathcal{L}^{\text{critic}} + \gamma\cdot\mathcal{L}^{\text{goal}} \tag{2}
]

阶段 2:多系统联合微调。
用二维像素准确表示三维导航目标存在歧义,且在嵌入式设备上对 7B VLM 进行高速推理也很困难。因此,连接不同系统的中间特征设计至关重要:它应在不损害原系统效率与表征能力的前提下,使功能互补的系统间有效信息流动。我们不直接使用混杂大量异构信息的 VLM 隐状态,而是引入一组可学习潜在查询(latent queries);其输出潜特征作为紧凑中间量,通过 prompt tuning 桥接 VLM 与扩散策略模型。同时,我们调整两系统输入的时间对齐以适配异步执行:System 1 在时刻 (T) 接收最新观测,而 System 2 的 RGB 记忆输入采样自更早时刻区间 ((0, T-K)),其中 (K) 从 ((0,12)) 随机采样。这种时间解耦使双系统框架更好适应异步执行。

4.5 扩展:用世界模型学习更好的潜在规划

为构建更好的潜在规划表示,我们引入扩展:使用预测式世界模型解码器生成朝向中期目标的第一人称观测序列。该范式可能导向基于互联网视频的可扩展训练,并隐式增强动态环境中的预测能力。具体地,我们采用预训练 1.3B Wan2.1 模型(Wan et al., 2025)作为骨干,将其原始 T5 编码器(Raffel et al., 2020)替换为 System 2 生成的潜在规划 token。在 InternData-N1 导航数据上微调后,世界模型能够以高预测精度、在 System 2 潜在规划条件下模拟未来结果。


5. 实验

5.1 System 2 评估

数据集与评估指标。 我们在 Habitat 仿真器的 VLN-CE 设定下,于 R2R-CE(Anderson et al., 2018a)与 RxR-CE(Ku et al., 2020)基准上评估 System 2。这些基准在 Matterport3D 环境中模拟真实室内导航,要求智能体在连续控制下跟随自然语言指令。R2R-CE 提供相对较短路径的英文指令;RxR-CE 则是更大规模、轨迹更长且更多样的多语言基准。

为评估泛化能力,所有实验均在两个基准的 validation unseen 划分上进行。遵循先前工作,采用标准 VLN 指标:导航误差 NE(到目标最终距离)、成功率 SR(停在目标 3 米内的 episode 比例)、Oracle 成功率 OSR(路径上最佳点是否到达)、以及路径长度加权成功率 SPL(惩罚过长轨迹)。这些指标综合评估指令跟随的有效性与效率。

主要结果。 我们与三类 VLN 基线比较:(1)使用全景、里程计与深度的传感器丰富基线(如 HPN+DN、CMA、GridMM、ETPNav);(2)使用深度与单第一人称 RGB、但不依赖大规模视觉-语言模型的 VLN 方法(如 CM2、LAW、WS-MGMap);(3)仅用单 RGB 输入的基于 Video-LLM 的 VLN 模型(如 NaVid、MapNav、NaVILA、UniNaVid)。InternVLA-N1 在两种设定下评估:仅 RGB(S2)与 RGB+Depth(S1+S2)。如表 2 所示,我们的仅 RGB 变体已超越所有既往 RGB 方法:在 R2R Val-Unseen 上达到 SR 55.4%SPL 52.1%,超过 NaVILA(SR 54.0%、SPL 49.0%)与 MapNav(SR 39.7%、SPL 37.2%)。

表 2. VLN-CE R2R 与 RxR Val-Unseen 上与 SOTA 方法对比

* 表示使用 Hong et al.(2022)航点预测器的方法。† 表示使用超出 R2R-CE 与 RxR-CE 基准的额外训练数据的方法。
在这里插入图片描述

Method Pano. Odo. Depth S.RGB R2R NE↓ R2R OS↑ R2R SR↑ R2R SPL↑ RxR NE↓ RxR SR↑ RxR SPL↑ RxR nDTW↑
HPN+DN* 6.31 40.0 36.0 34.0 - - - -
CMA* 6.20 52.0 41.0 36.0 8.76 26.5 22.1 47.0
Sim2Sim* 6.07 52.0 43.0 36.0 - - - -
GridMM* 5.11 61.0 49.0 41.0 - - - -
ETPNav* 4.71 65.0 57.0 49.0 5.64 54.7 44.8 61.9
ScaleVLN* 4.80 - 55.0 51.0 - - - -
InstructNav 6.89 - 31.0 24.0 - - - -
AG-CMTP 7.90 39.2 23.1 19.1 - - - -
R2R-CMTP 7.90 38.0 26.4 22.7 - - - -
LAW 6.83 44.0 35.0 31.0 10.90 8.0 8.0 38.0
CM2 7.02 41.5 34.3 27.6 - - - -
WS-MGMap 6.28 47.6 38.9 34.3 - - - -
ETPNav+FF 5.95 55.8 44.9 30.4 8.79 25.5 18.1 -
Seq2Seq 7.77 37.0 25.0 22.0 12.10 13.9 11.9 30.8
CMA 7.37 40.0 32.0 30.0 - - - -
NaVid 5.47 49.1 37.4 35.9 - - - -
MapNav 4.93 53.0 39.7 37.2 - - - -
NaVILA 5.37 57.6 49.7 45.5 - - - -
NaVILA† 5.22 62.5 54.0 49.0 6.77 49.3 44.0 58.8
UniNaVid† 5.58 53.3 47.0 42.7 6.24 48.7 40.9 -
InternVLA-N1 (S2)† 4.89 60.6 55.4 52.1 6.41 49.5 41.8 62.6
InternVLA-N1 (S1+S2)† 4.83 63.3 58.2 54.0 5.91 53.5 46.1 65.3

5.2 System 1 评估

数据集与评估指标。 为评估 System 1 的泛化与鲁棒性,我们基于 IsaacSim 构建仿真基准以反映真实部署中的潜在 sim-to-real 差距。场景包含两类:带杂乱障碍的随机生成布局,以及覆盖住宅与商业环境的专业设计布局(Wang et al., 2024a)。评估场景概览见图 5。全部评估环境分为四个子集:ClutterEnv-Easy(10)、ClutterEnv-Hard(10)、InternScenes-Home(20)、InternScenes-Commercial(20)(括号内为场景资产数量)。在轮式机器人上评估三类局部导航任务:无目标探索测量 Episode Time 与 Explore Area;点目标与图像目标导航评估 SR 与 SPL(到达目标点 1.0 m 内视为成功)。每项任务在每个场景中随机初始化并评估 100 个 episode。

在这里插入图片描述

图 5. 用于 System 1 评估的 ClutteredEnv 与 InternScenes 场景概览。上行来自 ClutterEnv,下行来自 InternScenes-Home。

主要结果。 我们与多样基线比较:图像目标/无目标任务上的 GNM、ViNT、NoMad;点目标导航上的 DD-PPO、iPlanner、ViPlanner。主要结果见图 6、7、8。System 1 具备若干使其大幅超越基线的独特能力:(1)分布外场景中的稳健避障:尽管训练数据大多来自室内,其在 ClutterEnv 无目标探索上仍比 NoMad 高出约 2.7×;(2)高效一致的路径规划:在复杂室内布局的 InternScenes 中,更擅长推断区域连通性,成功率比先前方法高约 10.9%;(3)图像驱动探索:当目标图像较远时多数局部导航方法会失败,而我们的模型能自适应平衡探索与利用,平均比先前方法高约 27.1%

在这里插入图片描述

图 6. 无目标探索任务上的 System 1 指标:InternVLA-N1(S1) 性能分数超过基线 2 倍以上。
图 7. 点目标导航任务:InternVLA-N1(S1) 在所有环境中持续超越先前 SOTA。
在这里插入图片描述

图 8. 图像目标导航任务:InternVLA-N1(S1) 平均比基线高约 27.1%。

5.3 双系统评估

数据集与评估指标。 我们首先在与 System 2 相同的 VLN-CE 基准上评估双系统:用我们的 System 1 替换 Habitat-Sim 默认点目标导航策略。进一步在 VLN-PE(Wang et al., 2025b)上评估——该物理真实 VLN 平台与基准可模拟真实部署中的机器人动力学与控制误差。我们在 VLN-PE 中考虑 R2R 数据集与人形机器人 Unitree H1。

遵循标准 VLN 评估协议,采用五类主要指标:TL(轨迹平均长度,米)、NE(最终停止位置到目标平均距离)、SR(成功到达概率;停在目标 3 m 半径内视为到达)、OS(轨迹任一点到达目标的概率)、SPL(兼顾 SR 与 TL)。物理仿真另加两项:FR(跌倒率)、StR(卡住率)。

主要结果。 表 2 显示:相对单独 System 2,双系统在 R2R 与 RxR 上分别再提升约 2.8%4.1% 的成功率,凸显两系统协同及 System 1 在避障与路径规划上的优势。基线包括 Seq2Seq、CMA、RDP 与 NaVid。

表 3. VLN-PE(物理运动控制器)评估指标

在这里插入图片描述

Method Seen TL↓ NE↓ FR↓ StR↓ OS↑ SR↑ SPL↑ Unseen TL↓ NE↓ FR↓ StR↓ OS↑ SR↑ SPL↑
Random 0.14 8.24 0.30 0 0.30 0.30 0.30 0.11 7.78 0.74 0 3.34 3.04 2.30
在 VLN-PE 上训练
Seq2Seq 10.61 7.53 27.36 4.26 32.67 19.75 14.68 10.85 7.88 26.80 5.57 28.13 15.14 10.77
Seq2Seq+ 10.22 7.75 33.43 3.19 30.09 16.86 12.54 9.88 7.85 26.27 6.52 28.79 16.56 12.7
CMA 11.13 7.59 23.71 3.19 34.94 21.58 16.10 11.16 7.98 22.64 3.27 33.11 19.15 14.05
CMA+ 8.86 7.14 23.56 3.50 36.17 25.84 21.75 8.70 7.26 21.75 3.27 31.40 22.12 18.65
RDP 13.26 6.76 27.51 1.82 38.60 25.08 17.07 12.70 6.72 24.57 3.11 36.9 25.24 17.73
从 VLN-CE 零样本迁移
Seq2Seq† 7.80 7.62 20.21 3.04 19.30 15.20 12.79 7.73 7.18 18.04 3.04 22.42 16.48 14.11
CMA† 6.62 7.37 20.06 3.95 18.54 16.11 14.64 6.58 7.09 17.07 3.79 20.86 16.93 15.24
NaVid 7.54 6.20 11.25 0.46 24.32 21.58 17.45 7.12 5.94 8.61 0.45 27.32 22.42 18.58
InternVLA-N1 10.46 4.71 15.50 1.06 57.60 53.34 44.53 9.74 4.73 12.55 3.04 56.72 50.63 43.31

+:先在 Habitat 训练再在 VLN-PE 微调。†:使用数据增强训练。

尽管 InternVLA-N1 用任何来自 VLN-PE 的 H1 机器人数据微调,仍显著超越所有在 VLN-PE 上训练的模型,SR 至少提升约 17%;相对零样本迁移表现较好的单系统 NaVid,SR 与 SPL 分别提升约 20.21%17.22%,凸显双系统集成的强泛化与鲁棒性。

表 4. VLN-PE(flash controller)评估指标

Method Seen TL↓ NE↓ FR↓ StR↓ OS↑ SR↑ SPL↑ Unseen TL↓ NE↓ FR↓ StR↓ OS↑ SR↑ SPL↑
在 VLN-PE 上训练
Seq2Seq 34.59 12.45 0.45 0 48.02 19.0 12.7 19.24 8.27 0.22 0 43.05 15.74 9.70
CMA 151.60 141.50 1.52 0 46.05 19.15 13.71 40.21 31.24 0.22 0 45.06 20.94 14.06
RDP 15.68 7.18 1.06 0 43.30 25.84 18.22 15.12 6.98 0.30 0 42.54 24.94 17.54
从 VLN-CE 零样本迁移
InternVLA-N1 11.22 3.58 0 0 75.23 68.84 61.33 10.11 4.13 0.45 0 67.63 60.36 54.93

由于 flash controller 直接将智能体瞬移到目标坐标,智能体几乎不会卡住,也很少跌倒。排除运动动力学与卡住挑战后,InternVLA-N1 表现进一步提升,相对在 VLN-PE 上训练的模型 SR 至少提高约 35%

5.4 扩展:世界模型定性结果

世界模型被微调为以 System 2 生成的潜在规划 token 为条件,生成描绘朝向预期目标导航的第一人称视频序列。我们在仿真与真实环境中评估生成视频质量。定性结果(图 9)表明:世界模型能有效生成朝向可视化像素级目标的逼真导航轨迹,同时保留细粒度视觉细节并维持一致几何结构。此外,引入视频预测目标可加速联合调优:在 R2R-CE 上达到最优评估性能所需训练 epoch 从 4 降至仅 2

在这里插入图片描述

图 9. InternVLA-N1 世界模型定性结果。上两行为真实场景预测,下两行为未见仿真场景结果。示例指令包括上楼找橙色咖啡雕塑、进入办公区到白板旁工位、穿过客厅到户外门廊、进入厨房并在白灯罩落地灯左侧停下等。

5.5 真实世界实验

实验设置。 我们在轮式(Turtlebot4)、四足(Unitree Go2)与人形(Unitree G1)机器人上进行真实实验。均配备 Intel RealSense D455 相机,安装高度不同但均向下倾斜 (15^\circ)。整系统部署在配备 RTX 4090 的远程机器上,InternVLA-N1 约占 20 GB GPU 显存。我们在多个室内外场景评估零样本指令跟随与避障性能。

流水线与速度。 给定初始 VLN 指令后,机器人持续采集实时对齐的 RGB & Depth 图像并传输到远程服务器推理。服务器在后台异步推理双系统模型,并向机器人返回最新轨迹或离散动作。轨迹根据推理图像时刻的里程计变换到世界坐标,并由 MPC 控制器跟踪。我们在 System 2 多轮对话中复用 KV-cache,将轨迹 token 推理从约 1.1 s 加速到约 0.7 s。经 TensorRT 优化,System 1 可在约 0.03 s 内并行生成 32 条轨迹。得益于异步流水线与推理优化,机器人可在上一条轨迹跟踪结束后获得更新轨迹,运动更平滑。到达语言指令目标时 System 2 输出 STOP。真实实验成功条件:(1)与所有静态/动态障碍保持无碰撞;(2)经过全部期望地标并在期望目标处停下。

主要结果。 我们在办公室、食堂、街道与便利店等代表性场景评估。所有真实实验均为零样本,未采集任何场景特定数据微调。定性结果见图 10。得益于双系统模式,InternVLA-N1 可感知动态环境的高频图像,并规划反应式无碰撞轨迹以完成长时程 VLN(Panel 1)。食堂评估(Panel 2)显示系统在杂乱环境中选择正确像素目标并生成安全轨迹。对长时程指令跟随与语义理解,系统在办公室与街道(Panel 3 & 4)规划平滑轨迹经过全部地标并停在最终目标。全过程对动态行人、楼梯与变化光照具有鲁棒性。此外,Panel 5 & 6 测试类人短指令(而非训练集中的逐步指令),机器人在部分情形下也能理解并完成任务。InternVLA-N1 跨真实平台稳健:尽管不同机器人在相机高度、振动与跟踪性能上有差异,仍能良好完成 VLN。更多演示见项目主页。

基线与指标。 为定量评估真实场景中的鲁棒性与泛化,我们在走廊(简单 VLN 指令)、卧室(单房间中等指令)与办公室(房间到房间困难指令)场景中,与 CMA、NaVid、NaVILA 及我们先前工作 StreamVLN(输出离散动作)比较。每个模型在每个场景进行 20 次实验,观察 SR 与 NE。定量与定性结果见图 11、12。轻量模型 CMA 仅能在简单场景与指令下完成 VLN,SR 显著低于基于 VLM 的方法——后者受益于基础模型的强视觉-语言理解能力。在 VLM 方法中,NaVid 行进一段后易原地旋转,复杂指令下失败;NaVILA 具备长时程跟随能力,但在复杂办公室场景中常无法按语言指令导航到最终目标;StreamVLN 在长时程静态场景表现优越,但行人等动态障碍阻挡时 SR 较低。相对地,InternVLA-N1 双系统在静态与动态场景均取得良好 SR 与 NE,可规避环境中的动态行人并成功完成最终 VLN 任务。

在这里插入图片描述
在这里插入图片描述


6. 结论

本报告介绍 InternVLA-N1——首个双系统视觉-语言导航基础模型。我们的异步框架在统一架构中整合多模态推理、指令跟随、长时程规划与实时动态避障。这些能力在开放世界设定中展现强零样本泛化,并可直接部署到多样机器人平台。该领域长期面临导航数据规模有限的挑战;为此我们同步发布大规模高质量数据集 InternData-N1,以支持复杂导航任务。希望全部开源资源惠及更广泛研究社区,并推动具身智能与机器人导航持续进步。


参考文献

参考文献条目保留原文英文著录(与论文一致)。完整列表见原 PDF 第 18–24 页,或本地渲染页:

完整参考文献亦可直接查阅原 PDF:InternVLA_N1.pdf。本地已下载全部 25 页渲染图:internvla_n1_assets/page-01.pngpage-25.png

点击展开:主要参考文献条目(节选,按原文顺序)
  • An et al., 2022. BevBert: Multimodal map pre-training for language-guided navigation. arXiv:2212.04385
  • An et al., 2023. ETPNav: Evolving topological planning for VLN in continuous environments. arXiv:2304.03047
  • Anderson et al., 2018a/b. Vision-and-language navigation. CVPR
  • Bai et al., 2025. Qwen2.5-VL technical report. arXiv:2502.13923
  • Bjorck et al., 2025. GR00T N1. arXiv:2503.14734
  • Bu et al., 2024/2025. Dual-system / UniVLA. arXiv
  • Cai et al., 2025. NavDP. arXiv:2505.08712
  • Cheng et al., 2025. NaVILA. RSS
  • Kahneman, 2011. Thinking, Fast and Slow
  • Krantz et al., 2020b. Beyond the nav-graph: VLN in continuous environments. ECCV
  • Shah et al., 2023a/b. GNM / ViNT
  • Sridhar et al., 2024. NoMad
  • Wan et al., 2025. Wan: Open and advanced large-scale video generative models. arXiv:2503.20314
  • Wei et al., 2025. StreamVLN. arXiv:2507.05240
  • Zhang et al., 2024/2025a. NaVid / Uni-NaVid. RSS
  • …(其余条目见原文)

附录 A. 作者贡献

所有贡献者按姓氏字母序排列。

A.1 核心贡献者(Core Contributors)

Wenzhe Cai, Delin Feng, Yu Liu, Jiangmiao Pang, Jiaqi Peng, Chenyang Wan, Hanqing Wang, Liuyi Wang, Tai Wang, Meng Wei, Yuqiang Yang, Xiqian Yu, Chenming Zhu.

A.2 贡献者(Contributors)

Peizhou Cao, Yilun Chen, Zeyu He, Yifei Huang, Wensi Huang, Hengjie Li, Dahua Lin, Jingli Lin, Xihui Liu, Yilin Long, Xiaohan Mao, Yu Qiao, Jiawei Qiu, Yuan Shen, Yukai Wang, Xueyuan Wei, Chao Wu, Zhenyu Yang, Jia Zeng, Yiming Zeng, Siqi Zhang, Jingjing Zhang, Shenghan Zhang, Shi Zhang, Yuchang Zhang, Hui Zhao, Bowen Zhou, Yuanzhen Zhou, Haoyi Zhu, Shaohao Zhu.

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传


BibTeX

@article{wang2025internvla,
  title = {InternVLA-N1: An Open Dual-System Vision-Language Navigation Foundation Model with Learned Latent Plans},
  author = {Intern Robotics},
  booktitle = {Arxiv},
  year = {2025},
}

附录:原论文全页渲染(便于对照图示细节)

页码 内容概要 预览
1 标题、摘要、图1 外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传
2–3 引言 / 相关工作 page-02.pngpage-03.png
4–6 InternData-N1、表1、图2–3 外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传
7–9 方法、图4、公式 外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传
10–14 实验、表2–4、图5–8 外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传
15–17 世界模型、真实实验、图9–12 外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传
18–24 参考文献 page-18.pngpage-24.png
25 附录作者 外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

本地 PDF:internvla_n1_assets/InternVLA_N1.pdf

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐