写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

导读

导航模型通常沿任务和机器人本体分开发展:VLN 模型学习听指令穿过房间,ObjectNav 模型寻找物体,Tracking 模型跟随特定目标,自动驾驶模型规划车辆轨迹;轮式机器人、四足机器人、无人机和汽车又拥有不同的相机数量、运动尺度与动作空间。每换一个任务或本体,输入组织方式和策略头往往都要重做。

ICLR 2026 论文 NavFoM 尝试把这些分支装进同一个 7B 模型。它以一个或多个相机的 RGB 历史、语言指令和任务状态为输入,统一输出 8 个未来轨迹点;802 万条导航样本覆盖 VLN、目标搜索、视觉跟踪、自动驾驶以及 Web 视频,并混合 476 万条图像/视频问答数据。面对相机位置和历史长度的变化,Temporal-Viewpoint Indicator(TVI)token 标记“哪一时刻、哪个方向”,Budget-Aware Temporal Sampling(BATS)则在固定 token 预算内优先保留近期画面。

一个联合训练 checkpoint 在 7 个公开基准上直接评测,不再为每项任务单独微调。RxR 四视角成功率达到 64.4%,HM3D-OVON 未见类别上的零样本成功率达到 45.2%,EVT-Bench 干扰目标跟踪成功率达到 62.0%。广度并不等于每项都最强:NavSIM 的 PDMS 为 84.3,低于专用 DiffusionDrive 的 88.1;OpenUAV Unseen-Map 的成功率也只有 6.3%。

猫先生认为,NavFoM 的关键价值是把“通用导航”从共享一个 VLM 主干,推进到共享输入语法与轨迹输出接口。TVI 解决不同相机如何进入同一上下文,BATS 解决不同任务时长如何挤进同一预算,任务专用差异则被压缩到轨迹尺度和本地执行器。它证明了联合训练可以互相增益,也暴露了统一模型与专用系统之间仍有性能和部署边界。

  • 论文标题:Embodied Navigation Foundation Model
  • 论文地址:https://arxiv.org/abs/2509.12129
  • 项目主页:https://pku-epic.github.io/NavFoM-Web/
  • 会议:ICLR 2026

NavFoM 将不同本体的视觉输入统一为轨迹或文本输出

NavFoM 在轮式、四足和车辆等真实本体上的导航结果

图 1:NavFoM 用同一模型接收不同相机配置和指令,输出导航轨迹或问答文本,并展示跨任务、跨本体真机结果。来源:论文 Figure 1。

原文脉络

第 1 节把任务割裂与本体割裂视为通用导航的两条边界,第 2 节回顾大模型导航、跨本体策略与跨任务导航。第 3 节依次定义统一轨迹接口、TVI token、BATS、训练数据和系统实现。第 4 节按照 VLN、无人机、寻物、跟踪、自动驾驶和真机实验展开,最后用联合训练、相机数量、历史采样和标识 token 消融解释收益。第 5 节将 NavFoM 定位为导航基础模型的起点,附录补充轨迹归一化、数据处理与远程部署系统。

1—2. 背景与相关工作:任务和本体为何难以共用模型

已有通用导航研究往往只打通一条轴。Uni-NaVid 等跨任务模型能够兼顾 VLN、ObjectNav、问答和跟随,但通常假设相同的室内机器人与相机配置;GNM 等跨本体策略可以从多种机器人经验中学习,又多集中在固定的 image-goal 或 point-goal 任务。自动驾驶和无人机导航因为尺度、视野与控制变量差异更大,通常留在另一套技术栈里。

NavFoM 把导航统一为一个条件轨迹预测问题:移动本体在时刻 T 接收 N 路第一视角 RGB 历史和语言指令,模型预测一组未来 waypoint。地面机器人与汽车的单点动作为 (x, y, yaw),无人机增加高度 z。这种表示避开轮速、关节角和离散转向定义的差异,把各本体的运动学适配留给下游本地规划器。

难点随之转移到视觉上下文。同一批 token 可能来自正前方、侧后方或环视相机,也可能来自刚刚一秒或几十步之前。直接拼接无法告诉 LLM 每张画面的空间与时间来源;完整保留长视频又会让 token 数量和推理时间持续增长。TVI 与 BATS 分别处理这两个问题。

3. Method:为多相机、多时长和多任务设计统一接口

3.1 双分支架构:问答生成文字,导航生成轨迹

NavFoM 的视觉编码、LLM 与双输出头架构

图 2:图像经过 DINOv2、SigLIP、网格池化和跨模态投影后进入 Qwen2-7B;语言头生成回答,规划头从 action token 生成轨迹。来源:论文 Figure 3。

NavFoM 同时保留 QA 和导航两条输出分支。DINOv2 与 SigLIP 分别编码画面,特征在通道维拼接后通过两层 MLP 投影到 Qwen2-7B 的 token 空间。图像问答、视频问答和导航因此共享视觉—语言主干:QA 分支按自回归方式生成文本,导航分支让 LLM 产生一个 action hidden state,再由三层 MLP 规划头输出 8 个 waypoint。

视觉 token 分为两档。最新画面保留 64 个 fine-grained token,用于读取障碍、目标和局部几何;历史帧各压缩为 4 个 coarse-grained token,用较低成本保存路径上下文。导航损失采用轨迹均方误差,QA 使用 next-token 交叉熵,两者联合训练。

不同本体的轨迹尺度相差很大:室内机器人移动数米,无人机和汽车的预测范围可达数十米。作者按室内机器人、UAV 和汽车分别设置尺度因子,把各维 waypoint 归一化到 [-1, 1] 再学习。统一的是输出格式,不是强迫四种本体共享同一物理尺度。

3.1.1 TVI token:给视觉序列加上时间与方位

TVI token 的时间与相机角度表示

图 3:TVI embedding 在二维降维图中同时形成时间方向和环形角度结构。来源:论文 Figure 4。

每组视觉 token 前加入一个 TVI token,由三部分相加得到:可学习的 base embedding、时间编码以及相机方位角编码。角度编码同时对方位角的正弦和余弦做位置编码,使 0° 与 360° 在表示空间中保持相邻,不把环形方向错误地拉成一条直线。

同一套标识根据任务裁剪信息:

  • Image QA 只使用 base,表示后面是一张图;
  • Video QA 使用 base + time,标记帧的时间顺序;
  • Navigation 使用 base + time + angle,同时标记历史和相机方向。

这种“额外插入标识 token”的方式没有直接改写预训练视觉特征。RxR 四视角消融中,TVI 达到 64.4% SR;普通 viewpoint-history positional embedding 只有 52.3%,独立可学习视角 token 为 59.1%。降维可视化与量化结果共同说明,模型确实学到了时间顺序和角度的连续结构。

3.1.2 BATS:固定预算下,近期看得细,远期留线索

多视角视频的 token 数会随导航时长线性增长。BATS 设定总预算 B:未超预算时保留全部历史;超出后按类似遗忘曲线的指数概率采样,越接近当前时刻,帧被保留的概率越高,同时用 0.1 的概率下限为远期历史留下少量机会。相机增加时,每路视觉历史共享同一个总预算,算法重新计算采样强度。

在 2048-token 设置下,BATS 的 RxR SR / SPL / nDTW 为 64.4 / 56.2 / 65.8,统一采样为 62.4 / 54.0 / 63.9。预算从 2048 压到 1024 后,BATS 的 nDTW 只下降 1.7 个点,而统一采样下降 6.0 个点。它没有做复杂的在线 token merging,推理耗时也不会随历史无限增长。

固定预算也带来竞争关系。相机从 1 路增加到 4 路时性能持续上升,扩展到 6 路反而略降;更多相机没有带来足够的新视野,却占用了原本留给历史帧的 token。BATS 解决“总量失控”,还没有解决“不同视角与历史应如何动态竞价”。

猫先生认为,TVI 与 BATS 是 NavFoM 比“大数据混合训练”更可复用的部分。前者把异构传感器写成 LLM 能识别的视觉语法,后者把长时记忆变成显式资源分配;模型的通用性不仅来自见过更多数据,也来自输入接口允许任务和相机发生变化。

3.2 Data:1270 万样本如何组成

NavFoM 与此前导航模型的训练数据规模

图 4:NavFoM 的联合数据包含约 802 万导航样本和 476 万 QA 样本,总量约 1270 万。来源:论文 Figure 7。

导航数据覆盖五个来源:

  • VLN 337 万:R2R、RxR 室内导航与 OpenUAV 室外指令飞行;
  • Object Goal Navigation 102 万:从 HM3D ObjectNav 成功轨迹构造;
  • Active Visual Tracking 89.7 万:来自 EVT-Bench;
  • Autonomous Driving 68.1 万:来自 nuScenes 与 OpenScene;
  • Web-Video Navigation 203 万:Sekai 的 YouTube 视频、VLM 指令与 SLAM 轨迹。

另外混入 315 万图像 QA 和 161 万视频 QA,以保留开放世界视觉语言知识。R2R/RxR 采集时还随机化 1—8 路相机、0.6—1.5 米相机高度及 75°—120° 水平视场角,为跨相机配置提供训练覆盖。

“无需任务专用微调”需要准确理解:NavFoM 用一个联合 checkpoint 直接跑所有基准,没有在评测前为每项任务再训练;但 802 万导航数据本身已经包含 R2R、RxR、EVT、nuScenes、OpenScene 等任务的训练分布。它证明的是联合训练后的跨任务复用,并非对所有导航任务都零样本。真正的零样本证据主要来自 HM3D-OVON 开放词汇测试、只用单视角数据训练却切换到四视角评测等设置。

3.3 Implementation:规模化训练依赖特征缓存

训练使用 56 张 NVIDIA H100,持续约 72 小时,总计 4032 GPU-hours。完整历史若逐帧在线通过两套视觉编码器,计算和显存都会迅速膨胀。作者预先缓存每帧 4 个 coarse visual token,最新画面和 Image QA 仍在线提取 64 个 fine token,使训练速度提高 2.9 倍、GPU 显存降低 1.8 倍。

这种缓存适合监督数据已固定的大规模训练,却意味着视觉编码器看到的是离线历史表征;若未来加入端到端视频增强、在线强化学习或更新视觉主干,缓存需要重新生成。

4. Experiments:广度、迁移与专用模型之间的取舍

4.1—4.2 七个基准上的统一评测

能力与基准 NavFoM 设置 代表性结果 对照与解释
VLN-CE RxR 单视角 SR 57.4 StreamVLN-RGB-only 为 51.8
VLN-CE RxR 四视角 SR 64.4 HNR 使用 RGB-D 与里程计,SR 56.3
HM3D-OVON Unseen 四视角、零样本 SR 45.2 / SPL 31.9 MTU3D 为 40.8 / 12.1
EVT Distracted Target 四视角 SR 62.0 / TR 67.9 TrackVLA 为 57.6 / 63.2
NAVSIM 八视角 PDMS 84.3 DiffusionDrive 为 88.1

VLN、开放词汇寻物和干扰目标跟踪支撑了跨任务收益;自动驾驶则说明统一模型可以进入专业任务,但还没有全面超过专用架构。OpenUAV 同样呈现边界:Unseen-Object SR 为 29.83%,Unseen-Map 只有 6.30%。约 300 米的陌生街区需要大范围探索和更高质量 UAV 数据,固定长度轨迹预测不能替代地图与探索机制。

4.3 真机:110 个可复现实验与系统依赖

NavFoM 与 Uni-NaVid 的真机成功率

NavFoM 在 VLN、目标搜索和跟踪任务中的真机案例

图 5:5 米 × 5 米环境中的 110 个可复现测试,包括 50 个 VLN、30 个搜索和 30 个跟踪案例。NavFoM 成功率分别为 78%、93% 和 86%。来源:论文 Figure 10。

NavFoM 在三类测试中都超过 Uni-NaVid,提升最明显的是跟踪:53% 提高到 86%。作者还展示了 Galbot G1、Unitree Go2、Unitree G1 和 NCS-P3 无人机上的长指令执行,但这部分主要是定性视频,没有给出与 110 个固定案例同等级的跨本体统计。

整套真机系统并非一个纯视觉模型直接输出电机控制。机器人压缩并上传多视角 RGB,远程服务器生成 8 点轨迹,各本体的现成本地规划器再输出速度或关节命令;附录明确说明,本地 API 必要时可以使用 LiDAR 等传感器。主文写远程 RTX 4090,附录和项目页则写 RTX 5090,硬件描述存在不一致。1600-token 预算下模型一次轨迹推理最多约 0.5 秒,执行与上传采用异步方式。

4.4 Ablation:多任务数据在互相补能力

不同任务数据联合训练带来的性能变化

图 6:从单任务数据逐步加入其他导航任务后,VLN、搜索、跟踪和驾驶均提升,其中跨分布的搜索与跟踪增幅最大。来源:论文 Figure 12。

搜索任务只用自身数据时 SR 为 10.3%,加入全部其他任务数据后达到 45.2%;跟踪从 12.6% 提升到 62.0%;VLN 从 57.5% 提升到 64.4%,驾驶 PDMS 从 79.4 提升到 84.3。多视角、开放目标与不同场景之间确实存在可迁移能力。

这组消融同时增加了任务多样性和样本数量,没有提供“总样本数相同、只改变任务构成”的严格对照,因此无法完全区分数据规模与跨任务协同各自贡献。搜索和跟踪的巨大增幅还与训练—评测差异有关:它们的专用训练数据主要是单视角、闭集目标,其他任务恰好补充了多视角和开放目标分布。

5. Discussion and Conclusion:导航基础模型的起点与边界

NavFoM 把四类任务、四类移动本体、1—8 路相机和长短不一的视觉历史组织成一个可训练接口。TVI 负责说明 token 的时间与方向,BATS 控制历史成本,fine/coarse 双尺度保留最新细节与远期线索,轨迹归一化和本地规划器吸收本体差异。联合数据最终让一个 checkpoint 覆盖 7 个公开基准。

“Foundation Model”仍是一项目标而非已经完成的事实。模型依赖 1270 万监督样本、4032 H100 GPU-hours 和远程高端 GPU;专业自动驾驶性能未领先,UAV 陌生地图探索仍弱,跨本体真机证据以定性展示为主,规划头也只是预测短期 8 点轨迹。代码与模型权重在论文及项目页中尚未给出公开入口,可复现性仍取决于后续发布。

猫先生认为,NavFoM 让人看到了一种比“每个机器人训练一个 VLA”更可扩展的导航路线:视觉语言主干共享通用认知,TVI 和 BATS 规范异构观测,轨迹接口连接不同本体。下一步的关键不只是继续扩大混合数据,而是验证模型能否迁移到训练数据里从未出现的新任务、新相机拓扑和新运动学本体,并在相同数据量下证明跨任务协同确实来自能力迁移。

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐