具身智能之VLN-R1:怎样用强化微调训练视觉语言导航智能体
写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
导读
Vision-Language Navigation(VLN)要求智能体听懂“穿过厨房,左转,在卧室门口停下”这类指令,并在环境中走到目标位置。早期导航方法大多在预先构建的拓扑图上选择下一个节点;即便采用大语言模型,也经常先把视觉观察转成文本,或把可行动作限制在离散路点之间。这样的系统便于规划,却难以对应真实机器人持续移动、转向和纠错的过程。
VLN-R1 选择了一条更端到端的路线:把第一人称视频流、历史观测和语言指令交给 Qwen2-VL,直接输出 FORWARD / TURN-LEFT / TURN-RIGHT / STOP 四类原子动作;训练先用专家轨迹做监督微调(SFT),再借鉴 DeepSeek-R1 的 Group Relative Policy Optimization(GRPO)进行强化微调(RFT)。它为导航序列设计了 Time-Decayed Reward(TDR):越靠近当前时刻的正确动作,奖励权重越高。
论文的论证顺序是:Introduction 和 Related Work 先说明离散图与模块化视觉处理的局限;Methodology 依次介绍 GRPO、VLN-Ego 数据引擎、SFT 与 RFT;Experiments 检验连续导航、跨域迁移和关键设计的消融;最后明确模拟环境与离散动作空间仍是主要边界。

图 1:VLN-R1 将导航输入改为第一人称视频,并把 LVLM 的输出改成连续环境中的原子动作序列;训练分为文本监督的 SFT 与奖励驱动的 RFT。来源:论文 Figure 1。
猫先生认为,VLN-R1 的核心不只是“把 RL 用到导航上”。它把视觉语言模型的文本续写能力改造成可验证的多步动作预测,再让奖励函数明确区分“眼前一步走对”和“遥远未来猜对”。
- 论文标题:VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
- 论文地址:https://arxiv.org/abs/2506.17221
- 项目主页:https://vlnr1.github.io/
- 论文源码:https://arxiv.org/e-print/2506.17221
原文脉络
原文 Section 1 将问题从离散 VLN 推向连续 VLN-CE;Section 2 回顾连续导航、LLM/LVLM 导航与强化后训练三条研究线。Section 3 是核心:3.1 给出 RLVR/GRPO 预备知识,3.2 构建 VLN-Ego,3.3 用 Long-Short Memory Sampling 做 SFT,3.4 以 TDR 做 RFT。Section 4 依次报告实现细节、主结果和消融,Section 5 总结并讨论限制。
1–2. Introduction 与 Related Work:连续导航不能只是在图上换一个规划器
离散 VLN 中,环境通常被编码成可跳转的节点图,智能体在节点之间移动。图结构提供了干净的候选集合,但也把“往前走一点、转 30 度、发现走错后修正”压缩成对既定连边的选择。连续 VLN-CE 虽允许低层控制,却常依赖深度图、导航图、CLIP 等额外模块,系统的视觉理解、路径规划和动作执行仍然分离。
LLM 进入 VLN 后,常扮演语言规划器:图像先被外部视觉模型描述成文本,再由语言模型选择路线。VLN-R1 认为这种串联会积累视觉描述误差,并且难以充分利用 LVLM 的原始视觉表征。它保留四个离散原子动作,却让这些动作在 Habitat 的连续物理环境中执行;“连续”指的是移动与观测过程不再依赖预给路点,而不是让网络直接回归任意线速度和角速度。
强化微调是另一条关键背景。数学、代码任务中,GRPO 可以凭可验证答案给模型相对优势信号;导航没有一段天然唯一的推理文本,却有专家未来动作序列。论文的转化是:将每一步动作是否正确变成软的时序奖励,而非把整段输出只判为对或错。
3. Methodology:从视频记忆到时间敏感的动作奖励
3.1 Preliminary:为什么选择 GRPO,而不是只做动作文本监督
VLN-R1 使用 RL with Verifiable Rewards 的思路。对同一输入,策略采样一组动作序列,按回报在组内归一化得到相对优势;GRPO 不需要额外训练 critic 或奖励模型,同时用 KL 项约束新策略不要偏离 SFT 参考策略。直观地说,模型不是只记住某条专家答案,而是在同一段视频和指令下,比较多种候选动作序列,强化相对更接近目标轨迹的那一组。
这一选择适合导航的前提是奖励可以验证。论文并未从真实环境成功率直接回传稀疏奖励,而是使用未来动作标注构造密集信号。因此它更接近“带序列结构的专家动作后训练”,优势是训练稳定、样本效率高;局限是奖励仍受演示轨迹定义约束。
3.2 Dataset Engine:VLN-Ego 将连续轨迹改写为可训练的视觉语言样本
VLN-Ego 由 Habitat 仿真器生成,底层使用 Matterport3D 的 90 个场景:61 个训练场景、11 个 val-seen、18 个 val-unseen。数据沿用 R2R 的 7,189 条轨迹和英语 RxR 的 42,023 条轨迹,最终得到约 63 万条 R2R 训练样本和 120 万条 RxR 训练样本。
每个样本由三部分拼成:语言指令、视觉部分、动作部分。视觉部分同时保留历史帧和当前第一人称观察;动作部分给出四个选项,并将未来 6 步专家动作写成文本。这个格式很重要:LVLM 学的不是抽象的“向目标靠近”,而是带有候选符号与动作描述的连续未来序列。

图 2:VLN-Ego 从 Habitat 连续轨迹中收集动作级标注,并将输入拆为 Instruction、Vision、Action 三部分。来源:论文 Figure 2。
3.3 Supervised Fine-Tuning:Long-Short Memory Sampling 保留“刚看见的”和“很早看见的”
均匀采样会把近期转弯线索与很久以前的画面同等对待;单纯指数衰减又容易忘记长路径中早先经过的房间。Long-Short Memory Sampling 将历史分成两段:近端时间窗密集采样,较远历史按更大间隔稀疏采样。它希望同时回答两个导航问题:眼前该不该转弯,以及此前是否已经经过某个地标。
SFT 阶段,模型在指令、历史帧和当前帧条件下自回归生成未来 6 步动作文本,以交叉熵对齐专家序列。动作文本同时含选项标识与自然语言动作描述,例如“向左转 30 度”。这比单一类别标签多了一层语言约束,但本质仍是专家行为克隆:只要整段文本的 token 被平均对齐,模型就很难感知第 1 步错误与第 6 步错误在控制后果上的差别。
3.4 Reinforcement Fine-Tuning:TDR 将多步预测变成位置敏感的优化目标
RFT 沿用同样的输入输出格式,但只从生成文本中抽取动作序列。对第 t t t 个未来动作,若预测 a ^ t \hat a_t a^t 与专家 a t a_t at 一致就得到 1,否则为 0;再以指数衰减为更近动作分配更高权重:
r T D R = ∑ t = 1 T γ t − 1 I [ a ^ t = a t ] , 0 < γ < 1 r_{\mathrm{TDR}}=\sum_{t=1}^{T}\gamma^{t-1}\,\mathbb{I}[\hat a_t=a_t],\qquad 0<\gamma<1 rTDR=t=1∑Tγt−1I[a^t=at],0<γ<1
第一个动作最能改变接下来看到的画面,也最值得被严格优化;较远动作仍被计入回报,但不会与近期动作等权。随后 GRPO 在一组采样结果内根据相对回报更新策略。

图 3:两阶段训练共享第一人称视频与语言输入,区别在于 SFT 对齐输出文本,RFT 对动作序列施加 TDR。来源:论文 Figure 3。
猫先生认为,TDR 的合理性来自闭环控制,而不只是“指数衰减很常见”。预测错了第一步,智能体的后续观测就会改变,原本正确的第 6 步也失去原语境;因此让近期动作获得更高信用分配,确实比整段 token 等权更贴合导航。
4. Experiments:RFT 是否让更小的 LVLM 学会连续导航?
4.1 Implementation Details:只用 RGB 第一人称视频的设定
作者在 VLN-Ego 上训练 Qwen2-VL-2B 和 Qwen2-VL-7B。SFT 使用 R2R 与 RxR 合计 180 万样本;RFT 从两者各随机取 1 万条,共 2 万样本。评测采用 18 个未见过的 val-unseen 场景,并使用 VLN-CE 的 SR(成功率)、OS(Oracle Success)、SPL(按路径长度加权的成功率)、NE(导航误差)和 TL(轨迹长度)。这是一项只输入自我视角 RGB 视频的比较,不使用深度、里程计或全局地图。
4.2 Main Results:RFT 在 R2R 与 RxR 上都带来明显提升
R2R val-unseen 上,2B 的 SFT 模型 SR/SPL 为 21.2/15.9,经过 RFT 后升至 25.6/20.5;7B 则从 24.9/17.5 升至 30.2/21.8。论文特别强调,RFT 后的 2B 在若干指标上接近甚至超过 SFT 的 7B,说明后训练信号可以部分替代单纯扩大模型规模。
跨域情形更能说明 RFT 的数据效率:仅在 R2R 做 SFT、再用 1 万条 RxR 样本进行 RFT 时,2B 和 7B 在 RxR 的 SR 分别达到 20.7 与 22.7,高于对应 SFT 的 14.1 与 14.9。这个结论应读成“少量目标域专家动作对齐可显著改善迁移”,而不是 RFT 已经摆脱对目标域轨迹的依赖。
同时,SR、OS 与 SPL 需要一起看。SR 只问最终是否到达,OS 允许沿途曾接近目标,SPL 还会惩罚绕远路;因此 7B RFT 在 R2R 上达到 30.2 SR、41.2 OS、21.8 SPL,说明它既更常抵达目标,也仍保留了一定路径效率。相比之下,RFT 2B 的导航误差并未在所有设置中同步下降,提示后训练提升并不等价于每一种轨迹质量指标都单调变好。这也是后续应报告失败轨迹的原因。
4.3 Ablation Study:动作长度、记忆采样与奖励形状都在起作用
消融使用 Qwen2-VL-7B 与 R2R。SFT 阶段预测未来 6 步动作的 SR 为 24.9,高于单步(15.1)、4 步(21.4)和 8 步(22.7);Long-Short Memory Sampling 的 SR 也是 24.9,高于平均采样与指数衰减。RFT 中,组采样数从 2 提高到 8 时 SR/OS 达到 30.2/41.2;奖励函数方面,指数时间衰减同样取得 30.2/41.2,优于硬奖励(23.8/32.3)、全动作等权(25.0/33.0)和线性加权(28.3/33.6)。

图 4:定性轨迹展示了 VLN-R1 的闭环执行过程;它说明模型能随视角变化持续产生动作,但不能替代大规模真实环境鲁棒性评测。来源:论文 Figure 4。
5. Conclusion and Limitation:一条面向连续 VLN 的后训练路线,而非真实机器人导航终点
VLN-R1 将 LVLM 的第一人称视频理解、六步动作预测和 GRPO 后训练放进同一条连续 VLN 链路。VLN-Ego 提供了可验证的动作级监督,Long-Short Memory Sampling 解决视频历史的取舍,TDR 则把序列错误的时间位置写进奖励。实验支持这套组合在 VLN-CE 及小样本跨域迁移中有效。
论文自己也给出两项关键限制:评测只在室内仿真环境进行,真实世界中的视觉噪声、动力学与安全约束尚未验证;动作空间仍是四个离散原子动作,不能覆盖精细的连续速度控制。再进一步说,TDR 依赖专家未来动作作为奖励参照,面对多条同样可行的路径或在线探索时,还需要更接近任务成功与安全约束的奖励设计。
猫先生认为,这篇工作最值得带走的是一个可迁移的后训练范式:先将具身任务改写为可验证的多步输出,再让奖励尊重控制中的时间因果。它是否能走向真机,取决于下一步能否用不依赖专家未来序列的信号,处理连续控制和开放环境中的多解路径。
参考资料
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)