Trajectory-Diversity-Driven Robust Vision-and-Language Navigation

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Li, Jiangyang, Wan, Cong, Dong, SongLin, Ding, Chenhao, Wang, Qiang, Ma, Zhiheng, Gong, Yihong
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866911519872122880
author Li, Jiangyang
Wan, Cong
Dong, SongLin
Ding, Chenhao
Wang, Qiang
Ma, Zhiheng
Gong, Yihong
author_facet Li, Jiangyang
Wan, Cong
Dong, SongLin
Ding, Chenhao
Wang, Qiang
Ma, Zhiheng
Gong, Yihong
contents Vision-and-Language Navigation (VLN) requires agents to navigate photo-realistic environments following natural language instructions. Current methods predominantly rely on imitation learning, which suffers from limited generalization and poor robustness to execution perturbations. We present NavGRPO, a reinforcement learning framework that learns goal-directed navigation policies through Group Relative Policy Optimization. By exploring diverse trajectories and optimizing via within-group performance comparisons, our method enables agents to distinguish effective strategies beyond expert paths without requiring additional value networks. Built on ScaleVLN, NavGRPO achieves superior robustness on R2R and REVERIE benchmarks with +3.0% and +1.71% SPL improvements in unseen environments. Under extreme early-stage perturbations, we demonstrate +14.89% SPL gain over the baseline, confirming that goal-directed RL training builds substantially more robust navigation policies. Code and models will be released.
format Preprint
id arxiv_https___arxiv_org_abs_2603_15370
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
Li, Jiangyang
Wan, Cong
Dong, SongLin
Ding, Chenhao
Wang, Qiang
Ma, Zhiheng
Gong, Yihong
Computer Vision and Pattern Recognition
Vision-and-Language Navigation (VLN) requires agents to navigate photo-realistic environments following natural language instructions. Current methods predominantly rely on imitation learning, which suffers from limited generalization and poor robustness to execution perturbations. We present NavGRPO, a reinforcement learning framework that learns goal-directed navigation policies through Group Relative Policy Optimization. By exploring diverse trajectories and optimizing via within-group performance comparisons, our method enables agents to distinguish effective strategies beyond expert paths without requiring additional value networks. Built on ScaleVLN, NavGRPO achieves superior robustness on R2R and REVERIE benchmarks with +3.0% and +1.71% SPL improvements in unseen environments. Under extreme early-stage perturbations, we demonstrate +14.89% SPL gain over the baseline, confirming that goal-directed RL training builds substantially more robust navigation policies. Code and models will be released.
title Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2603.15370