Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xueying, Lyu, Feng, Wu, Hao, Liu, Mingliu, Liu, Jia-Nan, Liu, Guozi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)
por: Guo, Wenxuan, et al.
Publicado: (2026)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
por: Liu, Jiaxing, et al.
Publicado: (2026)
por: Liu, Jiaxing, et al.
Publicado: (2026)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026)
por: Xue, Wei, et al.
Publicado: (2026)
Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
Nav-R1: Reasoning and Navigation in Embodied Scenes
por: Liu, Qingxiang, et al.
Publicado: (2025)
por: Liu, Qingxiang, et al.
Publicado: (2025)
SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation
por: Shi, Xiangyu, et al.
Publicado: (2025)
por: Shi, Xiangyu, et al.
Publicado: (2025)
Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology
por: Wang, Xiangyu, et al.
Publicado: (2024)
por: Wang, Xiangyu, et al.
Publicado: (2024)
COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation
por: Zhang, Siqi, et al.
Publicado: (2025)
por: Zhang, Siqi, et al.
Publicado: (2025)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
por: Peng, Daojie, et al.
Publicado: (2026)
por: Peng, Daojie, et al.
Publicado: (2026)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
por: Qiao, Yanyuan, et al.
Publicado: (2024)
por: Qiao, Yanyuan, et al.
Publicado: (2024)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
por: Li, Haoyuan, et al.
Publicado: (2026)
por: Li, Haoyuan, et al.
Publicado: (2026)
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
por: Du, Yi, et al.
Publicado: (2025)
por: Du, Yi, et al.
Publicado: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
por: Zhang, Siqi, et al.
Publicado: (2025)
por: Zhang, Siqi, et al.
Publicado: (2025)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
por: Wei, Meng, et al.
Publicado: (2025)
por: Wei, Meng, et al.
Publicado: (2025)
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
por: Lyu, Kailin, et al.
Publicado: (2026)
por: Lyu, Kailin, et al.
Publicado: (2026)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
por: Zuo, Jing, et al.
Publicado: (2026)
por: Zuo, Jing, et al.
Publicado: (2026)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
por: Ling, Yiran, et al.
Publicado: (2026)
por: Ling, Yiran, et al.
Publicado: (2026)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
por: Lin, Sihao, et al.
Publicado: (2025)
por: Lin, Sihao, et al.
Publicado: (2025)
Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation
por: Jin, Qunchao, et al.
Publicado: (2026)
por: Jin, Qunchao, et al.
Publicado: (2026)
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
por: Xu, Haoxuan, et al.
Publicado: (2026)
por: Xu, Haoxuan, et al.
Publicado: (2026)
CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation
por: Su, Xia, et al.
Publicado: (2026)
por: Su, Xia, et al.
Publicado: (2026)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
por: Liu, Fei, et al.
Publicado: (2025)
por: Liu, Fei, et al.
Publicado: (2025)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
por: Hao, Haihong, et al.
Publicado: (2026)
por: Hao, Haihong, et al.
Publicado: (2026)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
por: Shi, Haoxiang, et al.
Publicado: (2025)
por: Shi, Haoxiang, et al.
Publicado: (2025)
VISTAv2: World Imagination for Indoor Vision-and-Language Navigation
por: Huang, Yanjia, et al.
Publicado: (2025)
por: Huang, Yanjia, et al.
Publicado: (2025)
What Limits Vision-and-Language Navigation ?
por: Wang, Yunheng, et al.
Publicado: (2026)
por: Wang, Yunheng, et al.
Publicado: (2026)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
por: Wen, Junjie, et al.
Publicado: (2024)
por: Wen, Junjie, et al.
Publicado: (2024)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
por: Zhou, Jiaying, et al.
Publicado: (2026)
por: Zhou, Jiaying, et al.
Publicado: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
por: Zhao, Baining, et al.
Publicado: (2026)
por: Zhao, Baining, et al.
Publicado: (2026)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
por: Li, Zerui, et al.
Publicado: (2025)
por: Li, Zerui, et al.
Publicado: (2025)
Generalized Robot 3D Vision-Language Model with Fast Rendering and Pre-Training Vision-Language Alignment
por: Liu, Kangcheng, et al.
Publicado: (2023)
por: Liu, Kangcheng, et al.
Publicado: (2023)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
por: Zhong, Zhide, et al.
Publicado: (2026)
por: Zhong, Zhide, et al.
Publicado: (2026)
Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation
por: Shi, Xiangyu, et al.
Publicado: (2025)
por: Shi, Xiangyu, et al.
Publicado: (2025)
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
por: Zeng, Shuang, et al.
Publicado: (2025)
por: Zeng, Shuang, et al.
Publicado: (2025)
Ejemplares similares
-
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026) -
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
por: Liu, Jiaxing, et al.
Publicado: (2026) -
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026) -
Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2024) -
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
por: Hong, Haodong, et al.
Publicado: (2024)