Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Xiang, Fang, Wanlong, Wang, Changshuo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Rethinking Video-Language Model from the Language Input Perspective
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
par: Shi, Haoxiang, et autres
Publié: (2025)
par: Shi, Haoxiang, et autres
Publié: (2025)
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
par: Liu, Jiaxing, et autres
Publié: (2026)
par: Liu, Jiaxing, et autres
Publié: (2026)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
par: Zhang, Jiazhao, et autres
Publié: (2024)
par: Zhang, Jiazhao, et autres
Publié: (2024)
Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning
par: Li, Xueying, et autres
Publié: (2026)
par: Li, Xueying, et autres
Publié: (2026)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
par: Xue, Wei, et autres
Publié: (2026)
par: Xue, Wei, et autres
Publié: (2026)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
par: Hong, Haodong, et autres
Publié: (2024)
par: Hong, Haodong, et autres
Publié: (2024)
What Limits Vision-and-Language Navigation ?
par: Wang, Yunheng, et autres
Publié: (2026)
par: Wang, Yunheng, et autres
Publié: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
par: Du, Yi, et autres
Publié: (2025)
par: Du, Yi, et autres
Publié: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
par: Zeng, Shuang, et autres
Publié: (2025)
par: Zeng, Shuang, et autres
Publié: (2025)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
par: Yin, Hang, et autres
Publié: (2025)
par: Yin, Hang, et autres
Publié: (2025)
MapDream: Task-Driven Map Learning for Vision-Language Navigation
par: Lian, Guoxin, et autres
Publié: (2026)
par: Lian, Guoxin, et autres
Publié: (2026)
Learning to Tune Like an Expert: Interpretable and Scene-Aware Navigation via MLLM Reasoning and CVAE-Based Adaptation
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
Hierarchical Scoring with 3D Gaussian Splatting for Instance Image-Goal Navigation
par: Deng, Yijie, et autres
Publié: (2025)
par: Deng, Yijie, et autres
Publié: (2025)
MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming
par: Wang, Shuo, et autres
Publié: (2025)
par: Wang, Shuo, et autres
Publié: (2025)
AgriVLN: Vision-and-Language Navigation for Agricultural Robots
par: Zhao, Xiaobei, et autres
Publié: (2025)
par: Zhao, Xiaobei, et autres
Publié: (2025)
Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation
par: Zheng, Wanrong, et autres
Publié: (2026)
par: Zheng, Wanrong, et autres
Publié: (2026)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
par: Li, Kailing, et autres
Publié: (2026)
par: Li, Kailing, et autres
Publié: (2026)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
par: Peng, Daojie, et autres
Publié: (2026)
par: Peng, Daojie, et autres
Publié: (2026)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
par: Chen, Bolei, et autres
Publié: (2025)
par: Chen, Bolei, et autres
Publié: (2025)
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
par: Lyu, Kailin, et autres
Publié: (2026)
par: Lyu, Kailin, et autres
Publié: (2026)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology
par: Wang, Xiangyu, et autres
Publié: (2024)
par: Wang, Xiangyu, et autres
Publié: (2024)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
par: Ding, Xichen, et autres
Publié: (2025)
par: Ding, Xichen, et autres
Publié: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
par: Zhang, Siqi, et autres
Publié: (2025)
par: Zhang, Siqi, et autres
Publié: (2025)
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation
par: Zhang, Siqi, et autres
Publié: (2025)
par: Zhang, Siqi, et autres
Publié: (2025)
Open-Set 3D Semantic Instance Maps for Vision Language Navigation -- O3D-SIM
par: Nanwani, Laksh, et autres
Publié: (2024)
par: Nanwani, Laksh, et autres
Publié: (2024)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
par: Chen, Kehan, et autres
Publié: (2024)
par: Chen, Kehan, et autres
Publié: (2024)
HERO: Hierarchical Traversable 3D Scene Graphs for Embodied Navigation Among Movable Obstacles
par: Wang, Yunheng, et autres
Publié: (2025)
par: Wang, Yunheng, et autres
Publié: (2025)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
par: Wang, Zhaowei, et autres
Publié: (2024)
par: Wang, Zhaowei, et autres
Publié: (2024)
Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation
par: Bao, Muyi, et autres
Publié: (2026)
par: Bao, Muyi, et autres
Publié: (2026)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
Documents similaires
-
CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning
par: Fang, Xiang, et autres
Publié: (2026) -
Rethinking Video-Language Model from the Language Input Perspective
par: Fang, Xiang, et autres
Publié: (2026) -
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
par: Shi, Haoxiang, et autres
Publié: (2025) -
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
par: Fang, Xiang, et autres
Publié: (2026) -
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)