HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Haoxuan, Li, Tianfu, Chen, Wenbo, Liu, Yi, Wu, Jin, Lei, Huashuo, Lou, Yunfan, Wang, Lujia, Wang, Hesheng, Li, Haoang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation
di: Li, Tianfu, et al.
Pubblicazione: (2026)
di: Li, Tianfu, et al.
Pubblicazione: (2026)
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
di: Wang, Shuo, et al.
Pubblicazione: (2025)
di: Wang, Shuo, et al.
Pubblicazione: (2025)
SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation
di: Huang, Jingzhi, et al.
Pubblicazione: (2026)
di: Huang, Jingzhi, et al.
Pubblicazione: (2026)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
di: Zhong, Zhide, et al.
Pubblicazione: (2025)
di: Zhong, Zhide, et al.
Pubblicazione: (2025)
Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement
di: Qiu, Weikang, et al.
Pubblicazione: (2026)
di: Qiu, Weikang, et al.
Pubblicazione: (2026)
SkyVLN: Vision-and-Language Navigation and NMPC Control for UAVs in Urban Environments
di: Li, Tianshun, et al.
Pubblicazione: (2025)
di: Li, Tianshun, et al.
Pubblicazione: (2025)
Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation
di: Nie, Chang, et al.
Pubblicazione: (2026)
di: Nie, Chang, et al.
Pubblicazione: (2026)
Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
di: Wang, Shuo, et al.
Pubblicazione: (2025)
di: Wang, Shuo, et al.
Pubblicazione: (2025)
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
di: Pan, Yiyuan, et al.
Pubblicazione: (2024)
di: Pan, Yiyuan, et al.
Pubblicazione: (2024)
DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation
di: Liu, Xiangchen, et al.
Pubblicazione: (2026)
di: Liu, Xiangchen, et al.
Pubblicazione: (2026)
Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline
di: Song, Wenxuan, et al.
Pubblicazione: (2026)
di: Song, Wenxuan, et al.
Pubblicazione: (2026)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
VLN-Game: Vision-Language Equilibrium Search for Zero-Shot Semantic Navigation
di: Yu, Bangguo, et al.
Pubblicazione: (2024)
di: Yu, Bangguo, et al.
Pubblicazione: (2024)
AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation
di: Huang, Jingzhi, et al.
Pubblicazione: (2026)
di: Huang, Jingzhi, et al.
Pubblicazione: (2026)
PG-SLAM: Photo-realistic and Geometry-aware RGB-D SLAM in Dynamic Environments
di: Li, Haoang, et al.
Pubblicazione: (2024)
di: Li, Haoang, et al.
Pubblicazione: (2024)
DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation
di: Xin, Zihao, et al.
Pubblicazione: (2026)
di: Xin, Zihao, et al.
Pubblicazione: (2026)
Real-Time Metric-Semantic Mapping for Autonomous Navigation in Outdoor Environments
di: Jiao, Jianhao, et al.
Pubblicazione: (2024)
di: Jiao, Jianhao, et al.
Pubblicazione: (2024)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments
di: Payandeh, Amirreza, et al.
Pubblicazione: (2025)
di: Payandeh, Amirreza, et al.
Pubblicazione: (2025)
Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance
di: Zhang, Lingfeng, et al.
Pubblicazione: (2026)
di: Zhang, Lingfeng, et al.
Pubblicazione: (2026)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation
di: Ding, Xin, et al.
Pubblicazione: (2025)
di: Ding, Xin, et al.
Pubblicazione: (2025)
Enhancing Exploratory Capability of Visual Navigation Using Uncertainty of Implicit Scene Representation
di: Wang, Yichen, et al.
Pubblicazione: (2024)
di: Wang, Yichen, et al.
Pubblicazione: (2024)
RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
di: Lei, Huashuo, et al.
Pubblicazione: (2026)
di: Lei, Huashuo, et al.
Pubblicazione: (2026)
Interactive Navigation for Legged Manipulators with Learned Arm-Pushing Controller
di: Bi, Zhihai, et al.
Pubblicazione: (2025)
di: Bi, Zhihai, et al.
Pubblicazione: (2025)
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
Seeing through Uncertainty: Robust Task-Oriented Optimization in Visual Navigation
di: Pan, Yiyuan, et al.
Pubblicazione: (2025)
di: Pan, Yiyuan, et al.
Pubblicazione: (2025)
HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models
di: Chen, Zixing, et al.
Pubblicazione: (2026)
di: Chen, Zixing, et al.
Pubblicazione: (2026)
BEINGS: Bayesian Embodied Image-goal Navigation with Gaussian Splatting
di: Meng, Wugang, et al.
Pubblicazione: (2024)
di: Meng, Wugang, et al.
Pubblicazione: (2024)
Dream-SLAM: Dreaming the Unseen for Active SLAM in Dynamic Environments
di: Meng, Xiangqi, et al.
Pubblicazione: (2026)
di: Meng, Xiangqi, et al.
Pubblicazione: (2026)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
di: Li, Kailing, et al.
Pubblicazione: (2026)
di: Li, Kailing, et al.
Pubblicazione: (2026)
Towards Autonomous Indoor Parking: A Globally Consistent Semantic SLAM System and A Semantic Localization Subsystem
di: Sha, Yichen, et al.
Pubblicazione: (2024)
di: Sha, Yichen, et al.
Pubblicazione: (2024)
Continually Evolving Skill Knowledge in Vision Language Action Model
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
di: Wu, Yuxuan, et al.
Pubblicazione: (2025)
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
di: Huang, Yanjia, et al.
Pubblicazione: (2025)
di: Huang, Yanjia, et al.
Pubblicazione: (2025)
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
di: Du, Yi, et al.
Pubblicazione: (2025)
di: Du, Yi, et al.
Pubblicazione: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
di: Xue, Wei, et al.
Pubblicazione: (2026)
di: Xue, Wei, et al.
Pubblicazione: (2026)
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
di: Li, Fuhao, et al.
Pubblicazione: (2025)
di: Li, Fuhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation
di: Li, Tianfu, et al.
Pubblicazione: (2026) -
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
di: Xu, Haoxuan, et al.
Pubblicazione: (2026) -
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
di: Wang, Shuo, et al.
Pubblicazione: (2025) -
SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation
di: Huang, Jingzhi, et al.
Pubblicazione: (2026) -
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
di: Zhong, Zhide, et al.
Pubblicazione: (2025)