HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Haoxuan, Li, Tianfu, Chen, Wenbo, Liu, Yi, Wu, Jin, Lei, Huashuo, Lou, Yunfan, Wang, Lujia, Wang, Hesheng, Li, Haoang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation
por: Li, Tianfu, et al.
Publicado: (2026)
por: Li, Tianfu, et al.
Publicado: (2026)
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
por: Xu, Haoxuan, et al.
Publicado: (2026)
por: Xu, Haoxuan, et al.
Publicado: (2026)
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
por: Wang, Shuo, et al.
Publicado: (2025)
por: Wang, Shuo, et al.
Publicado: (2025)
SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation
por: Huang, Jingzhi, et al.
Publicado: (2026)
por: Huang, Jingzhi, et al.
Publicado: (2026)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
por: Zhong, Zhide, et al.
Publicado: (2025)
por: Zhong, Zhide, et al.
Publicado: (2025)
Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement
por: Qiu, Weikang, et al.
Publicado: (2026)
por: Qiu, Weikang, et al.
Publicado: (2026)
SkyVLN: Vision-and-Language Navigation and NMPC Control for UAVs in Urban Environments
por: Li, Tianshun, et al.
Publicado: (2025)
por: Li, Tianshun, et al.
Publicado: (2025)
Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation
por: Nie, Chang, et al.
Publicado: (2026)
por: Nie, Chang, et al.
Publicado: (2026)
Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
por: Wang, Shuo, et al.
Publicado: (2025)
por: Wang, Shuo, et al.
Publicado: (2025)
Planning from Imagination: Episodic Simulation and Episodic Memory for Vision-and-Language Navigation
por: Pan, Yiyuan, et al.
Publicado: (2024)
por: Pan, Yiyuan, et al.
Publicado: (2024)
DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation
por: Liu, Xiangchen, et al.
Publicado: (2026)
por: Liu, Xiangchen, et al.
Publicado: (2026)
Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline
por: Song, Wenxuan, et al.
Publicado: (2026)
por: Song, Wenxuan, et al.
Publicado: (2026)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
VLN-Game: Vision-Language Equilibrium Search for Zero-Shot Semantic Navigation
por: Yu, Bangguo, et al.
Publicado: (2024)
por: Yu, Bangguo, et al.
Publicado: (2024)
AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation
por: Huang, Jingzhi, et al.
Publicado: (2026)
por: Huang, Jingzhi, et al.
Publicado: (2026)
PG-SLAM: Photo-realistic and Geometry-aware RGB-D SLAM in Dynamic Environments
por: Li, Haoang, et al.
Publicado: (2024)
por: Li, Haoang, et al.
Publicado: (2024)
DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation
por: Xin, Zihao, et al.
Publicado: (2026)
por: Xin, Zihao, et al.
Publicado: (2026)
Real-Time Metric-Semantic Mapping for Autonomous Navigation in Outdoor Environments
por: Jiao, Jianhao, et al.
Publicado: (2024)
por: Jiao, Jianhao, et al.
Publicado: (2024)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments
por: Payandeh, Amirreza, et al.
Publicado: (2025)
por: Payandeh, Amirreza, et al.
Publicado: (2025)
Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance
por: Zhang, Lingfeng, et al.
Publicado: (2026)
por: Zhang, Lingfeng, et al.
Publicado: (2026)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation
por: Ding, Xin, et al.
Publicado: (2025)
por: Ding, Xin, et al.
Publicado: (2025)
Enhancing Exploratory Capability of Visual Navigation Using Uncertainty of Implicit Scene Representation
por: Wang, Yichen, et al.
Publicado: (2024)
por: Wang, Yichen, et al.
Publicado: (2024)
RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark
por: Lei, Huashuo, et al.
Publicado: (2026)
por: Lei, Huashuo, et al.
Publicado: (2026)
Interactive Navigation for Legged Manipulators with Learned Arm-Pushing Controller
por: Bi, Zhihai, et al.
Publicado: (2025)
por: Bi, Zhihai, et al.
Publicado: (2025)
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
por: Zhong, Zhide, et al.
Publicado: (2026)
por: Zhong, Zhide, et al.
Publicado: (2026)
Seeing through Uncertainty: Robust Task-Oriented Optimization in Visual Navigation
por: Pan, Yiyuan, et al.
Publicado: (2025)
por: Pan, Yiyuan, et al.
Publicado: (2025)
HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models
por: Chen, Zixing, et al.
Publicado: (2026)
por: Chen, Zixing, et al.
Publicado: (2026)
BEINGS: Bayesian Embodied Image-goal Navigation with Gaussian Splatting
por: Meng, Wugang, et al.
Publicado: (2024)
por: Meng, Wugang, et al.
Publicado: (2024)
Dream-SLAM: Dreaming the Unseen for Active SLAM in Dynamic Environments
por: Meng, Xiangqi, et al.
Publicado: (2026)
por: Meng, Xiangqi, et al.
Publicado: (2026)
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation
por: Li, Kailing, et al.
Publicado: (2026)
por: Li, Kailing, et al.
Publicado: (2026)
Towards Autonomous Indoor Parking: A Globally Consistent Semantic SLAM System and A Semantic Localization Subsystem
por: Sha, Yichen, et al.
Publicado: (2024)
por: Sha, Yichen, et al.
Publicado: (2024)
Continually Evolving Skill Knowledge in Vision Language Action Model
por: Wu, Yuxuan, et al.
Publicado: (2025)
por: Wu, Yuxuan, et al.
Publicado: (2025)
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
por: Huang, Yanjia, et al.
Publicado: (2025)
por: Huang, Yanjia, et al.
Publicado: (2025)
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
por: Du, Yi, et al.
Publicado: (2025)
por: Du, Yi, et al.
Publicado: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026)
por: Xue, Wei, et al.
Publicado: (2026)
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
por: Li, Fuhao, et al.
Publicado: (2025)
por: Li, Fuhao, et al.
Publicado: (2025)
Ejemplares similares
-
P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation
por: Li, Tianfu, et al.
Publicado: (2026) -
Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos
por: Xu, Haoxuan, et al.
Publicado: (2026) -
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation
por: Wang, Shuo, et al.
Publicado: (2025) -
SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation
por: Huang, Jingzhi, et al.
Publicado: (2026) -
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
por: Zhong, Zhide, et al.
Publicado: (2025)