NavBench: Probing Multimodal Large Language Models for Embodied Navigation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Qiao, Yanyuan, Hong, Haodong, Lyu, Wenqi, An, Dong, Zhang, Siqi, Xie, Yutong, Wang, Xinyu, Wu, Qi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
von: Li, Zerui, et al.
Veröffentlicht: (2025)
von: Li, Zerui, et al.
Veröffentlicht: (2025)
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
General Scene Adaptation for Vision-and-Language Navigation
von: Hong, Haodong, et al.
Veröffentlicht: (2025)
von: Hong, Haodong, et al.
Veröffentlicht: (2025)
SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
von: Zhu, Junyou, et al.
Veröffentlicht: (2024)
von: Zhu, Junyou, et al.
Veröffentlicht: (2024)
COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation
von: Li, Yifan, et al.
Veröffentlicht: (2025)
von: Li, Yifan, et al.
Veröffentlicht: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
Embodied Domain Adaptation for Object Detection
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
Nav-R1: Reasoning and Navigation in Embodied Scenes
von: Liu, Qingxiang, et al.
Veröffentlicht: (2025)
von: Liu, Qingxiang, et al.
Veröffentlicht: (2025)
OctoNav: Towards Generalist Embodied Navigation
von: Gao, Chen, et al.
Veröffentlicht: (2025)
von: Gao, Chen, et al.
Veröffentlicht: (2025)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
von: Zhou, Yutong, et al.
Veröffentlicht: (2024)
von: Zhou, Yutong, et al.
Veröffentlicht: (2024)
CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
von: Hao, Haihong, et al.
Veröffentlicht: (2025)
von: Hao, Haihong, et al.
Veröffentlicht: (2025)
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
von: Wu, Pengying, et al.
Veröffentlicht: (2024)
von: Wu, Pengying, et al.
Veröffentlicht: (2024)
BadNAVer: Exploring Jailbreak Attacks On Vision-and-Language Navigation
von: Lyu, Wenqi, et al.
Veröffentlicht: (2025)
von: Lyu, Wenqi, et al.
Veröffentlicht: (2025)
NavTrust: Benchmarking Trustworthiness for Embodied Navigation
von: Jiang, Huaide, et al.
Veröffentlicht: (2026)
von: Jiang, Huaide, et al.
Veröffentlicht: (2026)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation
von: Liu, Youzhi, et al.
Veröffentlicht: (2024)
von: Liu, Youzhi, et al.
Veröffentlicht: (2024)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
von: Wang, Shaoan, et al.
Veröffentlicht: (2026)
von: Wang, Shaoan, et al.
Veröffentlicht: (2026)
VL-Mamba: Exploring State Space Models for Multimodal Learning
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024)
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
von: Kawabata, Tomohito, et al.
Veröffentlicht: (2025)
von: Kawabata, Tomohito, et al.
Veröffentlicht: (2025)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
von: Xue, Kaiwen, et al.
Veröffentlicht: (2026)
von: Xue, Kaiwen, et al.
Veröffentlicht: (2026)
SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
von: Qi, Tianye, et al.
Veröffentlicht: (2025)
von: Qi, Tianye, et al.
Veröffentlicht: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
von: Liu, Xin, et al.
Veröffentlicht: (2023)
von: Liu, Xin, et al.
Veröffentlicht: (2023)
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
von: Cheng, Ao, et al.
Veröffentlicht: (2026)
von: Cheng, Ao, et al.
Veröffentlicht: (2026)
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction
von: Liu, Fei, et al.
Veröffentlicht: (2025)
von: Liu, Fei, et al.
Veröffentlicht: (2025)
A Knowledge-driven Adaptive Collaboration of LLMs for Enhancing Medical Decision-making
von: Wu, Xiao, et al.
Veröffentlicht: (2025)
von: Wu, Xiao, et al.
Veröffentlicht: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
von: Luo, Yulin, et al.
Veröffentlicht: (2025)
von: Luo, Yulin, et al.
Veröffentlicht: (2025)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
von: Zhang, Xinyu, et al.
Veröffentlicht: (2026)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2026)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
Improving Online Source-free Domain Adaptation for Object Detection by Unsupervised Data Acquisition
von: Shi, Xiangyu, et al.
Veröffentlicht: (2023)
von: Shi, Xiangyu, et al.
Veröffentlicht: (2023)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
von: Wu, Sijing, et al.
Veröffentlicht: (2026)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
CoNav: A Benchmark for Human-Centered Collaborative Navigation
von: Li, Changhao, et al.
Veröffentlicht: (2024)
von: Li, Changhao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
von: Li, Zerui, et al.
Veröffentlicht: (2025) -
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2024) -
General Scene Adaptation for Vision-and-Language Navigation
von: Hong, Haodong, et al.
Veröffentlicht: (2025) -
SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025) -
MiniVLN: Efficient Vision-and-Language Navigation by Progressive Knowledge Distillation
von: Zhu, Junyou, et al.
Veröffentlicht: (2024)