Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Yue, Ma, Ziqiao, Li, Jialu, Qiao, Yanyuan, Wang, Zun, Chai, Joyce, Wu, Qi, Bansal, Mohit, Kordjamshidi, Parisa |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
Narrowing the Gap between Vision and Action in Navigation
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024)
por: Zhang, Zheyuan, et al.
Publicado: (2024)
NavHint: Vision and Language Navigation Agent with a Hint Generator
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
por: Ma, Tianyi, et al.
Publicado: (2025)
por: Ma, Tianyi, et al.
Publicado: (2025)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
por: Kamali, Danial, et al.
Publicado: (2025)
por: Kamali, Danial, et al.
Publicado: (2025)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
General Scene Adaptation for Vision-and-Language Navigation
por: Hong, Haodong, et al.
Publicado: (2025)
por: Hong, Haodong, et al.
Publicado: (2025)
Neuro-symbolic Training for Reasoning over Spatial Language
por: Premsri, Tanawan, et al.
Publicado: (2024)
por: Premsri, Tanawan, et al.
Publicado: (2024)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
por: Tumu, Akshar, et al.
Publicado: (2025)
por: Tumu, Akshar, et al.
Publicado: (2025)
Babysit A Language Model From Scratch: Interactive Language Learning by Trials and Demonstrations
por: Ma, Ziqiao, et al.
Publicado: (2024)
por: Ma, Ziqiao, et al.
Publicado: (2024)
SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts
por: Zhou, Gengze, et al.
Publicado: (2024)
por: Zhou, Gengze, et al.
Publicado: (2024)
Exploring Spatial Language Grounding Through Referring Expressions
por: Tumu, Akshar, et al.
Publicado: (2025)
por: Tumu, Akshar, et al.
Publicado: (2025)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
por: Wang, Zun, et al.
Publicado: (2024)
por: Wang, Zun, et al.
Publicado: (2024)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
por: Wang, Zun, et al.
Publicado: (2024)
por: Wang, Zun, et al.
Publicado: (2024)
FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks
por: Premsri, Tanawan, et al.
Publicado: (2025)
por: Premsri, Tanawan, et al.
Publicado: (2025)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
por: Li, Zerui, et al.
Publicado: (2025)
por: Li, Zerui, et al.
Publicado: (2025)
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
por: Premsri, Tanawan, et al.
Publicado: (2025)
por: Premsri, Tanawan, et al.
Publicado: (2025)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
por: Yu, Shoubin, et al.
Publicado: (2025)
por: Yu, Shoubin, et al.
Publicado: (2025)
Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale
por: Li, Songze, et al.
Publicado: (2025)
por: Li, Songze, et al.
Publicado: (2025)
Consistent Joint Decision-Making with Heterogeneous Learning Models
por: Faghihi, Hossein Rajaby, et al.
Publicado: (2024)
por: Faghihi, Hossein Rajaby, et al.
Publicado: (2024)
Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation
por: Ma, Ziqiao, et al.
Publicado: (2025)
por: Ma, Ziqiao, et al.
Publicado: (2025)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
por: Barezi, Elham J., et al.
Publicado: (2024)
por: Barezi, Elham J., et al.
Publicado: (2024)
NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization
por: Kamali, Danial, et al.
Publicado: (2024)
por: Kamali, Danial, et al.
Publicado: (2024)
Multi-Object Hallucination in Vision-Language Models
por: Chen, Xuweiyi, et al.
Publicado: (2024)
por: Chen, Xuweiyi, et al.
Publicado: (2024)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
por: Zhou, Gengze, et al.
Publicado: (2024)
por: Zhou, Gengze, et al.
Publicado: (2024)
The Mechanistic Emergence of Symbol Grounding in Language Models
por: Wu, Shuyu, et al.
Publicado: (2025)
por: Wu, Shuyu, et al.
Publicado: (2025)
Reasoning over Uncertain Text by Generative Large Language Models
por: Nafar, Aliakbar, et al.
Publicado: (2024)
por: Nafar, Aliakbar, et al.
Publicado: (2024)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
Learning vs Retrieval: The Role of In-Context Examples in Regression with Large Language Models
por: Nafar, Aliakbar, et al.
Publicado: (2024)
por: Nafar, Aliakbar, et al.
Publicado: (2024)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
por: Zhang, Yue, et al.
Publicado: (2026)
por: Zhang, Yue, et al.
Publicado: (2026)
Neuro-Symbolic Frameworks: Conceptual Characterization and Empirical Comparative Analysis
por: Sinha, Sania, et al.
Publicado: (2025)
por: Sinha, Sania, et al.
Publicado: (2025)
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences
por: Huang, Yidong, et al.
Publicado: (2024)
por: Huang, Yidong, et al.
Publicado: (2024)
Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation
por: Shi, Xiangyu, et al.
Publicado: (2025)
por: Shi, Xiangyu, et al.
Publicado: (2025)
Prompt2DeModel: Declarative Neuro-Symbolic Modeling with Natural Language
por: Faghihi, Hossein Rajaby, et al.
Publicado: (2024)
por: Faghihi, Hossein Rajaby, et al.
Publicado: (2024)
Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow
por: Zhong, Yangyang, et al.
Publicado: (2026)
por: Zhong, Yangyang, et al.
Publicado: (2026)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
por: An, Dong, et al.
Publicado: (2023)
por: An, Dong, et al.
Publicado: (2023)
Ejemplares similares
-
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
por: Zhang, Yue, et al.
Publicado: (2025) -
Narrowing the Gap between Vision and Action in Navigation
por: Zhang, Yue, et al.
Publicado: (2024) -
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024) -
NavHint: Vision and Language Navigation Agent with a Hint Generator
por: Zhang, Yue, et al.
Publicado: (2024) -
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
por: Ma, Tianyi, et al.
Publicado: (2025)