TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Rajabi, Navid, Kosecka, Jana |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
Q-GroundCAM: Quantifying Grounding in Vision Language Models via GradCAM
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation
di: Padhan, Swagat, et al.
Pubblicazione: (2026)
di: Padhan, Swagat, et al.
Pubblicazione: (2026)
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
di: Li, Zongxia, et al.
Pubblicazione: (2025)
di: Li, Zongxia, et al.
Pubblicazione: (2025)
See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation
di: Hu, Chih Yao, et al.
Pubblicazione: (2025)
di: Hu, Chih Yao, et al.
Pubblicazione: (2025)
Language and Planning in Robotic Navigation: A Multilingual Evaluation of State-of-the-Art Models
di: Mansour, Malak, et al.
Pubblicazione: (2025)
di: Mansour, Malak, et al.
Pubblicazione: (2025)
MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation
di: Werby, Abdelrhman, et al.
Pubblicazione: (2024)
di: Werby, Abdelrhman, et al.
Pubblicazione: (2024)
SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
di: Hou, Yuchen, et al.
Pubblicazione: (2026)
di: Hou, Yuchen, et al.
Pubblicazione: (2026)
LLaRA: Supercharging Robot Learning Data for Vision-Language Policy
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
RT-Cache: Training-Free Retrieval for Real-Time Manipulation
di: Kwon, Owen, et al.
Pubblicazione: (2025)
di: Kwon, Owen, et al.
Pubblicazione: (2025)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
What Limits Vision-and-Language Navigation ?
di: Wang, Yunheng, et al.
Pubblicazione: (2026)
di: Wang, Yunheng, et al.
Pubblicazione: (2026)
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
di: Li, Qixiu, et al.
Pubblicazione: (2024)
di: Li, Qixiu, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation Generative Pretrained Transformer
di: Hanlin, Wen
Pubblicazione: (2024)
di: Hanlin, Wen
Pubblicazione: (2024)
Hybrid Training for Vision-Language-Action Models
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2025)
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2025)
Interactive Post-Training for Vision-Language-Action Models
di: Tan, Shuhan, et al.
Pubblicazione: (2025)
di: Tan, Shuhan, et al.
Pubblicazione: (2025)
Gloss2Text: Sign Language Gloss translation using LLMs and Semantically Aware Label Smoothing
di: Fayyazsanavi, Pooya, et al.
Pubblicazione: (2024)
di: Fayyazsanavi, Pooya, et al.
Pubblicazione: (2024)
Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems
di: Islam, Chashi Mahiul, et al.
Pubblicazione: (2024)
di: Islam, Chashi Mahiul, et al.
Pubblicazione: (2024)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
di: Li, Zerui, et al.
Pubblicazione: (2025)
di: Li, Zerui, et al.
Pubblicazione: (2025)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
Video-Language Critic: Transferable Reward Functions for Language-Conditioned Robotics
di: Alakuijala, Minttu, et al.
Pubblicazione: (2024)
di: Alakuijala, Minttu, et al.
Pubblicazione: (2024)
LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving
di: Sha, Hao, et al.
Pubblicazione: (2023)
di: Sha, Hao, et al.
Pubblicazione: (2023)
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
di: Yu, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Yu, Zhuoyuan, et al.
Pubblicazione: (2025)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use
di: Xi, Jiajun, et al.
Pubblicazione: (2024)
di: Xi, Jiajun, et al.
Pubblicazione: (2024)
Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation
di: Shen, William, et al.
Pubblicazione: (2023)
di: Shen, William, et al.
Pubblicazione: (2023)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation
di: Wang, Yunheng, et al.
Pubblicazione: (2025)
di: Wang, Yunheng, et al.
Pubblicazione: (2025)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
di: Chen, Yi, et al.
Pubblicazione: (2024)
di: Chen, Yi, et al.
Pubblicazione: (2024)
MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World
di: Hong, Yining, et al.
Pubblicazione: (2024)
di: Hong, Yining, et al.
Pubblicazione: (2024)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
di: Wei, Ziming, et al.
Pubblicazione: (2025)
di: Wei, Ziming, et al.
Pubblicazione: (2025)
Feedback-Driven Vision-Language Alignment with Minimal Human Supervision
di: Giannone, Giorgio, et al.
Pubblicazione: (2025)
di: Giannone, Giorgio, et al.
Pubblicazione: (2025)
Unified Vision-Language Modeling via Concept Space Alignment
di: Qiu, Yifu, et al.
Pubblicazione: (2026)
di: Qiu, Yifu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023) -
Q-GroundCAM: Quantifying Grounding in Vision Language Models via GradCAM
di: Rajabi, Navid, et al.
Pubblicazione: (2024) -
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
di: Rajabi, Navid, et al.
Pubblicazione: (2024) -
Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation
di: Padhan, Swagat, et al.
Pubblicazione: (2026) -
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
di: Li, Zongxia, et al.
Pubblicazione: (2025)