Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hong, Haodong, Wang, Sen, Huang, Zi, Wu, Qi, Liu, Jiajun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
General Scene Adaptation for Vision-and-Language Navigation
von: Hong, Haodong, et al.
Veröffentlicht: (2025)
von: Hong, Haodong, et al.
Veröffentlicht: (2025)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
von: Li, Zerui, et al.
Veröffentlicht: (2025)
von: Li, Zerui, et al.
Veröffentlicht: (2025)
Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
von: Chen, Haodong, et al.
Veröffentlicht: (2026)
von: Chen, Haodong, et al.
Veröffentlicht: (2026)
MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains
von: Zhan, Zhaohuan, et al.
Veröffentlicht: (2024)
von: Zhan, Zhaohuan, et al.
Veröffentlicht: (2024)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
von: Kim, Mingyeong, et al.
Veröffentlicht: (2026)
von: Kim, Mingyeong, et al.
Veröffentlicht: (2026)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
von: Li, Yanwei, et al.
Veröffentlicht: (2024)
von: Li, Yanwei, et al.
Veröffentlicht: (2024)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
von: Ohi, Masanari, et al.
Veröffentlicht: (2024)
von: Ohi, Masanari, et al.
Veröffentlicht: (2024)
CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model
von: Yu, Zhuoyuan, et al.
Veröffentlicht: (2025)
von: Yu, Zhuoyuan, et al.
Veröffentlicht: (2025)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
von: Wang, Zehao, et al.
Veröffentlicht: (2024)
von: Wang, Zehao, et al.
Veröffentlicht: (2024)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
von: Zhang, Pingrui, et al.
Veröffentlicht: (2025)
von: Zhang, Pingrui, et al.
Veröffentlicht: (2025)
The Labyrinth of Links: Navigating the Associative Maze of Multi-modal LLMs
von: Li, Hong, et al.
Veröffentlicht: (2024)
von: Li, Hong, et al.
Veröffentlicht: (2024)
MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning
von: Zhao, Haozhe, et al.
Veröffentlicht: (2023)
von: Zhao, Haozhe, et al.
Veröffentlicht: (2023)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2025)
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2025)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
von: Li, Zhang, et al.
Veröffentlicht: (2023)
von: Li, Zhang, et al.
Veröffentlicht: (2023)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
von: Yao, Zonghai, et al.
Veröffentlicht: (2026)
von: Yao, Zonghai, et al.
Veröffentlicht: (2026)
Text Prompt Injection of Vision Language Models
von: Zhu, Ruizhe
Veröffentlicht: (2025)
von: Zhu, Ruizhe
Veröffentlicht: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
von: Yang, Rui, et al.
Veröffentlicht: (2025)
von: Yang, Rui, et al.
Veröffentlicht: (2025)
What Limits Vision-and-Language Navigation ?
von: Wang, Yunheng, et al.
Veröffentlicht: (2026)
von: Wang, Yunheng, et al.
Veröffentlicht: (2026)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
von: Zhang, Zhaoyang, et al.
Veröffentlicht: (2023)
von: Zhang, Zhaoyang, et al.
Veröffentlicht: (2023)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
von: Zhang, Juntian, et al.
Veröffentlicht: (2025)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
von: Lin, Bingqian, et al.
Veröffentlicht: (2024)
von: Lin, Bingqian, et al.
Veröffentlicht: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
von: Miao, Yongzhu, et al.
Veröffentlicht: (2023)
von: Miao, Yongzhu, et al.
Veröffentlicht: (2023)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
von: Li, Xuchen, et al.
Veröffentlicht: (2024)
Are Large Vision Language Models Good Game Players?
von: Wang, Xinyu, et al.
Veröffentlicht: (2025)
von: Wang, Xinyu, et al.
Veröffentlicht: (2025)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
von: Zhao, Fei, et al.
Veröffentlicht: (2024)
von: Zhao, Fei, et al.
Veröffentlicht: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025)
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025)
Differentiable Prompt Learning for Vision Language Models
von: Huang, Zhenhan, et al.
Veröffentlicht: (2024)
von: Huang, Zhenhan, et al.
Veröffentlicht: (2024)
Bayesian Principles Improve Prompt Learning In Vision-Language Models
von: Kim, Mingyu, et al.
Veröffentlicht: (2025)
von: Kim, Mingyu, et al.
Veröffentlicht: (2025)
Vision-and-Language Navigation Generative Pretrained Transformer
von: Hanlin, Wen
Veröffentlicht: (2024)
von: Hanlin, Wen
Veröffentlicht: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
von: Li, Zhaowei, et al.
Veröffentlicht: (2024)
von: Li, Zhaowei, et al.
Veröffentlicht: (2024)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
von: Li, Jialu, et al.
Veröffentlicht: (2024)
von: Li, Jialu, et al.
Veröffentlicht: (2024)
Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
von: Liu, Zhihang, et al.
Veröffentlicht: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
Multi-modal Attribute Prompting for Vision-Language Models
von: Liu, Xin, et al.
Veröffentlicht: (2024)
von: Liu, Xin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
von: Hong, Haodong, et al.
Veröffentlicht: (2024) -
General Scene Adaptation for Vision-and-Language Navigation
von: Hong, Haodong, et al.
Veröffentlicht: (2025) -
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
von: Li, Zerui, et al.
Veröffentlicht: (2025) -
Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
von: Chen, Haodong, et al.
Veröffentlicht: (2026) -
MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains
von: Zhan, Zhaohuan, et al.
Veröffentlicht: (2024)