NAVIG: Natural Language-guided Analysis with Vision Language Models for Image Geo-localization
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Zheyuan, Li, Runze, Kabir, Tasnim, Boyd-Graber, Jordan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2024)
por: Wu, Xiyang, et al.
Publicado: (2024)
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024)
por: Zhang, Zheyuan, et al.
Publicado: (2024)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
por: Diao, Xingjian, et al.
Publicado: (2026)
por: Diao, Xingjian, et al.
Publicado: (2026)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
por: Yu, Keunwoo Peter, et al.
Publicado: (2023)
por: Yu, Keunwoo Peter, et al.
Publicado: (2023)
Self-Rewarding Vision-Language Model via Reasoning Decomposition
por: Li, Zongxia, et al.
Publicado: (2025)
por: Li, Zongxia, et al.
Publicado: (2025)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
por: Jia, Mengzhao, et al.
Publicado: (2024)
por: Jia, Mengzhao, et al.
Publicado: (2024)
Lost in Embeddings: Information Loss in Vision-Language Models
por: Li, Wenyan, et al.
Publicado: (2025)
por: Li, Wenyan, et al.
Publicado: (2025)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
por: Wang, Weihang, et al.
Publicado: (2025)
por: Wang, Weihang, et al.
Publicado: (2025)
Vision Language Models Are Not (Yet) Spelling Correctors
por: Liang, Junhong, et al.
Publicado: (2025)
por: Liang, Junhong, et al.
Publicado: (2025)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
por: Deng, Yihe, et al.
Publicado: (2024)
por: Deng, Yihe, et al.
Publicado: (2024)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
por: Zhang, Junyi, et al.
Publicado: (2025)
por: Zhang, Junyi, et al.
Publicado: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
por: Liu, Zheng, et al.
Publicado: (2024)
por: Liu, Zheng, et al.
Publicado: (2024)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
por: Cai, Hengxing, et al.
Publicado: (2025)
por: Cai, Hengxing, et al.
Publicado: (2025)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
por: Lee, Seongyun, et al.
Publicado: (2024)
por: Lee, Seongyun, et al.
Publicado: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
por: Ye, Jiacheng, et al.
Publicado: (2025)
por: Ye, Jiacheng, et al.
Publicado: (2025)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
por: Gao, Peng, et al.
Publicado: (2021)
por: Gao, Peng, et al.
Publicado: (2021)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
por: Kim, Geewook, et al.
Publicado: (2024)
por: Kim, Geewook, et al.
Publicado: (2024)
InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
por: Dong, Xiaoyi, et al.
Publicado: (2024)
por: Dong, Xiaoyi, et al.
Publicado: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation
por: Tanji, Naoto, et al.
Publicado: (2025)
por: Tanji, Naoto, et al.
Publicado: (2025)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
por: Wei, Canshi
Publicado: (2024)
por: Wei, Canshi
Publicado: (2024)
What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
por: Ryu, Koki, et al.
Publicado: (2026)
por: Ryu, Koki, et al.
Publicado: (2026)
Why do LLaVA Vision-Language Models Reply to Images in English?
por: Hinck, Musashi, et al.
Publicado: (2024)
por: Hinck, Musashi, et al.
Publicado: (2024)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
por: Fei, Senyu, et al.
Publicado: (2025)
por: Fei, Senyu, et al.
Publicado: (2025)
Vision-Language Models Do Not Understand Negation
por: Alhamoud, Kumail, et al.
Publicado: (2025)
por: Alhamoud, Kumail, et al.
Publicado: (2025)
Image-Based Geolocation Using Large Vision-Language Models
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Attribution Analysis Meets Model Editing: Advancing Knowledge Correction in Vision Language Models with VisEdit
por: Chen, Qizhou, et al.
Publicado: (2024)
por: Chen, Qizhou, et al.
Publicado: (2024)
TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings
por: Wasi, Azmine Toushik, et al.
Publicado: (2026)
por: Wasi, Azmine Toushik, et al.
Publicado: (2026)
Efficient Few-Shot Medical Image Analysis via Hierarchical Contrastive Vision-Language Learning
por: Fuller, Harrison, et al.
Publicado: (2025)
por: Fuller, Harrison, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
por: Lu, Yifan, et al.
Publicado: (2025)
por: Lu, Yifan, et al.
Publicado: (2025)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
por: Sharma, Aditya, et al.
Publicado: (2024)
por: Sharma, Aditya, et al.
Publicado: (2024)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
por: Chen, Junzhe, et al.
Publicado: (2024)
por: Chen, Junzhe, et al.
Publicado: (2024)
Evaluation of Cultural Competence of Vision-Language Models
por: Yadav, Srishti, et al.
Publicado: (2025)
por: Yadav, Srishti, et al.
Publicado: (2025)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
Ejemplares similares
-
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2024) -
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024) -
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024) -
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024) -
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
por: Diao, Xingjian, et al.
Publicado: (2026)