Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
Fuente:
arXiv
Saved in:
| Main Authors: | Bharadwaj, Siddhant, Vashist, Ashish, Aleem, Fahimul, Vyas, Shruti |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MolVision: Molecular Property Prediction with Vision Language Models
by: Adak, Deepan, et al.
Published: (2025)
by: Adak, Deepan, et al.
Published: (2025)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
by: Qian, Zhaofang, et al.
Published: (2025)
by: Qian, Zhaofang, et al.
Published: (2025)
Adaptive Multi Scale Document Binarisation Using Vision Mamba
by: Azfar, Mohd., et al.
Published: (2024)
by: Azfar, Mohd., et al.
Published: (2024)
Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images
by: Mueez, Abdul, et al.
Published: (2026)
by: Mueez, Abdul, et al.
Published: (2026)
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
by: Zafar, Anas, et al.
Published: (2026)
by: Zafar, Anas, et al.
Published: (2026)
Image-Based Geolocation Using Large Vision-Language Models
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
Granular Privacy Control for Geolocation with Vision Language Models
by: Mendes, Ethan, et al.
Published: (2024)
by: Mendes, Ethan, et al.
Published: (2024)
The Spatial Blindspot of Vision-Language Models
by: Alam, Nahid, et al.
Published: (2026)
by: Alam, Nahid, et al.
Published: (2026)
LLMGeo: Benchmarking Large Language Models on Image Geolocation In-the-wild
by: Wang, Zhiqiang, et al.
Published: (2024)
by: Wang, Zhiqiang, et al.
Published: (2024)
Skill-Conditioned Visual Geolocation for Vision-Language Models
by: Yang, Chenjie, et al.
Published: (2026)
by: Yang, Chenjie, et al.
Published: (2026)
MolSight: Molecular Property Prediction with Images
by: Baranwal, Aaditya, et al.
Published: (2026)
by: Baranwal, Aaditya, et al.
Published: (2026)
Assessing the Geolocation Capabilities, Limitations and Societal Risks of Generative Vision-Language Models
by: Grainge, Oliver, et al.
Published: (2025)
by: Grainge, Oliver, et al.
Published: (2025)
LR0.FM: Low-Res Benchmark and Improving Robustness for Zero-Shot Classification in Foundation Models
by: Pathak, Priyank, et al.
Published: (2025)
by: Pathak, Priyank, et al.
Published: (2025)
Advancing Automatic Photovoltaic Defect Detection using Semi-Supervised Semantic Segmentation of Electroluminescence Images
by: Jha, Abhishek, et al.
Published: (2024)
by: Jha, Abhishek, et al.
Published: (2024)
Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images
by: Wolf, Daniel, et al.
Published: (2025)
by: Wolf, Daniel, et al.
Published: (2025)
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
by: Sharma, Shivam, et al.
Published: (2026)
by: Sharma, Shivam, et al.
Published: (2026)
iSafetyBench: A video-language benchmark for safety in industrial environment
by: Abdullah, Raiyaan, et al.
Published: (2025)
by: Abdullah, Raiyaan, et al.
Published: (2025)
Lost in the Vibrations: Vision Language Models Fail the Dynamic Gauges Test
by: Fu, Tairan, et al.
Published: (2026)
by: Fu, Tairan, et al.
Published: (2026)
FOD-S2R: A FOD Dataset for Sim2Real Transfer Learning based Object Detection
by: Vashist, Ashish, et al.
Published: (2025)
by: Vashist, Ashish, et al.
Published: (2025)
Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
by: Addepalli, Sravanti, et al.
Published: (2023)
by: Addepalli, Sravanti, et al.
Published: (2023)
Brain Tumor Classification in MRI Images: A Computationally Efficient Convolutional Neural Network
by: Chowdhury, Md Fahimul Kabir, et al.
Published: (2026)
by: Chowdhury, Md Fahimul Kabir, et al.
Published: (2026)
Do Vision Language Models Need to Process Image Tokens?
by: Ghosh, Sambit, et al.
Published: (2026)
by: Ghosh, Sambit, et al.
Published: (2026)
Rejection Sampling IMLE: Designing Priors for Better Few-Shot Image Synthesis
by: Vashist, Chirag, et al.
Published: (2024)
by: Vashist, Chirag, et al.
Published: (2024)
Zero-shot Vision-Language Reranking for Cross-View Geolocalization
by: Erzurumlu, Yunus Talha, et al.
Published: (2026)
by: Erzurumlu, Yunus Talha, et al.
Published: (2026)
Image Re-Identification: Where Self-supervision Meets Vision-Language Learning
by: Wang, Bin, et al.
Published: (2024)
by: Wang, Bin, et al.
Published: (2024)
Evaluating Precise Geolocation Inference Capabilities of Vision Language Models
by: Jay, Neel, et al.
Published: (2025)
by: Jay, Neel, et al.
Published: (2025)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
by: Li, Lingyao, et al.
Published: (2025)
by: Li, Lingyao, et al.
Published: (2025)
PIGEON: Predicting Image Geolocations
by: Haas, Lukas, et al.
Published: (2023)
by: Haas, Lukas, et al.
Published: (2023)
GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations
by: Liu, Xinwei, et al.
Published: (2025)
by: Liu, Xinwei, et al.
Published: (2025)
One Pass Is Not Enough: Recursive Latent Refinement for Generative Models
by: Esmaeilzadeh, Mehdi, et al.
Published: (2026)
by: Esmaeilzadeh, Mehdi, et al.
Published: (2026)
Uncovering Cultural Representation Disparities in Vision-Language Models
by: Kadiyala, Ram Mohan Rao, et al.
Published: (2025)
by: Kadiyala, Ram Mohan Rao, et al.
Published: (2025)
SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?
by: Shin, Jongmin, et al.
Published: (2026)
by: Shin, Jongmin, et al.
Published: (2026)
Coding the Visual World: From Image to Simulation Using Vision Language Models
by: Eppel, Sagi
Published: (2026)
by: Eppel, Sagi
Published: (2026)
GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization
by: Jia, Pengyue, et al.
Published: (2026)
by: Jia, Pengyue, et al.
Published: (2026)
Object-Level Explanations for Image Geolocation Models: a GeoGuessr use-case
by: Durrieu, Emilie, et al.
Published: (2026)
by: Durrieu, Emilie, et al.
Published: (2026)
GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
by: Jia, Pengyue, et al.
Published: (2025)
by: Jia, Pengyue, et al.
Published: (2025)
Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation
by: Zhang, Xin, et al.
Published: (2025)
by: Zhang, Xin, et al.
Published: (2025)
What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
by: Ryu, Koki, et al.
Published: (2026)
by: Ryu, Koki, et al.
Published: (2026)
Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
by: Lee, Seulbi, et al.
Published: (2026)
by: Lee, Seulbi, et al.
Published: (2026)
Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets
by: Basu, Abhipsa, et al.
Published: (2026)
by: Basu, Abhipsa, et al.
Published: (2026)
Similar Items
-
MolVision: Molecular Property Prediction with Vision Language Models
by: Adak, Deepan, et al.
Published: (2025) -
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
by: Qian, Zhaofang, et al.
Published: (2025) -
Adaptive Multi Scale Document Binarisation Using Vision Mamba
by: Azfar, Mohd., et al.
Published: (2024) -
Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images
by: Mueez, Abdul, et al.
Published: (2026) -
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
by: Zafar, Anas, et al.
Published: (2026)