LLMGeo: Benchmarking Large Language Models on Image Geolocation In-the-wild
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhiqiang, Xu, Dejia, Khan, Rana Muhammad Shahroz, Lin, Yanbin, Fan, Zhiwen, Zhu, Xingquan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking Large Language Models for Image Classification of Marine Mammals
par: Qi, Yijiashun, et autres
Publié: (2024)
par: Qi, Yijiashun, et autres
Publié: (2024)
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
par: Wang, Zhiqiang, et autres
Publié: (2025)
par: Wang, Zhiqiang, et autres
Publié: (2025)
LightGaussian: Unbounded 3D Gaussian Compression with 15x Reduction and 200+ FPS
par: Fan, Zhiwen, et autres
Publié: (2023)
par: Fan, Zhiwen, et autres
Publié: (2023)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
par: Li, Lingyao, et autres
Publié: (2025)
par: Li, Lingyao, et autres
Publié: (2025)
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025)
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025)
Can Test-Time Scaling Improve World Foundation Model?
par: Cong, Wenyan, et autres
Publié: (2025)
par: Cong, Wenyan, et autres
Publié: (2025)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
par: Li, Chenxu, et autres
Publié: (2025)
par: Li, Chenxu, et autres
Publié: (2025)
Image-Based Geolocation Using Large Vision-Language Models
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025)
par: Qian, Zhaofang, et autres
Publié: (2025)
GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization
par: Jia, Pengyue, et autres
Publié: (2026)
par: Jia, Pengyue, et autres
Publié: (2026)
Can Optical Denoising Clean Sonar Images? A Benchmark and Fusion Approach
par: Wang, Ziyu, et autres
Publié: (2025)
par: Wang, Ziyu, et autres
Publié: (2025)
Through the Lens: Benchmarking Deepfake Detectors Against Moiré-Induced Distortions
par: Tariq, Razaib, et autres
Publié: (2025)
par: Tariq, Razaib, et autres
Publié: (2025)
Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models
par: Huang, Jiaxi, et autres
Publié: (2025)
par: Huang, Jiaxi, et autres
Publié: (2025)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
par: Bharadwaj, Siddhant, et autres
Publié: (2026)
par: Bharadwaj, Siddhant, et autres
Publié: (2026)
Single Trajectory Distillation for Accelerating Image and Video Style Transfer
par: Xu, Sijie, et autres
Publié: (2024)
par: Xu, Sijie, et autres
Publié: (2024)
Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature Fields
par: Zhou, Shijie, et autres
Publié: (2023)
par: Zhou, Shijie, et autres
Publié: (2023)
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
par: Tao, Qian, et autres
Publié: (2025)
par: Tao, Qian, et autres
Publié: (2025)
Granular Privacy Control for Geolocation with Vision Language Models
par: Mendes, Ethan, et autres
Publié: (2024)
par: Mendes, Ethan, et autres
Publié: (2024)
Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants
par: Mioduski, Ryan
Publié: (2025)
par: Mioduski, Ryan
Publié: (2025)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
par: Danish, Muhammad Sohail, et autres
Publié: (2024)
par: Danish, Muhammad Sohail, et autres
Publié: (2024)
PIGEON: Predicting Image Geolocations
par: Haas, Lukas, et autres
Publié: (2023)
par: Haas, Lukas, et autres
Publié: (2023)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
par: Fu, Ronghao, et autres
Publié: (2026)
par: Fu, Ronghao, et autres
Publié: (2026)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
SteinDreamer: Variance Reduction for Text-to-3D Score Distillation via Stein Identity
par: Wang, Peihao, et autres
Publié: (2023)
par: Wang, Peihao, et autres
Publié: (2023)
Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation
par: Bicakci, Yunus Serhat, et autres
Publié: (2025)
par: Bicakci, Yunus Serhat, et autres
Publié: (2025)
Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models
par: Khanal, Bidur, et autres
Publié: (2025)
par: Khanal, Bidur, et autres
Publié: (2025)
Exploring the Impact of Moire Pattern on Deepfake Detectors
par: Tariq, Razaib, et autres
Publié: (2024)
par: Tariq, Razaib, et autres
Publié: (2024)
Are Multimodal Large Language Models Good Annotators for Image Tagging?
par: Xie, Ming-Kun, et autres
Publié: (2026)
par: Xie, Ming-Kun, et autres
Publié: (2026)
Skill-Conditioned Visual Geolocation for Vision-Language Models
par: Yang, Chenjie, et autres
Publié: (2026)
par: Yang, Chenjie, et autres
Publié: (2026)
Feature4X: Bridging Any Monocular Video to 4D Agentic AI with Versatile Gaussian Feature Fields
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Assessing the Geolocation Capabilities, Limitations and Societal Risks of Generative Vision-Language Models
par: Grainge, Oliver, et autres
Publié: (2025)
par: Grainge, Oliver, et autres
Publié: (2025)
Learning Traffic Crashes as Language: Datasets, Benchmarks, and What-if Causal Analyses
par: Fan, Zhiwen, et autres
Publié: (2024)
par: Fan, Zhiwen, et autres
Publié: (2024)
Large Spatial Model: End-to-end Unposed Images to Semantic 3D
par: Fan, Zhiwen, et autres
Publié: (2024)
par: Fan, Zhiwen, et autres
Publié: (2024)
Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
par: Zhang, Fan, et autres
Publié: (2025)
par: Zhang, Fan, et autres
Publié: (2025)
DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian Splatting
par: Zhou, Shijie, et autres
Publié: (2024)
par: Zhou, Shijie, et autres
Publié: (2024)
GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
par: Jia, Pengyue, et autres
Publié: (2025)
par: Jia, Pengyue, et autres
Publié: (2025)
Object-Level Explanations for Image Geolocation Models: a GeoGuessr use-case
par: Durrieu, Emilie, et autres
Publié: (2026)
par: Durrieu, Emilie, et autres
Publié: (2026)
CL-VISTA: Benchmarking Continual Learning in Video Large Language Models
par: Guo, Haiyang, et autres
Publié: (2026)
par: Guo, Haiyang, et autres
Publié: (2026)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
par: Lu, Fan, et autres
Publié: (2024)
par: Lu, Fan, et autres
Publié: (2024)
4K4DGen: Panoramic 4D Generation at 4K Resolution
par: Li, Renjie, et autres
Publié: (2024)
par: Li, Renjie, et autres
Publié: (2024)
Documents similaires
-
Benchmarking Large Language Models for Image Classification of Marine Mammals
par: Qi, Yijiashun, et autres
Publié: (2024) -
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
par: Wang, Zhiqiang, et autres
Publié: (2025) -
LightGaussian: Unbounded 3D Gaussian Compression with 15x Reduction and 200+ FPS
par: Fan, Zhiwen, et autres
Publié: (2023) -
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
par: Li, Lingyao, et autres
Publié: (2025) -
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025)