Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Yushuo, Duan, Huiyu, Zhang, Zicheng, Liu, Xiaohong, Min, Xiongkuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
di: Fu, Kang, et al.
Pubblicazione: (2026)
di: Fu, Kang, et al.
Pubblicazione: (2026)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
di: Wang, Juntong, et al.
Pubblicazione: (2025)
di: Wang, Juntong, et al.
Pubblicazione: (2025)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
di: Chen, Honghua, et al.
Pubblicazione: (2026)
di: Chen, Honghua, et al.
Pubblicazione: (2026)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
di: Fu, Kang, et al.
Pubblicazione: (2025)
di: Fu, Kang, et al.
Pubblicazione: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
di: Xu, Zitong, et al.
Pubblicazione: (2025)
di: Xu, Zitong, et al.
Pubblicazione: (2025)
GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
di: Zheng, Yushuo, et al.
Pubblicazione: (2025)
Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing
di: Wang, Ruiyi, et al.
Pubblicazione: (2025)
di: Wang, Ruiyi, et al.
Pubblicazione: (2025)
Quality Assessment for AI Generated Images with Instruction Tuning
di: Wang, Jiarui, et al.
Pubblicazione: (2024)
di: Wang, Jiarui, et al.
Pubblicazione: (2024)
LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs
di: Yang, Woo Yi, et al.
Pubblicazione: (2025)
di: Yang, Woo Yi, et al.
Pubblicazione: (2025)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
di: Xu, Zitong, et al.
Pubblicazione: (2026)
di: Xu, Zitong, et al.
Pubblicazione: (2026)
RGC-VQA: An Exploration Database for Robotic-Generated Video Quality Assessment
di: Jin, Jianing, et al.
Pubblicazione: (2025)
di: Jin, Jianing, et al.
Pubblicazione: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
di: Wu, Sijing, et al.
Pubblicazione: (2026)
di: Wu, Sijing, et al.
Pubblicazione: (2026)
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
di: Wang, Juntong, et al.
Pubblicazione: (2025)
di: Wang, Juntong, et al.
Pubblicazione: (2025)
Teaching LMMs for Image Quality Scoring and Interpreting
di: Zhang, Zicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zicheng, et al.
Pubblicazione: (2025)
UniProcessor: A Text-induced Unified Low-level Image Processor
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
di: Wang, Ruiyi, et al.
Pubblicazione: (2024)
di: Wang, Ruiyi, et al.
Pubblicazione: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
di: Sun, Yinan, et al.
Pubblicazione: (2024)
di: Sun, Yinan, et al.
Pubblicazione: (2024)
AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
di: Li, Yunhao, et al.
Pubblicazione: (2025)
di: Li, Yunhao, et al.
Pubblicazione: (2025)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
di: Wang, Juntong, et al.
Pubblicazione: (2025)
di: Wang, Juntong, et al.
Pubblicazione: (2025)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
di: Li, Yunhao, et al.
Pubblicazione: (2026)
di: Li, Yunhao, et al.
Pubblicazione: (2026)
Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach
di: Gao, Shiqi, et al.
Pubblicazione: (2026)
di: Gao, Shiqi, et al.
Pubblicazione: (2026)
DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models
di: Wang, Juntong, et al.
Pubblicazione: (2026)
di: Wang, Juntong, et al.
Pubblicazione: (2026)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
di: Yang, Liu, et al.
Pubblicazione: (2025)
di: Yang, Liu, et al.
Pubblicazione: (2025)
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
di: Wang, Jiarui, et al.
Pubblicazione: (2024)
di: Wang, Jiarui, et al.
Pubblicazione: (2024)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
di: Zhu, Xilei, et al.
Pubblicazione: (2024)
Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment
di: Gao, Shiqi, et al.
Pubblicazione: (2026)
di: Gao, Shiqi, et al.
Pubblicazione: (2026)
EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment
di: Gao, Lancheng, et al.
Pubblicazione: (2026)
di: Gao, Lancheng, et al.
Pubblicazione: (2026)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
di: Kou, Tengchuan, et al.
Pubblicazione: (2024)
Quality Assessment and Distortion-aware Saliency Prediction for AI-Generated Omnidirectional Images
di: Yang, Liu, et al.
Pubblicazione: (2025)
di: Yang, Liu, et al.
Pubblicazione: (2025)
AIGCOIQA2024: Perceptual Quality Assessment of AI Generated Omnidirectional Images
di: Yang, Liu, et al.
Pubblicazione: (2024)
di: Yang, Liu, et al.
Pubblicazione: (2024)
GLARE: Low Light Image Enhancement via Generative Latent Feature based Codebook Retrieval
di: Zhou, Han, et al.
Pubblicazione: (2024)
di: Zhou, Han, et al.
Pubblicazione: (2024)
ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
di: Xu, Zitong, et al.
Pubblicazione: (2025)
di: Xu, Zitong, et al.
Pubblicazione: (2025)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models
di: Li, Lingyao, et al.
Pubblicazione: (2025)
di: Li, Lingyao, et al.
Pubblicazione: (2025)
Towards Explainable Partial-AIGC Image Quality Assessment
di: Qian, Jiaying, et al.
Pubblicazione: (2025)
di: Qian, Jiaying, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
di: Fu, Kang, et al.
Pubblicazione: (2026) -
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
di: Wang, Jiarui, et al.
Pubblicazione: (2025) -
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
di: Wang, Juntong, et al.
Pubblicazione: (2025) -
GeoR-Bench: Evaluating Geoscience Visual Reasoning
di: Zheng, Yushuo, et al.
Pubblicazione: (2026) -
A-Bench: Are LMMs Masters at Evaluating AI-generated Images?
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)