LocateBench: Evaluating the Locating Ability of Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chiang, Ting-Rui, Robinson, Joshua, Yu, Xinyan Velocity, Yogatama, Dani |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Pelican Soup Framework: A Theoretical Framework for Language Model Capabilities
por: Chiang, Ting-Rui, et al.
Publicado: (2024)
por: Chiang, Ting-Rui, et al.
Publicado: (2024)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
por: Yu, Bo, et al.
Publicado: (2026)
por: Yu, Bo, et al.
Publicado: (2026)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
por: Zhang, Gengyuan, et al.
Publicado: (2023)
por: Zhang, Gengyuan, et al.
Publicado: (2023)
PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
por: Ayyubi, Hammad, et al.
Publicado: (2025)
por: Ayyubi, Hammad, et al.
Publicado: (2025)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
por: Zhan, Yufei, et al.
Publicado: (2023)
por: Zhan, Yufei, et al.
Publicado: (2023)
Locating Demographic Bias at the Attention-Head Level in CLIP's Vision Encoder
por: Yasser, Alaa, et al.
Publicado: (2026)
por: Yasser, Alaa, et al.
Publicado: (2026)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
por: Mai, Zheda, et al.
Publicado: (2025)
por: Mai, Zheda, et al.
Publicado: (2025)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
por: Wang, Sibo, et al.
Publicado: (2024)
por: Wang, Sibo, et al.
Publicado: (2024)
ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models
por: Clavié, Benjamin, et al.
Publicado: (2025)
por: Clavié, Benjamin, et al.
Publicado: (2025)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
por: Wang, Shihao, et al.
Publicado: (2026)
por: Wang, Shihao, et al.
Publicado: (2026)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
por: Qharabagh, Muhammad Fetrat, et al.
Publicado: (2024)
por: Qharabagh, Muhammad Fetrat, et al.
Publicado: (2024)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance
por: Taesiri, Mohammad Reza, et al.
Publicado: (2025)
por: Taesiri, Mohammad Reza, et al.
Publicado: (2025)
PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
por: Haller, Patrick, et al.
Publicado: (2025)
por: Haller, Patrick, et al.
Publicado: (2025)
Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
por: Zhang, Chengsheng, et al.
Publicado: (2026)
por: Zhang, Chengsheng, et al.
Publicado: (2026)
TorchSpatial: A Location Encoding Framework and Benchmark for Spatial Representation Learning
por: Wu, Nemin, et al.
Publicado: (2024)
por: Wu, Nemin, et al.
Publicado: (2024)
DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models
por: Wang, JiYang, et al.
Publicado: (2026)
por: Wang, JiYang, et al.
Publicado: (2026)
Location-guided Head Pose Estimation for Fisheye Image
por: Li, Bing, et al.
Publicado: (2024)
por: Li, Bing, et al.
Publicado: (2024)
Learning Multi-Modal Mobility Dynamics for Generalized Next Location Recommendation
por: Dai, Junshu, et al.
Publicado: (2025)
por: Dai, Junshu, et al.
Publicado: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
por: Yan, Bei, et al.
Publicado: (2024)
por: Yan, Bei, et al.
Publicado: (2024)
LOCR: Location-Guided Transformer for Optical Character Recognition
por: Sun, Yu, et al.
Publicado: (2024)
por: Sun, Yu, et al.
Publicado: (2024)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
por: Zhang, Juntian, et al.
Publicado: (2025)
por: Zhang, Juntian, et al.
Publicado: (2025)
DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks
por: Zhou, Haokun, et al.
Publicado: (2024)
por: Zhou, Haokun, et al.
Publicado: (2024)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
por: Li, Dingming, et al.
Publicado: (2025)
por: Li, Dingming, et al.
Publicado: (2025)
Text Guided Image Editing with Automatic Concept Locating and Forgetting
por: Li, Jia, et al.
Publicado: (2024)
por: Li, Jia, et al.
Publicado: (2024)
LocDiff: Identifying Locations on Earth by Diffusing in the Hilbert Space
por: Wang, Zhangyu, et al.
Publicado: (2025)
por: Wang, Zhangyu, et al.
Publicado: (2025)
Location-Aware Pretraining for Medical Difference Visual Question Answering
por: Musinguzi, Denis, et al.
Publicado: (2026)
por: Musinguzi, Denis, et al.
Publicado: (2026)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
por: Yuan, Botai, et al.
Publicado: (2025)
por: Yuan, Botai, et al.
Publicado: (2025)
SatCLIP: Global, General-Purpose Location Embeddings with Satellite Imagery
por: Klemmer, Konstantin, et al.
Publicado: (2023)
por: Klemmer, Konstantin, et al.
Publicado: (2023)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
por: Ukai, Mahiro, et al.
Publicado: (2025)
por: Ukai, Mahiro, et al.
Publicado: (2025)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
por: Bao, Han, et al.
Publicado: (2024)
por: Bao, Han, et al.
Publicado: (2024)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
por: Cai, Jie, et al.
Publicado: (2025)
por: Cai, Jie, et al.
Publicado: (2025)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
por: Saxena, Rohit, et al.
Publicado: (2026)
por: Saxena, Rohit, et al.
Publicado: (2026)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
por: Lee, Kang-il, et al.
Publicado: (2024)
por: Lee, Kang-il, et al.
Publicado: (2024)
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
por: Chen, Kesheng, et al.
Publicado: (2026)
por: Chen, Kesheng, et al.
Publicado: (2026)
A Proxy Consistency Loss for Grounded Fusion of Earth Observation and Location Encoders
por: Wang, Zhongying, et al.
Publicado: (2026)
por: Wang, Zhongying, et al.
Publicado: (2026)
Ejemplares similares
-
Pelican Soup Framework: A Theoretical Framework for Language Model Capabilities
por: Chiang, Ting-Rui, et al.
Publicado: (2024) -
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
por: Yu, Bo, et al.
Publicado: (2026) -
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
por: Zhang, Gengyuan, et al.
Publicado: (2023) -
PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
por: Ayyubi, Hammad, et al.
Publicado: (2025) -
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025)