EasyARC: Evaluating Vision Language Models on True Visual Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Unsal, Mert, Akkus, Aylin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ARC Is a Vision Problem!
por: Hu, Keya, et al.
Publicado: (2025)
por: Hu, Keya, et al.
Publicado: (2025)
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
por: Huang, Xin, et al.
Publicado: (2025)
por: Huang, Xin, et al.
Publicado: (2025)
Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information
por: Chu, Xu, et al.
Publicado: (2025)
por: Chu, Xu, et al.
Publicado: (2025)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
por: Xie, Yuechen, et al.
Publicado: (2026)
por: Xie, Yuechen, et al.
Publicado: (2026)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
por: Rajabi, Navid, et al.
Publicado: (2023)
por: Rajabi, Navid, et al.
Publicado: (2023)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
por: Chahe, Amirhosein, et al.
Publicado: (2025)
por: Chahe, Amirhosein, et al.
Publicado: (2025)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
por: Cui, Kelly, et al.
Publicado: (2026)
por: Cui, Kelly, et al.
Publicado: (2026)
Consistency Models Made Easy
por: Geng, Zhengyang, et al.
Publicado: (2024)
por: Geng, Zhengyang, et al.
Publicado: (2024)
Attribute-based Visual Reprogramming for Vision-Language Models
por: Cai, Chengyi, et al.
Publicado: (2025)
por: Cai, Chengyi, et al.
Publicado: (2025)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
por: Góral, Gracjan, et al.
Publicado: (2024)
por: Góral, Gracjan, et al.
Publicado: (2024)
Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models
por: Tsaprazlis, Efthymios, et al.
Publicado: (2025)
por: Tsaprazlis, Efthymios, et al.
Publicado: (2025)
Towards Interpreting Visual Information Processing in Vision-Language Models
por: Neo, Clement, et al.
Publicado: (2024)
por: Neo, Clement, et al.
Publicado: (2024)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
por: Berasi, Davide, et al.
Publicado: (2025)
por: Berasi, Davide, et al.
Publicado: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
por: Nagar, Aishik, et al.
Publicado: (2024)
por: Nagar, Aishik, et al.
Publicado: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
por: Li, Ling, et al.
Publicado: (2024)
por: Li, Ling, et al.
Publicado: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
por: Zhang, Beichen, et al.
Publicado: (2025)
por: Zhang, Beichen, et al.
Publicado: (2025)
Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning
por: Harmanani, Mohamed, et al.
Publicado: (2026)
por: Harmanani, Mohamed, et al.
Publicado: (2026)
Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models
por: You, Weiqiu, et al.
Publicado: (2026)
por: You, Weiqiu, et al.
Publicado: (2026)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
por: Ding, Yi, et al.
Publicado: (2025)
por: Ding, Yi, et al.
Publicado: (2025)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
por: Pang, Xingzhou, et al.
Publicado: (2026)
por: Pang, Xingzhou, et al.
Publicado: (2026)
Forecasting and Visualizing Air Quality from Sky Images with Vision-Language Models
por: Vahdatpour, Mohammad Saleh, et al.
Publicado: (2025)
por: Vahdatpour, Mohammad Saleh, et al.
Publicado: (2025)
Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models
por: Hou, Kuinan, et al.
Publicado: (2025)
por: Hou, Kuinan, et al.
Publicado: (2025)
Is Oracle Pruning the True Oracle?
por: Feng, Sicheng, et al.
Publicado: (2024)
por: Feng, Sicheng, et al.
Publicado: (2024)
HoneyBee: Data Recipes for Vision-Language Reasoners
por: Bansal, Hritik, et al.
Publicado: (2025)
por: Bansal, Hritik, et al.
Publicado: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
por: Zhao, Qingqing, et al.
Publicado: (2025)
por: Zhao, Qingqing, et al.
Publicado: (2025)
Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition
por: Tang, Wei, et al.
Publicado: (2025)
por: Tang, Wei, et al.
Publicado: (2025)
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
por: Li, Xu, et al.
Publicado: (2024)
por: Li, Xu, et al.
Publicado: (2024)
Vision-Language Models for Medical Report Generation and Visual Question Answering: A Review
por: Hartsock, Iryna, et al.
Publicado: (2024)
por: Hartsock, Iryna, et al.
Publicado: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models
por: Huang, Chenyu, et al.
Publicado: (2026)
por: Huang, Chenyu, et al.
Publicado: (2026)
MARVEL: Multidimensional Abstraction and Reasoning through Visual Evaluation and Learning
por: Jiang, Yifan, et al.
Publicado: (2024)
por: Jiang, Yifan, et al.
Publicado: (2024)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
por: Zhang, Zezhou, et al.
Publicado: (2026)
por: Zhang, Zezhou, et al.
Publicado: (2026)
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
por: Liu, Anjie, et al.
Publicado: (2026)
por: Liu, Anjie, et al.
Publicado: (2026)
Simple Vision-Language Math Reasoning via Rendered Text
por: Skripkin, Matvey, et al.
Publicado: (2025)
por: Skripkin, Matvey, et al.
Publicado: (2025)
UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling
por: Al-Tahan, Haider, et al.
Publicado: (2024)
por: Al-Tahan, Haider, et al.
Publicado: (2024)
Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts
por: Golovanevsky, Michal, et al.
Publicado: (2025)
por: Golovanevsky, Michal, et al.
Publicado: (2025)
Test-Time Training for Visual Foresight Vision-Language-Action Models
por: Park, Sangwu, et al.
Publicado: (2026)
por: Park, Sangwu, et al.
Publicado: (2026)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
por: Li, Sijie, et al.
Publicado: (2026)
por: Li, Sijie, et al.
Publicado: (2026)
Ejemplares similares
-
ARC Is a Vision Problem!
por: Hu, Keya, et al.
Publicado: (2025) -
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
por: Huang, Xin, et al.
Publicado: (2025) -
Qwen Look Again: Guiding Vision-Language Reasoning Models to Re-attention Visual Information
por: Chu, Xu, et al.
Publicado: (2025) -
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
por: Xie, Yuechen, et al.
Publicado: (2026) -
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
por: Rajabi, Navid, et al.
Publicado: (2023)