Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions
Fuente:
arXiv
Saved in:
| Main Authors: | Sengupta, Saurav, Moradinasab, Nazanin, Liu, Jiebei, Brown, Donald E. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features
by: Sengupta, Saurav, et al.
Published: (2025)
by: Sengupta, Saurav, et al.
Published: (2025)
Towards Robust Multimodal Representation: A Unified Approach with Adaptive Experts and Alignment
by: Moradinasab, Nazanin, et al.
Published: (2025)
by: Moradinasab, Nazanin, et al.
Published: (2025)
GenGMM: Generalized Gaussian-Mixture-based Domain Adaptation Model for Semantic Segmentation
by: Moradinasab, Nazanin, et al.
Published: (2024)
by: Moradinasab, Nazanin, et al.
Published: (2024)
Automatic Report Generation for Histopathology images using pre-trained Vision Transformers and BERT
by: Sengupta, Saurav, et al.
Published: (2023)
by: Sengupta, Saurav, et al.
Published: (2023)
ProtoGMM: Multi-prototype Gaussian-Mixture-based Domain Adaptation Model for Semantic Segmentation
by: Moradinasab, Nazanin, et al.
Published: (2024)
by: Moradinasab, Nazanin, et al.
Published: (2024)
Label-efficient Contrastive Learning-based model for nuclei detection and classification in 3D Cardiovascular Immunofluorescent Images
by: Moradinasab, Nazanin, et al.
Published: (2023)
by: Moradinasab, Nazanin, et al.
Published: (2023)
Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description
by: Mahjourian, Nazanin, et al.
Published: (2025)
by: Mahjourian, Nazanin, et al.
Published: (2025)
TAB: Transformer Attention Bottlenecks enable User Intervention and Debugging in Vision-Language Models
by: Rahmanzadehgervi, Pooyan, et al.
Published: (2024)
by: Rahmanzadehgervi, Pooyan, et al.
Published: (2024)
Sanitizing Manufacturing Dataset Labels Using Vision-Language Models
by: Mahjourian, Nazanin, et al.
Published: (2025)
by: Mahjourian, Nazanin, et al.
Published: (2025)
CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models
by: Jha, Saurav, et al.
Published: (2024)
by: Jha, Saurav, et al.
Published: (2024)
CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models
by: Li, Qiming, et al.
Published: (2025)
by: Li, Qiming, et al.
Published: (2025)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
by: Guo, Xuyang, et al.
Published: (2025)
by: Guo, Xuyang, et al.
Published: (2025)
fine-CLIP: Enhancing Zero-Shot Fine-Grained Surgical Action Recognition with Vision-Language Models
by: Sharma, Saurav, et al.
Published: (2025)
by: Sharma, Saurav, et al.
Published: (2025)
SynMVCrowd: A Large Synthetic Benchmark for Multi-view Crowd Counting and Localization
by: Zhang, Qi, et al.
Published: (2026)
by: Zhang, Qi, et al.
Published: (2026)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
by: Du, Hao, et al.
Published: (2025)
by: Du, Hao, et al.
Published: (2025)
Can Vision Language Models Assess Graphic Design Aesthetics? A Benchmark, Evaluation, and Dataset Perspective
by: An, Arctanx, et al.
Published: (2026)
by: An, Arctanx, et al.
Published: (2026)
CountSteer: Steering Attention for Object Counting in Diffusion Models
by: Boo, Hyemin, et al.
Published: (2025)
by: Boo, Hyemin, et al.
Published: (2025)
One Last Attention for Your Vision-Language Model
by: Chen, Liang, et al.
Published: (2025)
by: Chen, Liang, et al.
Published: (2025)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
by: Guo, Longteng, et al.
Published: (2026)
by: Guo, Longteng, et al.
Published: (2026)
CountXplain: Interpretable Cell Counting with Prototype-Based Density Map Estimation
by: Mohammed, Abdurahman Ali, et al.
Published: (2025)
by: Mohammed, Abdurahman Ali, et al.
Published: (2025)
Can Vision-Language Models Solve the Shell Game?
by: Liu, Tiedong, et al.
Published: (2026)
by: Liu, Tiedong, et al.
Published: (2026)
Can Current AI Models Count What We Mean, Not What They See? A Benchmark and Systematic Evaluation
by: Nguyen, Gia Khanh, et al.
Published: (2025)
by: Nguyen, Gia Khanh, et al.
Published: (2025)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
by: Liu, Che, et al.
Published: (2024)
by: Liu, Che, et al.
Published: (2024)
CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models
by: Alzahrani, Reem, et al.
Published: (2026)
by: Alzahrani, Reem, et al.
Published: (2026)
Vision-Language Models Can't See the Obvious
by: Dahou, Yasser, et al.
Published: (2025)
by: Dahou, Yasser, et al.
Published: (2025)
Can 3D Vision-Language Models Truly Understand Natural Language?
by: Deng, Weipeng, et al.
Published: (2024)
by: Deng, Weipeng, et al.
Published: (2024)
SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model
by: Cao, Bin, et al.
Published: (2024)
by: Cao, Bin, et al.
Published: (2024)
Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning
by: Li, Chenjun, et al.
Published: (2025)
by: Li, Chenjun, et al.
Published: (2025)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
by: Bao, Han, et al.
Published: (2024)
by: Bao, Han, et al.
Published: (2024)
MMSpec: Benchmarking Speculative Decoding for Vision-Language Models
by: Shen, Hui, et al.
Published: (2026)
by: Shen, Hui, et al.
Published: (2026)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
by: Ruan, Jiacheng, et al.
Published: (2025)
by: Ruan, Jiacheng, et al.
Published: (2025)
CellFMCount: A Fluorescence Microscopy Dataset, Benchmark, and Methods for Cell Counting
by: Mohammed, Abdurahman Ali, et al.
Published: (2025)
by: Mohammed, Abdurahman Ali, et al.
Published: (2025)
Attention Debiasing for Token Pruning in Vision Language Models
by: Zhao, Kai, et al.
Published: (2025)
by: Zhao, Kai, et al.
Published: (2025)
CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment
by: Wang, Bo, et al.
Published: (2025)
by: Wang, Bo, et al.
Published: (2025)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
by: Hasani, Hosein, et al.
Published: (2025)
by: Hasani, Hosein, et al.
Published: (2025)
SurgXBench: Explainable Vision-Language Model Benchmark for Surgery
by: Cheng, Jiajun, et al.
Published: (2025)
by: Cheng, Jiajun, et al.
Published: (2025)
HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection
by: Shi, Senyuan, et al.
Published: (2026)
by: Shi, Senyuan, et al.
Published: (2026)
Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis
by: Weng, Xingxing, et al.
Published: (2026)
by: Weng, Xingxing, et al.
Published: (2026)
OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks
by: Fu, Ronghao, et al.
Published: (2026)
by: Fu, Ronghao, et al.
Published: (2026)
From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based Selection
by: Cai, Lincan, et al.
Published: (2025)
by: Cai, Lincan, et al.
Published: (2025)
Similar Items
-
Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features
by: Sengupta, Saurav, et al.
Published: (2025) -
Towards Robust Multimodal Representation: A Unified Approach with Adaptive Experts and Alignment
by: Moradinasab, Nazanin, et al.
Published: (2025) -
GenGMM: Generalized Gaussian-Mixture-based Domain Adaptation Model for Semantic Segmentation
by: Moradinasab, Nazanin, et al.
Published: (2024) -
Automatic Report Generation for Histopathology images using pre-trained Vision Transformers and BERT
by: Sengupta, Saurav, et al.
Published: (2023) -
ProtoGMM: Multi-prototype Gaussian-Mixture-based Domain Adaptation Model for Semantic Segmentation
by: Moradinasab, Nazanin, et al.
Published: (2024)