Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Xuyang, Huang, Zekai, Shi, Zhenmei, Song, Zhao, Zhang, Jiahao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
Text-to-Image Diffusion Models Cannot Count, and Prompt Refinement Cannot Help
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
di: Chen, Yubin, et al.
Pubblicazione: (2025)
di: Chen, Yubin, et al.
Pubblicazione: (2025)
Vision-Language Models Can't See the Obvious
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
Counting to Four is still a Chore for VLMs
di: Anh, Duy Le Dinh, et al.
Pubblicazione: (2026)
di: Anh, Duy Le Dinh, et al.
Pubblicazione: (2026)
T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions
di: Sengupta, Saurav, et al.
Pubblicazione: (2025)
di: Sengupta, Saurav, et al.
Pubblicazione: (2025)
[De|Re]constructing VLMs' Reasoning in Counting
di: Alghisi, Simone, et al.
Pubblicazione: (2025)
di: Alghisi, Simone, et al.
Pubblicazione: (2025)
CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models
di: Alzahrani, Reem, et al.
Pubblicazione: (2026)
di: Alzahrani, Reem, et al.
Pubblicazione: (2026)
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
di: Yao, Ziyu, et al.
Pubblicazione: (2025)
di: Yao, Ziyu, et al.
Pubblicazione: (2025)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
di: Chen, Boyuan, et al.
Pubblicazione: (2026)
di: Chen, Boyuan, et al.
Pubblicazione: (2026)
FocalCount: Towards Class-Count Imbalance in Class-Agnostic Counting
di: Zhu, Huilin, et al.
Pubblicazione: (2025)
di: Zhu, Huilin, et al.
Pubblicazione: (2025)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
di: Hasani, Hosein, et al.
Pubblicazione: (2025)
Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors
di: Shi, Youxu, et al.
Pubblicazione: (2025)
di: Shi, Youxu, et al.
Pubblicazione: (2025)
UNICBench: UNIfied Counting Benchmark for MLLM
di: Rong, Chenggang, et al.
Pubblicazione: (2026)
di: Rong, Chenggang, et al.
Pubblicazione: (2026)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
di: Pang, Xingzhou, et al.
Pubblicazione: (2026)
Rethinking Cell Counting Methods: Decoupling Counting and Localization
di: Zheng, Zixuan, et al.
Pubblicazione: (2025)
di: Zheng, Zixuan, et al.
Pubblicazione: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
di: Che, Liwei, et al.
Pubblicazione: (2026)
di: Che, Liwei, et al.
Pubblicazione: (2026)
CountEx: Fine-Grained Counting via Exemplars and Exclusion
di: Huang, Yifeng, et al.
Pubblicazione: (2026)
di: Huang, Yifeng, et al.
Pubblicazione: (2026)
Point, Segment and Count: A Generalized Framework for Object Counting
di: Huang, Zhizhong, et al.
Pubblicazione: (2023)
di: Huang, Zhizhong, et al.
Pubblicazione: (2023)
CountSteer: Steering Attention for Object Counting in Diffusion Models
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
Counting Hallucinations in Diffusion Models
di: Fu, Shuai, et al.
Pubblicazione: (2025)
di: Fu, Shuai, et al.
Pubblicazione: (2025)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
di: Qharabagh, Muhammad Fetrat, et al.
Pubblicazione: (2024)
di: Qharabagh, Muhammad Fetrat, et al.
Pubblicazione: (2024)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
di: Kamath, Amita, et al.
Pubblicazione: (2026)
di: Kamath, Amita, et al.
Pubblicazione: (2026)
Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models
di: Hou, Kuinan, et al.
Pubblicazione: (2025)
di: Hou, Kuinan, et al.
Pubblicazione: (2025)
When Lighting Deceives: Exposing Vision-Language Models' Illumination Vulnerability Through Illumination Transformation Attack
di: Liu, Hanqing, et al.
Pubblicazione: (2025)
di: Liu, Hanqing, et al.
Pubblicazione: (2025)
Can Current AI Models Count What We Mean, Not What They See? A Benchmark and Systematic Evaluation
di: Nguyen, Gia Khanh, et al.
Pubblicazione: (2025)
di: Nguyen, Gia Khanh, et al.
Pubblicazione: (2025)
I Can't Believe It's Not Scene Flow!
di: Khatri, Ishan, et al.
Pubblicazione: (2024)
di: Khatri, Ishan, et al.
Pubblicazione: (2024)
MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)
di: Chou, Shih-Han, et al.
Pubblicazione: (2024)
di: Chou, Shih-Han, et al.
Pubblicazione: (2024)
CountFormer: Multi-View Crowd Counting Transformer
di: Mo, Hong, et al.
Pubblicazione: (2024)
di: Mo, Hong, et al.
Pubblicazione: (2024)
CountGD: Multi-Modal Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2024)
CountGD++: Generalized Prompting for Open-World Counting
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
di: Amini-Naieni, Niki, et al.
Pubblicazione: (2025)
Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking and Strategic Insights
di: Zhong, Yuan, et al.
Pubblicazione: (2025)
di: Zhong, Yuan, et al.
Pubblicazione: (2025)
Time Blindness: Why Video-Language Models Can't See What Humans Can?
di: Upadhyay, Ujjwal, et al.
Pubblicazione: (2025)
di: Upadhyay, Ujjwal, et al.
Pubblicazione: (2025)
Repetitive Action Counting with Hybrid Temporal Relation Modeling
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2023)
Do VLMs Have Bad Eyes? Diagnosing Compositional Failures via Mechanistic Interpretability
di: Aravindan, Ashwath Vaithinathan, et al.
Pubblicazione: (2025)
di: Aravindan, Ashwath Vaithinathan, et al.
Pubblicazione: (2025)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
CountMamba: Exploring Multi-directional Selective State-Space Models for Plant Counting
di: He, Hulingxiao, et al.
Pubblicazione: (2024)
di: He, Hulingxiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models
di: Guo, Xuyang, et al.
Pubblicazione: (2025) -
Text-to-Image Diffusion Models Cannot Count, and Prompt Refinement Cannot Help
di: Guo, Xuyang, et al.
Pubblicazione: (2025) -
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
di: Chen, Yubin, et al.
Pubblicazione: (2025) -
Vision-Language Models Can't See the Obvious
di: Dahou, Yasser, et al.
Pubblicazione: (2025) -
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
di: Guo, Xuyang, et al.
Pubblicazione: (2025)