Understanding Counting Mechanisms in Large Language and Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hasani, Hosein, Izadi, Amirmohammad, Askari, Fatemeh, Bagherian, Mobin, Mohammadian, Sadegh, Izadi, Mohammad, Baghshah, Mahdieh Soleymani |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uncovering Grounding IDs: How External Cues Shape Multimodal Binding
par: Hasani, Hosein, et autres
Publié: (2025)
par: Hasani, Hosein, et autres
Publié: (2025)
Causal Attribution via Activation Patching
par: Izadi, Amirmohammad, et autres
Publié: (2026)
par: Izadi, Amirmohammad, et autres
Publié: (2026)
Mechanistic Interpretability of Large-Scale Counting in LLMs through a System-2 Strategy
par: Hasani, Hosein, et autres
Publié: (2026)
par: Hasani, Hosein, et autres
Publié: (2026)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
par: Izadi, Amirmohammad, et autres
Publié: (2025)
par: Izadi, Amirmohammad, et autres
Publié: (2025)
ComAlign: Compositional Alignment in Vision-Language Models
par: Abdollah, Ali, et autres
Publié: (2024)
par: Abdollah, Ali, et autres
Publié: (2024)
Improving 3D Few-Shot Segmentation with Inference-Time Pseudo-Labeling
par: Mozafari, Mohammad, et autres
Publié: (2024)
par: Mozafari, Mohammad, et autres
Publié: (2024)
HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models
par: Zohrabi, Reihaneh, et autres
Publié: (2026)
par: Zohrabi, Reihaneh, et autres
Publié: (2026)
T2I-FineEval: Fine-Grained Compositional Metric for Text-to-Image Evaluation
par: Hosseini, Seyed Mohammad Hadi, et autres
Publié: (2025)
par: Hosseini, Seyed Mohammad Hadi, et autres
Publié: (2025)
LibraGrad: Balancing Gradient Flow for Universally Better Vision Transformer Attributions
par: Mehri, Faridoun, et autres
Publié: (2024)
par: Mehri, Faridoun, et autres
Publié: (2024)
Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection
par: Zohrabi, Reihaneh, et autres
Publié: (2025)
par: Zohrabi, Reihaneh, et autres
Publié: (2025)
Trained Models Tell Us How to Make Them Robust to Spurious Correlation without Group Annotation
par: Ghaznavi, Mahdi, et autres
Publié: (2024)
par: Ghaznavi, Mahdi, et autres
Publié: (2024)
CAREL: Instruction-guided reinforcement learning with cross-modal auxiliary objectives
par: Saghafian, Armin, et autres
Publié: (2024)
par: Saghafian, Armin, et autres
Publié: (2024)
Fine-Grained Alignment and Noise Refinement for Compositional Text-to-Image Generation
par: Izadi, Amir Mohammad, et autres
Publié: (2025)
par: Izadi, Amir Mohammad, et autres
Publié: (2025)
Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning
par: Najar, Ali, et autres
Publié: (2026)
par: Najar, Ali, et autres
Publié: (2026)
Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP Models
par: Abbasi, Reza, et autres
Publié: (2024)
par: Abbasi, Reza, et autres
Publié: (2024)
GABInsight: Exploring Gender-Activity Binding Bias in Vision-Language Models
par: Abdollahi, Ali, et autres
Publié: (2024)
par: Abdollahi, Ali, et autres
Publié: (2024)
Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
par: Abbasi, Reza, et autres
Publié: (2024)
par: Abbasi, Reza, et autres
Publié: (2024)
Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models
par: Marioriyad, Arash, et autres
Publié: (2024)
par: Marioriyad, Arash, et autres
Publié: (2024)
Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models
par: Rezaei, Parham, et autres
Publié: (2025)
par: Rezaei, Parham, et autres
Publié: (2025)
Limits and Gains of Test-Time Scaling in Vision-Language Reasoning
par: Ahmadpour, Mohammadjavad, et autres
Publié: (2025)
par: Ahmadpour, Mohammadjavad, et autres
Publié: (2025)
Dilated Balanced Cross Entropy Loss for Medical Image Segmentation
par: Hosseini, Seyed Mohsen, et autres
Publié: (2024)
par: Hosseini, Seyed Mohsen, et autres
Publié: (2024)
Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!
par: Marioriyad, Arash, et autres
Publié: (2024)
par: Marioriyad, Arash, et autres
Publié: (2024)
Enhancing Few-Shot Image Classification through Learnable Multi-Scale Embedding and Attention Mechanisms
par: Askari, Fatemeh, et autres
Publié: (2024)
par: Askari, Fatemeh, et autres
Publié: (2024)
Classification of Breast Cancer Histopathology Images using a Modified Supervised Contrastive Learning Method
par: Sani, Matina Mahdizadeh, et autres
Publié: (2024)
par: Sani, Matina Mahdizadeh, et autres
Publié: (2024)
Infinity and Beyond: Compositional Alignment in VAR and Diffusion T2I Models
par: Shahabadi, Hossein, et autres
Publié: (2025)
par: Shahabadi, Hossein, et autres
Publié: (2025)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
par: Qharabagh, Muhammad Fetrat, et autres
Publié: (2024)
par: Qharabagh, Muhammad Fetrat, et autres
Publié: (2024)
Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study
par: Abbasi, Reza, et autres
Publié: (2025)
par: Abbasi, Reza, et autres
Publié: (2025)
CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
par: Abbasi, Reza, et autres
Publié: (2025)
par: Abbasi, Reza, et autres
Publié: (2025)
Review of Hallucination Understanding in Large Language and Vision Models
par: Ho, Zhengyi, et autres
Publié: (2025)
par: Ho, Zhengyi, et autres
Publié: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
par: Che, Liwei, et autres
Publié: (2026)
par: Che, Liwei, et autres
Publié: (2026)
Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning
par: Kasaei, Seyed Amir, et autres
Publié: (2026)
par: Kasaei, Seyed Amir, et autres
Publié: (2026)
CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models
par: Alzahrani, Reem, et autres
Publié: (2026)
par: Alzahrani, Reem, et autres
Publié: (2026)
No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation
par: Sameti, Mohammad Hossein, et autres
Publié: (2025)
par: Sameti, Mohammad Hossein, et autres
Publié: (2025)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
par: Chen, Boyuan, et autres
Publié: (2026)
par: Chen, Boyuan, et autres
Publié: (2026)
Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis
par: Fadaei, Amir Hosein, et autres
Publié: (2025)
par: Fadaei, Amir Hosein, et autres
Publié: (2025)
FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
par: Pan, Huitong, et autres
Publié: (2024)
par: Pan, Huitong, et autres
Publié: (2024)
LPOI: Listwise Preference Optimization for Vision Language Models
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
par: Zadeh, Fatemeh Pesaran, et autres
Publié: (2025)
Physics Context Builders: A Modular Framework for Physical Reasoning in Vision-Language Models
par: Balazadeh, Vahid, et autres
Publié: (2024)
par: Balazadeh, Vahid, et autres
Publié: (2024)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
par: Guo, Xuyang, et autres
Publié: (2025)
par: Guo, Xuyang, et autres
Publié: (2025)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
par: Fu, Teng, et autres
Publié: (2025)
par: Fu, Teng, et autres
Publié: (2025)
Documents similaires
-
Uncovering Grounding IDs: How External Cues Shape Multimodal Binding
par: Hasani, Hosein, et autres
Publié: (2025) -
Causal Attribution via Activation Patching
par: Izadi, Amirmohammad, et autres
Publié: (2026) -
Mechanistic Interpretability of Large-Scale Counting in LLMs through a System-2 Strategy
par: Hasani, Hosein, et autres
Publié: (2026) -
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
par: Izadi, Amirmohammad, et autres
Publié: (2025) -
ComAlign: Compositional Alignment in Vision-Language Models
par: Abdollah, Ali, et autres
Publié: (2024)