Follow-Up Differential Descriptions: Language Models Resolve Ambiguities for Image Classification
Fuente:
arXiv
Saved in:
| Main Authors: | Esfandiarpoor, Reza, Bach, Stephen H. |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept Descriptions
by: Esfandiarpoor, Reza, et al.
Published: (2024)
by: Esfandiarpoor, Reza, et al.
Published: (2024)
MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification
by: Fieback, Laura, et al.
Published: (2024)
by: Fieback, Laura, et al.
Published: (2024)
LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
by: Han, Songhao, et al.
Published: (2023)
by: Han, Songhao, et al.
Published: (2023)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
by: Xiao, Junfei, et al.
Published: (2023)
by: Xiao, Junfei, et al.
Published: (2023)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
by: Jian, Pu, et al.
Published: (2025)
by: Jian, Pu, et al.
Published: (2025)
Why are Visually-Grounded Language Models Bad at Image Classification?
by: Zhang, Yuhui, et al.
Published: (2024)
by: Zhang, Yuhui, et al.
Published: (2024)
Beyond Thumbs Up/Down: Untangling Challenges of Fine-Grained Feedback for Text-to-Image Generation
by: Collins, Katherine M., et al.
Published: (2024)
by: Collins, Katherine M., et al.
Published: (2024)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
by: Villegas, Danae Sánchez, et al.
Published: (2025)
by: Villegas, Danae Sánchez, et al.
Published: (2025)
Residual-based Language Models are Free Boosters for Biomedical Imaging
by: Lai, Zhixin, et al.
Published: (2024)
by: Lai, Zhixin, et al.
Published: (2024)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
by: Wang, Xiao, et al.
Published: (2024)
by: Wang, Xiao, et al.
Published: (2024)
Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting
by: Hamed, Omar, et al.
Published: (2024)
by: Hamed, Omar, et al.
Published: (2024)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
by: Qin, Yulei, et al.
Published: (2025)
by: Qin, Yulei, et al.
Published: (2025)
DOCCI: Descriptions of Connected and Contrasting Images
by: Onoe, Yasumasa, et al.
Published: (2024)
by: Onoe, Yasumasa, et al.
Published: (2024)
Differentiable Prompt Learning for Vision Language Models
by: Huang, Zhenhan, et al.
Published: (2024)
by: Huang, Zhenhan, et al.
Published: (2024)
Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
by: Abbasi, Reza, et al.
Published: (2024)
by: Abbasi, Reza, et al.
Published: (2024)
LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
by: Yariv, Guy, et al.
Published: (2024)
by: Yariv, Guy, et al.
Published: (2024)
FisherMask: Enhancing Neural Network Labeling Efficiency in Image Classification Using Fisher Information
by: Gul, Shreen, et al.
Published: (2024)
by: Gul, Shreen, et al.
Published: (2024)
Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
by: Lee, Sua, et al.
Published: (2025)
by: Lee, Sua, et al.
Published: (2025)
Centered Masking for Language-Image Pre-Training
by: Liang, Mingliang, et al.
Published: (2024)
by: Liang, Mingliang, et al.
Published: (2024)
Scaling Up Temporal Domain Generalization via Temporal Experts Averaging
by: Liu, Aoming, et al.
Published: (2025)
by: Liu, Aoming, et al.
Published: (2025)
Resolving Interference (RI): Disentangling Models for Improved Model Merging
by: Ramesh, Pratik, et al.
Published: (2026)
by: Ramesh, Pratik, et al.
Published: (2026)
Picturing Ambiguity: A Visual Twist on the Winograd Schema Challenge
by: Park, Brendan, et al.
Published: (2024)
by: Park, Brendan, et al.
Published: (2024)
Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy
by: Ging, Simon, et al.
Published: (2024)
by: Ging, Simon, et al.
Published: (2024)
Embedding Geometries of Contrastive Language-Image Pre-Training
by: Chou, Jason Chuan-Chih, et al.
Published: (2024)
by: Chou, Jason Chuan-Chih, et al.
Published: (2024)
From Pixels to Prose: A Large Dataset of Dense Image Captions
by: Singla, Vasu, et al.
Published: (2024)
by: Singla, Vasu, et al.
Published: (2024)
ChEX: Interactive Localization and Region Description in Chest X-rays
by: Müller, Philip, et al.
Published: (2024)
by: Müller, Philip, et al.
Published: (2024)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
by: Chen, Yangyi, et al.
Published: (2025)
by: Chen, Yangyi, et al.
Published: (2025)
Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
by: Su, Hung-Ting, et al.
Published: (2024)
by: Su, Hung-Ting, et al.
Published: (2024)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
by: Lei, Jiayi, et al.
Published: (2025)
by: Lei, Jiayi, et al.
Published: (2025)
A Comparative Study of Machine Unlearning Techniques for Image and Text Classification Models
by: Safa, Omar M., et al.
Published: (2024)
by: Safa, Omar M., et al.
Published: (2024)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
by: Miranda, Imanol, et al.
Published: (2024)
by: Miranda, Imanol, et al.
Published: (2024)
Evaluating Numerical Reasoning in Text-to-Image Models
by: Kajić, Ivana, et al.
Published: (2024)
by: Kajić, Ivana, et al.
Published: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
by: Jiang, Chaoya, et al.
Published: (2023)
by: Jiang, Chaoya, et al.
Published: (2023)
Words That Make Language Models Perceive
by: Wang, Sophie L., et al.
Published: (2025)
by: Wang, Sophie L., et al.
Published: (2025)
The Neglected Tails in Vision-Language Models
by: Parashar, Shubham, et al.
Published: (2024)
by: Parashar, Shubham, et al.
Published: (2024)
Linear Alignment of Vision-language Models for Image Captioning
by: Paischer, Fabian, et al.
Published: (2023)
by: Paischer, Fabian, et al.
Published: (2023)
D3G: Diverse Demographic Data Generation Increases Zero-Shot Image Classification Accuracy within Multimodal Models
by: Hickmon, Javon
Published: (2025)
by: Hickmon, Javon
Published: (2025)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
by: Groot, Tobias, et al.
Published: (2024)
by: Groot, Tobias, et al.
Published: (2024)
Language-Image Models with 3D Understanding
by: Cho, Jang Hyun, et al.
Published: (2024)
by: Cho, Jang Hyun, et al.
Published: (2024)
Logic-RAG: Augmenting Large Multimodal Models with Visual-Spatial Knowledge for Road Scene Understanding
by: Kabir, Imran, et al.
Published: (2025)
by: Kabir, Imran, et al.
Published: (2025)
Similar Items
-
If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept Descriptions
by: Esfandiarpoor, Reza, et al.
Published: (2024) -
MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification
by: Fieback, Laura, et al.
Published: (2024) -
LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
by: Han, Songhao, et al.
Published: (2023) -
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
by: Xiao, Junfei, et al.
Published: (2023) -
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
by: Jian, Pu, et al.
Published: (2025)