Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
Fuente:
arXiv
Salvato in:
| Autori principali: | Abbasi, Reza, Samiei, Mohammad, Rohban, Mohammad Hossein, Baghshah, Mahdieh Soleymani |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP Models
di: Abbasi, Reza, et al.
Pubblicazione: (2024)
di: Abbasi, Reza, et al.
Pubblicazione: (2024)
CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
di: Abbasi, Reza, et al.
Pubblicazione: (2025)
Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2025)
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2025)
GABInsight: Exploring Gender-Activity Binding Bias in Vision-Language Models
di: Abdollahi, Ali, et al.
Pubblicazione: (2024)
di: Abdollahi, Ali, et al.
Pubblicazione: (2024)
LibraGrad: Balancing Gradient Flow for Universally Better Vision Transformer Attributions
di: Mehri, Faridoun, et al.
Pubblicazione: (2024)
di: Mehri, Faridoun, et al.
Pubblicazione: (2024)
Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models
di: Rezaei, Parham, et al.
Pubblicazione: (2025)
di: Rezaei, Parham, et al.
Pubblicazione: (2025)
RODEO: Robust Outlier Detection via Exposing Adaptive Out-of-Distribution Samples
di: Mirzaei, Hossein, et al.
Pubblicazione: (2025)
di: Mirzaei, Hossein, et al.
Pubblicazione: (2025)
No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2025)
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2025)
Fine-Grained Alignment and Noise Refinement for Compositional Text-to-Image Generation
di: Izadi, Amir Mohammad, et al.
Pubblicazione: (2025)
di: Izadi, Amir Mohammad, et al.
Pubblicazione: (2025)
Improving 3D Few-Shot Segmentation with Inference-Time Pseudo-Labeling
di: Mozafari, Mohammad, et al.
Pubblicazione: (2024)
di: Mozafari, Mohammad, et al.
Pubblicazione: (2024)
CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
ComAlign: Compositional Alignment in Vision-Language Models
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2026)
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2026)
Classification of Breast Cancer Histopathology Images using a Modified Supervised Contrastive Learning Method
di: Sani, Matina Mahdizadeh, et al.
Pubblicazione: (2024)
di: Sani, Matina Mahdizadeh, et al.
Pubblicazione: (2024)
Dilated Balanced Cross Entropy Loss for Medical Image Segmentation
di: Hosseini, Seyed Mohsen, et al.
Pubblicazione: (2024)
di: Hosseini, Seyed Mohsen, et al.
Pubblicazione: (2024)
Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2026)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2026)
Trained Models Tell Us How to Make Them Robust to Spurious Correlation without Group Annotation
di: Ghaznavi, Mahdi, et al.
Pubblicazione: (2024)
di: Ghaznavi, Mahdi, et al.
Pubblicazione: (2024)
Inductive Biases for Zero-shot Systematic Generalization in Language-informed Reinforcement Learning
di: Dijujin, Negin Hashemi, et al.
Pubblicazione: (2025)
di: Dijujin, Negin Hashemi, et al.
Pubblicazione: (2025)
The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge
di: Marioriyad, Arash, et al.
Pubblicazione: (2025)
di: Marioriyad, Arash, et al.
Pubblicazione: (2025)
VQEL: Enabling Self-Play in Emergent Language Games via Agent-Internal Vector Quantization
di: Paqaleh, Mohammad Mahdi Samiei, et al.
Pubblicazione: (2025)
di: Paqaleh, Mohammad Mahdi Samiei, et al.
Pubblicazione: (2025)
Decompose-and-Compose: A Compositional Approach to Mitigating Spurious Correlation
di: Noohdani, Fahimeh Hosseini, et al.
Pubblicazione: (2024)
di: Noohdani, Fahimeh Hosseini, et al.
Pubblicazione: (2024)
MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2026)
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2026)
Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
di: Kasaei, Seyed Amir, et al.
Pubblicazione: (2025)
Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
di: Izadi, Amirmohammad, et al.
Pubblicazione: (2025)
di: Izadi, Amirmohammad, et al.
Pubblicazione: (2025)
T2I-FineEval: Fine-Grained Compositional Metric for Text-to-Image Evaluation
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2025)
di: Hosseini, Seyed Mohammad Hadi, et al.
Pubblicazione: (2025)
Lying to Win: Assessing LLM Deception through Human-AI Games and Parallel-World Probing
di: Marioriyad, Arash, et al.
Pubblicazione: (2026)
di: Marioriyad, Arash, et al.
Pubblicazione: (2026)
If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept Descriptions
di: Esfandiarpoor, Reza, et al.
Pubblicazione: (2024)
di: Esfandiarpoor, Reza, et al.
Pubblicazione: (2024)
Infinity and Beyond: Compositional Alignment in VAR and Diffusion T2I Models
di: Shahabadi, Hossein, et al.
Pubblicazione: (2025)
di: Shahabadi, Hossein, et al.
Pubblicazione: (2025)
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
di: Mehta, Sachin, et al.
Pubblicazione: (2024)
di: Mehta, Sachin, et al.
Pubblicazione: (2024)
PatchGuard: Adversarially Robust Anomaly Detection and Localization through Vision Transformers and Pseudo Anomalies
di: Nafez, Mojtaba, et al.
Pubblicazione: (2025)
di: Nafez, Mojtaba, et al.
Pubblicazione: (2025)
Weak-to-Strong Compositional Learning from Generative Models for Language-based Object Detection
di: Park, Kwanyong, et al.
Pubblicazione: (2024)
di: Park, Kwanyong, et al.
Pubblicazione: (2024)
Interpretable Few-shot Learning with Online Attribute Selection
di: Zarei, Mohammad Reza, et al.
Pubblicazione: (2022)
di: Zarei, Mohammad Reza, et al.
Pubblicazione: (2022)
SORA: Free Second-Order Attacks in Fast Adversarial Training
di: Teymourian, Mazdak, et al.
Pubblicazione: (2026)
di: Teymourian, Mazdak, et al.
Pubblicazione: (2026)
Generative AI for Character Animation: A Comprehensive Survey of Techniques, Applications, and Future Directions
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
TiC-CLIP: Continual Training of CLIP Models
di: Garg, Saurabh, et al.
Pubblicazione: (2023)
di: Garg, Saurabh, et al.
Pubblicazione: (2023)
Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference
di: Miranda, Imanol, et al.
Pubblicazione: (2026)
di: Miranda, Imanol, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP Models
di: Abbasi, Reza, et al.
Pubblicazione: (2024) -
CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
di: Abbasi, Reza, et al.
Pubblicazione: (2025) -
Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study
di: Abbasi, Reza, et al.
Pubblicazione: (2025) -
Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models
di: Marioriyad, Arash, et al.
Pubblicazione: (2024) -
Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!
di: Marioriyad, Arash, et al.
Pubblicazione: (2024)