Common Data Properties Limit Object-Attribute Binding in CLIP
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gurung, Bijay, Hoffmann, David T., Brox, Thomas |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models
par: Schrodi, Simon, et autres
Publié: (2024)
par: Schrodi, Simon, et autres
Publié: (2024)
When and How Does CLIP Enable Domain and Compositional Generalization?
par: Kempf, Elias, et autres
Publié: (2025)
par: Kempf, Elias, et autres
Publié: (2025)
Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
Real Classification by Description: Extending CLIP's Limits of Part Attributes Recognition
par: Baron, Ethan, et autres
Publié: (2024)
par: Baron, Ethan, et autres
Publié: (2024)
ABE-CLIP: Training-Free Attribute Binding Enhancement for Compositional Image-Text Matching
par: Zhang, Qi, et autres
Publié: (2025)
par: Zhang, Qi, et autres
Publié: (2025)
Anomaly Detection with Conditioned Denoising Diffusion Models
par: Mousakhan, Arian, et autres
Publié: (2023)
par: Mousakhan, Arian, et autres
Publié: (2023)
Incremental Object Detection with CLIP
par: Huang, Ziyue, et autres
Publié: (2023)
par: Huang, Ziyue, et autres
Publié: (2023)
CLIP-FTI: Fine-Grained Face Template Inversion via CLIP-Driven Attribute Conditioning
par: Dai, Longchen, et autres
Publié: (2025)
par: Dai, Longchen, et autres
Publié: (2025)
Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study
par: Abbasi, Reza, et autres
Publié: (2025)
par: Abbasi, Reza, et autres
Publié: (2025)
Using Knowledge Graphs to harvest datasets for efficient CLIP model training
par: Ging, Simon, et autres
Publié: (2025)
par: Ging, Simon, et autres
Publié: (2025)
Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
par: Abbasi, Reza, et autres
Publié: (2024)
par: Abbasi, Reza, et autres
Publié: (2024)
C2P-CLIP: Injecting Category Common Prompt in CLIP to Enhance Generalization in Deepfake Detection
par: Tan, Chuangchuang, et autres
Publié: (2024)
par: Tan, Chuangchuang, et autres
Publié: (2024)
Box It to Bind It: Unified Layout Control and Attribute Binding in T2I Diffusion Models
par: Taghipour, Ashkan, et autres
Publié: (2024)
par: Taghipour, Ashkan, et autres
Publié: (2024)
SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
par: Hirota, Yusuke, et autres
Publié: (2024)
par: Hirota, Yusuke, et autres
Publié: (2024)
GazeCLIP: Gaze-Guided CLIP with Adaptive-Enhanced Fine-Grained Language Prompt for Deepfake Attribution and Detection
par: Zhang, Yaning, et autres
Publié: (2026)
par: Zhang, Yaning, et autres
Publié: (2026)
On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models
par: Bratulić, Jelena, et autres
Publié: (2025)
par: Bratulić, Jelena, et autres
Publié: (2025)
Eureka-Moments in Transformers: Multi-Step Tasks Reveal Softmax Induced Optimization Problems
par: Hoffmann, David T., et autres
Publié: (2023)
par: Hoffmann, David T., et autres
Publié: (2023)
Efficiently Disentangling CLIP for Multi-Object Perception
par: Rawlekar, Samyak, et autres
Publié: (2025)
par: Rawlekar, Samyak, et autres
Publié: (2025)
NeuroCLIP: Neuromorphic Data Understanding by CLIP and SNN
par: Guo, Yufei, et autres
Publié: (2023)
par: Guo, Yufei, et autres
Publié: (2023)
StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization
par: Gaur, Gopalji, et autres
Publié: (2025)
par: Gaur, Gopalji, et autres
Publié: (2025)
Are CLIP features all you need for Universal Synthetic Image Origin Attribution?
par: Cioni, Dario, et autres
Publié: (2024)
par: Cioni, Dario, et autres
Publié: (2024)
ET tu, CLIP? Addressing Common Object Errors for Unseen Environments
par: Byun, Ye Won, et autres
Publié: (2024)
par: Byun, Ye Won, et autres
Publié: (2024)
MultiBind: A Benchmark for Attribute Misbinding in Multi-Subject Generation
par: Tian, Wenqing, et autres
Publié: (2026)
par: Tian, Wenqing, et autres
Publié: (2026)
InstructAttribute: Fine-grained Object Attributes editing with Instruction
par: Yin, Xingxi, et autres
Publié: (2025)
par: Yin, Xingxi, et autres
Publié: (2025)
SEED4D: A Synthetic Ego--Exo Dynamic 4D Data Generator, Driving Dataset and Benchmark
par: Kästingschäfer, Marius, et autres
Publié: (2024)
par: Kästingschäfer, Marius, et autres
Publié: (2024)
FairCLIP: Social Bias Elimination based on Attribute Prototype Learning and Representation Neutralization
par: Wang, Junyang, et autres
Publié: (2022)
par: Wang, Junyang, et autres
Publié: (2022)
Detect, Classify, Act: Categorizing Industrial Anomalies with Multi-Modal Large Language Models
par: Mokhtar, Sassan, et autres
Publié: (2025)
par: Mokhtar, Sassan, et autres
Publié: (2025)
sshELF: Single-Shot Hierarchical Extrapolation of Latent Features for 3D Reconstruction from Sparse-Views
par: Najafli, Eyvaz, et autres
Publié: (2025)
par: Najafli, Eyvaz, et autres
Publié: (2025)
Enhancing CLIP with CLIP: Exploring Pseudolabeling for Limited-Label Prompt Tuning
par: Menghini, Cristina, et autres
Publié: (2023)
par: Menghini, Cristina, et autres
Publié: (2023)
CLIP-Guided Source-Free Object Detection in Aerial Images
par: Liu, Nanqing, et autres
Publié: (2024)
par: Liu, Nanqing, et autres
Publié: (2024)
Exploring Open-Vocabulary Object Recognition in Images using CLIP
par: Chen, Wei Yu, et autres
Publié: (2026)
par: Chen, Wei Yu, et autres
Publié: (2026)
Demystifying CLIP Data
par: Xu, Hu, et autres
Publié: (2023)
par: Xu, Hu, et autres
Publié: (2023)
GA2-CLIP: Generic Attribute Anchor for Efficient Prompt Tuningin Video-Language Models
par: Wang, Bin, et autres
Publié: (2025)
par: Wang, Bin, et autres
Publié: (2025)
MSCI: Addressing CLIP's Inherent Limitations for Compositional Zero-Shot Learning
par: Wang, Yue, et autres
Publié: (2025)
par: Wang, Yue, et autres
Publié: (2025)
The Common Objects Underwater (COU) Dataset for Robust Underwater Object Detection
par: Mukherjee, Rishi, et autres
Publié: (2025)
par: Mukherjee, Rishi, et autres
Publié: (2025)
Neural Point Cloud Diffusion for Disentangled 3D Shape and Appearance Generation
par: Schröppel, Philipp, et autres
Publié: (2023)
par: Schröppel, Philipp, et autres
Publié: (2023)
Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy
par: Ging, Simon, et autres
Publié: (2024)
par: Ging, Simon, et autres
Publié: (2024)
BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining
par: Khoche, Ajinkya, et autres
Publié: (2025)
par: Khoche, Ajinkya, et autres
Publié: (2025)
Few-Shot Class-Incremental Model Attribution Using Learnable Representation From CLIP-ViT Features
par: Lee, Hanbyul, et autres
Publié: (2025)
par: Lee, Hanbyul, et autres
Publié: (2025)
Concept Bottleneck Models Without Predefined Concepts
par: Schrodi, Simon, et autres
Publié: (2024)
par: Schrodi, Simon, et autres
Publié: (2024)
Documents similaires
-
Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models
par: Schrodi, Simon, et autres
Publié: (2024) -
When and How Does CLIP Enable Domain and Compositional Generalization?
par: Kempf, Elias, et autres
Publié: (2025) -
Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control
par: Trusca, Maria Mihaela, et autres
Publié: (2024) -
Real Classification by Description: Extending CLIP's Limits of Part Attributes Recognition
par: Baron, Ethan, et autres
Publié: (2024) -
ABE-CLIP: Training-Free Attribute Binding Enhancement for Compositional Image-Text Matching
par: Zhang, Qi, et autres
Publié: (2025)