Distilling Knowledge from Text-to-Image Generative Models Improves Visio-Linguistic Reasoning in CLIP
Fuente:
arXiv
Salvato in:
| Autori principali: | Basu, Samyadeep, Hu, Shell Xu, Sanjabi, Maziar, Massiceti, Daniela, Feizi, Soheil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2024)
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2024)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
di: Zarei, Arman, et al.
Pubblicazione: (2024)
di: Zarei, Arman, et al.
Pubblicazione: (2024)
On Mechanistic Knowledge Localization in Text-to-Image Generative Models
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
Rethinking Artistic Copyright Infringements in the Era of Text-to-Image Generative Models
di: Moayeri, Mazda, et al.
Pubblicazione: (2024)
di: Moayeri, Mazda, et al.
Pubblicazione: (2024)
Localizing Knowledge in Diffusion Transformers
di: Zarei, Arman, et al.
Pubblicazione: (2025)
di: Zarei, Arman, et al.
Pubblicazione: (2025)
IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
di: Zarei, Arman, et al.
Pubblicazione: (2025)
di: Zarei, Arman, et al.
Pubblicazione: (2025)
AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
di: Zarei, Arman, et al.
Pubblicazione: (2025)
di: Zarei, Arman, et al.
Pubblicazione: (2025)
Explaining CLIP's performance disparities on data from blind/low vision users
di: Massiceti, Daniela, et al.
Pubblicazione: (2023)
di: Massiceti, Daniela, et al.
Pubblicazione: (2023)
What do we learn from inverting CLIP models?
di: Kazemi, Hamid, et al.
Pubblicazione: (2024)
di: Kazemi, Hamid, et al.
Pubblicazione: (2024)
Exploring the Spectrum of Visio-Linguistic Compositionality and Recognition
di: Oh, Youngtaek, et al.
Pubblicazione: (2024)
di: Oh, Youngtaek, et al.
Pubblicazione: (2024)
CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation
di: Chung, Jeannie, et al.
Pubblicazione: (2026)
di: Chung, Jeannie, et al.
Pubblicazione: (2026)
CLIP-SR: Collaborative Linguistic and Image Processing for Super-Resolution
di: Hu, Bingwen, et al.
Pubblicazione: (2024)
di: Hu, Bingwen, et al.
Pubblicazione: (2024)
Differentially Private Representation Learning via Image Captioning
di: Sander, Tom, et al.
Pubblicazione: (2024)
di: Sander, Tom, et al.
Pubblicazione: (2024)
CLIP-KD: An Empirical Study of CLIP Model Distillation
di: Yang, Chuanguang, et al.
Pubblicazione: (2023)
di: Yang, Chuanguang, et al.
Pubblicazione: (2023)
Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
di: Zhang, Le, et al.
Pubblicazione: (2023)
di: Zhang, Le, et al.
Pubblicazione: (2023)
ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model
di: Chen, Yifan, et al.
Pubblicazione: (2024)
di: Chen, Yifan, et al.
Pubblicazione: (2024)
CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples
di: Zhang, Jianrui, et al.
Pubblicazione: (2024)
di: Zhang, Jianrui, et al.
Pubblicazione: (2024)
IConMark: Robust Interpretable Concept-Based Watermark For AI Images
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs
di: Li, Can, et al.
Pubblicazione: (2025)
di: Li, Can, et al.
Pubblicazione: (2025)
VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling
di: Zhang, Qian, et al.
Pubblicazione: (2024)
di: Zhang, Qian, et al.
Pubblicazione: (2024)
VisioBlend: Sketch and Stroke-Guided Denoising Diffusion Probabilistic Model for Realistic Image Generation
di: Devmurari, Harshkumar, et al.
Pubblicazione: (2024)
di: Devmurari, Harshkumar, et al.
Pubblicazione: (2024)
Text-to-Image Generation Via Energy-Based CLIP
di: Ganz, Roy, et al.
Pubblicazione: (2024)
di: Ganz, Roy, et al.
Pubblicazione: (2024)
PRIME: Prioritizing Interpretability in Failure Mode Extraction
di: Rezaei, Keivan, et al.
Pubblicazione: (2023)
di: Rezaei, Keivan, et al.
Pubblicazione: (2023)
TTD: Text-Tag Self-Distillation Enhancing Image-Text Alignment in CLIP to Alleviate Single Tag Bias
di: Jo, Sanghyun, et al.
Pubblicazione: (2024)
di: Jo, Sanghyun, et al.
Pubblicazione: (2024)
Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation
di: Csizmadia, Daniel, et al.
Pubblicazione: (2025)
di: Csizmadia, Daniel, et al.
Pubblicazione: (2025)
CLIP-Gaze: Towards General Gaze Estimation via Visual-Linguistic Model
di: Yin, Pengwei, et al.
Pubblicazione: (2024)
di: Yin, Pengwei, et al.
Pubblicazione: (2024)
A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
VTD-CLIP: Video-to-Text Discretization via Prompting CLIP
di: Zhu, Wencheng, et al.
Pubblicazione: (2025)
di: Zhu, Wencheng, et al.
Pubblicazione: (2025)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
MoCLIP: Motion-Aware Fine-Tuning and Distillation of CLIP for Human Motion Generation
di: Maldonado, Gabriel, et al.
Pubblicazione: (2025)
di: Maldonado, Gabriel, et al.
Pubblicazione: (2025)
How Learnable Grids Recover Fine Detail in Low Dimensions: A Neural Tangent Kernel Analysis of Multigrid Parametric Encodings
di: Audia, Samuel, et al.
Pubblicazione: (2025)
di: Audia, Samuel, et al.
Pubblicazione: (2025)
VisioPhysioENet: Visual Physiological Engagement Detection Network
di: Singh, Alakhsimar, et al.
Pubblicazione: (2024)
di: Singh, Alakhsimar, et al.
Pubblicazione: (2024)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
DP-RDM: Adapting Diffusion Models to Private Domains Without Fine-Tuning
di: Lebensold, Jonathan, et al.
Pubblicazione: (2024)
di: Lebensold, Jonathan, et al.
Pubblicazione: (2024)
Robustness of AI-Image Detectors: Fundamental Limits and Practical Attacks
di: Saberi, Mehrdad, et al.
Pubblicazione: (2023)
di: Saberi, Mehrdad, et al.
Pubblicazione: (2023)
Extending CLIP's Image-Text Alignment to Referring Image Segmentation
di: Kim, Seoyeon, et al.
Pubblicazione: (2023)
di: Kim, Seoyeon, et al.
Pubblicazione: (2023)
Connecting Consistency Distillation to Score Distillation for Text-to-3D Generation
di: Li, Zongrui, et al.
Pubblicazione: (2024)
di: Li, Zongrui, et al.
Pubblicazione: (2024)
Text-to-Sticker: Style Tailoring Latent Diffusion Models for Human Expression
di: Sinha, Animesh, et al.
Pubblicazione: (2023)
di: Sinha, Animesh, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2024) -
Understanding Information Storage and Transfer in Multi-modal Large Language Models
di: Basu, Samyadeep, et al.
Pubblicazione: (2024) -
Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
di: Zarei, Arman, et al.
Pubblicazione: (2024) -
On Mechanistic Knowledge Localization in Text-to-Image Generative Models
di: Basu, Samyadeep, et al.
Pubblicazione: (2024) -
Rethinking Artistic Copyright Infringements in the Era of Text-to-Image Generative Models
di: Moayeri, Mazda, et al.
Pubblicazione: (2024)