Interpreting CLIP's Image Representation via Text-Based Decomposition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gandelsman, Yossi, Efros, Alexei A., Steinhardt, Jacob |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Interpreting the Second-Order Effects of Neurons in CLIP
par: Gandelsman, Yossi, et autres
Publié: (2024)
par: Gandelsman, Yossi, et autres
Publié: (2024)
Interpreting ResNet-based CLIP via Neuron-Attention Decomposition
par: Bu, Edmund, et autres
Publié: (2025)
par: Bu, Edmund, et autres
Publié: (2025)
Vision Transformers Don't Need Trained Registers
par: Jiang, Nick, et autres
Publié: (2025)
par: Jiang, Nick, et autres
Publié: (2025)
Quantifying and Enabling the Interpretability of CLIP-like Models
par: Madasu, Avinash, et autres
Publié: (2024)
par: Madasu, Avinash, et autres
Publié: (2024)
Synthesizing Moving People with 3D Control
par: Li, Boyi, et autres
Publié: (2024)
par: Li, Boyi, et autres
Publié: (2024)
The Unreasonable Effectiveness of Text Embedding Interpolation for Continuous Image Steering
par: Ekin, Yigit, et autres
Publié: (2026)
par: Ekin, Yigit, et autres
Publié: (2026)
Steering CLIP's vision transformer with sparse autoencoders
par: Joseph, Sonia, et autres
Publié: (2025)
par: Joseph, Sonia, et autres
Publié: (2025)
Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
par: Koepke, A. Sophia, et autres
Publié: (2026)
par: Koepke, A. Sophia, et autres
Publié: (2026)
Interpreting the Weight Space of Customized Diffusion Models
par: Dravid, Amil, et autres
Publié: (2024)
par: Dravid, Amil, et autres
Publié: (2024)
An Empirical Study of Autoregressive Pre-training from Videos
par: Rajasegaran, Jathushan, et autres
Publié: (2025)
par: Rajasegaran, Jathushan, et autres
Publié: (2025)
Enhancing Multimodal Understanding with CLIP-Based Image-to-Text Transformation
par: Che, Chang, et autres
Publié: (2024)
par: Che, Chang, et autres
Publié: (2024)
Jailbreaking Vision-Language Models Through the Visual Modality
par: Azulay, Aharon, et autres
Publié: (2026)
par: Azulay, Aharon, et autres
Publié: (2026)
Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations
par: Jiang, Nick, et autres
Publié: (2024)
par: Jiang, Nick, et autres
Publié: (2024)
Learning Video Representations without Natural Videos
par: Yu, Xueyang, et autres
Publié: (2024)
par: Yu, Xueyang, et autres
Publié: (2024)
Diffusion Models as Data Mining Tools
par: Siglidis, Ioannis, et autres
Publié: (2024)
par: Siglidis, Ioannis, et autres
Publié: (2024)
LLMs can see and hear without any training
par: Ashutosh, Kumar, et autres
Publié: (2025)
par: Ashutosh, Kumar, et autres
Publié: (2025)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
par: Zhu, Zhiyu, et autres
Publié: (2025)
par: Zhu, Zhiyu, et autres
Publié: (2025)
Test-Time Training on Video Streams
par: Wang, Renhao, et autres
Publié: (2023)
par: Wang, Renhao, et autres
Publié: (2023)
Long-Text-to-Image Generation via Compositional Prompt Decomposition
par: Huang, Jen-Yuan, et autres
Publié: (2026)
par: Huang, Jen-Yuan, et autres
Publié: (2026)
DIST-CLIP: Arbitrary Metadata and Image Guided MRI Harmonization via Disentangled Anatomy-Contrast Representations
par: Avci, Mehmet Yigit, et autres
Publié: (2025)
par: Avci, Mehmet Yigit, et autres
Publié: (2025)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
par: Cao, Anh-Quan, et autres
Publié: (2024)
par: Cao, Anh-Quan, et autres
Publié: (2024)
FoCLIP: A Feature-Space Misalignment Framework for CLIP-Based Image Manipulation and Detection
par: Chen, Yulin, et autres
Publié: (2025)
par: Chen, Yulin, et autres
Publié: (2025)
Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
par: Kwon, Jihoon, et autres
Publié: (2025)
par: Kwon, Jihoon, et autres
Publié: (2025)
ComCLIP: Training-Free Compositional Image and Text Matching
par: Jiang, Kenan, et autres
Publié: (2022)
par: Jiang, Kenan, et autres
Publié: (2022)
Video CLIP Model for Multi-View Echocardiography Interpretation
par: Takizawa, Ryo, et autres
Publié: (2025)
par: Takizawa, Ryo, et autres
Publié: (2025)
Unconstrained Open Vocabulary Image Classification: Zero-Shot Transfer from Text to Image via CLIP Inversion
par: Allgeuer, Philipp, et autres
Publié: (2024)
par: Allgeuer, Philipp, et autres
Publié: (2024)
Parrot Captions Teach CLIP to Spot Text
par: Lin, Yiqi, et autres
Publié: (2023)
par: Lin, Yiqi, et autres
Publié: (2023)
Knowledge-Base based Semantic Image Transmission Using CLIP
par: Li, Chongyang, et autres
Publié: (2025)
par: Li, Chongyang, et autres
Publié: (2025)
microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification
par: Silva, Sathira, et autres
Publié: (2025)
par: Silva, Sathira, et autres
Publié: (2025)
Interpreting CLIP: Insights on the Robustness to ImageNet Distribution Shifts
par: Crabbé, Jonathan, et autres
Publié: (2023)
par: Crabbé, Jonathan, et autres
Publié: (2023)
Helping CLIP See Both the Forest and the Trees: A Decomposition and Description Approach
par: Xue, Leyan, et autres
Publié: (2025)
par: Xue, Leyan, et autres
Publié: (2025)
CLIP Model for Images to Textual Prompts Based on Top-k Neighbors
par: Zhang, Xin, et autres
Publié: (2024)
par: Zhang, Xin, et autres
Publié: (2024)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
par: Pan, Jiancheng, et autres
Publié: (2024)
par: Pan, Jiancheng, et autres
Publié: (2024)
CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding
par: Xu, Wenhao, et autres
Publié: (2024)
par: Xu, Wenhao, et autres
Publié: (2024)
Interpreting Global Perturbation Robustness of Image Models using Axiomatic Spectral Importance Decomposition
par: Luo, Róisín, et autres
Publié: (2024)
par: Luo, Róisín, et autres
Publié: (2024)
Fairness Analysis of CLIP-Based Foundation Models for X-Ray Image Classification
par: Sun, Xiangyu, et autres
Publié: (2025)
par: Sun, Xiangyu, et autres
Publié: (2025)
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
par: Tran, Quoc-Khang, et autres
Publié: (2026)
par: Tran, Quoc-Khang, et autres
Publié: (2026)
Leveraging Cross-Modal Neighbor Representation for Improved CLIP Classification
par: Yi, Chao, et autres
Publié: (2024)
par: Yi, Chao, et autres
Publié: (2024)
Hierarchical Representation Matching for CLIP-based Class-Incremental Learning
par: Wen, Zhen-Hao, et autres
Publié: (2025)
par: Wen, Zhen-Hao, et autres
Publié: (2025)
Multi-Group Proportional Representation for Text-to-Image Models
par: Jung, Sangwon, et autres
Publié: (2025)
par: Jung, Sangwon, et autres
Publié: (2025)
Documents similaires
-
Interpreting the Second-Order Effects of Neurons in CLIP
par: Gandelsman, Yossi, et autres
Publié: (2024) -
Interpreting ResNet-based CLIP via Neuron-Attention Decomposition
par: Bu, Edmund, et autres
Publié: (2025) -
Vision Transformers Don't Need Trained Registers
par: Jiang, Nick, et autres
Publié: (2025) -
Quantifying and Enabling the Interpretability of CLIP-like Models
par: Madasu, Avinash, et autres
Publié: (2024) -
Synthesizing Moving People with 3D Control
par: Li, Boyi, et autres
Publié: (2024)