From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gentile, Francesco, Dall'Asen, Nicola, Tonini, Francesco, Mancini, Massimiliano, Vaquero, Lorenzo, Ricci, Elisa |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AL-GTD: Deep Active Learning for Gaze Target Detection
par: Tonini, Francesco, et autres
Publié: (2024)
par: Tonini, Francesco, et autres
Publié: (2024)
Retrieval-enriched zero-shot image classification in low-resource domains
par: Dall'Asen, Nicola, et autres
Publié: (2024)
par: Dall'Asen, Nicola, et autres
Publié: (2024)
Training-Free Semantic Multi-Object Tracking with Vision-Language Models
par: Bonat, Laurence, et autres
Publié: (2026)
par: Bonat, Laurence, et autres
Publié: (2026)
Dynamic Scoring with Enhanced Semantics for Training-Free Human-Object Interaction Detection
par: Tonini, Francesco, et autres
Publié: (2025)
par: Tonini, Francesco, et autres
Publié: (2025)
Adv-KD: Adversarial Knowledge Distillation for Faster Diffusion Sampling
par: Mekonnen, Kidist Amde, et autres
Publié: (2024)
par: Mekonnen, Kidist Amde, et autres
Publié: (2024)
Towards Unconstrained Human-Object Interaction
par: Tonini, Francesco, et autres
Publié: (2026)
par: Tonini, Francesco, et autres
Publié: (2026)
MIL-PF: Multiple Instance Learning on Precomputed Features for Mammography Classification
par: Jovišić, Nikola, et autres
Publié: (2026)
par: Jovišić, Nikola, et autres
Publié: (2026)
MAMBO: High-Resolution Generative Approach for Mammography Images
par: Škipina, Milica, et autres
Publié: (2025)
par: Škipina, Milica, et autres
Publié: (2025)
Training-Free Personalization via Retrieval and Reasoning on Fingerprints
par: Das, Deepayan, et autres
Publié: (2025)
par: Das, Deepayan, et autres
Publié: (2025)
Increasing the Utility of Synthetic Images through Chamfer Guidance
par: Dall'Asen, Nicola, et autres
Publié: (2025)
par: Dall'Asen, Nicola, et autres
Publié: (2025)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
par: Berasi, Davide, et autres
Publié: (2025)
par: Berasi, Davide, et autres
Publié: (2025)
ConViS-Bench: Estimating Video Similarity Through Semantic Concepts
par: Liberatori, Benedetta, et autres
Publié: (2025)
par: Liberatori, Benedetta, et autres
Publié: (2025)
The Phantom Menace: Unmasking Privacy Leakages in Vision-Language Models
par: Caldarella, Simone, et autres
Publié: (2024)
par: Caldarella, Simone, et autres
Publié: (2024)
One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering
par: Das, Deepayan, et autres
Publié: (2024)
par: Das, Deepayan, et autres
Publié: (2024)
Unlearning Personal Data from a Single Image
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
par: Farina, Matteo, et autres
Publié: (2025)
par: Farina, Matteo, et autres
Publié: (2025)
Large Multimodal Models as General In-Context Classifiers
par: Garosi, Marco, et autres
Publié: (2026)
par: Garosi, Marco, et autres
Publié: (2026)
Compositional Caching for Training-free Open-vocabulary Attribute Detection
par: Garosi, Marco, et autres
Publié: (2025)
par: Garosi, Marco, et autres
Publié: (2025)
Harnessing Large Language Models for Training-free Video Anomaly Detection
par: Zanella, Luca, et autres
Publié: (2024)
par: Zanella, Luca, et autres
Publié: (2024)
Training-free Online Video Step Grounding
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
Classifier-to-Bias: Toward Unsupervised Automatic Bias Detection for Visual Classifiers
par: Guimard, Quentin, et autres
Publié: (2025)
par: Guimard, Quentin, et autres
Publié: (2025)
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
par: Farina, Matteo, et autres
Publié: (2024)
par: Farina, Matteo, et autres
Publié: (2024)
Automatic benchmarking of large multimodal models via iterative experiment programming
par: Conti, Alessandro, et autres
Publié: (2024)
par: Conti, Alessandro, et autres
Publié: (2024)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
par: De Min, Thomas, et autres
Publié: (2026)
par: De Min, Thomas, et autres
Publié: (2026)
Interpreting CLIP's Image Representation via Text-Based Decomposition
par: Gandelsman, Yossi, et autres
Publié: (2023)
par: Gandelsman, Yossi, et autres
Publié: (2023)
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning
par: Farina, Matteo, et autres
Publié: (2024)
par: Farina, Matteo, et autres
Publié: (2024)
Vocabulary-free Image Classification and Semantic Segmentation
par: Conti, Alessandro, et autres
Publié: (2024)
par: Conti, Alessandro, et autres
Publié: (2024)
Vocabulary-free Image Classification
par: Conti, Alessandro, et autres
Publié: (2023)
par: Conti, Alessandro, et autres
Publié: (2023)
Can Text-to-Video Generation help Video-Language Alignment?
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
On Large Multimodal Models as Open-World Image Classifiers
par: Conti, Alessandro, et autres
Publié: (2025)
par: Conti, Alessandro, et autres
Publié: (2025)
CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values
par: Koleilat, Taha, et autres
Publié: (2025)
par: Koleilat, Taha, et autres
Publié: (2025)
Interpreting ResNet-based CLIP via Neuron-Attention Decomposition
par: Bu, Edmund, et autres
Publié: (2025)
par: Bu, Edmund, et autres
Publié: (2025)
Zero-Shot Temporal Action Localization Through Textual Guidance
par: Liberatori, Benedetta, et autres
Publié: (2026)
par: Liberatori, Benedetta, et autres
Publié: (2026)
Test-time Vocabulary Adaptation for Language-driven Object Detection
par: Liu, Mingxuan, et autres
Publié: (2025)
par: Liu, Mingxuan, et autres
Publié: (2025)
SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models
par: Guimard, Quentin, et autres
Publié: (2026)
par: Guimard, Quentin, et autres
Publié: (2026)
CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models
par: Sammani, Fawaz, et autres
Publié: (2025)
par: Sammani, Fawaz, et autres
Publié: (2025)
ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition
par: Lin, Shen, et autres
Publié: (2026)
par: Lin, Shen, et autres
Publié: (2026)
How to Take a Memorable Picture? Empowering Users with Actionable Feedback
par: Laiti, Francesco, et autres
Publié: (2026)
par: Laiti, Francesco, et autres
Publié: (2026)
Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization
par: Berasi, Davide, et autres
Publié: (2026)
par: Berasi, Davide, et autres
Publié: (2026)
Documents similaires
-
AL-GTD: Deep Active Learning for Gaze Target Detection
par: Tonini, Francesco, et autres
Publié: (2024) -
Retrieval-enriched zero-shot image classification in low-resource domains
par: Dall'Asen, Nicola, et autres
Publié: (2024) -
Training-Free Semantic Multi-Object Tracking with Vision-Language Models
par: Bonat, Laurence, et autres
Publié: (2026) -
Dynamic Scoring with Enhanced Semantics for Training-Free Human-Object Interaction Detection
par: Tonini, Francesco, et autres
Publié: (2025) -
Adv-KD: Adversarial Knowledge Distillation for Faster Diffusion Sampling
par: Mekonnen, Kidist Amde, et autres
Publié: (2024)