Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNet
Fuente:
arXiv
Saved in:
| Main Authors: | Giulivi, Loris, Boracchi, Giacomo |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
by: Giulivi, Loris, et al.
Published: (2024)
by: Giulivi, Loris, et al.
Published: (2024)
SE3D: A Framework For Saliency Method Evaluation In 3D Imaging
by: Wiśniewski, Mariusz, et al.
Published: (2024)
by: Wiśniewski, Mariusz, et al.
Published: (2024)
An expert-driven data generation pipeline for histological images
by: Basla, Roberto, et al.
Published: (2024)
by: Basla, Roberto, et al.
Published: (2024)
MultiLink: Multi-class Structure Recovery via Agglomerative Clustering and Model Selection
by: Magri, Luca, et al.
Published: (2025)
by: Magri, Luca, et al.
Published: (2025)
Convolutional Set Transformer
by: Chinello, Federico, et al.
Published: (2025)
by: Chinello, Federico, et al.
Published: (2025)
Multi-modal Auto-regressive Modeling via Visual Words
by: Peng, Tianshuo, et al.
Published: (2024)
by: Peng, Tianshuo, et al.
Published: (2024)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
by: Chen, Haokun, et al.
Published: (2025)
by: Chen, Haokun, et al.
Published: (2025)
Explaining How Visual, Textual and Multimodal Encoders Share Concepts
by: Cornet, Clément, et al.
Published: (2025)
by: Cornet, Clément, et al.
Published: (2025)
InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection
by: Chen, Junjie, et al.
Published: (2024)
by: Chen, Junjie, et al.
Published: (2024)
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
by: Zhou, Qiongyi, et al.
Published: (2024)
by: Zhou, Qiongyi, et al.
Published: (2024)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
by: Cao, Anh-Quan, et al.
Published: (2024)
by: Cao, Anh-Quan, et al.
Published: (2024)
Temporal-consistent CAMs for Weakly Supervised Video Segmentation in Waste Sorting
by: Marelli, Andrea, et al.
Published: (2025)
by: Marelli, Andrea, et al.
Published: (2025)
PIF: Anomaly detection via preference embedding
by: Leveni, Filippo, et al.
Published: (2025)
by: Leveni, Filippo, et al.
Published: (2025)
Hashing for Structure-based Anomaly Detection
by: Leveni, Filippo, et al.
Published: (2025)
by: Leveni, Filippo, et al.
Published: (2025)
Preference Isolation Forest for Structure-based Anomaly Detection
by: Leveni, Filippo, et al.
Published: (2025)
by: Leveni, Filippo, et al.
Published: (2025)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
by: Gao, Bin-Bin, et al.
Published: (2025)
by: Gao, Bin-Bin, et al.
Published: (2025)
VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings
by: Giahi, Ramin, et al.
Published: (2025)
by: Giahi, Ramin, et al.
Published: (2025)
A Deep Learning Pipeline for Solid Waste Detection in Remote Sensing Images
by: Gibellini, Federico, et al.
Published: (2025)
by: Gibellini, Federico, et al.
Published: (2025)
Explaining multimodal LLMs via intra-modal token interactions
by: Liang, Jiawei, et al.
Published: (2025)
by: Liang, Jiawei, et al.
Published: (2025)
CT-CLIP: A Multi-modal Fusion Framework for Robust Apple Leaf Disease Recognition in Complex Environments
by: Liu, Lemin, et al.
Published: (2025)
by: Liu, Lemin, et al.
Published: (2025)
MulCPred: Learning Multi-modal Concepts for Explainable Pedestrian Action Prediction
by: Feng, Yan, et al.
Published: (2024)
by: Feng, Yan, et al.
Published: (2024)
Crossmodal Knowledge Distillation with WordNet-Relaxed Text Embeddings for Robust Image Classification
by: Guo, Chenqi, et al.
Published: (2025)
by: Guo, Chenqi, et al.
Published: (2025)
ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task
by: Khalil, Ahmad, et al.
Published: (2025)
by: Khalil, Ahmad, et al.
Published: (2025)
Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions
by: Möller, Lucas, et al.
Published: (2024)
by: Möller, Lucas, et al.
Published: (2024)
Explaining Generalization Power of a DNN Using Interactive Concepts
by: Zhou, Huilin, et al.
Published: (2023)
by: Zhou, Huilin, et al.
Published: (2023)
Color in Visual-Language Models: CLIP deficiencies
by: Arias, Guillem, et al.
Published: (2025)
by: Arias, Guillem, et al.
Published: (2025)
Interpreting ResNet-based CLIP via Neuron-Attention Decomposition
by: Bu, Edmund, et al.
Published: (2025)
by: Bu, Edmund, et al.
Published: (2025)
Improving the Explain-Any-Concept by Introducing Nonlinearity to the Trainable Surrogate Model
by: Zaval, Mounes, et al.
Published: (2024)
by: Zaval, Mounes, et al.
Published: (2024)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
by: Wu, Linquan, et al.
Published: (2026)
by: Wu, Linquan, et al.
Published: (2026)
RAVE: Residual Vector Embedding for CLIP-Guided Backlit Image Enhancement
by: Gaintseva, Tatiana, et al.
Published: (2024)
by: Gaintseva, Tatiana, et al.
Published: (2024)
GET: Unlocking the Multi-modal Potential of CLIP for Generalized Category Discovery
by: Wang, Enguang, et al.
Published: (2024)
by: Wang, Enguang, et al.
Published: (2024)
Visual Words Meet BM25: Sparse Auto-Encoder Visual Word Scoring for Image Retrieval
by: Han, Donghoon, et al.
Published: (2026)
by: Han, Donghoon, et al.
Published: (2026)
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
by: Zhang, Yunzhi, et al.
Published: (2024)
by: Zhang, Yunzhi, et al.
Published: (2024)
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
by: Shi, Danli, et al.
Published: (2024)
by: Shi, Danli, et al.
Published: (2024)
FG-CLIP: Fine-Grained Visual and Textual Alignment
by: Xie, Chunyu, et al.
Published: (2025)
by: Xie, Chunyu, et al.
Published: (2025)
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
by: Chen, Tianwei, et al.
Published: (2026)
by: Chen, Tianwei, et al.
Published: (2026)
HAMLET-FFD: Hierarchical Adaptive Multi-modal Learning Embeddings Transformation for Face Forgery Detection
by: Cui, Jialei, et al.
Published: (2025)
by: Cui, Jialei, et al.
Published: (2025)
AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly Detection
by: Cao, Yunkang, et al.
Published: (2024)
by: Cao, Yunkang, et al.
Published: (2024)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
by: Lu, Yi, et al.
Published: (2025)
by: Lu, Yi, et al.
Published: (2025)
A Multimodal Hybrid Late-Cascade Fusion Network for Enhanced 3D Object Detection
by: Sgaravatti, Carlo, et al.
Published: (2025)
by: Sgaravatti, Carlo, et al.
Published: (2025)
Similar Items
-
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
by: Giulivi, Loris, et al.
Published: (2024) -
SE3D: A Framework For Saliency Method Evaluation In 3D Imaging
by: Wiśniewski, Mariusz, et al.
Published: (2024) -
An expert-driven data generation pipeline for histological images
by: Basla, Roberto, et al.
Published: (2024) -
MultiLink: Multi-class Structure Recovery via Agglomerative Clustering and Model Selection
by: Magri, Luca, et al.
Published: (2025) -
Convolutional Set Transformer
by: Chinello, Federico, et al.
Published: (2025)