Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion
Fuente:
arXiv
Salvato in:
| Autori principali: | Mistretta, Marco, Baldrati, Alberto, Agnolucci, Lorenzo, Bertini, Marco, Bagdanov, Andrew D. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Zero-shot Generalization of Learned Prompts via Unsupervised Knowledge Distillation
di: Mistretta, Marco, et al.
Pubblicazione: (2024)
di: Mistretta, Marco, et al.
Pubblicazione: (2024)
SpectralGCD: Spectral Concept Selection and Cross-modal Representation Learning for Generalized Category Discovery
di: Caselli, Lorenzo, et al.
Pubblicazione: (2026)
di: Caselli, Lorenzo, et al.
Pubblicazione: (2026)
iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment
di: Magistri, Simone, et al.
Pubblicazione: (2026)
di: Magistri, Simone, et al.
Pubblicazione: (2026)
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
RE-tune: Incremental Fine Tuning of Biomedical Vision-Language Models for Multi-label Chest X-ray Classification
di: Mistretta, Marco, et al.
Pubblicazione: (2024)
di: Mistretta, Marco, et al.
Pubblicazione: (2024)
Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP
di: Herzog, Jonas, et al.
Pubblicazione: (2026)
di: Herzog, Jonas, et al.
Pubblicazione: (2026)
Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation
di: Wang, Jiaxi, et al.
Pubblicazione: (2023)
di: Wang, Jiaxi, et al.
Pubblicazione: (2023)
Geometry-Aware CLIP Retrieval via Local Cross-Modal Alignment and Steering
di: Prakash, Nirmalendu, et al.
Pubblicazione: (2026)
di: Prakash, Nirmalendu, et al.
Pubblicazione: (2026)
Multimodal-Conditioned Latent Diffusion Models for Fashion Image Editing
di: Baldrati, Alberto, et al.
Pubblicazione: (2024)
di: Baldrati, Alberto, et al.
Pubblicazione: (2024)
FoCLIP: A Feature-Space Misalignment Framework for CLIP-Based Image Manipulation and Detection
di: Chen, Yulin, et al.
Pubblicazione: (2025)
di: Chen, Yulin, et al.
Pubblicazione: (2025)
Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP
di: Eslami, Sedigheh, et al.
Pubblicazione: (2024)
di: Eslami, Sedigheh, et al.
Pubblicazione: (2024)
Leveraging Cross-Modal Neighbor Representation for Improved CLIP Classification
di: Yi, Chao, et al.
Pubblicazione: (2024)
di: Yi, Chao, et al.
Pubblicazione: (2024)
Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning
di: Jia, Haonan, et al.
Pubblicazione: (2026)
di: Jia, Haonan, et al.
Pubblicazione: (2026)
Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion
di: Dell'Erba, Samuele, et al.
Pubblicazione: (2025)
di: Dell'Erba, Samuele, et al.
Pubblicazione: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
Implicit Inversion turns CLIP into a Decoder
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
di: D'Orazio, Antonio, et al.
Pubblicazione: (2025)
Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis
di: Samanta, Argha Kamal, et al.
Pubblicazione: (2025)
di: Samanta, Argha Kamal, et al.
Pubblicazione: (2025)
CLIP-based Camera-Agnostic Feature Learning for Intra-camera Person Re-Identification
di: Tan, Xuan, et al.
Pubblicazione: (2024)
di: Tan, Xuan, et al.
Pubblicazione: (2024)
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
di: Bulat, Adrian, et al.
Pubblicazione: (2026)
di: Bulat, Adrian, et al.
Pubblicazione: (2026)
Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNet
di: Giulivi, Loris, et al.
Pubblicazione: (2024)
di: Giulivi, Loris, et al.
Pubblicazione: (2024)
Multi-Modality Distillation via Learning the teacher's modality-level Gram Matrix
di: Liu, Peng
Pubblicazione: (2021)
di: Liu, Peng
Pubblicazione: (2021)
Security Risk of Misalignment between Text and Image in Multi-modal Model
di: Wang, Xiaosen, et al.
Pubblicazione: (2025)
di: Wang, Xiaosen, et al.
Pubblicazione: (2025)
InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection
di: Chen, Junjie, et al.
Pubblicazione: (2024)
di: Chen, Junjie, et al.
Pubblicazione: (2024)
MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment
di: Li, Juan, et al.
Pubblicazione: (2026)
di: Li, Juan, et al.
Pubblicazione: (2026)
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
di: Shi, Danli, et al.
Pubblicazione: (2024)
di: Shi, Danli, et al.
Pubblicazione: (2024)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
di: Li, Fan, et al.
Pubblicazione: (2025)
di: Li, Fan, et al.
Pubblicazione: (2025)
CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion
di: Jindal, Akshit, et al.
Pubblicazione: (2026)
di: Jindal, Akshit, et al.
Pubblicazione: (2026)
Distilling Cross-Modal Knowledge via Feature Disentanglement
di: Liu, Junhong, et al.
Pubblicazione: (2025)
di: Liu, Junhong, et al.
Pubblicazione: (2025)
Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization
di: Zhou, Hefeng, et al.
Pubblicazione: (2026)
di: Zhou, Hefeng, et al.
Pubblicazione: (2026)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
Image Intrinsic Scale Assessment: Bridging the Gap Between Quality and Resolution
di: Hosu, Vlad, et al.
Pubblicazione: (2025)
di: Hosu, Vlad, et al.
Pubblicazione: (2025)
Cross-Modal Mapping and Dual-Branch Reconstruction for 2D-3D Multimodal Industrial Anomaly Detection
di: Daci, Radia, et al.
Pubblicazione: (2026)
di: Daci, Radia, et al.
Pubblicazione: (2026)
AA-CLIP: Enhancing Zero-shot Anomaly Detection via Anomaly-Aware CLIP
di: Ma, Wenxin, et al.
Pubblicazione: (2025)
di: Ma, Wenxin, et al.
Pubblicazione: (2025)
CT-CLIP: A Multi-modal Fusion Framework for Robust Apple Leaf Disease Recognition in Complex Environments
di: Liu, Lemin, et al.
Pubblicazione: (2025)
di: Liu, Lemin, et al.
Pubblicazione: (2025)
CLIP Adaptation by Intra-modal Overlap Reduction
di: Kravets, Alexey, et al.
Pubblicazione: (2024)
di: Kravets, Alexey, et al.
Pubblicazione: (2024)
Unconstrained Open Vocabulary Image Classification: Zero-Shot Transfer from Text to Image via CLIP Inversion
di: Allgeuer, Philipp, et al.
Pubblicazione: (2024)
di: Allgeuer, Philipp, et al.
Pubblicazione: (2024)
Fusion-Mamba for Cross-modality Object Detection
di: Dong, Wenhao, et al.
Pubblicazione: (2024)
di: Dong, Wenhao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improving Zero-shot Generalization of Learned Prompts via Unsupervised Knowledge Distillation
di: Mistretta, Marco, et al.
Pubblicazione: (2024) -
SpectralGCD: Spectral Concept Selection and Cross-modal Representation Learning for Generalized Category Discovery
di: Caselli, Lorenzo, et al.
Pubblicazione: (2026) -
iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024) -
IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment
di: Magistri, Simone, et al.
Pubblicazione: (2026) -
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)