CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion
Fuente:
arXiv
Salvato in:
| Autori principali: | Jindal, Akshit, Anand, Saket, Arora, Chetan, Goyal, Vikram |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Identifying Physically Realizable Triggers for Backdoored Face Recognition Networks
di: Raj, Ankita, et al.
Pubblicazione: (2025)
di: Raj, Ankita, et al.
Pubblicazione: (2025)
Backdooring CLIP through Concept Confusion
di: Hu, Lijie, et al.
Pubblicazione: (2025)
di: Hu, Lijie, et al.
Pubblicazione: (2025)
InverTune: Removing Backdoors from Multimodal Contrastive Learning Models via Trigger Inversion and Activation Tuning
di: Sun, Mengyuan, et al.
Pubblicazione: (2025)
di: Sun, Mengyuan, et al.
Pubblicazione: (2025)
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
di: Yao, Xin, et al.
Pubblicazione: (2025)
di: Yao, Xin, et al.
Pubblicazione: (2025)
Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling
di: Li, Zida, et al.
Pubblicazione: (2026)
di: Li, Zida, et al.
Pubblicazione: (2026)
Removing the Trigger, Not the Backdoor: Alternative Triggers and Latent Backdoors
di: Abad, Gorka, et al.
Pubblicazione: (2026)
di: Abad, Gorka, et al.
Pubblicazione: (2026)
Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP
di: Singh, Naman Deep, et al.
Pubblicazione: (2024)
di: Singh, Naman Deep, et al.
Pubblicazione: (2024)
Backdoor Mitigation in Object Detection via Adversarial Fine-Tuning
di: Dunnett, Kealan, et al.
Pubblicazione: (2026)
di: Dunnett, Kealan, et al.
Pubblicazione: (2026)
CLIP-Flow: A Universal Discriminator for AI-Generated Images Inspired by Anomaly Detection
di: Yuan, Zhipeng, et al.
Pubblicazione: (2025)
di: Yuan, Zhipeng, et al.
Pubblicazione: (2025)
DeeCLIP: A Robust and Generalizable Transformer-Based Framework for Detecting AI-Generated Images
di: Keita, Mamadou, et al.
Pubblicazione: (2025)
di: Keita, Mamadou, et al.
Pubblicazione: (2025)
Backdoor Attacks against No-Reference Image Quality Assessment Models via a Scalable Trigger
di: Yu, Yi, et al.
Pubblicazione: (2024)
di: Yu, Yi, et al.
Pubblicazione: (2024)
Forensics Adapter: Unleashing CLIP for Generalizable Face Forgery Detection
di: Cui, Xinjie, et al.
Pubblicazione: (2024)
di: Cui, Xinjie, et al.
Pubblicazione: (2024)
Examining the Threat Landscape: Foundation Models and Model Stealing
di: Raj, Ankita, et al.
Pubblicazione: (2025)
di: Raj, Ankita, et al.
Pubblicazione: (2025)
Model X-ray:Detecting Backdoored Models via Decision Boundary
di: Su, Yanghao, et al.
Pubblicazione: (2024)
di: Su, Yanghao, et al.
Pubblicazione: (2024)
Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models
di: Zhang, Zongmin, et al.
Pubblicazione: (2025)
di: Zhang, Zongmin, et al.
Pubblicazione: (2025)
Does CLIP Know My Face?
di: Hintersdorf, Dominik, et al.
Pubblicazione: (2022)
di: Hintersdorf, Dominik, et al.
Pubblicazione: (2022)
Poisoning-based Backdoor Attacks for Arbitrary Target Label with Positive Triggers
di: Huang, Binxiao, et al.
Pubblicazione: (2024)
di: Huang, Binxiao, et al.
Pubblicazione: (2024)
Versatile Backdoor Attack with Visible, Semantic, Sample-Specific, and Compatible Triggers
di: Wang, Ruotong, et al.
Pubblicazione: (2023)
di: Wang, Ruotong, et al.
Pubblicazione: (2023)
Robust Anti-Backdoor Instruction Tuning in LVLMs
di: Xun, Yuan, et al.
Pubblicazione: (2025)
di: Xun, Yuan, et al.
Pubblicazione: (2025)
BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning
di: Yang, Ziqing, et al.
Pubblicazione: (2026)
di: Yang, Ziqing, et al.
Pubblicazione: (2026)
Backdoor Attack with Sparse and Invisible Trigger
di: Gao, Yinghua, et al.
Pubblicazione: (2023)
di: Gao, Yinghua, et al.
Pubblicazione: (2023)
Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor Attacks
di: Yang, Wenhan, et al.
Pubblicazione: (2023)
di: Yang, Wenhan, et al.
Pubblicazione: (2023)
Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models
di: Lai, Songning, et al.
Pubblicazione: (2024)
di: Lai, Songning, et al.
Pubblicazione: (2024)
REFINE: Inversion-Free Backdoor Defense via Model Reprogramming
di: Chen, Yukun, et al.
Pubblicazione: (2025)
di: Chen, Yukun, et al.
Pubblicazione: (2025)
Proactive Adversarial Defense: Harnessing Prompt Tuning in Vision-Language Models to Detect Unseen Backdoored Images
di: Stein, Kyle, et al.
Pubblicazione: (2024)
di: Stein, Kyle, et al.
Pubblicazione: (2024)
Exposing Functional Fusion: A New Class of Strategic Backdoor in Dynamic Prompt Architectures
di: Liu, Zeyao, et al.
Pubblicazione: (2026)
di: Liu, Zeyao, et al.
Pubblicazione: (2026)
BadDet+: Robust Backdoor Attacks for Object Detection
di: Dunnett, Kealan, et al.
Pubblicazione: (2026)
di: Dunnett, Kealan, et al.
Pubblicazione: (2026)
CatchBackdoor: Backdoor Detection via Critical Trojan Neural Path Fuzzing
di: Jin, Haibo, et al.
Pubblicazione: (2021)
di: Jin, Haibo, et al.
Pubblicazione: (2021)
Assessing Risk of Stealing Proprietary Models for Medical Imaging Tasks
di: Raj, Ankita, et al.
Pubblicazione: (2025)
di: Raj, Ankita, et al.
Pubblicazione: (2025)
Revocable Backdoor for Deep Model Trading
di: Xu, Yiran, et al.
Pubblicazione: (2024)
di: Xu, Yiran, et al.
Pubblicazione: (2024)
Model Pairing Using Embedding Translation for Backdoor Attack Detection on Open-Set Classification Tasks
di: Unnervik, Alexander, et al.
Pubblicazione: (2024)
di: Unnervik, Alexander, et al.
Pubblicazione: (2024)
BadCLIP: Trigger-Aware Prompt Learning for Backdoor Attacks on CLIP
di: Bai, Jiawang, et al.
Pubblicazione: (2023)
di: Bai, Jiawang, et al.
Pubblicazione: (2023)
Deciphering the Definition of Adversarial Robustness for post-hoc OOD Detectors
di: Lorenz, Peter, et al.
Pubblicazione: (2024)
di: Lorenz, Peter, et al.
Pubblicazione: (2024)
Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor
di: Wei, Shaokui, et al.
Pubblicazione: (2024)
di: Wei, Shaokui, et al.
Pubblicazione: (2024)
Toward Reliable, Safe, and Secure LLMs for Scientific Applications
di: Chaturvedi, Saket Sanjeev, et al.
Pubblicazione: (2026)
di: Chaturvedi, Saket Sanjeev, et al.
Pubblicazione: (2026)
UNIT: Backdoor Mitigation via Automated Neural Distribution Tightening
di: Cheng, Siyuan, et al.
Pubblicazione: (2024)
di: Cheng, Siyuan, et al.
Pubblicazione: (2024)
SSL-OTA: Unveiling Backdoor Threats in Self-Supervised Learning for Object Detection
di: Wang, Qiannan, et al.
Pubblicazione: (2023)
di: Wang, Qiannan, et al.
Pubblicazione: (2023)
HoneypotNet: Backdoor Attacks Against Model Extraction
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
PromptSmooth: Certifying Robustness of Medical Vision-Language Models via Prompt Learning
di: Hussein, Noor, et al.
Pubblicazione: (2024)
di: Hussein, Noor, et al.
Pubblicazione: (2024)
Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation
di: Zhong, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhong, Zhiyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Identifying Physically Realizable Triggers for Backdoored Face Recognition Networks
di: Raj, Ankita, et al.
Pubblicazione: (2025) -
Backdooring CLIP through Concept Confusion
di: Hu, Lijie, et al.
Pubblicazione: (2025) -
InverTune: Removing Backdoors from Multimodal Contrastive Learning Models via Trigger Inversion and Activation Tuning
di: Sun, Mengyuan, et al.
Pubblicazione: (2025) -
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
di: Yao, Xin, et al.
Pubblicazione: (2025) -
Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling
di: Li, Zida, et al.
Pubblicazione: (2026)