SRD: Reinforcement-Learned Semantic Perturbation for Backdoor Defense in VLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Shuhan, Liang, Siyuan, Zheng, Hongling, Liu, Aishan, Wang, Xinbiao, Luo, Yong, Lin, Fu, Rutkowski, Leszek, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models
por: Xu, Shuhan, et al.
Publicado: (2026)
por: Xu, Shuhan, et al.
Publicado: (2026)
ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks
por: Ren, Zhiyao, et al.
Publicado: (2025)
por: Ren, Zhiyao, et al.
Publicado: (2025)
Revisiting Backdoor Attacks against Large Vision-Language Models from Domain Shift
por: Liang, Siyuan, et al.
Publicado: (2024)
por: Liang, Siyuan, et al.
Publicado: (2024)
ME: Trigger Element Combination Backdoor Attack on Copyright Infringement
por: Yang, Feiyu, et al.
Publicado: (2025)
por: Yang, Feiyu, et al.
Publicado: (2025)
TrapFlow: Controllable Website Fingerprinting Defense via Dynamic Backdoor Learning
por: Liang, Siyuan, et al.
Publicado: (2024)
por: Liang, Siyuan, et al.
Publicado: (2024)
ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language Models
por: Liu, Xuxu, et al.
Publicado: (2025)
por: Liu, Xuxu, et al.
Publicado: (2025)
Adversarial Backdoor Defense in CLIP
por: Kuang, Junhao, et al.
Publicado: (2024)
por: Kuang, Junhao, et al.
Publicado: (2024)
CleanerCLIP: Fine-grained Counterfactual Semantic Augmentation for Backdoor Defense in Contrastive Learning
por: Xun, Yuan, et al.
Publicado: (2024)
por: Xun, Yuan, et al.
Publicado: (2024)
BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning
por: Liang, Siyuan, et al.
Publicado: (2026)
por: Liang, Siyuan, et al.
Publicado: (2026)
Towards Robust Physical-world Backdoor Attacks on Lane Detection
por: Zhang, Xinwei, et al.
Publicado: (2024)
por: Zhang, Xinwei, et al.
Publicado: (2024)
Poisoned Forgery Face: Towards Backdoor Attacks on Face Forgery Detection
por: Liang, Jiawei, et al.
Publicado: (2024)
por: Liang, Jiawei, et al.
Publicado: (2024)
BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive Learning
por: Liang, Siyuan, et al.
Publicado: (2023)
por: Liang, Siyuan, et al.
Publicado: (2023)
VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language Models
por: Liang, Jiawei, et al.
Publicado: (2024)
por: Liang, Jiawei, et al.
Publicado: (2024)
Unlearning Backdoor Threats: Enhancing Backdoor Defense in Multimodal Contrastive Learning via Local Token Unlearning
por: Liang, Siyuan, et al.
Publicado: (2024)
por: Liang, Siyuan, et al.
Publicado: (2024)
Breaking the False Sense of Security in Backdoor Defense through Re-Activation Attack
por: Zhu, Mingli, et al.
Publicado: (2024)
por: Zhu, Mingli, et al.
Publicado: (2024)
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
por: Liu, Ming, et al.
Publicado: (2025)
por: Liu, Ming, et al.
Publicado: (2025)
CogMorph: Cognitive Morphing Attacks for Text-to-Image Models
por: Jing, Zonglei, et al.
Publicado: (2025)
por: Jing, Zonglei, et al.
Publicado: (2025)
Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models
por: Ma, Sihan, et al.
Publicado: (2026)
por: Ma, Sihan, et al.
Publicado: (2026)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
Distillation Traps and Guards: A Calibration Knob for LLM Distillability
por: Zhan, Weixiao, et al.
Publicado: (2026)
por: Zhan, Weixiao, et al.
Publicado: (2026)
MG-Net: Learn to Customize QAOA with Circuit Depth Awareness
por: Qian, Yang, et al.
Publicado: (2024)
por: Qian, Yang, et al.
Publicado: (2024)
Efficient Backdoor Defense in Multimodal Contrastive Learning: A Token-Level Unlearning Method for Mitigating Threats
por: Liu, Kuanrong, et al.
Publicado: (2024)
por: Liu, Kuanrong, et al.
Publicado: (2024)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
LanEvil: Benchmarking the Robustness of Lane Detection to Environmental Illusions
por: Zhang, Tianyuan, et al.
Publicado: (2024)
por: Zhang, Tianyuan, et al.
Publicado: (2024)
CopyrightShield: Enhancing Diffusion Model Security against Copyright Infringement Attacks
por: Guo, Zhixiang, et al.
Publicado: (2024)
por: Guo, Zhixiang, et al.
Publicado: (2024)
TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting
por: Nguyen, Quang Duc, et al.
Publicado: (2026)
por: Nguyen, Quang Duc, et al.
Publicado: (2026)
Review of Hallucination Understanding in Large Language and Vision Models
por: Ho, Zhengyi, et al.
Publicado: (2025)
por: Ho, Zhengyi, et al.
Publicado: (2025)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
por: Wang, Lu, et al.
Publicado: (2025)
por: Wang, Lu, et al.
Publicado: (2025)
Object Detectors in the Open Environment: Challenges, Solutions, and Outlook
por: Liang, Siyuan, et al.
Publicado: (2024)
por: Liang, Siyuan, et al.
Publicado: (2024)
T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks
por: Liu, Jiayang, et al.
Publicado: (2025)
por: Liu, Jiayang, et al.
Publicado: (2025)
Rethinking the Role of Dynamic Sparse Training for Scalable Deep Reinforcement Learning
por: Ma, Guozheng, et al.
Publicado: (2025)
por: Ma, Guozheng, et al.
Publicado: (2025)
Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual Triggers
por: Wang, Jiancheng, et al.
Publicado: (2026)
por: Wang, Jiancheng, et al.
Publicado: (2026)
Transition Role of Entangled Data in Quantum Machine Learning
por: Wang, Xinbiao, et al.
Publicado: (2023)
por: Wang, Xinbiao, et al.
Publicado: (2023)
Separable Power of Classical and Quantum Learning Protocols Through the Lens of No-Free-Lunch Theorem
por: Wang, Xinbiao, et al.
Publicado: (2024)
por: Wang, Xinbiao, et al.
Publicado: (2024)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
por: Liang, Siyuan, et al.
Publicado: (2025)
por: Liang, Siyuan, et al.
Publicado: (2025)
Lie Detector: Unified Backdoor Detection via Cross-Examination Framework
por: Wang, Xuan, et al.
Publicado: (2025)
por: Wang, Xuan, et al.
Publicado: (2025)
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
por: Zhong, Qihuang, et al.
Publicado: (2026)
por: Zhong, Qihuang, et al.
Publicado: (2026)
GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing
por: Xiao, Yisong, et al.
Publicado: (2024)
por: Xiao, Yisong, et al.
Publicado: (2024)
Fairness Mediator: Neutralize Stereotype Associations to Mitigate Bias in Large Language Models
por: Xiao, Yisong, et al.
Publicado: (2025)
por: Xiao, Yisong, et al.
Publicado: (2025)
Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor
por: Wei, Shaokui, et al.
Publicado: (2024)
por: Wei, Shaokui, et al.
Publicado: (2024)
Ejemplares similares
-
CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models
por: Xu, Shuhan, et al.
Publicado: (2026) -
ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks
por: Ren, Zhiyao, et al.
Publicado: (2025) -
Revisiting Backdoor Attacks against Large Vision-Language Models from Domain Shift
por: Liang, Siyuan, et al.
Publicado: (2024) -
ME: Trigger Element Combination Backdoor Attack on Copyright Infringement
por: Yang, Feiyu, et al.
Publicado: (2025) -
TrapFlow: Controllable Website Fingerprinting Defense via Dynamic Backdoor Learning
por: Liang, Siyuan, et al.
Publicado: (2024)