Backdoor Cleaning without External Guidance in MLLM Fine-tuning
Fuente:
arXiv
Saved in:
| Main Authors: | Rong, Xuankun, Huang, Wenke, Liang, Jian, Bi, Jinhe, Xiao, Xun, Li, Yiming, Du, Bo, Ye, Mang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
by: Rong, Xuankun, et al.
Published: (2025)
by: Rong, Xuankun, et al.
Published: (2025)
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
by: Ye, Mang, et al.
Published: (2025)
by: Ye, Mang, et al.
Published: (2025)
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
by: Zhang, Jiale, et al.
Published: (2025)
by: Zhang, Jiale, et al.
Published: (2025)
FedSSP: Federated Graph Learning with Spectral Knowledge and Personalized Preference
by: Tan, Zihan, et al.
Published: (2024)
by: Tan, Zihan, et al.
Published: (2024)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
by: Wang, Jiongxiao, et al.
Published: (2024)
by: Wang, Jiongxiao, et al.
Published: (2024)
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
by: Yang, Kang, et al.
Published: (2025)
by: Yang, Kang, et al.
Published: (2025)
Clean-image Backdoor Attacks
by: Rong, Dazhong, et al.
Published: (2024)
by: Rong, Dazhong, et al.
Published: (2024)
When Forgetting Triggers Backdoors: A Clean Unlearning Attack
by: Arazzi, Marco, et al.
Published: (2025)
by: Arazzi, Marco, et al.
Published: (2025)
Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference
by: Li, Jianwei, et al.
Published: (2026)
by: Li, Jianwei, et al.
Published: (2026)
DFB: A Data-Free, Low-Budget, and High-Efficacy Clean-Label Backdoor Attack
by: Ma, Binhao, et al.
Published: (2023)
by: Ma, Binhao, et al.
Published: (2023)
Clean-Label Physical Backdoor Attacks with Data Distillation
by: Dao, Thinh, et al.
Published: (2024)
by: Dao, Thinh, et al.
Published: (2024)
UltraClean: A Simple Framework to Train Robust Neural Networks against Backdoor Attacks
by: Zhao, Bingyin, et al.
Published: (2023)
by: Zhao, Bingyin, et al.
Published: (2023)
Generalization Bound and New Algorithm for Clean-Label Backdoor Attack
by: Yu, Lijia, et al.
Published: (2024)
by: Yu, Lijia, et al.
Published: (2024)
PEFTGuard: Detecting Backdoor Attacks Against Parameter-Efficient Fine-Tuning
by: Sun, Zhen, et al.
Published: (2024)
by: Sun, Zhen, et al.
Published: (2024)
One-to-Multiple Clean-Label Image Camouflage (OmClic) based Backdoor Attack on Deep Learning
by: Wang, Guohong, et al.
Published: (2023)
by: Wang, Guohong, et al.
Published: (2023)
Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents
by: Wang, Xuan, et al.
Published: (2025)
by: Wang, Xuan, et al.
Published: (2025)
Selection-Based Vulnerabilities: Clean-Label Backdoor Attacks in Active Learning
by: Zhi, Yuhan, et al.
Published: (2025)
by: Zhi, Yuhan, et al.
Published: (2025)
FFCBA: Feature-based Full-target Clean-label Backdoor Attacks
by: Yin, Yangxu, et al.
Published: (2025)
by: Yin, Yangxu, et al.
Published: (2025)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
by: Zeng, Yi, et al.
Published: (2024)
by: Zeng, Yi, et al.
Published: (2024)
A Study of Backdoors in Instruction Fine-tuned Language Models
by: Raghuram, Jayaram, et al.
Published: (2024)
by: Raghuram, Jayaram, et al.
Published: (2024)
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
by: Feng, Yunhao, et al.
Published: (2026)
by: Feng, Yunhao, et al.
Published: (2026)
FedThief: Harming Others to Benefit Oneself in Self-Centered Federated Learning
by: Zhang, Xiangyu, et al.
Published: (2025)
by: Zhang, Xiangyu, et al.
Published: (2025)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
by: Li, Yuetai, et al.
Published: (2024)
by: Li, Yuetai, et al.
Published: (2024)
Lite-BD: A Lightweight Black-box Backdoor Defense via Reviving Multi-Stage Image Transformations
by: Miah, Abdullah Arafat, et al.
Published: (2026)
by: Miah, Abdullah Arafat, et al.
Published: (2026)
Selective Pre-training for Private Fine-tuning
by: Yu, Da, et al.
Published: (2023)
by: Yu, Da, et al.
Published: (2023)
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
by: Fu, Hang, et al.
Published: (2026)
by: Fu, Hang, et al.
Published: (2026)
Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP
by: Singh, Naman Deep, et al.
Published: (2024)
by: Singh, Naman Deep, et al.
Published: (2024)
Towards Stealthy and Effective Backdoor Attacks on Lane Detection: A Naturalistic Data Poisoning Approach
by: Liao, Yifan, et al.
Published: (2025)
by: Liao, Yifan, et al.
Published: (2025)
Does Few-shot Learning Suffer from Backdoor Attacks?
by: Liu, Xinwei, et al.
Published: (2023)
by: Liu, Xinwei, et al.
Published: (2023)
SSCL-BW: Sample-Specific Clean-Label Backdoor Watermarking for Dataset Ownership Verification
by: Wang, Yingjia, et al.
Published: (2025)
by: Wang, Yingjia, et al.
Published: (2025)
Unified Neural Backdoor Removal with Only Few Clean Samples through Unlearning and Relearning
by: Min, Nay Myat, et al.
Published: (2024)
by: Min, Nay Myat, et al.
Published: (2024)
Vertical Federated Learning for Effectiveness, Security, Applicability: A Survey
by: Ye, Mang, et al.
Published: (2024)
by: Ye, Mang, et al.
Published: (2024)
Backdooring Masked Diffusion Language Models
by: Cao, Daniel Yiming, et al.
Published: (2026)
by: Cao, Daniel Yiming, et al.
Published: (2026)
When Backdoors Speak: Understanding LLM Backdoor Attacks Through Model-Generated Explanations
by: Ge, Huaizhi, et al.
Published: (2024)
by: Ge, Huaizhi, et al.
Published: (2024)
UniASM: Binary Code Similarity Detection without Fine-tuning
by: Gu, Yeming, et al.
Published: (2022)
by: Gu, Yeming, et al.
Published: (2022)
Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
by: Huang, Yuan
Published: (2025)
by: Huang, Yuan
Published: (2025)
BURN: Backdoor Unlearning via Adversarial Boundary Analysis
by: Su, Yanghao, et al.
Published: (2025)
by: Su, Yanghao, et al.
Published: (2025)
Securing Federated Learning against Backdoor Threats with Foundation Model Integration
by: Bi, Xiaohuan, et al.
Published: (2024)
by: Bi, Xiaohuan, et al.
Published: (2024)
Mellivora Capensis: A Backdoor-Free Training Framework on the Poisoned Dataset without Auxiliary Data
by: Pu, Yuwen, et al.
Published: (2024)
by: Pu, Yuwen, et al.
Published: (2024)
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
by: Pi, Renjie, et al.
Published: (2024)
by: Pi, Renjie, et al.
Published: (2024)
Similar Items
-
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
by: Rong, Xuankun, et al.
Published: (2025) -
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
by: Ye, Mang, et al.
Published: (2025) -
Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data
by: Zhang, Jiale, et al.
Published: (2025) -
FedSSP: Federated Graph Learning with Spectral Knowledge and Personalized Preference
by: Tan, Zihan, et al.
Published: (2024) -
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
by: Wang, Jiongxiao, et al.
Published: (2024)