BURN: Backdoor Unlearning via Adversarial Boundary Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Su, Yanghao, Zhang, Jie, Li, Yiming, Zhang, Tianwei, Guo, Qing, Zhang, Weiming, Yu, Nenghai, Lukas, Nils, Zhou, Wenbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Model X-ray:Detecting Backdoored Models via Decision Boundary
di: Su, Yanghao, et al.
Pubblicazione: (2024)
di: Su, Yanghao, et al.
Pubblicazione: (2024)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026)
di: Su, Yanghao, et al.
Pubblicazione: (2026)
AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRA
di: Feng, Weitao, et al.
Pubblicazione: (2024)
di: Feng, Weitao, et al.
Pubblicazione: (2024)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
di: Li, Pengcheng, et al.
Pubblicazione: (2026)
di: Li, Pengcheng, et al.
Pubblicazione: (2026)
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
di: Qi, Peigui, et al.
Pubblicazione: (2025)
di: Qi, Peigui, et al.
Pubblicazione: (2025)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
di: Tong, Meng, et al.
Pubblicazione: (2023)
di: Tong, Meng, et al.
Pubblicazione: (2023)
Exploiting Vulnerabilities in Speech Translation Systems through Targeted Adversarial Attacks
di: Liu, Chang, et al.
Pubblicazione: (2025)
di: Liu, Chang, et al.
Pubblicazione: (2025)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
di: Li, Shuai, et al.
Pubblicazione: (2023)
di: Li, Shuai, et al.
Pubblicazione: (2023)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Performance-lossless Black-box Model Watermarking
di: Zhao, Na, et al.
Pubblicazione: (2023)
di: Zhao, Na, et al.
Pubblicazione: (2023)
PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
di: Zhao, Jiawei, et al.
Pubblicazione: (2025)
di: Zhao, Jiawei, et al.
Pubblicazione: (2025)
CamLoPA: A Hidden Wireless Camera Localization Framework via Signal Propagation Path Analysis
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
On the Vulnerability of Text Sanitization
di: Tong, Meng, et al.
Pubblicazione: (2024)
di: Tong, Meng, et al.
Pubblicazione: (2024)
Natias: Neuron Attribution based Transferable Image Adversarial Steganography
di: Fan, Zexin, et al.
Pubblicazione: (2024)
di: Fan, Zexin, et al.
Pubblicazione: (2024)
FoC: Figure out the Cryptographic Functions in Stripped Binaries with LLMs
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
A high-capacity linguistic steganography based on entropy-driven rank-token mapping
di: Jiang, Jun, et al.
Pubblicazione: (2025)
di: Jiang, Jun, et al.
Pubblicazione: (2025)
EditMark: Watermarking Large Language Models based on Model Editing
di: Li, Shuai, et al.
Pubblicazione: (2025)
di: Li, Shuai, et al.
Pubblicazione: (2025)
Invisibility Cloak: Disappearance under Human Pose Estimation via Backdoor Attacks
di: Zhang, Minxing, et al.
Pubblicazione: (2024)
di: Zhang, Minxing, et al.
Pubblicazione: (2024)
PoseGuard: Pose-Guided Generation with Safety Guardrails
di: Wang, Kongxin, et al.
Pubblicazione: (2025)
di: Wang, Kongxin, et al.
Pubblicazione: (2025)
SSD: A State-based Stealthy Backdoor Attack For Navigation System in UAV Route Planning
di: Wang, Zhaoxuan, et al.
Pubblicazione: (2025)
di: Wang, Zhaoxuan, et al.
Pubblicazione: (2025)
Provably Secure Public-Key Steganography Based on Admissible Encoding
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
GIFDL: Generated Image Fluctuation Distortion Learning for Enhancing Steganographic Security
di: Wang, Xiangkun, et al.
Pubblicazione: (2025)
di: Wang, Xiangkun, et al.
Pubblicazione: (2025)
Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2023)
di: Zhao, Jiawei, et al.
Pubblicazione: (2023)
Backdoor Attacks against Hybrid Classical-Quantum Neural Networks
di: Guo, Ji, et al.
Pubblicazione: (2024)
di: Guo, Ji, et al.
Pubblicazione: (2024)
Beyond the Edge of Function: Unraveling the Patterns of Type Recovery in Binary Code
di: Li, Gangyang, et al.
Pubblicazione: (2025)
di: Li, Gangyang, et al.
Pubblicazione: (2025)
Coward: Collision-based OOD Watermarking for Practical Proactive Federated Backdoor Detection
di: Li, Wenjie, et al.
Pubblicazione: (2025)
di: Li, Wenjie, et al.
Pubblicazione: (2025)
Stealthy Targeted Backdoor Attacks against Image Captioning
di: Fan, Wenshu, et al.
Pubblicazione: (2024)
di: Fan, Wenshu, et al.
Pubblicazione: (2024)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
Provably Secure Disambiguating Neural Linguistic Steganography
di: Qi, Yuang, et al.
Pubblicazione: (2024)
di: Qi, Yuang, et al.
Pubblicazione: (2024)
The Gradient Puppeteer: Adversarial Domination in Gradient Leakage Attacks through Model Poisoning
di: Xiang, Kunlan, et al.
Pubblicazione: (2025)
di: Xiang, Kunlan, et al.
Pubblicazione: (2025)
"No Matter What You Do": Purifying GNN Models via Backdoor Unlearning
di: Zhang, Jiale, et al.
Pubblicazione: (2024)
di: Zhang, Jiale, et al.
Pubblicazione: (2024)
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
Really Unlearned? Verifying Machine Unlearning via Influential Sample Pairs
di: Xu, Heng, et al.
Pubblicazione: (2024)
di: Xu, Heng, et al.
Pubblicazione: (2024)
BeDKD: Backdoor Defense Based on Directional Mapping Module and Adversarial Knowledge Distillation
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
BadFU: Backdoor Federated Learning through Adversarial Machine Unlearning
di: Lu, Bingguang, et al.
Pubblicazione: (2025)
di: Lu, Bingguang, et al.
Pubblicazione: (2025)
Transferable Backdoor Attacks for Code Models via Sharpness-Aware Adversarial Perturbation
di: Chang, Shuyu, et al.
Pubblicazione: (2026)
di: Chang, Shuyu, et al.
Pubblicazione: (2026)
Backdoor Attacks against Image-to-Image Networks
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
STEAD: Robust Provably Secure Linguistic Steganography with Diffusion Language Model
di: Qi, Yuang, et al.
Pubblicazione: (2026)
di: Qi, Yuang, et al.
Pubblicazione: (2026)
Unlearn and Burn: Adversarial Machine Unlearning Requests Destroy Model Accuracy
di: Huang, Yangsibo, et al.
Pubblicazione: (2024)
di: Huang, Yangsibo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Model X-ray:Detecting Backdoored Models via Decision Boundary
di: Su, Yanghao, et al.
Pubblicazione: (2024) -
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026) -
AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRA
di: Feng, Weitao, et al.
Pubblicazione: (2024) -
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
di: Li, Pengcheng, et al.
Pubblicazione: (2026) -
SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
di: Qi, Peigui, et al.
Pubblicazione: (2025)