Mitigating Backdoor Attacks using Activation-Guided Model Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hsieh, Felix, Nguyen, Huy H., MaungMaung, AprilPyone, Usynin, Dmitrii, Echizen, Isao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fine-Tuning Text-To-Image Diffusion Models for Class-Wise Spurious Feature Generation
par: MaungMaung, AprilPyone, et autres
Publié: (2024)
par: MaungMaung, AprilPyone, et autres
Publié: (2024)
Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
par: Chengyu, Jia, et autres
Publié: (2026)
par: Chengyu, Jia, et autres
Publié: (2026)
EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics
par: Nguyen, Van-Loc, et autres
Publié: (2026)
par: Nguyen, Van-Loc, et autres
Publié: (2026)
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
par: Wang, Hongbo, et autres
Publié: (2025)
par: Wang, Hongbo, et autres
Publié: (2025)
Stability Analysis of ChatGPT-based Sentiment Analysis in AI Quality Assurance
par: Ouyang, Tinghui, et autres
Publié: (2024)
par: Ouyang, Tinghui, et autres
Publié: (2024)
Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor
par: Wei, Shaokui, et autres
Publié: (2024)
par: Wei, Shaokui, et autres
Publié: (2024)
Tell-Tale Watermarks for Explanatory Reasoning in Synthetic Media Forensics
par: Chang, Ching-Chun, et autres
Publié: (2025)
par: Chang, Ching-Chun, et autres
Publié: (2025)
FedBlock: A Blockchain Approach to Federated Learning against Backdoor Attacks
par: Nguyen, Duong H., et autres
Publié: (2024)
par: Nguyen, Duong H., et autres
Publié: (2024)
Agentic Copyright Watermarking against Adversarial Evidence Forgery with Purification-Agnostic Curriculum Proxy Learning
par: Bao, Erjin, et autres
Publié: (2024)
par: Bao, Erjin, et autres
Publié: (2024)
GreedyPixel: Fine-Grained Black-Box Adversarial Attack Via Greedy Algorithm
par: Wang, Hanrui, et autres
Publié: (2025)
par: Wang, Hanrui, et autres
Publié: (2025)
DiffMI: Breaking Face Recognition Privacy via Diffusion-Driven Training-Free Model Inversion
par: Wang, Hanrui, et autres
Publié: (2025)
par: Wang, Hanrui, et autres
Publié: (2025)
Clean-image Backdoor Attacks
par: Rong, Dazhong, et autres
Publié: (2024)
par: Rong, Dazhong, et autres
Publié: (2024)
Biologically-Informed Hybrid Membership Inference Attacks on Generative Genomic Models
par: Belfiore, Asia, et autres
Publié: (2025)
par: Belfiore, Asia, et autres
Publié: (2025)
Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks
par: Nguyen, Quang H., et autres
Publié: (2024)
par: Nguyen, Quang H., et autres
Publié: (2024)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
DisDet: Exploring Detectability of Backdoor Attack on Diffusion Models
par: Sui, Yang, et autres
Publié: (2024)
par: Sui, Yang, et autres
Publié: (2024)
Backdoor Attack with Mode Mixture Latent Modification
par: Zhang, Hongwei, et autres
Publié: (2024)
par: Zhang, Hongwei, et autres
Publié: (2024)
Cyber Vaccine for Deepfake Immunity
par: Chang, Ching-Chun, et autres
Publié: (2023)
par: Chang, Ching-Chun, et autres
Publié: (2023)
BadDet+: Robust Backdoor Attacks for Object Detection
par: Dunnett, Kealan, et autres
Publié: (2026)
par: Dunnett, Kealan, et autres
Publié: (2026)
Event Trojan: Asynchronous Event-based Backdoor Attacks
par: Wang, Ruofei, et autres
Publié: (2024)
par: Wang, Ruofei, et autres
Publié: (2024)
Inevitable Encounters: Backdoor Attacks Involving Lossy Compression
par: Li, Qian, et autres
Publié: (2026)
par: Li, Qian, et autres
Publié: (2026)
SATBA: An Invisible Backdoor Attack Based On Spatial Attention
par: Zhou, Huasong, et autres
Publié: (2023)
par: Zhou, Huasong, et autres
Publié: (2023)
HoneypotNet: Backdoor Attacks Against Model Extraction
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Universal Backdoor Attacks
par: Schneider, Benjamin, et autres
Publié: (2023)
par: Schneider, Benjamin, et autres
Publié: (2023)
A Proxy Attack-Free Strategy for Practically Improving the Poisoning Efficiency in Backdoor Attacks
par: Li, Ziqiang, et autres
Publié: (2023)
par: Li, Ziqiang, et autres
Publié: (2023)
Backdoor Mitigation in Object Detection via Adversarial Fine-Tuning
par: Dunnett, Kealan, et autres
Publié: (2026)
par: Dunnett, Kealan, et autres
Publié: (2026)
UNIT: Backdoor Mitigation via Automated Neural Distribution Tightening
par: Cheng, Siyuan, et autres
Publié: (2024)
par: Cheng, Siyuan, et autres
Publié: (2024)
LOTUS: Evasive and Resilient Backdoor Attacks through Sub-Partitioning
par: Cheng, Siyuan, et autres
Publié: (2024)
par: Cheng, Siyuan, et autres
Publié: (2024)
Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation
par: Zhong, Zhiyuan, et autres
Publié: (2025)
par: Zhong, Zhiyuan, et autres
Publié: (2025)
Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models
par: Zhang, Zongmin, et autres
Publié: (2025)
par: Zhang, Zongmin, et autres
Publié: (2025)
ConSeg: Contextual Backdoor Attack Against Semantic Segmentation
par: Abbasi, Bilal Hussain, et autres
Publié: (2025)
par: Abbasi, Bilal Hussain, et autres
Publié: (2025)
Multi-Target Federated Backdoor Attack Based on Feature Aggregation
par: Hao, Lingguag, et autres
Publié: (2025)
par: Hao, Lingguag, et autres
Publié: (2025)
Adversarially Guided Stateful Defense Against Backdoor Attacks in Federated Deep Learning
par: Ali, Hassan, et autres
Publié: (2024)
par: Ali, Hassan, et autres
Publié: (2024)
Data Free Backdoor Attacks
par: Cao, Bochuan, et autres
Publié: (2024)
par: Cao, Bochuan, et autres
Publié: (2024)
Towards Physical World Backdoor Attacks against Skeleton Action Recognition
par: Zheng, Qichen, et autres
Publié: (2024)
par: Zheng, Qichen, et autres
Publié: (2024)
IPBA: Imperceptible Perturbation Backdoor Attack in Federated Self-Supervised Learning
par: Wang, Jiayao, et autres
Publié: (2025)
par: Wang, Jiayao, et autres
Publié: (2025)
Megatron: Evasive Clean-Label Backdoor Attacks against Vision Transformer
par: Gong, Xueluan, et autres
Publié: (2024)
par: Gong, Xueluan, et autres
Publié: (2024)
Gungnir: Exploiting Stylistic Features in Images for Backdoor Attacks on Diffusion Models
par: Zhang, Lei, et autres
Publié: (2025)
par: Zhang, Lei, et autres
Publié: (2025)
Poisoning-based Backdoor Attacks for Arbitrary Target Label with Positive Triggers
par: Huang, Binxiao, et autres
Publié: (2024)
par: Huang, Binxiao, et autres
Publié: (2024)
Efficient Backdoor Attacks for Deep Neural Networks in Real-world Scenarios
par: Li, Ziqiang, et autres
Publié: (2023)
par: Li, Ziqiang, et autres
Publié: (2023)
Documents similaires
-
Fine-Tuning Text-To-Image Diffusion Models for Class-Wise Spurious Feature Generation
par: MaungMaung, AprilPyone, et autres
Publié: (2024) -
Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
par: Chengyu, Jia, et autres
Publié: (2026) -
EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics
par: Nguyen, Van-Loc, et autres
Publié: (2026) -
SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification
par: Wang, Hongbo, et autres
Publié: (2025) -
Stability Analysis of ChatGPT-based Sentiment Analysis in AI Quality Assurance
par: Ouyang, Tinghui, et autres
Publié: (2024)