From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Qin, Wang, Fei, Xiao, Chaowei, Chen, Muhao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
di: Tong, Terry, et al.
Pubblicazione: (2024)
di: Tong, Terry, et al.
Pubblicazione: (2024)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
di: Liu, Qin, et al.
Pubblicazione: (2024)
di: Liu, Qin, et al.
Pubblicazione: (2024)
Instructional Fingerprinting of Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)
di: Tong, Terry, et al.
Pubblicazione: (2025)
Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense
di: Min, Rui, et al.
Pubblicazione: (2024)
di: Min, Rui, et al.
Pubblicazione: (2024)
Backdoor Vectors: a Task Arithmetic View on Backdoor Attacks and Defenses
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
MADE: Graph Backdoor Defense with Masked Unlearning
di: Lin, Xiao, et al.
Pubblicazione: (2024)
di: Lin, Xiao, et al.
Pubblicazione: (2024)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
di: Wen, Xiaofei, et al.
Pubblicazione: (2025)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
di: Liu, Qin, et al.
Pubblicazione: (2025)
di: Liu, Qin, et al.
Pubblicazione: (2025)
Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
di: De Muri, Giovanni, et al.
Pubblicazione: (2025)
di: De Muri, Giovanni, et al.
Pubblicazione: (2025)
Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs
di: Wang, Yifei, et al.
Pubblicazione: (2026)
di: Wang, Yifei, et al.
Pubblicazione: (2026)
Every Character Counts: From Vulnerability to Defense in Phishing Detection
di: Chiper, Maria, et al.
Pubblicazione: (2025)
di: Chiper, Maria, et al.
Pubblicazione: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
The Art of Deception: Robust Backdoor Attack using Dynamic Stacking of Triggers
di: Mengara, Orson
Pubblicazione: (2024)
di: Mengara, Orson
Pubblicazione: (2024)
PoLO: Proof-of-Learning and Proof-of-Ownership at Once with Chained Watermarking
di: Deng, Haiyu, et al.
Pubblicazione: (2025)
di: Deng, Haiyu, et al.
Pubblicazione: (2025)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
di: Wang, Yifei, et al.
Pubblicazione: (2024)
di: Wang, Yifei, et al.
Pubblicazione: (2024)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
di: Liu, Yupei, et al.
Pubblicazione: (2023)
di: Liu, Yupei, et al.
Pubblicazione: (2023)
Defending the Edge: Representative-Attention Defense against Backdoor Attacks in Federated Learning
di: Obioma, Chibueze Peace, et al.
Pubblicazione: (2025)
di: Obioma, Chibueze Peace, et al.
Pubblicazione: (2025)
Concealing Backdoor Model Updates in Federated Learning by Trigger-Optimized Data Poisoning
di: Zhang, Yujie, et al.
Pubblicazione: (2024)
di: Zhang, Yujie, et al.
Pubblicazione: (2024)
Shortcuts Everywhere and Nowhere: Exploring Multi-Trigger Backdoor Attacks
di: Li, Yige, et al.
Pubblicazione: (2024)
di: Li, Yige, et al.
Pubblicazione: (2024)
TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting
di: Nguyen, Quang Duc, et al.
Pubblicazione: (2026)
di: Nguyen, Quang Duc, et al.
Pubblicazione: (2026)
Universal Jailbreak Backdoors from Poisoned Human Feedback
di: Rando, Javier, et al.
Pubblicazione: (2023)
di: Rando, Javier, et al.
Pubblicazione: (2023)
Weight space Detection of Backdoors in LoRA Adapters
di: Merenciano, David Puertolas, et al.
Pubblicazione: (2026)
di: Merenciano, David Puertolas, et al.
Pubblicazione: (2026)
Adversarial Text Purification: A Large Language Model Approach for Defense
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
A Study of Backdoors in Instruction Fine-tuned Language Models
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
Weird Generalization and Inductive Backdoors: New Ways to Corrupt LLMs
di: Betley, Jan, et al.
Pubblicazione: (2025)
di: Betley, Jan, et al.
Pubblicazione: (2025)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
di: Rando, Javier, et al.
Pubblicazione: (2024)
di: Rando, Javier, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Trapping Attacker in Dilemma: Examining Internal Correlations and External Influences of Trigger for Defending GNN Backdoors
di: Yang, Fan, et al.
Pubblicazione: (2026)
di: Yang, Fan, et al.
Pubblicazione: (2026)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
di: Liao, Zeyi, et al.
Pubblicazione: (2024)
di: Liao, Zeyi, et al.
Pubblicazione: (2024)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
Backdoor Secrets Unveiled: Identifying Backdoor Data with Optimized Scaled Prediction Consistency
di: Pal, Soumyadeep, et al.
Pubblicazione: (2024)
di: Pal, Soumyadeep, et al.
Pubblicazione: (2024)
Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm
di: Kim, Jaehan, et al.
Pubblicazione: (2024)
di: Kim, Jaehan, et al.
Pubblicazione: (2024)
PSBD: Prediction Shift Uncertainty Unlocks Backdoor Detection
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
REFINE: Inversion-Free Backdoor Defense via Model Reprogramming
di: Chen, Yukun, et al.
Pubblicazione: (2025)
di: Chen, Yukun, et al.
Pubblicazione: (2025)
BACKTIME: Backdoor Attacks on Multivariate Time Series Forecasting
di: Lin, Xiao, et al.
Pubblicazione: (2024)
di: Lin, Xiao, et al.
Pubblicazione: (2024)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023) -
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
di: Tong, Terry, et al.
Pubblicazione: (2024) -
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
di: Liu, Qin, et al.
Pubblicazione: (2024) -
Instructional Fingerprinting of Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2024) -
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)