Defense Against Syntactic Textual Backdoor Attacks with Token Substitution
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Xinglin, He, Xianwen, Li, Yao, Cheng, Minhao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
The Best Defense is Attack: Repairing Semantics in Textual Adversarial Examples
von: Yang, Heng, et al.
Veröffentlicht: (2023)
von: Yang, Heng, et al.
Veröffentlicht: (2023)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
von: Li, Ziqiang, et al.
Veröffentlicht: (2024)
von: Li, Ziqiang, et al.
Veröffentlicht: (2024)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
von: Cheng, Pengzhou, et al.
Veröffentlicht: (2024)
von: Cheng, Pengzhou, et al.
Veröffentlicht: (2024)
Cut the Deadwood Out: Backdoor Purification via Guided Module Substitution
von: Tong, Yao, et al.
Veröffentlicht: (2024)
von: Tong, Yao, et al.
Veröffentlicht: (2024)
Claim-Guided Textual Backdoor Attack for Practical Applications
von: Song, Minkyoo, et al.
Veröffentlicht: (2024)
von: Song, Minkyoo, et al.
Veröffentlicht: (2024)
Invisible Backdoor Attacks on Diffusion Models
von: Li, Sen, et al.
Veröffentlicht: (2024)
von: Li, Sen, et al.
Veröffentlicht: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Composite Backdoor Attacks Against Large Language Models
von: Huang, Hai, et al.
Veröffentlicht: (2023)
von: Huang, Hai, et al.
Veröffentlicht: (2023)
Two Heads are Better than One: Nested PoE for Robust Defense Against Multi-Backdoors
von: Graf, Victoria, et al.
Veröffentlicht: (2024)
von: Graf, Victoria, et al.
Veröffentlicht: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
Backdoor Attack on Multilingual Machine Translation
von: Wang, Jun, et al.
Veröffentlicht: (2024)
von: Wang, Jun, et al.
Veröffentlicht: (2024)
Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs
von: Yan, Dong, et al.
Veröffentlicht: (2026)
von: Yan, Dong, et al.
Veröffentlicht: (2026)
BadActs: A Universal Backdoor Defense in the Activation Space
von: Yi, Biao, et al.
Veröffentlicht: (2024)
von: Yi, Biao, et al.
Veröffentlicht: (2024)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
von: Afane, Mohamed, et al.
Veröffentlicht: (2025)
von: Afane, Mohamed, et al.
Veröffentlicht: (2025)
An Embarrassingly Simple Defense Against LLM Abliteration Attacks
von: Shairah, Harethah Abu, et al.
Veröffentlicht: (2025)
von: Shairah, Harethah Abu, et al.
Veröffentlicht: (2025)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
DINA: A Dual Defense Framework Against Internal Noise and External Attacks in Natural Language Processing
von: Chuang, Ko-Wei, et al.
Veröffentlicht: (2025)
von: Chuang, Ko-Wei, et al.
Veröffentlicht: (2025)
Pruning Strategies for Backdoor Defense in LLMs
von: Chapagain, Santosh, et al.
Veröffentlicht: (2025)
von: Chapagain, Santosh, et al.
Veröffentlicht: (2025)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
von: Brown, Hannah, et al.
Veröffentlicht: (2024)
von: Brown, Hannah, et al.
Veröffentlicht: (2024)
Fast Adversarial Training against Textual Adversarial Attacks
von: Yang, Yichen, et al.
Veröffentlicht: (2024)
von: Yang, Yichen, et al.
Veröffentlicht: (2024)
Variance-Based Defense Against Blended Backdoor Attacks
von: Aseervatham, Sujeevan, et al.
Veröffentlicht: (2025)
von: Aseervatham, Sujeevan, et al.
Veröffentlicht: (2025)
RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection
von: Zhu, He, et al.
Veröffentlicht: (2026)
von: Zhu, He, et al.
Veröffentlicht: (2026)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
von: Zhao, Shuai, et al.
Veröffentlicht: (2024)
UniGuardian: A Unified Defense for Detecting Prompt Injection, Backdoor Attacks and Adversarial Attacks in Large Language Models
von: Lin, Huawei, et al.
Veröffentlicht: (2025)
von: Lin, Huawei, et al.
Veröffentlicht: (2025)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
von: Li, Xirui, et al.
Veröffentlicht: (2024)
von: Li, Xirui, et al.
Veröffentlicht: (2024)
BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
von: Feng, Yunhao, et al.
Veröffentlicht: (2026)
von: Feng, Yunhao, et al.
Veröffentlicht: (2026)
Evaluating Morphological Plausibility of Subword Tokenization via Statistical Alignment with Morpho-Syntactic Features
von: Stephen, Abishek, et al.
Veröffentlicht: (2026)
von: Stephen, Abishek, et al.
Veröffentlicht: (2026)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
von: Yi, Xin, et al.
Veröffentlicht: (2025)
von: Yi, Xin, et al.
Veröffentlicht: (2025)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
von: Liu, Xuannan, et al.
Veröffentlicht: (2024)
von: Liu, Xuannan, et al.
Veröffentlicht: (2024)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
von: Kim, Heegyu, et al.
Veröffentlicht: (2024)
von: Kim, Heegyu, et al.
Veröffentlicht: (2024)
On the Semantic and Syntactic Information Encoded in Proto-Tokens for One-Step Text Reconstruction
von: Bondarenko, Ivan, et al.
Veröffentlicht: (2026)
von: Bondarenko, Ivan, et al.
Veröffentlicht: (2026)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2024)
von: Wang, Jiongxiao, et al.
Veröffentlicht: (2024)
Detection and Measurement of Syntactic Templates in Generated Text
von: Shaib, Chantal, et al.
Veröffentlicht: (2024)
von: Shaib, Chantal, et al.
Veröffentlicht: (2024)
Defending against Backdoor Attacks via Module Switching
von: Li, Weijun, et al.
Veröffentlicht: (2025)
von: Li, Weijun, et al.
Veröffentlicht: (2025)
LimeAttack: Local Explainable Method for Textual Hard-Label Adversarial Attack
von: Zhu, Hai, et al.
Veröffentlicht: (2023)
von: Zhu, Hai, et al.
Veröffentlicht: (2023)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
von: Du, Wei, et al.
Veröffentlicht: (2023)
von: Du, Wei, et al.
Veröffentlicht: (2023)
Scalable Token-Level Hallucination Detection in Large Language Models
von: Min, Rui, et al.
Veröffentlicht: (2026)
von: Min, Rui, et al.
Veröffentlicht: (2026)
BadGraph: A Backdoor Attack Against Latent Diffusion Model for Text-Guided Graph Generation
von: Ye, Liang, et al.
Veröffentlicht: (2025)
von: Ye, Liang, et al.
Veröffentlicht: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
von: Ouyang, Yang, et al.
Veröffentlicht: (2025)
von: Ouyang, Yang, et al.
Veröffentlicht: (2025)
Semantic Graphs for Syntactic Simplification: A Revisit from the Age of LLM
von: Yao, Peiran, et al.
Veröffentlicht: (2024)
von: Yao, Peiran, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
The Best Defense is Attack: Repairing Semantics in Textual Adversarial Examples
von: Yang, Heng, et al.
Veröffentlicht: (2023) -
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
von: Li, Ziqiang, et al.
Veröffentlicht: (2024) -
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
von: Cheng, Pengzhou, et al.
Veröffentlicht: (2024) -
Cut the Deadwood Out: Backdoor Purification via Guided Module Substitution
von: Tong, Yao, et al.
Veröffentlicht: (2024) -
Claim-Guided Textual Backdoor Attack for Practical Applications
von: Song, Minkyoo, et al.
Veröffentlicht: (2024)