Jailbreak Attacks and Defenses Against Large Language Models: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Yi, Sibo, Liu, Yule, Sun, Zhen, Cong, Tianshuo, He, Xinlei, Song, Jiaxing, Xu, Ke, Li, Qi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
di: Yi, Sibo, et al.
Pubblicazione: (2025)
di: Yi, Sibo, et al.
Pubblicazione: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
di: Ran, Delong, et al.
Pubblicazione: (2024)
di: Ran, Delong, et al.
Pubblicazione: (2024)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025)
di: Ran, Delong, et al.
Pubblicazione: (2025)
PEFTGuard: Detecting Backdoor Attacks Against Parameter-Efficient Fine-Tuning
di: Sun, Zhen, et al.
Pubblicazione: (2024)
di: Sun, Zhen, et al.
Pubblicazione: (2024)
SoK: Benchmarking Poisoning Attacks and Defenses in Federated Learning
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
di: Liu, Zesen, et al.
Pubblicazione: (2024)
di: Liu, Zesen, et al.
Pubblicazione: (2024)
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
di: Cong, Tianshuo, et al.
Pubblicazione: (2024)
di: Cong, Tianshuo, et al.
Pubblicazione: (2024)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
di: Liu, Yule, et al.
Pubblicazione: (2025)
di: Liu, Yule, et al.
Pubblicazione: (2025)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
di: Li, Haoran, et al.
Pubblicazione: (2023)
di: Li, Haoran, et al.
Pubblicazione: (2023)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
Breaking Down the Defenses: A Comparative Survey of Attacks on Large Language Models
di: Chowdhury, Arijit Ghosh, et al.
Pubblicazione: (2024)
di: Chowdhury, Arijit Ghosh, et al.
Pubblicazione: (2024)
CL-Attack: Textual Backdoor Attacks via Cross-Lingual Triggers
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
di: Kim, Heegyu, et al.
Pubblicazione: (2024)
di: Kim, Heegyu, et al.
Pubblicazione: (2024)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
di: Gong, Yichen, et al.
Pubblicazione: (2023)
di: Gong, Yichen, et al.
Pubblicazione: (2023)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
di: Li, Bangxin, et al.
Pubblicazione: (2024)
di: Li, Bangxin, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Data Defenses Against Large Language Models
di: Agnew, William, et al.
Pubblicazione: (2024)
di: Agnew, William, et al.
Pubblicazione: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
Prompt Stealing Attacks Against Large Language Models
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
$PD^3F$: A Pluggable and Dynamic DoS-Defense Framework Against Resource Consumption Attacks Targeting Large Language Models
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
Stego Battlefield: Evaluating Image Steganography Attacks and Steganalysis Defenses
di: Sun, Zhen, et al.
Pubblicazione: (2026)
di: Sun, Zhen, et al.
Pubblicazione: (2026)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
di: Xiong, Chen, et al.
Pubblicazione: (2024)
di: Xiong, Chen, et al.
Pubblicazione: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
di: Li, Yucheng, et al.
Pubblicazione: (2025)
di: Li, Yucheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
di: Yi, Sibo, et al.
Pubblicazione: (2025) -
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
di: Ran, Delong, et al.
Pubblicazione: (2024) -
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025) -
PEFTGuard: Detecting Backdoor Attacks Against Parameter-Efficient Fine-Tuning
di: Sun, Zhen, et al.
Pubblicazione: (2024) -
SoK: Benchmarking Poisoning Attacks and Defenses in Federated Learning
di: Zhang, Heyi, et al.
Pubblicazione: (2025)