A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Zihao, Liu, Yi, Deng, Gelei, Li, Yuekang, Picek, Stjepan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
di: Ding, Junchen, et al.
Pubblicazione: (2025)
di: Ding, Junchen, et al.
Pubblicazione: (2025)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
A Rusty Link in the AI Supply Chain: Detecting Evil Configurations in Model Repositories
di: Ding, Ziqi, et al.
Pubblicazione: (2025)
di: Ding, Ziqi, et al.
Pubblicazione: (2025)
Towards Backdoor Stealthiness in Model Parameter Space
di: Xu, Xiaoyun, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyun, et al.
Pubblicazione: (2025)
Context is the Key: Backdoor Attacks for In-Context Learning with Vision Transformers
di: Abad, Gorka, et al.
Pubblicazione: (2024)
di: Abad, Gorka, et al.
Pubblicazione: (2024)
Flashy Backdoor: Real-world Environment Backdoor Attack on SNNs with DVS Cameras
di: Riaño, Roberto, et al.
Pubblicazione: (2024)
di: Riaño, Roberto, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
Membership Inference Attacks Against Video Large Language Models
di: Song, Wei, et al.
Pubblicazione: (2026)
di: Song, Wei, et al.
Pubblicazione: (2026)
Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
di: Chen, Zhihao, et al.
Pubblicazione: (2026)
SoK: The Last Line of Defense: On Backdoor Defense Evaluation
di: Abad, Gorka, et al.
Pubblicazione: (2025)
di: Abad, Gorka, et al.
Pubblicazione: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Membership Privacy Evaluation in Deep Spiking Neural Networks
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation
di: Zhang, Wenhui, et al.
Pubblicazione: (2025)
di: Zhang, Wenhui, et al.
Pubblicazione: (2025)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning
di: Deng, Gelei, et al.
Pubblicazione: (2024)
di: Deng, Gelei, et al.
Pubblicazione: (2024)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
Recent Advances in Attack and Defense Approaches of Large Language Models
di: Cui, Jing, et al.
Pubblicazione: (2024)
di: Cui, Jing, et al.
Pubblicazione: (2024)
Good News for Script Kiddies? Evaluating Large Language Models for Automated Exploit Generation
di: Jin, David, et al.
Pubblicazione: (2025)
di: Jin, David, et al.
Pubblicazione: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)
di: Park, Junyoung, et al.
Pubblicazione: (2026)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025)
di: Tong, Haibo, et al.
Pubblicazione: (2025)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
di: Pan, Licheng, et al.
Pubblicazione: (2026)
di: Pan, Licheng, et al.
Pubblicazione: (2026)
The Attack and Defense Landscape of Agentic AI: A Comprehensive Survey
di: Kim, Juhee, et al.
Pubblicazione: (2026)
di: Kim, Juhee, et al.
Pubblicazione: (2026)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
di: Wang, Youze, et al.
Pubblicazione: (2025)
di: Wang, Youze, et al.
Pubblicazione: (2025)
Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale
di: Liu, Yi, et al.
Pubblicazione: (2026)
di: Liu, Yi, et al.
Pubblicazione: (2026)
SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
di: Teng, Ma, et al.
Pubblicazione: (2024)
di: Teng, Ma, et al.
Pubblicazione: (2024)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024) -
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
di: Ding, Junchen, et al.
Pubblicazione: (2025) -
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
di: Yang, Xianglin, et al.
Pubblicazione: (2025) -
A Rusty Link in the AI Supply Chain: Detecting Evil Configurations in Model Repositories
di: Ding, Ziqi, et al.
Pubblicazione: (2025) -
Towards Backdoor Stealthiness in Model Parameter Space
di: Xu, Xiaoyun, et al.
Pubblicazione: (2025)