JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chu, Junjie, Liu, Yugeng, Yang, Ziqing, Shen, Xinyue, Backes, Michael, Zhang, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring
par: Chu, Junjie, et autres
Publié: (2025)
par: Chu, Junjie, et autres
Publié: (2025)
Voice Jailbreak Attacks Against GPT-4o
par: Shen, Xinyue, et autres
Publié: (2024)
par: Shen, Xinyue, et autres
Publié: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023)
par: Mehrotra, Anay, et autres
Publié: (2023)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
par: Lin, Shi, et autres
Publié: (2024)
par: Lin, Shi, et autres
Publié: (2024)
Jailbreaking LLMs via Calibration
par: Lu, Yuxuan, et autres
Publié: (2026)
par: Lu, Yuxuan, et autres
Publié: (2026)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
Boosting Jailbreak Attack with Momentum
par: Zhang, Yihao, et autres
Publié: (2024)
par: Zhang, Yihao, et autres
Publié: (2024)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
par: Jaiswal, Piyush, et autres
Publié: (2026)
par: Jaiswal, Piyush, et autres
Publié: (2026)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
par: Yang, Ziqing, et autres
Publié: (2024)
par: Yang, Ziqing, et autres
Publié: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
par: Xin, Yuan, et autres
Publié: (2025)
par: Xin, Yuan, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)
par: Mu, Junjie, et autres
Publié: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
par: Liu, Xiaoqun, et autres
Publié: (2024)
par: Liu, Xiaoqun, et autres
Publié: (2024)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
par: Mo, Yichuan, et autres
Publié: (2024)
par: Mo, Yichuan, et autres
Publié: (2024)
Jailbreaking in the Haystack
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
par: Lv, Lijia, et autres
Publié: (2024)
par: Lv, Lijia, et autres
Publié: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
par: Zhou, Guanghao, et autres
Publié: (2025)
par: Zhou, Guanghao, et autres
Publié: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
par: Hu, Xiaomeng, et autres
Publié: (2025)
par: Hu, Xiaomeng, et autres
Publié: (2025)
What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks
par: Kirch, Nathalie, et autres
Publié: (2024)
par: Kirch, Nathalie, et autres
Publié: (2024)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
par: Ni, Ziyi, et autres
Publié: (2025)
par: Ni, Ziyi, et autres
Publié: (2025)
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
par: Gohil, Vasudev
Publié: (2025)
par: Gohil, Vasudev
Publié: (2025)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
par: Yang, Junxiao, et autres
Publié: (2025)
par: Yang, Junxiao, et autres
Publié: (2025)
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
par: Fang, Zhicheng, et autres
Publié: (2026)
par: Fang, Zhicheng, et autres
Publié: (2026)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
par: Tong, Haibo, et autres
Publié: (2025)
par: Tong, Haibo, et autres
Publié: (2025)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
par: Shen, Guangyu, et autres
Publié: (2024)
par: Shen, Guangyu, et autres
Publié: (2024)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
par: Pan, Licheng, et autres
Publié: (2026)
par: Pan, Licheng, et autres
Publié: (2026)
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
par: Rando, Javier, et autres
Publié: (2024)
par: Rando, Javier, et autres
Publié: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
par: Chen, Taiye, et autres
Publié: (2025)
par: Chen, Taiye, et autres
Publié: (2025)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
par: Andriushchenko, Maksym, et autres
Publié: (2024)
par: Andriushchenko, Maksym, et autres
Publié: (2024)
Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks
par: Nurlanov, Zhakshylyk, et autres
Publié: (2026)
par: Nurlanov, Zhakshylyk, et autres
Publié: (2026)
Documents similaires
-
JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring
par: Chu, Junjie, et autres
Publié: (2025) -
Voice Jailbreak Attacks Against GPT-4o
par: Shen, Xinyue, et autres
Publié: (2024) -
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024) -
Reconstruct Your Previous Conversations! Comprehensively Investigating Privacy Leakage Risks in Conversations with GPT Models
par: Chu, Junjie, et autres
Publié: (2024) -
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)