Testing the Limits of Jailbreaking Defenses with the Purple Problem
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Taeyoun, Kotha, Suhas, Raghunathan, Aditi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jailbreaking in the Haystack
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
par: Shah, Rishi Rajesh, et autres
Publié: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
par: Kim, Heegyu, et autres
Publié: (2024)
par: Kim, Heegyu, et autres
Publié: (2024)
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
par: Wang, Tony T., et autres
Publié: (2024)
par: Wang, Tony T., et autres
Publié: (2024)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
par: Li, Nathaniel, et autres
Publié: (2024)
par: Li, Nathaniel, et autres
Publié: (2024)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
par: Sun, Bowen, et autres
Publié: (2026)
par: Sun, Bowen, et autres
Publié: (2026)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
par: Kotha, Suhas, et autres
Publié: (2023)
par: Kotha, Suhas, et autres
Publié: (2023)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
par: Ahmed, Mohamed, et autres
Publié: (2025)
par: Ahmed, Mohamed, et autres
Publié: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
par: Chen, Taiye, et autres
Publié: (2025)
par: Chen, Taiye, et autres
Publié: (2025)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
par: Zheng, Xiaosen, et autres
Publié: (2024)
par: Zheng, Xiaosen, et autres
Publié: (2024)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
par: Jiang, Weisen, et autres
Publié: (2025)
par: Jiang, Weisen, et autres
Publié: (2025)
A StrongREJECT for Empty Jailbreaks
par: Souly, Alexandra, et autres
Publié: (2024)
par: Souly, Alexandra, et autres
Publié: (2024)
Sockpuppetting: Jailbreaking LLMs by Combining Prefilling with Optimization
par: Dotsinski, Asen, et autres
Publié: (2026)
par: Dotsinski, Asen, et autres
Publié: (2026)
Sparse Autoencoders are Capable LLM Jailbreak Mitigators
par: Assogba, Yannick, et autres
Publié: (2026)
par: Assogba, Yannick, et autres
Publié: (2026)
A Systematic Literature Review on LLM Defenses Against Prompt Injection and Jailbreaking: Expanding NIST Taxonomy
par: Correia, Pedro H. Barcha, et autres
Publié: (2026)
par: Correia, Pedro H. Barcha, et autres
Publié: (2026)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
par: Jia, Xiaojun, et autres
Publié: (2024)
par: Jia, Xiaojun, et autres
Publié: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
par: Lochab, Anamika, et autres
Publié: (2025)
par: Lochab, Anamika, et autres
Publié: (2025)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
par: Li, Qizhang, et autres
Publié: (2024)
par: Li, Qizhang, et autres
Publié: (2024)
Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks
par: Hu, Hanjiang, et autres
Publié: (2025)
par: Hu, Hanjiang, et autres
Publié: (2025)
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
par: Rahman, Salman, et autres
Publié: (2025)
par: Rahman, Salman, et autres
Publié: (2025)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
par: Jiang, Yifan, et autres
Publié: (2024)
par: Jiang, Yifan, et autres
Publié: (2024)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
par: Hu, Kai, et autres
Publié: (2025)
par: Hu, Kai, et autres
Publié: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
par: Coalson, Zachary, et autres
Publié: (2024)
par: Coalson, Zachary, et autres
Publié: (2024)
PANDAS: Improving Many-shot Jailbreaking via Positive Affirmation, Negative Demonstration, and Adaptive Sampling
par: Ma, Avery, et autres
Publié: (2025)
par: Ma, Avery, et autres
Publié: (2025)
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
par: Geng, Jiahui, et autres
Publié: (2025)
par: Geng, Jiahui, et autres
Publié: (2025)
Self-Evaluation as a Defense Against Adversarial Attacks on LLMs
par: Brown, Hannah, et autres
Publié: (2024)
par: Brown, Hannah, et autres
Publié: (2024)
Data-centric NLP Backdoor Defense from the Lens of Memorization
par: Wang, Zhenting, et autres
Publié: (2024)
par: Wang, Zhenting, et autres
Publié: (2024)
Dissecting Adversarial Robustness of Multimodal LM Agents
par: Wu, Chen Henry, et autres
Publié: (2024)
par: Wu, Chen Henry, et autres
Publié: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?
par: Chen, Shuo, et autres
Publié: (2024)
par: Chen, Shuo, et autres
Publié: (2024)
Jailbreaking with Universal Multi-Prompts
par: Hsu, Yu-Ling, et autres
Publié: (2025)
par: Hsu, Yu-Ling, et autres
Publié: (2025)
Jailbreaking LLMs via Calibration
par: Lu, Yuxuan, et autres
Publié: (2026)
par: Lu, Yuxuan, et autres
Publié: (2026)
Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
par: Guo, Wenkai, et autres
Publié: (2025)
par: Guo, Wenkai, et autres
Publié: (2025)
Mitigating Bias in RAG: Controlling the Embedder
par: Kim, Taeyoun, et autres
Publié: (2025)
par: Kim, Taeyoun, et autres
Publié: (2025)
From Theory to Practice: Evaluating Data Poisoning Attacks and Defenses in In-Context Learning on Social Media Health Discourse
par: Jhuma, Rabeya Amin, et autres
Publié: (2025)
par: Jhuma, Rabeya Amin, et autres
Publié: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
par: Zhu, Sicheng, et autres
Publié: (2024)
par: Zhu, Sicheng, et autres
Publié: (2024)
Documents similaires
-
Jailbreaking in the Haystack
par: Shah, Rishi Rajesh, et autres
Publié: (2025) -
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024) -
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
par: Kim, Heegyu, et autres
Publié: (2024) -
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
par: Wang, Tony T., et autres
Publié: (2024) -
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
par: Li, Nathaniel, et autres
Publié: (2024)