LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Nathaniel, Han, Ziwen, Steneker, Ian, Primack, Willow, Goodside, Riley, Zhang, Hugh, Wang, Zifan, Menghini, Cristina, Yue, Summer |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Low-Resource Languages Jailbreak GPT-4
por: Yong, Zheng-Xin, et al.
Publicado: (2023)
por: Yong, Zheng-Xin, et al.
Publicado: (2023)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
por: Zeng, Yifan, et al.
Publicado: (2024)
por: Zeng, Yifan, et al.
Publicado: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
por: Chen, Bocheng, et al.
Publicado: (2024)
por: Chen, Bocheng, et al.
Publicado: (2024)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
por: Li, Yucheng, et al.
Publicado: (2025)
por: Li, Yucheng, et al.
Publicado: (2025)
A Red Teaming Roadmap Towards System-Level Safety
por: Wang, Zifan, et al.
Publicado: (2025)
por: Wang, Zifan, et al.
Publicado: (2025)
LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution
por: Yang, Zhuoran, et al.
Publicado: (2025)
por: Yang, Zhuoran, et al.
Publicado: (2025)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
por: Yang, Guangyu, et al.
Publicado: (2025)
por: Yang, Guangyu, et al.
Publicado: (2025)
Preventing Jailbreak Prompts as Malicious Tools for Cybercriminals: A Cyber Defense Perspective
por: Tshimula, Jean Marie, et al.
Publicado: (2024)
por: Tshimula, Jean Marie, et al.
Publicado: (2024)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
por: Rahman, Salman, et al.
Publicado: (2025)
por: Rahman, Salman, et al.
Publicado: (2025)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
por: Kim, Taeyoun, et al.
Publicado: (2024)
por: Kim, Taeyoun, et al.
Publicado: (2024)
Proactive defense against LLM Jailbreak
por: Zhao, Weiliang, et al.
Publicado: (2025)
por: Zhao, Weiliang, et al.
Publicado: (2025)
LLM Anonymization Against Agentic Re-Identification
por: Li, Ziwen, et al.
Publicado: (2026)
por: Li, Ziwen, et al.
Publicado: (2026)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
por: Gibbs, Tom, et al.
Publicado: (2024)
por: Gibbs, Tom, et al.
Publicado: (2024)
Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors
por: Zhao, Yi, et al.
Publicado: (2025)
por: Zhao, Yi, et al.
Publicado: (2025)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
por: Guo, Yangyang, et al.
Publicado: (2024)
por: Guo, Yangyang, et al.
Publicado: (2024)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
por: Long, Zhuohang, et al.
Publicado: (2025)
por: Long, Zhuohang, et al.
Publicado: (2025)
Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs
por: Liu, Yize, et al.
Publicado: (2025)
por: Liu, Yize, et al.
Publicado: (2025)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
por: Wu, Tianyi, et al.
Publicado: (2025)
por: Wu, Tianyi, et al.
Publicado: (2025)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
por: Wu, Yu-Hang, et al.
Publicado: (2025)
por: Wu, Yu-Hang, et al.
Publicado: (2025)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
por: Shen, Guobin, et al.
Publicado: (2025)
por: Shen, Guobin, et al.
Publicado: (2025)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
por: Li, Jindong, et al.
Publicado: (2026)
por: Li, Jindong, et al.
Publicado: (2026)
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
por: Zhang, Chiyu, et al.
Publicado: (2026)
por: Zhang, Chiyu, et al.
Publicado: (2026)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
por: Ying, Zonghao, et al.
Publicado: (2025)
por: Ying, Zonghao, et al.
Publicado: (2025)
Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
por: Zhou, Andy, et al.
Publicado: (2025)
por: Zhou, Andy, et al.
Publicado: (2025)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
por: Kim, Heegyu, et al.
Publicado: (2024)
por: Kim, Heegyu, et al.
Publicado: (2024)
One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs
por: Li, Linbao, et al.
Publicado: (2025)
por: Li, Linbao, et al.
Publicado: (2025)
GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods
por: Huang, Ruixuan, et al.
Publicado: (2025)
por: Huang, Ruixuan, et al.
Publicado: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
por: Xiong, Chen, et al.
Publicado: (2024)
por: Xiong, Chen, et al.
Publicado: (2024)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
por: Shen, Xinjie, et al.
Publicado: (2026)
por: Shen, Xinjie, et al.
Publicado: (2026)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
por: Jiang, Yifan, et al.
Publicado: (2024)
por: Jiang, Yifan, et al.
Publicado: (2024)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
por: Luo, Xuan, et al.
Publicado: (2025)
por: Luo, Xuan, et al.
Publicado: (2025)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
por: Ahmed, Mohamed, et al.
Publicado: (2025)
por: Ahmed, Mohamed, et al.
Publicado: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
por: Ouyang, Yang, et al.
Publicado: (2025)
por: Ouyang, Yang, et al.
Publicado: (2025)
LLM Jailbreak Detection for (Almost) Free!
por: Chen, Guorui, et al.
Publicado: (2025)
por: Chen, Guorui, et al.
Publicado: (2025)
Yet Another Watermark for Large Language Models
por: Bao, Siyuan, et al.
Publicado: (2025)
por: Bao, Siyuan, et al.
Publicado: (2025)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
por: Liu, Songyang, et al.
Publicado: (2026)
por: Liu, Songyang, et al.
Publicado: (2026)
Ejemplares similares
-
Low-Resource Languages Jailbreak GPT-4
por: Yong, Zheng-Xin, et al.
Publicado: (2023) -
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
por: Zeng, Yifan, et al.
Publicado: (2024) -
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
por: Chen, Bocheng, et al.
Publicado: (2024) -
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
por: Li, Yucheng, et al.
Publicado: (2025) -
A Red Teaming Roadmap Towards System-Level Safety
por: Wang, Zifan, et al.
Publicado: (2025)