Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wit, Maria Carolina Cornelia, Pang, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
por: Yung, Canaan, et al.
Publicado: (2024)
por: Yung, Canaan, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
por: Zhao, Wei, et al.
Publicado: (2024)
por: Zhao, Wei, et al.
Publicado: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
por: Robey, Alexander, et al.
Publicado: (2023)
por: Robey, Alexander, et al.
Publicado: (2023)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
por: Das, Badhan Chandra, et al.
Publicado: (2026)
por: Das, Badhan Chandra, et al.
Publicado: (2026)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
por: Ran, Delong, et al.
Publicado: (2024)
por: Ran, Delong, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
por: Zhao, Yinzhi, et al.
Publicado: (2026)
por: Zhao, Yinzhi, et al.
Publicado: (2026)
Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
por: Ding, Renhua, et al.
Publicado: (2025)
por: Ding, Renhua, et al.
Publicado: (2025)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
por: Wong, Ryan, et al.
Publicado: (2025)
por: Wong, Ryan, et al.
Publicado: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
por: Hong, Wenjing, et al.
Publicado: (2026)
por: Hong, Wenjing, et al.
Publicado: (2026)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
por: Sun, Xiongtao, et al.
Publicado: (2024)
por: Sun, Xiongtao, et al.
Publicado: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
por: Zhou, Guanghao, et al.
Publicado: (2025)
por: Zhou, Guanghao, et al.
Publicado: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
por: Li, Jie, et al.
Publicado: (2024)
por: Li, Jie, et al.
Publicado: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
por: Ying, Zonghao, et al.
Publicado: (2025)
por: Ying, Zonghao, et al.
Publicado: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
por: Xiao, Zeguan, et al.
Publicado: (2024)
por: Xiao, Zeguan, et al.
Publicado: (2024)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
por: Narula, Sidhant, et al.
Publicado: (2025)
por: Narula, Sidhant, et al.
Publicado: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
por: Mia, Md Jueal, et al.
Publicado: (2026)
por: Mia, Md Jueal, et al.
Publicado: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
por: Park, Junyoung, et al.
Publicado: (2026)
por: Park, Junyoung, et al.
Publicado: (2026)
New Wide-Net-Casting Jailbreak Attacks Risk Large Models
por: Xiang, Qiuchi, et al.
Publicado: (2026)
por: Xiang, Qiuchi, et al.
Publicado: (2026)
Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
por: Guo, Qiming, et al.
Publicado: (2025)
por: Guo, Qiming, et al.
Publicado: (2025)
Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration
por: Tsmindashvili, Tatia, et al.
Publicado: (2025)
por: Tsmindashvili, Tatia, et al.
Publicado: (2025)
SoK: Robustness in Large Language Models against Jailbreak Attacks
por: Xu, Feiyue, et al.
Publicado: (2026)
por: Xu, Feiyue, et al.
Publicado: (2026)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
por: Jaiswal, Piyush, et al.
Publicado: (2026)
por: Jaiswal, Piyush, et al.
Publicado: (2026)
Merging Improves Self-Critique Against Jailbreak Attacks
por: Gallego, Victor
Publicado: (2024)
por: Gallego, Victor
Publicado: (2024)
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
por: Hossain, Md Zarif, et al.
Publicado: (2024)
por: Hossain, Md Zarif, et al.
Publicado: (2024)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
por: Zhou, Andy, et al.
Publicado: (2024)
por: Zhou, Andy, et al.
Publicado: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
por: Yu, Miao, et al.
Publicado: (2024)
por: Yu, Miao, et al.
Publicado: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
por: Ma, Zhiqing, et al.
Publicado: (2026)
por: Ma, Zhiqing, et al.
Publicado: (2026)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
por: Tong, Haibo, et al.
Publicado: (2025)
por: Tong, Haibo, et al.
Publicado: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2024)
por: Wang, Ruofan, et al.
Publicado: (2024)
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025)
por: Gao, Kuofeng, et al.
Publicado: (2025)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
por: Yang, Fan
Publicado: (2025)
por: Yang, Fan
Publicado: (2025)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
por: Feng, Bo-Han, et al.
Publicado: (2026)
por: Feng, Bo-Han, et al.
Publicado: (2026)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
por: Mu, Honglin, et al.
Publicado: (2024)
por: Mu, Honglin, et al.
Publicado: (2024)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
por: Zhao, Yunhan, et al.
Publicado: (2024)
por: Zhao, Yunhan, et al.
Publicado: (2024)
Ejemplares similares
-
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
por: Yung, Canaan, et al.
Publicado: (2024) -
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
por: Zhao, Wei, et al.
Publicado: (2024) -
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
por: Robey, Alexander, et al.
Publicado: (2023) -
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
por: Das, Badhan Chandra, et al.
Publicado: (2026) -
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)