JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Jin, Haibo, Hu, Leyang, Li, Xinnuo, Zhang, Peiyan, Chen, Chonghan, Zhuang, Jun, Wang, Haohan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
InfoFlood: Jailbreaking Large Language Models with Information Overload
por: Yadav, Advait, et al.
Publicado: (2025)
por: Yadav, Advait, et al.
Publicado: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
por: Zhang, Peiyan, et al.
Publicado: (2025)
por: Zhang, Peiyan, et al.
Publicado: (2025)
Jailbreaking Attack against Multimodal Large Language Model
por: Niu, Zhenxing, et al.
Publicado: (2024)
por: Niu, Zhenxing, et al.
Publicado: (2024)
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
por: Liao, Qilin, et al.
Publicado: (2025)
por: Liao, Qilin, et al.
Publicado: (2025)
Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization
por: Hao, Shuyang, et al.
Publicado: (2025)
por: Hao, Shuyang, et al.
Publicado: (2025)
Failures to Find Transferable Image Jailbreaks Between Vision-Language Models
por: Schaeffer, Rylan, et al.
Publicado: (2024)
por: Schaeffer, Rylan, et al.
Publicado: (2024)
GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
por: Ying, Zonghao, et al.
Publicado: (2024)
por: Ying, Zonghao, et al.
Publicado: (2024)
Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization
por: Guan, Jiwei, et al.
Publicado: (2026)
por: Guan, Jiwei, et al.
Publicado: (2026)
Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models
por: Liang, Shuang, et al.
Publicado: (2025)
por: Liang, Shuang, et al.
Publicado: (2025)
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
por: Jin, Haibo, et al.
Publicado: (2025)
por: Jin, Haibo, et al.
Publicado: (2025)
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
por: Miao, Ziqi, et al.
Publicado: (2025)
por: Miao, Ziqi, et al.
Publicado: (2025)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
por: Yu, Ye, et al.
Publicado: (2026)
por: Yu, Ye, et al.
Publicado: (2026)
Text is All You Need for Vision-Language Model Jailbreaking
por: Chen, Yihang, et al.
Publicado: (2026)
por: Chen, Yihang, et al.
Publicado: (2026)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
por: Feng, Yingchaojie, et al.
Publicado: (2024)
por: Feng, Yingchaojie, et al.
Publicado: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
por: Kadali, Sri Durga Sai Sowmya, et al.
Publicado: (2026)
por: Kadali, Sri Durga Sai Sowmya, et al.
Publicado: (2026)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
por: Ran, Delong, et al.
Publicado: (2024)
por: Ran, Delong, et al.
Publicado: (2024)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
por: Dong, Yiting, et al.
Publicado: (2024)
por: Dong, Yiting, et al.
Publicado: (2024)
Image-Based Geolocation Using Large Vision-Language Models
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025)
por: Gao, Kuofeng, et al.
Publicado: (2025)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
por: Yang, Guangyu, et al.
Publicado: (2025)
por: Yang, Guangyu, et al.
Publicado: (2025)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
por: Yu, Zhiyuan, et al.
Publicado: (2024)
por: Yu, Zhiyuan, et al.
Publicado: (2024)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
por: Zhao, Wei, et al.
Publicado: (2024)
por: Zhao, Wei, et al.
Publicado: (2024)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
por: Li, Bangxin, et al.
Publicado: (2024)
por: Li, Bangxin, et al.
Publicado: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
por: Hu, Xiaomeng, et al.
Publicado: (2024)
por: Hu, Xiaomeng, et al.
Publicado: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
por: Zhou, Guanghao, et al.
Publicado: (2025)
por: Zhou, Guanghao, et al.
Publicado: (2025)
Jailbreaking Large Language Models Through Content Concretization
por: Wahréus, Johan, et al.
Publicado: (2025)
por: Wahréus, Johan, et al.
Publicado: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
por: Xiao, Zeguan, et al.
Publicado: (2024)
por: Xiao, Zeguan, et al.
Publicado: (2024)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
por: Gong, Yichen, et al.
Publicado: (2023)
por: Gong, Yichen, et al.
Publicado: (2023)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
por: Liu, Jiangtao, et al.
Publicado: (2025)
por: Liu, Jiangtao, et al.
Publicado: (2025)
When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?
por: Tian, Yuan, et al.
Publicado: (2026)
por: Tian, Yuan, et al.
Publicado: (2026)
Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step
por: Wang, Wenxuan, et al.
Publicado: (2024)
por: Wang, Wenxuan, et al.
Publicado: (2024)
Towards Safe AI Clinicians: A Comprehensive Study on Large Language Model Jailbreaking in Healthcare
por: Zhang, Hang, et al.
Publicado: (2025)
por: Zhang, Hang, et al.
Publicado: (2025)
BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
por: Nakka, Kalyan, et al.
Publicado: (2025)
por: Nakka, Kalyan, et al.
Publicado: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
por: Zhao, Shiji, et al.
Publicado: (2025)
por: Zhao, Shiji, et al.
Publicado: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
por: Jia, Xiaojun, et al.
Publicado: (2024)
por: Jia, Xiaojun, et al.
Publicado: (2024)
Is the System Message Really Important to Jailbreaks in Large Language Models?
por: Zou, Xiaotian, et al.
Publicado: (2024)
por: Zou, Xiaotian, et al.
Publicado: (2024)
Ejemplares similares
-
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
por: Jin, Haibo, et al.
Publicado: (2024) -
InfoFlood: Jailbreaking Large Language Models with Information Overload
por: Yadav, Advait, et al.
Publicado: (2025) -
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
por: Zhang, Peiyan, et al.
Publicado: (2025) -
Jailbreaking Attack against Multimodal Large Language Model
por: Niu, Zhenxing, et al.
Publicado: (2024) -
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
por: Jiang, Zhengyuan, et al.
Publicado: (2025)