MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Xinkai, Wei, Zhipeng, Gong, Huanli, Zheng, Jing Ting, Zhang, Yuchen, Dong, Yue, Erichson, N. Benjamin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Reasoning LLMs Refuse What They Infer in Long Contexts?
par: Fu, Yu, et autres
Publié: (2026)
par: Fu, Yu, et autres
Publié: (2026)
RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents
par: Yeke, Doguhuan, et autres
Publié: (2026)
par: Yeke, Doguhuan, et autres
Publié: (2026)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
par: Wang, Xinkai, et autres
Publié: (2025)
par: Wang, Xinkai, et autres
Publié: (2025)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
par: Nian, Yi, et autres
Publié: (2025)
par: Nian, Yi, et autres
Publié: (2025)
JailGuard: A Universal Detection Framework for LLM Prompt-based Attacks
par: Zhang, Xiaoyu, et autres
Publié: (2023)
par: Zhang, Xiaoyu, et autres
Publié: (2023)
ShallowJail: Steering Jailbreaks against Large Language Models
par: Liu, Shang, et autres
Publié: (2026)
par: Liu, Shang, et autres
Publié: (2026)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
par: Luo, Weidi, et autres
Publié: (2024)
par: Luo, Weidi, et autres
Publié: (2024)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
par: Weng, Fenghua, et autres
Publié: (2024)
par: Weng, Fenghua, et autres
Publié: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience
par: Wang, Xi, et autres
Publié: (2025)
par: Wang, Xi, et autres
Publié: (2025)
AttackSeqBench: Benchmarking the Capabilities of LLMs for Attack Sequences Understanding
par: Ma, Haokai, et autres
Publié: (2025)
par: Ma, Haokai, et autres
Publié: (2025)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
par: Chao, Patrick, et autres
Publié: (2024)
par: Chao, Patrick, et autres
Publié: (2024)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
par: Lin, Runqi, et autres
Publié: (2025)
par: Lin, Runqi, et autres
Publié: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
par: Gibbs, Tom, et autres
Publié: (2024)
par: Gibbs, Tom, et autres
Publié: (2024)
ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack
par: Lin, Xingwei, et autres
Publié: (2026)
par: Lin, Xingwei, et autres
Publié: (2026)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
par: Zhang, Shenyi, et autres
Publié: (2025)
par: Zhang, Shenyi, et autres
Publié: (2025)
BlackboxBench: A Comprehensive Benchmark of Black-box Adversarial Attacks
par: Zheng, Meixi, et autres
Publié: (2023)
par: Zheng, Meixi, et autres
Publié: (2023)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
par: Wang, Youze, et autres
Publié: (2025)
par: Wang, Youze, et autres
Publié: (2025)
Untargeted Jailbreak Attack
par: Huang, Xinzhe, et autres
Publié: (2025)
par: Huang, Xinzhe, et autres
Publié: (2025)
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
par: Russinovich, Mark, et autres
Publié: (2024)
par: Russinovich, Mark, et autres
Publié: (2024)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
par: Tong, Haibo, et autres
Publié: (2025)
par: Tong, Haibo, et autres
Publié: (2025)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
par: Yin, Ziyi, et autres
Publié: (2025)
par: Yin, Ziyi, et autres
Publié: (2025)
JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs
par: Li, Hongyi, et autres
Publié: (2024)
par: Li, Hongyi, et autres
Publié: (2024)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
par: Piet, Julien, et autres
Publié: (2025)
par: Piet, Julien, et autres
Publié: (2025)
OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing
par: Chen, Jianming, et autres
Publié: (2026)
par: Chen, Jianming, et autres
Publié: (2026)
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
par: Zhang, Junke, et autres
Publié: (2026)
par: Zhang, Junke, et autres
Publié: (2026)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
par: Narula, Sidhant, et autres
Publié: (2025)
par: Narula, Sidhant, et autres
Publié: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
par: Lu, Lin, et autres
Publié: (2024)
par: Lu, Lin, et autres
Publié: (2024)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
par: Jia, Xiaojun, et autres
Publié: (2025)
par: Jia, Xiaojun, et autres
Publié: (2025)
Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
par: He, Zeqing, et autres
Publié: (2024)
par: He, Zeqing, et autres
Publié: (2024)
The Echo Chamber Multi-Turn LLM Jailbreak
par: Alobaid, Ahmad, et autres
Publié: (2026)
par: Alobaid, Ahmad, et autres
Publié: (2026)
Turn Your Face Into An Attack Surface: Screen Attack Using Facial Reflections in Video Conferencing
par: Huang, Yong, et autres
Publié: (2026)
par: Huang, Yong, et autres
Publié: (2026)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
par: Kadali, Sri Durga Sai Sowmya, et autres
Publié: (2026)
par: Kadali, Sri Durga Sai Sowmya, et autres
Publié: (2026)
The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks
par: Li, Chunyang, et autres
Publié: (2025)
par: Li, Chunyang, et autres
Publié: (2025)
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
par: Zhang, Hanrong, et autres
Publié: (2024)
par: Zhang, Hanrong, et autres
Publié: (2024)
Documents similaires
-
Do Reasoning LLMs Refuse What They Infer in Long Contexts?
par: Fu, Yu, et autres
Publié: (2026) -
RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents
par: Yeke, Doguhuan, et autres
Publié: (2026) -
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
par: Wang, Xinkai, et autres
Publié: (2025) -
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
par: Nian, Yi, et autres
Publié: (2025) -
JailGuard: A Universal Detection Framework for LLM Prompt-based Attacks
par: Zhang, Xiaoyu, et autres
Publié: (2023)