MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Song, Jialin, Liu, Xiaodong, Yang, Weiwei, Chen, Wuyang, Feng, Mingqian, Zhu, Xuekai, Gao, Jianfeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
von: Weng, Zixuan, et al.
Veröffentlicht: (2025)
von: Weng, Zixuan, et al.
Veröffentlicht: (2025)
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
von: Ma, Chang, et al.
Veröffentlicht: (2024)
von: Ma, Chang, et al.
Veröffentlicht: (2024)
Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
AM$^3$Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs
von: Zhu, Han, et al.
Veröffentlicht: (2026)
von: Zhu, Han, et al.
Veröffentlicht: (2026)
SafeMT: Multi-turn Safety for Multimodal Language Models
von: Zhu, Han, et al.
Veröffentlicht: (2025)
von: Zhu, Han, et al.
Veröffentlicht: (2025)
X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates
von: Kim, Hyunjun, et al.
Veröffentlicht: (2025)
von: Kim, Hyunjun, et al.
Veröffentlicht: (2025)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
von: Tang, Hua, et al.
Veröffentlicht: (2025)
von: Tang, Hua, et al.
Veröffentlicht: (2025)
Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks
von: Hu, Hanjiang, et al.
Veröffentlicht: (2025)
von: Hu, Hanjiang, et al.
Veröffentlicht: (2025)
Scaling LLM Multi-turn RL with End-to-end Summarization-based Context Management
von: Lu, Miao, et al.
Veröffentlicht: (2025)
von: Lu, Miao, et al.
Veröffentlicht: (2025)
Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction
von: Fang, Jinrui, et al.
Veröffentlicht: (2026)
von: Fang, Jinrui, et al.
Veröffentlicht: (2026)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
von: Shen, Guobin, et al.
Veröffentlicht: (2025)
von: Shen, Guobin, et al.
Veröffentlicht: (2025)
REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM
von: Jindal, Madhur, et al.
Veröffentlicht: (2025)
von: Jindal, Madhur, et al.
Veröffentlicht: (2025)
Asymmetric Actor-Critic for Multi-turn LLM Agents
von: Jiang, Shuli, et al.
Veröffentlicht: (2026)
von: Jiang, Shuli, et al.
Veröffentlicht: (2026)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
von: Dong, Xuan, et al.
Veröffentlicht: (2026)
von: Dong, Xuan, et al.
Veröffentlicht: (2026)
Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese
von: Zaghouani, Wajdi, et al.
Veröffentlicht: (2026)
von: Zaghouani, Wajdi, et al.
Veröffentlicht: (2026)
GMTRouter: Personalized LLM Router over Multi-turn User Interactions
von: Xie, Encheng, et al.
Veröffentlicht: (2025)
von: Xie, Encheng, et al.
Veröffentlicht: (2025)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
von: Liu, Fan, et al.
Veröffentlicht: (2024)
von: Liu, Fan, et al.
Veröffentlicht: (2024)
Confidence Estimation for LLMs in Multi-turn Interactions
von: Zhang, Caiqi, et al.
Veröffentlicht: (2026)
von: Zhang, Caiqi, et al.
Veröffentlicht: (2026)
A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations
von: Tan, Andong, et al.
Veröffentlicht: (2026)
von: Tan, Andong, et al.
Veröffentlicht: (2026)
Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning
von: Liu, Qiang, et al.
Veröffentlicht: (2025)
von: Liu, Qiang, et al.
Veröffentlicht: (2025)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
Jailbreak Distillation: Renewable Safety Benchmarking
von: Zhang, Jingyu, et al.
Veröffentlicht: (2025)
von: Zhang, Jingyu, et al.
Veröffentlicht: (2025)
Is Length Really A Liability? An Evaluation of Multi-turn LLM Conversations using BoolQ
von: Neergaard, Karl, et al.
Veröffentlicht: (2026)
von: Neergaard, Karl, et al.
Veröffentlicht: (2026)
CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation
von: Cheng, Yiruo, et al.
Veröffentlicht: (2024)
von: Cheng, Yiruo, et al.
Veröffentlicht: (2024)
MORTAR: Multi-turn Metamorphic Testing for LLM-based Dialogue Systems
von: Guo, Guoxiang, et al.
Veröffentlicht: (2024)
von: Guo, Guoxiang, et al.
Veröffentlicht: (2024)
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
von: Lin, Liang, et al.
Veröffentlicht: (2025)
von: Lin, Liang, et al.
Veröffentlicht: (2025)
TensorLLM: Tensorising Multi-Head Attention for Enhanced Reasoning and Compression in LLMs
von: Gu, Yuxuan, et al.
Veröffentlicht: (2025)
von: Gu, Yuxuan, et al.
Veröffentlicht: (2025)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
von: Ji, Haoxuan, et al.
Veröffentlicht: (2024)
von: Ji, Haoxuan, et al.
Veröffentlicht: (2024)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
von: Zhou, Zhenhong, et al.
Veröffentlicht: (2024)
von: Zhou, Zhenhong, et al.
Veröffentlicht: (2024)
Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
von: Feng, Mingqian, et al.
Veröffentlicht: (2026)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
von: Luo, Weidi, et al.
Veröffentlicht: (2024)
von: Luo, Weidi, et al.
Veröffentlicht: (2024)
Unmasking the Canvas: A Dynamic Benchmark for Image Generation Jailbreaking and LLM Content Safety
von: Nair, Variath Madhupal Gautham, et al.
Veröffentlicht: (2025)
von: Nair, Variath Madhupal Gautham, et al.
Veröffentlicht: (2025)
Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations
von: Zheng, Mingqian, et al.
Veröffentlicht: (2026)
von: Zheng, Mingqian, et al.
Veröffentlicht: (2026)
Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression
von: Xu, Zhichao, et al.
Veröffentlicht: (2024)
von: Xu, Zhichao, et al.
Veröffentlicht: (2024)
MMMModal -- Multi-Images Multi-Audio Multi-turn Multi-Modal
von: Zolkepli, Husein, et al.
Veröffentlicht: (2024)
von: Zolkepli, Husein, et al.
Veröffentlicht: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
von: Chen, Taiye, et al.
Veröffentlicht: (2025)
von: Chen, Taiye, et al.
Veröffentlicht: (2025)
Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search
von: Lu, Jialin, et al.
Veröffentlicht: (2026)
von: Lu, Jialin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
von: Feng, Mingqian, et al.
Veröffentlicht: (2026) -
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025) -
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
von: Weng, Zixuan, et al.
Veröffentlicht: (2025) -
AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents
von: Ma, Chang, et al.
Veröffentlicht: (2024) -
Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)