M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Ha, Junwoo, Kim, Hyunjun, Yu, Sangyoon, Park, Haon, Yousefpour, Ashkan, Park, Yuna, Kim, Suhyun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates
por: Kim, Hyunjun, et al.
Publicado: (2025)
por: Kim, Hyunjun, et al.
Publicado: (2025)
ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks
por: Kim, Hyunjun, et al.
Publicado: (2025)
por: Kim, Hyunjun, et al.
Publicado: (2025)
sudo rm -rf agentic_security
por: Lee, Sejin, et al.
Publicado: (2025)
por: Lee, Sejin, et al.
Publicado: (2025)
Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations
por: Kim, Hyunjun
Publicado: (2026)
por: Kim, Hyunjun
Publicado: (2026)
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
por: Lee, Wonjun, et al.
Publicado: (2025)
por: Lee, Wonjun, et al.
Publicado: (2025)
Learning to Conceal Risk: Controllable Multi-turn Red Teaming for LLMs in the Financial Domain
por: Cheng, Gang, et al.
Publicado: (2025)
por: Cheng, Gang, et al.
Publicado: (2025)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
por: Weng, Zixuan, et al.
Publicado: (2025)
por: Weng, Zixuan, et al.
Publicado: (2025)
MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs
por: Hsu, Hsin-Ling, et al.
Publicado: (2026)
por: Hsu, Hsin-Ling, et al.
Publicado: (2026)
Multi-lingual Multi-turn Automated Red Teaming for LLMs
por: Singhania, Abhishek, et al.
Publicado: (2025)
por: Singhania, Abhishek, et al.
Publicado: (2025)
Evaluating and Enhancing LLMs for Multi-turn Text-to-SQL with Multiple Question Types
por: Guo, Ziming, et al.
Publicado: (2024)
por: Guo, Ziming, et al.
Publicado: (2024)
PromptTailor: Multi-turn Intent-Aligned Prompt Synthesis for Lightweight LLMs
por: Xu, Yizhou, et al.
Publicado: (2025)
por: Xu, Yizhou, et al.
Publicado: (2025)
Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn Interaction
por: Zhang, Jinchuan, et al.
Publicado: (2024)
por: Zhang, Jinchuan, et al.
Publicado: (2024)
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
por: Graf, Victoria, et al.
Publicado: (2026)
por: Graf, Victoria, et al.
Publicado: (2026)
Adversarial versification in portuguese as a jailbreak operator in LLMs
por: Queiroz, Joao
Publicado: (2025)
por: Queiroz, Joao
Publicado: (2025)
Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
por: Lee, Wonjun, et al.
Publicado: (2025)
por: Lee, Wonjun, et al.
Publicado: (2025)
Broaden your SCOPE! Efficient Multi-turn Conversation Planning for LLMs with Semantic Space
por: Chen, Zhiliang, et al.
Publicado: (2025)
por: Chen, Zhiliang, et al.
Publicado: (2025)
EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models
por: Lee, Donggyu, et al.
Publicado: (2025)
por: Lee, Donggyu, et al.
Publicado: (2025)
MINT: Evaluating LLMs in Multi-turn Interaction with Tools and Language Feedback
por: Wang, Xingyao, et al.
Publicado: (2023)
por: Wang, Xingyao, et al.
Publicado: (2023)
On the Multi-turn Instruction Following for Conversational Web Agents
por: Deng, Yang, et al.
Publicado: (2024)
por: Deng, Yang, et al.
Publicado: (2024)
Data Selection for Multi-turn Dialogue Instruction Tuning
por: Li, Bo, et al.
Publicado: (2026)
por: Li, Bo, et al.
Publicado: (2026)
Asymmetric Actor-Critic for Multi-turn LLM Agents
por: Jiang, Shuli, et al.
Publicado: (2026)
por: Jiang, Shuli, et al.
Publicado: (2026)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
por: Panpatil, Siddhant, et al.
Publicado: (2025)
por: Panpatil, Siddhant, et al.
Publicado: (2025)
Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
por: Chen, Bingsen, et al.
Publicado: (2026)
por: Chen, Bingsen, et al.
Publicado: (2026)
Multi-round jailbreak attack on large language models
por: Zhou, Yihua, et al.
Publicado: (2024)
por: Zhou, Yihua, et al.
Publicado: (2024)
Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMs
por: Gwak, Daehoon, et al.
Publicado: (2025)
por: Gwak, Daehoon, et al.
Publicado: (2025)
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
por: Pang, Renning, et al.
Publicado: (2026)
por: Pang, Renning, et al.
Publicado: (2026)
SafeMT: Multi-turn Safety for Multimodal Language Models
por: Zhu, Han, et al.
Publicado: (2025)
por: Zhu, Han, et al.
Publicado: (2025)
Ideological Bias in LLMs' Economic Causal Reasoning
por: Lee, Donggyu, et al.
Publicado: (2026)
por: Lee, Donggyu, et al.
Publicado: (2026)
Aligning Large Language Models by On-Policy Self-Judgment
por: Lee, Sangkyu, et al.
Publicado: (2024)
por: Lee, Sangkyu, et al.
Publicado: (2024)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
por: Yao, Zonghai, et al.
Publicado: (2026)
por: Yao, Zonghai, et al.
Publicado: (2026)
A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations
por: Tan, Andong, et al.
Publicado: (2026)
por: Tan, Andong, et al.
Publicado: (2026)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
por: Tang, Hua, et al.
Publicado: (2025)
por: Tang, Hua, et al.
Publicado: (2025)
TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild
por: Li, Huayang, et al.
Publicado: (2023)
por: Li, Huayang, et al.
Publicado: (2023)
Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction
por: Hafez, Wael, et al.
Publicado: (2026)
por: Hafez, Wael, et al.
Publicado: (2026)
REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM
por: Jindal, Madhur, et al.
Publicado: (2025)
por: Jindal, Madhur, et al.
Publicado: (2025)
Multilingual jailbreaking of LLMs using low-resource languages
por: Marx, Dylan, et al.
Publicado: (2026)
por: Marx, Dylan, et al.
Publicado: (2026)
CulturalTeaming: AI-Assisted Interactive Red-Teaming for Challenging LLMs' (Lack of) Multicultural Knowledge
por: Chiu, Yu Ying, et al.
Publicado: (2024)
por: Chiu, Yu Ying, et al.
Publicado: (2024)
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
por: Zhang, Yizhe, et al.
Publicado: (2023)
por: Zhang, Yizhe, et al.
Publicado: (2023)
MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models
por: Kim, Hyunjun, et al.
Publicado: (2025)
por: Kim, Hyunjun, et al.
Publicado: (2025)
MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
por: Acikgoz, Emre Can, et al.
Publicado: (2025)
por: Acikgoz, Emre Can, et al.
Publicado: (2025)
Ejemplares similares
-
X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates
por: Kim, Hyunjun, et al.
Publicado: (2025) -
ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks
por: Kim, Hyunjun, et al.
Publicado: (2025) -
sudo rm -rf agentic_security
por: Lee, Sejin, et al.
Publicado: (2025) -
Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations
por: Kim, Hyunjun
Publicado: (2026) -
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
por: Lee, Wonjun, et al.
Publicado: (2025)