Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Zhenhong, Xiang, Jiuyang, Chen, Haopeng, Liu, Quan, Li, Zherui, Su, Sen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CORBA: Contagious Recursive Blocking Attacks on Multi-Agent Systems Based on Large Language Models
par: Zhou, Zhenhong, et autres
Publié: (2025)
par: Zhou, Zhenhong, et autres
Publié: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
par: Liu, Zheyuan, et autres
Publié: (2026)
par: Liu, Zheyuan, et autres
Publié: (2026)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
par: Yu, Erxin, et autres
Publié: (2024)
par: Yu, Erxin, et autres
Publié: (2024)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
par: Li, Zherui, et autres
Publié: (2025)
par: Li, Zherui, et autres
Publié: (2025)
Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue
par: Bhagtani, Kratika, et autres
Publié: (2026)
par: Bhagtani, Kratika, et autres
Publié: (2026)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
par: Bai, Ge, et autres
Publié: (2024)
par: Bai, Ge, et autres
Publié: (2024)
MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
par: Yan, Siyu, et autres
Publié: (2025)
par: Yan, Siyu, et autres
Publié: (2025)
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
par: Wang, Kun, et autres
Publié: (2026)
par: Wang, Kun, et autres
Publié: (2026)
SafeMT: Multi-turn Safety for Multimodal Language Models
par: Zhu, Han, et autres
Publié: (2025)
par: Zhu, Han, et autres
Publié: (2025)
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
par: Graf, Victoria, et autres
Publié: (2026)
par: Graf, Victoria, et autres
Publié: (2026)
Alignment-Enhanced Decoding:Defending via Token-Level Adaptive Refining of Probability Distributions
par: Liu, Quan, et autres
Publié: (2024)
par: Liu, Quan, et autres
Publié: (2024)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
par: Zhang, Wei, et autres
Publié: (2026)
par: Zhang, Wei, et autres
Publié: (2026)
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
par: Lang, Hao, et autres
Publié: (2023)
par: Lang, Hao, et autres
Publié: (2023)
When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models
par: Nama, Vihaan, et autres
Publié: (2026)
par: Nama, Vihaan, et autres
Publié: (2026)
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
par: Pang, Renning, et autres
Publié: (2026)
par: Pang, Renning, et autres
Publié: (2026)
Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
par: Abdulhai, Marwa, et autres
Publié: (2025)
par: Abdulhai, Marwa, et autres
Publié: (2025)
Data Selection for Multi-turn Dialogue Instruction Tuning
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
par: Nihal, Ragib Amin, et autres
Publié: (2025)
par: Nihal, Ragib Amin, et autres
Publié: (2025)
A State-Update Prompting Strategy for Efficient and Robust Multi-turn Dialogue
par: Liu, Ziyi
Publié: (2025)
par: Liu, Ziyi
Publié: (2025)
Resource Consumption Threats in Large Language Models
par: Zhang, Yuanhe, et autres
Publié: (2026)
par: Zhang, Yuanhe, et autres
Publié: (2026)
Discourse Diversity in Multi-Turn Empathic Dialogue
par: Zhan, Hongli, et autres
Publié: (2026)
par: Zhan, Hongli, et autres
Publié: (2026)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2025)
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2025)
A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems
par: Yi, Zihao, et autres
Publié: (2024)
par: Yi, Zihao, et autres
Publié: (2024)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
par: Li, Kenneth, et autres
Publié: (2024)
par: Li, Kenneth, et autres
Publié: (2024)
Inductive-Deductive Strategy Reuse for Multi-Turn Instructional Dialogues
par: Ou, Jiao, et autres
Publié: (2024)
par: Ou, Jiao, et autres
Publié: (2024)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
par: Liu, Junyu, et autres
Publié: (2026)
par: Liu, Junyu, et autres
Publié: (2026)
On the Role of Attention Heads in Large Language Model Safety
par: Zhou, Zhenhong, et autres
Publié: (2024)
par: Zhou, Zhenhong, et autres
Publié: (2024)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
par: Wan, Yanming, et autres
Publié: (2025)
par: Wan, Yanming, et autres
Publié: (2025)
MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols
par: Du, Yuhao, et autres
Publié: (2025)
par: Du, Yuhao, et autres
Publié: (2025)
A Static and Dynamic Attention Framework for Multi Turn Dialogue Generation
par: Zhang, Wei-Nan, et autres
Publié: (2024)
par: Zhang, Wei-Nan, et autres
Publié: (2024)
SOMA: Efficient Multi-turn LLM Serving via Small Language Model
par: Cheng, Xueqi, et autres
Publié: (2026)
par: Cheng, Xueqi, et autres
Publié: (2026)
Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
par: Zhou, Andy, et autres
Publié: (2025)
par: Zhou, Andy, et autres
Publié: (2025)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
par: Yang, Chenghao, et autres
Publié: (2025)
par: Yang, Chenghao, et autres
Publié: (2025)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
par: Ma, Zhiqing, et autres
Publié: (2026)
par: Ma, Zhiqing, et autres
Publié: (2026)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
par: Gibbs, Tom, et autres
Publié: (2024)
par: Gibbs, Tom, et autres
Publié: (2024)
DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models
par: Chen, Kedi, et autres
Publié: (2024)
par: Chen, Kedi, et autres
Publié: (2024)
Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs
par: Sinha, Aditya, et autres
Publié: (2026)
par: Sinha, Aditya, et autres
Publié: (2026)
Documents similaires
-
CORBA: Contagious Recursive Blocking Attacks on Multi-Agent Systems Based on Large Language Models
par: Zhou, Zhenhong, et autres
Publié: (2025) -
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
par: Liu, Zheyuan, et autres
Publié: (2026) -
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
par: Yu, Erxin, et autres
Publié: (2024) -
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
par: Li, Zherui, et autres
Publié: (2025) -
Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue
par: Bhagtani, Kratika, et autres
Publié: (2026)