One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Xinjie, Wei, Rongzhe, Niu, Peizhi, Wang, Haoyu, Wu, Ruihan, Chien, Eli, Li, Bo, Chen, Pin-Yu, Li, Pan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
by: Wei, Rongzhe, et al.
Published: (2025)
by: Wei, Rongzhe, et al.
Published: (2025)
Moltbook Moderation: Uncovering Hidden Intent Through Multi-Turn Dialogue
by: Al-Lawati, Ali, et al.
Published: (2026)
by: Al-Lawati, Ali, et al.
Published: (2026)
Differentially Private Graph Diffusion with Applications in Personalized PageRanks
by: Wei, Rongzhe, et al.
Published: (2024)
by: Wei, Rongzhe, et al.
Published: (2024)
Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness
by: Wei, Rongzhe, et al.
Published: (2025)
by: Wei, Rongzhe, et al.
Published: (2025)
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
by: Lang, Hao, et al.
Published: (2023)
by: Lang, Hao, et al.
Published: (2023)
Privately Learning from Graphs with Applications in Fine-tuning Large Language Models
by: Yin, Haoteng, et al.
Published: (2024)
by: Yin, Haoteng, et al.
Published: (2024)
From Intents to Conversations: Generating Intent-Driven Dialogues with Contrastive Learning for Multi-Turn Classification
by: Liu, Junhua, et al.
Published: (2024)
by: Liu, Junhua, et al.
Published: (2024)
Differentially Private Relational Learning with Entity-level Privacy Guarantees
by: Huang, Yinan, et al.
Published: (2025)
by: Huang, Yinan, et al.
Published: (2025)
Why Companies Turn Too Late: Strategic Inertia from Startup to Scale-Up
by: Huang, Qien
Published: (2026)
by: Huang, Qien
Published: (2026)
MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?
by: Wahed, Muntasir, et al.
Published: (2025)
by: Wahed, Muntasir, et al.
Published: (2025)
Graph Transductive Defense: a Two-Stage Defense for Graph Membership Inference Attacks
by: Niu, Peizhi, et al.
Published: (2024)
by: Niu, Peizhi, et al.
Published: (2024)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
by: Tong, Haibo, et al.
Published: (2025)
by: Tong, Haibo, et al.
Published: (2025)
On the Inherent Privacy Properties of Discrete Denoising Diffusion Models
by: Wei, Rongzhe, et al.
Published: (2023)
by: Wei, Rongzhe, et al.
Published: (2023)
Intent Aware Context Retrieval for Multi-Turn Agricultural Question Answering
by: Vijayvargia, Abhay, et al.
Published: (2025)
by: Vijayvargia, Abhay, et al.
Published: (2025)
Discourse Diversity in Multi-Turn Empathic Dialogue
by: Zhan, Hongli, et al.
Published: (2026)
by: Zhan, Hongli, et al.
Published: (2026)
Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions
by: Sachdeva, Rachneet, et al.
Published: (2025)
by: Sachdeva, Rachneet, et al.
Published: (2025)
From Myopic Selection to Long-Horizon Awareness: Sequential LLM Routing for Multi-Turn Dialogue
by: Zhang, Jiarui, et al.
Published: (2026)
by: Zhang, Jiarui, et al.
Published: (2026)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
by: Wang, Jian, et al.
Published: (2025)
by: Wang, Jian, et al.
Published: (2025)
Privacy Amplification in Differentially Private Zeroth-Order Optimization with Hidden States
by: Chien, Eli, et al.
Published: (2025)
by: Chien, Eli, et al.
Published: (2025)
Model Generalization on Text Attribute Graphs: Principles with Large Language Models
by: Wang, Haoyu, et al.
Published: (2025)
by: Wang, Haoyu, et al.
Published: (2025)
Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
by: Li, Guojian, et al.
Published: (2025)
by: Li, Guojian, et al.
Published: (2025)
InfoQuest: Evaluating Multi-Turn Dialogue Agents for Open-Ended Conversations with Hidden Context
by: de Oliveira, Bryan L. M., et al.
Published: (2025)
by: de Oliveira, Bryan L. M., et al.
Published: (2025)
Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
by: Li, Xu, et al.
Published: (2026)
by: Li, Xu, et al.
Published: (2026)
EthicMind: A Risk-Aware Framework for Ethical-Emotional Alignment in Multi-Turn Dialogue
by: Deng, Jiawen, et al.
Published: (2026)
by: Deng, Jiawen, et al.
Published: (2026)
Syn-TurnTurk: A Synthetic Dataset for Turn-Taking Prediction in Turkish Dialogues
by: Bayrak, Ahmet Tuğrul, et al.
Published: (2026)
by: Bayrak, Ahmet Tuğrul, et al.
Published: (2026)
JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systems
by: Yang, Guangzhao, et al.
Published: (2026)
by: Yang, Guangzhao, et al.
Published: (2026)
Confidence Should Be Calibrated More Than One Turn Deep
by: Zhang, Zhaohan, et al.
Published: (2026)
by: Zhang, Zhaohan, et al.
Published: (2026)
Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialogue
by: Bhagtani, Kratika, et al.
Published: (2026)
by: Bhagtani, Kratika, et al.
Published: (2026)
OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations
by: Chen, Jiangwang, et al.
Published: (2026)
by: Chen, Jiangwang, et al.
Published: (2026)
Dual Attention Guided Defense Against Malicious Edits
by: Zhang, Jie, et al.
Published: (2025)
by: Zhang, Jie, et al.
Published: (2025)
Towards Transferable Defense Against Malicious Image Edits
by: Zhang, Jie, et al.
Published: (2025)
by: Zhang, Jie, et al.
Published: (2025)
Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
by: Shen, Xinjie, et al.
Published: (2025)
by: Shen, Xinjie, et al.
Published: (2025)
One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries
by: Zloczower, Itay, et al.
Published: (2026)
by: Zloczower, Itay, et al.
Published: (2026)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
by: Li, Nathaniel, et al.
Published: (2024)
by: Li, Nathaniel, et al.
Published: (2024)
ACR: Adaptive Context Refactoring via Context Refactoring Operators for Multi-Turn Dialogue
by: Shen, Jiawei, et al.
Published: (2026)
by: Shen, Jiawei, et al.
Published: (2026)
Langevin Unlearning: A New Perspective of Noisy Gradient Descent for Machine Unlearning
by: Chien, Eli, et al.
Published: (2024)
by: Chien, Eli, et al.
Published: (2024)
Certified Machine Unlearning via Noisy Stochastic Gradient Descent
by: Chien, Eli, et al.
Published: (2024)
by: Chien, Eli, et al.
Published: (2024)
Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
by: Li, Junbo, et al.
Published: (2025)
by: Li, Junbo, et al.
Published: (2025)
Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction
by: Wang, Haoyu, et al.
Published: (2026)
by: Wang, Haoyu, et al.
Published: (2026)
Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak
by: Huang, Zixuan, et al.
Published: (2025)
by: Huang, Zixuan, et al.
Published: (2025)
Similar Items
-
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
by: Wei, Rongzhe, et al.
Published: (2025) -
Moltbook Moderation: Uncovering Hidden Intent Through Multi-Turn Dialogue
by: Al-Lawati, Ali, et al.
Published: (2026) -
Differentially Private Graph Diffusion with Applications in Personalized PageRanks
by: Wei, Rongzhe, et al.
Published: (2024) -
Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness
by: Wei, Rongzhe, et al.
Published: (2025) -
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
by: Lang, Hao, et al.
Published: (2023)