Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Xiongtao, Zhang, Deyue, Yang, Dongdong, Zou, Quanchen, Li, Hui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
par: Ma, Zhiqing, et autres
Publié: (2026)
par: Ma, Zhiqing, et autres
Publié: (2026)
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
par: Xu, Wenzhuo, et autres
Publié: (2025)
par: Xu, Wenzhuo, et autres
Publié: (2025)
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
par: Xu, Wenzhuo, et autres
Publié: (2026)
par: Xu, Wenzhuo, et autres
Publié: (2026)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
par: Gibbs, Tom, et autres
Publié: (2024)
par: Gibbs, Tom, et autres
Publié: (2024)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)
par: Mu, Junjie, et autres
Publié: (2025)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
par: Zhou, Guanghao, et autres
Publié: (2025)
par: Zhou, Guanghao, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
Many-Turn Jailbreaking
par: Yang, Xianjun, et autres
Publié: (2025)
par: Yang, Xianjun, et autres
Publié: (2025)
Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
par: Zhou, Andy, et autres
Publié: (2025)
par: Zhou, Andy, et autres
Publié: (2025)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
par: Nihal, Ragib Amin, et autres
Publié: (2025)
par: Nihal, Ragib Amin, et autres
Publié: (2025)
Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
par: Bisconti, Piercosma, et autres
Publié: (2025)
par: Bisconti, Piercosma, et autres
Publié: (2025)
Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
par: Zou, Qingsong, et autres
Publié: (2025)
par: Zou, Qingsong, et autres
Publié: (2025)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
par: Yung, Canaan, et autres
Publié: (2024)
par: Yung, Canaan, et autres
Publié: (2024)
Is the System Message Really Important to Jailbreaks in Large Language Models?
par: Zou, Xiaotian, et autres
Publié: (2024)
par: Zou, Xiaotian, et autres
Publié: (2024)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
par: Reddy, Aashray, et autres
Publié: (2025)
par: Reddy, Aashray, et autres
Publié: (2025)
SPRI: Aligning Large Language Models with Context-Situated Principles
par: Zhan, Hongli, et autres
Publié: (2025)
par: Zhan, Hongli, et autres
Publié: (2025)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks
par: Cheng, Yixin, et autres
Publié: (2024)
par: Cheng, Yixin, et autres
Publié: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
par: Yang, Fan
Publié: (2025)
par: Yang, Fan
Publié: (2025)
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
par: Lin, Zizhuo, et autres
Publié: (2026)
par: Lin, Zizhuo, et autres
Publié: (2026)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations
par: Lei, Yiming, et autres
Publié: (2025)
par: Lei, Yiming, et autres
Publié: (2025)
ReviewInstruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Models
par: Wu, Jiangxu, et autres
Publié: (2025)
par: Wu, Jiangxu, et autres
Publié: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
par: Kang, Choongwon, et autres
Publié: (2026)
par: Kang, Choongwon, et autres
Publié: (2026)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
par: Feng, Bo-Han, et autres
Publié: (2026)
par: Feng, Bo-Han, et autres
Publié: (2026)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Documents similaires
-
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025) -
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
par: Ma, Zhiqing, et autres
Publié: (2026) -
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
par: Xu, Wenzhuo, et autres
Publié: (2025) -
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
par: Xu, Wenzhuo, et autres
Publié: (2026) -
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
par: Zhou, Yue, et autres
Publié: (2024)