Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Zixuan, Huang, Kecheng, Yin, Lihao, He, Bowei, Zhen, Huiling, Yuan, Mingxuan, Shao, Zili |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
di: Huang, Zixuan, et al.
Pubblicazione: (2026)
Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
di: He, Bowei, et al.
Pubblicazione: (2025)
di: He, Bowei, et al.
Pubblicazione: (2025)
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
di: He, Bowei, et al.
Pubblicazione: (2025)
di: He, Bowei, et al.
Pubblicazione: (2025)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
di: Rahman, Salman, et al.
Pubblicazione: (2025)
di: Rahman, Salman, et al.
Pubblicazione: (2025)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
Certifying Language Model Robustness with Fuzzed Randomized Smoothing: An Efficient Defense Against Backdoor Attacks
di: He, Bowei, et al.
Pubblicazione: (2025)
di: He, Bowei, et al.
Pubblicazione: (2025)
DiLA: Enhancing LLM Tool Learning with Differential Logic Layer
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks
di: Siska, Charlotte, et al.
Pubblicazione: (2025)
di: Siska, Charlotte, et al.
Pubblicazione: (2025)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
di: Ma, Zhiqing, et al.
Pubblicazione: (2026)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
di: Jiang, Yifan, et al.
Pubblicazione: (2024)
di: Jiang, Yifan, et al.
Pubblicazione: (2024)
What Matters For Safety Alignment?
di: Li, Xing, et al.
Pubblicazione: (2026)
di: Li, Xing, et al.
Pubblicazione: (2026)
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
Why Attention Patterns Exist: A Unifying Temporal Perspective Analysis
di: Yang, Qingyue, et al.
Pubblicazione: (2026)
di: Yang, Qingyue, et al.
Pubblicazione: (2026)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
di: Li, Yucheng, et al.
Pubblicazione: (2025)
di: Li, Yucheng, et al.
Pubblicazione: (2025)
Proactive defense against LLM Jailbreak
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
Many-Turn Jailbreaking
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
di: Yang, Xianjun, et al.
Pubblicazione: (2025)
ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
di: Shen, Xinjie, et al.
Pubblicazione: (2026)
di: Shen, Xinjie, et al.
Pubblicazione: (2026)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
di: Feng, Mingqian, et al.
Pubblicazione: (2026)
Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs
di: Liu, Yize, et al.
Pubblicazione: (2025)
di: Liu, Yize, et al.
Pubblicazione: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
di: Cheng, Zehua, et al.
Pubblicazione: (2026)
History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks
di: Wang, Yanshu, et al.
Pubblicazione: (2026)
di: Wang, Yanshu, et al.
Pubblicazione: (2026)
Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction
di: Bao, Han, et al.
Pubblicazione: (2026)
di: Bao, Han, et al.
Pubblicazione: (2026)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
di: Long, Zhuohang, et al.
Pubblicazione: (2025)
di: Long, Zhuohang, et al.
Pubblicazione: (2025)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
di: Shen, Guobin, et al.
Pubblicazione: (2025)
di: Shen, Guobin, et al.
Pubblicazione: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
di: Weng, Zixuan, et al.
Pubblicazione: (2025)
di: Weng, Zixuan, et al.
Pubblicazione: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
di: Priyanshu, Aman, et al.
Pubblicazione: (2024)
LoopServe: An Adaptive Dual-phase LLM Inference Acceleration System for Multi-Turn Dialogues
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Sens-Merging: Sensitivity-Guided Parameter Balancing for Merging Large Language Models
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
di: Yankun, Hong, et al.
Pubblicazione: (2025)
di: Yankun, Hong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts
di: Huang, Zixuan, et al.
Pubblicazione: (2026) -
Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
di: He, Bowei, et al.
Pubblicazione: (2025) -
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
di: He, Bowei, et al.
Pubblicazione: (2025) -
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
di: Li, Nathaniel, et al.
Pubblicazione: (2024) -
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)