Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks
Fuente:
arXiv
Guardado en:
| Autor principal: | You, Doohee |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
por: Tong, Haibo, et al.
Publicado: (2025)
por: Tong, Haibo, et al.
Publicado: (2025)
Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs
por: Yeo, Andrew, et al.
Publicado: (2025)
por: Yeo, Andrew, et al.
Publicado: (2025)
CivicShield: A Cross-Domain Defense-in-Depth Framework for Securing Government-Facing AI Chatbots Against Multi-Turn Adversarial Attacks
por: Patil, KrishnaSaiReddy
Publicado: (2026)
por: Patil, KrishnaSaiReddy
Publicado: (2026)
ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack
por: Lin, Xingwei, et al.
Publicado: (2026)
por: Lin, Xingwei, et al.
Publicado: (2026)
Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection
por: Kulkarni, Prashant
Publicado: (2026)
por: Kulkarni, Prashant
Publicado: (2026)
MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
por: Zhang, Xinkai, et al.
Publicado: (2026)
por: Zhang, Xinkai, et al.
Publicado: (2026)
Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
por: Russinovich, Mark, et al.
Publicado: (2024)
por: Russinovich, Mark, et al.
Publicado: (2024)
Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security
por: Dai, Muzhi, et al.
Publicado: (2025)
por: Dai, Muzhi, et al.
Publicado: (2025)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
por: Narula, Sidhant, et al.
Publicado: (2025)
por: Narula, Sidhant, et al.
Publicado: (2025)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
por: Shen, Xinjie, et al.
Publicado: (2026)
por: Shen, Xinjie, et al.
Publicado: (2026)
A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense
por: Zhai, Keke
Publicado: (2024)
por: Zhai, Keke
Publicado: (2024)
Defenses Against Prompt Attacks Learn Surface Heuristics
por: Li, Shawn, et al.
Publicado: (2026)
por: Li, Shawn, et al.
Publicado: (2026)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
por: Liu, Ziyao, et al.
Publicado: (2024)
por: Liu, Ziyao, et al.
Publicado: (2024)
Exploring Backdoor Attack and Defense for LLM-empowered Recommendations
por: Ning, Liangbo, et al.
Publicado: (2025)
por: Ning, Liangbo, et al.
Publicado: (2025)
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
por: Jha, Pranav K
Publicado: (2025)
por: Jha, Pranav K
Publicado: (2025)
Turning Generative Models Degenerate: The Power of Data Poisoning Attacks
por: Jiang, Shuli, et al.
Publicado: (2024)
por: Jiang, Shuli, et al.
Publicado: (2024)
Unseen Attack Detection in Software-Defined Networking Using a BERT-Based Large Language Model
por: Swileh, Mohammed N., et al.
Publicado: (2024)
por: Swileh, Mohammed N., et al.
Publicado: (2024)
The Attack and Defense Landscape of Agentic AI: A Comprehensive Survey
por: Kim, Juhee, et al.
Publicado: (2026)
por: Kim, Juhee, et al.
Publicado: (2026)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
por: Shang, Zhengchun, et al.
Publicado: (2025)
por: Shang, Zhengchun, et al.
Publicado: (2025)
Recent Advances in Attack and Defense Approaches of Large Language Models
por: Cui, Jing, et al.
Publicado: (2024)
por: Cui, Jing, et al.
Publicado: (2024)
A Critical Evaluation of Defenses against Prompt Injection Attacks
por: Jia, Yuqi, et al.
Publicado: (2025)
por: Jia, Yuqi, et al.
Publicado: (2025)
Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models
por: Wen, Jinming, et al.
Publicado: (2025)
por: Wen, Jinming, et al.
Publicado: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
por: Gibbs, Tom, et al.
Publicado: (2024)
por: Gibbs, Tom, et al.
Publicado: (2024)
FedSecurity: Benchmarking Attacks and Defenses in Federated Learning and Federated LLMs
por: Han, Shanshan, et al.
Publicado: (2023)
por: Han, Shanshan, et al.
Publicado: (2023)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
por: Liu, Xiaoqun, et al.
Publicado: (2024)
por: Liu, Xiaoqun, et al.
Publicado: (2024)
Dual Defense: Enhancing Privacy and Mitigating Poisoning Attacks in Federated Learning
por: Xu, Runhua, et al.
Publicado: (2025)
por: Xu, Runhua, et al.
Publicado: (2025)
AMDS: Attack-Aware Multi-Stage Defense System for Network Intrusion Detection with Two-Stage Adaptive Weight Learning
por: Olukola, Oluseyi, et al.
Publicado: (2026)
por: Olukola, Oluseyi, et al.
Publicado: (2026)
Transient Turn Injection: Exposing Stateless Multi-Turn Vulnerabilities in Large Language Models
por: Rayhan, Naheed, et al.
Publicado: (2026)
por: Rayhan, Naheed, et al.
Publicado: (2026)
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
por: Xu, Yuming, et al.
Publicado: (2026)
por: Xu, Yuming, et al.
Publicado: (2026)
SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks
por: Sivaroopan, Nirhoshan, et al.
Publicado: (2026)
por: Sivaroopan, Nirhoshan, et al.
Publicado: (2026)
MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents
por: Zhu, Kaijie, et al.
Publicado: (2025)
por: Zhu, Kaijie, et al.
Publicado: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
TED-LaST: Towards Robust Backdoor Defense Against Adaptive Attacks
por: Mo, Xiaoxing, et al.
Publicado: (2025)
por: Mo, Xiaoxing, et al.
Publicado: (2025)
Intellectual Property in Graph-Based Machine Learning as a Service: Attacks and Defenses
por: Li, Lincan, et al.
Publicado: (2025)
por: Li, Lincan, et al.
Publicado: (2025)
Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
por: Fu, Haowei, et al.
Publicado: (2025)
por: Fu, Haowei, et al.
Publicado: (2025)
Data Duplication: A Novel Multi-Purpose Attack Paradigm in Machine Unlearning
por: Ye, Dayong, et al.
Publicado: (2025)
por: Ye, Dayong, et al.
Publicado: (2025)
The Echo Chamber Multi-Turn LLM Jailbreak
por: Alobaid, Ahmad, et al.
Publicado: (2026)
por: Alobaid, Ahmad, et al.
Publicado: (2026)
SOK: A Taxonomy of Attack Vectors and Defense Strategies for Agentic Supply Chain Runtime
por: Jiang, Xiaochong, et al.
Publicado: (2026)
por: Jiang, Xiaochong, et al.
Publicado: (2026)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
por: Li, Xiaohu, et al.
Publicado: (2025)
por: Li, Xiaohu, et al.
Publicado: (2025)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
por: Zhou, Yihe, et al.
Publicado: (2025)
por: Zhou, Yihe, et al.
Publicado: (2025)
Ejemplares similares
-
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
por: Tong, Haibo, et al.
Publicado: (2025) -
Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs
por: Yeo, Andrew, et al.
Publicado: (2025) -
CivicShield: A Cross-Domain Defense-in-Depth Framework for Securing Government-Facing AI Chatbots Against Multi-Turn Adversarial Attacks
por: Patil, KrishnaSaiReddy
Publicado: (2026) -
ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack
por: Lin, Xingwei, et al.
Publicado: (2026) -
Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection
por: Kulkarni, Prashant
Publicado: (2026)