A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense
Fuente:
arXiv
Salvato in:
| Autore principale: | Zhai, Keke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Recent Advances in Attack and Defense Approaches of Large Language Models
di: Cui, Jing, et al.
Pubblicazione: (2024)
di: Cui, Jing, et al.
Pubblicazione: (2024)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025)
di: Tong, Haibo, et al.
Pubblicazione: (2025)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
di: Chen, Yulong, et al.
Pubblicazione: (2025)
di: Chen, Yulong, et al.
Pubblicazione: (2025)
Dual Defense: Enhancing Privacy and Mitigating Poisoning Attacks in Federated Learning
di: Xu, Runhua, et al.
Pubblicazione: (2025)
di: Xu, Runhua, et al.
Pubblicazione: (2025)
Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks
di: You, Doohee
Pubblicazione: (2026)
di: You, Doohee
Pubblicazione: (2026)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
di: Xu, Yuming, et al.
Pubblicazione: (2026)
di: Xu, Yuming, et al.
Pubblicazione: (2026)
Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language Models
di: Ye, Rui, et al.
Pubblicazione: (2024)
di: Ye, Rui, et al.
Pubblicazione: (2024)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
Attacks and Defenses for Generative Diffusion Models: A Comprehensive Survey
di: Truong, Vu Tuan, et al.
Pubblicazione: (2024)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
di: Pan, Licheng, et al.
Pubblicazione: (2026)
di: Pan, Licheng, et al.
Pubblicazione: (2026)
Intellectual Property in Graph-Based Machine Learning as a Service: Attacks and Defenses
di: Li, Lincan, et al.
Pubblicazione: (2025)
di: Li, Lincan, et al.
Pubblicazione: (2025)
Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems
di: Balashov, Andrii, et al.
Pubblicazione: (2025)
di: Balashov, Andrii, et al.
Pubblicazione: (2025)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
di: Li, Xurui, et al.
Pubblicazione: (2025)
di: Li, Xurui, et al.
Pubblicazione: (2025)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
di: Song, Weiming, et al.
Pubblicazione: (2026)
di: Song, Weiming, et al.
Pubblicazione: (2026)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
A Critical Evaluation of Defenses against Prompt Injection Attacks
di: Jia, Yuqi, et al.
Pubblicazione: (2025)
di: Jia, Yuqi, et al.
Pubblicazione: (2025)
The Attack and Defense Landscape of Agentic AI: A Comprehensive Survey
di: Kim, Juhee, et al.
Pubblicazione: (2026)
di: Kim, Juhee, et al.
Pubblicazione: (2026)
Investigating the Impact of Quantization Methods on the Safety and Reliability of Large Language Models
di: Kharinaev, Artyom, et al.
Pubblicazione: (2025)
di: Kharinaev, Artyom, et al.
Pubblicazione: (2025)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
di: Liu, Shuyuan, et al.
Pubblicazione: (2025)
di: Liu, Shuyuan, et al.
Pubblicazione: (2025)
Defenses Against Prompt Attacks Learn Surface Heuristics
di: Li, Shawn, et al.
Pubblicazione: (2026)
di: Li, Shawn, et al.
Pubblicazione: (2026)
Exploring Backdoor Attack and Defense for LLM-empowered Recommendations
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
di: Jha, Pranav K
Pubblicazione: (2025)
di: Jha, Pranav K
Pubblicazione: (2025)
Behavior-Aware and Generalizable Defense Against Black-Box Adversarial Attacks for ML-Based IDS
di: Ennaji, Sabrine, et al.
Pubblicazione: (2025)
di: Ennaji, Sabrine, et al.
Pubblicazione: (2025)
MLLMGuard: A Multi-dimensional Safety Evaluation Suite for Multimodal Large Language Models
di: Gu, Tianle, et al.
Pubblicazione: (2024)
di: Gu, Tianle, et al.
Pubblicazione: (2024)
Evaluation of Prompt Injection Defenses in Large Language Models
di: Deep, Priyal, et al.
Pubblicazione: (2026)
di: Deep, Priyal, et al.
Pubblicazione: (2026)
Enhancing O-RAN Security: Evasion Attacks and Robust Defenses for Graph Reinforcement Learning-based Connection Management
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2024)
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2024)
Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs
di: Yeo, Andrew, et al.
Pubblicazione: (2025)
di: Yeo, Andrew, et al.
Pubblicazione: (2025)
HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense
di: Li, Siyuan, et al.
Pubblicazione: (2026)
di: Li, Siyuan, et al.
Pubblicazione: (2026)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Recent Advances in Attack and Defense Approaches of Large Language Models
di: Cui, Jing, et al.
Pubblicazione: (2024) -
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
di: Yang, Xianglin, et al.
Pubblicazione: (2025) -
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024) -
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025) -
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
di: Zhou, Yihe, et al.
Pubblicazione: (2025)