Recent Advances in Attack and Defense Approaches of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Jing, Xu, Yishi, Huang, Zhewei, Zhou, Shuchang, Jiao, Jianbin, Zhang, Junge |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
di: Cui, Jing, et al.
Pubblicazione: (2025)
di: Cui, Jing, et al.
Pubblicazione: (2025)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
Adversarial Attacks and Defenses on Graph-aware Large Language Models (LLMs)
di: Olatunji, Iyiola E., et al.
Pubblicazione: (2025)
di: Olatunji, Iyiola E., et al.
Pubblicazione: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
PR-Attack: Coordinated Prompt-RAG Attacks on Retrieval-Augmented Generation in Large Language Models via Bilevel Optimization
di: Jiao, Yang, et al.
Pubblicazione: (2025)
di: Jiao, Yang, et al.
Pubblicazione: (2025)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
A Survey of Attacks on Large Language Models
di: Xu, Wenrui, et al.
Pubblicazione: (2025)
di: Xu, Wenrui, et al.
Pubblicazione: (2025)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
di: Chen, Yulong, et al.
Pubblicazione: (2025)
di: Chen, Yulong, et al.
Pubblicazione: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Evaluation of Prompt Injection Defenses in Large Language Models
di: Deep, Priyal, et al.
Pubblicazione: (2026)
di: Deep, Priyal, et al.
Pubblicazione: (2026)
Automating Prompt Leakage Attacks on Large Language Models Using Agentic Approach
di: Sternak, Tvrtko, et al.
Pubblicazione: (2025)
di: Sternak, Tvrtko, et al.
Pubblicazione: (2025)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
di: Wang, Youze, et al.
Pubblicazione: (2025)
di: Wang, Youze, et al.
Pubblicazione: (2025)
A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense
di: Zhai, Keke
Pubblicazione: (2024)
di: Zhai, Keke
Pubblicazione: (2024)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
Membership Inference Attacks on Tokenizers of Large Language Models
di: Tong, Meng, et al.
Pubblicazione: (2025)
di: Tong, Meng, et al.
Pubblicazione: (2025)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
di: Xu, Yuming, et al.
Pubblicazione: (2026)
di: Xu, Yuming, et al.
Pubblicazione: (2026)
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
di: Li, Xi, et al.
Pubblicazione: (2024)
di: Li, Xi, et al.
Pubblicazione: (2024)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
di: Guan, Shaowei, et al.
Pubblicazione: (2025)
Dual Defense: Enhancing Privacy and Mitigating Poisoning Attacks in Federated Learning
di: Xu, Runhua, et al.
Pubblicazione: (2025)
di: Xu, Runhua, et al.
Pubblicazione: (2025)
Large Language Models Merging for Enhancing the Link Stealing Attack on Graph Neural Networks
di: Guan, Faqian, et al.
Pubblicazione: (2024)
di: Guan, Faqian, et al.
Pubblicazione: (2024)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
di: Li, Yuetai, et al.
Pubblicazione: (2024)
di: Li, Yuetai, et al.
Pubblicazione: (2024)
Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework
di: Onitiju, Taiwo, et al.
Pubblicazione: (2026)
di: Onitiju, Taiwo, et al.
Pubblicazione: (2026)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
FedSecurity: Benchmarking Attacks and Defenses in Federated Learning and Federated LLMs
di: Han, Shanshan, et al.
Pubblicazione: (2023)
di: Han, Shanshan, et al.
Pubblicazione: (2023)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)
di: Park, Junyoung, et al.
Pubblicazione: (2026)
Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
di: Fu, Haowei, et al.
Pubblicazione: (2025)
di: Fu, Haowei, et al.
Pubblicazione: (2025)
Threats, Attacks, and Defenses in Machine Unlearning: A Survey
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
di: Liu, Ziyao, et al.
Pubblicazione: (2024)
Defenses Against Prompt Attacks Learn Surface Heuristics
di: Li, Shawn, et al.
Pubblicazione: (2026)
di: Li, Shawn, et al.
Pubblicazione: (2026)
Exploring Backdoor Attack and Defense for LLM-empowered Recommendations
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
di: Jha, Pranav K
Pubblicazione: (2025)
di: Jha, Pranav K
Pubblicazione: (2025)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
di: Teng, Ma, et al.
Pubblicazione: (2024)
di: Teng, Ma, et al.
Pubblicazione: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
AttacKG+:Boosting Attack Knowledge Graph Construction with Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2024)
di: Zhang, Yongheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
di: Cui, Jing, et al.
Pubblicazione: (2025) -
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024) -
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
di: Zhou, Yihe, et al.
Pubblicazione: (2025) -
Adversarial Attacks and Defenses on Graph-aware Large Language Models (LLMs)
di: Olatunji, Iyiola E., et al.
Pubblicazione: (2025)