Salvato in:
| Autori principali: | Truong, Vu Tuan, Dang, Luan Ba, Le, Long Bao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2408.03400 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026)
Enhancing Security in Deep Reinforcement Learning: A Comprehensive Survey on Adversarial Attacks and Defenses
di: Yichao, Wu, et al.
Pubblicazione: (2025)
di: Yichao, Wu, et al.
Pubblicazione: (2025)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
A Survey of Model Extraction Attacks and Defenses in Distributed Computing Environments
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
A Systematic Survey of Model Extraction Attacks and Defenses: State-of-the-Art and Perspectives
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Attacks and Defenses Against LLM Fingerprinting
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
di: Pan, Licheng, et al.
Pubblicazione: (2026)
di: Pan, Licheng, et al.
Pubblicazione: (2026)
Optimal Defenses Against Gradient Reconstruction Attacks
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
Stealthy Poisoning Attacks Bypass Defenses in Regression Settings
di: Carnerero-Cano, Javier, et al.
Pubblicazione: (2026)
di: Carnerero-Cano, Javier, et al.
Pubblicazione: (2026)
SoK: Benchmarking Poisoning Attacks and Defenses in Federated Learning
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
di: Zhang, Heyi, et al.
Pubblicazione: (2025)
Backdoor Vectors: a Task Arithmetic View on Backdoor Attacks and Defenses
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems
di: Thornton, Scott
Pubblicazione: (2026)
di: Thornton, Scott
Pubblicazione: (2026)
LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks
di: Panebianco, Francesco, et al.
Pubblicazione: (2025)
di: Panebianco, Francesco, et al.
Pubblicazione: (2025)
A Survey of Privacy Threats and Defense in Vertical Federated Learning: From Model Life Cycle Perspective
di: Yu, Lei, et al.
Pubblicazione: (2024)
di: Yu, Lei, et al.
Pubblicazione: (2024)
Defending the Edge: Representative-Attention Defense against Backdoor Attacks in Federated Learning
di: Obioma, Chibueze Peace, et al.
Pubblicazione: (2025)
di: Obioma, Chibueze Peace, et al.
Pubblicazione: (2025)
The Attack and Defense Landscape of Agentic AI: A Comprehensive Survey
di: Kim, Juhee, et al.
Pubblicazione: (2026)
di: Kim, Juhee, et al.
Pubblicazione: (2026)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
di: Jiang, Weisen, et al.
Pubblicazione: (2025)
di: Jiang, Weisen, et al.
Pubblicazione: (2025)
Real-world Adversarial Defense against Patch Attacks based on Diffusion Model
di: Wei, Xingxing, et al.
Pubblicazione: (2024)
di: Wei, Xingxing, et al.
Pubblicazione: (2024)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
di: Liu, Yupei, et al.
Pubblicazione: (2023)
di: Liu, Yupei, et al.
Pubblicazione: (2023)
A Survey of Privacy-Preserving Model Explanations: Privacy Risks, Attacks, and Countermeasures
di: Nguyen, Thanh Tam, et al.
Pubblicazione: (2024)
di: Nguyen, Thanh Tam, et al.
Pubblicazione: (2024)
DIFFender: Diffusion-Based Adversarial Defense against Patch Attacks
di: Kang, Caixin, et al.
Pubblicazione: (2023)
di: Kang, Caixin, et al.
Pubblicazione: (2023)
Diffusion-Driven Synthetic Tabular Data Generation for Enhanced DoS/DDoS Attack Classification
di: B, Aravind, et al.
Pubblicazione: (2026)
di: B, Aravind, et al.
Pubblicazione: (2026)
AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective
di: Wang, Zhenyi, et al.
Pubblicazione: (2026)
di: Wang, Zhenyi, et al.
Pubblicazione: (2026)
A Comprehensive Study of Supervised Machine Learning Models for Zero-Day Attack Detection: Analyzing Performance on Imbalanced Data
di: Lotfi, Zahra, et al.
Pubblicazione: (2025)
di: Lotfi, Zahra, et al.
Pubblicazione: (2025)
LaFA: Latent Feature Attacks on Non-negative Matrix Factorization
di: Vu, Minh, et al.
Pubblicazione: (2024)
di: Vu, Minh, et al.
Pubblicazione: (2024)
PureGen: Universal Data Purification for Train-Time Poison Defense via Generative Model Dynamics
di: Bhat, Sunay, et al.
Pubblicazione: (2024)
di: Bhat, Sunay, et al.
Pubblicazione: (2024)
Thought Purity: A Defense Framework For Chain-of-Thought Attack
di: Xue, Zihao, et al.
Pubblicazione: (2025)
di: Xue, Zihao, et al.
Pubblicazione: (2025)
UIFV: Data Reconstruction Attack in Vertical Federated Learning
di: Yang, Jirui, et al.
Pubblicazione: (2024)
di: Yang, Jirui, et al.
Pubblicazione: (2024)
RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse
di: Liu, Mingrui, et al.
Pubblicazione: (2026)
di: Liu, Mingrui, et al.
Pubblicazione: (2026)
How Does a Deep Learning Model Architecture Impact Its Privacy? A Comprehensive Study of Privacy Attacks on CNNs and Transformers
di: Zhang, Guangsheng, et al.
Pubblicazione: (2022)
di: Zhang, Guangsheng, et al.
Pubblicazione: (2022)
Winning the MIDST Challenge: New Membership Inference Attacks on Diffusion Models for Tabular Data Synthesis
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
Disrupting Model Merging: A Parameter-Level Defense Without Sacrificing Accuracy
di: Junhao, Wei, et al.
Pubblicazione: (2025)
di: Junhao, Wei, et al.
Pubblicazione: (2025)
LoRID: Low-Rank Iterative Diffusion for Adversarial Purification
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2024)
di: Zollicoffer, Geigh, et al.
Pubblicazione: (2024)
Large Language Models in Cybersecurity: Applications, Vulnerabilities, and Defense Techniques
di: Jaffal, Niveen O., et al.
Pubblicazione: (2025)
di: Jaffal, Niveen O., et al.
Pubblicazione: (2025)
Twin Auto-Encoder Model for Learning Separable Representation in Cyberattack Detection
di: Dinh, Phai Vu, et al.
Pubblicazione: (2024)
di: Dinh, Phai Vu, et al.
Pubblicazione: (2024)
LLM Security: Vulnerabilities, Attacks, Defenses, and Countermeasures
di: Aguilera-Martínez, Francisco, et al.
Pubblicazione: (2025)
di: Aguilera-Martínez, Francisco, et al.
Pubblicazione: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
di: Truong, Vu Tuan, et al.
Pubblicazione: (2026) -
Enhancing Security in Deep Reinforcement Learning: A Comprehensive Survey on Adversarial Attacks and Defenses
di: Yichao, Wu, et al.
Pubblicazione: (2025) -
A Survey on Model Extraction Attacks and Defenses for Large Language Models
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025) -
A Survey of Model Extraction Attacks and Defenses in Distributed Computing Environments
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025) -
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)