A Framework for Rapidly Developing and Deploying Protection Against Large Language Model Attacks
Fuente:
arXiv
Saved in:
| Main Authors: | Swanda, Adam, Chang, Amy, Chen, Alexander, Burch, Fraser, Kassianik, Paul, Berlin, Konstantin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cisco Integrated AI Security and Safety Framework Report
by: Chang, Amy, et al.
Published: (2025)
by: Chang, Amy, et al.
Published: (2025)
Llama-3.1-FoundationAI-SecurityLLM-Base-8B Technical Report
by: Kassianik, Paul, et al.
Published: (2025)
by: Kassianik, Paul, et al.
Published: (2025)
LLM Cyber Evaluations Don't Capture Real-World Risk
by: Lukošiūtė, Kamilė, et al.
Published: (2025)
by: Lukošiūtė, Kamilė, et al.
Published: (2025)
Death by a Thousand Prompts: Open Model Vulnerability Analysis
by: Chang, Amy, et al.
Published: (2025)
by: Chang, Amy, et al.
Published: (2025)
Membership Inference Attacks Against Vision-Language Models
by: Hu, Yuke, et al.
Published: (2025)
by: Hu, Yuke, et al.
Published: (2025)
Extracting Memorized Training Data via Decomposition
by: Su, Ellen, et al.
Published: (2024)
by: Su, Ellen, et al.
Published: (2024)
Theoretically Unmasking Inference Attacks Against LDP-Protected Clients in Federated Vision Models
by: Nguyen, Quan, et al.
Published: (2025)
by: Nguyen, Quan, et al.
Published: (2025)
To Protect the LLM Agent Against the Prompt Injection Attack with Polymorphic Prompt
by: Wang, Zhilong, et al.
Published: (2025)
by: Wang, Zhilong, et al.
Published: (2025)
FIDELIS: Blockchain-Enabled Protection Against Poisoning Attacks in Federated Learning
by: Carney, Jane, et al.
Published: (2025)
by: Carney, Jane, et al.
Published: (2025)
Capability-Based Scaling Trends for LLM-Based Red-Teaming
by: Panfilov, Alexander, et al.
Published: (2025)
by: Panfilov, Alexander, et al.
Published: (2025)
Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
by: Guo, Qiming, et al.
Published: (2025)
by: Guo, Qiming, et al.
Published: (2025)
Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
by: Chang, Chen-Wei, et al.
Published: (2025)
by: Chang, Chen-Wei, et al.
Published: (2025)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
by: Chen, Yuetian, et al.
Published: (2026)
by: Chen, Yuetian, et al.
Published: (2026)
Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
by: Weerawardhena, Sajana, et al.
Published: (2025)
by: Weerawardhena, Sajana, et al.
Published: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
by: Zhao, Jiawei, et al.
Published: (2024)
by: Zhao, Jiawei, et al.
Published: (2024)
Membership Inference Attacks on Tokenizers of Large Language Models
by: Tong, Meng, et al.
Published: (2025)
by: Tong, Meng, et al.
Published: (2025)
Large Language Models Merging for Enhancing the Link Stealing Attack on Graph Neural Networks
by: Guan, Faqian, et al.
Published: (2024)
by: Guan, Faqian, et al.
Published: (2024)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
by: Mehrotra, Anay, et al.
Published: (2023)
by: Mehrotra, Anay, et al.
Published: (2023)
A Model Stealing Attack Against Multi-Exit Networks
by: Pan, Li, et al.
Published: (2023)
by: Pan, Li, et al.
Published: (2023)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
by: Li, Xi, et al.
Published: (2024)
by: Li, Xi, et al.
Published: (2024)
TransLinkGuard: Safeguarding Transformer Models Against Model Stealing in Edge Deployment
by: Li, Qinfeng, et al.
Published: (2024)
by: Li, Qinfeng, et al.
Published: (2024)
A Survey of Attacks on Large Language Models
by: Xu, Wenrui, et al.
Published: (2025)
by: Xu, Wenrui, et al.
Published: (2025)
AttacKG+:Boosting Attack Knowledge Graph Construction with Large Language Models
by: Zhang, Yongheng, et al.
Published: (2024)
by: Zhang, Yongheng, et al.
Published: (2024)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
by: Narula, Sidhant, et al.
Published: (2025)
by: Narula, Sidhant, et al.
Published: (2025)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
by: Yang, Yiqi, et al.
Published: (2024)
by: Yang, Yiqi, et al.
Published: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
by: Yin, Ziyi, et al.
Published: (2025)
by: Yin, Ziyi, et al.
Published: (2025)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
by: Hong, Wenjing, et al.
Published: (2026)
by: Hong, Wenjing, et al.
Published: (2026)
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
by: Chen, Zeyuan, et al.
Published: (2026)
by: Chen, Zeyuan, et al.
Published: (2026)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
by: Mia, Md Jueal, et al.
Published: (2026)
by: Mia, Md Jueal, et al.
Published: (2026)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
by: Yu, Ye, et al.
Published: (2026)
by: Yu, Ye, et al.
Published: (2026)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
by: Li, Jie, et al.
Published: (2024)
by: Li, Jie, et al.
Published: (2024)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
by: Park, Junyoung, et al.
Published: (2026)
by: Park, Junyoung, et al.
Published: (2026)
Membership Inference Attacks Against Video Large Language Models
by: Song, Wei, et al.
Published: (2026)
by: Song, Wei, et al.
Published: (2026)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
by: Cong, Tianshuo, et al.
Published: (2024)
by: Cong, Tianshuo, et al.
Published: (2024)
Defending Against Beta Poisoning Attacks in Machine Learning Models
by: Gulciftci, Nilufer, et al.
Published: (2025)
by: Gulciftci, Nilufer, et al.
Published: (2025)
PID: Prompt-Independent Data Protection Against Latent Diffusion Models
by: Li, Ang, et al.
Published: (2024)
by: Li, Ang, et al.
Published: (2024)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
by: Truong, Vu Tuan, et al.
Published: (2026)
by: Truong, Vu Tuan, et al.
Published: (2026)
Recent Advances in Attack and Defense Approaches of Large Language Models
by: Cui, Jing, et al.
Published: (2024)
by: Cui, Jing, et al.
Published: (2024)
Improved Membership Inference Attacks Against Language Classification Models
by: Shachor, Shlomit, et al.
Published: (2023)
by: Shachor, Shlomit, et al.
Published: (2023)
Similar Items
-
Cisco Integrated AI Security and Safety Framework Report
by: Chang, Amy, et al.
Published: (2025) -
Llama-3.1-FoundationAI-SecurityLLM-Base-8B Technical Report
by: Kassianik, Paul, et al.
Published: (2025) -
LLM Cyber Evaluations Don't Capture Real-World Risk
by: Lukošiūtė, Kamilė, et al.
Published: (2025) -
Death by a Thousand Prompts: Open Model Vulnerability Analysis
by: Chang, Amy, et al.
Published: (2025) -
Membership Inference Attacks Against Vision-Language Models
by: Hu, Yuke, et al.
Published: (2025)