Death by a Thousand Prompts: Open Model Vulnerability Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Chang, Amy, Conley, Nicholas, Ganesan, Harish Santhanalakshmi, Swanda, Adam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLM Cyber Evaluations Don't Capture Real-World Risk
di: Lukošiūtė, Kamilė, et al.
Pubblicazione: (2025)
di: Lukošiūtė, Kamilė, et al.
Pubblicazione: (2025)
Vulnerability Detection in C/C++ Code with Deep Learning
di: Huang, Zhen, et al.
Pubblicazione: (2024)
di: Huang, Zhen, et al.
Pubblicazione: (2024)
Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis
di: Brokman, Jonathan, et al.
Pubblicazione: (2024)
di: Brokman, Jonathan, et al.
Pubblicazione: (2024)
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
di: Struppek, Lukas, et al.
Pubblicazione: (2026)
di: Struppek, Lukas, et al.
Pubblicazione: (2026)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
di: Reddy, Aashray, et al.
Pubblicazione: (2025)
di: Reddy, Aashray, et al.
Pubblicazione: (2025)
LiteLMGuard: Seamless and Lightweight On-Device Prompt Filtering for Safeguarding Small Language Models against Quantization-induced Risks and Vulnerabilities
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
ARVO: Atlas of Reproducible Vulnerabilities for Open Source Software
di: Mei, Xiang, et al.
Pubblicazione: (2024)
di: Mei, Xiang, et al.
Pubblicazione: (2024)
TAPAS: Efficient Two-Server Asymmetric Private Aggregation Beyond Prio(+)
di: Karthikeyan, Harish, et al.
Pubblicazione: (2026)
di: Karthikeyan, Harish, et al.
Pubblicazione: (2026)
Cisco Integrated AI Security and Safety Framework Report
di: Chang, Amy, et al.
Pubblicazione: (2025)
di: Chang, Amy, et al.
Pubblicazione: (2025)
A Framework for Rapidly Developing and Deploying Protection Against Large Language Model Attacks
di: Swanda, Adam, et al.
Pubblicazione: (2025)
di: Swanda, Adam, et al.
Pubblicazione: (2025)
Dissecting the Black Box: Circuit-Level Analysis of LLM Vulnerability Detection
di: Atiiq, Syafiq Al, et al.
Pubblicazione: (2026)
di: Atiiq, Syafiq Al, et al.
Pubblicazione: (2026)
Reconstruction Attacks on Machine Unlearning: Simple Models are Vulnerable
di: Bertran, Martin, et al.
Pubblicazione: (2024)
di: Bertran, Martin, et al.
Pubblicazione: (2024)
Efficient but Vulnerable: Benchmarking and Defending LLM Batch Prompting Attack
di: Yue, Murong, et al.
Pubblicazione: (2025)
di: Yue, Murong, et al.
Pubblicazione: (2025)
Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning
di: Chen, Aobo, et al.
Pubblicazione: (2026)
di: Chen, Aobo, et al.
Pubblicazione: (2026)
Vulnerability Detection in Ethereum Smart Contracts via Machine Learning: A Qualitative Analysis
di: Ressi, Dalila, et al.
Pubblicazione: (2024)
di: Ressi, Dalila, et al.
Pubblicazione: (2024)
Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models
di: Qian, Wei, et al.
Pubblicazione: (2025)
di: Qian, Wei, et al.
Pubblicazione: (2025)
Prompt Obfuscation for Large Language Models
di: Pape, David, et al.
Pubblicazione: (2024)
di: Pape, David, et al.
Pubblicazione: (2024)
Deep Learning-based Binary Analysis for Vulnerability Detection in x86-64 Machine Code
di: Petingola, Mitchell
Pubblicazione: (2026)
di: Petingola, Mitchell
Pubblicazione: (2026)
The Tail Tells All: Estimating Model-Level Membership Inference Vulnerability Without Reference Models
di: Dodd, Euodia, et al.
Pubblicazione: (2025)
di: Dodd, Euodia, et al.
Pubblicazione: (2025)
Evaluating Large Language Models in Vulnerability Detection Under Variable Context Windows
di: Lin, Jie, et al.
Pubblicazione: (2025)
di: Lin, Jie, et al.
Pubblicazione: (2025)
Stealix: Model Stealing via Prompt Evolution
di: Zhuang, Zhixiong, et al.
Pubblicazione: (2025)
di: Zhuang, Zhixiong, et al.
Pubblicazione: (2025)
Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
di: Kang, Mintong, et al.
Pubblicazione: (2025)
di: Kang, Mintong, et al.
Pubblicazione: (2025)
Sponge Attacks on Sensing AI: Energy-Latency Vulnerabilities and Defense via Model Pruning
di: Hasan, Syed Mhamudul, et al.
Pubblicazione: (2025)
di: Hasan, Syed Mhamudul, et al.
Pubblicazione: (2025)
Evaluating Line-level Localization Ability of Learning-based Code Vulnerability Detection Models
di: Pintore, Marco, et al.
Pubblicazione: (2025)
di: Pintore, Marco, et al.
Pubblicazione: (2025)
SoK: Reducing the Vulnerability of Fine-tuned Language Models to Membership Inference Attacks
di: Amit, Guy, et al.
Pubblicazione: (2024)
di: Amit, Guy, et al.
Pubblicazione: (2024)
A Manually-Curated Dataset of Fixes to Vulnerabilities of Open-Source Software
di: Ponta, Serena E., et al.
Pubblicazione: (2019)
di: Ponta, Serena E., et al.
Pubblicazione: (2019)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
Predicting Vulnerability to Malware Using Machine Learning Models: A Study on Microsoft Windows Machines
di: Esnaashari, Marzieh, et al.
Pubblicazione: (2025)
di: Esnaashari, Marzieh, et al.
Pubblicazione: (2025)
Vulnerability-Aware Robust Multimodal Adversarial Training
di: Zhang, Junrui, et al.
Pubblicazione: (2025)
di: Zhang, Junrui, et al.
Pubblicazione: (2025)
Privacy Vulnerabilities in Marginals-based Synthetic Data
di: Golob, Steven, et al.
Pubblicazione: (2024)
di: Golob, Steven, et al.
Pubblicazione: (2024)
On Reliability of Efficient Membership Inference Vulnerability Evaluation
di: Jälkö, Joonas, et al.
Pubblicazione: (2026)
di: Jälkö, Joonas, et al.
Pubblicazione: (2026)
Agentic Vulnerability Reasoning on Windows COM Binaries
di: Lee, Hwiwon, et al.
Pubblicazione: (2026)
di: Lee, Hwiwon, et al.
Pubblicazione: (2026)
Can LLMs be Fooled? Investigating Vulnerabilities in LLMs
di: Abdali, Sara, et al.
Pubblicazione: (2024)
di: Abdali, Sara, et al.
Pubblicazione: (2024)
PVF (Parameter Vulnerability Factor): A Scalable Metric for Understanding AI Vulnerability Against SDCs in Model Parameters
di: Jiao, Xun, et al.
Pubblicazione: (2024)
di: Jiao, Xun, et al.
Pubblicazione: (2024)
Bypassing Prompt Guards in Production with Controlled-Release Prompting
di: Fairoze, Jaiden, et al.
Pubblicazione: (2025)
di: Fairoze, Jaiden, et al.
Pubblicazione: (2025)
Open LLMs are Necessary for Current Private Adaptations and Outperform their Closed Alternatives
di: Hanke, Vincent, et al.
Pubblicazione: (2024)
di: Hanke, Vincent, et al.
Pubblicazione: (2024)
Prompt Stealing Attacks Against Text-to-Image Generation Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
Demystifying Trajectory Recovery From Ash: An Open-Source Evaluation and Enhancement
di: D'Silva, Nicholas, et al.
Pubblicazione: (2024)
di: D'Silva, Nicholas, et al.
Pubblicazione: (2024)
Automated Mapping of Vulnerability Advisories onto their Fix Commits in Open Source Repositories
di: Hommersom, Daan, et al.
Pubblicazione: (2021)
di: Hommersom, Daan, et al.
Pubblicazione: (2021)
GenTel-Safe: A Unified Benchmark and Shielding Framework for Defending Against Prompt Injection Attacks
di: Li, Rongchang, et al.
Pubblicazione: (2024)
di: Li, Rongchang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LLM Cyber Evaluations Don't Capture Real-World Risk
di: Lukošiūtė, Kamilė, et al.
Pubblicazione: (2025) -
Vulnerability Detection in C/C++ Code with Deep Learning
di: Huang, Zhen, et al.
Pubblicazione: (2024) -
Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis
di: Brokman, Jonathan, et al.
Pubblicazione: (2024) -
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
di: Struppek, Lukas, et al.
Pubblicazione: (2026) -
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
di: Reddy, Aashray, et al.
Pubblicazione: (2025)