garak: A Framework for Security Probing Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Derczynski, Leon, Galinkin, Erick, Martin, Jeffrey, Majumdar, Subho, Inie, Nanna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Summon a Demon and Bind it: A Grounded Theory of LLM Red Teaming
di: Inie, Nanna, et al.
Pubblicazione: (2023)
di: Inie, Nanna, et al.
Pubblicazione: (2023)
Importing Phantoms: Measuring LLM Package Hallucination Vulnerabilities
di: Krishna, Arjun, et al.
Pubblicazione: (2025)
di: Krishna, Arjun, et al.
Pubblicazione: (2025)
Hacc-Man: An Arcade Game for Jailbreaking LLMs
di: Valentim, Matheus, et al.
Pubblicazione: (2024)
di: Valentim, Matheus, et al.
Pubblicazione: (2024)
Training a General Purpose Automated Red Teaming Model
di: Padmakumar, Aishwarya, et al.
Pubblicazione: (2026)
di: Padmakumar, Aishwarya, et al.
Pubblicazione: (2026)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
di: Galinkin, Erick, et al.
Pubblicazione: (2024)
di: Galinkin, Erick, et al.
Pubblicazione: (2024)
Weakest Link in the Chain: Security Vulnerabilities in Advanced Reasoning Models
di: Krishna, Arjun, et al.
Pubblicazione: (2025)
di: Krishna, Arjun, et al.
Pubblicazione: (2025)
Building Resilient SMEs: Harnessing Large Language Models for Cyber Security in Australia
di: Kereopa-Yorke, Benjamin
Pubblicazione: (2023)
di: Kereopa-Yorke, Benjamin
Pubblicazione: (2023)
Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature
di: Zhou, Tong, et al.
Pubblicazione: (2024)
di: Zhou, Tong, et al.
Pubblicazione: (2024)
An Investigation into Misuse of Java Security APIs by Large Language Models
di: Mousavi, Zahra, et al.
Pubblicazione: (2024)
di: Mousavi, Zahra, et al.
Pubblicazione: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
di: Zhang, Ruisi, et al.
Pubblicazione: (2023)
di: Zhang, Ruisi, et al.
Pubblicazione: (2023)
Security and Privacy Challenges of Large Language Models: A Survey
di: Das, Badhan Chandra, et al.
Pubblicazione: (2024)
di: Das, Badhan Chandra, et al.
Pubblicazione: (2024)
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
di: Wang, Yidan, et al.
Pubblicazione: (2025)
di: Wang, Yidan, et al.
Pubblicazione: (2025)
SecureLLM: Using Compositionality to Build Provably Secure Language Models for Private, Sensitive, and Secret Data
di: Alabdulkareem, Abdulrahman, et al.
Pubblicazione: (2024)
di: Alabdulkareem, Abdulrahman, et al.
Pubblicazione: (2024)
Phare: A Safety Probe for Large Language Models
di: Jeune, Pierre Le, et al.
Pubblicazione: (2025)
di: Jeune, Pierre Le, et al.
Pubblicazione: (2025)
CVE-LLM : Ontology-Assisted Automatic Vulnerability Evaluation Using Large Language Models
di: Ghosh, Rikhiya, et al.
Pubblicazione: (2025)
di: Ghosh, Rikhiya, et al.
Pubblicazione: (2025)
Lateral Phishing With Large Language Models: A Large Organization Comparative Study
di: Bethany, Mazal, et al.
Pubblicazione: (2024)
di: Bethany, Mazal, et al.
Pubblicazione: (2024)
Institutional Platform for Secure Self-Service Large Language Model Exploration
di: Bumgardner, V. K. Cody, et al.
Pubblicazione: (2024)
di: Bumgardner, V. K. Cody, et al.
Pubblicazione: (2024)
Securing Large Language Models (LLMs) from Prompt Injection Attacks
di: Suri, Omar Farooq Khan, et al.
Pubblicazione: (2025)
di: Suri, Omar Farooq Khan, et al.
Pubblicazione: (2025)
Measuring Copyright Risks of Large Language Model via Partial Information Probing
di: Zhao, Weijie, et al.
Pubblicazione: (2024)
di: Zhao, Weijie, et al.
Pubblicazione: (2024)
Copyright Traps for Large Language Models
di: Meeus, Matthieu, et al.
Pubblicazione: (2024)
di: Meeus, Matthieu, et al.
Pubblicazione: (2024)
$PD^3F$: A Pluggable and Dynamic DoS-Defense Framework Against Resource Consumption Attacks Targeting Large Language Models
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
LRCTI: A Large Language Model-Based Framework for Multi-Step Evidence Retrieval and Reasoning in Cyber Threat Intelligence Credibility Verification
di: Tang, Fengxiao, et al.
Pubblicazione: (2025)
di: Tang, Fengxiao, et al.
Pubblicazione: (2025)
Large Language Models as Carriers of Hidden Messages
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2024)
Yet Another Watermark for Large Language Models
di: Bao, Siyuan, et al.
Pubblicazione: (2025)
di: Bao, Siyuan, et al.
Pubblicazione: (2025)
Token-Level Privacy in Large Language Models
di: Harel, Re'em, et al.
Pubblicazione: (2025)
di: Harel, Re'em, et al.
Pubblicazione: (2025)
SecureNet: A Comparative Study of DeBERTa and Large Language Models for Phishing Detection
di: Mahendru, Sakshi, et al.
Pubblicazione: (2024)
di: Mahendru, Sakshi, et al.
Pubblicazione: (2024)
How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework
di: Liang, Zi, et al.
Pubblicazione: (2025)
di: Liang, Zi, et al.
Pubblicazione: (2025)
Privacy-Preserving Instructions for Aligning Large Language Models
di: Yu, Da, et al.
Pubblicazione: (2024)
di: Yu, Da, et al.
Pubblicazione: (2024)
Prompt Stealing Attacks Against Large Language Models
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
Majority Bit-Aware Watermarking For Large Language Models
di: Xu, Jiahao, et al.
Pubblicazione: (2025)
di: Xu, Jiahao, et al.
Pubblicazione: (2025)
Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
di: Zhang, Ruisi, et al.
Pubblicazione: (2025)
di: Zhang, Ruisi, et al.
Pubblicazione: (2025)
Breaking Down the Defenses: A Comparative Survey of Attacks on Large Language Models
di: Chowdhury, Arijit Ghosh, et al.
Pubblicazione: (2024)
di: Chowdhury, Arijit Ghosh, et al.
Pubblicazione: (2024)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
Multi-Agent Collaboration in Incident Response with Large Language Models
di: Liu, Zefang
Pubblicazione: (2024)
di: Liu, Zefang
Pubblicazione: (2024)
Denial-of-Service Poisoning Attacks against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Watermarking Large Language Models and the Generated Content: Opportunities and Challenges
di: Zhang, Ruisi, et al.
Pubblicazione: (2024)
di: Zhang, Ruisi, et al.
Pubblicazione: (2024)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
di: Li, Haoran, et al.
Pubblicazione: (2023)
di: Li, Haoran, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Summon a Demon and Bind it: A Grounded Theory of LLM Red Teaming
di: Inie, Nanna, et al.
Pubblicazione: (2023) -
Importing Phantoms: Measuring LLM Package Hallucination Vulnerabilities
di: Krishna, Arjun, et al.
Pubblicazione: (2025) -
Hacc-Man: An Arcade Game for Jailbreaking LLMs
di: Valentim, Matheus, et al.
Pubblicazione: (2024) -
Training a General Purpose Automated Red Teaming Model
di: Padmakumar, Aishwarya, et al.
Pubblicazione: (2026) -
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
di: Galinkin, Erick, et al.
Pubblicazione: (2024)