PAL: Proxy-Guided Black-Box Attack on Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sitawarin, Chawin, Mu, Norman, Wagner, David, Araujo, Alexandre |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mark My Words: Analyzing and Evaluating Language Model Watermarks
di: Piet, Julien, et al.
Pubblicazione: (2023)
di: Piet, Julien, et al.
Pubblicazione: (2023)
PubDef: Defending Against Transfer Attacks From Public Models
di: Sitawarin, Chawin, et al.
Pubblicazione: (2023)
di: Sitawarin, Chawin, et al.
Pubblicazione: (2023)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
di: Mehrotra, Anay, et al.
Pubblicazione: (2023)
di: Mehrotra, Anay, et al.
Pubblicazione: (2023)
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
di: Piet, Julien, et al.
Pubblicazione: (2023)
di: Piet, Julien, et al.
Pubblicazione: (2023)
Generative AI Security: Challenges and Countermeasures
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
Kov: Transferable and Naturalistic Black-Box LLM Attacks using Markov Decision Processes and Tree Search
di: Moss, Robert J.
Pubblicazione: (2024)
di: Moss, Robert J.
Pubblicazione: (2024)
The Resurgence of GCG Adversarial Attacks on Large Language Models
di: Tan, Yuting, et al.
Pubblicazione: (2025)
di: Tan, Yuting, et al.
Pubblicazione: (2025)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
di: Wang, Xinyuan, et al.
Pubblicazione: (2024)
di: Wang, Xinyuan, et al.
Pubblicazione: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification
di: Gubri, Martin, et al.
Pubblicazione: (2024)
di: Gubri, Martin, et al.
Pubblicazione: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
di: Bai, Yang, et al.
Pubblicazione: (2024)
di: Bai, Yang, et al.
Pubblicazione: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
di: Li, Xiao, et al.
Pubblicazione: (2024)
di: Li, Xiao, et al.
Pubblicazione: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
di: Wang, Libo
Pubblicazione: (2024)
di: Wang, Libo
Pubblicazione: (2024)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
di: Shao, Zedian, et al.
Pubblicazione: (2024)
di: Shao, Zedian, et al.
Pubblicazione: (2024)
Exploiting Class Probabilities for Black-box Sentence-level Attacks
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
di: Moraffah, Raha, et al.
Pubblicazione: (2024)
Instructional Fingerprinting of Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
di: Xu, Jiashu, et al.
Pubblicazione: (2024)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
Large Language Models in Cybersecurity: State-of-the-Art
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
Duwak: Dual Watermarks in Large Language Models
di: Zhu, Chaoyi, et al.
Pubblicazione: (2024)
di: Zhu, Chaoyi, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models with Symbolic Mathematics
di: Bethany, Emet, et al.
Pubblicazione: (2024)
di: Bethany, Emet, et al.
Pubblicazione: (2024)
Beyond Gradient and Priors in Privacy Attacks: Leveraging Pooler Layer Inputs of Language Models in Federated Learning
di: Li, Jianwei, et al.
Pubblicazione: (2023)
di: Li, Jianwei, et al.
Pubblicazione: (2023)
Auto-Tuning Safety Guardrails for Black-Box Large Language Models
di: Abdulkadir, Perry
Pubblicazione: (2025)
di: Abdulkadir, Perry
Pubblicazione: (2025)
MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification
di: Jiang, Weisen, et al.
Pubblicazione: (2026)
di: Jiang, Weisen, et al.
Pubblicazione: (2026)
Machine Unlearning of Pre-trained Large Language Models
di: Yao, Jin, et al.
Pubblicazione: (2024)
di: Yao, Jin, et al.
Pubblicazione: (2024)
On the Role of Attention Heads in Large Language Model Safety
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
EnJa: Ensemble Jailbreak on Large Language Models
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
Interpreting the Repeated Token Phenomenon in Large Language Models
di: Yona, Itay, et al.
Pubblicazione: (2025)
di: Yona, Itay, et al.
Pubblicazione: (2025)
SurvAttack: Black-Box Attack On Survival Models through Ontology-Informed EHR Perturbation
di: Kerdabadi, Mohsen Nayebi, et al.
Pubblicazione: (2024)
di: Kerdabadi, Mohsen Nayebi, et al.
Pubblicazione: (2024)
Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models
di: Dang, Trung Cuong, et al.
Pubblicazione: (2025)
di: Dang, Trung Cuong, et al.
Pubblicazione: (2025)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
Unlocking Memorization in Large Language Models with Dynamic Soft Prompting
di: Wang, Zhepeng, et al.
Pubblicazione: (2024)
di: Wang, Zhepeng, et al.
Pubblicazione: (2024)
FIT to Forget: Robust Continual Unlearning for Large Language Models
di: Xu, Xiaoyu, et al.
Pubblicazione: (2026)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2026)
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
OBLIVIATE: Robust and Practical Machine Unlearning for Large Language Models
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Xu, Xiaoyu, et al.
Pubblicazione: (2025)
Probing the Robustness of Large Language Models Safety to Latent Perturbations
di: Gu, Tianle, et al.
Pubblicazione: (2025)
di: Gu, Tianle, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mark My Words: Analyzing and Evaluating Language Model Watermarks
di: Piet, Julien, et al.
Pubblicazione: (2023) -
PubDef: Defending Against Transfer Attacks From Public Models
di: Sitawarin, Chawin, et al.
Pubblicazione: (2023) -
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
di: Mehrotra, Anay, et al.
Pubblicazione: (2023) -
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
di: Piet, Julien, et al.
Pubblicazione: (2023) -
Generative AI Security: Challenges and Countermeasures
di: Zhu, Banghua, et al.
Pubblicazione: (2024)