Enregistré dans:
| Auteur principal: | Moss, Robert J. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2408.08899 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023)
par: Mehrotra, Anay, et autres
Publié: (2023)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
par: Sitawarin, Chawin, et autres
Publié: (2024)
par: Sitawarin, Chawin, et autres
Publié: (2024)
TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification
par: Gubri, Martin, et autres
Publié: (2024)
par: Gubri, Martin, et autres
Publié: (2024)
Exploiting Class Probabilities for Black-box Sentence-level Attacks
par: Moraffah, Raha, et autres
Publié: (2024)
par: Moraffah, Raha, et autres
Publié: (2024)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2025)
par: Liang, Buyun, et autres
Publié: (2025)
REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
par: Liang, Buyun, et autres
Publié: (2026)
par: Liang, Buyun, et autres
Publié: (2026)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
par: Cao, Bochuan, et autres
Publié: (2023)
par: Cao, Bochuan, et autres
Publié: (2023)
Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening
par: Zhang, Mohan, et autres
Publié: (2026)
par: Zhang, Mohan, et autres
Publié: (2026)
Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
par: Tang, Haochun, et autres
Publié: (2026)
par: Tang, Haochun, et autres
Publié: (2026)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
par: Wang, Xinyuan, et autres
Publié: (2024)
par: Wang, Xinyuan, et autres
Publié: (2024)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
par: Akbar-Tajari, Mohammad, et autres
Publié: (2025)
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
par: Gohil, Vasudev
Publié: (2025)
par: Gohil, Vasudev
Publié: (2025)
Membership Inference Attacks on LLM-based Recommender Systems
par: He, Jiajie, et autres
Publié: (2025)
par: He, Jiajie, et autres
Publié: (2025)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
par: Liu, Yupei, et autres
Publié: (2023)
par: Liu, Yupei, et autres
Publié: (2023)
PBa-LLM: Privacy- and Bias-aware NLP using Named-Entity Recognition (NER)
par: Mancera, Gonzalo, et autres
Publié: (2025)
par: Mancera, Gonzalo, et autres
Publié: (2025)
BinaryShield: Cross-Service Threat Intelligence in LLM Services using Privacy-Preserving Fingerprints
par: Gill, Waris, et autres
Publié: (2025)
par: Gill, Waris, et autres
Publié: (2025)
The Resurgence of GCG Adversarial Attacks on Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
SurvAttack: Black-Box Attack On Survival Models through Ontology-Informed EHR Perturbation
par: Kerdabadi, Mohsen Nayebi, et autres
Publié: (2024)
par: Kerdabadi, Mohsen Nayebi, et autres
Publié: (2024)
SoK: Pitfalls in Evaluating Black-Box Attacks
par: Suya, Fnu, et autres
Publié: (2023)
par: Suya, Fnu, et autres
Publié: (2023)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
par: Baumgärtner, Tim, et autres
Publié: (2024)
par: Baumgärtner, Tim, et autres
Publié: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
par: Shao, Zedian, et autres
Publié: (2024)
par: Shao, Zedian, et autres
Publié: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
par: Fang, Zhicheng, et autres
Publié: (2026)
par: Fang, Zhicheng, et autres
Publié: (2026)
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
par: Struppek, Lukas, et autres
Publié: (2026)
par: Struppek, Lukas, et autres
Publié: (2026)
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
par: Vega, Jason, et autres
Publié: (2023)
par: Vega, Jason, et autres
Publié: (2023)
On Adversarial Robustness of Language Models in Transfer Learning
par: Turbal, Bohdan, et autres
Publié: (2024)
par: Turbal, Bohdan, et autres
Publié: (2024)
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
par: Poppi, Samuele, et autres
Publié: (2024)
par: Poppi, Samuele, et autres
Publié: (2024)
Adversarial Attacks on Parts of Speech: An Empirical Study in Text-to-Image Generation
par: Shahariar, G M, et autres
Publié: (2024)
par: Shahariar, G M, et autres
Publié: (2024)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
par: Liu, Zesen, et autres
Publié: (2024)
par: Liu, Zesen, et autres
Publié: (2024)
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
par: Liao, Zeyi, et autres
Publié: (2024)
par: Liao, Zeyi, et autres
Publié: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks
par: Cheng, Yixin, et autres
Publié: (2025)
par: Cheng, Yixin, et autres
Publié: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
par: Chen, Taiye, et autres
Publié: (2025)
par: Chen, Taiye, et autres
Publié: (2025)
Attack and defense techniques in large language models: A survey and new perspectives
par: Liao, Zhiyu, et autres
Publié: (2025)
par: Liao, Zhiyu, et autres
Publié: (2025)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
par: Jiang, Weisen, et autres
Publié: (2025)
par: Jiang, Weisen, et autres
Publié: (2025)
Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses
par: Yang, Xiaoxue, et autres
Publié: (2025)
par: Yang, Xiaoxue, et autres
Publié: (2025)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
par: Chen, Zhuo, et autres
Publié: (2024)
par: Chen, Zhuo, et autres
Publié: (2024)
Documents similaires
-
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
par: Mehrotra, Anay, et autres
Publié: (2023) -
PAL: Proxy-Guided Black-Box Attack on Large Language Models
par: Sitawarin, Chawin, et autres
Publié: (2024) -
TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification
par: Gubri, Martin, et autres
Publié: (2024) -
Exploiting Class Probabilities for Black-box Sentence-level Attacks
par: Moraffah, Raha, et autres
Publié: (2024) -
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024)