Exploiting Class Probabilities for Black-box Sentence-level Attacks
Fuente:
arXiv
Guardado en:
| Autores principales: | Moraffah, Raha, Liu, Huan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Generative Approach to Surrogate-based Black-box Attacks
por: Moraffah, Raha, et al.
Publicado: (2024)
por: Moraffah, Raha, et al.
Publicado: (2024)
Adversarial Text Purification: A Large Language Model Approach for Defense
por: Moraffah, Raha, et al.
Publicado: (2024)
por: Moraffah, Raha, et al.
Publicado: (2024)
Towards LLM-guided Causal Explainability for Black-box Text Classifiers
por: Bhattacharjee, Amrita, et al.
Publicado: (2023)
por: Bhattacharjee, Amrita, et al.
Publicado: (2023)
The Wolf Within: Covert Injection of Malice into MLLM Societies via an MLLM Operative
por: Tan, Zhen, et al.
Publicado: (2024)
por: Tan, Zhen, et al.
Publicado: (2024)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
por: Mehrotra, Anay, et al.
Publicado: (2023)
por: Mehrotra, Anay, et al.
Publicado: (2023)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
por: Sitawarin, Chawin, et al.
Publicado: (2024)
por: Sitawarin, Chawin, et al.
Publicado: (2024)
Less is More: Understanding Word-level Textual Adversarial Attack via n-gram Frequency Descend
por: Lu, Ning, et al.
Publicado: (2023)
por: Lu, Ning, et al.
Publicado: (2023)
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
por: Li, Yuexin, et al.
Publicado: (2026)
por: Li, Yuexin, et al.
Publicado: (2026)
EIA: Environmental Injection Attack on Generalist Web Agents for Privacy Leakage
por: Liao, Zeyi, et al.
Publicado: (2024)
por: Liao, Zeyi, et al.
Publicado: (2024)
Kov: Transferable and Naturalistic Black-Box LLM Attacks using Markov Decision Processes and Tree Search
por: Moss, Robert J.
Publicado: (2024)
por: Moss, Robert J.
Publicado: (2024)
"Glue pizza and eat rocks" -- Exploiting Vulnerabilities in Retrieval-Augmented Generative Models
por: Tan, Zhen, et al.
Publicado: (2024)
por: Tan, Zhen, et al.
Publicado: (2024)
Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents
por: Wang, Chunxiao
Publicado: (2026)
por: Wang, Chunxiao
Publicado: (2026)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026)
por: Hu, Xulin, et al.
Publicado: (2026)
A General Black-box Adversarial Attack on Graph-based Fake News Detectors
por: Zhu, Peican, et al.
Publicado: (2024)
por: Zhu, Peican, et al.
Publicado: (2024)
Formalizing and Benchmarking Prompt Injection Attacks and Defenses
por: Liu, Yupei, et al.
Publicado: (2023)
por: Liu, Yupei, et al.
Publicado: (2023)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
por: Shao, Zedian, et al.
Publicado: (2024)
por: Shao, Zedian, et al.
Publicado: (2024)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
por: Ahmed, Mohamed, et al.
Publicado: (2025)
por: Ahmed, Mohamed, et al.
Publicado: (2025)
Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings
por: Zhang, Yuanhe, et al.
Publicado: (2024)
por: Zhang, Yuanhe, et al.
Publicado: (2024)
Q-FAKER: Query-free Hard Black-box Attack via Controlled Generation
por: Na, CheolWon, et al.
Publicado: (2025)
por: Na, CheolWon, et al.
Publicado: (2025)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
por: Liu, Zesen, et al.
Publicado: (2024)
por: Liu, Zesen, et al.
Publicado: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Beyond Gradient and Priors in Privacy Attacks: Leveraging Pooler Layer Inputs of Language Models in Federated Learning
por: Li, Jianwei, et al.
Publicado: (2023)
por: Li, Jianwei, et al.
Publicado: (2023)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
por: Huang, Tiansheng, et al.
Publicado: (2025)
por: Huang, Tiansheng, et al.
Publicado: (2025)
Attack and defense techniques in large language models: A survey and new perspectives
por: Liao, Zhiyu, et al.
Publicado: (2025)
por: Liao, Zhiyu, et al.
Publicado: (2025)
Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
por: Tang, Haochun, et al.
Publicado: (2026)
por: Tang, Haochun, et al.
Publicado: (2026)
The Resurgence of GCG Adversarial Attacks on Large Language Models
por: Tan, Yuting, et al.
Publicado: (2025)
por: Tan, Yuting, et al.
Publicado: (2025)
Black-box Adversarial Attacks on Network-wide Multi-step Traffic State Prediction Models
por: Poudel, Bibek, et al.
Publicado: (2021)
por: Poudel, Bibek, et al.
Publicado: (2021)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
por: Baumgärtner, Tim, et al.
Publicado: (2024)
por: Baumgärtner, Tim, et al.
Publicado: (2024)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
por: Wang, Yifei, et al.
Publicado: (2024)
por: Wang, Yifei, et al.
Publicado: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
por: Qian, Cheng, et al.
Publicado: (2024)
por: Qian, Cheng, et al.
Publicado: (2024)
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
por: Fang, Zhicheng, et al.
Publicado: (2026)
por: Fang, Zhicheng, et al.
Publicado: (2026)
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
por: Struppek, Lukas, et al.
Publicado: (2026)
por: Struppek, Lukas, et al.
Publicado: (2026)
SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
por: Liang, Buyun, et al.
Publicado: (2025)
por: Liang, Buyun, et al.
Publicado: (2025)
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
por: Vega, Jason, et al.
Publicado: (2023)
por: Vega, Jason, et al.
Publicado: (2023)
REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
por: Liang, Buyun, et al.
Publicado: (2026)
por: Liang, Buyun, et al.
Publicado: (2026)
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
por: Poppi, Samuele, et al.
Publicado: (2024)
por: Poppi, Samuele, et al.
Publicado: (2024)
Adversarial Attacks on Parts of Speech: An Empirical Study in Text-to-Image Generation
por: Shahariar, G M, et al.
Publicado: (2024)
por: Shahariar, G M, et al.
Publicado: (2024)
Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks
por: Cheng, Yixin, et al.
Publicado: (2025)
por: Cheng, Yixin, et al.
Publicado: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Ejemplares similares
-
A Generative Approach to Surrogate-based Black-box Attacks
por: Moraffah, Raha, et al.
Publicado: (2024) -
Adversarial Text Purification: A Large Language Model Approach for Defense
por: Moraffah, Raha, et al.
Publicado: (2024) -
Towards LLM-guided Causal Explainability for Black-box Text Classifiers
por: Bhattacharjee, Amrita, et al.
Publicado: (2023) -
The Wolf Within: Covert Injection of Malice into MLLM Societies via an MLLM Operative
por: Tan, Zhen, et al.
Publicado: (2024) -
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
por: Mehrotra, Anay, et al.
Publicado: (2023)