Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Xiangwen, Balashankar, Ananth, Chandrasekaran, Varun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
von: Chao, Patrick, et al.
Veröffentlicht: (2024)
von: Chao, Patrick, et al.
Veröffentlicht: (2024)
JULI: Jailbreak Large Language Models by Self-Introspection
von: Wang, Jesson, et al.
Veröffentlicht: (2025)
von: Wang, Jesson, et al.
Veröffentlicht: (2025)
Privately Aligning Language Models with Reinforcement Learning
von: Wu, Fan, et al.
Veröffentlicht: (2023)
von: Wu, Fan, et al.
Veröffentlicht: (2023)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
von: Li, Songze, et al.
Veröffentlicht: (2026)
von: Li, Songze, et al.
Veröffentlicht: (2026)
AMUN: Adversarial Machine UNlearning
von: Ebrahimpour-Boroojeny, Ali, et al.
Veröffentlicht: (2025)
von: Ebrahimpour-Boroojeny, Ali, et al.
Veröffentlicht: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
Jailbreaking Large Language Models in Infinitely Many Ways
von: Goldstein, Oliver, et al.
Veröffentlicht: (2025)
von: Goldstein, Oliver, et al.
Veröffentlicht: (2025)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
von: Li, Xuan, et al.
Veröffentlicht: (2023)
von: Li, Xuan, et al.
Veröffentlicht: (2023)
A Systematic Review of Poisoning Attacks Against Large Language Models
von: Fendley, Neil, et al.
Veröffentlicht: (2025)
von: Fendley, Neil, et al.
Veröffentlicht: (2025)
Challenges in Enabling Private Data Valuation
von: Fu, Yiwei, et al.
Veröffentlicht: (2026)
von: Fu, Yiwei, et al.
Veröffentlicht: (2026)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
von: Lin, Runqi, et al.
Veröffentlicht: (2025)
von: Lin, Runqi, et al.
Veröffentlicht: (2025)
The Efficacy of Transfer-based No-box Attacks on Image Watermarking: A Pragmatic Analysis
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
Jailbreak Attack Initializations as Extractors of Compliance Directions
von: Levi, Amit, et al.
Veröffentlicht: (2025)
von: Levi, Amit, et al.
Veröffentlicht: (2025)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
von: Peng, Benji, et al.
Veröffentlicht: (2024)
von: Peng, Benji, et al.
Veröffentlicht: (2024)
Bypassing LLM Watermarks with Color-Aware Substitutions
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
von: Wu, Qilong, et al.
Veröffentlicht: (2024)
Voice Jailbreak Attacks Against GPT-4o
von: Shen, Xinyue, et al.
Veröffentlicht: (2024)
von: Shen, Xinyue, et al.
Veröffentlicht: (2024)
Defending Large Language Models Against Attacks With Residual Stream Activation Analysis
von: Kawasaki, Amelia, et al.
Veröffentlicht: (2024)
von: Kawasaki, Amelia, et al.
Veröffentlicht: (2024)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
von: Reddy, Aashray, et al.
Veröffentlicht: (2025)
von: Reddy, Aashray, et al.
Veröffentlicht: (2025)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
von: Shen, Xinyue, et al.
Veröffentlicht: (2023)
von: Shen, Xinyue, et al.
Veröffentlicht: (2023)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Membership Inference Attacks on Large-Scale Models: A Survey
von: Wu, Hengyu, et al.
Veröffentlicht: (2025)
von: Wu, Hengyu, et al.
Veröffentlicht: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
von: Lin, Shi, et al.
Veröffentlicht: (2024)
von: Lin, Shi, et al.
Veröffentlicht: (2024)
Jailbreaking Attack against Multimodal Large Language Model
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
Layer-Targeted Multilingual Knowledge Erasure in Large Language Models
von: Li, Taoran, et al.
Veröffentlicht: (2026)
von: Li, Taoran, et al.
Veröffentlicht: (2026)
The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation
von: Jia, Hengrui, et al.
Veröffentlicht: (2025)
von: Jia, Hengrui, et al.
Veröffentlicht: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
von: Jia, Xiaojun, et al.
Veröffentlicht: (2024)
von: Jia, Xiaojun, et al.
Veröffentlicht: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
von: Zou, Wei, et al.
Veröffentlicht: (2024)
von: Zou, Wei, et al.
Veröffentlicht: (2024)
Using Retriever Augmented Large Language Models for Attack Graph Generation
von: Prapty, Renascence Tarafder, et al.
Veröffentlicht: (2024)
von: Prapty, Renascence Tarafder, et al.
Veröffentlicht: (2024)
Efficient Jailbreaking of Large Models by Freeze Training: Lower Layers Exhibit Greater Sensitivity to Harmful Content
von: Shen, Hongyuan, et al.
Veröffentlicht: (2025)
von: Shen, Hongyuan, et al.
Veröffentlicht: (2025)
TokenProber: Jailbreaking Text-to-image Models via Fine-grained Word Impact Analysis
von: Wang, Longtian, et al.
Veröffentlicht: (2025)
von: Wang, Longtian, et al.
Veröffentlicht: (2025)
Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
von: Fu, Shaopeng, et al.
Veröffentlicht: (2025)
von: Fu, Shaopeng, et al.
Veröffentlicht: (2025)
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
von: Hossain, Ismail, et al.
Veröffentlicht: (2026)
von: Hossain, Ismail, et al.
Veröffentlicht: (2026)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
von: Galinkin, Erick, et al.
Veröffentlicht: (2024)
von: Galinkin, Erick, et al.
Veröffentlicht: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
von: Hu, Xiaomeng, et al.
Veröffentlicht: (2024)
von: Hu, Xiaomeng, et al.
Veröffentlicht: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
von: Li, Xiao, et al.
Veröffentlicht: (2024)
von: Li, Xiao, et al.
Veröffentlicht: (2024)
EnJa: Ensemble Jailbreak on Large Language Models
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
Adversarial Attacks on Locally Private Graph Neural Networks
von: Varun, Matta, et al.
Veröffentlicht: (2026)
von: Varun, Matta, et al.
Veröffentlicht: (2026)
Poison with Style: A Practical Poisoning Attack on Code Large Language Models
von: Tran, Khang, et al.
Veröffentlicht: (2026)
von: Tran, Khang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
von: Chao, Patrick, et al.
Veröffentlicht: (2024) -
JULI: Jailbreak Large Language Models by Self-Introspection
von: Wang, Jesson, et al.
Veröffentlicht: (2025) -
Privately Aligning Language Models with Reinforcement Learning
von: Wu, Fan, et al.
Veröffentlicht: (2023) -
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
von: Li, Songze, et al.
Veröffentlicht: (2026) -
AMUN: Adversarial Machine UNlearning
von: Ebrahimpour-Boroojeny, Ali, et al.
Veröffentlicht: (2025)