The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
Fuente:
arXiv
Guardado en:
| Autores principales: | Nikolić, Kristina, Sun, Luze, Zhang, Jie, Tramèr, Florian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Universal Jailbreak Backdoors from Poisoned Human Feedback
por: Rando, Javier, et al.
Publicado: (2023)
por: Rando, Javier, et al.
Publicado: (2023)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
por: Rando, Javier, et al.
Publicado: (2024)
por: Rando, Javier, et al.
Publicado: (2024)
Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks
por: Nurlanov, Zhakshylyk, et al.
Publicado: (2026)
por: Nurlanov, Zhakshylyk, et al.
Publicado: (2026)
Gradient-based Jailbreak Images for Multimodal Fusion Models
por: Rando, Javier, et al.
Publicado: (2024)
por: Rando, Javier, et al.
Publicado: (2024)
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
por: Hossain, Ismail, et al.
Publicado: (2026)
por: Hossain, Ismail, et al.
Publicado: (2026)
Mitigating Many-Shot Jailbreaking
por: Ackerman, Christopher M., et al.
Publicado: (2025)
por: Ackerman, Christopher M., et al.
Publicado: (2025)
Injecting Universal Jailbreak Backdoors into LLMs in Minutes
por: Chen, Zhuowei, et al.
Publicado: (2025)
por: Chen, Zhuowei, et al.
Publicado: (2025)
Syntax- and Compilation-Preserving Evasion of LLM Vulnerability Detectors
por: Sun, Luze, et al.
Publicado: (2026)
por: Sun, Luze, et al.
Publicado: (2026)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
Rethinking How to Evaluate Language Model Jailbreak
por: Cai, Hongyu, et al.
Publicado: (2024)
por: Cai, Hongyu, et al.
Publicado: (2024)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
Jailbreaking in the Haystack
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
por: Chao, Patrick, et al.
Publicado: (2024)
por: Chao, Patrick, et al.
Publicado: (2024)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
por: Wu, Yuanwei, et al.
Publicado: (2023)
por: Wu, Yuanwei, et al.
Publicado: (2023)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
por: Andriushchenko, Maksym, et al.
Publicado: (2024)
AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs
por: Liu, Xiaogeng, et al.
Publicado: (2024)
por: Liu, Xiaogeng, et al.
Publicado: (2024)
Jailbreaking with Universal Multi-Prompts
por: Hsu, Yu-Ling, et al.
Publicado: (2025)
por: Hsu, Yu-Ling, et al.
Publicado: (2025)
Jailbreaking LLMs via Calibration
por: Lu, Yuxuan, et al.
Publicado: (2026)
por: Lu, Yuxuan, et al.
Publicado: (2026)
Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem
por: Lin, Shuyi, et al.
Publicado: (2025)
por: Lin, Shuyi, et al.
Publicado: (2025)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
por: Chen, Wenyu, et al.
Publicado: (2026)
por: Chen, Wenyu, et al.
Publicado: (2026)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
por: Galinkin, Erick, et al.
Publicado: (2024)
por: Galinkin, Erick, et al.
Publicado: (2024)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
por: Yang, Junxiao, et al.
Publicado: (2025)
por: Yang, Junxiao, et al.
Publicado: (2025)
Exploiting Prefix-Tree in Structured Output Interfaces for Enhancing Jailbreak Attacking
por: Li, Yanzeng, et al.
Publicado: (2025)
por: Li, Yanzeng, et al.
Publicado: (2025)
Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
por: Li, Songze, et al.
Publicado: (2025)
por: Li, Songze, et al.
Publicado: (2025)
Functional Homotopy: Smoothing Discrete Optimization via Continuous Parameters for LLM Jailbreak Attacks
por: Wang, Zi, et al.
Publicado: (2024)
por: Wang, Zi, et al.
Publicado: (2024)
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
por: Cornacchia, Giandomenico, et al.
Publicado: (2024)
por: Cornacchia, Giandomenico, et al.
Publicado: (2024)
EnJa: Ensemble Jailbreak on Large Language Models
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Boosting Jailbreak Attack with Momentum
por: Zhang, Yihao, et al.
Publicado: (2024)
por: Zhang, Yihao, et al.
Publicado: (2024)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
por: Zhu, Sicheng, et al.
Publicado: (2024)
por: Zhu, Sicheng, et al.
Publicado: (2024)
Low-Resource Languages Jailbreak GPT-4
por: Yong, Zheng-Xin, et al.
Publicado: (2023)
por: Yong, Zheng-Xin, et al.
Publicado: (2023)
Jailbreaking Large Language Models with Symbolic Mathematics
por: Bethany, Emet, et al.
Publicado: (2024)
por: Bethany, Emet, et al.
Publicado: (2024)
Evaluating the Robustness of the "Ensemble Everything Everywhere" Defense
por: Zhang, Jie, et al.
Publicado: (2024)
por: Zhang, Jie, et al.
Publicado: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
por: Ghosal, Soumya Suvra, et al.
Publicado: (2024)
AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
por: Carlini, Nicholas, et al.
Publicado: (2025)
por: Carlini, Nicholas, et al.
Publicado: (2025)
Membership Inference Attacks Cannot Prove that a Model Was Trained On Your Data
por: Zhang, Jie, et al.
Publicado: (2024)
por: Zhang, Jie, et al.
Publicado: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
por: Qian, Cheng, et al.
Publicado: (2024)
por: Qian, Cheng, et al.
Publicado: (2024)
Black-box Optimization of LLM Outputs by Asking for Directions
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
por: Chen, Guangke, et al.
Publicado: (2025)
por: Chen, Guangke, et al.
Publicado: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Ejemplares similares
-
Universal Jailbreak Backdoors from Poisoned Human Feedback
por: Rando, Javier, et al.
Publicado: (2023) -
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
por: Rando, Javier, et al.
Publicado: (2024) -
Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks
por: Nurlanov, Zhakshylyk, et al.
Publicado: (2026) -
Gradient-based Jailbreak Images for Multimodal Fusion Models
por: Rando, Javier, et al.
Publicado: (2024) -
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
por: Hossain, Ismail, et al.
Publicado: (2026)