Jailbreaking LLMs via Calibration
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Yuxuan, Guo, Yongkang, Kong, Yuqing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
por: Mehrotra, Anay, et al.
Publicado: (2023)
por: Mehrotra, Anay, et al.
Publicado: (2023)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
por: Rando, Javier, et al.
Publicado: (2024)
por: Rando, Javier, et al.
Publicado: (2024)
KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs
por: Liang, Buyun, et al.
Publicado: (2025)
por: Liang, Buyun, et al.
Publicado: (2025)
Pruning for Protection: Increasing Jailbreak Resistance in Aligned LLMs Without Fine-Tuning
por: Hasan, Adib, et al.
Publicado: (2024)
por: Hasan, Adib, et al.
Publicado: (2024)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
por: Zhu, Sicheng, et al.
Publicado: (2024)
por: Zhu, Sicheng, et al.
Publicado: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024)
por: Lin, Shi, et al.
Publicado: (2024)
Jailbreaking in the Haystack
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
por: Mo, Yichuan, et al.
Publicado: (2024)
por: Mo, Yichuan, et al.
Publicado: (2024)
Jailbreaking with Universal Multi-Prompts
por: Hsu, Yu-Ling, et al.
Publicado: (2025)
por: Hsu, Yu-Ling, et al.
Publicado: (2025)
Rethinking How to Evaluate Language Model Jailbreak
por: Cai, Hongyu, et al.
Publicado: (2024)
por: Cai, Hongyu, et al.
Publicado: (2024)
Low-Resource Languages Jailbreak GPT-4
por: Yong, Zheng-Xin, et al.
Publicado: (2023)
por: Yong, Zheng-Xin, et al.
Publicado: (2023)
Jailbreaking Large Language Models with Symbolic Mathematics
por: Bethany, Emet, et al.
Publicado: (2024)
por: Bethany, Emet, et al.
Publicado: (2024)
Universal Jailbreak Backdoors from Poisoned Human Feedback
por: Rando, Javier, et al.
Publicado: (2023)
por: Rando, Javier, et al.
Publicado: (2023)
EnJa: Ensemble Jailbreak on Large Language Models
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking
por: Fang, Zhicheng, et al.
Publicado: (2026)
por: Fang, Zhicheng, et al.
Publicado: (2026)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
por: Qian, Cheng, et al.
Publicado: (2024)
por: Qian, Cheng, et al.
Publicado: (2024)
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
por: Wei, Zeming, et al.
Publicado: (2023)
por: Wei, Zeming, et al.
Publicado: (2023)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Is the System Message Really Important to Jailbreaks in Large Language Models?
por: Zou, Xiaotian, et al.
Publicado: (2024)
por: Zou, Xiaotian, et al.
Publicado: (2024)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
por: Hu, Xulin, et al.
Publicado: (2026)
por: Hu, Xulin, et al.
Publicado: (2026)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
por: Hua, Peichun, et al.
Publicado: (2025)
por: Hua, Peichun, et al.
Publicado: (2025)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
por: Jiang, Weisen, et al.
Publicado: (2025)
por: Jiang, Weisen, et al.
Publicado: (2025)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
por: Boreiko, Valentyn, et al.
Publicado: (2024)
por: Boreiko, Valentyn, et al.
Publicado: (2024)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
por: Zheng, Xiaosen, et al.
Publicado: (2024)
por: Zheng, Xiaosen, et al.
Publicado: (2024)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
por: Yao, Yang, et al.
Publicado: (2025)
por: Yao, Yang, et al.
Publicado: (2025)
STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents
por: Li, Jing-Jing, et al.
Publicado: (2025)
por: Li, Jing-Jing, et al.
Publicado: (2025)
Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming
por: Sharma, Mrinank, et al.
Publicado: (2025)
por: Sharma, Mrinank, et al.
Publicado: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
por: Reddy, Aashray, et al.
Publicado: (2025)
por: Reddy, Aashray, et al.
Publicado: (2025)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
por: Shen, Guangyu, et al.
Publicado: (2024)
por: Shen, Guangyu, et al.
Publicado: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
por: Hu, Xiaomeng, et al.
Publicado: (2024)
por: Hu, Xiaomeng, et al.
Publicado: (2024)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
por: Ahmed, Mohamed, et al.
Publicado: (2025)
por: Ahmed, Mohamed, et al.
Publicado: (2025)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
por: Li, Xiao, et al.
Publicado: (2024)
por: Li, Xiao, et al.
Publicado: (2024)
Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
por: Fang, Zheng, et al.
Publicado: (2026)
por: Fang, Zheng, et al.
Publicado: (2026)
A Systematic Literature Review on LLM Defenses Against Prompt Injection and Jailbreaking: Expanding NIST Taxonomy
por: Correia, Pedro H. Barcha, et al.
Publicado: (2026)
por: Correia, Pedro H. Barcha, et al.
Publicado: (2026)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
por: Saiem, Bijoy Ahmed, et al.
Publicado: (2024)
por: Saiem, Bijoy Ahmed, et al.
Publicado: (2024)
Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach
por: Wang, Tony T., et al.
Publicado: (2024)
por: Wang, Tony T., et al.
Publicado: (2024)
TurboFuzzLLM: Turbocharging Mutation-based Fuzzing for Effectively Jailbreaking Large Language Models in Practice
por: Goel, Aman, et al.
Publicado: (2025)
por: Goel, Aman, et al.
Publicado: (2025)
PromptScreen: Efficient Jailbreak Mitigation Using Semantic Linear Classification in a Multi-Staged Pipeline
por: Rao, Akshaj Prashanth, et al.
Publicado: (2025)
por: Rao, Akshaj Prashanth, et al.
Publicado: (2025)
Ejemplares similares
-
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024) -
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
por: Mehrotra, Anay, et al.
Publicado: (2023) -
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
por: Rando, Javier, et al.
Publicado: (2024) -
KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs
por: Liang, Buyun, et al.
Publicado: (2025) -
Pruning for Protection: Increasing Jailbreak Resistance in Aligned LLMs Without Fine-Tuning
por: Hasan, Adib, et al.
Publicado: (2024)