Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Kumar, Shubham, Ahuja, Narendra |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Measuring the (Un)Faithfulness of Concept-Based Explanations
por: Kumar, Shubham, et al.
Publicado: (2025)
por: Kumar, Shubham, et al.
Publicado: (2025)
LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models
por: Bhatnagar, Shubhang, et al.
Publicado: (2025)
por: Bhatnagar, Shubhang, et al.
Publicado: (2025)
Locally-Minimal Probabilistic Explanations
por: Izza, Yacine, et al.
Publicado: (2023)
por: Izza, Yacine, et al.
Publicado: (2023)
GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-Explanation
por: Ramesh, Govind, et al.
Publicado: (2024)
por: Ramesh, Govind, et al.
Publicado: (2024)
Causality-Aware Local Interpretable Model-Agnostic Explanations
por: Cinquini, Martina, et al.
Publicado: (2022)
por: Cinquini, Martina, et al.
Publicado: (2022)
Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models
por: Ball, Sarah, et al.
Publicado: (2024)
por: Ball, Sarah, et al.
Publicado: (2024)
Piecewise-Linear Manifolds for Deep Metric Learning
por: Bhatnagar, Shubhang, et al.
Publicado: (2024)
por: Bhatnagar, Shubhang, et al.
Publicado: (2024)
Boosting Jailbreak Transferability for Large Language Models
por: Liu, Hanqing, et al.
Publicado: (2024)
por: Liu, Hanqing, et al.
Publicado: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
por: Zhou, Weikang, et al.
Publicado: (2024)
por: Zhou, Weikang, et al.
Publicado: (2024)
Potential Field Based Deep Metric Learning
por: Bhatnagar, Shubhang, et al.
Publicado: (2024)
por: Bhatnagar, Shubhang, et al.
Publicado: (2024)
Challenges and Applications of Large Language Models: A Comparison of GPT and DeepSeek family of models
por: Sharma, Shubham, et al.
Publicado: (2025)
por: Sharma, Shubham, et al.
Publicado: (2025)
Jailbreaking Large Language Models with Symbolic Mathematics
por: Bethany, Emet, et al.
Publicado: (2024)
por: Bethany, Emet, et al.
Publicado: (2024)
Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success
por: Maple, Carsten, et al.
Publicado: (2026)
por: Maple, Carsten, et al.
Publicado: (2026)
Emoji-Based Jailbreaking of Large Language Models
por: Gopinadh, M P V S, et al.
Publicado: (2026)
por: Gopinadh, M P V S, et al.
Publicado: (2026)
Jailbreaking Large Vision Language Models in Intelligent Transportation Systems
por: Das, Badhan Chandra, et al.
Publicado: (2025)
por: Das, Badhan Chandra, et al.
Publicado: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
por: Lee, Isack, et al.
Publicado: (2024)
por: Lee, Isack, et al.
Publicado: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
Improving Tool Retrieval by Leveraging Large Language Models for Query Generation
por: Kachuee, Mohammad, et al.
Publicado: (2024)
por: Kachuee, Mohammad, et al.
Publicado: (2024)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025)
por: Gao, Kuofeng, et al.
Publicado: (2025)
Large Causal Models from Large Language Models
por: Mahadevan, Sridhar
Publicado: (2025)
por: Mahadevan, Sridhar
Publicado: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
por: Li, Jie, et al.
Publicado: (2024)
por: Li, Jie, et al.
Publicado: (2024)
Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations
por: Rawlekar, Samyak, et al.
Publicado: (2024)
por: Rawlekar, Samyak, et al.
Publicado: (2024)
GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
por: Yu, Jiahao, et al.
Publicado: (2023)
por: Yu, Jiahao, et al.
Publicado: (2023)
Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models
por: Wit, Maria Carolina Cornelia, et al.
Publicado: (2025)
por: Wit, Maria Carolina Cornelia, et al.
Publicado: (2025)
ShallowJail: Steering Jailbreaks against Large Language Models
por: Liu, Shang, et al.
Publicado: (2026)
por: Liu, Shang, et al.
Publicado: (2026)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
por: Yang, Fan
Publicado: (2025)
por: Yang, Fan
Publicado: (2025)
Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models
por: Zheng, Youjia, et al.
Publicado: (2025)
por: Zheng, Youjia, et al.
Publicado: (2025)
Jailbreaking Black Box Large Language Models in Twenty Queries
por: Chao, Patrick, et al.
Publicado: (2023)
por: Chao, Patrick, et al.
Publicado: (2023)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
Causal Explanations for Image Classifiers
por: Chockler, Hana, et al.
Publicado: (2024)
por: Chockler, Hana, et al.
Publicado: (2024)
A Framework for Causal Concept-based Model Explanations
por: Bjøru, Anna Rodum, et al.
Publicado: (2025)
por: Bjøru, Anna Rodum, et al.
Publicado: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
por: Ran, Delong, et al.
Publicado: (2024)
por: Ran, Delong, et al.
Publicado: (2024)
Large Language Models as Nondeterministic Causal Models
por: Beckers, Sander
Publicado: (2025)
por: Beckers, Sander
Publicado: (2025)
Local Success Does Not Compose: Benchmarking Large Language Models for Compositional Formal Verification
por: Xu, Xu, et al.
Publicado: (2025)
por: Xu, Xu, et al.
Publicado: (2025)
Jailbreaking Large Language Models Through Content Concretization
por: Wahréus, Johan, et al.
Publicado: (2025)
por: Wahréus, Johan, et al.
Publicado: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
por: Xiao, Zeguan, et al.
Publicado: (2024)
por: Xiao, Zeguan, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
por: Zhao, Wei, et al.
Publicado: (2024)
por: Zhao, Wei, et al.
Publicado: (2024)
SoK: Robustness in Large Language Models against Jailbreak Attacks
por: Xu, Feiyue, et al.
Publicado: (2026)
por: Xu, Feiyue, et al.
Publicado: (2026)
Ejemplares similares
-
Measuring the (Un)Faithfulness of Concept-Based Explanations
por: Kumar, Shubham, et al.
Publicado: (2025) -
LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models
por: Bhatnagar, Shubhang, et al.
Publicado: (2025) -
Locally-Minimal Probabilistic Explanations
por: Izza, Yacine, et al.
Publicado: (2023) -
GPT-4 Jailbreaks Itself with Near-Perfect Success Using Self-Explanation
por: Ramesh, Govind, et al.
Publicado: (2024) -
Causality-Aware Local Interpretable Model-Agnostic Explanations
por: Cinquini, Martina, et al.
Publicado: (2022)