Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Yuping, He, Pengfei, Xu, Han, Xing, Yue, Yamada, Makoto, Liu, Hui, Tang, Jiliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Knowledge Checking in Retrieval-augmented Generation: A Representation Perspective
por: Zeng, Shenglai, et al.
Publicado: (2024)
por: Zeng, Shenglai, et al.
Publicado: (2024)
Towards Context-Robust LLMs: A Gated Representation Fine-tuning Approach
por: Zeng, Shenglai, et al.
Publicado: (2025)
por: Zeng, Shenglai, et al.
Publicado: (2025)
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
por: Lin, Liang, et al.
Publicado: (2025)
por: Lin, Liang, et al.
Publicado: (2025)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
por: Cui, Yingqian, et al.
Publicado: (2024)
por: Cui, Yingqian, et al.
Publicado: (2024)
Retrieval Heads are Dynamic
por: Lin, Yuping, et al.
Publicado: (2026)
por: Lin, Yuping, et al.
Publicado: (2026)
Towards the Effect of Examples on In-Context Learning: A Theoretical Case Study
por: He, Pengfei, et al.
Publicado: (2024)
por: He, Pengfei, et al.
Publicado: (2024)
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
por: Xu, Zhi, et al.
Publicado: (2026)
por: Xu, Zhi, et al.
Publicado: (2026)
Data Poisoning for In-context Learning
por: He, Pengfei, et al.
Publicado: (2024)
por: He, Pengfei, et al.
Publicado: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
por: Xu, Zhao, et al.
Publicado: (2024)
por: Xu, Zhao, et al.
Publicado: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
por: Liu, Fan, et al.
Publicado: (2024)
por: Liu, Fan, et al.
Publicado: (2024)
Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs
por: Zhou, Yao, et al.
Publicado: (2026)
por: Zhou, Yao, et al.
Publicado: (2026)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024)
por: Lin, Shi, et al.
Publicado: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
A Survey to Recent Progress Towards Understanding In-Context Learning
por: Mao, Haitao, et al.
Publicado: (2024)
por: Mao, Haitao, et al.
Publicado: (2024)
xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking
por: Lee, Sunbowen, et al.
Publicado: (2025)
por: Lee, Sunbowen, et al.
Publicado: (2025)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
por: Kadali, Sri Durga Sai Sowmya, et al.
Publicado: (2026)
por: Kadali, Sri Durga Sai Sowmya, et al.
Publicado: (2026)
DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
por: Lv, Lijia, et al.
Publicado: (2024)
por: Lv, Lijia, et al.
Publicado: (2024)
RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
por: Luo, Xuan, et al.
Publicado: (2025)
por: Luo, Xuan, et al.
Publicado: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
por: Chu, Junjie, et al.
Publicado: (2024)
por: Chu, Junjie, et al.
Publicado: (2024)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
por: Noughabi, Havva Alizadeh, et al.
Publicado: (2025)
por: Noughabi, Havva Alizadeh, et al.
Publicado: (2025)
Reasoning with Graphs: Structuring Implicit Knowledge to Enhance LLMs Reasoning
por: Han, Haoyu, et al.
Publicado: (2025)
por: Han, Haoyu, et al.
Publicado: (2025)
Automate Knowledge Concept Tagging on Math Questions with LLMs
por: Li, Hang, et al.
Publicado: (2024)
por: Li, Hang, et al.
Publicado: (2024)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
por: Wang, Zijun, et al.
Publicado: (2024)
por: Wang, Zijun, et al.
Publicado: (2024)
Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation
por: Meng, Wenlong, et al.
Publicado: (2025)
por: Meng, Wenlong, et al.
Publicado: (2025)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
por: Liu, Xuannan, et al.
Publicado: (2024)
por: Liu, Xuannan, et al.
Publicado: (2024)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
por: Chen, Kexin, et al.
Publicado: (2024)
por: Chen, Kexin, et al.
Publicado: (2024)
Enhancing Jailbreak Attacks with Diversity Guidance
por: Zhang, Xu, et al.
Publicado: (2024)
por: Zhang, Xu, et al.
Publicado: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
por: Wang, Yihan, et al.
Publicado: (2024)
por: Wang, Yihan, et al.
Publicado: (2024)
On Verbalized Confidence Scores for LLMs
por: Yang, Daniel, et al.
Publicado: (2024)
por: Yang, Daniel, et al.
Publicado: (2024)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
por: Guo, Xingang, et al.
Publicado: (2024)
por: Guo, Xingang, et al.
Publicado: (2024)
Exploring Memorization in Fine-tuned Language Models
por: Zeng, Shenglai, et al.
Publicado: (2023)
por: Zeng, Shenglai, et al.
Publicado: (2023)
SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis
por: Wong, Aidan, et al.
Publicado: (2024)
por: Wong, Aidan, et al.
Publicado: (2024)
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
por: Poppi, Samuele, et al.
Publicado: (2024)
por: Poppi, Samuele, et al.
Publicado: (2024)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
por: Cui, Yingqian, et al.
Publicado: (2025)
por: Cui, Yingqian, et al.
Publicado: (2025)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
por: Xing, Wenpeng, et al.
Publicado: (2025)
por: Xing, Wenpeng, et al.
Publicado: (2025)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
por: Yi, Xin, et al.
Publicado: (2025)
por: Yi, Xin, et al.
Publicado: (2025)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
por: Jiang, Fengqing, et al.
Publicado: (2024)
por: Jiang, Fengqing, et al.
Publicado: (2024)
ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Ejemplares similares
-
Towards Knowledge Checking in Retrieval-augmented Generation: A Representation Perspective
por: Zeng, Shenglai, et al.
Publicado: (2024) -
Towards Context-Robust LLMs: A Gated Representation Fine-tuning Approach
por: Zeng, Shenglai, et al.
Publicado: (2025) -
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
por: Lin, Liang, et al.
Publicado: (2025) -
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
por: Cui, Yingqian, et al.
Publicado: (2024) -
Retrieval Heads are Dynamic
por: Lin, Yuping, et al.
Publicado: (2026)