Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Yuping, He, Pengfei, Xu, Han, Xing, Yue, Yamada, Makoto, Liu, Hui, Tang, Jiliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Knowledge Checking in Retrieval-augmented Generation: A Representation Perspective
di: Zeng, Shenglai, et al.
Pubblicazione: (2024)
di: Zeng, Shenglai, et al.
Pubblicazione: (2024)
Towards Context-Robust LLMs: A Gated Representation Fine-tuning Approach
di: Zeng, Shenglai, et al.
Pubblicazione: (2025)
di: Zeng, Shenglai, et al.
Pubblicazione: (2025)
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
di: Lin, Liang, et al.
Pubblicazione: (2025)
di: Lin, Liang, et al.
Pubblicazione: (2025)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
Retrieval Heads are Dynamic
di: Lin, Yuping, et al.
Pubblicazione: (2026)
di: Lin, Yuping, et al.
Pubblicazione: (2026)
Towards the Effect of Examples on In-Context Learning: A Theoretical Case Study
di: He, Pengfei, et al.
Pubblicazione: (2024)
di: He, Pengfei, et al.
Pubblicazione: (2024)
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
di: Xu, Zhi, et al.
Pubblicazione: (2026)
di: Xu, Zhi, et al.
Pubblicazione: (2026)
Data Poisoning for In-context Learning
di: He, Pengfei, et al.
Pubblicazione: (2024)
di: He, Pengfei, et al.
Pubblicazione: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs
di: Zhou, Yao, et al.
Pubblicazione: (2026)
di: Zhou, Yao, et al.
Pubblicazione: (2026)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
A Survey to Recent Progress Towards Understanding In-Context Learning
di: Mao, Haitao, et al.
Pubblicazione: (2024)
di: Mao, Haitao, et al.
Pubblicazione: (2024)
xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
di: Lv, Lijia, et al.
Pubblicazione: (2024)
di: Lv, Lijia, et al.
Pubblicazione: (2024)
RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
di: Luo, Xuan, et al.
Pubblicazione: (2025)
di: Luo, Xuan, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
Reasoning with Graphs: Structuring Implicit Knowledge to Enhance LLMs Reasoning
di: Han, Haoyu, et al.
Pubblicazione: (2025)
di: Han, Haoyu, et al.
Pubblicazione: (2025)
Automate Knowledge Concept Tagging on Math Questions with LLMs
di: Li, Hang, et al.
Pubblicazione: (2024)
di: Li, Hang, et al.
Pubblicazione: (2024)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
di: Wang, Zijun, et al.
Pubblicazione: (2024)
di: Wang, Zijun, et al.
Pubblicazione: (2024)
Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
Jailbreak Attacks and Defenses against Multimodal Generative Models: A Survey
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
di: Liu, Xuannan, et al.
Pubblicazione: (2024)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
di: Chen, Kexin, et al.
Pubblicazione: (2024)
di: Chen, Kexin, et al.
Pubblicazione: (2024)
Enhancing Jailbreak Attacks with Diversity Guidance
di: Zhang, Xu, et al.
Pubblicazione: (2024)
di: Zhang, Xu, et al.
Pubblicazione: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
On Verbalized Confidence Scores for LLMs
di: Yang, Daniel, et al.
Pubblicazione: (2024)
di: Yang, Daniel, et al.
Pubblicazione: (2024)
Exploring Memorization in Fine-tuned Language Models
di: Zeng, Shenglai, et al.
Pubblicazione: (2023)
di: Zeng, Shenglai, et al.
Pubblicazione: (2023)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
di: Guo, Xingang, et al.
Pubblicazione: (2024)
di: Guo, Xingang, et al.
Pubblicazione: (2024)
SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis
di: Wong, Aidan, et al.
Pubblicazione: (2024)
di: Wong, Aidan, et al.
Pubblicazione: (2024)
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
di: Poppi, Samuele, et al.
Pubblicazione: (2024)
di: Poppi, Samuele, et al.
Pubblicazione: (2024)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Knowledge Checking in Retrieval-augmented Generation: A Representation Perspective
di: Zeng, Shenglai, et al.
Pubblicazione: (2024) -
Towards Context-Robust LLMs: A Gated Representation Fine-tuning Approach
di: Zeng, Shenglai, et al.
Pubblicazione: (2025) -
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
di: Lin, Liang, et al.
Pubblicazione: (2025) -
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
di: Cui, Yingqian, et al.
Pubblicazione: (2024) -
Retrieval Heads are Dynamic
di: Lin, Yuping, et al.
Pubblicazione: (2026)