Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ball, Sarah, Kreuter, Frauke, Panickssery, Nina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Human Preferences in Large Language Model Latent Space: A Technical Analysis on the Reliability of Synthetic Data in Voting Outcome Prediction
di: Ball, Sarah, et al.
Pubblicazione: (2025)
di: Ball, Sarah, et al.
Pubblicazione: (2025)
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
di: Mura, Raffaele, et al.
Pubblicazione: (2025)
di: Mura, Raffaele, et al.
Pubblicazione: (2025)
Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct
di: Ackerman, Christopher, et al.
Pubblicazione: (2024)
di: Ackerman, Christopher, et al.
Pubblicazione: (2024)
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
di: Ball, Sarah, et al.
Pubblicazione: (2025)
di: Ball, Sarah, et al.
Pubblicazione: (2025)
Refusal in Language Models Is Mediated by a Single Direction
di: Arditi, Andy, et al.
Pubblicazione: (2024)
di: Arditi, Andy, et al.
Pubblicazione: (2024)
From Ground Truth to Measurement: A Statistical Framework for Human Labeling
di: Chew, Robert, et al.
Pubblicazione: (2026)
di: Chew, Robert, et al.
Pubblicazione: (2026)
Mitigating Many-Shot Jailbreaking
di: Ackerman, Christopher M., et al.
Pubblicazione: (2025)
di: Ackerman, Christopher M., et al.
Pubblicazione: (2025)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
di: Lee, Isack, et al.
Pubblicazione: (2024)
di: Lee, Isack, et al.
Pubblicazione: (2024)
Single-pass Detection of Jailbreaking Input in Large Language Models
di: Candogan, Leyla Naz, et al.
Pubblicazione: (2025)
di: Candogan, Leyla Naz, et al.
Pubblicazione: (2025)
Steering Llama 2 via Contrastive Activation Addition
di: Panickssery, Nina, et al.
Pubblicazione: (2023)
di: Panickssery, Nina, et al.
Pubblicazione: (2023)
Variation in Verification: Understanding Verification Dynamics in Large Language Models
di: Zhou, Yefan, et al.
Pubblicazione: (2025)
di: Zhou, Yefan, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models with Symbolic Mathematics
di: Bethany, Emet, et al.
Pubblicazione: (2024)
di: Bethany, Emet, et al.
Pubblicazione: (2024)
Large Language Models Explore by Latent Distilling
di: Zeng, Yuanhao, et al.
Pubblicazione: (2026)
di: Zeng, Yuanhao, et al.
Pubblicazione: (2026)
EnJa: Ensemble Jailbreak on Large Language Models
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
Understanding Understanding: A Pragmatic Framework Motivated by Large Language Models
di: Leyton-Brown, Kevin, et al.
Pubblicazione: (2024)
di: Leyton-Brown, Kevin, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection
di: Hu, Xulin, et al.
Pubblicazione: (2026)
di: Hu, Xulin, et al.
Pubblicazione: (2026)
Understanding Subword Compositionality of Large Language Models
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
di: Xu, Yi, et al.
Pubblicazione: (2026)
di: Xu, Yi, et al.
Pubblicazione: (2026)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
di: Boreiko, Valentyn, et al.
Pubblicazione: (2024)
GUNDAM: Aligning Large Language Models with Graph Understanding
di: Ouyang, Sheng, et al.
Pubblicazione: (2024)
di: Ouyang, Sheng, et al.
Pubblicazione: (2024)
Local Topology Measures of Contextual Language Model Latent Spaces With Applications to Dialogue Term Extraction
di: Ruppik, Benjamin Matthias, et al.
Pubblicazione: (2024)
di: Ruppik, Benjamin Matthias, et al.
Pubblicazione: (2024)
Demystifying Embedding Spaces using Large Language Models
di: Tennenholtz, Guy, et al.
Pubblicazione: (2023)
di: Tennenholtz, Guy, et al.
Pubblicazione: (2023)
Meanings and Feelings of Large Language Models: Observability of Latent States in Generative AI
di: Liu, Tian Yu, et al.
Pubblicazione: (2024)
di: Liu, Tian Yu, et al.
Pubblicazione: (2024)
Counterfactual Token Generation in Large Language Models
di: Chatzi, Ivi, et al.
Pubblicazione: (2024)
di: Chatzi, Ivi, et al.
Pubblicazione: (2024)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
di: Hua, Peichun, et al.
Pubblicazione: (2025)
di: Hua, Peichun, et al.
Pubblicazione: (2025)
LSEBMCL: A Latent Space Energy-Based Model for Continual Learning
di: Li, Xiaodi, et al.
Pubblicazione: (2025)
di: Li, Xiaodi, et al.
Pubblicazione: (2025)
Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
Can Large Language Models Understand Intermediate Representations in Compilers?
di: Jiang, Hailong, et al.
Pubblicazione: (2025)
di: Jiang, Hailong, et al.
Pubblicazione: (2025)
Language over Content: Tracing Cultural Understanding in Multilingual Large Language Models
di: Cho, Seungho, et al.
Pubblicazione: (2025)
di: Cho, Seungho, et al.
Pubblicazione: (2025)
Model-diff: A Tool for Comparative Study of Language Models in the Input Space
di: Liu, Weitang, et al.
Pubblicazione: (2024)
di: Liu, Weitang, et al.
Pubblicazione: (2024)
Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
A Dual-Space Framework for General Knowledge Distillation of Large Language Models
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
Can Large Language Models Understand Molecules?
di: Sadeghi, Shaghayegh, et al.
Pubblicazione: (2024)
di: Sadeghi, Shaghayegh, et al.
Pubblicazione: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
di: Reddy, Aashray, et al.
Pubblicazione: (2025)
di: Reddy, Aashray, et al.
Pubblicazione: (2025)
GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models
di: Mahran, Mariam, et al.
Pubblicazione: (2025)
di: Mahran, Mariam, et al.
Pubblicazione: (2025)
Rethinking How to Evaluate Language Model Jailbreak
di: Cai, Hongyu, et al.
Pubblicazione: (2024)
di: Cai, Hongyu, et al.
Pubblicazione: (2024)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
di: Slagle, Kevin
Pubblicazione: (2024)
di: Slagle, Kevin
Pubblicazione: (2024)
Documenti analoghi
-
Human Preferences in Large Language Model Latent Space: A Technical Analysis on the Reliability of Synthetic Data in Voting Outcome Prediction
di: Ball, Sarah, et al.
Pubblicazione: (2025) -
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
di: Mura, Raffaele, et al.
Pubblicazione: (2025) -
Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct
di: Ackerman, Christopher, et al.
Pubblicazione: (2024) -
Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
di: Ball, Sarah, et al.
Pubblicazione: (2025) -
Refusal in Language Models Is Mediated by a Single Direction
di: Arditi, Andy, et al.
Pubblicazione: (2024)