A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks
Fuente:
arXiv
Guardado en:
| Autores principales: | Bullwinkel, Blake, Russinovich, Mark, Salem, Ahmed, Zanella-Beguelin, Santiago, Jones, Daniel, Severi, Giorgio, Kim, Eugenia, Hines, Keegan, Minnich, Amanda, Zunger, Yonatan, Kumar, Ram Shankar Siva |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Trigger in the Haystack: Extracting and Reconstructing LLM Backdoor Triggers
por: Bullwinkel, Blake, et al.
Publicado: (2026)
por: Bullwinkel, Blake, et al.
Publicado: (2026)
GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt
por: Russinovich, Mark, et al.
Publicado: (2026)
por: Russinovich, Mark, et al.
Publicado: (2026)
A Systematization of Security Vulnerabilities in Computer Use Agents
por: Jones, Daniel, et al.
Publicado: (2025)
por: Jones, Daniel, et al.
Publicado: (2025)
Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
por: Russinovich, Mark, et al.
Publicado: (2024)
por: Russinovich, Mark, et al.
Publicado: (2024)
Lessons From Red Teaming 100 Generative AI Products
por: Bullwinkel, Blake, et al.
Publicado: (2025)
por: Bullwinkel, Blake, et al.
Publicado: (2025)
Jailbreaking is (Mostly) Simpler Than You Think
por: Russinovich, Mark, et al.
Publicado: (2025)
por: Russinovich, Mark, et al.
Publicado: (2025)
Defending Against Indirect Prompt Injection Attacks With Spotlighting
por: Hines, Keegan, et al.
Publicado: (2024)
por: Hines, Keegan, et al.
Publicado: (2024)
Securing AI Agents with Information-Flow Control
por: Costa, Manuel, et al.
Publicado: (2025)
por: Costa, Manuel, et al.
Publicado: (2025)
Obliviate: Efficient Unmemorization for Protecting Intellectual Property in Large Language Models
por: Russinovich, Mark, et al.
Publicado: (2025)
por: Russinovich, Mark, et al.
Publicado: (2025)
Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique
por: Russinovich, Mark, et al.
Publicado: (2024)
por: Russinovich, Mark, et al.
Publicado: (2024)
Optimizing Agent Planning for Security and Autonomy
por: Kolluri, Aashish, et al.
Publicado: (2026)
por: Kolluri, Aashish, et al.
Publicado: (2026)
PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System
por: Munoz, Gary D. Lopez, et al.
Publicado: (2024)
por: Munoz, Gary D. Lopez, et al.
Publicado: (2024)
Beyond Membership: Limitations of Add/Remove Adjacency in Differential Privacy
por: Pradhan, Gauri, et al.
Publicado: (2025)
por: Pradhan, Gauri, et al.
Publicado: (2025)
LogiPlan: A Structured Benchmark for Logical Planning and Relational Reasoning in LLMs
por: Cai, Yanan, et al.
Publicado: (2025)
por: Cai, Yanan, et al.
Publicado: (2025)
The Canary's Echo: Auditing Privacy Risks of LLM-Generated Synthetic Text
por: Meeus, Matthieu, et al.
Publicado: (2025)
por: Meeus, Matthieu, et al.
Publicado: (2025)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
por: Li, Tianlong, et al.
Publicado: (2024)
por: Li, Tianlong, et al.
Publicado: (2024)
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
por: Wen, Rui, et al.
Publicado: (2026)
por: Wen, Rui, et al.
Publicado: (2026)
Beyond the Single Turn: Reframing Refusals as Dynamic Experiences Embedded in the Context of Mental Health Support Interactions with LLMs
por: Tang, Ningjing, et al.
Publicado: (2026)
por: Tang, Ningjing, et al.
Publicado: (2026)
Closed-Form Bounds for DP-SGD against Record-level Inference
por: Cherubin, Giovanni, et al.
Publicado: (2024)
por: Cherubin, Giovanni, et al.
Publicado: (2024)
Many-Turn Jailbreaking
por: Yang, Xianjun, et al.
Publicado: (2025)
por: Yang, Xianjun, et al.
Publicado: (2025)
SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
por: Feng, Mingqian, et al.
Publicado: (2026)
por: Feng, Mingqian, et al.
Publicado: (2026)
TAMAÑO CORPORAL Y TEMPERATURA AMBIENTAL EN POBLACIONES CAZADORAS RECOLECTORAS DEL HOLOCENO TARDIO DE PAMPA Y PATAGONIA
por: Marien Béguelin
Publicado: (2010)
por: Marien Béguelin
Publicado: (2010)
ESTIMACION DEL SEXO EN POBLACIONES DEL SUR DE SUDAMERCIA MEDIANTE FUNCIONES DISCRIMINANTES PARA EL FEMUR
por: Marien Béguelin
Publicado: (2008)
por: Marien Béguelin
Publicado: (2008)
PONIENDO BLANCO SOBRE NEGRO: ANÁLISIS QUÍMICOS Y MICROSCÓPICOS SOBRE SEDIMENTOS Y RESTOS HUMANOS DE LA LAGUNA DEL JUNCAL (VALLE DEL RÍO NEGRO, NORPATAGONIA)
por: Marien Béguelin
Publicado: (2022)
por: Marien Béguelin
Publicado: (2022)
ESTIMACION DE LA ESTATURA EN MUESTRAS DEL HOLOCENO TARDIO DEL N.O. DE SANTA CRUZ: PROBLEMAS METODOLOGICOS
por: Marien Béguelin
Publicado: (2005)
por: Marien Béguelin
Publicado: (2005)
Estimación del sexo en cazadores-recolectores de Sudamérica a partir de variables métricas del húmero
por: Marien Béguelin
Publicado: (2011)
por: Marien Béguelin
Publicado: (2011)
Variación morfométrica postcraneal en muestras tardías de restos humanos de Patagonia: una aproximación biogeográfica
por: Marien Béguelin
Publicado: (2006)
por: Marien Béguelin
Publicado: (2006)
Permissive Information-Flow Analysis for Large Language Models
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2024)
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2024)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
por: He, Zhida, et al.
Publicado: (2026)
por: He, Zhida, et al.
Publicado: (2026)
Preparative, Enactive, and Intertwined Theories of Change: Cultural Practitioners Influencing Conflict in Ecuador
por: Sarah Ullom-Minnich
Publicado: (2019)
por: Sarah Ullom-Minnich
Publicado: (2019)
Lightning detection rates and wildland fire in the mountains of northern Baja California, Mexico
por: Richard A. Minnich
Publicado: (1993)
por: Richard A. Minnich
Publicado: (1993)
The "Clipping Thesis": A Year Later.
por: Minnich, Nancy P.
Publicado: (1987)
por: Minnich, Nancy P.
Publicado: (1987)
Microforms & Secondary Schools
por: Minnich, Nancy P.
Publicado: (1972)
por: Minnich, Nancy P.
Publicado: (1972)
Computerized Literature Search Services in an Engineering Library
por: Hines, David L.
Publicado: (1975)
por: Hines, David L.
Publicado: (1975)
Multi-Turn Jailbreaks Are Simpler Than They Seem
por: Yang, Xiaoxue, et al.
Publicado: (2025)
por: Yang, Xiaoxue, et al.
Publicado: (2025)
The Echo Chamber Multi-Turn LLM Jailbreak
por: Alobaid, Ahmad, et al.
Publicado: (2026)
por: Alobaid, Ahmad, et al.
Publicado: (2026)
Automating Deception: Scalable Multi-Turn LLM Jailbreaks
por: Kumarappan, Adarsh, et al.
Publicado: (2025)
por: Kumarappan, Adarsh, et al.
Publicado: (2025)
Projected Tensor-Tensor Products for Efficient Computation of Optimal Multiway Data Representations
por: Keegan, Katherine, et al.
Publicado: (2024)
por: Keegan, Katherine, et al.
Publicado: (2024)
Energy-lowering symmetry breaking creates a flat-band insulator in paramagnetic Nb3Cl8
por: Xiong, Jia-Xin, et al.
Publicado: (2024)
por: Xiong, Jia-Xin, et al.
Publicado: (2024)
Chameleon: Increasing Label-Only Membership Leakage with Adaptive Poisoning
por: Chaudhari, Harsh, et al.
Publicado: (2023)
por: Chaudhari, Harsh, et al.
Publicado: (2023)
Ejemplares similares
-
The Trigger in the Haystack: Extracting and Reconstructing LLM Backdoor Triggers
por: Bullwinkel, Blake, et al.
Publicado: (2026) -
GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt
por: Russinovich, Mark, et al.
Publicado: (2026) -
A Systematization of Security Vulnerabilities in Computer Use Agents
por: Jones, Daniel, et al.
Publicado: (2025) -
Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
por: Russinovich, Mark, et al.
Publicado: (2024) -
Lessons From Red Teaming 100 Generative AI Products
por: Bullwinkel, Blake, et al.
Publicado: (2025)