ShallowJail: Steering Jailbreaks against Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Shang, Pei, Hanyu, Liu, Zeyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024)
por: Luo, Weidi, et al.
Publicado: (2024)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
por: Nian, Yi, et al.
Publicado: (2025)
por: Nian, Yi, et al.
Publicado: (2025)
JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs
por: Li, Hongyi, et al.
Publicado: (2024)
por: Li, Hongyi, et al.
Publicado: (2024)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
por: Xiong, Chen, et al.
Publicado: (2026)
por: Xiong, Chen, et al.
Publicado: (2026)
SoK: Robustness in Large Language Models against Jailbreak Attacks
por: Xu, Feiyue, et al.
Publicado: (2026)
por: Xu, Feiyue, et al.
Publicado: (2026)
LymphNode: A Plug-and-Play Access Control Method for Deep Neural Networks
por: Pei, Hanyu, et al.
Publicado: (2026)
por: Pei, Hanyu, et al.
Publicado: (2026)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
por: Zhang, Xinkai, et al.
Publicado: (2026)
por: Zhang, Xinkai, et al.
Publicado: (2026)
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025)
por: Gao, Kuofeng, et al.
Publicado: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
por: Li, Jie, et al.
Publicado: (2024)
por: Li, Jie, et al.
Publicado: (2024)
OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing
por: Chen, Jianming, et al.
Publicado: (2026)
por: Chen, Jianming, et al.
Publicado: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
por: Park, Junyoung, et al.
Publicado: (2026)
por: Park, Junyoung, et al.
Publicado: (2026)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
por: Song, Weiming, et al.
Publicado: (2026)
por: Song, Weiming, et al.
Publicado: (2026)
Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion
por: Pramanik, Vishal, et al.
Publicado: (2026)
por: Pramanik, Vishal, et al.
Publicado: (2026)
Emoji-Based Jailbreaking of Large Language Models
por: Gopinadh, M P V S, et al.
Publicado: (2026)
por: Gopinadh, M P V S, et al.
Publicado: (2026)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation
por: Liu, Zehao, et al.
Publicado: (2025)
por: Liu, Zehao, et al.
Publicado: (2025)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
por: Wang, Zhaoqi, et al.
Publicado: (2026)
por: Wang, Zhaoqi, et al.
Publicado: (2026)
PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization
por: Liu, Aofan, et al.
Publicado: (2025)
por: Liu, Aofan, et al.
Publicado: (2025)
Defending against Jailbreak through Early Exit Generation of Large Language Models
por: Zhao, Chongwen, et al.
Publicado: (2024)
por: Zhao, Chongwen, et al.
Publicado: (2024)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
por: Zhang, Deyue, et al.
Publicado: (2025)
por: Zhang, Deyue, et al.
Publicado: (2025)
Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection
por: Wang, Zhilong, et al.
Publicado: (2024)
por: Wang, Zhilong, et al.
Publicado: (2024)
Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models
por: Zheng, Youjia, et al.
Publicado: (2025)
por: Zheng, Youjia, et al.
Publicado: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
por: Ran, Delong, et al.
Publicado: (2024)
por: Ran, Delong, et al.
Publicado: (2024)
New Wide-Net-Casting Jailbreak Attacks Risk Large Models
por: Xiang, Qiuchi, et al.
Publicado: (2026)
por: Xiang, Qiuchi, et al.
Publicado: (2026)
Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction
por: Liu, Tong, et al.
Publicado: (2024)
por: Liu, Tong, et al.
Publicado: (2024)
Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles
por: Wang, Zhilong, et al.
Publicado: (2024)
por: Wang, Zhilong, et al.
Publicado: (2024)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
por: Das, Badhan Chandra, et al.
Publicado: (2026)
por: Das, Badhan Chandra, et al.
Publicado: (2026)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models
por: Zhang, Chuhan, et al.
Publicado: (2025)
por: Zhang, Chuhan, et al.
Publicado: (2025)
The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models
por: Wu, Zihui, et al.
Publicado: (2024)
por: Wu, Zihui, et al.
Publicado: (2024)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience
por: Wang, Xi, et al.
Publicado: (2025)
por: Wang, Xi, et al.
Publicado: (2025)
EVA: Editing for Versatile Alignment against Jailbreaks
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
por: Wang, Xunguang, et al.
Publicado: (2024)
por: Wang, Xunguang, et al.
Publicado: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024)
por: Jiang, Tanqiu, et al.
Publicado: (2024)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
por: Ma, Siyuan, et al.
Publicado: (2024)
por: Ma, Siyuan, et al.
Publicado: (2024)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
por: Yang, Fan
Publicado: (2025)
por: Yang, Fan
Publicado: (2025)
Ejemplares similares
-
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024) -
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
por: Nian, Yi, et al.
Publicado: (2025) -
JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs
por: Li, Hongyi, et al.
Publicado: (2024) -
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
por: Xiong, Chen, et al.
Publicado: (2026) -
SoK: Robustness in Large Language Models against Jailbreak Attacks
por: Xu, Feiyue, et al.
Publicado: (2026)