Emoji-Based Jailbreaking of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Gopinadh, M P V S, Hussain, S Mahaboob |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Jailbreaking Large Language Models Through Content Concretization
por: Wahréus, Johan, et al.
Publicado: (2025)
por: Wahréus, Johan, et al.
Publicado: (2025)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
por: Das, Badhan Chandra, et al.
Publicado: (2026)
por: Das, Badhan Chandra, et al.
Publicado: (2026)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
por: Li, Jie, et al.
Publicado: (2024)
por: Li, Jie, et al.
Publicado: (2024)
ShallowJail: Steering Jailbreaks against Large Language Models
por: Liu, Shang, et al.
Publicado: (2026)
por: Liu, Shang, et al.
Publicado: (2026)
Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models
por: Zheng, Youjia, et al.
Publicado: (2025)
por: Zheng, Youjia, et al.
Publicado: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
SoK: Robustness in Large Language Models against Jailbreak Attacks
por: Xu, Feiyue, et al.
Publicado: (2026)
por: Xu, Feiyue, et al.
Publicado: (2026)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models
por: Zhang, Chuhan, et al.
Publicado: (2025)
por: Zhang, Chuhan, et al.
Publicado: (2025)
The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models
por: Wu, Zihui, et al.
Publicado: (2024)
por: Wu, Zihui, et al.
Publicado: (2024)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
por: Yang, Fan
Publicado: (2025)
por: Yang, Fan
Publicado: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
por: Wong, Ryan, et al.
Publicado: (2025)
por: Wong, Ryan, et al.
Publicado: (2025)
Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
por: Wu, Jinman, et al.
Publicado: (2026)
por: Wu, Jinman, et al.
Publicado: (2026)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
por: Hong, Wenjing, et al.
Publicado: (2026)
por: Hong, Wenjing, et al.
Publicado: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
por: Park, Junyoung, et al.
Publicado: (2026)
por: Park, Junyoung, et al.
Publicado: (2026)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
por: Song, Weiming, et al.
Publicado: (2026)
por: Song, Weiming, et al.
Publicado: (2026)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
por: Zhang, Deyue, et al.
Publicado: (2025)
por: Zhang, Deyue, et al.
Publicado: (2025)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
por: Teng, Ma, et al.
Publicado: (2024)
por: Teng, Ma, et al.
Publicado: (2024)
Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models
por: Li, Yakai, et al.
Publicado: (2025)
por: Li, Yakai, et al.
Publicado: (2025)
PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization
por: Liu, Aofan, et al.
Publicado: (2025)
por: Liu, Aofan, et al.
Publicado: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
por: Mia, Md Jueal, et al.
Publicado: (2026)
por: Mia, Md Jueal, et al.
Publicado: (2026)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025)
por: Gao, Kuofeng, et al.
Publicado: (2025)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
por: Xiong, Chen, et al.
Publicado: (2026)
por: Xiong, Chen, et al.
Publicado: (2026)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
por: Wang, Zhaoqi, et al.
Publicado: (2026)
por: Wang, Zhaoqi, et al.
Publicado: (2026)
HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
por: Narula, Sidhant, et al.
Publicado: (2025)
por: Narula, Sidhant, et al.
Publicado: (2025)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
por: Yang, Yiqi, et al.
Publicado: (2024)
por: Yang, Yiqi, et al.
Publicado: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
por: Ran, Delong, et al.
Publicado: (2024)
por: Ran, Delong, et al.
Publicado: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
por: Xiao, Zeguan, et al.
Publicado: (2024)
por: Xiao, Zeguan, et al.
Publicado: (2024)
Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction
por: Liu, Tong, et al.
Publicado: (2024)
por: Liu, Tong, et al.
Publicado: (2024)
Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation
por: Liu, Zehao, et al.
Publicado: (2025)
por: Liu, Zehao, et al.
Publicado: (2025)
Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles
por: Wang, Zhilong, et al.
Publicado: (2024)
por: Wang, Zhilong, et al.
Publicado: (2024)
On Jailbreaking Quantized Language Models Through Fault Injection Attacks
por: Zahran, Noureldin, et al.
Publicado: (2025)
por: Zahran, Noureldin, et al.
Publicado: (2025)
Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection
por: Wang, Zhilong, et al.
Publicado: (2024)
por: Wang, Zhilong, et al.
Publicado: (2024)
New Wide-Net-Casting Jailbreak Attacks Risk Large Models
por: Xiang, Qiuchi, et al.
Publicado: (2026)
por: Xiang, Qiuchi, et al.
Publicado: (2026)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
por: Zhao, Shiji, et al.
Publicado: (2025)
por: Zhao, Shiji, et al.
Publicado: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
por: Zou, Xiaotian, et al.
Publicado: (2024)
por: Zou, Xiaotian, et al.
Publicado: (2024)
Ejemplares similares
-
Jailbreaking Large Language Models Through Content Concretization
por: Wahréus, Johan, et al.
Publicado: (2025) -
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
por: Das, Badhan Chandra, et al.
Publicado: (2026) -
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
por: Li, Jie, et al.
Publicado: (2024) -
ShallowJail: Steering Jailbreaks against Large Language Models
por: Liu, Shang, et al.
Publicado: (2026) -
Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models
por: Zheng, Youjia, et al.
Publicado: (2025)