Imperceptible Jailbreaking against Large Language Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Gao, Kuofeng, Li, Yiming, Du, Chao, Wang, Xin, Ma, Xingjun, Xia, Shu-Tao, Pang, Tianyu
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866914077936189440
author Gao, Kuofeng
Li, Yiming
Du, Chao
Wang, Xin
Ma, Xingjun
Xia, Shu-Tao
Pang, Tianyu
author_facet Gao, Kuofeng
Li, Yiming
Du, Chao
Wang, Xin
Ma, Xingjun
Xia, Shu-Tao
Pang, Tianyu
contents Jailbreaking attacks on the vision modality typically rely on imperceptible adversarial perturbations, whereas attacks on the textual modality are generally assumed to require visible modifications (e.g., non-semantic suffixes). In this paper, we introduce imperceptible jailbreaks that exploit a class of Unicode characters called variation selectors. By appending invisible variation selectors to malicious questions, the jailbreak prompts appear visually identical to original malicious questions on screen, while their tokenization is "secretly" altered. We propose a chain-of-search pipeline to generate such adversarial suffixes to induce harmful responses. Our experiments show that our imperceptible jailbreaks achieve high attack success rates against four aligned LLMs and generalize to prompt injection attacks, all without producing any visible modifications in the written prompt. Our code is available at https://github.com/sail-sg/imperceptible-jailbreaks.
format Preprint
id arxiv_https___arxiv_org_abs_2510_05025
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Imperceptible Jailbreaking against Large Language Models
Gao, Kuofeng
Li, Yiming
Du, Chao
Wang, Xin
Ma, Xingjun
Xia, Shu-Tao
Pang, Tianyu
Computation and Language
Artificial Intelligence
Cryptography and Security
Jailbreaking attacks on the vision modality typically rely on imperceptible adversarial perturbations, whereas attacks on the textual modality are generally assumed to require visible modifications (e.g., non-semantic suffixes). In this paper, we introduce imperceptible jailbreaks that exploit a class of Unicode characters called variation selectors. By appending invisible variation selectors to malicious questions, the jailbreak prompts appear visually identical to original malicious questions on screen, while their tokenization is "secretly" altered. We propose a chain-of-search pipeline to generate such adversarial suffixes to induce harmful responses. Our experiments show that our imperceptible jailbreaks achieve high attack success rates against four aligned LLMs and generalize to prompt injection attacks, all without producing any visible modifications in the written prompt. Our code is available at https://github.com/sail-sg/imperceptible-jailbreaks.
title Imperceptible Jailbreaking against Large Language Models
topic Computation and Language
Artificial Intelligence
Cryptography and Security
url https://arxiv.org/abs/2510.05025