Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Xun, Qin, Simeng, Jia, Xiaoshuang, Duan, Ranjie, Yan, Huanqian, Zeng, Zhitao, Yang, Fei, Liu, Yang, Jia, Xiaojun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
di: Teng, Ma, et al.
Pubblicazione: (2024)
di: Teng, Ma, et al.
Pubblicazione: (2024)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
di: Gao, Sensen, et al.
Pubblicazione: (2024)
di: Gao, Sensen, et al.
Pubblicazione: (2024)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
di: Jia, Xiaojun, et al.
Pubblicazione: (2025)
di: Jia, Xiaojun, et al.
Pubblicazione: (2025)
SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents
di: Jia, Xiaojun, et al.
Pubblicazione: (2026)
di: Jia, Xiaojun, et al.
Pubblicazione: (2026)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
di: Wang, Fengxiang, et al.
Pubblicazione: (2024)
di: Wang, Fengxiang, et al.
Pubblicazione: (2024)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
di: Wang, Yanting, et al.
Pubblicazione: (2025)
di: Wang, Yanting, et al.
Pubblicazione: (2025)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
di: Li, Songze, et al.
Pubblicazione: (2026)
di: Li, Songze, et al.
Pubblicazione: (2026)
Chinese Remainder Theorem Approach to Montgomery-Type Algorithms
di: Xu, Guangwu, et al.
Pubblicazione: (2024)
di: Xu, Guangwu, et al.
Pubblicazione: (2024)
MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
di: Ye, Xi, et al.
Pubblicazione: (2026)
di: Ye, Xi, et al.
Pubblicazione: (2026)
LLM Jailbreak Detection for (Almost) Free!
di: Chen, Guorui, et al.
Pubblicazione: (2025)
di: Chen, Guorui, et al.
Pubblicazione: (2025)
Multimodal Unlearnable Examples: Protecting Data against Multimodal Contrastive Learning
di: Liu, Xinwei, et al.
Pubblicazione: (2024)
di: Liu, Xinwei, et al.
Pubblicazione: (2024)
Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
di: Wang, Ziwei, et al.
Pubblicazione: (2026)
di: Wang, Ziwei, et al.
Pubblicazione: (2026)
Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
JailGuard: A Universal Detection Framework for LLM Prompt-based Attacks
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2023)
Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
di: Li, Songze, et al.
Pubblicazione: (2025)
di: Li, Songze, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
di: Zeng, Churui, et al.
Pubblicazione: (2026)
di: Zeng, Churui, et al.
Pubblicazione: (2026)
Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt
di: Jenny, Maël, et al.
Pubblicazione: (2026)
di: Jenny, Maël, et al.
Pubblicazione: (2026)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Exposing Functional Fusion: A New Class of Strategic Backdoor in Dynamic Prompt Architectures
di: Liu, Zeyao, et al.
Pubblicazione: (2026)
di: Liu, Zeyao, et al.
Pubblicazione: (2026)
Involuntary Jailbreak: On Self-Prompting Attacks
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
PromptArmor: Simple yet Effective Prompt Injection Defenses
di: Shi, Tianneng, et al.
Pubblicazione: (2025)
di: Shi, Tianneng, et al.
Pubblicazione: (2025)
Security and Privacy Measurement on Chinese Consumer IoT Traffic based on Device Lifecycle
di: Jin, Chenghua, et al.
Pubblicazione: (2025)
di: Jin, Chenghua, et al.
Pubblicazione: (2025)
Sealing the Audit-Runtime Gap for LLM Skills
di: Shen, Tingda, et al.
Pubblicazione: (2026)
di: Shen, Tingda, et al.
Pubblicazione: (2026)
HidePrint: Protecting Device Anonymity by Obscuring Radio Fingerprints
di: Oligeri, Gabriele, et al.
Pubblicazione: (2024)
di: Oligeri, Gabriele, et al.
Pubblicazione: (2024)
Beyond Fixed and Dynamic Prompts: Embedded Jailbreak Templates for Advancing LLM Security
di: Kim, Hajun, et al.
Pubblicazione: (2025)
di: Kim, Hajun, et al.
Pubblicazione: (2025)
PromptLocate: Localizing Prompt Injection Attacks
di: Jia, Yuqi, et al.
Pubblicazione: (2025)
di: Jia, Yuqi, et al.
Pubblicazione: (2025)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense
di: Mai, Wuyuao, et al.
Pubblicazione: (2025)
di: Mai, Wuyuao, et al.
Pubblicazione: (2025)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
di: Chen, Guangke, et al.
Pubblicazione: (2025)
di: Chen, Guangke, et al.
Pubblicazione: (2025)
CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation
di: Zhang, Xiaolei, et al.
Pubblicazione: (2026)
di: Zhang, Xiaolei, et al.
Pubblicazione: (2026)
DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
di: Xiong, Chen, et al.
Pubblicazione: (2024)
di: Xiong, Chen, et al.
Pubblicazione: (2024)
Does Few-shot Learning Suffer from Backdoor Attacks?
di: Liu, Xinwei, et al.
Pubblicazione: (2023)
di: Liu, Xinwei, et al.
Pubblicazione: (2023)
Joint Optimization of Prompt Security and System Performance in Edge-Cloud LLM Systems
di: Huang, Haiyang, et al.
Pubblicazione: (2025)
di: Huang, Haiyang, et al.
Pubblicazione: (2025)
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
di: Qi, Weiwei, et al.
Pubblicazione: (2026)
di: Qi, Weiwei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024) -
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
di: Teng, Ma, et al.
Pubblicazione: (2024) -
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
di: Gao, Sensen, et al.
Pubblicazione: (2024) -
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
di: Jia, Xiaojun, et al.
Pubblicazione: (2025) -
SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents
di: Jia, Xiaojun, et al.
Pubblicazione: (2026)