StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Bangxin, Xing, Hengrui, Tian, Cong, Huang, Chao, Qian, Jin, Xiao, Huangqing, Feng, Linfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
di: Zhang, Junke, et al.
Pubblicazione: (2026)
di: Zhang, Junke, et al.
Pubblicazione: (2026)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance
di: Zhang, Zaixi, et al.
Pubblicazione: (2025)
di: Zhang, Zaixi, et al.
Pubblicazione: (2025)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
di: Piet, Julien, et al.
Pubblicazione: (2025)
di: Piet, Julien, et al.
Pubblicazione: (2025)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models
di: Liu, Jiangtao, et al.
Pubblicazione: (2025)
di: Liu, Jiangtao, et al.
Pubblicazione: (2025)
Exploiting Prefix-Tree in Structured Output Interfaces for Enhancing Jailbreak Attacking
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate
di: Qi, Senmao, et al.
Pubblicazione: (2025)
di: Qi, Senmao, et al.
Pubblicazione: (2025)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
AutoTestForge: A Multidimensional Automated Testing Framework for Natural Language Processing Models
di: Xing, Hengrui, et al.
Pubblicazione: (2025)
di: Xing, Hengrui, et al.
Pubblicazione: (2025)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
di: Lu, Lin, et al.
Pubblicazione: (2024)
di: Lu, Lin, et al.
Pubblicazione: (2024)
SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
An Automated Attack Investigation Approach Leveraging Threat-Knowledge-Augmented Large Language Models
di: Dai, Rujie, et al.
Pubblicazione: (2025)
di: Dai, Rujie, et al.
Pubblicazione: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models
di: Choi, Wonwoo, et al.
Pubblicazione: (2026)
di: Choi, Wonwoo, et al.
Pubblicazione: (2026)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
Practical Reasoning Interruption Attacks on Reasoning Large Language Models
di: Cui, Yu, et al.
Pubblicazione: (2025)
di: Cui, Yu, et al.
Pubblicazione: (2025)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
di: Wang, Xiangwen, et al.
Pubblicazione: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)
di: Park, Junyoung, et al.
Pubblicazione: (2026)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
di: Weng, Fenghua, et al.
Pubblicazione: (2024)
di: Weng, Fenghua, et al.
Pubblicazione: (2024)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection
di: Zhou, Yuqi, et al.
Pubblicazione: (2024)
di: Zhou, Yuqi, et al.
Pubblicazione: (2024)
Jailbreaking Generative AI: Empowering Novices to Conduct Phishing Attacks
di: Mishra, Rina, et al.
Pubblicazione: (2025)
di: Mishra, Rina, et al.
Pubblicazione: (2025)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
di: Ouyang, Yang, et al.
Pubblicazione: (2025)
New Wide-Net-Casting Jailbreak Attacks Risk Large Models
di: Xiang, Qiuchi, et al.
Pubblicazione: (2026)
di: Xiang, Qiuchi, et al.
Pubblicazione: (2026)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
di: Das, Badhan Chandra, et al.
Pubblicazione: (2026)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
di: Chen, Yulin, et al.
Pubblicazione: (2024)
di: Chen, Yulin, et al.
Pubblicazione: (2024)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
di: Zhang, Junke, et al.
Pubblicazione: (2026) -
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
di: Zhang, Shenyi, et al.
Pubblicazione: (2025) -
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
di: Hong, Wenjing, et al.
Pubblicazione: (2026) -
GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance
di: Zhang, Zaixi, et al.
Pubblicazione: (2025) -
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
di: Piet, Julien, et al.
Pubblicazione: (2025)