TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Zhi, Li, Jiaqi, Zhang, Xiaotong, Yu, Hong, Liu, Han |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HQA-Attack: Toward High Quality Black-Box Hard-Label Adversarial Attack on Text
von: Liu, Han, et al.
Veröffentlicht: (2024)
von: Liu, Han, et al.
Veröffentlicht: (2024)
SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack
von: Liu, Han, et al.
Veröffentlicht: (2026)
von: Liu, Han, et al.
Veröffentlicht: (2026)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
von: Shu, Dong, et al.
Veröffentlicht: (2024)
von: Shu, Dong, et al.
Veröffentlicht: (2024)
Jailbreaking Large Language Models with Morality Attacks
von: Su, Ying, et al.
Veröffentlicht: (2026)
von: Su, Ying, et al.
Veröffentlicht: (2026)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
von: Sun, Xiaobing, et al.
Veröffentlicht: (2026)
von: Sun, Xiaobing, et al.
Veröffentlicht: (2026)
Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models
von: Li, Jiahui, et al.
Veröffentlicht: (2024)
von: Li, Jiahui, et al.
Veröffentlicht: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models
von: Miao, Ziqi, et al.
Veröffentlicht: (2025)
von: Miao, Ziqi, et al.
Veröffentlicht: (2025)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
von: Mu, Honglin, et al.
Veröffentlicht: (2024)
von: Mu, Honglin, et al.
Veröffentlicht: (2024)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
von: Feng, Yingchaojie, et al.
Veröffentlicht: (2024)
von: Feng, Yingchaojie, et al.
Veröffentlicht: (2024)
SafeInt: Shielding Large Language Models from Jailbreak Attacks via Safety-Aware Representation Intervention
von: Wu, Jiaqi, et al.
Veröffentlicht: (2025)
von: Wu, Jiaqi, et al.
Veröffentlicht: (2025)
Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis
von: Lin, Yuping, et al.
Veröffentlicht: (2024)
von: Lin, Yuping, et al.
Veröffentlicht: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
von: Liu, Han, et al.
Veröffentlicht: (2026)
von: Liu, Han, et al.
Veröffentlicht: (2026)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
von: Yu, Miao, et al.
Veröffentlicht: (2024)
von: Yu, Miao, et al.
Veröffentlicht: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
von: Zou, Qingsong, et al.
Veröffentlicht: (2025)
von: Zou, Qingsong, et al.
Veröffentlicht: (2025)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2026)
Enhancing Jailbreak Attacks with Diversity Guidance
von: Zhang, Xu, et al.
Veröffentlicht: (2024)
von: Zhang, Xu, et al.
Veröffentlicht: (2024)
Jailbreaking Attack against Multimodal Large Language Model
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
von: Ying, Zonghao, et al.
Veröffentlicht: (2025)
von: Ying, Zonghao, et al.
Veröffentlicht: (2025)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
von: Yi, Xin, et al.
Veröffentlicht: (2025)
von: Yi, Xin, et al.
Veröffentlicht: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
von: Sun, Xiongtao, et al.
Veröffentlicht: (2024)
von: Sun, Xiongtao, et al.
Veröffentlicht: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
von: Li, Xiao, et al.
Veröffentlicht: (2024)
von: Li, Xiao, et al.
Veröffentlicht: (2024)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
von: Zhou, Andy, et al.
Veröffentlicht: (2024)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
von: Dong, Yiting, et al.
Veröffentlicht: (2024)
von: Dong, Yiting, et al.
Veröffentlicht: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
RUQuant: Towards Refining Uniform Quantization for Large Language Models
von: Liu, Han, et al.
Veröffentlicht: (2026)
von: Liu, Han, et al.
Veröffentlicht: (2026)
DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification
von: Li, Yu, et al.
Veröffentlicht: (2025)
von: Li, Yu, et al.
Veröffentlicht: (2025)
TF-Attack: Transferable and Fast Adversarial Attacks on Large Language Models
von: Li, Zelin, et al.
Veröffentlicht: (2024)
von: Li, Zelin, et al.
Veröffentlicht: (2024)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
von: Oh, Sejoon, et al.
Veröffentlicht: (2024)
von: Oh, Sejoon, et al.
Veröffentlicht: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
von: Yung, Canaan, et al.
Veröffentlicht: (2024)
von: Yung, Canaan, et al.
Veröffentlicht: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
von: Lin, Shi, et al.
Veröffentlicht: (2024)
von: Lin, Shi, et al.
Veröffentlicht: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
von: Kadali, Sri Durga Sai Sowmya, et al.
Veröffentlicht: (2026)
von: Kadali, Sri Durga Sai Sowmya, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
HQA-Attack: Toward High Quality Black-Box Hard-Label Adversarial Attack on Text
von: Liu, Han, et al.
Veröffentlicht: (2024) -
SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack
von: Liu, Han, et al.
Veröffentlicht: (2026) -
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
von: Shu, Dong, et al.
Veröffentlicht: (2024) -
Jailbreaking Large Language Models with Morality Attacks
von: Su, Ying, et al.
Veröffentlicht: (2026) -
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
von: Sun, Xiaobing, et al.
Veröffentlicht: (2026)