Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jiahui, Hao, Yongchang, Xu, Haoyu, Wang, Xing, Hong, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
di: Xu, Zhi, et al.
Pubblicazione: (2026)
di: Xu, Zhi, et al.
Pubblicazione: (2026)
Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models
di: Xing, Xiaolin, et al.
Pubblicazione: (2024)
di: Xing, Xiaolin, et al.
Pubblicazione: (2024)
LLMR: Knowledge Distillation with a Large Language Model-Induced Reward
di: Li, Dongheng, et al.
Pubblicazione: (2024)
di: Li, Dongheng, et al.
Pubblicazione: (2024)
TokMem: One-Token Procedural Memory for Large Language Models
di: Wu, Zijun, et al.
Pubblicazione: (2025)
di: Wu, Zijun, et al.
Pubblicazione: (2025)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
Weak-to-Strong Jailbreaking on Large Language Models
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
di: Gao, Lang, et al.
Pubblicazione: (2024)
di: Gao, Lang, et al.
Pubblicazione: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
di: Cui, Chenhang, et al.
Pubblicazione: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Diversity Helps Jailbreak Large Language Models
di: Zhao, Weiliang, et al.
Pubblicazione: (2024)
di: Zhao, Weiliang, et al.
Pubblicazione: (2024)
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
di: Li, Ran, et al.
Pubblicazione: (2025)
di: Li, Ran, et al.
Pubblicazione: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models
di: Yu, Mingyu, et al.
Pubblicazione: (2025)
di: Yu, Mingyu, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Diffusion Models: Revealing Hidden Safety Flaws in Diffusion-Based Text Generation
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
di: Xu, Nan, et al.
Pubblicazione: (2023)
di: Xu, Nan, et al.
Pubblicazione: (2023)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models with Morality Attacks
di: Su, Ying, et al.
Pubblicazione: (2026)
di: Su, Ying, et al.
Pubblicazione: (2026)
iPrOp: Interactive Prompt Optimization for Large Language Models with a Human in the Loop
di: Li, Jiahui, et al.
Pubblicazione: (2024)
di: Li, Jiahui, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
di: Luo, Xuan, et al.
Pubblicazione: (2025)
di: Luo, Xuan, et al.
Pubblicazione: (2025)
Persona Jailbreaking in Large Language Models
di: Sandhan, Jivnesh, et al.
Pubblicazione: (2026)
di: Sandhan, Jivnesh, et al.
Pubblicazione: (2026)
Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
di: Zhou, Weikang, et al.
Pubblicazione: (2024)
Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models
di: Xu, Yue, et al.
Pubblicazione: (2024)
di: Xu, Yue, et al.
Pubblicazione: (2024)
Knowledge Editing for Large Language Model with Knowledge Neuronal Ensemble
di: Li, Yongchang, et al.
Pubblicazione: (2024)
di: Li, Yongchang, et al.
Pubblicazione: (2024)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
di: Jiang, Lei, et al.
Pubblicazione: (2025)
di: Jiang, Lei, et al.
Pubblicazione: (2025)
Multilingual Jailbreak Challenges in Large Language Models
di: Deng, Yue, et al.
Pubblicazione: (2023)
di: Deng, Yue, et al.
Pubblicazione: (2023)
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
CourseGPT-zh: an Educational Large Language Model Based on Knowledge Distillation Incorporating Prompt Optimization
di: Qu, Zheyan, et al.
Pubblicazione: (2024)
di: Qu, Zheyan, et al.
Pubblicazione: (2024)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Unleashing the Potential of Large Language Models as Prompt Optimizers: Analogical Analysis with Gradient-based Model Optimizers
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
di: Hua, Peichun, et al.
Pubblicazione: (2025)
di: Hua, Peichun, et al.
Pubblicazione: (2025)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
EnJa: Ensemble Jailbreak on Large Language Models
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
di: Xu, Zhi, et al.
Pubblicazione: (2026) -
Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models
di: Miao, Ziqi, et al.
Pubblicazione: (2025) -
Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models
di: Xing, Xiaolin, et al.
Pubblicazione: (2024) -
LLMR: Knowledge Distillation with a Large Language Model-Induced Reward
di: Li, Dongheng, et al.
Pubblicazione: (2024) -
TokMem: One-Token Procedural Memory for Large Language Models
di: Wu, Zijun, et al.
Pubblicazione: (2025)