RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Peiran, Liu, Xiaogeng, Xiao, Chaowei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
por: Liu, Xiaogeng, et al.
Publicado: (2025)
por: Liu, Xiaogeng, et al.
Publicado: (2025)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
OET: Optimization-based prompt injection Evaluation Toolkit
por: Pan, Jinsheng, et al.
Publicado: (2025)
por: Pan, Jinsheng, et al.
Publicado: (2025)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024)
por: Luo, Weidi, et al.
Publicado: (2024)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
por: Ma, Siyuan, et al.
Publicado: (2024)
por: Ma, Siyuan, et al.
Publicado: (2024)
AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs
por: Liu, Xiaogeng, et al.
Publicado: (2024)
por: Liu, Xiaogeng, et al.
Publicado: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
por: Liu, Fan, et al.
Publicado: (2024)
por: Liu, Fan, et al.
Publicado: (2024)
ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models
por: Liu, Xiaogeng, et al.
Publicado: (2026)
por: Liu, Xiaogeng, et al.
Publicado: (2026)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
por: Wang, Xunguang, et al.
Publicado: (2024)
por: Wang, Xunguang, et al.
Publicado: (2024)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
por: Li, Xirui, et al.
Publicado: (2024)
por: Li, Xirui, et al.
Publicado: (2024)
Involuntary Jailbreak: On Self-Prompting Attacks
por: Guo, Yangyang, et al.
Publicado: (2025)
por: Guo, Yangyang, et al.
Publicado: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
por: Ma, Jiachen, et al.
Publicado: (2024)
por: Ma, Jiachen, et al.
Publicado: (2024)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Defenses Against Prompt Attacks Learn Surface Heuristics
por: Li, Shawn, et al.
Publicado: (2026)
por: Li, Shawn, et al.
Publicado: (2026)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
por: Jaiswal, Piyush, et al.
Publicado: (2026)
por: Jaiswal, Piyush, et al.
Publicado: (2026)
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
por: Wu, Daoyuan, et al.
Publicado: (2024)
por: Wu, Daoyuan, et al.
Publicado: (2024)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
por: Cui, Tiehan, et al.
Publicado: (2025)
por: Cui, Tiehan, et al.
Publicado: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024)
por: Jiang, Tanqiu, et al.
Publicado: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
Untargeted Jailbreak Attack
por: Huang, Xinzhe, et al.
Publicado: (2025)
por: Huang, Xinzhe, et al.
Publicado: (2025)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
por: Yu, Zhiyuan, et al.
Publicado: (2024)
por: Yu, Zhiyuan, et al.
Publicado: (2024)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
por: Nian, Yi, et al.
Publicado: (2025)
por: Nian, Yi, et al.
Publicado: (2025)
Retrieval-Confused Generation is a Good Defender for Privacy Violation Attack of Large Language Models
por: Peng, Wanli, et al.
Publicado: (2025)
por: Peng, Wanli, et al.
Publicado: (2025)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
por: Jiang, Weisen, et al.
Publicado: (2025)
por: Jiang, Weisen, et al.
Publicado: (2025)
Architecting Secure AI Agents: Perspectives on System-Level Defenses Against Indirect Prompt Injection Attacks
por: Xiang, Chong, et al.
Publicado: (2026)
por: Xiang, Chong, et al.
Publicado: (2026)
PIDP-Attack: Combining Prompt Injection with Database Poisoning Attacks on Retrieval-Augmented Generation Systems
por: Wang, Haozhen, et al.
Publicado: (2026)
por: Wang, Haozhen, et al.
Publicado: (2026)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
por: Wang, Zhaoqi, et al.
Publicado: (2026)
por: Wang, Zhaoqi, et al.
Publicado: (2026)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
por: Qian, Cheng, et al.
Publicado: (2024)
por: Qian, Cheng, et al.
Publicado: (2024)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
por: Wong, Ryan, et al.
Publicado: (2025)
por: Wong, Ryan, et al.
Publicado: (2025)
Efficient but Vulnerable: Benchmarking and Defending LLM Batch Prompting Attack
por: Yue, Murong, et al.
Publicado: (2025)
por: Yue, Murong, et al.
Publicado: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
por: Zhao, Chongwen, et al.
Publicado: (2024)
por: Zhao, Chongwen, et al.
Publicado: (2024)
Defending against Indirect Prompt Injection by Instruction Detection
por: Wen, Tongyu, et al.
Publicado: (2025)
por: Wen, Tongyu, et al.
Publicado: (2025)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
por: Xue, Zhiyu, et al.
Publicado: (2024)
por: Xue, Zhiyu, et al.
Publicado: (2024)
FlipAttack: Jailbreak LLMs via Flipping
por: Liu, Yue, et al.
Publicado: (2024)
por: Liu, Yue, et al.
Publicado: (2024)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
por: Wang, Zhaoqi, et al.
Publicado: (2025)
por: Wang, Zhaoqi, et al.
Publicado: (2025)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
por: Wu, Yuanwei, et al.
Publicado: (2023)
por: Wu, Yuanwei, et al.
Publicado: (2023)
Ejemplares similares
-
AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
por: Liu, Xiaogeng, et al.
Publicado: (2025) -
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
por: Wang, Yu, et al.
Publicado: (2024) -
OET: Optimization-based prompt injection Evaluation Toolkit
por: Pan, Jinsheng, et al.
Publicado: (2025) -
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024) -
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
por: Ma, Siyuan, et al.
Publicado: (2024)