DeepInception: Hypnotize Large Language Model to Be Jailbreaker
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Xuan, Zhou, Zhanke, Zhu, Jianing, Yao, Jiangchao, Liu, Tongliang, Han, Bo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
von: Chao, Patrick, et al.
Veröffentlicht: (2024)
von: Chao, Patrick, et al.
Veröffentlicht: (2024)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
von: Lin, Runqi, et al.
Veröffentlicht: (2025)
von: Lin, Runqi, et al.
Veröffentlicht: (2025)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
von: Li, Songze, et al.
Veröffentlicht: (2026)
von: Li, Songze, et al.
Veröffentlicht: (2026)
Jailbreaking Large Language Models in Infinitely Many Ways
von: Goldstein, Oliver, et al.
Veröffentlicht: (2025)
von: Goldstein, Oliver, et al.
Veröffentlicht: (2025)
JULI: Jailbreak Large Language Models by Self-Introspection
von: Wang, Jesson, et al.
Veröffentlicht: (2025)
von: Wang, Jesson, et al.
Veröffentlicht: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
von: Li, Yuxi, et al.
Veröffentlicht: (2024)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
von: Peng, Benji, et al.
Veröffentlicht: (2024)
von: Peng, Benji, et al.
Veröffentlicht: (2024)
Jailbreaking the Non-Transferable Barrier via Test-Time Data Disguising
von: Xiang, Yongli, et al.
Veröffentlicht: (2025)
von: Xiang, Yongli, et al.
Veröffentlicht: (2025)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
von: Shen, Xinyue, et al.
Veröffentlicht: (2023)
von: Shen, Xinyue, et al.
Veröffentlicht: (2023)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
von: Reddy, Aashray, et al.
Veröffentlicht: (2025)
von: Reddy, Aashray, et al.
Veröffentlicht: (2025)
Adaptive Backtracking for Privacy Protection in Large Language Models
von: Yao, Zhihao, et al.
Veröffentlicht: (2025)
von: Yao, Zhihao, et al.
Veröffentlicht: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
von: Jia, Xiaojun, et al.
Veröffentlicht: (2024)
von: Jia, Xiaojun, et al.
Veröffentlicht: (2024)
Adversarial Inception Backdoor Attacks against Reinforcement Learning
von: Rathbun, Ethan, et al.
Veröffentlicht: (2024)
von: Rathbun, Ethan, et al.
Veröffentlicht: (2024)
A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos
von: Yao, Yang, et al.
Veröffentlicht: (2025)
von: Yao, Yang, et al.
Veröffentlicht: (2025)
Few-Shot Adversarial Prompt Learning on Vision-Language Models
von: Zhou, Yiwei, et al.
Veröffentlicht: (2024)
von: Zhou, Yiwei, et al.
Veröffentlicht: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
von: Lochab, Anamika, et al.
Veröffentlicht: (2025)
Defending Jailbreak Prompts via In-Context Adversarial Game
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips
von: Coalson, Zachary, et al.
Veröffentlicht: (2024)
von: Coalson, Zachary, et al.
Veröffentlicht: (2024)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
von: Galinkin, Erick, et al.
Veröffentlicht: (2024)
von: Galinkin, Erick, et al.
Veröffentlicht: (2024)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
von: Liang, Siyuan, et al.
Veröffentlicht: (2025)
von: Liang, Siyuan, et al.
Veröffentlicht: (2025)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
von: Hu, Kai, et al.
Veröffentlicht: (2025)
von: Hu, Kai, et al.
Veröffentlicht: (2025)
Jailbreaking Large Language Models with Symbolic Mathematics
von: Bethany, Emet, et al.
Veröffentlicht: (2024)
von: Bethany, Emet, et al.
Veröffentlicht: (2024)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Efficient Jailbreaking of Large Models by Freeze Training: Lower Layers Exhibit Greater Sensitivity to Harmful Content
von: Shen, Hongyuan, et al.
Veröffentlicht: (2025)
von: Shen, Hongyuan, et al.
Veröffentlicht: (2025)
DeepTracer: Tracing Stolen Model via Deep Coupled Watermarks
von: Yang, Yunfei, et al.
Veröffentlicht: (2025)
von: Yang, Yunfei, et al.
Veröffentlicht: (2025)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
von: Jiang, Yifan, et al.
Veröffentlicht: (2024)
von: Jiang, Yifan, et al.
Veröffentlicht: (2024)
ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
von: Liu, Xu, et al.
Veröffentlicht: (2025)
von: Liu, Xu, et al.
Veröffentlicht: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
von: Lin, Shi, et al.
Veröffentlicht: (2024)
von: Lin, Shi, et al.
Veröffentlicht: (2024)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
von: Chen, Wenyu, et al.
Veröffentlicht: (2026)
von: Chen, Wenyu, et al.
Veröffentlicht: (2026)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
von: Xiang, Zhen, et al.
Veröffentlicht: (2024)
von: Xiang, Zhen, et al.
Veröffentlicht: (2024)
Hijacking Large Language Models via Adversarial In-Context Learning
von: Zhou, Xiangyu, et al.
Veröffentlicht: (2023)
von: Zhou, Xiangyu, et al.
Veröffentlicht: (2023)
HIDBench: Benchmarking Large Language Models for Host-Based Intrusion Detection
von: Sun, Danyu, et al.
Veröffentlicht: (2026)
von: Sun, Danyu, et al.
Veröffentlicht: (2026)
EnJa: Ensemble Jailbreak on Large Language Models
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
On Large Language Model Continual Unlearning
von: Gao, Chongyang, et al.
Veröffentlicht: (2024)
von: Gao, Chongyang, et al.
Veröffentlicht: (2024)
Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities
von: Geng, Jiahui, et al.
Veröffentlicht: (2025)
von: Geng, Jiahui, et al.
Veröffentlicht: (2025)
AttnDiff: Attention-based Differential Fingerprinting for Large Language Models
von: Zhang, Haobo, et al.
Veröffentlicht: (2026)
von: Zhang, Haobo, et al.
Veröffentlicht: (2026)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
von: Jin, Haibo, et al.
Veröffentlicht: (2024)
von: Jin, Haibo, et al.
Veröffentlicht: (2024)
Stealthy and Adjustable Text-Guided Backdoor Attacks on Multimodal Pretrained Models
von: Zhang, Yiyang, et al.
Veröffentlicht: (2026)
von: Zhang, Yiyang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
von: Chao, Patrick, et al.
Veröffentlicht: (2024) -
Understanding and Enhancing the Transferability of Jailbreaking Attacks
von: Lin, Runqi, et al.
Veröffentlicht: (2025) -
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
von: Li, Songze, et al.
Veröffentlicht: (2026) -
Jailbreaking Large Language Models in Infinitely Many Ways
von: Goldstein, Oliver, et al.
Veröffentlicht: (2025) -
JULI: Jailbreak Large Language Models by Self-Introspection
von: Wang, Jesson, et al.
Veröffentlicht: (2025)