Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Songze, He, Ruishi, Jia, Xiaojun, Wang, Jun, Fu, Zhihui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models
por: Chu, Fengheng, et al.
Publicado: (2026)
por: Chu, Fengheng, et al.
Publicado: (2026)
ReCIT: Reconstructing Full Private Data from Gradient in Parameter-Efficient Fine-Tuning of Large Language Models
por: Xie, Jin, et al.
Publicado: (2025)
por: Xie, Jin, et al.
Publicado: (2025)
TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
por: Li, Songze, et al.
Publicado: (2024)
por: Li, Songze, et al.
Publicado: (2024)
Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
por: Li, Songze, et al.
Publicado: (2025)
por: Li, Songze, et al.
Publicado: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
por: Reddy, Aashray, et al.
Publicado: (2025)
por: Reddy, Aashray, et al.
Publicado: (2025)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
por: Jiang, Yifan, et al.
Publicado: (2024)
por: Jiang, Yifan, et al.
Publicado: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
por: Jia, Xiaojun, et al.
Publicado: (2024)
por: Jia, Xiaojun, et al.
Publicado: (2024)
FuncPoison: Poisoning Function Library to Hijack Multi-agent Autonomous Driving Systems
por: Long, Yuzhen, et al.
Publicado: (2025)
por: Long, Yuzhen, et al.
Publicado: (2025)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
por: Chao, Patrick, et al.
Publicado: (2024)
por: Chao, Patrick, et al.
Publicado: (2024)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
JULI: Jailbreak Large Language Models by Self-Introspection
por: Wang, Jesson, et al.
Publicado: (2025)
por: Wang, Jesson, et al.
Publicado: (2025)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
por: Li, Xuan, et al.
Publicado: (2023)
por: Li, Xuan, et al.
Publicado: (2023)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
por: Wang, Xiangwen, et al.
Publicado: (2026)
por: Wang, Xiangwen, et al.
Publicado: (2026)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
por: Reddy, Aashray, et al.
Publicado: (2025)
por: Reddy, Aashray, et al.
Publicado: (2025)
Jailbreaking Large Language Models in Infinitely Many Ways
por: Goldstein, Oliver, et al.
Publicado: (2025)
por: Goldstein, Oliver, et al.
Publicado: (2025)
Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion Models
por: Wang, Kai, et al.
Publicado: (2026)
por: Wang, Kai, et al.
Publicado: (2026)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
por: Chen, Guangke, et al.
Publicado: (2025)
por: Chen, Guangke, et al.
Publicado: (2025)
PoisonedRAG: Knowledge Corruption Attacks to Retrieval-Augmented Generation of Large Language Models
por: Zou, Wei, et al.
Publicado: (2024)
por: Zou, Wei, et al.
Publicado: (2024)
Constructing Adversarial Examples for Vertical Federated Learning: Optimal Client Corruption through Multi-Armed Bandit
por: Yao, Duanyi, et al.
Publicado: (2024)
por: Yao, Duanyi, et al.
Publicado: (2024)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
por: Shen, Xinyue, et al.
Publicado: (2023)
por: Shen, Xinyue, et al.
Publicado: (2023)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
por: Li, Nathaniel, et al.
Publicado: (2024)
por: Li, Nathaniel, et al.
Publicado: (2024)
Noise as a Probe: Membership Inference Attacks on Diffusion Models Leveraging Initial Noise
por: Lian, Puwei, et al.
Publicado: (2026)
por: Lian, Puwei, et al.
Publicado: (2026)
Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective
por: Lian, Puwei, et al.
Publicado: (2025)
por: Lian, Puwei, et al.
Publicado: (2025)
Turn-Based Structural Triggers: Prompt-Free Backdoors in Multi-Turn LLMs
por: Lu, Yiyang, et al.
Publicado: (2026)
por: Lu, Yiyang, et al.
Publicado: (2026)
DeDe: Detecting Backdoor Samples for SSL Encoders via Decoders
por: Hou, Sizai, et al.
Publicado: (2024)
por: Hou, Sizai, et al.
Publicado: (2024)
OmniLytics+: A Secure, Efficient, and Affordable Blockchain Data Market for Machine Learning through Off-Chain Processing
por: Li, Songze, et al.
Publicado: (2024)
por: Li, Songze, et al.
Publicado: (2024)
TrojanDam: Detection-Free Backdoor Defense in Federated Learning through Proactive Model Robustification utilizing OOD Data
por: Dai, Yanbo, et al.
Publicado: (2025)
por: Dai, Yanbo, et al.
Publicado: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
zkLLM: Zero Knowledge Proofs for Large Language Models
por: Sun, Haochen, et al.
Publicado: (2024)
por: Sun, Haochen, et al.
Publicado: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
por: Lochab, Anamika, et al.
Publicado: (2025)
por: Lochab, Anamika, et al.
Publicado: (2025)
Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models
por: Yao, Duanyi, et al.
Publicado: (2026)
por: Yao, Duanyi, et al.
Publicado: (2026)
Efficient Jailbreaking of Large Models by Freeze Training: Lower Layers Exhibit Greater Sensitivity to Harmful Content
por: Shen, Hongyuan, et al.
Publicado: (2025)
por: Shen, Hongyuan, et al.
Publicado: (2025)
Visual CoT Makes VLMs Smarter but More Fragile
por: Xu, Chunxue, et al.
Publicado: (2025)
por: Xu, Chunxue, et al.
Publicado: (2025)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
por: Galinkin, Erick, et al.
Publicado: (2024)
por: Galinkin, Erick, et al.
Publicado: (2024)
EnJa: Ensemble Jailbreak on Large Language Models
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
por: Hu, Kai, et al.
Publicado: (2025)
por: Hu, Kai, et al.
Publicado: (2025)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
por: Xie, Zhixin, et al.
Publicado: (2026)
por: Xie, Zhixin, et al.
Publicado: (2026)
Ejemplares similares
-
Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models
por: Chu, Fengheng, et al.
Publicado: (2026) -
ReCIT: Reconstructing Full Private Data from Gradient in Parameter-Efficient Fine-Tuning of Large Language Models
por: Xie, Jin, et al.
Publicado: (2025) -
TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
por: Li, Songze, et al.
Publicado: (2024) -
Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
por: Li, Songze, et al.
Publicado: (2025) -
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
por: Reddy, Aashray, et al.
Publicado: (2025)