Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhaoqi, Zhang, Zijian, He, Daqing, Kou, Pengtao, Li, Xin, Liu, Jiamou, An, Jincheng, Liu, Yong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2025)
par: Wang, Zhaoqi, et autres
Publié: (2025)
Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction
par: Liu, Tong, et autres
Publié: (2024)
par: Liu, Tong, et autres
Publié: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
par: Yin, Ziyi, et autres
Publié: (2025)
par: Yin, Ziyi, et autres
Publié: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
par: Li, Jie, et autres
Publié: (2024)
par: Li, Jie, et autres
Publié: (2024)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
par: Hao, Shuyang, et autres
Publié: (2025)
par: Hao, Shuyang, et autres
Publié: (2025)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
par: Zhang, Shenyi, et autres
Publié: (2025)
par: Zhang, Shenyi, et autres
Publié: (2025)
SoK: Robustness in Large Language Models against Jailbreak Attacks
par: Xu, Feiyue, et autres
Publié: (2026)
par: Xu, Feiyue, et autres
Publié: (2026)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
par: Dong, Yiting, et autres
Publié: (2024)
par: Dong, Yiting, et autres
Publié: (2024)
Jailbreaking the Non-Transferable Barrier via Test-Time Data Disguising
par: Xiang, Yongli, et autres
Publié: (2025)
par: Xiang, Yongli, et autres
Publié: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
par: Wang, Youze, et autres
Publié: (2025)
par: Wang, Youze, et autres
Publié: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
par: Lu, Lin, et autres
Publié: (2024)
par: Lu, Lin, et autres
Publié: (2024)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
par: Wang, Xiangwen, et autres
Publié: (2026)
par: Wang, Xiangwen, et autres
Publié: (2026)
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
ELBA-Bench: An Efficient Learning Backdoor Attacks Benchmark for Large Language Models
par: Liu, Xuxu, et autres
Publié: (2025)
par: Liu, Xuxu, et autres
Publié: (2025)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
par: Cui, Tiehan, et autres
Publié: (2025)
par: Cui, Tiehan, et autres
Publié: (2025)
New Wide-Net-Casting Jailbreak Attacks Risk Large Models
par: Xiang, Qiuchi, et autres
Publié: (2026)
par: Xiang, Qiuchi, et autres
Publié: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
par: Park, Junyoung, et autres
Publié: (2026)
par: Park, Junyoung, et autres
Publié: (2026)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
par: Ma, Siyuan, et autres
Publié: (2024)
par: Ma, Siyuan, et autres
Publié: (2024)
Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
par: Yan, Yu, et autres
Publié: (2026)
par: Yan, Yu, et autres
Publié: (2026)
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
par: Chen, Xuan, et autres
Publié: (2024)
par: Chen, Xuan, et autres
Publié: (2024)
Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
par: Das, Badhan Chandra, et autres
Publié: (2026)
par: Das, Badhan Chandra, et autres
Publié: (2026)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
par: Wang, Xinkai, et autres
Publié: (2025)
par: Wang, Xinkai, et autres
Publié: (2025)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
par: Zhou, Guanghao, et autres
Publié: (2025)
par: Zhou, Guanghao, et autres
Publié: (2025)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
par: Deng, Gelei, et autres
Publié: (2023)
par: Deng, Gelei, et autres
Publié: (2023)
ShallowJail: Steering Jailbreaks against Large Language Models
par: Liu, Shang, et autres
Publié: (2026)
par: Liu, Shang, et autres
Publié: (2026)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
par: Weng, Fenghua, et autres
Publié: (2024)
par: Weng, Fenghua, et autres
Publié: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
par: Wang, Yidan, et autres
Publié: (2025)
par: Wang, Yidan, et autres
Publié: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
par: Kadali, Sri Durga Sai Sowmya, et autres
Publié: (2026)
par: Kadali, Sri Durga Sai Sowmya, et autres
Publié: (2026)
Disguised Copyright Infringement of Latent Diffusion Models
par: Lu, Yiwei, et autres
Publié: (2024)
par: Lu, Yiwei, et autres
Publié: (2024)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
par: Yang, Fan
Publié: (2025)
par: Yang, Fan
Publié: (2025)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
par: Feng, Yingchaojie, et autres
Publié: (2024)
par: Feng, Yingchaojie, et autres
Publié: (2024)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
par: Li, Xuan, et autres
Publié: (2023)
par: Li, Xuan, et autres
Publié: (2023)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
Documents similaires
-
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2025) -
Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction
par: Liu, Tong, et autres
Publié: (2024) -
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
par: Yin, Ziyi, et autres
Publié: (2025) -
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
par: Li, Jie, et autres
Publié: (2024) -
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
par: Hao, Shuyang, et autres
Publié: (2025)