Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Weiyang, Shi, Zesheng, Li, Zhuo, Wang, Yequan, Liu, Xuebo, Wang, Wenya, Liu, Fangming, Zhang, Min, Li, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026)
par: Guo, Weiyang, et autres
Publié: (2026)
Multi-objective Large Language Model Alignment with Hierarchical Experts
par: Li, Zhuo, et autres
Publié: (2025)
par: Li, Zhuo, et autres
Publié: (2025)
Mitigating Context-Memory Conflicts in LLMs through Dynamic Cognitive Reconciliation Decoding
par: Zhou, Yigeng, et autres
Publié: (2026)
par: Zhou, Yigeng, et autres
Publié: (2026)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
par: Li, Wu, et autres
Publié: (2026)
par: Li, Wu, et autres
Publié: (2026)
Playing Language Game with LLMs Leads to Jailbreaking
par: Peng, Yu, et autres
Publié: (2024)
par: Peng, Yu, et autres
Publié: (2024)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2025)
par: Wang, Zhaoqi, et autres
Publié: (2025)
PathSeeker: Exploring LLM Security Vulnerabilities with a Reinforcement Learning-Based Jailbreak Approach
par: Lin, Zhihao, et autres
Publié: (2024)
par: Lin, Zhihao, et autres
Publié: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
par: Cui, Tiehan, et autres
Publié: (2025)
par: Cui, Tiehan, et autres
Publié: (2025)
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Jailbreaking LLMs via Calibration
par: Lu, Yuxuan, et autres
Publié: (2026)
par: Lu, Yuxuan, et autres
Publié: (2026)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
par: Guo, Weiyang, et autres
Publié: (2025)
par: Guo, Weiyang, et autres
Publié: (2025)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2026)
par: Wang, Zhaoqi, et autres
Publié: (2026)
Skill Weaving: Efficient LLM Improvement via Modular Skillpacks
par: Li, Zhuo, et autres
Publié: (2026)
par: Li, Zhuo, et autres
Publié: (2026)
Jailbreaking to Jailbreak
par: Kritz, Jeremy, et autres
Publié: (2025)
par: Kritz, Jeremy, et autres
Publié: (2025)
Knowledge Fusion of Large Language Models Via Modular SkillPacks
par: Du, Guodong, et autres
Publié: (2025)
par: Du, Guodong, et autres
Publié: (2025)
Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs
par: Li, Jianan, et autres
Publié: (2026)
par: Li, Jianan, et autres
Publié: (2026)
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
BadRobot: Jailbreaking Embodied LLMs in the Physical World
par: Zhang, Hangtao, et autres
Publié: (2024)
par: Zhang, Hangtao, et autres
Publié: (2024)
Poisoned LangChain: Jailbreak LLMs by LangChain
par: Wang, Ziqiu, et autres
Publié: (2024)
par: Wang, Ziqiu, et autres
Publié: (2024)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift
par: Wei, Zhihua, et autres
Publié: (2026)
par: Wei, Zhihua, et autres
Publié: (2026)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
par: Chen, Kexin, et autres
Publié: (2024)
par: Chen, Kexin, et autres
Publié: (2024)
Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs
par: Li, Xiaoxia, et autres
Publié: (2024)
par: Li, Xiaoxia, et autres
Publié: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
par: Xiong, Xiqiao, et autres
Publié: (2025)
par: Xiong, Xiqiao, et autres
Publié: (2025)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
par: Wang, Xunguang, et autres
Publié: (2024)
par: Wang, Xunguang, et autres
Publié: (2024)
Na'vi or Knave: Jailbreaking Language Models via Metaphorical Avatars
par: Yan, Yu, et autres
Publié: (2024)
par: Yan, Yu, et autres
Publié: (2024)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
par: Shen, Guangyu, et autres
Publié: (2024)
par: Shen, Guangyu, et autres
Publié: (2024)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
par: Chen, Wenyu, et autres
Publié: (2026)
par: Chen, Wenyu, et autres
Publié: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
par: Ji, Haoxuan, et autres
Publié: (2024)
par: Ji, Haoxuan, et autres
Publié: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
par: Zhou, Huilin, et autres
Publié: (2026)
par: Zhou, Huilin, et autres
Publié: (2026)
LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
par: DeepSeek-AI, et autres
Publié: (2025)
par: DeepSeek-AI, et autres
Publié: (2025)
E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning
par: Guo, Weiyang, et autres
Publié: (2026)
par: Guo, Weiyang, et autres
Publié: (2026)
Involuntary Jailbreak: On Self-Prompting Attacks
par: Guo, Yangyang, et autres
Publié: (2025)
par: Guo, Yangyang, et autres
Publié: (2025)
Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
par: Wang, Ziwei, et autres
Publié: (2026)
par: Wang, Ziwei, et autres
Publié: (2026)
Documents similaires
-
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026) -
Multi-objective Large Language Model Alignment with Hierarchical Experts
par: Li, Zhuo, et autres
Publié: (2025) -
Mitigating Context-Memory Conflicts in LLMs through Dynamic Cognitive Reconciliation Decoding
par: Zhou, Yigeng, et autres
Publié: (2026) -
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
par: Li, Wu, et autres
Publié: (2026) -
Playing Language Game with LLMs Leads to Jailbreaking
par: Peng, Yu, et autres
Publié: (2024)