When LLM Meets DRL: Advancing Jailbreaking Efficiency via DRL-guided Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Xuan, Nie, Yuzhou, Guo, Wenbo, Zhang, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
di: Chen, Xuan, et al.
Pubblicazione: (2024)
di: Chen, Xuan, et al.
Pubblicazione: (2024)
A DRL-Empowered Multi-Level Jamming Approach for Secure Semantic Communication
di: Chen, Weixuan, et al.
Pubblicazione: (2025)
di: Chen, Weixuan, et al.
Pubblicazione: (2025)
TBDD: A New Trust-based, DRL-driven Framework for Blockchain Sharding in IoT
di: Zhang, Zixu, et al.
Pubblicazione: (2024)
di: Zhang, Zixu, et al.
Pubblicazione: (2024)
Backdoors in DRL: Four Environments Focusing on In-distribution Triggers
di: Ashcraft, Chace, et al.
Pubblicazione: (2025)
di: Ashcraft, Chace, et al.
Pubblicazione: (2025)
VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
di: Nie, Yuzhou, et al.
Pubblicazione: (2025)
di: Nie, Yuzhou, et al.
Pubblicazione: (2025)
Carbon-Aware Intrusion Detection: A Comparative Study of Supervised and Unsupervised DRL for Sustainable IoT Edge Gateways
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
di: Jamshidi, Saeid, et al.
Pubblicazione: (2025)
LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage
di: Nie, Yuzhou, et al.
Pubblicazione: (2024)
di: Nie, Yuzhou, et al.
Pubblicazione: (2024)
MalwarePT: A Binary-Level Foundation Model for Malware Analysis
di: Vasan, Saastha, et al.
Pubblicazione: (2026)
di: Vasan, Saastha, et al.
Pubblicazione: (2026)
Beyond Fixed and Dynamic Prompts: Embedded Jailbreak Templates for Advancing LLM Security
di: Kim, Hajun, et al.
Pubblicazione: (2025)
di: Kim, Hajun, et al.
Pubblicazione: (2025)
AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents
di: Wang, Zhun, et al.
Pubblicazione: (2025)
di: Wang, Zhun, et al.
Pubblicazione: (2025)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
di: Dong, Xiaoning, et al.
Pubblicazione: (2024)
di: Dong, Xiaoning, et al.
Pubblicazione: (2024)
HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking
di: Wang, Zeng, et al.
Pubblicazione: (2026)
di: Wang, Zeng, et al.
Pubblicazione: (2026)
Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
di: Zhang, Junke, et al.
Pubblicazione: (2026)
di: Zhang, Junke, et al.
Pubblicazione: (2026)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
di: Xiong, Chen, et al.
Pubblicazione: (2024)
di: Xiong, Chen, et al.
Pubblicazione: (2024)
Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving
di: Chen, Xuan, et al.
Pubblicazione: (2025)
di: Chen, Xuan, et al.
Pubblicazione: (2025)
MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
di: Ye, Xi, et al.
Pubblicazione: (2026)
di: Ye, Xi, et al.
Pubblicazione: (2026)
Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety
di: Chen, Xuan, et al.
Pubblicazione: (2026)
di: Chen, Xuan, et al.
Pubblicazione: (2026)
MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection
di: Chen, Xuan, et al.
Pubblicazione: (2026)
di: Chen, Xuan, et al.
Pubblicazione: (2026)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2025)
di: Wang, Zhaoqi, et al.
Pubblicazione: (2025)
Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks
di: Geng, Jianing, et al.
Pubblicazione: (2025)
di: Geng, Jianing, et al.
Pubblicazione: (2025)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
The Forking Way: When TEEs Meet Consensus
di: Wilde, Annika, et al.
Pubblicazione: (2024)
di: Wilde, Annika, et al.
Pubblicazione: (2024)
PrivCode: When Code Generation Meets Differential Privacy
di: Liu, Zheng, et al.
Pubblicazione: (2025)
di: Liu, Zheng, et al.
Pubblicazione: (2025)
SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
di: Mou, Zhiyi, et al.
Pubblicazione: (2026)
Beyond Jailbreak: Unveiling Risks in LLM Applications Arising from Blurred Capability Boundaries
di: Zhang, Yunyi, et al.
Pubblicazione: (2025)
di: Zhang, Yunyi, et al.
Pubblicazione: (2025)
Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models
di: Dong, Yingkai, et al.
Pubblicazione: (2024)
di: Dong, Yingkai, et al.
Pubblicazione: (2024)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
di: He, Zeqing, et al.
Pubblicazione: (2024)
di: He, Zeqing, et al.
Pubblicazione: (2024)
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
di: Wang, Yanting, et al.
Pubblicazione: (2025)
di: Wang, Yanting, et al.
Pubblicazione: (2025)
Belt and Braces: When Federated Learning Meets Differential Privacy
di: Ren, Xuebin, et al.
Pubblicazione: (2024)
di: Ren, Xuebin, et al.
Pubblicazione: (2024)
Adaptive Probe-based Steering for Robust LLM Jailbreaking
di: Chen, Junxi, et al.
Pubblicazione: (2026)
di: Chen, Junxi, et al.
Pubblicazione: (2026)
When AI Meets Wall Street: A Survey on Trustworthy AI in Fintech
di: Zeng, Qingwen, et al.
Pubblicazione: (2026)
di: Zeng, Qingwen, et al.
Pubblicazione: (2026)
When Graph Convolution Meets Double Attention: Online Privacy Disclosure Detection with Multi-Label Text Classification
di: Liang, Zhanbo, et al.
Pubblicazione: (2023)
di: Liang, Zhanbo, et al.
Pubblicazione: (2023)
The Great Pretender: A Stochasticity Problem in LLM Jailbreak
di: Monteuuis, Jean-Philippe, et al.
Pubblicazione: (2026)
di: Monteuuis, Jean-Philippe, et al.
Pubblicazione: (2026)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
di: Lu, Lin, et al.
Pubblicazione: (2024)
di: Lu, Lin, et al.
Pubblicazione: (2024)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
di: Chen, Zejian, et al.
Pubblicazione: (2026)
di: Chen, Zejian, et al.
Pubblicazione: (2026)
Defending Jailbreak Prompts via In-Context Adversarial Game
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
Proactive defense against LLM Jailbreak
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
When Machine Learning Meets Vulnerability Discovery: Challenges and Lessons Learned
di: Arasteh, Sima, et al.
Pubblicazione: (2025)
di: Arasteh, Sima, et al.
Pubblicazione: (2025)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
di: Chen, Xuan, et al.
Pubblicazione: (2024) -
A DRL-Empowered Multi-Level Jamming Approach for Secure Semantic Communication
di: Chen, Weixuan, et al.
Pubblicazione: (2025) -
TBDD: A New Trust-based, DRL-driven Framework for Blockchain Sharding in IoT
di: Zhang, Zixu, et al.
Pubblicazione: (2024) -
Backdoors in DRL: Four Environments Focusing on In-distribution Triggers
di: Ashcraft, Chace, et al.
Pubblicazione: (2025) -
VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
di: Nie, Yuzhou, et al.
Pubblicazione: (2025)