Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fu, Shaopeng, Ding, Liang, Zhang, Jingfeng, Wang, Di |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory
von: Fu, Shaopeng, et al.
Veröffentlicht: (2026)
von: Fu, Shaopeng, et al.
Veröffentlicht: (2026)
Defending Jailbreak Prompts via In-Context Adversarial Game
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
Efficient Adversarial Training in LLMs with Continuous Attacks
von: Xhonneux, Sophie, et al.
Veröffentlicht: (2024)
von: Xhonneux, Sophie, et al.
Veröffentlicht: (2024)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
von: Qian, Cheng, et al.
Veröffentlicht: (2024)
von: Qian, Cheng, et al.
Veröffentlicht: (2024)
HashVFL: Defending Against Data Reconstruction Attacks in Vertical Federated Learning
von: Qiu, Pengyu, et al.
Veröffentlicht: (2022)
von: Qiu, Pengyu, et al.
Veröffentlicht: (2022)
Low-Cost Hard-Label Adversarial Attack with Theoretical Foundations
von: Liu, Jun, et al.
Veröffentlicht: (2026)
von: Liu, Jun, et al.
Veröffentlicht: (2026)
DataFreeShield: Defending Adversarial Attacks without Training Data
von: Lee, Hyeyoon, et al.
Veröffentlicht: (2024)
von: Lee, Hyeyoon, et al.
Veröffentlicht: (2024)
MEA-Defender: A Robust Watermark against Model Extraction Attack
von: Lv, Peizhuo, et al.
Veröffentlicht: (2024)
von: Lv, Peizhuo, et al.
Veröffentlicht: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
von: Liu, Fan, et al.
Veröffentlicht: (2024)
von: Liu, Fan, et al.
Veröffentlicht: (2024)
MIST: Defending Against Membership Inference Attacks Through Membership-Invariant Subspace Training
von: Li, Jiacheng, et al.
Veröffentlicht: (2023)
von: Li, Jiacheng, et al.
Veröffentlicht: (2023)
Invariant Aggregator for Defending against Federated Backdoor Attacks
von: Wang, Xiaoyang, et al.
Veröffentlicht: (2022)
von: Wang, Xiaoyang, et al.
Veröffentlicht: (2022)
Defending Against Unforeseen Failure Modes with Latent Adversarial Training
von: Casper, Stephen, et al.
Veröffentlicht: (2024)
von: Casper, Stephen, et al.
Veröffentlicht: (2024)
Defending Against Sophisticated Poisoning Attacks with RL-based Aggregation in Federated Learning
von: Wang, Yujing, et al.
Veröffentlicht: (2024)
von: Wang, Yujing, et al.
Veröffentlicht: (2024)
Generalization Properties of Adversarial Training for $\ell_0$-Bounded Adversarial Attacks
von: Delgosha, Payam, et al.
Veröffentlicht: (2024)
von: Delgosha, Payam, et al.
Veröffentlicht: (2024)
Pre-trained Encoder Inference: Revealing Upstream Encoders In Downstream Machine Learning Services
von: Fu, Shaopeng, et al.
Veröffentlicht: (2024)
von: Fu, Shaopeng, et al.
Veröffentlicht: (2024)
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
von: Li, Ran, et al.
Veröffentlicht: (2025)
von: Li, Ran, et al.
Veröffentlicht: (2025)
FL-Defender: Combating Targeted Attacks in Federated Learning
von: Jebreel, Najeeb, et al.
Veröffentlicht: (2022)
von: Jebreel, Najeeb, et al.
Veröffentlicht: (2022)
Defending against Backdoor Attack on Deep Neural Networks
von: Cheng, Hao, et al.
Veröffentlicht: (2020)
von: Cheng, Hao, et al.
Veröffentlicht: (2020)
How to Defend Against Large-scale Model Poisoning Attacks in Federated Learning: A Vertical Solution
von: Wang, Jinbo, et al.
Veröffentlicht: (2024)
von: Wang, Jinbo, et al.
Veröffentlicht: (2024)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
von: Lin, Runqi, et al.
Veröffentlicht: (2025)
von: Lin, Runqi, et al.
Veröffentlicht: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
von: Chu, Junjie, et al.
Veröffentlicht: (2024)
von: Chu, Junjie, et al.
Veröffentlicht: (2024)
Enhancing Adversarial Attacks via Parameter Adaptive Adversarial Attack
von: Jin, Zhibo, et al.
Veröffentlicht: (2024)
von: Jin, Zhibo, et al.
Veröffentlicht: (2024)
Voice Jailbreak Attacks Against GPT-4o
von: Shen, Xinyue, et al.
Veröffentlicht: (2024)
von: Shen, Xinyue, et al.
Veröffentlicht: (2024)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
von: Jiang, Weisen, et al.
Veröffentlicht: (2025)
von: Jiang, Weisen, et al.
Veröffentlicht: (2025)
Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
von: Kaneko, Masahiro, et al.
Veröffentlicht: (2025)
von: Kaneko, Masahiro, et al.
Veröffentlicht: (2025)
Your Agent Can Defend Itself against Backdoor Attacks
von: Changjiang, Li, et al.
Veröffentlicht: (2025)
von: Changjiang, Li, et al.
Veröffentlicht: (2025)
Attack by Unlearning: Unlearning-Induced Adversarial Attacks on Graph Neural Networks
von: Zhang, Jiahao, et al.
Veröffentlicht: (2026)
von: Zhang, Jiahao, et al.
Veröffentlicht: (2026)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
von: Li, Qizhang, et al.
Veröffentlicht: (2024)
von: Li, Qizhang, et al.
Veröffentlicht: (2024)
Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
von: Wang, Xiangwen, et al.
Veröffentlicht: (2026)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
von: Yang, Junxiao, et al.
Veröffentlicht: (2025)
von: Yang, Junxiao, et al.
Veröffentlicht: (2025)
Jailbreak Attack Initializations as Extractors of Compliance Directions
von: Levi, Amit, et al.
Veröffentlicht: (2025)
von: Levi, Amit, et al.
Veröffentlicht: (2025)
Revisiting Gradient Pruning: A Dual Realization for Defending against Gradient Attacks
von: Xue, Lulu, et al.
Veröffentlicht: (2024)
von: Xue, Lulu, et al.
Veröffentlicht: (2024)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
von: Andriushchenko, Maksym, et al.
Veröffentlicht: (2024)
von: Andriushchenko, Maksym, et al.
Veröffentlicht: (2024)
Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks
von: Nurlanov, Zhakshylyk, et al.
Veröffentlicht: (2026)
von: Nurlanov, Zhakshylyk, et al.
Veröffentlicht: (2026)
MetaCipher: A Time-Persistent and Universal Multi-Agent Framework for Cipher-Based Jailbreak Attacks for LLMs
von: Chen, Boyuan, et al.
Veröffentlicht: (2025)
von: Chen, Boyuan, et al.
Veröffentlicht: (2025)
CodePurify: Defend Backdoor Attacks on Neural Code Models via Entropy-based Purification
von: Mu, Fangwen, et al.
Veröffentlicht: (2024)
von: Mu, Fangwen, et al.
Veröffentlicht: (2024)
Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
von: Wu, Yuanwei, et al.
Veröffentlicht: (2023)
von: Wu, Yuanwei, et al.
Veröffentlicht: (2023)
Revisiting Label Inference Attacks in Vertical Federated Learning: Why They Are Vulnerable and How to Defend
von: Liu, Yige, et al.
Veröffentlicht: (2026)
von: Liu, Yige, et al.
Veröffentlicht: (2026)
One Stone, Two Birds: Enhancing Adversarial Defense Through the Lens of Distributional Discrepancy
von: Zhang, Jiacheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jiacheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory
von: Fu, Shaopeng, et al.
Veröffentlicht: (2026) -
Defending Jailbreak Prompts via In-Context Adversarial Game
von: Zhou, Yujun, et al.
Veröffentlicht: (2024) -
Efficient Adversarial Training in LLMs with Continuous Attacks
von: Xhonneux, Sophie, et al.
Veröffentlicht: (2024) -
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
von: Zhang, Zhexin, et al.
Veröffentlicht: (2024) -
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
von: Qian, Cheng, et al.
Veröffentlicht: (2024)