From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhexin, Yang, Junxiao, Lu, Yida, Ke, Pei, Cui, Shiyao, Zheng, Chujie, Wang, Hongning, Huang, Minlie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Reliable Model Watermarking: Defending Against Theft without Compromising on Evasion
di: Zhu, Hongyu, et al.
Pubblicazione: (2024)
di: Zhu, Hongyu, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering
di: Chen, Renmiao, et al.
Pubblicazione: (2025)
di: Chen, Renmiao, et al.
Pubblicazione: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
The Ripple Effect: On Unforeseen Complications of Backdoor Attacks
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
di: Wong, Ryan, et al.
Pubblicazione: (2025)
di: Wong, Ryan, et al.
Pubblicazione: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Defending Against Neural Network Model Inversion Attacks via Data Poisoning
di: Zhou, Shuai, et al.
Pubblicazione: (2024)
di: Zhou, Shuai, et al.
Pubblicazione: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs
di: Zhong, Yinan, et al.
Pubblicazione: (2025)
di: Zhong, Yinan, et al.
Pubblicazione: (2025)
Defending Against Attack on the Cloned: In-Band Active Man-in-the-Middle Detection for the Signal Protocol
di: Teng, Wil Liam, et al.
Pubblicazione: (2024)
di: Teng, Wil Liam, et al.
Pubblicazione: (2024)
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
Defending Against Beta Poisoning Attacks in Machine Learning Models
di: Gulciftci, Nilufer, et al.
Pubblicazione: (2025)
di: Gulciftci, Nilufer, et al.
Pubblicazione: (2025)
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
di: Wu, Daoyuan, et al.
Pubblicazione: (2024)
di: Wu, Daoyuan, et al.
Pubblicazione: (2024)
Too Private to Tell: Practical Token Theft Attacks on Apple Intelligence
di: Zhou, Haoling, et al.
Pubblicazione: (2026)
di: Zhou, Haoling, et al.
Pubblicazione: (2026)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
Voice Jailbreak Attacks Against GPT-4o
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
di: Wang, Peiran, et al.
Pubblicazione: (2024)
di: Wang, Peiran, et al.
Pubblicazione: (2024)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
di: An, Li, et al.
Pubblicazione: (2025)
di: An, Li, et al.
Pubblicazione: (2025)
CleanStack: A New Dual-Stack for Defending Against Stack-Based Memory Corruption Attacks
di: Chong, Lei
Pubblicazione: (2025)
di: Chong, Lei
Pubblicazione: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
di: Lu, Lin, et al.
Pubblicazione: (2024)
di: Lu, Lin, et al.
Pubblicazione: (2024)
Defending Against Prompt Injection with DataFilter
di: Wang, Yizhu, et al.
Pubblicazione: (2025)
di: Wang, Yizhu, et al.
Pubblicazione: (2025)
Defending Against Indirect Prompt Injection Attacks With Spotlighting
di: Hines, Keegan, et al.
Pubblicazione: (2024)
di: Hines, Keegan, et al.
Pubblicazione: (2024)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
di: Wang, Xunguang, et al.
Pubblicazione: (2024)
di: Wang, Xunguang, et al.
Pubblicazione: (2024)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
di: Mao, Yanxu, et al.
Pubblicazione: (2025)
di: Mao, Yanxu, et al.
Pubblicazione: (2025)
Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks
di: Jin, Haotian, et al.
Pubblicazione: (2025)
di: Jin, Haotian, et al.
Pubblicazione: (2025)
Defending Against Sophisticated Poisoning Attacks with RL-based Aggregation in Federated Learning
di: Wang, Yujing, et al.
Pubblicazione: (2024)
di: Wang, Yujing, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Attacks With Residual Stream Activation Analysis
di: Kawasaki, Amelia, et al.
Pubblicazione: (2024)
di: Kawasaki, Amelia, et al.
Pubblicazione: (2024)
HashVFL: Defending Against Data Reconstruction Attacks in Vertical Federated Learning
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
di: Qiu, Pengyu, et al.
Pubblicazione: (2022)
Defending Jailbreak Prompts via In-Context Adversarial Game
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
di: Fu, Shaopeng, et al.
Pubblicazione: (2025)
di: Fu, Shaopeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025) -
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023) -
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024) -
Reliable Model Watermarking: Defending Against Theft without Compromising on Evasion
di: Zhu, Hongyu, et al.
Pubblicazione: (2024) -
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)