Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Luoyu, Wang, Weiqi, Tian, Zhiyi, Wu, Feng, Asiri, Ahmed, Yu, Shui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
par: Chen, Luoyu, et autres
Publié: (2026)
par: Chen, Luoyu, et autres
Publié: (2026)
TAPE: Tailored Posterior Difference for Auditing of Machine Unlearning
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
Machine Unlearning: A Comprehensive Survey
par: Wang, Weiqi, et autres
Publié: (2024)
par: Wang, Weiqi, et autres
Publié: (2024)
SCU: An Efficient Machine Unlearning Scheme for Deep Learning Enabled Semantic Communications
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
CRFU: Compressive Representation Forgetting Against Privacy Leakage on Machine Unlearning
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
BlindU: Blind Machine Unlearning without Revealing Erasing Data
par: Wang, Weiqi, et autres
Publié: (2026)
par: Wang, Weiqi, et autres
Publié: (2026)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
par: Wu, Yu-Hang, et autres
Publié: (2025)
par: Wu, Yu-Hang, et autres
Publié: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
par: Xiong, Chen, et autres
Publié: (2024)
par: Xiong, Chen, et autres
Publié: (2024)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
par: Lu, Lin, et autres
Publié: (2024)
par: Lu, Lin, et autres
Publié: (2024)
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
par: Xie, Zhixin, et autres
Publié: (2026)
par: Xie, Zhixin, et autres
Publié: (2026)
FedBAP: Backdoor Defense via Benign Adversarial Perturbation in Federated Learning
par: Yan, Xinhai, et autres
Publié: (2025)
par: Yan, Xinhai, et autres
Publié: (2025)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
par: Xiong, Chen, et autres
Publié: (2026)
par: Xiong, Chen, et autres
Publié: (2026)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
par: Yang, Guangyu, et autres
Publié: (2025)
par: Yang, Guangyu, et autres
Publié: (2025)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
par: Hao, Shuyang, et autres
Publié: (2025)
par: Hao, Shuyang, et autres
Publié: (2025)
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
par: Wang, Xi, et autres
Publié: (2026)
par: Wang, Xi, et autres
Publié: (2026)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
par: Zhong, Xingwei, et autres
Publié: (2025)
par: Zhong, Xingwei, et autres
Publié: (2025)
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
par: Lin, Zheng, et autres
Publié: (2026)
par: Lin, Zheng, et autres
Publié: (2026)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
par: Zeng, Yifan, et autres
Publié: (2024)
par: Zeng, Yifan, et autres
Publié: (2024)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
par: Weng, Fenghua, et autres
Publié: (2024)
par: Weng, Fenghua, et autres
Publié: (2024)
Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses
par: Derya, Kemal, et autres
Publié: (2026)
par: Derya, Kemal, et autres
Publié: (2026)
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
par: Du, Mengyao, et autres
Publié: (2026)
par: Du, Mengyao, et autres
Publié: (2026)
Defending Buffer Overflows in WebAssembly: A Transpiler Approach
par: Feng, Weiqi
Publié: (2026)
par: Feng, Weiqi
Publié: (2026)
SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
par: Zeng, Xiyu, et autres
Publié: (2025)
par: Zeng, Xiyu, et autres
Publié: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles
par: Wang, Zhilong, et autres
Publié: (2024)
par: Wang, Zhilong, et autres
Publié: (2024)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models
par: Wang, Yanyun, et autres
Publié: (2026)
par: Wang, Yanyun, et autres
Publié: (2026)
Jailbreaking Generative AI: Multivector Phishing Threats and Transformer based Defenses
par: Mishra, Rina, et autres
Publié: (2025)
par: Mishra, Rina, et autres
Publié: (2025)
Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection
par: Wang, Zhilong, et autres
Publié: (2024)
par: Wang, Zhilong, et autres
Publié: (2024)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
par: Yang, Xianglin, et autres
Publié: (2025)
par: Yang, Xianglin, et autres
Publié: (2025)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
par: Xiang, Shiyu, et autres
Publié: (2025)
par: Xiang, Shiyu, et autres
Publié: (2025)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
par: Liang, Siyuan, et autres
Publié: (2025)
par: Liang, Siyuan, et autres
Publié: (2025)
LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution
par: Yang, Zhuoran, et autres
Publié: (2025)
par: Yang, Zhuoran, et autres
Publié: (2025)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
par: Li, Xiaohu, et autres
Publié: (2025)
par: Li, Xiaohu, et autres
Publié: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense
par: Mai, Wuyuao, et autres
Publié: (2025)
par: Mai, Wuyuao, et autres
Publié: (2025)
Documents similaires
-
Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
par: Chen, Luoyu, et autres
Publié: (2026) -
TAPE: Tailored Posterior Difference for Auditing of Machine Unlearning
par: Wang, Weiqi, et autres
Publié: (2025) -
Machine Unlearning: A Comprehensive Survey
par: Wang, Weiqi, et autres
Publié: (2024) -
SCU: An Efficient Machine Unlearning Scheme for Deep Learning Enabled Semantic Communications
par: Wang, Weiqi, et autres
Publié: (2025) -
CRFU: Compressive Representation Forgetting Against Privacy Leakage on Machine Unlearning
par: Wang, Weiqi, et autres
Publié: (2025)