LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Zhuoran, Zhang, Yanyong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
por: Li, Nathaniel, et al.
Publicado: (2024)
por: Li, Nathaniel, et al.
Publicado: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
por: Zeng, Yifan, et al.
Publicado: (2024)
por: Zeng, Yifan, et al.
Publicado: (2024)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
por: Xiong, Chen, et al.
Publicado: (2024)
por: Xiong, Chen, et al.
Publicado: (2024)
Applying Public Health Systematic Approaches to Cybersecurity: The Economics of Collective Defense
por: Dykstra, Josiah, et al.
Publicado: (2026)
por: Dykstra, Josiah, et al.
Publicado: (2026)
Data Defenses Against Large Language Models
por: Agnew, William, et al.
Publicado: (2024)
por: Agnew, William, et al.
Publicado: (2024)
Preserving security in a world with powerful AI Considerations for the future Defense Architecture
por: Generous, Nicholas, et al.
Publicado: (2025)
por: Generous, Nicholas, et al.
Publicado: (2025)
A Review on Internet of Things for Defense and Public Safety
por: Fraga-Lamas, Paula, et al.
Publicado: (2024)
por: Fraga-Lamas, Paula, et al.
Publicado: (2024)
Defense Against the Dark Prompts: Mitigating Best-of-N Jailbreaking with Prompt Evaluation
por: Armstrong, Stuart, et al.
Publicado: (2025)
por: Armstrong, Stuart, et al.
Publicado: (2025)
Who Coordinates U.S. Cyber Defense? A Co-Authorship Network Analysis of Joint Cybersecurity Advisories (2024--2025)
por: Canbaz, M. Abdullah, et al.
Publicado: (2025)
por: Canbaz, M. Abdullah, et al.
Publicado: (2025)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
por: Sun, Bowen, et al.
Publicado: (2026)
por: Sun, Bowen, et al.
Publicado: (2026)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
por: Chen, Beitao, et al.
Publicado: (2025)
por: Chen, Beitao, et al.
Publicado: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
por: Ouyang, Yang, et al.
Publicado: (2025)
por: Ouyang, Yang, et al.
Publicado: (2025)
RAID: An In-Training Defense against Attribute Inference Attacks in Recommender Systems
por: Feng, Xiaohua, et al.
Publicado: (2025)
por: Feng, Xiaohua, et al.
Publicado: (2025)
Victim-Centred Abuse Investigations and Defenses for Social Media Platforms
por: Hakami, Zaid, et al.
Publicado: (2025)
por: Hakami, Zaid, et al.
Publicado: (2025)
The Impact of AI on the Cyber Offense-Defense Balance and the Character of Cyber Conflict
por: Lohn, Andrew J.
Publicado: (2025)
por: Lohn, Andrew J.
Publicado: (2025)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
por: Li, Yucheng, et al.
Publicado: (2025)
por: Li, Yucheng, et al.
Publicado: (2025)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
por: Xiang, Shiyu, et al.
Publicado: (2025)
por: Xiang, Shiyu, et al.
Publicado: (2025)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
por: Yang, Guangyu, et al.
Publicado: (2025)
por: Yang, Guangyu, et al.
Publicado: (2025)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
por: Chen, Zejian, et al.
Publicado: (2026)
por: Chen, Zejian, et al.
Publicado: (2026)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
por: Kim, Taeyoun, et al.
Publicado: (2024)
por: Kim, Taeyoun, et al.
Publicado: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Preventing Jailbreak Prompts as Malicious Tools for Cybercriminals: A Cyber Defense Perspective
por: Tshimula, Jean Marie, et al.
Publicado: (2024)
por: Tshimula, Jean Marie, et al.
Publicado: (2024)
Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks
por: Cunningham, Hoagy, et al.
Publicado: (2026)
por: Cunningham, Hoagy, et al.
Publicado: (2026)
Securing The Future Of Healthcare: Building A Resilient Defense System For Patient Data Protection
por: Ejiofor, Oluomachi, et al.
Publicado: (2024)
por: Ejiofor, Oluomachi, et al.
Publicado: (2024)
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
por: Du, Mengyao, et al.
Publicado: (2026)
por: Du, Mengyao, et al.
Publicado: (2026)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
por: Long, Zhuohang, et al.
Publicado: (2025)
por: Long, Zhuohang, et al.
Publicado: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
por: Lu, Lin, et al.
Publicado: (2024)
por: Lu, Lin, et al.
Publicado: (2024)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
por: Zhong, Xingwei, et al.
Publicado: (2025)
por: Zhong, Xingwei, et al.
Publicado: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
por: Chen, Yulin, et al.
Publicado: (2024)
por: Chen, Yulin, et al.
Publicado: (2024)
Towards Scalable Defenses against Intimate Partner Infiltrations
por: Yang, Weisi, et al.
Publicado: (2025)
por: Yang, Weisi, et al.
Publicado: (2025)
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
por: Lin, Zheng, et al.
Publicado: (2026)
por: Lin, Zheng, et al.
Publicado: (2026)
AEIOU: A Unified Defense Framework against NSFW Prompts in Text-to-Image Models
por: Wang, Yiming, et al.
Publicado: (2024)
por: Wang, Yiming, et al.
Publicado: (2024)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
por: Guo, Yangyang, et al.
Publicado: (2024)
por: Guo, Yangyang, et al.
Publicado: (2024)
Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
por: Chen, Luoyu, et al.
Publicado: (2026)
por: Chen, Luoyu, et al.
Publicado: (2026)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
por: Liu, Shuyuan, et al.
Publicado: (2025)
por: Liu, Shuyuan, et al.
Publicado: (2025)
Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses
por: Derya, Kemal, et al.
Publicado: (2026)
por: Derya, Kemal, et al.
Publicado: (2026)
The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks
por: Li, Chunyang, et al.
Publicado: (2025)
por: Li, Chunyang, et al.
Publicado: (2025)
Cybersecurity through Entropy Injection: A Paradigm Shift from Reactive Defense to Proactive Uncertainty
por: Janani, Kush
Publicado: (2025)
por: Janani, Kush
Publicado: (2025)
Ejemplares similares
-
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
por: Li, Nathaniel, et al.
Publicado: (2024) -
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
por: Zeng, Yifan, et al.
Publicado: (2024) -
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
por: Xiong, Chen, et al.
Publicado: (2024) -
Applying Public Health Systematic Approaches to Cybersecurity: The Economics of Collective Defense
por: Dykstra, Josiah, et al.
Publicado: (2026) -
Data Defenses Against Large Language Models
por: Agnew, William, et al.
Publicado: (2024)