SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Xunguang, Wu, Daoyuan, Ji, Zhenlan, Li, Zongjie, Ma, Pingchuan, Wang, Shuai, Li, Yingjiu, Liu, Yang, Liu, Ning, Rahmel, Juergen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
von: Wu, Daoyuan, et al.
Veröffentlicht: (2024)
von: Wu, Daoyuan, et al.
Veröffentlicht: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods
von: Huang, Ruixuan, et al.
Veröffentlicht: (2025)
von: Huang, Ruixuan, et al.
Veröffentlicht: (2025)
Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2026)
von: Wang, Xunguang, et al.
Veröffentlicht: (2026)
Taming Various Privilege Escalation in LLM-Based Agent Systems: A Mandatory Access Control Framework
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2023)
von: Wang, Xunguang, et al.
Veröffentlicht: (2023)
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
SEAL: Subspace-Anchored Watermarks for LLM Ownership
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
von: Ji, Zhenlan, et al.
Veröffentlicht: (2024)
von: Ji, Zhenlan, et al.
Veröffentlicht: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
von: Liu, Fan, et al.
Veröffentlicht: (2024)
von: Liu, Fan, et al.
Veröffentlicht: (2024)
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
von: Li, Zongjie, et al.
Veröffentlicht: (2025)
von: Li, Zongjie, et al.
Veröffentlicht: (2025)
On Protecting Agentic Systems' Intellectual Property via Watermarking
von: Wang, Liwen, et al.
Veröffentlicht: (2026)
von: Wang, Liwen, et al.
Veröffentlicht: (2026)
Your Agent Can Defend Itself against Backdoor Attacks
von: Changjiang, Li, et al.
Veröffentlicht: (2025)
von: Changjiang, Li, et al.
Veröffentlicht: (2025)
IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems
von: Wang, Liwen, et al.
Veröffentlicht: (2025)
von: Wang, Liwen, et al.
Veröffentlicht: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
von: Qian, Cheng, et al.
Veröffentlicht: (2024)
von: Qian, Cheng, et al.
Veröffentlicht: (2024)
AGNNCert: Defending Graph Neural Networks against Arbitrary Perturbations with Deterministic Certification
von: Li, Jiate, et al.
Veröffentlicht: (2025)
von: Li, Jiate, et al.
Veröffentlicht: (2025)
Defend LLMs Through Self-Consciousness
von: Huang, Boshi, et al.
Veröffentlicht: (2025)
von: Huang, Boshi, et al.
Veröffentlicht: (2025)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
von: Wang, Peiran, et al.
Veröffentlicht: (2024)
von: Wang, Peiran, et al.
Veröffentlicht: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
von: Zhao, Chongwen, et al.
Veröffentlicht: (2024)
von: Zhao, Chongwen, et al.
Veröffentlicht: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
von: Xu, Zhangchen, et al.
Veröffentlicht: (2024)
von: Xu, Zhangchen, et al.
Veröffentlicht: (2024)
Quantifying and Defending against Privacy Threats on Federated Knowledge Graph Embedding
von: Hu, Yuke, et al.
Veröffentlicht: (2023)
von: Hu, Yuke, et al.
Veröffentlicht: (2023)
MCPSecBench: A Systematic Security Benchmark and Playground for Testing Model Context Protocols
von: Yang, Yixuan, et al.
Veröffentlicht: (2025)
von: Yang, Yixuan, et al.
Veröffentlicht: (2025)
Defending Jailbreak Prompts via In-Context Adversarial Game
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
von: Zhao, Weixiang, et al.
Veröffentlicht: (2025)
von: Zhao, Weixiang, et al.
Veröffentlicht: (2025)
Invariant Aggregator for Defending against Federated Backdoor Attacks
von: Wang, Xiaoyang, et al.
Veröffentlicht: (2022)
von: Wang, Xiaoyang, et al.
Veröffentlicht: (2022)
Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
von: Fu, Shaopeng, et al.
Veröffentlicht: (2025)
von: Fu, Shaopeng, et al.
Veröffentlicht: (2025)
Defending against Backdoor Attack on Deep Neural Networks
von: Cheng, Hao, et al.
Veröffentlicht: (2020)
von: Cheng, Hao, et al.
Veröffentlicht: (2020)
RADAR: Defending RAG Dynamically against Retrieval Corruption
von: Chen, Ziyuan, et al.
Veröffentlicht: (2026)
von: Chen, Ziyuan, et al.
Veröffentlicht: (2026)
ShieldMMU: Detecting and Defending against Controlled-Channel Attacks in Shielding Memory System
von: Liu, Gang, et al.
Veröffentlicht: (2025)
von: Liu, Gang, et al.
Veröffentlicht: (2025)
Defending against Indirect Prompt Injection by Instruction Detection
von: Wen, Tongyu, et al.
Veröffentlicht: (2025)
von: Wen, Tongyu, et al.
Veröffentlicht: (2025)
Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming
von: Sharma, Mrinank, et al.
Veröffentlicht: (2025)
von: Sharma, Mrinank, et al.
Veröffentlicht: (2025)
Rapid Plug-in Defenders
von: Wu, Kai, et al.
Veröffentlicht: (2023)
von: Wu, Kai, et al.
Veröffentlicht: (2023)
Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction
von: Chen, Yulin, et al.
Veröffentlicht: (2025)
von: Chen, Yulin, et al.
Veröffentlicht: (2025)
Dormant: Defending against Pose-driven Human Image Animation
von: Zhou, Jiachen, et al.
Veröffentlicht: (2024)
von: Zhou, Jiachen, et al.
Veröffentlicht: (2024)
Rethinking and Exploring String-Based Malware Family Classification in the Era of LLMs and RAG
von: Chen, Yufan, et al.
Veröffentlicht: (2025)
von: Chen, Yufan, et al.
Veröffentlicht: (2025)
Buffer is All You Need: Defending Federated Learning against Backdoor Attacks under Non-iids via Buffering
von: Lyu, Xingyu, et al.
Veröffentlicht: (2025)
von: Lyu, Xingyu, et al.
Veröffentlicht: (2025)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
von: Zhang, Shenyi, et al.
Veröffentlicht: (2025)
von: Zhang, Shenyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
von: Wu, Daoyuan, et al.
Veröffentlicht: (2024) -
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025) -
SoK: Evaluating Jailbreak Guardrails for Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025) -
GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods
von: Huang, Ruixuan, et al.
Veröffentlicht: (2025) -
Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2026)