LLMs Can Defend Themselves Against Jailbreaking in a Practical Manner: A Vision Paper
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Daoyuan, Wang, Shuai, Liu, Yang, Liu, Ning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
di: Wang, Xunguang, et al.
Pubblicazione: (2024)
di: Wang, Xunguang, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
di: Li, Zongjie, et al.
Pubblicazione: (2025)
di: Li, Zongjie, et al.
Pubblicazione: (2025)
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
di: Wong, Ryan, et al.
Pubblicazione: (2025)
di: Wong, Ryan, et al.
Pubblicazione: (2025)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
di: Wang, Peiran, et al.
Pubblicazione: (2024)
di: Wang, Peiran, et al.
Pubblicazione: (2024)
BadMoE: Backdooring Mixture-of-Experts LLMs via Optimizing Routing Triggers and Infecting Dormant Experts
di: Wang, Qingyue, et al.
Pubblicazione: (2025)
di: Wang, Qingyue, et al.
Pubblicazione: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
di: Sun, Zhen, et al.
Pubblicazione: (2025)
di: Sun, Zhen, et al.
Pubblicazione: (2025)
Detecting Various DeFi Price Manipulations with LLM Reasoning
di: Zhong, Juantao, et al.
Pubblicazione: (2025)
di: Zhong, Juantao, et al.
Pubblicazione: (2025)
MCPSecBench: A Systematic Security Benchmark and Playground for Testing Model Context Protocols
di: Yang, Yixuan, et al.
Pubblicazione: (2025)
di: Yang, Yixuan, et al.
Pubblicazione: (2025)
Defending LVLMs Against Vision Attacks through Partial-Perception Supervision
di: Zhou, Qi, et al.
Pubblicazione: (2024)
di: Zhou, Qi, et al.
Pubblicazione: (2024)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025)
di: Tong, Haibo, et al.
Pubblicazione: (2025)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
di: Cui, Tiehan, et al.
Pubblicazione: (2025)
di: Cui, Tiehan, et al.
Pubblicazione: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Reliable Model Watermarking: Defending Against Theft without Compromising on Evasion
di: Zhu, Hongyu, et al.
Pubblicazione: (2024)
di: Zhu, Hongyu, et al.
Pubblicazione: (2024)
FlipAttack: Jailbreak LLMs via Flipping
di: Liu, Yue, et al.
Pubblicazione: (2024)
di: Liu, Yue, et al.
Pubblicazione: (2024)
Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks
di: Jin, Haotian, et al.
Pubblicazione: (2025)
di: Jin, Haotian, et al.
Pubblicazione: (2025)
RTBAS: Defending LLM Agents Against Prompt Injection and Privacy Leakage
di: Zhong, Peter Yong, et al.
Pubblicazione: (2025)
di: Zhong, Peter Yong, et al.
Pubblicazione: (2025)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
di: Yang, Xianglin, et al.
Pubblicazione: (2025)
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
di: Du, Hao, et al.
Pubblicazione: (2025)
di: Du, Hao, et al.
Pubblicazione: (2025)
Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards
di: Hammadia, Taha, et al.
Pubblicazione: (2026)
di: Hammadia, Taha, et al.
Pubblicazione: (2026)
Defending Against Beta Poisoning Attacks in Machine Learning Models
di: Gulciftci, Nilufer, et al.
Pubblicazione: (2025)
di: Gulciftci, Nilufer, et al.
Pubblicazione: (2025)
VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit
di: Lin, Junda, et al.
Pubblicazione: (2026)
di: Lin, Junda, et al.
Pubblicazione: (2026)
Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent
di: Shang, Shang, et al.
Pubblicazione: (2024)
di: Shang, Shang, et al.
Pubblicazione: (2024)
MetaSeal: Defending Against Image Attribution Forgery Through Content-Dependent Cryptographic Watermarks
di: Zhou, Tong, et al.
Pubblicazione: (2025)
di: Zhou, Tong, et al.
Pubblicazione: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
di: Ran, Delong, et al.
Pubblicazione: (2024)
di: Ran, Delong, et al.
Pubblicazione: (2024)
Rethinking and Exploring String-Based Malware Family Classification in the Era of LLMs and RAG
di: Chen, Yufan, et al.
Pubblicazione: (2025)
di: Chen, Yufan, et al.
Pubblicazione: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
LLM4Vuln: A Unified Evaluation Framework for Decoupling and Enhancing LLMs' Vulnerability Reasoning
di: Sun, Yuqiang, et al.
Pubblicazione: (2024)
di: Sun, Yuqiang, et al.
Pubblicazione: (2024)
LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring
di: Li, Chloe, et al.
Pubblicazione: (2025)
di: Li, Chloe, et al.
Pubblicazione: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
di: Wang, Xunguang, et al.
Pubblicazione: (2024) -
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024) -
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025) -
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
di: Li, Zongjie, et al.
Pubblicazione: (2025) -
Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
di: Wong, Ryan, et al.
Pubblicazione: (2025)