SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Zhangchen, Jiang, Fengqing, Niu, Luyao, Jia, Jinyuan, Lin, Bill Yuchen, Poovendran, Radha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
por: Jiang, Fengqing, et al.
Publicado: (2024)
por: Jiang, Fengqing, et al.
Publicado: (2024)
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
Brave: Byzantine-Resilient and Privacy-Preserving Peer-to-Peer Federated Learning
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
por: Li, Yuetai, et al.
Publicado: (2024)
por: Li, Yuetai, et al.
Publicado: (2024)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
por: Jiang, Fengqing, et al.
Publicado: (2025)
por: Jiang, Fengqing, et al.
Publicado: (2025)
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
por: Jiang, Fengqing, et al.
Publicado: (2025)
por: Jiang, Fengqing, et al.
Publicado: (2025)
Stronger Models are NOT Stronger Teachers for Instruction Tuning
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
por: Jiang, Fengqing, et al.
Publicado: (2024)
por: Jiang, Fengqing, et al.
Publicado: (2024)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
por: Huang, Caishuang, et al.
Publicado: (2024)
por: Huang, Caishuang, et al.
Publicado: (2024)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
por: Jiang, Fengqing, et al.
Publicado: (2025)
por: Jiang, Fengqing, et al.
Publicado: (2025)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
por: Xiang, Zhen, et al.
Publicado: (2024)
por: Xiang, Zhen, et al.
Publicado: (2024)
Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
por: Sahabandu, Dinuka, et al.
Publicado: (2024)
por: Sahabandu, Dinuka, et al.
Publicado: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024)
por: Jiang, Tanqiu, et al.
Publicado: (2024)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
por: Zhang, Shenyi, et al.
Publicado: (2025)
por: Zhang, Shenyi, et al.
Publicado: (2025)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
por: Song, Weiming, et al.
Publicado: (2026)
por: Song, Weiming, et al.
Publicado: (2026)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
por: Qian, Cheng, et al.
Publicado: (2024)
por: Qian, Cheng, et al.
Publicado: (2024)
Defending against Backdoor Attack on Deep Neural Networks
por: Cheng, Hao, et al.
Publicado: (2020)
por: Cheng, Hao, et al.
Publicado: (2020)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
por: Liu, Fan, et al.
Publicado: (2024)
por: Liu, Fan, et al.
Publicado: (2024)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
por: Wang, Xunguang, et al.
Publicado: (2024)
por: Wang, Xunguang, et al.
Publicado: (2024)
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
por: Wang, Yanting, et al.
Publicado: (2025)
por: Wang, Yanting, et al.
Publicado: (2025)
Defending against Data Poisoning Attacks in Federated Learning via User Elimination
por: Galanis, Nick
Publicado: (2024)
por: Galanis, Nick
Publicado: (2024)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
por: Shen, Guobin, et al.
Publicado: (2025)
por: Shen, Guobin, et al.
Publicado: (2025)
Provably Robust Explainable Graph Neural Networks against Graph Perturbation Attacks
por: Li, Jiate, et al.
Publicado: (2025)
por: Li, Jiate, et al.
Publicado: (2025)
Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction
por: Chen, Yulin, et al.
Publicado: (2025)
por: Chen, Yulin, et al.
Publicado: (2025)
TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning
por: Xu, Zhangchen, et al.
Publicado: (2025)
por: Xu, Zhangchen, et al.
Publicado: (2025)
Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders
por: Jiang, Laura, et al.
Publicado: (2026)
por: Jiang, Laura, et al.
Publicado: (2026)
Defending Jailbreak Prompts via In-Context Adversarial Game
por: Zhou, Yujun, et al.
Publicado: (2024)
por: Zhou, Yujun, et al.
Publicado: (2024)
SafeDream: Safety World Model for Proactive Early Jailbreak Detection
por: Yan, Bo, et al.
Publicado: (2026)
por: Yan, Bo, et al.
Publicado: (2026)
Invariant Aggregator for Defending against Federated Backdoor Attacks
por: Wang, Xiaoyang, et al.
Publicado: (2022)
por: Wang, Xiaoyang, et al.
Publicado: (2022)
Concept-Aware Privacy Mechanisms for Defending Embedding Inversion Attacks
por: Tsai, Yu-Che, et al.
Publicado: (2026)
por: Tsai, Yu-Che, et al.
Publicado: (2026)
A Critical Evaluation of Defenses against Prompt Injection Attacks
por: Jia, Yuqi, et al.
Publicado: (2025)
por: Jia, Yuqi, et al.
Publicado: (2025)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
por: Jiang, Weisen, et al.
Publicado: (2025)
por: Jiang, Weisen, et al.
Publicado: (2025)
CANTXSec: A Deterministic Intrusion Detection and Prevention System for CAN Bus Monitoring ECU Activations
por: Donadel, Denis, et al.
Publicado: (2025)
por: Donadel, Denis, et al.
Publicado: (2025)
RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process
por: Wang, Peiran, et al.
Publicado: (2024)
por: Wang, Peiran, et al.
Publicado: (2024)
Double-Dip: Thwarting Label-Only Membership Inference Attacks with Transfer Learning and Randomization
por: Rajabi, Arezoo, et al.
Publicado: (2024)
por: Rajabi, Arezoo, et al.
Publicado: (2024)
GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient Analysis
por: Xie, Yueqi, et al.
Publicado: (2024)
por: Xie, Yueqi, et al.
Publicado: (2024)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
por: Lu, Lin, et al.
Publicado: (2024)
por: Lu, Lin, et al.
Publicado: (2024)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
por: Xiong, Chen, et al.
Publicado: (2024)
por: Xiong, Chen, et al.
Publicado: (2024)
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
por: Chen, Xuan, et al.
Publicado: (2024)
por: Chen, Xuan, et al.
Publicado: (2024)
Ejemplares similares
-
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
por: Jiang, Fengqing, et al.
Publicado: (2024) -
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
por: Xu, Zhangchen, et al.
Publicado: (2024) -
Brave: Byzantine-Resilient and Privacy-Preserving Peer-to-Peer Federated Learning
por: Xu, Zhangchen, et al.
Publicado: (2024) -
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
por: Li, Yuetai, et al.
Publicado: (2024) -
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
por: Jiang, Fengqing, et al.
Publicado: (2025)