Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Zehua, Yang, Jianwei, Dai, Wei, Sun, Jiahao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CircuitSynth: Reliable Synthetic Data Generation
por: Cheng, Zehua, et al.
Publicado: (2026)
por: Cheng, Zehua, et al.
Publicado: (2026)
CasualSynth: Generating Structurally Sound Synthetic Data
por: Cheng, Zehua, et al.
Publicado: (2026)
por: Cheng, Zehua, et al.
Publicado: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
por: Ji, Haoxuan, et al.
Publicado: (2024)
por: Ji, Haoxuan, et al.
Publicado: (2024)
AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks
por: Siska, Charlotte, et al.
Publicado: (2025)
por: Siska, Charlotte, et al.
Publicado: (2025)
SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
por: Pei, Aihua, et al.
Publicado: (2024)
por: Pei, Aihua, et al.
Publicado: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
por: Ma, Zhiqing, et al.
Publicado: (2026)
por: Ma, Zhiqing, et al.
Publicado: (2026)
When "Competency" in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex Ciphers
por: Handa, Divij, et al.
Publicado: (2024)
por: Handa, Divij, et al.
Publicado: (2024)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
por: Long, Zhuohang, et al.
Publicado: (2025)
por: Long, Zhuohang, et al.
Publicado: (2025)
A Graph-Enhanced Defense Framework for Explainable Fake News Detection with LLM
por: Wang, Bo, et al.
Publicado: (2026)
por: Wang, Bo, et al.
Publicado: (2026)
Beyond Reactive Safety: Risk-Aware LLM Alignment via Long-Horizon Simulation
por: Sun, Chenkai, et al.
Publicado: (2025)
por: Sun, Chenkai, et al.
Publicado: (2025)
Efficient Knowledge Infusion via KG-LLM Alignment
por: Jiang, Zhouyu, et al.
Publicado: (2024)
por: Jiang, Zhouyu, et al.
Publicado: (2024)
SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning
por: Wang, Lichao, et al.
Publicado: (2026)
por: Wang, Lichao, et al.
Publicado: (2026)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
por: Zhou, Weikang, et al.
Publicado: (2024)
por: Zhou, Weikang, et al.
Publicado: (2024)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
por: Cheng, Pengyu, et al.
Publicado: (2023)
por: Cheng, Pengyu, et al.
Publicado: (2023)
ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference
por: Ouyang, Haojie, et al.
Publicado: (2025)
por: Ouyang, Haojie, et al.
Publicado: (2025)
The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis
por: Wei, Zihao, et al.
Publicado: (2025)
por: Wei, Zihao, et al.
Publicado: (2025)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
por: Yu, Yongcan, et al.
Publicado: (2025)
por: Yu, Yongcan, et al.
Publicado: (2025)
Societal Alignment Frameworks Can Improve LLM Alignment
por: Stańczak, Karolina, et al.
Publicado: (2025)
por: Stańczak, Karolina, et al.
Publicado: (2025)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
por: Dong, Xiaoning, et al.
Publicado: (2024)
por: Dong, Xiaoning, et al.
Publicado: (2024)
Jailbreaking to Jailbreak
por: Kritz, Jeremy, et al.
Publicado: (2025)
por: Kritz, Jeremy, et al.
Publicado: (2025)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
por: Wang, Yuhang, et al.
Publicado: (2025)
por: Wang, Yuhang, et al.
Publicado: (2025)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)
por: Priyanshu, Aman, et al.
Publicado: (2024)
por: Priyanshu, Aman, et al.
Publicado: (2024)
PMMT: Preference Alignment in Multilingual Machine Translation via LLM Distillation
por: Sun, Shuqiao, et al.
Publicado: (2024)
por: Sun, Shuqiao, et al.
Publicado: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
por: Ni, Ziyi, et al.
Publicado: (2025)
por: Ni, Ziyi, et al.
Publicado: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
por: Ouyang, Yang, et al.
Publicado: (2025)
por: Ouyang, Yang, et al.
Publicado: (2025)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
Beyond Single-Point Judgment: Distribution Alignment for LLM-as-a-Judge
por: Chen, Luyu, et al.
Publicado: (2025)
por: Chen, Luyu, et al.
Publicado: (2025)
Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses
por: Ahmed, Mohamed, et al.
Publicado: (2025)
por: Ahmed, Mohamed, et al.
Publicado: (2025)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
por: Wang, Jiahao, et al.
Publicado: (2025)
por: Wang, Jiahao, et al.
Publicado: (2025)
Human-Instruction-Free LLM Self-Alignment with Limited Samples
por: Guo, Hongyi, et al.
Publicado: (2024)
por: Guo, Hongyi, et al.
Publicado: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Persona-Aware Alignment Framework for Personalized Dialogue Generation
por: Li, Guanrong, et al.
Publicado: (2025)
por: Li, Guanrong, et al.
Publicado: (2025)
Na'vi or Knave: Jailbreaking Language Models via Metaphorical Avatars
por: Yan, Yu, et al.
Publicado: (2024)
por: Yan, Yu, et al.
Publicado: (2024)
Defensive Dual Masking for Robust Adversarial Defense
por: Yang, Wangli, et al.
Publicado: (2024)
por: Yang, Wangli, et al.
Publicado: (2024)
Many-Turn Jailbreaking
por: Yang, Xianjun, et al.
Publicado: (2025)
por: Yang, Xianjun, et al.
Publicado: (2025)
KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
por: Pei, Aihua, et al.
Publicado: (2024)
por: Pei, Aihua, et al.
Publicado: (2024)
Collab: Controlled Decoding using Mixture of Agents for LLM Alignment
por: Chakraborty, Souradip, et al.
Publicado: (2025)
por: Chakraborty, Souradip, et al.
Publicado: (2025)
Ejemplares similares
-
CircuitSynth: Reliable Synthetic Data Generation
por: Cheng, Zehua, et al.
Publicado: (2026) -
CasualSynth: Generating Structurally Sound Synthetic Data
por: Cheng, Zehua, et al.
Publicado: (2026) -
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
por: Ji, Haoxuan, et al.
Publicado: (2024) -
AttentionDefense: Leveraging System Prompt Attention for Explainable Defense Against Novel Jailbreaks
por: Siska, Charlotte, et al.
Publicado: (2025) -
SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
por: Pei, Aihua, et al.
Publicado: (2024)