Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Yu-Hang, Xiong, Yu-Jie, Zhang, Hao, Zhang, Jia-Chen, Zhou, Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Proactive defense against LLM Jailbreak
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
di: Zhang, Chiyu, et al.
Pubblicazione: (2026)
di: Zhang, Chiyu, et al.
Pubblicazione: (2026)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
di: Yan, Yu, et al.
Pubblicazione: (2025)
di: Yan, Yu, et al.
Pubblicazione: (2025)
Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives
di: Chang, Wenhan, et al.
Pubblicazione: (2025)
di: Chang, Wenhan, et al.
Pubblicazione: (2025)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
Towards Safe AI Clinicians: A Comprehensive Study on Large Language Model Jailbreaking in Healthcare
di: Zhang, Hang, et al.
Pubblicazione: (2025)
di: Zhang, Hang, et al.
Pubblicazione: (2025)
Fight Poison with Poison: Enhancing Robustness in Few-shot Machine-Generated Text Detection with Adversarial Training
di: Duan, Wenjing, et al.
Pubblicazione: (2026)
di: Duan, Wenjing, et al.
Pubblicazione: (2026)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
LLM Jailbreak Detection for (Almost) Free!
di: Chen, Guorui, et al.
Pubblicazione: (2025)
di: Chen, Guorui, et al.
Pubblicazione: (2025)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
di: Liu, Songyang, et al.
Pubblicazione: (2026)
di: Liu, Songyang, et al.
Pubblicazione: (2026)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
One Model Transfer to All: On Robust Jailbreak Prompts Generation against LLMs
di: Li, Linbao, et al.
Pubblicazione: (2025)
di: Li, Linbao, et al.
Pubblicazione: (2025)
Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
di: Shen, Guobin, et al.
Pubblicazione: (2025)
di: Shen, Guobin, et al.
Pubblicazione: (2025)
AdaSteer: Your Aligned LLM is Inherently an Adaptive Jailbreak Defender
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
di: Zhao, Weixiang, et al.
Pubblicazione: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods
di: Huang, Ruixuan, et al.
Pubblicazione: (2025)
di: Huang, Ruixuan, et al.
Pubblicazione: (2025)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
Mitigating Jailbreaks with Intent-Aware LLMs
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures
di: Zhou, Yukai, et al.
Pubblicazione: (2025)
di: Zhou, Yukai, et al.
Pubblicazione: (2025)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
RAG Safety: Exploring Knowledge Poisoning Attacks to Retrieval-Augmented Generation
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
di: Li, Jindong, et al.
Pubblicazione: (2026)
di: Li, Jindong, et al.
Pubblicazione: (2026)
Universal Jailbreak Backdoors from Poisoned Human Feedback
di: Rando, Javier, et al.
Pubblicazione: (2023)
di: Rando, Javier, et al.
Pubblicazione: (2023)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Retrieval-Augmented Review Generation for Poisoning Recommender Systems
di: Yang, Shiyi, et al.
Pubblicazione: (2025)
di: Yang, Shiyi, et al.
Pubblicazione: (2025)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
Activation-Guided Local Editing for Jailbreaking Attacks
di: Wang, Jiecong, et al.
Pubblicazione: (2025)
di: Wang, Jiecong, et al.
Pubblicazione: (2025)
Root Defence Strategies: Ensuring Safety of LLM at the Decoding Level
di: Zeng, Xinyi, et al.
Pubblicazione: (2024)
di: Zeng, Xinyi, et al.
Pubblicazione: (2024)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
di: Li, Yucheng, et al.
Pubblicazione: (2025)
di: Li, Yucheng, et al.
Pubblicazione: (2025)
Watermarking LLM Agent Trajectories
di: Meng, Wenlong, et al.
Pubblicazione: (2026)
di: Meng, Wenlong, et al.
Pubblicazione: (2026)
Watermarking Conditional Text Generation for AI Detection: Unveiling Challenges and a Semantic-Aware Watermark Remedy
di: Fu, Yu, et al.
Pubblicazione: (2023)
di: Fu, Yu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Proactive defense against LLM Jailbreak
di: Zhao, Weiliang, et al.
Pubblicazione: (2025) -
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025) -
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
di: Zhang, Chiyu, et al.
Pubblicazione: (2026) -
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
di: Yan, Yu, et al.
Pubblicazione: (2025) -
Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives
di: Chang, Wenhan, et al.
Pubblicazione: (2025)