Harmful Prompt Laundering: Jailbreaking LLMs with Abductive Styles and Symbolic Encoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Joo, Seongho, Koh, Hyukhun, Jung, Kyomin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Public Data Assisted Differentially Private In-Context Learning
par: Joo, Seongho, et autres
Publié: (2025)
par: Joo, Seongho, et autres
Publié: (2025)
Can LLMs Recognize Toxicity? A Structured Investigation Framework and Toxicity Metric
par: Koh, Hyukhun, et autres
Publié: (2024)
par: Koh, Hyukhun, et autres
Publié: (2024)
Conditional [MASK] Discrete Diffusion Language Model
par: Koh, Hyukhun, et autres
Publié: (2024)
par: Koh, Hyukhun, et autres
Publié: (2024)
Black-Box Hallucination Detection via Consistency Under the Uncertain Expression
par: Joo, Seongho, et autres
Publié: (2025)
par: Joo, Seongho, et autres
Publié: (2025)
Program Synthesis via Test-Time Transduction
par: Lee, Kang-il, et autres
Publié: (2025)
par: Lee, Kang-il, et autres
Publié: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
Casual as an Anchor: Resolving Supervision Misalignment in Formality Transfer Dataset
par: Yu, Hyojeong, et autres
Publié: (2026)
par: Yu, Hyojeong, et autres
Publié: (2026)
Fine-grained Gender Control in Machine Translation with Large Language Models
par: Lee, Minwoo, et autres
Publié: (2024)
par: Lee, Minwoo, et autres
Publié: (2024)
MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers
par: Park, Kyeongman, et autres
Publié: (2025)
par: Park, Kyeongman, et autres
Publié: (2025)
`For Argument's Sake, Show Me How to Harm Myself!': Jailbreaking LLMs in Suicide and Self-Harm Contexts
par: Schoene, Annika M, et autres
Publié: (2025)
par: Schoene, Annika M, et autres
Publié: (2025)
Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
par: Lee, Sangmook, et autres
Publié: (2025)
par: Lee, Sangmook, et autres
Publié: (2025)
Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions
par: Chan, Yik Siu, et autres
Publié: (2025)
par: Chan, Yik Siu, et autres
Publié: (2025)
LLMs can be easily Confused by Instructional Distractions
par: Hwang, Yerin, et autres
Publié: (2025)
par: Hwang, Yerin, et autres
Publié: (2025)
Avoidance Decoding for Diverse Multi-Branch Story Generation
par: Park, Kyeongman, et autres
Publié: (2025)
par: Park, Kyeongman, et autres
Publié: (2025)
LongStory: Coherent, Complete and Length Controlled Long story Generation
par: Park, Kyeongman, et autres
Publié: (2023)
par: Park, Kyeongman, et autres
Publié: (2023)
Say It Differently: Linguistic Styles as Jailbreak Vectors
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs
par: Li, Xiaoxia, et autres
Publié: (2024)
par: Li, Xiaoxia, et autres
Publié: (2024)
NeSTR: A Neuro-Symbolic Abductive Framework for Temporal Reasoning in Large Language Models
par: Liang, Feng, et autres
Publié: (2025)
par: Liang, Feng, et autres
Publié: (2025)
What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks
par: Kirch, Nathalie, et autres
Publié: (2024)
par: Kirch, Nathalie, et autres
Publié: (2024)
StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation
par: Zheng, Huawei, et autres
Publié: (2026)
par: Zheng, Huawei, et autres
Publié: (2026)
Uncovering the Potential Risks in Unlearning: Danger of English-only Unlearning in Multilingual LLMs
par: Hwang, Kyomin, et autres
Publié: (2025)
par: Hwang, Kyomin, et autres
Publié: (2025)
Soft Begging: Modular and Efficient Shielding of LLMs against Prompt Injection and Jailbreaking based on Prompt Tuning
par: Ostermann, Simon, et autres
Publié: (2024)
par: Ostermann, Simon, et autres
Publié: (2024)
Generating Diverse Hypotheses for Inductive Reasoning
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
FaithUn: Toward Faithful Forgetting in Language Models by Investigating the Interconnectedness of Knowledge
par: Yang, Nakyeong, et autres
Publié: (2025)
par: Yang, Nakyeong, et autres
Publié: (2025)
Unplug and Play Language Models: Decomposing Experts in Language Models at Inference Time
par: Yang, Nakyeong, et autres
Publié: (2024)
par: Yang, Nakyeong, et autres
Publié: (2024)
When Wording Steers the Evaluation: Framing Bias in LLM judges
par: Hwang, Yerin, et autres
Publié: (2026)
par: Hwang, Yerin, et autres
Publié: (2026)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
Playing Language Game with LLMs Leads to Jailbreaking
par: Peng, Yu, et autres
Publié: (2024)
par: Peng, Yu, et autres
Publié: (2024)
Abductive Reasoning with Syllogistic Forms in Large Language Models
par: Abe, Hirohiko, et autres
Publié: (2026)
par: Abe, Hirohiko, et autres
Publié: (2026)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
par: Weng, Zixuan, et autres
Publié: (2025)
par: Weng, Zixuan, et autres
Publié: (2025)
Poisoned LangChain: Jailbreak LLMs by LangChain
par: Wang, Ziqiu, et autres
Publié: (2024)
par: Wang, Ziqiu, et autres
Publié: (2024)
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
Jailbreaking to Jailbreak
par: Kritz, Jeremy, et autres
Publié: (2025)
par: Kritz, Jeremy, et autres
Publié: (2025)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
MP2D: An Automated Topic Shift Dialogue Generation Framework Leveraging Knowledge Graphs
par: Hwang, Yerin, et autres
Publié: (2024)
par: Hwang, Yerin, et autres
Publié: (2024)
Data Laundering: Artificially Boosting Benchmark Results through Knowledge Distillation
par: Mansurov, Jonibek, et autres
Publié: (2024)
par: Mansurov, Jonibek, et autres
Publié: (2024)
From We to Me: Theory Informed Narrative Shift with Abductive Reasoning
par: Patil, Jaikrishna Manojkumar, et autres
Publié: (2026)
par: Patil, Jaikrishna Manojkumar, et autres
Publié: (2026)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
par: Liu, Xiaogeng, et autres
Publié: (2023)
par: Liu, Xiaogeng, et autres
Publié: (2023)
Documents similaires
-
Public Data Assisted Differentially Private In-Context Learning
par: Joo, Seongho, et autres
Publié: (2025) -
Can LLMs Recognize Toxicity? A Structured Investigation Framework and Toxicity Metric
par: Koh, Hyukhun, et autres
Publié: (2024) -
Conditional [MASK] Discrete Diffusion Language Model
par: Koh, Hyukhun, et autres
Publié: (2024) -
Black-Box Hallucination Detection via Consistency Under the Uncertain Expression
par: Joo, Seongho, et autres
Publié: (2025) -
Program Synthesis via Test-Time Transduction
par: Lee, Kang-il, et autres
Publié: (2025)