Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution Strategy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jeong, Joonhyun, Bae, Seyun, Jung, Yeonsung, Hwang, Jaeryong, Yang, Eunho |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can LLMs be Fooled? Investigating Vulnerabilities in LLMs
par: Abdali, Sara, et autres
Publié: (2024)
par: Abdali, Sara, et autres
Publié: (2024)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
par: Wang, Xinkai, et autres
Publié: (2025)
par: Wang, Xinkai, et autres
Publié: (2025)
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
par: Xu, Wenzhuo, et autres
Publié: (2026)
par: Xu, Wenzhuo, et autres
Publié: (2026)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
par: Liu, Xu, et autres
Publié: (2025)
par: Liu, Xu, et autres
Publié: (2025)
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
par: Xu, Wenzhuo, et autres
Publié: (2025)
par: Xu, Wenzhuo, et autres
Publié: (2025)
LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs
par: Jha, Piyush, et autres
Publié: (2024)
par: Jha, Piyush, et autres
Publié: (2024)
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
par: Wang, Yanting, et autres
Publié: (2025)
par: Wang, Yanting, et autres
Publié: (2025)
Mitigating Jailbreaks with Intent-Aware LLMs
par: Yeo, Wei Jie, et autres
Publié: (2025)
par: Yeo, Wei Jie, et autres
Publié: (2025)
The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning
par: Liu, Mingrui, et autres
Publié: (2025)
par: Liu, Mingrui, et autres
Publié: (2025)
Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt
par: Jenny, Maël, et autres
Publié: (2026)
par: Jenny, Maël, et autres
Publié: (2026)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
par: Xiang, Shiyu, et autres
Publié: (2025)
par: Xiang, Shiyu, et autres
Publié: (2025)
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions
par: Guo, Xuyang, et autres
Publié: (2025)
par: Guo, Xuyang, et autres
Publié: (2025)
You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense
par: Mai, Wuyuao, et autres
Publié: (2025)
par: Mai, Wuyuao, et autres
Publié: (2025)
Dagger Behind Smile: Fool LLMs with a Happy Ending Story
par: Song, Xurui, et autres
Publié: (2025)
par: Song, Xurui, et autres
Publié: (2025)
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
par: Nakka, Krishna Kanth, et autres
Publié: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
par: Xiong, Chen, et autres
Publié: (2024)
par: Xiong, Chen, et autres
Publié: (2024)
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
par: Chen, Xuan, et autres
Publié: (2024)
par: Chen, Xuan, et autres
Publié: (2024)
PUZZLED: Jailbreaking LLMs through Word-Based Puzzles
par: Ahn, Yelim, et autres
Publié: (2025)
par: Ahn, Yelim, et autres
Publié: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
par: Jaiswal, Piyush, et autres
Publié: (2026)
par: Jaiswal, Piyush, et autres
Publié: (2026)
Re-Triggering Safeguards within LLMs for Jailbreak Detection
par: Lin, Zheng, et autres
Publié: (2026)
par: Lin, Zheng, et autres
Publié: (2026)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
par: Luo, Xuan, et autres
Publié: (2025)
par: Luo, Xuan, et autres
Publié: (2025)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
par: Zhang, Chiyu, et autres
Publié: (2025)
par: Zhang, Chiyu, et autres
Publié: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
par: Shang, Zhengchun, et autres
Publié: (2025)
par: Shang, Zhengchun, et autres
Publié: (2025)
Alphabet Index Mapping: Jailbreaking LLMs through Semantic Dissimilarity
par: Husain, Bilal Saleh
Publié: (2025)
par: Husain, Bilal Saleh
Publié: (2025)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
par: Cui, Tiehan, et autres
Publié: (2025)
par: Cui, Tiehan, et autres
Publié: (2025)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
par: Chen, Yunhao, et autres
Publié: (2025)
par: Chen, Yunhao, et autres
Publié: (2025)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
par: Gong, Xueluan, et autres
Publié: (2024)
par: Gong, Xueluan, et autres
Publié: (2024)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026)
par: Guo, Weiyang, et autres
Publié: (2026)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
par: Xie, Zhixin, et autres
Publié: (2026)
par: Xie, Zhixin, et autres
Publié: (2026)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
par: Piet, Julien, et autres
Publié: (2025)
par: Piet, Julien, et autres
Publié: (2025)
Out of Distribution, Out of Luck: How Well Can LLMs Trained on Vulnerability Datasets Detect Top 25 CWE Weaknesses?
par: Li, Yikun, et autres
Publié: (2025)
par: Li, Yikun, et autres
Publié: (2025)
"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
par: Sun, Zhen, et autres
Publié: (2025)
par: Sun, Zhen, et autres
Publié: (2025)
Documents similaires
-
Can LLMs be Fooled? Investigating Vulnerabilities in LLMs
par: Abdali, Sara, et autres
Publié: (2024) -
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
par: Wang, Xinkai, et autres
Publié: (2025) -
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
par: Xu, Wenzhuo, et autres
Publié: (2026) -
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026) -
ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
par: Liu, Xu, et autres
Publié: (2025)