Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Duan, Wei, Qian, Li |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Mind the Trojan Horse: Image Prompt Adapter Enabling Scalable and Deceptive Jailbreaking
von: Chen, Junxi, et al.
Veröffentlicht: (2025)
von: Chen, Junxi, et al.
Veröffentlicht: (2025)
Trojan Horses in Recruiting: A Red-Teaming Case Study on Indirect Prompt Injection in Standard vs. Reasoning Models
von: Wirth, Manuel
Veröffentlicht: (2026)
von: Wirth, Manuel
Veröffentlicht: (2026)
ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
von: Tao, Xijia, et al.
Veröffentlicht: (2024)
von: Tao, Xijia, et al.
Veröffentlicht: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
von: Cheng, Siyang, et al.
Veröffentlicht: (2025)
von: Cheng, Siyang, et al.
Veröffentlicht: (2025)
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
von: Ran, Dezhi, et al.
Veröffentlicht: (2025)
von: Ran, Dezhi, et al.
Veröffentlicht: (2025)
Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
von: Sel, Bilgehan, et al.
Veröffentlicht: (2026)
von: Sel, Bilgehan, et al.
Veröffentlicht: (2026)
The AI Cognitive Trojan Horse: How Large Language Models May Bypass Human Epistemic Vigilance
von: Maynard, Andrew D.
Veröffentlicht: (2026)
von: Maynard, Andrew D.
Veröffentlicht: (2026)
Is the System Message Really Important to Jailbreaks in Large Language Models?
von: Zou, Xiaotian, et al.
Veröffentlicht: (2024)
von: Zou, Xiaotian, et al.
Veröffentlicht: (2024)
Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models
von: Teng, Ma, et al.
Veröffentlicht: (2024)
von: Teng, Ma, et al.
Veröffentlicht: (2024)
Adaptive Prompt Embedding Optimization for LLM Jailbreaking
von: Li, Miles Q., et al.
Veröffentlicht: (2026)
von: Li, Miles Q., et al.
Veröffentlicht: (2026)
MAviS: A Multimodal Conversational Assistant For Avian Species
von: Kryklyvets, Yevheniia, et al.
Veröffentlicht: (2026)
von: Kryklyvets, Yevheniia, et al.
Veröffentlicht: (2026)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
A Multimodal Conversational Assistant for the Characterization of Agricultural Plots from Geospatial Open Data
von: Cañada, Juan, et al.
Veröffentlicht: (2025)
von: Cañada, Juan, et al.
Veröffentlicht: (2025)
Involuntary Jailbreak: On Self-Prompting Attacks
von: Guo, Yangyang, et al.
Veröffentlicht: (2025)
von: Guo, Yangyang, et al.
Veröffentlicht: (2025)
Large Language Models as Misleading Assistants in Conversation
von: Hou, Betty Li, et al.
Veröffentlicht: (2024)
von: Hou, Betty Li, et al.
Veröffentlicht: (2024)
Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
von: Li, Xiaozhe, et al.
Veröffentlicht: (2026)
von: Li, Xiaozhe, et al.
Veröffentlicht: (2026)
Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction
von: Wang, Hongtao, et al.
Veröffentlicht: (2026)
von: Wang, Hongtao, et al.
Veröffentlicht: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
von: Ji, Haoxuan, et al.
Veröffentlicht: (2024)
von: Ji, Haoxuan, et al.
Veröffentlicht: (2024)
GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
von: Yu, Jiahao, et al.
Veröffentlicht: (2023)
von: Yu, Jiahao, et al.
Veröffentlicht: (2023)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
von: Gong, Yichen, et al.
Veröffentlicht: (2023)
von: Gong, Yichen, et al.
Veröffentlicht: (2023)
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
von: Ma, Jiachen, et al.
Veröffentlicht: (2024)
von: Ma, Jiachen, et al.
Veröffentlicht: (2024)
Gradient-based Jailbreak Images for Multimodal Fusion Models
von: Rando, Javier, et al.
Veröffentlicht: (2024)
von: Rando, Javier, et al.
Veröffentlicht: (2024)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
von: Wang, Zhaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Zhaoqi, et al.
Veröffentlicht: (2025)
Klear-AgentForge: Forging Agentic Intelligence through Posttraining Scaling
von: Wang, Qi, et al.
Veröffentlicht: (2025)
von: Wang, Qi, et al.
Veröffentlicht: (2025)
Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
von: Huang, Xun, et al.
Veröffentlicht: (2026)
von: Huang, Xun, et al.
Veröffentlicht: (2026)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
von: Wang, Youze, et al.
Veröffentlicht: (2025)
von: Wang, Youze, et al.
Veröffentlicht: (2025)
Iterative Prompting with Persuasion Skills in Jailbreaking Large Language Models
von: Ke, Shih-Wen, et al.
Veröffentlicht: (2025)
von: Ke, Shih-Wen, et al.
Veröffentlicht: (2025)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
von: Liu, Xiaogeng, et al.
Veröffentlicht: (2023)
von: Liu, Xiaogeng, et al.
Veröffentlicht: (2023)
Jailbreaking with Universal Multi-Prompts
von: Hsu, Yu-Ling, et al.
Veröffentlicht: (2025)
von: Hsu, Yu-Ling, et al.
Veröffentlicht: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
von: Zhang, Zheng, et al.
Veröffentlicht: (2025)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
von: Jaiswal, Piyush, et al.
Veröffentlicht: (2026)
von: Jaiswal, Piyush, et al.
Veröffentlicht: (2026)
TrojanDec: Data-free Detection of Trojan Inputs in Self-supervised Learning
von: Liu, Yupei, et al.
Veröffentlicht: (2025)
von: Liu, Yupei, et al.
Veröffentlicht: (2025)
TrojanWhisper: Evaluating Pre-trained LLMs to Detect and Localize Hardware Trojans
von: Faruque, Md Omar, et al.
Veröffentlicht: (2024)
von: Faruque, Md Omar, et al.
Veröffentlicht: (2024)
MLaGA: Multimodal Large Language and Graph Assistant
von: Fan, Dongzhe, et al.
Veröffentlicht: (2025)
von: Fan, Dongzhe, et al.
Veröffentlicht: (2025)
Jailbreaks on Vision Language Model via Multimodal Reasoning
von: Noheria, Aarush, et al.
Veröffentlicht: (2026)
von: Noheria, Aarush, et al.
Veröffentlicht: (2026)
Uncertainty-Aware Hardware Trojan Detection Using Multimodal Deep Learning
von: Vishwakarma, Rahul, et al.
Veröffentlicht: (2024)
von: Vishwakarma, Rahul, et al.
Veröffentlicht: (2024)
Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs
von: Li, Xiaoxia, et al.
Veröffentlicht: (2024)
von: Li, Xiaoxia, et al.
Veröffentlicht: (2024)
Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing
von: Zhao, Wei, et al.
Veröffentlicht: (2024)
von: Zhao, Wei, et al.
Veröffentlicht: (2024)
`Do as I say not as I do': A Semi-Automated Approach for Jailbreak Prompt Attack against Multimodal LLMs
von: Chiu, Chun Wai, et al.
Veröffentlicht: (2025)
von: Chiu, Chun Wai, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Mind the Trojan Horse: Image Prompt Adapter Enabling Scalable and Deceptive Jailbreaking
von: Chen, Junxi, et al.
Veröffentlicht: (2025) -
Trojan Horses in Recruiting: A Red-Teaming Case Study on Indirect Prompt Injection in Standard vs. Reasoning Models
von: Wirth, Manuel
Veröffentlicht: (2026) -
ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
von: Tao, Xijia, et al.
Veröffentlicht: (2024) -
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
von: Cheng, Siyang, et al.
Veröffentlicht: (2025) -
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
von: Ran, Dezhi, et al.
Veröffentlicht: (2025)