Adaptive Prompt Embedding Optimization for LLM Jailbreaking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Miles Q., Fung, Benjamin C. M., Li, Boyang, Rad, Radin Hamidi, Bagheri, Ebrahim |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Security Concerns for Large Language Models: A Survey
par: Li, Miles Q., et autres
Publié: (2025)
par: Li, Miles Q., et autres
Publié: (2025)
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents
par: Li, Miles Q., et autres
Publié: (2026)
par: Li, Miles Q., et autres
Publié: (2026)
Training Dynamics of a 1.7B LLaMa Model: A Data-Efficient Approach
par: Li, Miles Q., et autres
Publié: (2024)
par: Li, Miles Q., et autres
Publié: (2024)
On the Effectiveness of Incremental Training of Large Language Models
par: Li, Miles Q., et autres
Publié: (2024)
par: Li, Miles Q., et autres
Publié: (2024)
QueryGym: A Toolkit for Reproducible LLM-Based Query Reformulation
par: Bigdeli, Amin, et autres
Publié: (2025)
par: Bigdeli, Amin, et autres
Publié: (2025)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
par: Wang, Zhaoqi, et autres
Publié: (2025)
par: Wang, Zhaoqi, et autres
Publié: (2025)
A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents
par: Li, Miles Q., et autres
Publié: (2025)
par: Li, Miles Q., et autres
Publié: (2025)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
par: Shamsi, Zafir, et autres
Publié: (2026)
par: Shamsi, Zafir, et autres
Publié: (2026)
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
par: Zhang, Jianyi, et autres
Publié: (2025)
par: Zhang, Jianyi, et autres
Publié: (2025)
Involuntary Jailbreak: On Self-Prompting Attacks
par: Guo, Yangyang, et autres
Publié: (2025)
par: Guo, Yangyang, et autres
Publié: (2025)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
par: Li, Xirui, et autres
Publié: (2024)
par: Li, Xirui, et autres
Publié: (2024)
Benchmarking Prompt Sensitivity in Large Language Models
par: Razavi, Amirhossein, et autres
Publié: (2025)
par: Razavi, Amirhossein, et autres
Publié: (2025)
Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges
par: Koo, Hamin, et autres
Publié: (2025)
par: Koo, Hamin, et autres
Publié: (2025)
A Reproducibility Study of LLM-Based Query Reformulation
par: Bigdeli, Amin, et autres
Publié: (2026)
par: Bigdeli, Amin, et autres
Publié: (2026)
Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message
par: Duan, Wei, et autres
Publié: (2025)
par: Duan, Wei, et autres
Publié: (2025)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models
par: Bigdeli, Amin, et autres
Publié: (2026)
par: Bigdeli, Amin, et autres
Publié: (2026)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
par: Ji, Haoxuan, et autres
Publié: (2024)
par: Ji, Haoxuan, et autres
Publié: (2024)
Embedding by Elicitation: Dynamic Representations for Bayesian Optimization of System Prompts
par: Lin, Zhiyuan Jerry, et autres
Publié: (2026)
par: Lin, Zhiyuan Jerry, et autres
Publié: (2026)
Adversarial Training via Adaptive Knowledge Amalgamation of an Ensemble of Teachers
par: Hamidi, Shayan Mohajer, et autres
Publié: (2024)
par: Hamidi, Shayan Mohajer, et autres
Publié: (2024)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
par: Zhou, Andy, et autres
Publié: (2024)
par: Zhou, Andy, et autres
Publié: (2024)
Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs
par: Li, Jianan, et autres
Publié: (2026)
par: Li, Jianan, et autres
Publié: (2026)
Generating Synthetic Datasets for Few-shot Prompt Tuning
par: Guo, Xu, et autres
Publié: (2024)
par: Guo, Xu, et autres
Publié: (2024)
Jailbreaking LLM-Controlled Robots
par: Robey, Alexander, et autres
Publié: (2024)
par: Robey, Alexander, et autres
Publié: (2024)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
AdaFed: Fair Federated Learning via Adaptive Common Descent Direction
par: Hamidi, Shayan Mohajer, et autres
Publié: (2024)
par: Hamidi, Shayan Mohajer, et autres
Publié: (2024)
Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
par: Huang, Xun, et autres
Publié: (2026)
par: Huang, Xun, et autres
Publié: (2026)
NeuroPrompts: An Adaptive Framework to Optimize Prompts for Text-to-Image Generation
par: Rosenman, Shachar, et autres
Publié: (2023)
par: Rosenman, Shachar, et autres
Publié: (2023)
From Fewer Samples to Fewer Bits: Reframing Dataset Distillation as Joint Optimization of Precision and Compactness
par: Dinh, My H., et autres
Publié: (2026)
par: Dinh, My H., et autres
Publié: (2026)
EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions
par: Wu, Xiaorui, et autres
Publié: (2025)
par: Wu, Xiaorui, et autres
Publié: (2025)
LLM Jailbreak Detection for (Almost) Free!
par: Chen, Guorui, et autres
Publié: (2025)
par: Chen, Guorui, et autres
Publié: (2025)
Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs
par: Li, Xiaoxia, et autres
Publié: (2024)
par: Li, Xiaoxia, et autres
Publié: (2024)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
par: Nian, Yi, et autres
Publié: (2025)
par: Nian, Yi, et autres
Publié: (2025)
LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models
par: Jiang, Zhiyuan, et autres
Publié: (2026)
par: Jiang, Zhiyuan, et autres
Publié: (2026)
LLM Based Bayesian Optimization for Prompt Search
par: Ballew, Adam, et autres
Publié: (2025)
par: Ballew, Adam, et autres
Publié: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
par: Ma, Jiachen, et autres
Publié: (2024)
par: Ma, Jiachen, et autres
Publié: (2024)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning
par: Guo, Weiyang, et autres
Publié: (2025)
par: Guo, Weiyang, et autres
Publié: (2025)
PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting
par: Tsai, Yu-Che, et autres
Publié: (2026)
par: Tsai, Yu-Che, et autres
Publié: (2026)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
par: Jaiswal, Piyush, et autres
Publié: (2026)
par: Jaiswal, Piyush, et autres
Publié: (2026)
Documents similaires
-
Security Concerns for Large Language Models: A Survey
par: Li, Miles Q., et autres
Publié: (2025) -
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents
par: Li, Miles Q., et autres
Publié: (2026) -
Training Dynamics of a 1.7B LLaMa Model: A Data-Efficient Approach
par: Li, Miles Q., et autres
Publié: (2024) -
On the Effectiveness of Incremental Training of Large Language Models
par: Li, Miles Q., et autres
Publié: (2024) -
QueryGym: A Toolkit for Reproducible LLM-Based Query Reformulation
par: Bigdeli, Amin, et autres
Publié: (2025)