An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as Optimizer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Weipeng, Wang, Zhenting, Zhai, Juan, Ma, Shiqing, Zhao, Zhengyu, Shen, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
par: Wang, Yanting, et autres
Publié: (2025)
par: Wang, Yanting, et autres
Publié: (2025)
Efficient DNN-Powered Software with Fair Sparse Models
par: Gao, Xuanqi, et autres
Publié: (2024)
par: Gao, Xuanqi, et autres
Publié: (2024)
Holistic Audit Dataset Generation for LLM Unlearning via Knowledge Graph Traversal and Redundancy Removal
par: Jiang, Weipeng, et autres
Publié: (2025)
par: Jiang, Weipeng, et autres
Publié: (2025)
False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models
par: Jiang, Weipeng, et autres
Publié: (2026)
par: Jiang, Weipeng, et autres
Publié: (2026)
Mitigating Stylistic Biases of Machine Translation Systems via Monolingual Corpora Only
par: Gao, Xuanqi, et autres
Publié: (2025)
par: Gao, Xuanqi, et autres
Publié: (2025)
GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs
par: Basani, Advik Raj, et autres
Publié: (2024)
par: Basani, Advik Raj, et autres
Publié: (2024)
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
par: Du, Mengyao, et autres
Publié: (2026)
par: Du, Mengyao, et autres
Publié: (2026)
From Effectiveness to Efficiency: Uncovering Linguistic Bias in Large Language Model-based Code Generation
par: Jiang, Weipeng, et autres
Publié: (2024)
par: Jiang, Weipeng, et autres
Publié: (2024)
Speculative Coreset Selection for Task-Specific Fine-tuning
par: Zhang, Xiaoyu, et autres
Publié: (2024)
par: Zhang, Xiaoyu, et autres
Publié: (2024)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
par: Shen, Guangyu, et autres
Publié: (2024)
par: Shen, Guangyu, et autres
Publié: (2024)
Vript: A Video Is Worth Thousands of Words
par: Yang, Dongjie, et autres
Publié: (2024)
par: Yang, Dongjie, et autres
Publié: (2024)
The Foundation Cracks: A Comprehensive Study on Bugs and Testing Practices in LLM Libraries
par: Jiang, Weipeng, et autres
Publié: (2025)
par: Jiang, Weipeng, et autres
Publié: (2025)
The Invisible Hand: Unveiling Provider Bias in Large Language Models for Code Generation
par: Zhang, Xiaoyu, et autres
Publié: (2025)
par: Zhang, Xiaoyu, et autres
Publié: (2025)
Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization
par: Hu, Kai, et autres
Publié: (2024)
par: Hu, Kai, et autres
Publié: (2024)
DREAM: Debugging and Repairing AutoML Pipelines
par: Zhang, Xiaoyu, et autres
Publié: (2023)
par: Zhang, Xiaoyu, et autres
Publié: (2023)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
par: Zhao, Yunhan, et autres
Publié: (2024)
par: Zhao, Yunhan, et autres
Publié: (2024)
Constrained Efficient Global Optimization of Expensive Black-box Functions
par: Xu, Wenjie, et autres
Publié: (2022)
par: Xu, Wenjie, et autres
Publié: (2022)
Token-Budget-Aware LLM Reasoning
par: Han, Tingxu, et autres
Publié: (2024)
par: Han, Tingxu, et autres
Publié: (2024)
Data-centric NLP Backdoor Defense from the Lens of Memorization
par: Wang, Zhenting, et autres
Publié: (2024)
par: Wang, Zhenting, et autres
Publié: (2024)
Task-free Adaptive Meta Black-box Optimization
par: Wang, Chao, et autres
Publié: (2026)
par: Wang, Chao, et autres
Publié: (2026)
An Embedding is Worth a Thousand Noisy Labels
par: Di Salvo, Francesco, et autres
Publié: (2024)
par: Di Salvo, Francesco, et autres
Publié: (2024)
A Video Is Not Worth a Thousand Words
par: Pollard, Sam, et autres
Publié: (2025)
par: Pollard, Sam, et autres
Publié: (2025)
JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs
par: Li, Hongyi, et autres
Publié: (2024)
par: Li, Hongyi, et autres
Publié: (2024)
Black-box Optimization of LLM Outputs by Asking for Directions
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
Universal Multi-view Black-box Attack against Object Detectors via Layout Optimization
par: Wang, Donghua, et autres
Publié: (2024)
par: Wang, Donghua, et autres
Publié: (2024)
Universal Jailbreak Suffixes Are Strong Attention Hijackers
par: Ben-Tov, Matan, et autres
Publié: (2025)
par: Ben-Tov, Matan, et autres
Publié: (2025)
Rethinking Technology Stack Selection with AI Coding Proficiency
par: Zhang, Xiaoyu, et autres
Publié: (2025)
par: Zhang, Xiaoyu, et autres
Publié: (2025)
PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization
par: Li, Mingzhe, et autres
Publié: (2025)
par: Li, Mingzhe, et autres
Publié: (2025)
Adaptive Content Restriction for Large Language Models via Suffix Optimization
par: Li, Yige, et autres
Publié: (2025)
par: Li, Yige, et autres
Publié: (2025)
A LoRA is Worth a Thousand Pictures
par: Liu, Chenxi, et autres
Publié: (2024)
par: Liu, Chenxi, et autres
Publié: (2024)
How to Trace Latent Generative Model Generated Images without Artificial Watermark?
par: Wang, Zhenting, et autres
Publié: (2024)
par: Wang, Zhenting, et autres
Publié: (2024)
CITADEL: Context Similarity Based Deep Learning Framework Bug Finding
par: Zhang, Xiaoyu, et autres
Publié: (2024)
par: Zhang, Xiaoyu, et autres
Publié: (2024)
MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models
par: Gao, Xuanqi, et autres
Publié: (2025)
par: Gao, Xuanqi, et autres
Publié: (2025)
ASSURE: Metamorphic Testing for AI-powered Browser Extensions
par: Gao, Xuanqi, et autres
Publié: (2025)
par: Gao, Xuanqi, et autres
Publié: (2025)
PANDAS: Improving Many-shot Jailbreaking via Positive Affirmation, Negative Demonstration, and Adaptive Sampling
par: Ma, Avery, et autres
Publié: (2025)
par: Ma, Avery, et autres
Publié: (2025)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
par: Ji, Haoxuan, et autres
Publié: (2024)
par: Ji, Haoxuan, et autres
Publié: (2024)
Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
par: Tang, Haochun, et autres
Publié: (2026)
par: Tang, Haochun, et autres
Publié: (2026)
OpenBox: A Python Toolkit for Generalized Black-box Optimization
par: Jiang, Huaijun, et autres
Publié: (2023)
par: Jiang, Huaijun, et autres
Publié: (2023)
WordVIS: A Color Worth A Thousand Words
par: Khan, Umar, et autres
Publié: (2024)
par: Khan, Umar, et autres
Publié: (2024)
A Label is Worth a Thousand Images in Dataset Distillation
par: Qin, Tian, et autres
Publié: (2024)
par: Qin, Tian, et autres
Publié: (2024)
Documents similaires
-
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
par: Wang, Yanting, et autres
Publié: (2025) -
Efficient DNN-Powered Software with Fair Sparse Models
par: Gao, Xuanqi, et autres
Publié: (2024) -
Holistic Audit Dataset Generation for LLM Unlearning via Knowledge Graph Traversal and Redundancy Removal
par: Jiang, Weipeng, et autres
Publié: (2025) -
False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models
par: Jiang, Weipeng, et autres
Publié: (2026) -
Mitigating Stylistic Biases of Machine Translation Systems via Monolingual Corpora Only
par: Gao, Xuanqi, et autres
Publié: (2025)