Enregistré dans:
| Auteurs principaux: | Yung, Canaan, Dolatabadi, Hadi Mohaghegh, Erfani, Sarah, Leckie, Christopher |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.13517 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Geometry-Guided Adversarial Prompt Detection via Curvature and Local Intrinsic Dimension
par: Yung, Canaan, et autres
Publié: (2025)
par: Yung, Canaan, et autres
Publié: (2025)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
par: Cui, Kaiyuan, et autres
Publié: (2026)
par: Cui, Kaiyuan, et autres
Publié: (2026)
The Devil's Advocate: Shattering the Illusion of Unexploitable Data using Diffusion Models
par: Dolatabadi, Hadi M., et autres
Publié: (2023)
par: Dolatabadi, Hadi M., et autres
Publié: (2023)
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
par: Skorobogat, Ronald, et autres
Publié: (2026)
par: Skorobogat, Ronald, et autres
Publié: (2026)
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
par: Attia, Ahmed, et autres
Publié: (2026)
par: Attia, Ahmed, et autres
Publié: (2026)
Imperceptible Jailbreaking against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2025)
par: Gao, Kuofeng, et autres
Publié: (2025)
Be Persistent: Towards a Unified Solution for Mitigating Shortcuts in Deep Learning
par: Dolatabadi, Hadi M., et autres
Publié: (2024)
par: Dolatabadi, Hadi M., et autres
Publié: (2024)
Leveraging the Context through Multi-Round Interactions for Jailbreaking Attacks
par: Cheng, Yixin, et autres
Publié: (2024)
par: Cheng, Yixin, et autres
Publié: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
par: Jiang, Tanqiu, et autres
Publié: (2024)
par: Jiang, Tanqiu, et autres
Publié: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models
par: Li, Xiao, et autres
Publié: (2024)
par: Li, Xiao, et autres
Publié: (2024)
Exploiting Inter-Sample Information for Long-tailed Out-of-Distribution Detection
par: Udayangani, Nimeshika, et autres
Publié: (2025)
par: Udayangani, Nimeshika, et autres
Publié: (2025)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
par: Luo, Weidi, et autres
Publié: (2024)
par: Luo, Weidi, et autres
Publié: (2024)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
par: Zhou, Guanghao, et autres
Publié: (2025)
par: Zhou, Guanghao, et autres
Publié: (2025)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
par: Chen, Kexin, et autres
Publié: (2024)
par: Chen, Kexin, et autres
Publié: (2024)
Semantic Representation Attack against Aligned Large Language Models
par: Lian, Jiawei, et autres
Publié: (2025)
par: Lian, Jiawei, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
Defending against Jailbreak through Early Exit Generation of Large Language Models
par: Zhao, Chongwen, et autres
Publié: (2024)
par: Zhao, Chongwen, et autres
Publié: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP
par: Huang, Hanxun, et autres
Publié: (2025)
par: Huang, Hanxun, et autres
Publié: (2025)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
par: Ma, Zhiqing, et autres
Publié: (2026)
par: Ma, Zhiqing, et autres
Publié: (2026)
DROJ: A Prompt-Driven Attack against Large Language Models
par: Hu, Leyang, et autres
Publié: (2024)
par: Hu, Leyang, et autres
Publié: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
par: Zou, Qingsong, et autres
Publié: (2025)
par: Zou, Qingsong, et autres
Publié: (2025)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
par: Feng, Bo-Han, et autres
Publié: (2026)
par: Feng, Bo-Han, et autres
Publié: (2026)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
par: Oh, Sejoon, et autres
Publié: (2024)
par: Oh, Sejoon, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models
par: Ball, Sarah, et autres
Publié: (2024)
par: Ball, Sarah, et autres
Publié: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
par: Wang, Fengxiang, et autres
Publié: (2024)
par: Wang, Fengxiang, et autres
Publié: (2024)
Documents similaires
-
Geometry-Guided Adversarial Prompt Detection via Curvature and Local Intrinsic Dimension
par: Yung, Canaan, et autres
Publié: (2025) -
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
par: Cui, Kaiyuan, et autres
Publié: (2026) -
The Devil's Advocate: Shattering the Illusion of Unexploitable Data using Diffusion Models
par: Dolatabadi, Hadi M., et autres
Publié: (2023) -
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
par: Skorobogat, Ronald, et autres
Publié: (2026) -
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
par: Attia, Ahmed, et autres
Publié: (2026)