Defending LLMs against Jailbreaking Attacks via Backtranslation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yihan, Shi, Zhouxing, Bai, Andrew, Hsieh, Cho-Jui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
di: Li, Xirui, et al.
Pubblicazione: (2024)
di: Li, Xirui, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
di: Chen, Kexin, et al.
Pubblicazione: (2024)
di: Chen, Kexin, et al.
Pubblicazione: (2024)
PARDEN, Can You Repeat That? Defending against Jailbreaks via Repetition
di: Zhang, Ziyang, et al.
Pubblicazione: (2024)
di: Zhang, Ziyang, et al.
Pubblicazione: (2024)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
Accelerating Large Language Model Pretraining via LFR Pedagogy: Learn, Focus, and Review
di: Prakriya, Neha, et al.
Pubblicazione: (2024)
di: Prakriya, Neha, et al.
Pubblicazione: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
di: Zhou, Andy, et al.
Pubblicazione: (2024)
di: Zhou, Andy, et al.
Pubblicazione: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Backtranslation and paraphrasing in the LLM era? Comparing data augmentation methods for emotion classification
di: Radliński, Łukasz, et al.
Pubblicazione: (2025)
di: Radliński, Łukasz, et al.
Pubblicazione: (2025)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
di: Yung, Canaan, et al.
Pubblicazione: (2024)
di: Yung, Canaan, et al.
Pubblicazione: (2024)
MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
di: Jiang, Weisen, et al.
Pubblicazione: (2025)
di: Jiang, Weisen, et al.
Pubblicazione: (2025)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
di: Guo, Xingang, et al.
Pubblicazione: (2024)
di: Guo, Xingang, et al.
Pubblicazione: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2024)
di: Kao, Kuei-Chun, et al.
Pubblicazione: (2024)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
di: Mu, Honglin, et al.
Pubblicazione: (2024)
di: Mu, Honglin, et al.
Pubblicazione: (2024)
Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming
di: Sharma, Mrinank, et al.
Pubblicazione: (2025)
di: Sharma, Mrinank, et al.
Pubblicazione: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
Certified Training with Branch-and-Bound for Lyapunov-stable Neural Control
di: Shi, Zhouxing, et al.
Pubblicazione: (2024)
di: Shi, Zhouxing, et al.
Pubblicazione: (2024)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
di: Pu, Rui, et al.
Pubblicazione: (2024)
di: Pu, Rui, et al.
Pubblicazione: (2024)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
di: Akbar-Tajari, Mohammad, et al.
Pubblicazione: (2025)
di: Akbar-Tajari, Mohammad, et al.
Pubblicazione: (2025)
ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
di: Li, Xirui, et al.
Pubblicazione: (2026)
di: Li, Xirui, et al.
Pubblicazione: (2026)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
Jailbreak Instruction-Tuned LLMs via end-of-sentence MLP Re-weighting
di: Luo, Yifan, et al.
Pubblicazione: (2024)
di: Luo, Yifan, et al.
Pubblicazione: (2024)
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
di: Yin, Shangjian, et al.
Pubblicazione: (2026)
di: Yin, Shangjian, et al.
Pubblicazione: (2026)
On the Loss of Context-awareness in General Instruction Fine-tuning
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks
di: Kirch, Nathalie, et al.
Pubblicazione: (2024)
di: Kirch, Nathalie, et al.
Pubblicazione: (2024)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
di: Gohil, Vasudev
Pubblicazione: (2025)
di: Gohil, Vasudev
Pubblicazione: (2025)
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
The Saturation Point of Backtranslation in High Quality Low Resource English Gujarati Machine Translation
di: Arif, Arwa
Pubblicazione: (2025)
di: Arif, Arwa
Pubblicazione: (2025)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
di: Li, Xirui, et al.
Pubblicazione: (2024) -
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024) -
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024) -
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024) -
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)