Enregistré dans:
| Auteurs principaux: | Wang, Hao, Li, Hao, Huang, Minlie, Sha, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.16006 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
par: Wang, Xinyuan, et autres
Publié: (2024)
par: Wang, Xinyuan, et autres
Publié: (2024)
DiffusionAttacker: Diffusion-Driven Prompt Manipulation for LLM Jailbreak
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Mitigating Adversarial Attacks in LLMs through Defensive Suffix Generation
par: Kim, Minkyoung, et autres
Publié: (2024)
par: Kim, Minkyoung, et autres
Publié: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
par: Zhang, Zhexin, et autres
Publié: (2023)
par: Zhang, Zhexin, et autres
Publié: (2023)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)
par: Mu, Junjie, et autres
Publié: (2025)
ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs
par: Ni, Ziyi, et autres
Publié: (2025)
par: Ni, Ziyi, et autres
Publié: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
par: Chen, Yunhao, et autres
Publié: (2025)
par: Chen, Yunhao, et autres
Publié: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
Dialogue Injection Attack: Jailbreaking LLMs through Context Manipulation
par: Meng, Wenlong, et autres
Publié: (2025)
par: Meng, Wenlong, et autres
Publié: (2025)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
par: Zhang, Zhexin, et autres
Publié: (2024)
par: Zhang, Zhexin, et autres
Publié: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
Harnessing the Plug-and-Play Controller by Prompting
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
par: Lin, Liang, et autres
Publié: (2025)
par: Lin, Liang, et autres
Publié: (2025)
AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs
par: Liao, Zeyi, et autres
Publié: (2024)
par: Liao, Zeyi, et autres
Publié: (2024)
AmpleGCG-Plus: A Strong Generative Model of Adversarial Suffixes to Jailbreak LLMs with Higher Success Rates in Fewer Attempts
par: Kumar, Vishal, et autres
Publié: (2024)
par: Kumar, Vishal, et autres
Publié: (2024)
Activation-Guided Local Editing for Jailbreaking Attacks
par: Wang, Jiecong, et autres
Publié: (2025)
par: Wang, Jiecong, et autres
Publié: (2025)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
par: Wang, Zijun, et autres
Publié: (2024)
par: Wang, Zijun, et autres
Publié: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
par: Wang, Yihan, et autres
Publié: (2024)
par: Wang, Yihan, et autres
Publié: (2024)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
par: Noughabi, Havva Alizadeh, et autres
Publié: (2025)
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
par: Zhang, Zhexin, et autres
Publié: (2025)
par: Zhang, Zhexin, et autres
Publié: (2025)
SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis
par: Wong, Aidan, et autres
Publié: (2024)
par: Wong, Aidan, et autres
Publié: (2024)
Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks
par: Chen, Kexin, et autres
Publié: (2024)
par: Chen, Kexin, et autres
Publié: (2024)
A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness
par: Luo, Xuan, et autres
Publié: (2025)
par: Luo, Xuan, et autres
Publié: (2025)
Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
par: Xiao, Zhongyu, et autres
Publié: (2026)
par: Xiao, Zhongyu, et autres
Publié: (2026)
Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis
par: Lin, Yuping, et autres
Publié: (2024)
par: Lin, Yuping, et autres
Publié: (2024)
Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs
par: Zhou, Yao, et autres
Publié: (2026)
par: Zhou, Yao, et autres
Publié: (2026)
DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification
par: Li, Yu, et autres
Publié: (2025)
par: Li, Yu, et autres
Publié: (2025)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
par: Li, Qizhang, et autres
Publié: (2024)
par: Li, Qizhang, et autres
Publié: (2024)
COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability
par: Guo, Xingang, et autres
Publié: (2024)
par: Guo, Xingang, et autres
Publié: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
par: Huang, Xijie, et autres
Publié: (2024)
par: Huang, Xijie, et autres
Publié: (2024)
Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
par: Gu, Yuxian, et autres
Publié: (2024)
par: Gu, Yuxian, et autres
Publié: (2024)
Language Models Hallucinate, but May Excel at Fact Verification
par: Guan, Jian, et autres
Publié: (2023)
par: Guan, Jian, et autres
Publié: (2023)
Large Language Models Are Not Robust Multiple Choice Selectors
par: Zheng, Chujie, et autres
Publié: (2023)
par: Zheng, Chujie, et autres
Publié: (2023)
Documents similaires
-
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
par: Wang, Xinyuan, et autres
Publié: (2024) -
DiffusionAttacker: Diffusion-Driven Prompt Manipulation for LLM Jailbreak
par: Wang, Hao, et autres
Publié: (2024) -
Mitigating Adversarial Attacks in LLMs through Defensive Suffix Generation
par: Kim, Minkyoung, et autres
Publié: (2024) -
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
par: Zhang, Zhexin, et autres
Publié: (2023) -
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)