Geneshift: Impact of different scenario shift on Jailbreaking LLM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Tianyi, Xue, Zhiwei, Liu, Yue, Zhang, Jiaheng, Hooi, Bryan, Ng, See-Kiong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
par: Wu, Tianyi, et autres
Publié: (2026)
par: Wu, Tianyi, et autres
Publié: (2026)
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024)
par: Liu, Yue, et autres
Publié: (2024)
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
par: Li, Xirui, et autres
Publié: (2024)
par: Li, Xirui, et autres
Publié: (2024)
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
par: Li, Yuexin, et autres
Publié: (2026)
par: Li, Yuexin, et autres
Publié: (2026)
LLM Jailbreak Detection for (Almost) Free!
par: Chen, Guorui, et autres
Publié: (2025)
par: Chen, Guorui, et autres
Publié: (2025)
Rethinking Machine Unlearning in Image Generation Models
par: Liu, Renyang, et autres
Publié: (2025)
par: Liu, Renyang, et autres
Publié: (2025)
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
par: Zhang, Tianyu, et autres
Publié: (2024)
par: Zhang, Tianyu, et autres
Publié: (2024)
Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents
par: Das, Saswat, et autres
Publié: (2025)
par: Das, Saswat, et autres
Publié: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
par: Yu, Miao, et autres
Publié: (2024)
par: Yu, Miao, et autres
Publié: (2024)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
par: Ji, Wence, et autres
Publié: (2025)
par: Ji, Wence, et autres
Publié: (2025)
MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue
par: Wang, Fengxiang, et autres
Publié: (2024)
par: Wang, Fengxiang, et autres
Publié: (2024)
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
par: Xing, Wenpeng, et autres
Publié: (2025)
par: Xing, Wenpeng, et autres
Publié: (2025)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
par: Cheng, Siyang, et autres
Publié: (2025)
par: Cheng, Siyang, et autres
Publié: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
par: Xu, Zhao, et autres
Publié: (2024)
par: Xu, Zhao, et autres
Publié: (2024)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
par: Dong, Xiaoning, et autres
Publié: (2024)
par: Dong, Xiaoning, et autres
Publié: (2024)
TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
par: Yoon, Sung-Hoon, et autres
Publié: (2026)
par: Yoon, Sung-Hoon, et autres
Publié: (2026)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
par: Schwartz, Daniel, et autres
Publié: (2025)
par: Schwartz, Daniel, et autres
Publié: (2025)
Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks
par: Kabir, Md Rysul, et autres
Publié: (2026)
par: Kabir, Md Rysul, et autres
Publié: (2026)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
par: Ying, Zonghao, et autres
Publié: (2025)
par: Ying, Zonghao, et autres
Publié: (2025)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
par: Pu, Rui, et autres
Publié: (2024)
par: Pu, Rui, et autres
Publié: (2024)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
par: Shen, Guangyu, et autres
Publié: (2024)
par: Shen, Guangyu, et autres
Publié: (2024)
Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections
par: Yang, Xianglin, et autres
Publié: (2026)
par: Yang, Xianglin, et autres
Publié: (2026)
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
par: Ding, Ruomeng, et autres
Publié: (2026)
par: Ding, Ruomeng, et autres
Publié: (2026)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
par: Zhu, Sicheng, et autres
Publié: (2024)
par: Zhu, Sicheng, et autres
Publié: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
par: Mu, Junjie, et autres
Publié: (2025)
par: Mu, Junjie, et autres
Publié: (2025)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
par: Long, Zhuohang, et autres
Publié: (2025)
par: Long, Zhuohang, et autres
Publié: (2025)
Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM
par: Wu, Xiaoyu, et autres
Publié: (2025)
par: Wu, Xiaoyu, et autres
Publié: (2025)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
par: Lv, Lijia, et autres
Publié: (2024)
par: Lv, Lijia, et autres
Publié: (2024)
GuardReasoner: Towards Reasoning-based LLM Safeguards
par: Liu, Yue, et autres
Publié: (2025)
par: Liu, Yue, et autres
Publié: (2025)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
par: Lv, Huijie, et autres
Publié: (2024)
par: Lv, Huijie, et autres
Publié: (2024)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
par: Liu, Yue, et autres
Publié: (2025)
par: Liu, Yue, et autres
Publié: (2025)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
par: Gibbs, Tom, et autres
Publié: (2024)
par: Gibbs, Tom, et autres
Publié: (2024)
Imperceptible Jailbreaking against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2025)
par: Gao, Kuofeng, et autres
Publié: (2025)
Large Reasoning Models Are Autonomous Jailbreak Agents
par: Hagendorff, Thilo, et autres
Publié: (2025)
par: Hagendorff, Thilo, et autres
Publié: (2025)
Documents similaires
-
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
par: Wu, Tianyi, et autres
Publié: (2026) -
FlipAttack: Jailbreak LLMs via Flipping
par: Liu, Yue, et autres
Publié: (2024) -
DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers
par: Li, Xirui, et autres
Publié: (2024) -
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
par: Li, Yuexin, et autres
Publié: (2026) -
LLM Jailbreak Detection for (Almost) Free!
par: Chen, Guorui, et autres
Publié: (2025)