Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Junke, Wang, Jianwei, Chen, Sishuo, He, Yizhang, Feng, Qingshuai, Yang, Zhengyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
di: Chen, Yunhao, et al.
Pubblicazione: (2025)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
di: Hong, Wenjing, et al.
Pubblicazione: (2026)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
di: Li, Jindong, et al.
Pubblicazione: (2026)
di: Li, Jindong, et al.
Pubblicazione: (2026)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
di: Shen, Guobin, et al.
Pubblicazione: (2025)
di: Shen, Guobin, et al.
Pubblicazione: (2025)
Exploiting Prefix-Tree in Structured Output Interfaces for Enhancing Jailbreak Attacking
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
di: Zhong, Xingwei, et al.
Pubblicazione: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
di: Zeng, Churui, et al.
Pubblicazione: (2026)
di: Zeng, Churui, et al.
Pubblicazione: (2026)
Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection
di: Zhou, Yuqi, et al.
Pubblicazione: (2024)
di: Zhou, Yuqi, et al.
Pubblicazione: (2024)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
di: Lin, Runqi, et al.
Pubblicazione: (2025)
di: Lin, Runqi, et al.
Pubblicazione: (2025)
Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate
di: Qi, Senmao, et al.
Pubblicazione: (2025)
di: Qi, Senmao, et al.
Pubblicazione: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
di: Lu, Lin, et al.
Pubblicazione: (2024)
di: Lu, Lin, et al.
Pubblicazione: (2024)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
di: Zhang, Yingjie, et al.
Pubblicazione: (2025)
di: Zhang, Yingjie, et al.
Pubblicazione: (2025)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
di: Piet, Julien, et al.
Pubblicazione: (2025)
di: Piet, Julien, et al.
Pubblicazione: (2025)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)
di: Park, Junyoung, et al.
Pubblicazione: (2026)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
di: He, Zeqing, et al.
Pubblicazione: (2024)
di: He, Zeqing, et al.
Pubblicazione: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
Sealing the Audit-Runtime Gap for LLM Skills
di: Shen, Tingda, et al.
Pubblicazione: (2026)
di: Shen, Tingda, et al.
Pubblicazione: (2026)
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
di: Chen, Kejia, et al.
Pubblicazione: (2026)
di: Chen, Kejia, et al.
Pubblicazione: (2026)
FlipAttack: Jailbreak LLMs via Flipping
di: Liu, Yue, et al.
Pubblicazione: (2024)
di: Liu, Yue, et al.
Pubblicazione: (2024)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
Voice Jailbreak Attacks Against GPT-4o
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
di: Pan, Licheng, et al.
Pubblicazione: (2026)
di: Pan, Licheng, et al.
Pubblicazione: (2026)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
di: Li, Bangxin, et al.
Pubblicazione: (2024)
di: Li, Bangxin, et al.
Pubblicazione: (2024)
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
di: Chen, Xuan, et al.
Pubblicazione: (2024)
di: Chen, Xuan, et al.
Pubblicazione: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025)
di: Tong, Haibo, et al.
Pubblicazione: (2025)
Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration
di: Tsmindashvili, Tatia, et al.
Pubblicazione: (2025)
di: Tsmindashvili, Tatia, et al.
Pubblicazione: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
GraphAttack: Exploiting Representational Blindspots in LLM Safety Mechanisms
di: He, Sinan, et al.
Pubblicazione: (2025)
di: He, Sinan, et al.
Pubblicazione: (2025)
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
di: Xiong, Chen, et al.
Pubblicazione: (2024)
di: Xiong, Chen, et al.
Pubblicazione: (2024)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
di: Mao, Yanxu, et al.
Pubblicazione: (2025)
di: Mao, Yanxu, et al.
Pubblicazione: (2025)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
di: Chen, Yunhao, et al.
Pubblicazione: (2025) -
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
di: Hong, Wenjing, et al.
Pubblicazione: (2026) -
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025) -
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
di: Li, Jindong, et al.
Pubblicazione: (2026) -
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
di: Shen, Guobin, et al.
Pubblicazione: (2025)