Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Guangyu, Cheng, Siyuan, Zhang, Kaiyuan, Tao, Guanhong, An, Shengwei, Yan, Lu, Zhang, Zhuo, Ma, Shiqing, Zhang, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UNIT: Backdoor Mitigation via Automated Neural Distribution Tightening
di: Cheng, Siyuan, et al.
Pubblicazione: (2024)
di: Cheng, Siyuan, et al.
Pubblicazione: (2024)
LOTUS: Evasive and Resilient Backdoor Attacks through Sub-Partitioning
di: Cheng, Siyuan, et al.
Pubblicazione: (2024)
di: Cheng, Siyuan, et al.
Pubblicazione: (2024)
ASPIRER: Bypassing System Prompts With Permutation-based Backdoors in LLMs
di: Yan, Lu, et al.
Pubblicazione: (2024)
di: Yan, Lu, et al.
Pubblicazione: (2024)
Opening A Pandora's Box: Things You Should Know in the Era of Custom GPTs
di: Tao, Guanhong, et al.
Pubblicazione: (2023)
di: Tao, Guanhong, et al.
Pubblicazione: (2023)
Elijah: Eliminating Backdoors Injected in Diffusion Models via Distribution Shift
di: An, Shengwei, et al.
Pubblicazione: (2023)
di: An, Shengwei, et al.
Pubblicazione: (2023)
CENSOR: Defense Against Gradient Inversion via Orthogonal Subspace Bayesian Sampling
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
MGC: A Compiler Framework Exploiting Compositional Blindness in Aligned LLMs for Malware Generation
di: Yan, Lu, et al.
Pubblicazione: (2025)
di: Yan, Lu, et al.
Pubblicazione: (2025)
From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs
di: Shen, Guangyu, et al.
Pubblicazione: (2025)
di: Shen, Guangyu, et al.
Pubblicazione: (2025)
Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving
di: Chen, Xuan, et al.
Pubblicazione: (2025)
di: Chen, Xuan, et al.
Pubblicazione: (2025)
RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs
di: Chen, Xuan, et al.
Pubblicazione: (2024)
di: Chen, Xuan, et al.
Pubblicazione: (2024)
Gradient Shaping: Enhancing Backdoor Attack Against Reverse Engineering
di: Zhu, Rui, et al.
Pubblicazione: (2023)
di: Zhu, Rui, et al.
Pubblicazione: (2023)
TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
di: Wang, Yanting, et al.
Pubblicazione: (2025)
di: Wang, Yanting, et al.
Pubblicazione: (2025)
The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning
di: Liu, Mingrui, et al.
Pubblicazione: (2025)
di: Liu, Mingrui, et al.
Pubblicazione: (2025)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
When LLM Meets DRL: Advancing Jailbreaking Efficiency via DRL-guided Search
di: Chen, Xuan, et al.
Pubblicazione: (2024)
di: Chen, Xuan, et al.
Pubblicazione: (2024)
FlipAttack: Jailbreak LLMs via Flipping
di: Liu, Yue, et al.
Pubblicazione: (2024)
di: Liu, Yue, et al.
Pubblicazione: (2024)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
di: Chen, Zejian, et al.
Pubblicazione: (2026)
di: Chen, Zejian, et al.
Pubblicazione: (2026)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems via Knowledge Asymmetry Exploitation
di: Chen, Yufei, et al.
Pubblicazione: (2025)
di: Chen, Yufei, et al.
Pubblicazione: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
di: Xiong, Chen, et al.
Pubblicazione: (2024)
di: Xiong, Chen, et al.
Pubblicazione: (2024)
The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks
di: Li, Chunyang, et al.
Pubblicazione: (2025)
di: Li, Chunyang, et al.
Pubblicazione: (2025)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
di: Ji, Wence, et al.
Pubblicazione: (2025)
di: Ji, Wence, et al.
Pubblicazione: (2025)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
di: Sun, Zhen, et al.
Pubblicazione: (2025)
di: Sun, Zhen, et al.
Pubblicazione: (2025)
ProSec: Fortifying Code LLMs with Proactive Security Alignment
di: Xu, Xiangzhe, et al.
Pubblicazione: (2024)
di: Xu, Xiangzhe, et al.
Pubblicazione: (2024)
Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak
di: Gu, Haoran, et al.
Pubblicazione: (2026)
di: Gu, Haoran, et al.
Pubblicazione: (2026)
Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models
di: Zhang, Xiaomei, et al.
Pubblicazione: (2026)
di: Zhang, Xiaomei, et al.
Pubblicazione: (2026)
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants
di: Xu, Xiangzhe, et al.
Pubblicazione: (2025)
di: Xu, Xiangzhe, et al.
Pubblicazione: (2025)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
di: Xiang, Shiyu, et al.
Pubblicazione: (2025)
ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs
di: Liu, Xu, et al.
Pubblicazione: (2025)
di: Liu, Xu, et al.
Pubblicazione: (2025)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
di: Gong, Xueluan, et al.
Pubblicazione: (2024)
Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
JailPO: A Novel Black-box Jailbreak Framework via Preference Optimization against Aligned LLMs
di: Li, Hongyi, et al.
Pubblicazione: (2024)
di: Li, Hongyi, et al.
Pubblicazione: (2024)
JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
di: Lu, Lin, et al.
Pubblicazione: (2024)
di: Lu, Lin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
UNIT: Backdoor Mitigation via Automated Neural Distribution Tightening
di: Cheng, Siyuan, et al.
Pubblicazione: (2024) -
LOTUS: Evasive and Resilient Backdoor Attacks through Sub-Partitioning
di: Cheng, Siyuan, et al.
Pubblicazione: (2024) -
ASPIRER: Bypassing System Prompts With Permutation-based Backdoors in LLMs
di: Yan, Lu, et al.
Pubblicazione: (2024) -
Opening A Pandora's Box: Things You Should Know in the Era of Custom GPTs
di: Tao, Guanhong, et al.
Pubblicazione: (2023) -
Elijah: Eliminating Backdoors Injected in Diffusion Models via Distribution Shift
di: An, Shengwei, et al.
Pubblicazione: (2023)