FlipAttack: Jailbreak LLMs via Flipping
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yue, He, Xiaoxin, Xiong, Miao, Fu, Jinlan, Deng, Shumin, Ma, Yingwei, Zhang, Jiaheng, Hooi, Bryan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement Learning
di: Khalil, Khurram, et al.
Pubblicazione: (2025)
di: Khalil, Khurram, et al.
Pubblicazione: (2025)
Targeted Bit-Flip Attacks on LLM-Based Agents
di: Wang, Jialai, et al.
Pubblicazione: (2026)
di: Wang, Jialai, et al.
Pubblicazione: (2026)
Geneshift: Impact of different scenario shift on Jailbreaking LLM
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
di: Wu, Tianyi, et al.
Pubblicazione: (2025)
VPI-Bench: Visual Prompt Injection Attacks for Computer-Use Agents
di: Cao, Tri, et al.
Pubblicazione: (2025)
di: Cao, Tri, et al.
Pubblicazione: (2025)
GenBFA: An Evolutionary Optimization Approach to Bit-Flip Attacks on LLMs
di: Das, Sanjay, et al.
Pubblicazione: (2024)
di: Das, Sanjay, et al.
Pubblicazione: (2024)
Verification of Bit-Flip Attacks against Quantized Neural Networks
di: Zhang, Yedi, et al.
Pubblicazione: (2025)
di: Zhang, Yedi, et al.
Pubblicazione: (2025)
Compiled Models, Built-In Exploits: Uncovering Pervasive Bit-Flip Attack Surfaces in DNN Executables
di: Chen, Yanzuo, et al.
Pubblicazione: (2023)
di: Chen, Yanzuo, et al.
Pubblicazione: (2023)
DeepNcode: Encoding-Based Protection against Bit-Flip Attacks on Neural Networks
di: Velčický, Patrik, et al.
Pubblicazione: (2024)
di: Velčický, Patrik, et al.
Pubblicazione: (2024)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
di: Liu, Xiaoqun, et al.
Pubblicazione: (2024)
FaRAccel: FPGA-Accelerated Defense Architecture for Efficient Bit-Flip Attack Resilience in Transformer Models
di: Nazari, Najmeh, et al.
Pubblicazione: (2025)
di: Nazari, Najmeh, et al.
Pubblicazione: (2025)
Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion
di: Cui, Tiehan, et al.
Pubblicazione: (2025)
di: Cui, Tiehan, et al.
Pubblicazione: (2025)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
di: Sun, Zhen, et al.
Pubblicazione: (2025)
di: Sun, Zhen, et al.
Pubblicazione: (2025)
Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs
di: Xu, Zhao, et al.
Pubblicazione: (2024)
di: Xu, Zhao, et al.
Pubblicazione: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
di: Li, Xiaohu, et al.
Pubblicazione: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
di: Tong, Haibo, et al.
Pubblicazione: (2025)
di: Tong, Haibo, et al.
Pubblicazione: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
di: Yang, Xianglin, et al.
Pubblicazione: (2026)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Exploiting Prefix-Tree in Structured Output Interfaces for Enhancing Jailbreak Attacking
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
DiscourseFlip: An Oblique Discourse-Level Opinion Manipulation Attack against Black-box Retrieval-Augmented Generation
di: Gong, Yuyang, et al.
Pubblicazione: (2026)
di: Gong, Yuyang, et al.
Pubblicazione: (2026)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
di: Ma, Siyuan, et al.
Pubblicazione: (2024)
Transferable & Stealthy Ensemble Attacks: A Black-Box Jailbreaking Framework for Large Language Models
di: Yang, Yiqi, et al.
Pubblicazione: (2024)
di: Yang, Yiqi, et al.
Pubblicazione: (2024)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
di: Pu, Rui, et al.
Pubblicazione: (2024)
di: Pu, Rui, et al.
Pubblicazione: (2024)
BitFlipScope: Scalable Fault Localization and Recovery for Bit-Flip Corruptions in LLMs
di: Karamat, Muhammad Zeeshan, et al.
Pubblicazione: (2025)
di: Karamat, Muhammad Zeeshan, et al.
Pubblicazione: (2025)
Involuntary Jailbreak: On Self-Prompting Attacks
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
di: Yan, Yu, et al.
Pubblicazione: (2026)
di: Yan, Yu, et al.
Pubblicazione: (2026)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement Learning
di: Khalil, Khurram, et al.
Pubblicazione: (2025) -
Targeted Bit-Flip Attacks on LLM-Based Agents
di: Wang, Jialai, et al.
Pubblicazione: (2026) -
Geneshift: Impact of different scenario shift on Jailbreaking LLM
di: Wu, Tianyi, et al.
Pubblicazione: (2025) -
VPI-Bench: Visual Prompt Injection Attacks for Computer-Use Agents
di: Cao, Tri, et al.
Pubblicazione: (2025) -
GenBFA: An Evolutionary Optimization Approach to Bit-Flip Attacks on LLMs
di: Das, Sanjay, et al.
Pubblicazione: (2024)