MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Wentian, Xiang, Zhen, Niu, Wei, Guan, Le |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation
di: Liu, Zehao, et al.
Pubblicazione: (2025)
di: Liu, Zehao, et al.
Pubblicazione: (2025)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2025)
di: Wang, Zhaoqi, et al.
Pubblicazione: (2025)
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
di: Lin, Zheng, et al.
Pubblicazione: (2026)
di: Lin, Zheng, et al.
Pubblicazione: (2026)
Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection
di: Debi, Tanusree, et al.
Pubblicazione: (2026)
di: Debi, Tanusree, et al.
Pubblicazione: (2026)
NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models
di: Zhang, Chuhan, et al.
Pubblicazione: (2025)
di: Zhang, Chuhan, et al.
Pubblicazione: (2025)
Manipulating LLM Web Agents with Indirect Prompt Injection Attack via HTML Accessibility Tree
di: Johnson, Sam, et al.
Pubblicazione: (2025)
di: Johnson, Sam, et al.
Pubblicazione: (2025)
Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
The Echo Chamber Multi-Turn LLM Jailbreak
di: Alobaid, Ahmad, et al.
Pubblicazione: (2026)
di: Alobaid, Ahmad, et al.
Pubblicazione: (2026)
Re-Triggering Safeguards within LLMs for Jailbreak Detection
di: Lin, Zheng, et al.
Pubblicazione: (2026)
di: Lin, Zheng, et al.
Pubblicazione: (2026)
The Great Pretender: A Stochasticity Problem in LLM Jailbreak
di: Monteuuis, Jean-Philippe, et al.
Pubblicazione: (2026)
di: Monteuuis, Jean-Philippe, et al.
Pubblicazione: (2026)
EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion
di: Liang, Zhen, et al.
Pubblicazione: (2025)
di: Liang, Zhen, et al.
Pubblicazione: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
di: Mia, Md Jueal, et al.
Pubblicazione: (2026)
Invisible Tokens, Visible Bills: The Urgent Need to Audit Hidden Operations in Opaque LLM Services
di: Sun, Guoheng, et al.
Pubblicazione: (2025)
di: Sun, Guoheng, et al.
Pubblicazione: (2025)
Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
di: Sun, Zhen, et al.
Pubblicazione: (2025)
di: Sun, Zhen, et al.
Pubblicazione: (2025)
SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage
di: Dong, Xiaoning, et al.
Pubblicazione: (2024)
di: Dong, Xiaoning, et al.
Pubblicazione: (2024)
Token-Efficient Prompt Injection Attack: Provoking Cessation in LLM Reasoning via Adaptive Token Compression
di: Cui, Yu, et al.
Pubblicazione: (2025)
di: Cui, Yu, et al.
Pubblicazione: (2025)
PathSeeker: Exploring LLM Security Vulnerabilities with a Reinforcement Learning-Based Jailbreak Approach
di: Lin, Zhihao, et al.
Pubblicazione: (2024)
di: Lin, Zhihao, et al.
Pubblicazione: (2024)
OptiLeak: Efficient Prompt Reconstruction via Reinforcement Learning in Multi-tenant LLM Services
di: Wang, Longxiang, et al.
Pubblicazione: (2026)
di: Wang, Longxiang, et al.
Pubblicazione: (2026)
Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration
di: Tsmindashvili, Tatia, et al.
Pubblicazione: (2025)
di: Tsmindashvili, Tatia, et al.
Pubblicazione: (2025)
Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks
di: Geng, Jianing, et al.
Pubblicazione: (2025)
di: Geng, Jianing, et al.
Pubblicazione: (2025)
FlipAttack: Jailbreak LLMs via Flipping
di: Liu, Yue, et al.
Pubblicazione: (2024)
di: Liu, Yue, et al.
Pubblicazione: (2024)
New Wide-Net-Casting Jailbreak Attacks Risk Large Models
di: Xiang, Qiuchi, et al.
Pubblicazione: (2026)
di: Xiang, Qiuchi, et al.
Pubblicazione: (2026)
Active Honeypot Guardrail System: Probing and Confirming Multi-Turn LLM Jailbreaks
di: Wu, ChenYu, et al.
Pubblicazione: (2025)
di: Wu, ChenYu, et al.
Pubblicazione: (2025)
Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
di: Zhang, Yingjie, et al.
Pubblicazione: (2025)
di: Zhang, Yingjie, et al.
Pubblicazione: (2025)
Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate
di: Qi, Senmao, et al.
Pubblicazione: (2025)
di: Qi, Senmao, et al.
Pubblicazione: (2025)
Enhancing Jailbreak Attacks on LLMs via Persona Prompts
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks
di: Asl, Javad Rafiei, et al.
Pubblicazione: (2025)
di: Asl, Javad Rafiei, et al.
Pubblicazione: (2025)
CCFC: Core & Core-Full-Core Dual-Track Defense for LLM Jailbreak Protection
di: Hu, Jiaming, et al.
Pubblicazione: (2025)
di: Hu, Jiaming, et al.
Pubblicazione: (2025)
Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
di: Russinovich, Mark, et al.
Pubblicazione: (2024)
di: Russinovich, Mark, et al.
Pubblicazione: (2024)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
di: Shang, Zhengchun, et al.
Pubblicazione: (2025)
The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
di: Hossain, Ismail, et al.
Pubblicazione: (2026)
AiRacleX: Automated Detection of Price Oracle Manipulations via LLM-Driven Knowledge Mining and Prompt Generation
di: Gao, Bo, et al.
Pubblicazione: (2025)
di: Gao, Bo, et al.
Pubblicazione: (2025)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
LLM Jailbreak Detection for (Almost) Free!
di: Chen, Guorui, et al.
Pubblicazione: (2025)
di: Chen, Guorui, et al.
Pubblicazione: (2025)
Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack
di: Kang, Daewon, et al.
Pubblicazione: (2025)
di: Kang, Daewon, et al.
Pubblicazione: (2025)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
di: Mu, Junjie, et al.
Pubblicazione: (2025)
di: Mu, Junjie, et al.
Pubblicazione: (2025)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
di: Chen, Wenyu, et al.
Pubblicazione: (2026)
di: Chen, Wenyu, et al.
Pubblicazione: (2026)
VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
di: Nie, Yuzhou, et al.
Pubblicazione: (2025)
di: Nie, Yuzhou, et al.
Pubblicazione: (2025)
SafeDream: Safety World Model for Proactive Early Jailbreak Detection
di: Yan, Bo, et al.
Pubblicazione: (2026)
di: Yan, Bo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation
di: Liu, Zehao, et al.
Pubblicazione: (2025) -
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2025) -
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
di: Lin, Zheng, et al.
Pubblicazione: (2026) -
Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection
di: Debi, Tanusree, et al.
Pubblicazione: (2026) -
NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models
di: Zhang, Chuhan, et al.
Pubblicazione: (2025)