Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhilong, Cao, Yebo, Liu, Peng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles
di: Wang, Zhilong, et al.
Pubblicazione: (2024)
di: Wang, Zhilong, et al.
Pubblicazione: (2024)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
di: Xiong, Chen, et al.
Pubblicazione: (2026)
di: Xiong, Chen, et al.
Pubblicazione: (2026)
Invisible Prompts, Visible Threats: Malicious Font Injection in External Resources for Large Language Models
di: Xiong, Junjie, et al.
Pubblicazione: (2025)
di: Xiong, Junjie, et al.
Pubblicazione: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)
di: Park, Junyoung, et al.
Pubblicazione: (2026)
On Jailbreaking Quantized Language Models Through Fault Injection Attacks
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
di: Yan, Yu, et al.
Pubblicazione: (2025)
di: Yan, Yu, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
di: Wang, Zhaoqi, et al.
Pubblicazione: (2026)
Goal-guided Generative Prompt Injection Attack on Large Language Models
di: Zhang, Chong, et al.
Pubblicazione: (2024)
di: Zhang, Chong, et al.
Pubblicazione: (2024)
Noise Injection Reveals Hidden Capabilities of Sandbagging Language Models
di: Tice, Cameron, et al.
Pubblicazione: (2024)
di: Tice, Cameron, et al.
Pubblicazione: (2024)
To Protect the LLM Agent Against the Prompt Injection Attack with Polymorphic Prompt
di: Wang, Zhilong, et al.
Pubblicazione: (2025)
di: Wang, Zhilong, et al.
Pubblicazione: (2025)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
di: Yoon, Sangyeon, et al.
Pubblicazione: (2026)
ShallowJail: Steering Jailbreaks against Large Language Models
di: Liu, Shang, et al.
Pubblicazione: (2026)
di: Liu, Shang, et al.
Pubblicazione: (2026)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
di: Wang, Ziwei, et al.
Pubblicazione: (2026)
di: Wang, Ziwei, et al.
Pubblicazione: (2026)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
Leveraging Large Language Models to Detect npm Malicious Packages
di: Zahan, Nusrat, et al.
Pubblicazione: (2024)
di: Zahan, Nusrat, et al.
Pubblicazione: (2024)
MALSIGHT: Exploring Malicious Source Code and Benign Pseudocode for Iterative Binary Malware Summarization
di: Lu, Haolang, et al.
Pubblicazione: (2024)
di: Lu, Haolang, et al.
Pubblicazione: (2024)
Emoji-Based Jailbreaking of Large Language Models
di: Gopinadh, M P V S, et al.
Pubblicazione: (2026)
di: Gopinadh, M P V S, et al.
Pubblicazione: (2026)
Malla: Demystifying Real-world Large Language Model Integrated Malicious Services
di: Lin, Zilong, et al.
Pubblicazione: (2024)
di: Lin, Zilong, et al.
Pubblicazione: (2024)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
SoK: Robustness in Large Language Models against Jailbreak Attacks
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
di: Xu, Feiyue, et al.
Pubblicazione: (2026)
The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models
di: Wu, Zihui, et al.
Pubblicazione: (2024)
di: Wu, Zihui, et al.
Pubblicazione: (2024)
Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models
di: Wang, Youze, et al.
Pubblicazione: (2025)
di: Wang, Youze, et al.
Pubblicazione: (2025)
PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization
di: Liu, Aofan, et al.
Pubblicazione: (2025)
di: Liu, Aofan, et al.
Pubblicazione: (2025)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
di: Peng, Benji, et al.
Pubblicazione: (2024)
di: Peng, Benji, et al.
Pubblicazione: (2024)
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
di: Noever, David, et al.
Pubblicazione: (2024)
di: Noever, David, et al.
Pubblicazione: (2024)
Analysis of LLMs Against Prompt Injection and Jailbreak Attacks
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
di: Jaiswal, Piyush, et al.
Pubblicazione: (2026)
FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments
di: Mehta, Astha, et al.
Pubblicazione: (2026)
di: Mehta, Astha, et al.
Pubblicazione: (2026)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models
di: Zheng, Youjia, et al.
Pubblicazione: (2025)
di: Zheng, Youjia, et al.
Pubblicazione: (2025)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
Jailbreaking is (Mostly) Simpler Than You Think
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
di: Ran, Delong, et al.
Pubblicazione: (2024)
di: Ran, Delong, et al.
Pubblicazione: (2024)
TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense
di: Liu, Cheng, et al.
Pubblicazione: (2026)
di: Liu, Cheng, et al.
Pubblicazione: (2026)
Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
di: Zhang, Yingjie, et al.
Pubblicazione: (2025)
di: Zhang, Yingjie, et al.
Pubblicazione: (2025)
Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent
di: Shang, Shang, et al.
Pubblicazione: (2024)
di: Shang, Shang, et al.
Pubblicazione: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models
di: Zhang, Chuhan, et al.
Pubblicazione: (2025)
di: Zhang, Chuhan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Hide Your Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Carrier Articles
di: Wang, Zhilong, et al.
Pubblicazione: (2024) -
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
di: Xiong, Chen, et al.
Pubblicazione: (2026) -
Invisible Prompts, Visible Threats: Malicious Font Injection in External Resources for Large Language Models
di: Xiong, Junjie, et al.
Pubblicazione: (2025) -
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024) -
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)