NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Chuhan, Zhang, Ye, Shi, Bowen, Gan, Yuyou, Du, Tianyu, Ji, Shouling, Deng, Dazhan, Wu, Yingcai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Profiling for Pennies: Unveiling the Privacy Iceberg of LLM Agents
di: Chen, Jiahao, et al.
Pubblicazione: (2026)
di: Chen, Jiahao, et al.
Pubblicazione: (2026)
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
di: Wang, Xinkai, et al.
Pubblicazione: (2025)
Enhancing Adversarial Transferability with Adversarial Weight Tuning
di: Chen, Jiahao, et al.
Pubblicazione: (2024)
di: Chen, Jiahao, et al.
Pubblicazione: (2024)
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
di: Du, Mengyao, et al.
Pubblicazione: (2026)
di: Du, Mengyao, et al.
Pubblicazione: (2026)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
Beyond Jailbreak: Unveiling Risks in LLM Applications Arising from Blurred Capability Boundaries
di: Zhang, Yunyi, et al.
Pubblicazione: (2025)
di: Zhang, Yunyi, et al.
Pubblicazione: (2025)
CAMH: Advancing Model Hijacking Attack in Machine Learning
di: He, Xing, et al.
Pubblicazione: (2024)
di: He, Xing, et al.
Pubblicazione: (2024)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
di: He, Zeqing, et al.
Pubblicazione: (2024)
di: He, Zeqing, et al.
Pubblicazione: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
ReCIT: Reconstructing Full Private Data from Gradient in Parameter-Efficient Fine-Tuning of Large Language Models
di: Xie, Jin, et al.
Pubblicazione: (2025)
di: Xie, Jin, et al.
Pubblicazione: (2025)
Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation
di: Liu, Zehao, et al.
Pubblicazione: (2025)
di: Liu, Zehao, et al.
Pubblicazione: (2025)
Unveiling the Security Risks of Federated Learning in the Wild: From Research to Practice
di: Chen, Jiahao, et al.
Pubblicazione: (2026)
di: Chen, Jiahao, et al.
Pubblicazione: (2026)
Breaking Isolation: A New Perspective on Hypervisor Exploitation via Cross-Domain Attacks
di: Pan, Gaoning, et al.
Pubblicazione: (2025)
di: Pan, Gaoning, et al.
Pubblicazione: (2025)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
di: Chen, Zejian, et al.
Pubblicazione: (2026)
di: Chen, Zejian, et al.
Pubblicazione: (2026)
CLIBE: Detecting Dynamic Backdoors in Transformer-based NLP Models
di: Zeng, Rui, et al.
Pubblicazione: (2024)
di: Zeng, Rui, et al.
Pubblicazione: (2024)
Automatic Red Teaming LLM-based Agents with Model Context Protocol Tools
di: He, Ping, et al.
Pubblicazione: (2025)
di: He, Ping, et al.
Pubblicazione: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
di: Yang, Yu, et al.
Pubblicazione: (2025)
di: Yang, Yu, et al.
Pubblicazione: (2025)
SUB-PLAY: Adversarial Policies against Partially Observed Multi-Agent Reinforcement Learning Systems
di: Ma, Oubo, et al.
Pubblicazione: (2024)
di: Ma, Oubo, et al.
Pubblicazione: (2024)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses
di: Derya, Kemal, et al.
Pubblicazione: (2026)
di: Derya, Kemal, et al.
Pubblicazione: (2026)
IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents
di: An, Hengyu, et al.
Pubblicazione: (2025)
di: An, Hengyu, et al.
Pubblicazione: (2025)
APT-CGLP: Advanced Persistent Threat Hunting via Contrastive Graph-Language Pre-Training
di: Qiu, Xuebo, et al.
Pubblicazione: (2025)
di: Qiu, Xuebo, et al.
Pubblicazione: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
FuzzLLM: A Novel and Universal Fuzzing Framework for Proactively Discovering Jailbreak Vulnerabilities in Large Language Models
di: Yao, Dongyu, et al.
Pubblicazione: (2023)
di: Yao, Dongyu, et al.
Pubblicazione: (2023)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning
di: Deng, Gelei, et al.
Pubblicazione: (2024)
di: Deng, Gelei, et al.
Pubblicazione: (2024)
Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
di: Chen, Yulin, et al.
Pubblicazione: (2024)
di: Chen, Yulin, et al.
Pubblicazione: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Profiling for Pennies: Unveiling the Privacy Iceberg of LLM Agents
di: Chen, Jiahao, et al.
Pubblicazione: (2026) -
PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
di: Wang, Xinkai, et al.
Pubblicazione: (2025) -
Enhancing Adversarial Transferability with Adversarial Weight Tuning
di: Chen, Jiahao, et al.
Pubblicazione: (2024) -
TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
di: Du, Mengyao, et al.
Pubblicazione: (2026) -
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)