Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
Fuente:
arXiv
Salvato in:
| Autori principali: | Xing, Wenpeng, Li, Mohan, Hu, Chunqiang, Xu, Haitao, Zhang, Ningyu, Lin, Bo, Han, Meng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement
di: Yue, Xubin, et al.
Pubblicazione: (2025)
di: Yue, Xubin, et al.
Pubblicazione: (2025)
EverTracer: Hunting Stolen Large Language Models via Stealthy and Robust Probabilistic Fingerprint
di: Xu, Zhenhua, et al.
Pubblicazione: (2025)
di: Xu, Zhenhua, et al.
Pubblicazione: (2025)
Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks
di: Chu, Junjie, et al.
Pubblicazione: (2026)
di: Chu, Junjie, et al.
Pubblicazione: (2026)
Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
di: Xing, Wenpeng, et al.
Pubblicazione: (2025)
When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents
di: Jones, Jaylen, et al.
Pubblicazione: (2026)
di: Jones, Jaylen, et al.
Pubblicazione: (2026)
NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks
di: Asl, Javad Rafiei, et al.
Pubblicazione: (2025)
di: Asl, Javad Rafiei, et al.
Pubblicazione: (2025)
ForgetMark: Stealthy Fingerprint Embedding via Targeted Unlearning in Language Models
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking
di: Wang, Zeng, et al.
Pubblicazione: (2026)
di: Wang, Zeng, et al.
Pubblicazione: (2026)
Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills
di: Hsu, Chia-Yi, et al.
Pubblicazione: (2026)
di: Hsu, Chia-Yi, et al.
Pubblicazione: (2026)
Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
di: Kaunismaa, Jackson, et al.
Pubblicazione: (2026)
di: Kaunismaa, Jackson, et al.
Pubblicazione: (2026)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Differentially Private Distance Query with Asymmetric Noise
di: Sheng, Weihong, et al.
Pubblicazione: (2025)
di: Sheng, Weihong, et al.
Pubblicazione: (2025)
Local Distance Query with Differential Privacy
di: Sheng, Weihong, et al.
Pubblicazione: (2025)
di: Sheng, Weihong, et al.
Pubblicazione: (2025)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
di: He, Zeqing, et al.
Pubblicazione: (2024)
di: He, Zeqing, et al.
Pubblicazione: (2024)
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration
di: Tsmindashvili, Tatia, et al.
Pubblicazione: (2025)
di: Tsmindashvili, Tatia, et al.
Pubblicazione: (2025)
GenTel-Safe: A Unified Benchmark and Shielding Framework for Defending Against Prompt Injection Attacks
di: Li, Rongchang, et al.
Pubblicazione: (2024)
di: Li, Rongchang, et al.
Pubblicazione: (2024)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
Fingerprint Vector: Enabling Scalable and Efficient Model Fingerprint Transfer via Vector Addition
di: Xu, Zhenhua, et al.
Pubblicazione: (2024)
di: Xu, Zhenhua, et al.
Pubblicazione: (2024)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
di: Lin, Runqi, et al.
Pubblicazione: (2025)
di: Lin, Runqi, et al.
Pubblicazione: (2025)
HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
di: Liu, Yuexiao, et al.
Pubblicazione: (2025)
di: Liu, Yuexiao, et al.
Pubblicazione: (2025)
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
KinGuard: Hierarchical Kinship-Aware Fingerprinting to Defend Against Large Language Model Stealing
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
di: Xu, Zhenhua, et al.
Pubblicazione: (2026)
The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
di: Nikolić, Kristina, et al.
Pubblicazione: (2025)
di: Nikolić, Kristina, et al.
Pubblicazione: (2025)
Harmless Backdoor-based Client-side Watermarking in Federated Learning
di: Luo, Kaijing, et al.
Pubblicazione: (2024)
di: Luo, Kaijing, et al.
Pubblicazione: (2024)
From Compression to Accountability: Harmless Copyright Protection for Dataset Distillation
di: Liang, Yan, et al.
Pubblicazione: (2026)
di: Liang, Yan, et al.
Pubblicazione: (2026)
Temporal UI State Inconsistency in Desktop GUI Agents: Formalizing and Defending Against TOCTOU Attacks on Computer-Use Agents
di: Xu, Wenpeng
Pubblicazione: (2026)
di: Xu, Wenpeng
Pubblicazione: (2026)
WalletProbe: A Testing Framework for Browser-based Cryptocurrency Wallet Extensions
di: Hu, Xiaohui, et al.
Pubblicazione: (2025)
di: Hu, Xiaohui, et al.
Pubblicazione: (2025)
BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger
di: Chen, Yulin, et al.
Pubblicazione: (2024)
di: Chen, Yulin, et al.
Pubblicazione: (2024)
When Safe Models Merge into Danger: Exploiting Latent Vulnerabilities in LLM Fusion
di: Li, Jiaqing, et al.
Pubblicazione: (2026)
di: Li, Jiaqing, et al.
Pubblicazione: (2026)
Involuntary Jailbreak: On Self-Prompting Attacks
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
LLMGuard: Guarding Against Unsafe LLM Behavior
di: Goyal, Shubh, et al.
Pubblicazione: (2024)
di: Goyal, Shubh, et al.
Pubblicazione: (2024)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
di: Yang, Fan
Pubblicazione: (2025)
di: Yang, Fan
Pubblicazione: (2025)
Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks
di: Kabir, Md Rysul, et al.
Pubblicazione: (2026)
di: Kabir, Md Rysul, et al.
Pubblicazione: (2026)
Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise
di: Huang, Zhen, et al.
Pubblicazione: (2026)
di: Huang, Zhen, et al.
Pubblicazione: (2026)
Beyond Jailbreak: Unveiling Risks in LLM Applications Arising from Blurred Capability Boundaries
di: Zhang, Yunyi, et al.
Pubblicazione: (2025)
di: Zhang, Yunyi, et al.
Pubblicazione: (2025)
Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses
di: Derya, Kemal, et al.
Pubblicazione: (2026)
di: Derya, Kemal, et al.
Pubblicazione: (2026)
Targeted Fuzzing for Unsafe Rust Code: Leveraging Selective Instrumentation
di: Paaßen, David, et al.
Pubblicazione: (2025)
di: Paaßen, David, et al.
Pubblicazione: (2025)
Exploiting Prefix-Tree in Structured Output Interfaces for Enhancing Jailbreak Attacking
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
di: Li, Yanzeng, et al.
Pubblicazione: (2025)
Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
di: Chen, Luoyu, et al.
Pubblicazione: (2026)
di: Chen, Luoyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement
di: Yue, Xubin, et al.
Pubblicazione: (2025) -
EverTracer: Hunting Stolen Large Language Models via Stealthy and Robust Probabilistic Fingerprint
di: Xu, Zhenhua, et al.
Pubblicazione: (2025) -
Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks
di: Chu, Junjie, et al.
Pubblicazione: (2026) -
Towards Robust and Secure Embodied AI: A Survey on Vulnerabilities and Attacks
di: Xing, Wenpeng, et al.
Pubblicazione: (2025) -
When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents
di: Jones, Jaylen, et al.
Pubblicazione: (2026)