SafeDream: Safety World Model for Proactive Early Jailbreak Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Yan, Bo, Lin, Weikai, Zhu, Yada, Wang, Song |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
por: Yang, Xianglin, et al.
Publicado: (2025)
por: Yang, Xianglin, et al.
Publicado: (2025)
SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents
por: Liang, Siyuan, et al.
Publicado: (2025)
por: Liang, Siyuan, et al.
Publicado: (2025)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
por: Song, Weiming, et al.
Publicado: (2026)
por: Song, Weiming, et al.
Publicado: (2026)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
por: Nian, Yi, et al.
Publicado: (2025)
por: Nian, Yi, et al.
Publicado: (2025)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
por: Yang, Fan
Publicado: (2025)
por: Yang, Fan
Publicado: (2025)
Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
por: Wang, Ziwei, et al.
Publicado: (2026)
por: Wang, Ziwei, et al.
Publicado: (2026)
Re-Triggering Safeguards within LLMs for Jailbreak Detection
por: Lin, Zheng, et al.
Publicado: (2026)
por: Lin, Zheng, et al.
Publicado: (2026)
Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
por: Wu, Jinman, et al.
Publicado: (2026)
por: Wu, Jinman, et al.
Publicado: (2026)
Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models
por: Hong, Wenjing, et al.
Publicado: (2026)
por: Hong, Wenjing, et al.
Publicado: (2026)
PCDiff: Proactive Control for Ownership Protection in Diffusion Models with Watermark Compatibility
por: Gai, Keke, et al.
Publicado: (2025)
por: Gai, Keke, et al.
Publicado: (2025)
Proactive Detection of Physical Inter-rule Vulnerabilities in IoT Services Using a Deep Learning Approach
por: Huang, Bing, et al.
Publicado: (2024)
por: Huang, Bing, et al.
Publicado: (2024)
SDD: Self-Degraded Defense against Malicious Fine-tuning
por: Chen, Zixuan, et al.
Publicado: (2025)
por: Chen, Zixuan, et al.
Publicado: (2025)
Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation
por: Zhang, Wenhui, et al.
Publicado: (2025)
por: Zhang, Wenhui, et al.
Publicado: (2025)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
Proactively Detecting Threats: A Novel Approach Using LLMs
por: Chawla, Aniesh, et al.
Publicado: (2026)
por: Chawla, Aniesh, et al.
Publicado: (2026)
Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem
por: Lin, Shuyi, et al.
Publicado: (2025)
por: Lin, Shuyi, et al.
Publicado: (2025)
SoK: Robustness in Large Language Models against Jailbreak Attacks
por: Xu, Feiyue, et al.
Publicado: (2026)
por: Xu, Feiyue, et al.
Publicado: (2026)
NegBLEURT Forest: Leveraging Inconsistencies for Detecting Jailbreak Attacks
por: Sleem, Lama, et al.
Publicado: (2025)
por: Sleem, Lama, et al.
Publicado: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Untargeted Jailbreak Attack
por: Huang, Xinzhe, et al.
Publicado: (2025)
por: Huang, Xinzhe, et al.
Publicado: (2025)
Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation
por: Liu, Zehao, et al.
Publicado: (2025)
por: Liu, Zehao, et al.
Publicado: (2025)
Confusion is the Final Barrier: Rethinking Jailbreak Evaluation and Investigating the Real Misuse Threat of LLMs
por: Yan, Yu, et al.
Publicado: (2025)
por: Yan, Yu, et al.
Publicado: (2025)
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
por: Fang, Xianya, et al.
Publicado: (2026)
por: Fang, Xianya, et al.
Publicado: (2026)
Proactive Detection of Voice Cloning with Localized Watermarking
por: Roman, Robin San, et al.
Publicado: (2024)
por: Roman, Robin San, et al.
Publicado: (2024)
Emoji-Based Jailbreaking of Large Language Models
por: Gopinadh, M P V S, et al.
Publicado: (2026)
por: Gopinadh, M P V S, et al.
Publicado: (2026)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
por: Wang, Zhaoqi, et al.
Publicado: (2025)
por: Wang, Zhaoqi, et al.
Publicado: (2025)
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
por: Lin, Zheng, et al.
Publicado: (2026)
por: Lin, Zheng, et al.
Publicado: (2026)
SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models
por: Fang, Junfeng, et al.
Publicado: (2025)
por: Fang, Junfeng, et al.
Publicado: (2025)
The Dark Side of Function Calling: Pathways to Jailbreaking Large Language Models
por: Wu, Zihui, et al.
Publicado: (2024)
por: Wu, Zihui, et al.
Publicado: (2024)
Coward: Collision-based OOD Watermarking for Practical Proactive Federated Backdoor Detection
por: Li, Wenjie, et al.
Publicado: (2025)
por: Li, Wenjie, et al.
Publicado: (2025)
Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs
por: Gong, Xueluan, et al.
Publicado: (2024)
por: Gong, Xueluan, et al.
Publicado: (2024)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
por: Zhou, Kaiwen, et al.
Publicado: (2025)
por: Zhou, Kaiwen, et al.
Publicado: (2025)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
por: Zeng, Yi, et al.
Publicado: (2024)
por: Zeng, Yi, et al.
Publicado: (2024)
Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion
por: Pramanik, Vishal, et al.
Publicado: (2026)
por: Pramanik, Vishal, et al.
Publicado: (2026)
ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack
por: Lin, Xingwei, et al.
Publicado: (2026)
por: Lin, Xingwei, et al.
Publicado: (2026)
Gradient-based Jailbreak Images for Multimodal Fusion Models
por: Rando, Javier, et al.
Publicado: (2024)
por: Rando, Javier, et al.
Publicado: (2024)
LLMs Caught in the Crossfire: Malware Requests and Jailbreak Challenges
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
EVA: Editing for Versatile Alignment against Jailbreaks
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
Ejemplares similares
-
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
por: Yang, Xianglin, et al.
Publicado: (2025) -
SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents
por: Liang, Siyuan, et al.
Publicado: (2025) -
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
por: Xu, Zhangchen, et al.
Publicado: (2024) -
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
por: Song, Weiming, et al.
Publicado: (2026) -
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
por: Nian, Yi, et al.
Publicado: (2025)