Saved in:
| Main Authors: | Chen, Zixuan, Lin, Hao, Xu, Ke, Jiang, Xinghao, Sun, Tanfeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2505.18979 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization
by: Chen, Zixuan, et al.
Published: (2026)
by: Chen, Zixuan, et al.
Published: (2026)
Enhancing LLM Safety via Constrained Direct Preference Optimization
by: Liu, Zixuan, et al.
Published: (2024)
by: Liu, Zixuan, et al.
Published: (2024)
Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility
by: Wang, Mengxuan, et al.
Published: (2026)
by: Wang, Mengxuan, et al.
Published: (2026)
When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?
by: Tian, Yuan, et al.
Published: (2026)
by: Tian, Yuan, et al.
Published: (2026)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
by: Chen, Zixuan, et al.
Published: (2026)
by: Chen, Zixuan, et al.
Published: (2026)
The Safety-Aware Denoiser for Text Diffusion Models
by: Yusuf, Amman, et al.
Published: (2026)
by: Yusuf, Amman, et al.
Published: (2026)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
by: Oh, Sejoon, et al.
Published: (2024)
by: Oh, Sejoon, et al.
Published: (2024)
On Optimizing Multimodal Jailbreaks for Spoken Language Models
by: Krishnan, Aravind, et al.
Published: (2026)
by: Krishnan, Aravind, et al.
Published: (2026)
Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
by: Cao, Chentao, et al.
Published: (2025)
by: Cao, Chentao, et al.
Published: (2025)
Efficient Safety Retrofitting Against Jailbreaking for LLMs
by: Garcia-Gasulla, Dario, et al.
Published: (2025)
by: Garcia-Gasulla, Dario, et al.
Published: (2025)
Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem
by: Lin, Shuyi, et al.
Published: (2025)
by: Lin, Shuyi, et al.
Published: (2025)
Multimodal Pragmatic Jailbreak on Text-to-image Models
by: Liu, Tong, et al.
Published: (2024)
by: Liu, Tong, et al.
Published: (2024)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
by: Li, Yuxi, et al.
Published: (2024)
by: Li, Yuxi, et al.
Published: (2024)
Safety Filters for Black-Box Dynamical Systems by Learning Discriminating Hyperplanes
by: Lavanakul, Will, et al.
Published: (2024)
by: Lavanakul, Will, et al.
Published: (2024)
SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety
by: Xu, Zixuan, et al.
Published: (2026)
by: Xu, Zixuan, et al.
Published: (2026)
JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization
by: Zheng, Haolun, et al.
Published: (2026)
by: Zheng, Haolun, et al.
Published: (2026)
Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics
by: Frauenknecht, Bernd, et al.
Published: (2026)
by: Frauenknecht, Bernd, et al.
Published: (2026)
Image-Perfect Imperfections: Safety, Bias, and Authenticity in the Shadow of Text-To-Image Model Evolution
by: Wu, Yixin, et al.
Published: (2024)
by: Wu, Yixin, et al.
Published: (2024)
CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment
by: Liu, Jilong, et al.
Published: (2026)
by: Liu, Jilong, et al.
Published: (2026)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
by: Zhang, Peiyan, et al.
Published: (2025)
by: Zhang, Peiyan, et al.
Published: (2025)
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
by: Lu, Haoran, et al.
Published: (2025)
by: Lu, Haoran, et al.
Published: (2025)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
by: Andriushchenko, Maksym, et al.
Published: (2024)
by: Andriushchenko, Maksym, et al.
Published: (2024)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
by: Chen, Taiye, et al.
Published: (2025)
by: Chen, Taiye, et al.
Published: (2025)
Selective Safety Steering via Value-Filtered Decoding
by: Einbinder, Bat-Sheva, et al.
Published: (2026)
by: Einbinder, Bat-Sheva, et al.
Published: (2026)
Noise Injection Systemically Degrades Large Language Model Safety Guardrails
by: Shahani, Prithviraj Singh, et al.
Published: (2025)
by: Shahani, Prithviraj Singh, et al.
Published: (2025)
AlignGuard: Scalable Safety Alignment for Text-to-Image Generation
by: Liu, Runtao, et al.
Published: (2024)
by: Liu, Runtao, et al.
Published: (2024)
Domain Adaptive Safety Filters via Deep Operator Learning
by: Manda, Lakshmideepakreddy, et al.
Published: (2024)
by: Manda, Lakshmideepakreddy, et al.
Published: (2024)
AnySafe: Adapting Latent Safety Filters at Runtime via Safety Constraint Parameterization in the Latent Space
by: Agrawal, Sankalp, et al.
Published: (2025)
by: Agrawal, Sankalp, et al.
Published: (2025)
On Safety in Safe Bayesian Optimization
by: Fiedler, Christian, et al.
Published: (2024)
by: Fiedler, Christian, et al.
Published: (2024)
ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models
by: Jin, Weifei, et al.
Published: (2025)
by: Jin, Weifei, et al.
Published: (2025)
Statistically Assuring Safety of Control Systems using Ensembles of Safety Filters and Conformal Prediction
by: Tabbara, Ihab, et al.
Published: (2025)
by: Tabbara, Ihab, et al.
Published: (2025)
Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
by: Peng, Xingkai, et al.
Published: (2025)
by: Peng, Xingkai, et al.
Published: (2025)
Provably Optimal Reinforcement Learning under Safety Filtering
by: Oh, Donggeon David, et al.
Published: (2025)
by: Oh, Donggeon David, et al.
Published: (2025)
Prompt-Based Safety Guidance Is Ineffective for Unlearned Text-to-Image Diffusion Models
by: Shin, Jiwoo, et al.
Published: (2025)
by: Shin, Jiwoo, et al.
Published: (2025)
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
by: Yi, Huahui, et al.
Published: (2025)
by: Yi, Huahui, et al.
Published: (2025)
Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection
by: Selvanayagam, Niruthiha, et al.
Published: (2025)
by: Selvanayagam, Niruthiha, et al.
Published: (2025)
MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs
by: Lee, Junhyeok, et al.
Published: (2026)
by: Lee, Junhyeok, et al.
Published: (2026)
Gameplay Filters: Robust Zero-Shot Safety through Adversarial Imagination
by: Nguyen, Duy P., et al.
Published: (2024)
by: Nguyen, Duy P., et al.
Published: (2024)
GuardNet: Graph-Attention Filtering for Jailbreak Defense in Large Language Models
by: Forough, Javad, et al.
Published: (2025)
by: Forough, Javad, et al.
Published: (2025)
Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
by: Oldfield, James, et al.
Published: (2025)
by: Oldfield, James, et al.
Published: (2025)
Similar Items
-
IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization
by: Chen, Zixuan, et al.
Published: (2026) -
Enhancing LLM Safety via Constrained Direct Preference Optimization
by: Liu, Zixuan, et al.
Published: (2024) -
Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility
by: Wang, Mengxuan, et al.
Published: (2026) -
When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?
by: Tian, Yuan, et al.
Published: (2026) -
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
by: Chen, Zixuan, et al.
Published: (2026)