SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training
Fuente:
arXiv
Saved in:
| Main Authors: | Kumar, Komal, Deria, Ankan, Basu, Abhishek, Shamshad, Fahad, Cholakkal, Hisham, Nandakumar, Karthik |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
by: Deria, Ankan, et al.
Published: (2026)
by: Deria, Ankan, et al.
Published: (2026)
Calibration-Aware Prompt Learning for Medical Vision-Language Models
by: Basu, Abhishek, et al.
Published: (2025)
by: Basu, Abhishek, et al.
Published: (2025)
RAVEN: Erasing Invisible Watermarks via Novel View Synthesis
by: Shamshad, Fahad, et al.
Published: (2026)
by: Shamshad, Fahad, et al.
Published: (2026)
Makeup-Guided Facial Privacy Protection via Untrained Neural Network Priors
by: Shamshad, Fahad, et al.
Published: (2024)
by: Shamshad, Fahad, et al.
Published: (2024)
STEREO: A Two-Stage Framework for Adversarially Robust Concept Erasing from Text-to-Image Diffusion Models
by: Srivatsan, Koushik, et al.
Published: (2024)
by: Srivatsan, Koushik, et al.
Published: (2024)
FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing
by: Alam, Mohammed Talha, et al.
Published: (2025)
by: Alam, Mohammed Talha, et al.
Published: (2025)
PromptSmooth: Certifying Robustness of Medical Vision-Language Models via Prompt Learning
by: Hussein, Noor, et al.
Published: (2024)
by: Hussein, Noor, et al.
Published: (2024)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
by: Malik, Hashmat Shadab, et al.
Published: (2025)
by: Malik, Hashmat Shadab, et al.
Published: (2025)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
by: Kumar, Komal, et al.
Published: (2025)
by: Kumar, Komal, et al.
Published: (2025)
MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
by: Deria, Ankan, et al.
Published: (2026)
by: Deria, Ankan, et al.
Published: (2026)
Towards Evaluating the Robustness of Visual State Space Models
by: Malik, Hashmat Shadab, et al.
Published: (2024)
by: Malik, Hashmat Shadab, et al.
Published: (2024)
First-Place Solution to NeurIPS 2024 Invisible Watermark Removal Challenge
by: Shamshad, Fahad, et al.
Published: (2025)
by: Shamshad, Fahad, et al.
Published: (2025)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
by: Kumar, Komal, et al.
Published: (2025)
by: Kumar, Komal, et al.
Published: (2025)
MuGa-VTON: Multi-Garment Virtual Try-On via Diffusion Transformers with Prompt Customization
by: Deria, Ankan, et al.
Published: (2025)
by: Deria, Ankan, et al.
Published: (2025)
SPQR: A Standardized Benchmark for Modern Safety Alignment Methods in Text-to-Image Diffusion Models
by: Alam, Mohammed Talha, et al.
Published: (2025)
by: Alam, Mohammed Talha, et al.
Published: (2025)
Towards Calibrating Prompt Tuning of Vision-Language Models
by: Sharifdeen, Ashshak, et al.
Published: (2026)
by: Sharifdeen, Ashshak, et al.
Published: (2026)
Robust Atypical Mitosis Classification with DenseNet121: Stain-Aware Augmentation and Hybrid Loss for Domain Generalization
by: Dukre, Adinath, et al.
Published: (2025)
by: Dukre, Adinath, et al.
Published: (2025)
SteerDiff: Steering towards Safe Text-to-Image Diffusion Models
by: Zhang, Hongxiang, et al.
Published: (2024)
by: Zhang, Hongxiang, et al.
Published: (2024)
Semi-supervised Open-World Object Detection
by: Mullappilly, Sahal Shaji, et al.
Published: (2024)
by: Mullappilly, Sahal Shaji, et al.
Published: (2024)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
by: Hanif, Asif, et al.
Published: (2024)
by: Hanif, Asif, et al.
Published: (2024)
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
by: Thawakar, Omkar, et al.
Published: (2025)
by: Thawakar, Omkar, et al.
Published: (2025)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
by: Noman, Mubashir, et al.
Published: (2024)
by: Noman, Mubashir, et al.
Published: (2024)
DiffuseMix: Label-Preserving Data Augmentation with Diffusion Models
by: Islam, Khawar, et al.
Published: (2024)
by: Islam, Khawar, et al.
Published: (2024)
MediX-R1: Open Ended Medical Reinforcement Learning
by: Mullappilly, Sahal Shaji, et al.
Published: (2026)
by: Mullappilly, Sahal Shaji, et al.
Published: (2026)
ChangeBind: A Hybrid Change Encoder for Remote Sensing Change Detection
by: Noman, Mubashir, et al.
Published: (2024)
by: Noman, Mubashir, et al.
Published: (2024)
Intra-finger Variability of Diffusion-based Latent Fingerprint Generation
by: Hussein, Noor, et al.
Published: (2026)
by: Hussein, Noor, et al.
Published: (2026)
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
by: Ma, Zhiyuan, et al.
Published: (2024)
by: Ma, Zhiyuan, et al.
Published: (2024)
PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model
by: Kareem, Amrin, et al.
Published: (2024)
by: Kareem, Amrin, et al.
Published: (2024)
Beyond Memorization: Selective Learning for Copyright-Safe Diffusion Model Training
by: Kothandaraman, Divya, et al.
Published: (2025)
by: Kothandaraman, Divya, et al.
Published: (2025)
VFace: A Training-Free Approach for Diffusion-Based Video Face Swapping
by: Baliah, Sanoojan, et al.
Published: (2026)
by: Baliah, Sanoojan, et al.
Published: (2026)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
by: Demidov, Dmitry, et al.
Published: (2023)
by: Demidov, Dmitry, et al.
Published: (2023)
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
by: Noman, Mubashir, et al.
Published: (2024)
by: Noman, Mubashir, et al.
Published: (2024)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
by: Ishaq, Ayesha, et al.
Published: (2025)
by: Ishaq, Ayesha, et al.
Published: (2025)
ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control
by: Golan, Shelly, et al.
Published: (2026)
by: Golan, Shelly, et al.
Published: (2026)
DeContext as Defense: Safe Image Editing in Diffusion Transformers
by: Shen, Linghui, et al.
Published: (2025)
by: Shen, Linghui, et al.
Published: (2025)
Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning
by: Deria, Ankan, et al.
Published: (2025)
by: Deria, Ankan, et al.
Published: (2025)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
by: Noman, Mubashir, et al.
Published: (2024)
by: Noman, Mubashir, et al.
Published: (2024)
GenMix: Effective Data Augmentation with Generative Diffusion Model Image Editing
by: Islam, Khawar, et al.
Published: (2024)
by: Islam, Khawar, et al.
Published: (2024)
Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models
by: Tan, Yaoteng, et al.
Published: (2026)
by: Tan, Yaoteng, et al.
Published: (2026)
Open-Set Semi-Supervised Learning for Long-Tailed Medical Datasets
by: Kareem, Daniya Najiha A., et al.
Published: (2025)
by: Kareem, Daniya Najiha A., et al.
Published: (2025)
Similar Items
-
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
by: Deria, Ankan, et al.
Published: (2026) -
Calibration-Aware Prompt Learning for Medical Vision-Language Models
by: Basu, Abhishek, et al.
Published: (2025) -
RAVEN: Erasing Invisible Watermarks via Novel View Synthesis
by: Shamshad, Fahad, et al.
Published: (2026) -
Makeup-Guided Facial Privacy Protection via Untrained Neural Network Priors
by: Shamshad, Fahad, et al.
Published: (2024) -
STEREO: A Two-Stage Framework for Adversarially Robust Concept Erasing from Text-to-Image Diffusion Models
by: Srivatsan, Koushik, et al.
Published: (2024)