Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Zijing, Zhang, Fengda, Chen, Long, Kuang, Kun, Li, Jiahui, Gao, Kaifeng, Xiao, Jun, Wang, Xin, Zhu, Wenwu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
D-Fusion: Direct Preference Optimization for Aligning Diffusion Models with Visually Consistent Samples
by: Hu, Zijing, et al.
Published: (2025)
by: Hu, Zijing, et al.
Published: (2025)
Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
by: Hu, Zijing, et al.
Published: (2025)
by: Hu, Zijing, et al.
Published: (2025)
Distributionally Generative Augmentation for Fair Facial Attribute Classification
by: Zhang, Fengda, et al.
Published: (2024)
by: Zhang, Fengda, et al.
Published: (2024)
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
by: Lin, Bingqian, et al.
Published: (2024)
by: Lin, Bingqian, et al.
Published: (2024)
Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
by: Cheng, Tianle, et al.
Published: (2025)
by: Cheng, Tianle, et al.
Published: (2025)
Training-free Diffusion Model Alignment with Sampling Demons
by: Yeh, Po-Hung, et al.
Published: (2024)
by: Yeh, Po-Hung, et al.
Published: (2024)
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
by: Gao, Kaifeng, et al.
Published: (2024)
by: Gao, Kaifeng, et al.
Published: (2024)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey
by: Lamba, Preeti, et al.
Published: (2025)
by: Lamba, Preeti, et al.
Published: (2025)
ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models
by: Gao, Kaifeng, et al.
Published: (2024)
by: Gao, Kaifeng, et al.
Published: (2024)
Diffusion Reinforcement Learning via Centered Reward Distillation
by: Zhu, Yuanzhi, et al.
Published: (2026)
by: Zhu, Yuanzhi, et al.
Published: (2026)
Generalized Visual Relation Detection with Diffusion Models
by: Gao, Kaifeng, et al.
Published: (2025)
by: Gao, Kaifeng, et al.
Published: (2025)
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
by: Feng, Sicheng, et al.
Published: (2025)
by: Feng, Sicheng, et al.
Published: (2025)
DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
by: Deng, Haoyou, et al.
Published: (2026)
by: Deng, Haoyou, et al.
Published: (2026)
Towards Better Optimization For Listwise Preference in Diffusion Models
by: Bai, Jiamu, et al.
Published: (2025)
by: Bai, Jiamu, et al.
Published: (2025)
Towards Robust Content Watermarking Against Removal and Forgery Attacks
by: Zhu, Yifan, et al.
Published: (2026)
by: Zhu, Yifan, et al.
Published: (2026)
Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers
by: Chen, Lei, et al.
Published: (2024)
by: Chen, Lei, et al.
Published: (2024)
Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward
by: Xu, Xiaogang, et al.
Published: (2025)
by: Xu, Xiaogang, et al.
Published: (2025)
GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection
by: Yan, Haozhen, et al.
Published: (2025)
by: Yan, Haozhen, et al.
Published: (2025)
Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
by: Chen, Chubin, et al.
Published: (2025)
by: Chen, Chubin, et al.
Published: (2025)
Sparse-to-Sparse Training of Diffusion Models
by: Oliveira, Inês Cardoso, et al.
Published: (2025)
by: Oliveira, Inês Cardoso, et al.
Published: (2025)
Bidirectional Sparse Attention for Faster Video Diffusion Training
by: Zhan, Chenlu, et al.
Published: (2025)
by: Zhan, Chenlu, et al.
Published: (2025)
CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL
by: Ni, Zhenyang, et al.
Published: (2026)
by: Ni, Zhenyang, et al.
Published: (2026)
Elucidating and Endowing the Diffusion Training Paradigm for General Image Restoration
by: Lu, Xin, et al.
Published: (2025)
by: Lu, Xin, et al.
Published: (2025)
FreeTuner: Any Subject in Any Style with Training-free Diffusion
by: Xu, Youcan, et al.
Published: (2024)
by: Xu, Youcan, et al.
Published: (2024)
CTA: Cross-Task Alignment for Better Test Time Training
by: Barbeau, Samuel, et al.
Published: (2025)
by: Barbeau, Samuel, et al.
Published: (2025)
Video Diffusion Alignment via Reward Gradients
by: Prabhudesai, Mihir, et al.
Published: (2024)
by: Prabhudesai, Mihir, et al.
Published: (2024)
Reinforcement Learning for Unsupervised Video Summarization with Reward Generator Training
by: Abbasi, Mehryar, et al.
Published: (2024)
by: Abbasi, Mehryar, et al.
Published: (2024)
DyMO: Training-Free Diffusion Model Alignment with Dynamic Multi-Objective Scheduling
by: Xie, Xin, et al.
Published: (2024)
by: Xie, Xin, et al.
Published: (2024)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
by: Wang, Xin, et al.
Published: (2024)
by: Wang, Xin, et al.
Published: (2024)
AV-Unified: A Unified Framework for Audio-visual Scene Understanding
by: Li, Guangyao, et al.
Published: (2026)
by: Li, Guangyao, et al.
Published: (2026)
RFSR: Improving ISR Diffusion Models via Reward Feedback Learning
by: Sun, Xiaopeng, et al.
Published: (2024)
by: Sun, Xiaopeng, et al.
Published: (2024)
Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models
by: Tong, Yunze, et al.
Published: (2025)
by: Tong, Yunze, et al.
Published: (2025)
HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration
by: Huang, Yushi, et al.
Published: (2024)
by: Huang, Yushi, et al.
Published: (2024)
DECap: Towards Generalized Explicit Caption Editing via Diffusion Mechanism
by: Wang, Zhen, et al.
Published: (2023)
by: Wang, Zhen, et al.
Published: (2023)
Training Diffusion Models with Reinforcement Learning
by: Black, Kevin, et al.
Published: (2023)
by: Black, Kevin, et al.
Published: (2023)
The Age-specific Alzheimer 's Disease Prediction with Characteristic Constraints in Nonuniform Time Span
by: Hong, Xin, et al.
Published: (2025)
by: Hong, Xin, et al.
Published: (2025)
FLORA: Formal Language Model Enables Robust Training-free Zero-shot Object Referring Analysis
by: Chen, Zhe, et al.
Published: (2025)
by: Chen, Zhe, et al.
Published: (2025)
RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
by: Li, Jiahui, et al.
Published: (2024)
by: Li, Jiahui, et al.
Published: (2024)
$\text{H}^2$em: Learning Hierarchical Hyperbolic Embeddings for Compositional Zero-Shot Learning
by: Li, Lin, et al.
Published: (2025)
by: Li, Lin, et al.
Published: (2025)
Similar Items
-
D-Fusion: Direct Preference Optimization for Aligning Diffusion Models with Visually Consistent Samples
by: Hu, Zijing, et al.
Published: (2025) -
Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation
by: Hu, Zijing, et al.
Published: (2025) -
Distributionally Generative Augmentation for Fair Facial Attribute Classification
by: Zhang, Fengda, et al.
Published: (2024) -
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
by: Lin, Bingqian, et al.
Published: (2024) -
Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models
by: Cheng, Tianle, et al.
Published: (2025)