ImageReFL: Balancing Quality and Diversity in Human-Aligned Diffusion Models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Sorokin, Dmitrii, Nakhodnov, Maksim, Kuznetsov, Andrey, Alanov, Aibek
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866918037329805312
author Sorokin, Dmitrii
Nakhodnov, Maksim
Kuznetsov, Andrey
Alanov, Aibek
author_facet Sorokin, Dmitrii
Nakhodnov, Maksim
Kuznetsov, Andrey
Alanov, Aibek
contents Recent advances in diffusion models have led to impressive image generation capabilities, but aligning these models with human preferences remains challenging. Reward-based fine-tuning using models trained on human feedback improves alignment but often harms diversity, producing less varied outputs. In this work, we address this trade-off with two contributions. First, we introduce \textit{combined generation}, a novel sampling strategy that applies a reward-tuned diffusion model only in the later stages of the generation process, while preserving the base model for earlier steps. This approach mitigates early-stage overfitting and helps retain global structure and diversity. Second, we propose \textit{ImageReFL}, a fine-tuning method that improves image diversity with minimal loss in quality by training on real images and incorporating multiple regularizers, including diffusion and ReFL losses. Our approach outperforms conventional reward tuning methods on standard quality and diversity metrics. A user study further confirms that our method better balances human preference alignment and visual diversity. The source code can be found at https://github.com/ControlGenAI/ImageReFL .
format Preprint
id arxiv_https___arxiv_org_abs_2505_22569
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle ImageReFL: Balancing Quality and Diversity in Human-Aligned Diffusion Models
Sorokin, Dmitrii
Nakhodnov, Maksim
Kuznetsov, Andrey
Alanov, Aibek
Computer Vision and Pattern Recognition
Recent advances in diffusion models have led to impressive image generation capabilities, but aligning these models with human preferences remains challenging. Reward-based fine-tuning using models trained on human feedback improves alignment but often harms diversity, producing less varied outputs. In this work, we address this trade-off with two contributions. First, we introduce \textit{combined generation}, a novel sampling strategy that applies a reward-tuned diffusion model only in the later stages of the generation process, while preserving the base model for earlier steps. This approach mitigates early-stage overfitting and helps retain global structure and diversity. Second, we propose \textit{ImageReFL}, a fine-tuning method that improves image diversity with minimal loss in quality by training on real images and incorporating multiple regularizers, including diffusion and ReFL losses. Our approach outperforms conventional reward tuning methods on standard quality and diversity metrics. A user study further confirms that our method better balances human preference alignment and visual diversity. The source code can be found at https://github.com/ControlGenAI/ImageReFL .
title ImageReFL: Balancing Quality and Diversity in Human-Aligned Diffusion Models
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2505.22569