VCT: Training Consistency Models with Variational Noise Coupling

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Silvestri, Gianluigi, Ambrogioni, Luca, Lai, Chieh-Hsin, Takida, Yuhta, Mitsufuji, Yuki
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866913873970331648
author Silvestri, Gianluigi
Ambrogioni, Luca
Lai, Chieh-Hsin
Takida, Yuhta
Mitsufuji, Yuki
author_facet Silvestri, Gianluigi
Ambrogioni, Luca
Lai, Chieh-Hsin
Takida, Yuhta
Mitsufuji, Yuki
contents Consistency Training (CT) has recently emerged as a strong alternative to diffusion models for image generation. However, non-distillation CT often suffers from high variance and instability, motivating ongoing research into its training dynamics. We propose Variational Consistency Training (VCT), a flexible and effective framework compatible with various forward kernels, including those in flow matching. Its key innovation is a learned noise-data coupling scheme inspired by Variational Autoencoders, where a data-dependent encoder models noise emission. This enables VCT to adaptively learn noise-todata pairings, reducing training variance relative to the fixed, unsorted pairings in classical CT. Experiments on multiple image datasets demonstrate significant improvements: our method surpasses baselines, achieves state-of-the-art FID among non-distillation CT approaches on CIFAR-10, and matches SoTA performance on ImageNet 64 x 64 with only two sampling steps. Code is available at https://github.com/sony/vct.
format Preprint
id arxiv_https___arxiv_org_abs_2502_18197
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle VCT: Training Consistency Models with Variational Noise Coupling
Silvestri, Gianluigi
Ambrogioni, Luca
Lai, Chieh-Hsin
Takida, Yuhta
Mitsufuji, Yuki
Machine Learning
Computer Vision and Pattern Recognition
Consistency Training (CT) has recently emerged as a strong alternative to diffusion models for image generation. However, non-distillation CT often suffers from high variance and instability, motivating ongoing research into its training dynamics. We propose Variational Consistency Training (VCT), a flexible and effective framework compatible with various forward kernels, including those in flow matching. Its key innovation is a learned noise-data coupling scheme inspired by Variational Autoencoders, where a data-dependent encoder models noise emission. This enables VCT to adaptively learn noise-todata pairings, reducing training variance relative to the fixed, unsorted pairings in classical CT. Experiments on multiple image datasets demonstrate significant improvements: our method surpasses baselines, achieves state-of-the-art FID among non-distillation CT approaches on CIFAR-10, and matches SoTA performance on ImageNet 64 x 64 with only two sampling steps. Code is available at https://github.com/sony/vct.
title VCT: Training Consistency Models with Variational Noise Coupling
topic Machine Learning
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2502.18197