Transition Models: Rethinking the Generative Learning Objective

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Wang, Zidong, Zhang, Yiyuan, Yue, Xiaoyu, Yue, Xiangyu, Li, Yangguang, Ouyang, Wanli, Bai, Lei
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866915479342284800
author Wang, Zidong
Zhang, Yiyuan
Yue, Xiaoyu
Yue, Xiangyu
Li, Yangguang
Ouyang, Wanli
Bai, Lei
author_facet Wang, Zidong
Zhang, Yiyuan
Yue, Xiaoyu
Yue, Xiangyu
Li, Yangguang
Ouyang, Wanli
Bai, Lei
contents A fundamental dilemma in generative modeling persists: iterative diffusion models achieve outstanding fidelity, but at a significant computational cost, while efficient few-step alternatives are constrained by a hard quality ceiling. This conflict between generation steps and output quality arises from restrictive training objectives that focus exclusively on either infinitesimal dynamics (PF-ODEs) or direct endpoint prediction. We address this challenge by introducing an exact, continuous-time dynamics equation that analytically defines state transitions across any finite time interval. This leads to a novel generative paradigm, Transition Models (TiM), which adapt to arbitrary-step transitions, seamlessly traversing the generative trajectory from single leaps to fine-grained refinement with more steps. Despite having only 865M parameters, TiM achieves state-of-the-art performance, surpassing leading models such as SD3.5 (8B parameters) and FLUX.1 (12B parameters) across all evaluated step counts. Importantly, unlike previous few-step generators, TiM demonstrates monotonic quality improvement as the sampling budget increases. Additionally, when employing our native-resolution strategy, TiM delivers exceptional fidelity at resolutions up to 4096x4096.
format Preprint
id arxiv_https___arxiv_org_abs_2509_04394
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Transition Models: Rethinking the Generative Learning Objective
Wang, Zidong
Zhang, Yiyuan
Yue, Xiaoyu
Yue, Xiangyu
Li, Yangguang
Ouyang, Wanli
Bai, Lei
Machine Learning
Computer Vision and Pattern Recognition
A fundamental dilemma in generative modeling persists: iterative diffusion models achieve outstanding fidelity, but at a significant computational cost, while efficient few-step alternatives are constrained by a hard quality ceiling. This conflict between generation steps and output quality arises from restrictive training objectives that focus exclusively on either infinitesimal dynamics (PF-ODEs) or direct endpoint prediction. We address this challenge by introducing an exact, continuous-time dynamics equation that analytically defines state transitions across any finite time interval. This leads to a novel generative paradigm, Transition Models (TiM), which adapt to arbitrary-step transitions, seamlessly traversing the generative trajectory from single leaps to fine-grained refinement with more steps. Despite having only 865M parameters, TiM achieves state-of-the-art performance, surpassing leading models such as SD3.5 (8B parameters) and FLUX.1 (12B parameters) across all evaluated step counts. Importantly, unlike previous few-step generators, TiM demonstrates monotonic quality improvement as the sampling budget increases. Additionally, when employing our native-resolution strategy, TiM delivers exceptional fidelity at resolutions up to 4096x4096.
title Transition Models: Rethinking the Generative Learning Objective
topic Machine Learning
Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2509.04394