InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Jiang, Liming, Yan, Qing, Jia, Yumin, Liu, Zichuan, Kang, Hao, Lu, Xin
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866918106135265280
author Jiang, Liming
Yan, Qing
Jia, Yumin
Liu, Zichuan
Kang, Hao
Lu, Xin
author_facet Jiang, Liming
Yan, Qing
Jia, Yumin
Liu, Zichuan
Kang, Hao
Lu, Xin
contents Achieving flexible and high-fidelity identity-preserved image generation remains formidable, particularly with advanced Diffusion Transformers (DiTs) like FLUX. We introduce InfiniteYou (InfU), one of the earliest robust frameworks leveraging DiTs for this task. InfU addresses significant issues of existing methods, such as insufficient identity similarity, poor text-image alignment, and low generation quality and aesthetics. Central to InfU is InfuseNet, a component that injects identity features into the DiT base model via residual connections, enhancing identity similarity while maintaining generation capabilities. A multi-stage training strategy, including pretraining and supervised fine-tuning (SFT) with synthetic single-person-multiple-sample (SPMS) data, further improves text-image alignment, ameliorates image quality, and alleviates face copy-pasting. Extensive experiments demonstrate that InfU achieves state-of-the-art performance, surpassing existing baselines. In addition, the plug-and-play design of InfU ensures compatibility with various existing methods, offering a valuable contribution to the broader community.
format Preprint
id arxiv_https___arxiv_org_abs_2503_16418
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity
Jiang, Liming
Yan, Qing
Jia, Yumin
Liu, Zichuan
Kang, Hao
Lu, Xin
Computer Vision and Pattern Recognition
Machine Learning
Achieving flexible and high-fidelity identity-preserved image generation remains formidable, particularly with advanced Diffusion Transformers (DiTs) like FLUX. We introduce InfiniteYou (InfU), one of the earliest robust frameworks leveraging DiTs for this task. InfU addresses significant issues of existing methods, such as insufficient identity similarity, poor text-image alignment, and low generation quality and aesthetics. Central to InfU is InfuseNet, a component that injects identity features into the DiT base model via residual connections, enhancing identity similarity while maintaining generation capabilities. A multi-stage training strategy, including pretraining and supervised fine-tuning (SFT) with synthetic single-person-multiple-sample (SPMS) data, further improves text-image alignment, ameliorates image quality, and alleviates face copy-pasting. Extensive experiments demonstrate that InfU achieves state-of-the-art performance, surpassing existing baselines. In addition, the plug-and-play design of InfU ensures compatibility with various existing methods, offering a valuable contribution to the broader community.
title InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity
topic Computer Vision and Pattern Recognition
Machine Learning
url https://arxiv.org/abs/2503.16418