MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Zhang, Yuechen, Liu, Yaoyang, Xia, Bin, Peng, Bohao, Yan, Zexin, Lo, Eric, Jia, Jiaya
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866909916449472512
author Zhang, Yuechen
Liu, Yaoyang
Xia, Bin
Peng, Bohao
Yan, Zexin
Lo, Eric
Jia, Jiaya
author_facet Zhang, Yuechen
Liu, Yaoyang
Xia, Bin
Peng, Bohao
Yan, Zexin
Lo, Eric
Jia, Jiaya
contents We present MagicMirror, a framework for generating identity-preserved videos with cinematic-level quality and dynamic motion. While recent advances in video diffusion models have shown impressive capabilities in text-to-video generation, maintaining consistent identity while producing natural motion remains challenging. Previous methods either require person-specific fine-tuning or struggle to balance identity preservation with motion diversity. Built upon Video Diffusion Transformers, our method introduces three key components: (1) a dual-branch facial feature extractor that captures both identity and structural features, (2) a lightweight cross-modal adapter with Conditioned Adaptive Normalization for efficient identity integration, and (3) a two-stage training strategy combining synthetic identity pairs with video data. Extensive experiments demonstrate that MagicMirror effectively balances identity consistency with natural motion, outperforming existing methods across multiple metrics while requiring minimal parameters added. The code and model will be made publicly available.
format Preprint
id arxiv_https___arxiv_org_abs_2501_03931
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
Zhang, Yuechen
Liu, Yaoyang
Xia, Bin
Peng, Bohao
Yan, Zexin
Lo, Eric
Jia, Jiaya
Computer Vision and Pattern Recognition
We present MagicMirror, a framework for generating identity-preserved videos with cinematic-level quality and dynamic motion. While recent advances in video diffusion models have shown impressive capabilities in text-to-video generation, maintaining consistent identity while producing natural motion remains challenging. Previous methods either require person-specific fine-tuning or struggle to balance identity preservation with motion diversity. Built upon Video Diffusion Transformers, our method introduces three key components: (1) a dual-branch facial feature extractor that captures both identity and structural features, (2) a lightweight cross-modal adapter with Conditioned Adaptive Normalization for efficient identity integration, and (3) a two-stage training strategy combining synthetic identity pairs with video data. Extensive experiments demonstrate that MagicMirror effectively balances identity consistency with natural motion, outperforming existing methods across multiple metrics while requiring minimal parameters added. The code and model will be made publicly available.
title MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2501.03931