Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Zhang, Zhenghao, Liao, Junchao, Meng, Xiangyu, Qin, Long, Wang, Weizhi
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866912472763465728
author Zhang, Zhenghao
Liao, Junchao
Meng, Xiangyu
Qin, Long
Wang, Weizhi
author_facet Zhang, Zhenghao
Liao, Junchao
Meng, Xiangyu
Qin, Long
Wang, Weizhi
contents Recent advances in diffusion transformer models for motion-guided video generation, such as Tora, have shown significant progress. In this paper, we present Tora2, an enhanced version of Tora, which introduces several design improvements to expand its capabilities in both appearance and motion customization. Specifically, we introduce a decoupled personalization extractor that generates comprehensive personalization embeddings for multiple open-set entities, better preserving fine-grained visual details compared to previous methods. Building on this, we design a gated self-attention mechanism to integrate trajectory, textual description, and visual information for each entity. This innovation significantly reduces misalignment in multimodal conditioning during training. Moreover, we introduce a contrastive loss that jointly optimizes trajectory dynamics and entity consistency through explicit mapping between motion and personalization embeddings. Tora2 is, to our best knowledge, the first method to achieve simultaneous multi-entity customization of appearance and motion for video generation. Experimental results demonstrate that Tora2 achieves competitive performance with state-of-the-art customization methods while providing advanced motion control capabilities, which marks a critical advancement in multi-condition video generation. Project page: https://ali-videoai.github.io/Tora2_page/.
format Preprint
id arxiv_https___arxiv_org_abs_2507_05963
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation
Zhang, Zhenghao
Liao, Junchao
Meng, Xiangyu
Qin, Long
Wang, Weizhi
Computer Vision and Pattern Recognition
Recent advances in diffusion transformer models for motion-guided video generation, such as Tora, have shown significant progress. In this paper, we present Tora2, an enhanced version of Tora, which introduces several design improvements to expand its capabilities in both appearance and motion customization. Specifically, we introduce a decoupled personalization extractor that generates comprehensive personalization embeddings for multiple open-set entities, better preserving fine-grained visual details compared to previous methods. Building on this, we design a gated self-attention mechanism to integrate trajectory, textual description, and visual information for each entity. This innovation significantly reduces misalignment in multimodal conditioning during training. Moreover, we introduce a contrastive loss that jointly optimizes trajectory dynamics and entity consistency through explicit mapping between motion and personalization embeddings. Tora2 is, to our best knowledge, the first method to achieve simultaneous multi-entity customization of appearance and motion for video generation. Experimental results demonstrate that Tora2 achieves competitive performance with state-of-the-art customization methods while providing advanced motion control capabilities, which marks a critical advancement in multi-condition video generation. Project page: https://ali-videoai.github.io/Tora2_page/.
title Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2507.05963