InstanceAnimator: Multi-Instance Sketch Video Colorization

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Zhang, Yinhan, Ma, Yue, Wang, Bingyuan, Feng, Kunyu, Jin, Yeying, Chen, Qifeng, Rao, Anyi, Wang, Zeyu
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866914424852316160
author Zhang, Yinhan
Ma, Yue
Wang, Bingyuan
Feng, Kunyu
Jin, Yeying
Chen, Qifeng
Rao, Anyi
Wang, Zeyu
author_facet Zhang, Yinhan
Ma, Yue
Wang, Bingyuan
Feng, Kunyu
Jin, Yeying
Chen, Qifeng
Rao, Anyi
Wang, Zeyu
contents We propose InstanceAnimator, a novel Diffusion Transformer framework for multi-instance sketch video colorization. Existing methods suffer from three core limitations: inflexible user control due to heavy reliance on single reference frames, poor instance controllability leading to misalignment in multi-character scenarios, and degraded detail fidelity in fine-grained regions. To address these challenges, we introduce three corresponding innovations. First, a Canvas Guidance Condition eliminates workflow fragmentation by allowing free placement of reference elements and background, enabling unprecedented user flexibility. Second, an Instance Matching Mechanism resolves misalignment by integrating instance features with the sketches, ensuring precise control over multiple characters. Third, an Adaptive Decoupled Control Module enhances detail fidelity by injecting semantic features from characters, backgrounds, and text conditions into the diffusion process. Extensive experiments demonstrate that InstanceAnimator achieves superior multi-instance colorization with enhanced user control, high visual quality, and strong instance consistency.
format Preprint
id arxiv_https___arxiv_org_abs_2603_25357
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle InstanceAnimator: Multi-Instance Sketch Video Colorization
Zhang, Yinhan
Ma, Yue
Wang, Bingyuan
Feng, Kunyu
Jin, Yeying
Chen, Qifeng
Rao, Anyi
Wang, Zeyu
Computer Vision and Pattern Recognition
We propose InstanceAnimator, a novel Diffusion Transformer framework for multi-instance sketch video colorization. Existing methods suffer from three core limitations: inflexible user control due to heavy reliance on single reference frames, poor instance controllability leading to misalignment in multi-character scenarios, and degraded detail fidelity in fine-grained regions. To address these challenges, we introduce three corresponding innovations. First, a Canvas Guidance Condition eliminates workflow fragmentation by allowing free placement of reference elements and background, enabling unprecedented user flexibility. Second, an Instance Matching Mechanism resolves misalignment by integrating instance features with the sketches, ensuring precise control over multiple characters. Third, an Adaptive Decoupled Control Module enhances detail fidelity by injecting semantic features from characters, backgrounds, and text conditions into the diffusion process. Extensive experiments demonstrate that InstanceAnimator achieves superior multi-instance colorization with enhanced user control, high visual quality, and strong instance consistency.
title InstanceAnimator: Multi-Instance Sketch Video Colorization
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2603.25357