MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Zheng, Haoyu, Zhang, Wenqiao, Lv, Zheqi, Zhong, Yu, Dai, Yang, An, Jianxiang, Shen, Yongliang, Li, Juncheng, Zhang, Dongping, Tang, Siliang, Zhuang, Yueting
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866929651128991744
author Zheng, Haoyu
Zhang, Wenqiao
Lv, Zheqi
Zhong, Yu
Dai, Yang
An, Jianxiang
Shen, Yongliang
Li, Juncheng
Zhang, Dongping
Tang, Siliang
Zhuang, Yueting
author_facet Zheng, Haoyu
Zhang, Wenqiao
Lv, Zheqi
Zhong, Yu
Dai, Yang
An, Jianxiang
Shen, Yongliang
Li, Juncheng
Zhang, Dongping
Tang, Siliang
Zhuang, Yueting
contents Diffusion-based text-to-image (T2I) models have demonstrated remarkable results in global video editing tasks. However, their focus is primarily on global video modifications, and achieving desired attribute-specific changes remains a challenging task, specifically in multi-attribute editing (MAE) in video. Contemporary video editing approaches either require extensive fine-tuning or rely on additional networks (such as ControlNet) for modeling multi-object appearances, yet they remain in their infancy, offering only coarse-grained MAE solutions. In this paper, we present MAKIMA, a tuning-free MAE framework built upon pretrained T2I models for open-domain video editing. Our approach preserves video structure and appearance information by incorporating attention maps and features from the inversion process during denoising. To facilitate precise editing of multiple attributes, we introduce mask-guided attention modulation, enhancing correlations between spatially corresponding tokens and suppressing cross-attribute interference in both self-attention and cross-attention layers. To balance video frame generation quality and efficiency, we implement consistent feature propagation, which generates frame sequences by editing keyframes and propagating their features throughout the sequence. Extensive experiments demonstrate that MAKIMA outperforms existing baselines in open-domain multi-attribute video editing tasks, achieving superior results in both editing accuracy and temporal consistency while maintaining computational efficiency.
format Preprint
id arxiv_https___arxiv_org_abs_2412_19978
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation
Zheng, Haoyu
Zhang, Wenqiao
Lv, Zheqi
Zhong, Yu
Dai, Yang
An, Jianxiang
Shen, Yongliang
Li, Juncheng
Zhang, Dongping
Tang, Siliang
Zhuang, Yueting
Computer Vision and Pattern Recognition
Diffusion-based text-to-image (T2I) models have demonstrated remarkable results in global video editing tasks. However, their focus is primarily on global video modifications, and achieving desired attribute-specific changes remains a challenging task, specifically in multi-attribute editing (MAE) in video. Contemporary video editing approaches either require extensive fine-tuning or rely on additional networks (such as ControlNet) for modeling multi-object appearances, yet they remain in their infancy, offering only coarse-grained MAE solutions. In this paper, we present MAKIMA, a tuning-free MAE framework built upon pretrained T2I models for open-domain video editing. Our approach preserves video structure and appearance information by incorporating attention maps and features from the inversion process during denoising. To facilitate precise editing of multiple attributes, we introduce mask-guided attention modulation, enhancing correlations between spatially corresponding tokens and suppressing cross-attribute interference in both self-attention and cross-attention layers. To balance video frame generation quality and efficiency, we implement consistent feature propagation, which generates frame sequences by editing keyframes and propagating their features throughout the sequence. Extensive experiments demonstrate that MAKIMA outperforms existing baselines in open-domain multi-attribute video editing tasks, achieving superior results in both editing accuracy and temporal consistency while maintaining computational efficiency.
title MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2412.19978