Spatiotemporal Skip Guidance for Enhanced Video Diffusion Sampling

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Hyung, Junha, Kim, Kinam, Hong, Susung, Kim, Min-Jung, Choo, Jaegul
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866917850869923840
author Hyung, Junha
Kim, Kinam
Hong, Susung
Kim, Min-Jung
Choo, Jaegul
author_facet Hyung, Junha
Kim, Kinam
Hong, Susung
Kim, Min-Jung
Choo, Jaegul
contents Diffusion models have emerged as a powerful tool for generating high-quality images, videos, and 3D content. While sampling guidance techniques like CFG improve quality, they reduce diversity and motion. Autoguidance mitigates these issues but demands extra weak model training, limiting its practicality for large-scale models. In this work, we introduce Spatiotemporal Skip Guidance (STG), a simple training-free sampling guidance method for enhancing transformer-based video diffusion models. STG employs an implicit weak model via self-perturbation, avoiding the need for external models or additional training. By selectively skipping spatiotemporal layers, STG produces an aligned, degraded version of the original model to boost sample quality without compromising diversity or dynamic degree. Our contributions include: (1) introducing STG as an efficient, high-performing guidance technique for video diffusion models, (2) eliminating the need for auxiliary models by simulating a weak model through layer skipping, and (3) ensuring quality-enhanced guidance without compromising sample diversity or dynamics unlike CFG. For additional results, visit https://junhahyung.github.io/STGuidance.
format Preprint
id arxiv_https___arxiv_org_abs_2411_18664
institution arXiv
publishDate 2024
record_format arxiv
spellingShingle Spatiotemporal Skip Guidance for Enhanced Video Diffusion Sampling
Hyung, Junha
Kim, Kinam
Hong, Susung
Kim, Min-Jung
Choo, Jaegul
Computer Vision and Pattern Recognition
Diffusion models have emerged as a powerful tool for generating high-quality images, videos, and 3D content. While sampling guidance techniques like CFG improve quality, they reduce diversity and motion. Autoguidance mitigates these issues but demands extra weak model training, limiting its practicality for large-scale models. In this work, we introduce Spatiotemporal Skip Guidance (STG), a simple training-free sampling guidance method for enhancing transformer-based video diffusion models. STG employs an implicit weak model via self-perturbation, avoiding the need for external models or additional training. By selectively skipping spatiotemporal layers, STG produces an aligned, degraded version of the original model to boost sample quality without compromising diversity or dynamic degree. Our contributions include: (1) introducing STG as an efficient, high-performing guidance technique for video diffusion models, (2) eliminating the need for auxiliary models by simulating a weak model through layer skipping, and (3) ensuring quality-enhanced guidance without compromising sample diversity or dynamics unlike CFG. For additional results, visit https://junhahyung.github.io/STGuidance.
title Spatiotemporal Skip Guidance for Enhanced Video Diffusion Sampling
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2411.18664