MusicInfuser: Making Video Diffusion Listen and Dance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hong, Susung, Kemelmacher-Shlizerman, Ira, Curless, Brian, Seitz, Steven M. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
COMIC: Agentic Sketch Comedy Generation
par: Hong, Susung, et autres
Publié: (2026)
par: Hong, Susung, et autres
Publié: (2026)
Total Selfie: Generating Full-Body Selfies
par: Chen, Bowei, et autres
Publié: (2023)
par: Chen, Bowei, et autres
Publié: (2023)
Generating Fit Check Videos with a Handheld Camera
par: Chen, Bowei, et autres
Publié: (2025)
par: Chen, Bowei, et autres
Publié: (2025)
GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles
par: Shan, Mengyi, et autres
Publié: (2025)
par: Shan, Mengyi, et autres
Publié: (2025)
HoloGarment: 360° Novel View Synthesis of In-the-Wild Garments
par: Karras, Johanna, et autres
Publié: (2025)
par: Karras, Johanna, et autres
Publié: (2025)
Inverse Painting: Reconstructing The Painting Process
par: Chen, Bowei, et autres
Publié: (2024)
par: Chen, Bowei, et autres
Publié: (2024)
UltraZoom: Generating Gigapixel Images from Regular Photos
par: Ma, Jingwei, et autres
Publié: (2025)
par: Ma, Jingwei, et autres
Publié: (2025)
Generative Inbetweening: Adapting Image-to-Video Models for Keyframe Interpolation
par: Wang, Xiaojuan, et autres
Publié: (2024)
par: Wang, Xiaojuan, et autres
Publié: (2024)
Smoothed Energy Guidance: Guiding Diffusion Models with Reduced Energy Curvature of Attention
par: Hong, Susung
Publié: (2024)
par: Hong, Susung
Publié: (2024)
How Animals Dance (When You're Not Looking)
par: Wang, Xiaojuan, et autres
Publié: (2025)
par: Wang, Xiaojuan, et autres
Publié: (2025)
Perturb-and-Revise: Flexible 3D Editing with Generative Trajectories
par: Hong, Susung, et autres
Publié: (2024)
par: Hong, Susung, et autres
Publié: (2024)
Don't Look at the Camera: Achieving Perceived Eye Contact
par: Gao, Alice, et autres
Publié: (2024)
par: Gao, Alice, et autres
Publié: (2024)
DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders
par: Hong, Susung, et autres
Publié: (2025)
par: Hong, Susung, et autres
Publié: (2025)
Test-Time Anchoring for Discrete Diffusion Posterior Sampling
par: Rout, Litu, et autres
Publié: (2025)
par: Rout, Litu, et autres
Publié: (2025)
Generative Powers of Ten
par: Wang, Xiaojuan, et autres
Publié: (2023)
par: Wang, Xiaojuan, et autres
Publié: (2023)
Where and How to Perturb: On the Design of Perturbation Guidance in Diffusion and Flow Models
par: Ahn, Donghoon, et autres
Publié: (2025)
par: Ahn, Donghoon, et autres
Publié: (2025)
Every Image Listens, Every Image Dances: Music-Driven Image Animation
par: Dong, Zhikang, et autres
Publié: (2025)
par: Dong, Zhikang, et autres
Publié: (2025)
Just Dance with $π$! A Poly-modal Inductor for Weakly-supervised Video Anomaly Detection
par: Majhi, Snehashis, et autres
Publié: (2025)
par: Majhi, Snehashis, et autres
Publié: (2025)
ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation
par: Lin, Jingzhong, et autres
Publié: (2025)
par: Lin, Jingzhong, et autres
Publié: (2025)
Tell What You Hear From What You See -- Video to Audio Generation Through Text
par: Liu, Xiulong, et autres
Publié: (2024)
par: Liu, Xiulong, et autres
Publié: (2024)
Linearly Constrained Diffusion Implicit Models
par: Jayaram, Vivek, et autres
Publié: (2024)
par: Jayaram, Vivek, et autres
Publié: (2024)
Neural Tangent Knowledge Distillation for Optical Convolutional Networks
par: Xiang, Jinlin, et autres
Publié: (2025)
par: Xiang, Jinlin, et autres
Publié: (2025)
Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation
par: Lokegaonkar, Vaibhavi, et autres
Publié: (2026)
par: Lokegaonkar, Vaibhavi, et autres
Publié: (2026)
Looking and Listening Inside and Outside: Multimodal Artificial Intelligence Systems for Driver Safety Assessment and Intelligent Vehicle Decision-Making
par: Greer, Ross, et autres
Publié: (2026)
par: Greer, Ross, et autres
Publié: (2026)
Video-based Music Generation
par: Sulun, Serkan
Publié: (2026)
par: Sulun, Serkan
Publié: (2026)
Walk Before You Dance: High-fidelity and Editable Dance Synthesis via Generative Masked Motion Prior
par: Shah, Foram N, et autres
Publié: (2025)
par: Shah, Foram N, et autres
Publié: (2025)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
par: Liu, Runtao, et autres
Publié: (2024)
par: Liu, Runtao, et autres
Publié: (2024)
Adversarial Supervision Makes Layout-to-Image Diffusion Models Thrive
par: Li, Yumeng, et autres
Publié: (2024)
par: Li, Yumeng, et autres
Publié: (2024)
From Image to Video: An Empirical Study of Diffusion Representations
par: Vélez, Pedro, et autres
Publié: (2025)
par: Vélez, Pedro, et autres
Publié: (2025)
Video Motion Transfer with Diffusion Transformers
par: Pondaven, Alexander, et autres
Publié: (2024)
par: Pondaven, Alexander, et autres
Publié: (2024)
A Survey on Video Diffusion Models
par: Xing, Zhen, et autres
Publié: (2023)
par: Xing, Zhen, et autres
Publié: (2023)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
Warped Diffusion: Solving Video Inverse Problems with Image Diffusion Models
par: Daras, Giannis, et autres
Publié: (2024)
par: Daras, Giannis, et autres
Publié: (2024)
Slight Corruption in Pre-training Data Makes Better Diffusion Models
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Causality in Video Diffusers is Separable from Denoising
par: Bai, Xingjian, et autres
Publié: (2026)
par: Bai, Xingjian, et autres
Publié: (2026)
Diffusion-Based Offline RL for Improved Decision-Making in Augmented ARC Task
par: Kim, Yunho, et autres
Publié: (2024)
par: Kim, Yunho, et autres
Publié: (2024)
VideoPDE: Unified Generative PDE Solving via Video Inpainting Diffusion Models
par: Li, Edward, et autres
Publié: (2025)
par: Li, Edward, et autres
Publié: (2025)
Towards Precise Scaling Laws for Video Diffusion Transformers
par: Yin, Yuanyang, et autres
Publié: (2024)
par: Yin, Yuanyang, et autres
Publié: (2024)
FIT: A Large-Scale Dataset for Fit-Aware Virtual Try-On
par: Karras, Johanna, et autres
Publié: (2026)
par: Karras, Johanna, et autres
Publié: (2026)
Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation
par: Jeong, Hyeonho, et autres
Publié: (2024)
par: Jeong, Hyeonho, et autres
Publié: (2024)
Documents similaires
-
COMIC: Agentic Sketch Comedy Generation
par: Hong, Susung, et autres
Publié: (2026) -
Total Selfie: Generating Full-Body Selfies
par: Chen, Bowei, et autres
Publié: (2023) -
Generating Fit Check Videos with a Handheld Camera
par: Chen, Bowei, et autres
Publié: (2025) -
GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles
par: Shan, Mengyi, et autres
Publié: (2025) -
HoloGarment: 360° Novel View Synthesis of In-the-Wild Garments
par: Karras, Johanna, et autres
Publié: (2025)