Controllable Dance Generation with Style-Guided Motion Diffusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Hongsong, Zhu, Ying, Geng, Xin, Wang, Liang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DanceChat: Large Language Model-Guided Music-to-Dance Generation
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
di: Chen, Zihao, et al.
Pubblicazione: (2024)
di: Chen, Zihao, et al.
Pubblicazione: (2024)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2024)
di: Wang, Xuanchen, et al.
Pubblicazione: (2024)
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
di: Li, Ronghui, et al.
Pubblicazione: (2024)
di: Li, Ronghui, et al.
Pubblicazione: (2024)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
di: Xing, Yazhou, et al.
Pubblicazione: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
PianoMotion10M: Dataset and Benchmark for Hand Motion Generation in Piano Performance
di: Gan, Qijun, et al.
Pubblicazione: (2024)
di: Gan, Qijun, et al.
Pubblicazione: (2024)
PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation
di: Im, Jaekwon, et al.
Pubblicazione: (2026)
di: Im, Jaekwon, et al.
Pubblicazione: (2026)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
di: Hisariya, Tanisha, et al.
Pubblicazione: (2024)
di: Hisariya, Tanisha, et al.
Pubblicazione: (2024)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)
di: Low, Chetwin, et al.
Pubblicazione: (2025)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
di: Wang, Yongqi, et al.
Pubblicazione: (2024)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
di: Wang, Baisen, et al.
Pubblicazione: (2024)
di: Wang, Baisen, et al.
Pubblicazione: (2024)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
di: Li, Bingliang, et al.
Pubblicazione: (2024)
di: Li, Bingliang, et al.
Pubblicazione: (2024)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
di: Chen, Gehui, et al.
Pubblicazione: (2025)
di: Chen, Gehui, et al.
Pubblicazione: (2025)
Video-to-Audio Generation with Hidden Alignment
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
di: Guo, Wei, et al.
Pubblicazione: (2024)
di: Guo, Wei, et al.
Pubblicazione: (2024)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025)
di: Xu, Le, et al.
Pubblicazione: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Diffusion Models as Masked Audio-Video Learners
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
di: Izzati, Fathinah, et al.
Pubblicazione: (2025)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
DiffSSD: A Diffusion-Based Dataset For Speech Forensics
di: Bhagtani, Kratika, et al.
Pubblicazione: (2024)
di: Bhagtani, Kratika, et al.
Pubblicazione: (2024)
Classifying Shelf Life Quality of Pineapples by Combining Audio and Visual Features
di: Jiang, Yi-Lu, et al.
Pubblicazione: (2025)
di: Jiang, Yi-Lu, et al.
Pubblicazione: (2025)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
di: Yang, Qi, et al.
Pubblicazione: (2024)
di: Yang, Qi, et al.
Pubblicazione: (2024)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
Align Your Rhythm: Generating Highly Aligned Dance Poses with Gating-Enhanced Rhythm-Aware Feature Representation
di: Fan, Congyi, et al.
Pubblicazione: (2025)
di: Fan, Congyi, et al.
Pubblicazione: (2025)
3D Audio-Visual Segmentation
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
Read, Watch and Scream! Sound Generation from Text and Video
di: Jeong, Yujin, et al.
Pubblicazione: (2024)
di: Jeong, Yujin, et al.
Pubblicazione: (2024)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
QEAN: Quaternion-Enhanced Attention Network for Visual Dance Generation
di: Zhou, Zhizhen, et al.
Pubblicazione: (2024)
di: Zhou, Zhizhen, et al.
Pubblicazione: (2024)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
di: Li, Shufan, et al.
Pubblicazione: (2024)
di: Li, Shufan, et al.
Pubblicazione: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DanceChat: Large Language Model-Guided Music-to-Dance Generation
di: Wang, Qing, et al.
Pubblicazione: (2025) -
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
di: Chen, Zihao, et al.
Pubblicazione: (2024) -
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
di: Wang, Xuanchen, et al.
Pubblicazione: (2024) -
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
di: Li, Ronghui, et al.
Pubblicazione: (2024) -
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)