PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Im, Jaekwon, Polouliakh, Natalia, Akama, Taketo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DanceChat: Large Language Model-Guided Music-to-Dance Generation
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
par: Lee, Junwon, et autres
Publié: (2024)
par: Lee, Junwon, et autres
Publié: (2024)
Controllable Dance Generation with Style-Guided Motion Diffusion
par: Wang, Hongsong, et autres
Publié: (2024)
par: Wang, Hongsong, et autres
Publié: (2024)
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
par: Li, Ronghui, et autres
Publié: (2024)
par: Li, Ronghui, et autres
Publié: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
par: Hisariya, Tanisha, et autres
Publié: (2024)
par: Hisariya, Tanisha, et autres
Publié: (2024)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
par: Li, Xiaojie, et autres
Publié: (2025)
par: Li, Xiaojie, et autres
Publié: (2025)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
par: Wang, Baisen, et autres
Publié: (2024)
par: Wang, Baisen, et autres
Publié: (2024)
Align Your Rhythm: Generating Highly Aligned Dance Poses with Gating-Enhanced Rhythm-Aware Feature Representation
par: Fan, Congyi, et autres
Publié: (2025)
par: Fan, Congyi, et autres
Publié: (2025)
Learning Musical Representations for Music Performance Question Answering
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
par: Tang, Xiaoxuan, et autres
Publié: (2025)
par: Tang, Xiaoxuan, et autres
Publié: (2025)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Dance-to-Music Generation with Encoder-based Textual Inversion
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
par: Wang, Xuanchen, et autres
Publié: (2024)
par: Wang, Xuanchen, et autres
Publié: (2024)
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
par: Rinaldi, Ivan, et autres
Publié: (2024)
par: Rinaldi, Ivan, et autres
Publié: (2024)
Learning Sparsity for Effective and Efficient Music Performance Question Answering
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
par: Chi, Xiaowei, et autres
Publié: (2024)
par: Chi, Xiaowei, et autres
Publié: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
par: You, Wenhao, et autres
Publié: (2025)
par: You, Wenhao, et autres
Publié: (2025)
FilmComposer: LLM-Driven Music Production for Silent Film Clips
par: Xie, Zhifeng, et autres
Publié: (2025)
par: Xie, Zhifeng, et autres
Publié: (2025)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024)
par: Huang, Qiaochu, et autres
Publié: (2024)
Diffusion Models as Masked Audio-Video Learners
par: Nunez, Elvis, et autres
Publié: (2023)
par: Nunez, Elvis, et autres
Publié: (2023)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
par: Xing, Yazhou, et autres
Publié: (2024)
par: Xing, Yazhou, et autres
Publié: (2024)
M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment
par: Nguyen-Phuoc, Long, et autres
Publié: (2024)
par: Nguyen-Phuoc, Long, et autres
Publié: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024)
par: Yang, Kaixing, et autres
Publié: (2024)
Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
par: Postolache, Emilian, et autres
Publié: (2024)
par: Postolache, Emilian, et autres
Publié: (2024)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
par: Chen, Gehui, et autres
Publié: (2025)
par: Chen, Gehui, et autres
Publié: (2025)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
par: Mao, Yuxin, et autres
Publié: (2023)
par: Mao, Yuxin, et autres
Publié: (2023)
Vision-to-Music Generation: A Survey
par: Wang, Zhaokai, et autres
Publié: (2025)
par: Wang, Zhaokai, et autres
Publié: (2025)
DiffSSD: A Diffusion-Based Dataset For Speech Forensics
par: Bhagtani, Kratika, et autres
Publié: (2024)
par: Bhagtani, Kratika, et autres
Publié: (2024)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
par: He, Yuhang, et autres
Publié: (2024)
par: He, Yuhang, et autres
Publié: (2024)
3D Audio-Visual Segmentation
par: Sokolov, Artem, et autres
Publié: (2024)
par: Sokolov, Artem, et autres
Publié: (2024)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
QEAN: Quaternion-Enhanced Attention Network for Visual Dance Generation
par: Zhou, Zhizhen, et autres
Publié: (2024)
par: Zhou, Zhizhen, et autres
Publié: (2024)
It Takes Two: Real-time Co-Speech Two-person's Interaction Generation via Reactive Auto-regressive Diffusion Model
par: Shi, Mingyi, et autres
Publié: (2024)
par: Shi, Mingyi, et autres
Publié: (2024)
MEGADance: Mixture-of-Experts Architecture for Genre-Aware 3D Dance Generation
par: Yang, Kaixing, et autres
Publié: (2025)
par: Yang, Kaixing, et autres
Publié: (2025)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
par: Izzati, Fathinah, et autres
Publié: (2025)
par: Izzati, Fathinah, et autres
Publié: (2025)
Video-Guided Foley Sound Generation with Multimodal Controls
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
Documents similaires
-
DanceChat: Large Language Model-Guided Music-to-Dance Generation
par: Wang, Qing, et autres
Publié: (2025) -
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
par: Lee, Junwon, et autres
Publié: (2024) -
Controllable Dance Generation with Style-Guided Motion Diffusion
par: Wang, Hongsong, et autres
Publié: (2024) -
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
par: Li, Ronghui, et autres
Publié: (2024) -
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)