MEGADance: Mixture-of-Experts Architecture for Genre-Aware 3D Dance Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Kaixing, Tang, Xulong, Peng, Ziqiao, Hu, Yuxuan, He, Jun, Liu, Hongyan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation
por: Yang, Kaixing, et al.
Publicado: (2025)
por: Yang, Kaixing, et al.
Publicado: (2025)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
por: Yang, Kaixing, et al.
Publicado: (2024)
por: Yang, Kaixing, et al.
Publicado: (2024)
GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
por: Wang, Jinting, et al.
Publicado: (2025)
por: Wang, Jinting, et al.
Publicado: (2025)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
por: Li, Xiaojie, et al.
Publicado: (2025)
por: Li, Xiaojie, et al.
Publicado: (2025)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
por: Huang, Qiaochu, et al.
Publicado: (2024)
por: Huang, Qiaochu, et al.
Publicado: (2024)
Dance-to-Music Generation with Encoder-based Textual Inversion
por: Li, Sifei, et al.
Publicado: (2024)
por: Li, Sifei, et al.
Publicado: (2024)
Dance2MIDI: Dance-driven multi-instruments music generation
por: Han, Bo, et al.
Publicado: (2023)
por: Han, Bo, et al.
Publicado: (2023)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
por: Gu, Bin, et al.
Publicado: (2025)
por: Gu, Bin, et al.
Publicado: (2025)
DanceAnyWay: Synthesizing Beat-Guided 3D Dances with Randomized Temporal Contrastive Learning
por: Bhattacharya, Aneesh, et al.
Publicado: (2023)
por: Bhattacharya, Aneesh, et al.
Publicado: (2023)
Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation
por: Pina, Leonardo, et al.
Publicado: (2024)
por: Pina, Leonardo, et al.
Publicado: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
por: Xie, Siyi, et al.
Publicado: (2025)
por: Xie, Siyi, et al.
Publicado: (2025)
StereoFoley: Object-Aware Stereo Audio Generation from Video
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
por: Karchkhadze, Tornike, et al.
Publicado: (2025)
Low-latency Speech Enhancement via Speech Token Generation
por: Xue, Huaying, et al.
Publicado: (2023)
por: Xue, Huaying, et al.
Publicado: (2023)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
Flexible Control in Symbolic Music Generation via Musical Metadata
por: Han, Sangjun, et al.
Publicado: (2024)
por: Han, Sangjun, et al.
Publicado: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
por: Cui, Yang, et al.
Publicado: (2025)
por: Cui, Yang, et al.
Publicado: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
por: Niu, Xinlei, et al.
Publicado: (2025)
por: Niu, Xinlei, et al.
Publicado: (2025)
DanceChat: Large Language Model-Guided Music-to-Dance Generation
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
por: Wang, Yutian, et al.
Publicado: (2024)
por: Wang, Yutian, et al.
Publicado: (2024)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
por: Cong, Gaoxiang, et al.
Publicado: (2024)
por: Cong, Gaoxiang, et al.
Publicado: (2024)
Intelligent Text-Conditioned Music Generation
por: Xie, Zhouyao, et al.
Publicado: (2024)
por: Xie, Zhouyao, et al.
Publicado: (2024)
A Survey on Evaluation Metrics for Music Generation
por: Kader, Faria Binte, et al.
Publicado: (2025)
por: Kader, Faria Binte, et al.
Publicado: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
LoVA: Long-form Video-to-Audio Generation
por: Cheng, Xin, et al.
Publicado: (2024)
por: Cheng, Xin, et al.
Publicado: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
por: Shimada, Kazuki, et al.
Publicado: (2024)
por: Shimada, Kazuki, et al.
Publicado: (2024)
SonicVisionLM: Playing Sound with Vision Language Models
por: Xie, Zhifeng, et al.
Publicado: (2024)
por: Xie, Zhifeng, et al.
Publicado: (2024)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
ScripTONES: Sentiment-Conditioned Music Generation for Movie Scripts
por: Veerendranath, Vishruth, et al.
Publicado: (2024)
por: Veerendranath, Vishruth, et al.
Publicado: (2024)
Building Audio-Visual Digital Twins with Smartphones
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
por: You, Fuming, et al.
Publicado: (2024)
por: You, Fuming, et al.
Publicado: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
por: Guo, Zixin, et al.
Publicado: (2024)
por: Guo, Zixin, et al.
Publicado: (2024)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
por: Oh, Hyunwoo, et al.
Publicado: (2025)
por: Oh, Hyunwoo, et al.
Publicado: (2025)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025)
por: Song, Jiahao, et al.
Publicado: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
por: Kim, Haven, et al.
Publicado: (2025)
por: Kim, Haven, et al.
Publicado: (2025)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
por: Jin, Ruinan, et al.
Publicado: (2026)
por: Jin, Ruinan, et al.
Publicado: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
por: Ren, Yong, et al.
Publicado: (2024)
por: Ren, Yong, et al.
Publicado: (2024)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
por: Chan, Nolan, et al.
Publicado: (2026)
por: Chan, Nolan, et al.
Publicado: (2026)
Ejemplares similares
-
MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation
por: Yang, Kaixing, et al.
Publicado: (2025) -
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
por: Yang, Kaixing, et al.
Publicado: (2024) -
GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
por: Wang, Jinting, et al.
Publicado: (2025) -
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
por: Li, Xiaojie, et al.
Publicado: (2025) -
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
por: Huang, Qiaochu, et al.
Publicado: (2024)