MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Qiu, Ke, Qin, Yawen, Jia, Tianzhi, Yang, Xiaole, Wang, Kaimin, Yang, Kaixing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
por: Jia, Tianzhi, et al.
Publicado: (2026)
por: Jia, Tianzhi, et al.
Publicado: (2026)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
por: Jeyaraj, Rathinaraja, et al.
Publicado: (2025)
por: Jeyaraj, Rathinaraja, et al.
Publicado: (2025)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
por: Yang, Kaixing, et al.
Publicado: (2024)
por: Yang, Kaixing, et al.
Publicado: (2024)
MEGADance: Mixture-of-Experts Architecture for Genre-Aware 3D Dance Generation
por: Yang, Kaixing, et al.
Publicado: (2025)
por: Yang, Kaixing, et al.
Publicado: (2025)
MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation
por: Yang, Kaixing, et al.
Publicado: (2025)
por: Yang, Kaixing, et al.
Publicado: (2025)
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
por: Wang, Xuanchen, et al.
Publicado: (2025)
por: Wang, Xuanchen, et al.
Publicado: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
por: Tong, Xinyi, et al.
Publicado: (2025)
por: Tong, Xinyi, et al.
Publicado: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
por: Li, Yaoru, et al.
Publicado: (2025)
por: Li, Yaoru, et al.
Publicado: (2025)
MusicAIR: A Multimodal AI Music Generation Framework Powered by an Algorithm-Driven Core
por: Liao, Callie C., et al.
Publicado: (2025)
por: Liao, Callie C., et al.
Publicado: (2025)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
por: Zhu, Jian, et al.
Publicado: (2026)
por: Zhu, Jian, et al.
Publicado: (2026)
Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music
por: Su, Hongju, et al.
Publicado: (2025)
por: Su, Hongju, et al.
Publicado: (2025)
MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding
por: Yang, Meng, et al.
Publicado: (2026)
por: Yang, Meng, et al.
Publicado: (2026)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
por: Ji, Shulei, et al.
Publicado: (2023)
por: Ji, Shulei, et al.
Publicado: (2023)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
por: Karchkhadze, Tornike, et al.
Publicado: (2024)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
por: Li, Xiaojie, et al.
Publicado: (2025)
por: Li, Xiaojie, et al.
Publicado: (2025)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
por: Lyu, Guangtao, et al.
Publicado: (2025)
por: Lyu, Guangtao, et al.
Publicado: (2025)
Rubato: Transcribing Piano Music with Timestamps
por: Tamer, Nazif Can, et al.
Publicado: (2026)
por: Tamer, Nazif Can, et al.
Publicado: (2026)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
por: Wang, Yutian, et al.
Publicado: (2024)
por: Wang, Yutian, et al.
Publicado: (2024)
Towards Practical Real-Time Low-Latency Music Source Separation
por: Wu, Junyu, et al.
Publicado: (2025)
por: Wu, Junyu, et al.
Publicado: (2025)
Efficient Transformer-Based Piano Transcription With Sparse Attention Mechanisms
por: Wei, Weixing, et al.
Publicado: (2025)
por: Wei, Weixing, et al.
Publicado: (2025)
Research on Piano Timbre Transformation System Based on Diffusion Model
por: Hsu, Chun-Chieh, et al.
Publicado: (2026)
por: Hsu, Chun-Chieh, et al.
Publicado: (2026)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
por: Luo, Jing, et al.
Publicado: (2024)
por: Luo, Jing, et al.
Publicado: (2024)
CEM-Net: Cross-Emotion Memory Network for Emotional Talking Face Generation
por: Wu, Kangyi, et al.
Publicado: (2025)
por: Wu, Kangyi, et al.
Publicado: (2025)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
por: Guo, Zixin, et al.
Publicado: (2024)
por: Guo, Zixin, et al.
Publicado: (2024)
GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing
por: Lin, Zihao, et al.
Publicado: (2026)
por: Lin, Zihao, et al.
Publicado: (2026)
Flexible Control in Symbolic Music Generation via Musical Metadata
por: Han, Sangjun, et al.
Publicado: (2024)
por: Han, Sangjun, et al.
Publicado: (2024)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
por: Ma, Ziyang, et al.
Publicado: (2026)
por: Ma, Ziyang, et al.
Publicado: (2026)
SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations
por: Wang, Chunshi, et al.
Publicado: (2025)
por: Wang, Chunshi, et al.
Publicado: (2025)
Music Arena: Live Evaluation for Text-to-Music
por: Kim, Yonghyun, et al.
Publicado: (2025)
por: Kim, Yonghyun, et al.
Publicado: (2025)
Stemphonic: All-at-once Flexible Multi-stem Music Generation
por: Wu, Shih-Lun, et al.
Publicado: (2026)
por: Wu, Shih-Lun, et al.
Publicado: (2026)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
por: Sun, Jiahui, et al.
Publicado: (2025)
por: Sun, Jiahui, et al.
Publicado: (2025)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
por: Qian, Yikai, et al.
Publicado: (2024)
por: Qian, Yikai, et al.
Publicado: (2024)
MusicSwarm: Biologically Inspired Intelligence for Music Composition
por: Buehler, Markus J.
Publicado: (2025)
por: Buehler, Markus J.
Publicado: (2025)
Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
por: Yang, Sicheng, et al.
Publicado: (2024)
por: Yang, Sicheng, et al.
Publicado: (2024)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
por: Li, Shuyu, et al.
Publicado: (2025)
por: Li, Shuyu, et al.
Publicado: (2025)
Intelligent Text-Conditioned Music Generation
por: Xie, Zhouyao, et al.
Publicado: (2024)
por: Xie, Zhouyao, et al.
Publicado: (2024)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
por: Song, Jiahao, et al.
Publicado: (2025)
por: Song, Jiahao, et al.
Publicado: (2025)
Memo2496: Expert-Annotated Dataset and Dual-View Adaptive Framework for Music Emotion Recognition
por: Li, Qilin, et al.
Publicado: (2025)
por: Li, Qilin, et al.
Publicado: (2025)
MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation
por: Wu, Shih-Lun, et al.
Publicado: (2025)
por: Wu, Shih-Lun, et al.
Publicado: (2025)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
por: Yao, Dong, et al.
Publicado: (2023)
por: Yao, Dong, et al.
Publicado: (2023)
Ejemplares similares
-
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
por: Jia, Tianzhi, et al.
Publicado: (2026) -
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
por: Jeyaraj, Rathinaraja, et al.
Publicado: (2025) -
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
por: Yang, Kaixing, et al.
Publicado: (2024) -
MEGADance: Mixture-of-Experts Architecture for Genre-Aware 3D Dance Generation
por: Yang, Kaixing, et al.
Publicado: (2025) -
MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation
por: Yang, Kaixing, et al.
Publicado: (2025)