HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Jian, Cui, Jianwei, Chen, Shihao, Zhang, Yubang, Luo, Cheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025)
par: Tong, Xinyi, et autres
Publié: (2025)
Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music
par: Su, Hongju, et autres
Publié: (2025)
par: Su, Hongju, et autres
Publié: (2025)
FastSAG: Towards Fast Non-Autoregressive Singing Accompaniment Generation
par: Chen, Jianyi, et autres
Publié: (2024)
par: Chen, Jianyi, et autres
Publié: (2024)
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
par: Wang, Xuanchen, et autres
Publié: (2025)
par: Wang, Xuanchen, et autres
Publié: (2025)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
par: Qian, Yikai, et autres
Publié: (2024)
par: Qian, Yikai, et autres
Publié: (2024)
Gesture2Music: A Low-Latency Real-Time Framework for Continuous Gesture-Driven Music Generation
par: Jeyaraj, Rathinaraja, et autres
Publié: (2025)
par: Jeyaraj, Rathinaraja, et autres
Publié: (2025)
YuE: Scaling Open Foundation Models for Long-Form Music Generation
par: Yuan, Ruibin, et autres
Publié: (2025)
par: Yuan, Ruibin, et autres
Publié: (2025)
Stemphonic: All-at-once Flexible Multi-stem Music Generation
par: Wu, Shih-Lun, et autres
Publié: (2026)
par: Wu, Shih-Lun, et autres
Publié: (2026)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
par: Li, Xiaojie, et autres
Publié: (2025)
par: Li, Xiaojie, et autres
Publié: (2025)
D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation From Lead sheet
par: Choi, Eunjin, et autres
Publié: (2026)
par: Choi, Eunjin, et autres
Publié: (2026)
MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation
par: Wu, Shih-Lun, et autres
Publié: (2025)
par: Wu, Shih-Lun, et autres
Publié: (2025)
GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions
par: Zuo, Heda, et autres
Publié: (2025)
par: Zuo, Heda, et autres
Publié: (2025)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
par: Yao, Dong, et autres
Publié: (2023)
par: Yao, Dong, et autres
Publié: (2023)
A Survey of Foundation Models for Music Understanding
par: Li, Wenjun, et autres
Publié: (2024)
par: Li, Wenjun, et autres
Publié: (2024)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
par: Qiu, Ke, et autres
Publié: (2026)
par: Qiu, Ke, et autres
Publié: (2026)
ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
par: Peng, Yuezhang, et autres
Publié: (2025)
par: Peng, Yuezhang, et autres
Publié: (2025)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
par: Lyu, Guangtao, et autres
Publié: (2025)
par: Lyu, Guangtao, et autres
Publié: (2025)
Towards Practical Real-Time Low-Latency Music Source Separation
par: Wu, Junyu, et autres
Publié: (2025)
par: Wu, Junyu, et autres
Publié: (2025)
Intelligent Text-Conditioned Music Generation
par: Xie, Zhouyao, et autres
Publié: (2024)
par: Xie, Zhouyao, et autres
Publié: (2024)
MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding
par: Yang, Meng, et autres
Publié: (2026)
par: Yang, Meng, et autres
Publié: (2026)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
MusicScore: A Dataset for Music Score Modeling and Generation
par: Lin, Yuheng, et autres
Publié: (2024)
par: Lin, Yuheng, et autres
Publié: (2024)
Flexible Control in Symbolic Music Generation via Musical Metadata
par: Han, Sangjun, et autres
Publié: (2024)
par: Han, Sangjun, et autres
Publié: (2024)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
par: Hu, Han, et autres
Publié: (2025)
par: Hu, Han, et autres
Publié: (2025)
Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling
par: Fan, Congyi, et autres
Publié: (2026)
par: Fan, Congyi, et autres
Publié: (2026)
Music Arena: Live Evaluation for Text-to-Music
par: Kim, Yonghyun, et autres
Publié: (2025)
par: Kim, Yonghyun, et autres
Publié: (2025)
Research on Piano Timbre Transformation System Based on Diffusion Model
par: Hsu, Chun-Chieh, et autres
Publié: (2026)
par: Hsu, Chun-Chieh, et autres
Publié: (2026)
MusicSwarm: Biologically Inspired Intelligence for Music Composition
par: Buehler, Markus J.
Publié: (2025)
par: Buehler, Markus J.
Publié: (2025)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
par: Salganik, Rebecca, et autres
Publié: (2026)
par: Salganik, Rebecca, et autres
Publié: (2026)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
par: Li, Shuyu, et autres
Publié: (2025)
par: Li, Shuyu, et autres
Publié: (2025)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
par: Wang, Yutian, et autres
Publié: (2024)
par: Wang, Yutian, et autres
Publié: (2024)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
Dance-to-Music Generation with Encoder-based Textual Inversion
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
par: Lei, Ke, et autres
Publié: (2026)
par: Lei, Ke, et autres
Publié: (2026)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
par: Wang, Siyu, et autres
Publié: (2025)
par: Wang, Siyu, et autres
Publié: (2025)
Memo2496: Expert-Annotated Dataset and Dual-View Adaptive Framework for Music Emotion Recognition
par: Li, Qilin, et autres
Publié: (2025)
par: Li, Qilin, et autres
Publié: (2025)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024)
par: Zhang, Liqian, et autres
Publié: (2024)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
par: Lv, Yishan, et autres
Publié: (2026)
par: Lv, Yishan, et autres
Publié: (2026)
Documents similaires
-
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025) -
Amadeus: Autoregressive Model with Bidirectional Attribute Modelling for Symbolic Music
par: Su, Hongju, et autres
Publié: (2025) -
FastSAG: Towards Fast Non-Autoregressive Singing Accompaniment Generation
par: Chen, Jianyi, et autres
Publié: (2024) -
MusicWeaver: Composer-Style Structural Editing and Minute-Scale Coherent Music Generation
par: Wang, Xuanchen, et autres
Publié: (2025) -
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
par: Qian, Yikai, et autres
Publié: (2024)