A Survey on Cross-Modal Interaction Between Music and Multimodal Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Sifei, Tan, Mining, Shen, Feier, Luo, Minyan, Yin, Zijiao, Tang, Fan, Dong, Weiming, Xu, Changsheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dance-to-Music Generation with Encoder-based Textual Inversion
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026)
par: Zhao, Qihao, et autres
Publié: (2026)
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024)
par: Yang, Kaixing, et autres
Publié: (2024)
A Survey on Evaluation Metrics for Music Generation
par: Kader, Faria Binte, et autres
Publié: (2025)
par: Kader, Faria Binte, et autres
Publié: (2025)
Emotion-Aligned Contrastive Learning Between Images and Music
par: Stewart, Shanti, et autres
Publié: (2023)
par: Stewart, Shanti, et autres
Publié: (2023)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025)
par: Song, Jiahao, et autres
Publié: (2025)
Music Style Transfer with Time-Varying Inversion of Diffusion Models
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
par: Yao, Dong, et autres
Publié: (2023)
par: Yao, Dong, et autres
Publié: (2023)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
Flexible Control in Symbolic Music Generation via Musical Metadata
par: Han, Sangjun, et autres
Publié: (2024)
par: Han, Sangjun, et autres
Publié: (2024)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025)
par: Kim, Minyoung, et autres
Publié: (2025)
MoMu-Diffusion: On Learning Long-Term Motion-Music Synchronization and Correspondence
par: You, Fuming, et autres
Publié: (2024)
par: You, Fuming, et autres
Publié: (2024)
Video-Guided Text-to-Music Generation Using Public Domain Movie Collections
par: Kim, Haven, et autres
Publié: (2025)
par: Kim, Haven, et autres
Publié: (2025)
A Survey of Foundation Models for Music Understanding
par: Li, Wenjun, et autres
Publié: (2024)
par: Li, Wenjun, et autres
Publié: (2024)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
par: Salganik, Rebecca, et autres
Publié: (2026)
par: Salganik, Rebecca, et autres
Publié: (2026)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
par: Karchkhadze, Tornike, et autres
Publié: (2024)
par: Karchkhadze, Tornike, et autres
Publié: (2024)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
par: Wang, Haoxu, et autres
Publié: (2024)
par: Wang, Haoxu, et autres
Publié: (2024)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024)
par: Huang, Qiaochu, et autres
Publié: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
par: Qian, Yikai, et autres
Publié: (2024)
par: Qian, Yikai, et autres
Publié: (2024)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Intelligent Text-Conditioned Music Generation
par: Xie, Zhouyao, et autres
Publié: (2024)
par: Xie, Zhouyao, et autres
Publié: (2024)
Optimizing Feature Extraction for Symbolic Music
par: Simonetta, Federico, et autres
Publié: (2023)
par: Simonetta, Federico, et autres
Publié: (2023)
Cross-Modal Learning for Music-to-Music-Video Description Generation
par: Mao, Zhuoyuan, et autres
Publié: (2025)
par: Mao, Zhuoyuan, et autres
Publié: (2025)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
par: Stewart, Shanti, et autres
Publié: (2024)
par: Stewart, Shanti, et autres
Publié: (2024)
ScripTONES: Sentiment-Conditioned Music Generation for Movie Scripts
par: Veerendranath, Vishruth, et autres
Publié: (2024)
par: Veerendranath, Vishruth, et autres
Publié: (2024)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
par: Koh, Junyoung, et autres
Publié: (2025)
par: Koh, Junyoung, et autres
Publié: (2025)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
par: Zhang, Liqian, et autres
Publié: (2024)
par: Zhang, Liqian, et autres
Publié: (2024)
MMVA: Multimodal Matching Based on Valence and Arousal across Images, Music, and Musical Captions
par: Choi, Suhwan, et autres
Publié: (2025)
par: Choi, Suhwan, et autres
Publié: (2025)
Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling
par: Li, Xiaojie, et autres
Publié: (2025)
par: Li, Xiaojie, et autres
Publié: (2025)
A Unified Framework for Modality-Agnostic Deepfakes Detection
par: Yu, Cai, et autres
Publié: (2023)
par: Yu, Cai, et autres
Publié: (2023)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
par: Liu, Shansong, et autres
Publié: (2023)
par: Liu, Shansong, et autres
Publié: (2023)
MeloTrans: A Text to Symbolic Music Generation Model Following Human Composition Habit
par: Wang, Yutian, et autres
Publié: (2024)
par: Wang, Yutian, et autres
Publié: (2024)
MusicScore: A Dataset for Music Score Modeling and Generation
par: Lin, Yuheng, et autres
Publié: (2024)
par: Lin, Yuheng, et autres
Publié: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
par: Liu, Shansong, et autres
Publié: (2024)
par: Liu, Shansong, et autres
Publié: (2024)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences
par: Spanio, Matteo, et autres
Publié: (2026)
par: Spanio, Matteo, et autres
Publié: (2026)
Personality-Enhanced Multimodal Depression Detection in the Elderly
par: Wang, Honghong, et autres
Publié: (2025)
par: Wang, Honghong, et autres
Publié: (2025)
Documents similaires
-
Dance-to-Music Generation with Encoder-based Textual Inversion
par: Li, Sifei, et autres
Publié: (2024) -
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025) -
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
par: Zhao, Qihao, et autres
Publié: (2026) -
CoheDancers: Enhancing Interactive Group Dance Generation through Music-Driven Coherence Decomposition
par: Yang, Kaixing, et autres
Publié: (2024) -
A Survey on Evaluation Metrics for Music Generation
par: Kader, Faria Binte, et autres
Publié: (2025)