MMVA: Multimodal Matching Based on Valence and Arousal across Images, Music, and Musical Captions
Fuente:
arXiv
Salvato in:
| Autori principali: | Choi, Suhwan, Kim, Kyu Won, Kang, Myungjoo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
di: Ji, Shulei, et al.
Pubblicazione: (2023)
di: Ji, Shulei, et al.
Pubblicazione: (2023)
Frechet Music Distance: A Metric For Generative Symbolic Music Evaluation
di: Retkowski, Jan, et al.
Pubblicazione: (2024)
di: Retkowski, Jan, et al.
Pubblicazione: (2024)
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
di: Deng, Zihao, et al.
Pubblicazione: (2023)
di: Deng, Zihao, et al.
Pubblicazione: (2023)
Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
di: Zhao, Zijian, et al.
Pubblicazione: (2025)
di: Zhao, Zijian, et al.
Pubblicazione: (2025)
A Survey of Foundation Models for Music Understanding
di: Li, Wenjun, et al.
Pubblicazione: (2024)
di: Li, Wenjun, et al.
Pubblicazione: (2024)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
di: Song, Jiahao, et al.
Pubblicazione: (2025)
di: Song, Jiahao, et al.
Pubblicazione: (2025)
CoComposer: LLM Multi-agent Collaborative Music Composition
di: Xing, Peiwen, et al.
Pubblicazione: (2025)
di: Xing, Peiwen, et al.
Pubblicazione: (2025)
Controllable Video-to-Music Generation with Multiple Time-Varying Conditions
di: Wu, Junxian, et al.
Pubblicazione: (2025)
di: Wu, Junxian, et al.
Pubblicazione: (2025)
From Sound to Sight: Towards AI-authored Music Videos
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
di: Vitasovic, Leo, et al.
Pubblicazione: (2025)
Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
di: Zhang, Yixiao, et al.
Pubblicazione: (2024)
Analyzable Chain-of-Musical-Thought Prompting for High-Fidelity Music Generation
di: Lam, Max W. Y., et al.
Pubblicazione: (2025)
di: Lam, Max W. Y., et al.
Pubblicazione: (2025)
TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation
di: Choi, Keunwoo, et al.
Pubblicazione: (2025)
di: Choi, Keunwoo, et al.
Pubblicazione: (2025)
GVMGen: A General Video-to-Music Generation Model with Hierarchical Attentions
di: Zuo, Heda, et al.
Pubblicazione: (2025)
di: Zuo, Heda, et al.
Pubblicazione: (2025)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2024)
ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence
di: Ma, Menghe, et al.
Pubblicazione: (2026)
di: Ma, Menghe, et al.
Pubblicazione: (2026)
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
YuE: Scaling Open Foundation Models for Long-Form Music Generation
di: Yuan, Ruibin, et al.
Pubblicazione: (2025)
di: Yuan, Ruibin, et al.
Pubblicazione: (2025)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
di: Luo, Jing, et al.
Pubblicazione: (2025)
di: Luo, Jing, et al.
Pubblicazione: (2025)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
di: Koh, Junyoung, et al.
Pubblicazione: (2025)
SteerMusic: Enhanced Musical Consistency for Zero-shot Text-guided and Personalized Music Editing
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Flexible Control in Symbolic Music Generation via Musical Metadata
di: Han, Sangjun, et al.
Pubblicazione: (2024)
di: Han, Sangjun, et al.
Pubblicazione: (2024)
GACA-DiT: Diffusion-based Dance-to-Music Generation with Genre-Adaptive Rhythm and Context-Aware Alignment
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
BandCondiNet: Parallel Transformers-based Conditional Popular Music Generation with Multi-View Features
di: Luo, Jing, et al.
Pubblicazione: (2024)
di: Luo, Jing, et al.
Pubblicazione: (2024)
A Survey on Multimodal Music Emotion Recognition
di: Liyanarachchi, Rashini, et al.
Pubblicazione: (2025)
di: Liyanarachchi, Rashini, et al.
Pubblicazione: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
di: Ma, Yinghao, et al.
Pubblicazione: (2026)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
di: Qian, Yikai, et al.
Pubblicazione: (2024)
di: Qian, Yikai, et al.
Pubblicazione: (2024)
Generative AI for Music and Audio
di: Dong, Hao-Wen
Pubblicazione: (2024)
di: Dong, Hao-Wen
Pubblicazione: (2024)
MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio
di: Zhao, Qihao, et al.
Pubblicazione: (2026)
di: Zhao, Qihao, et al.
Pubblicazione: (2026)
PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
di: Long, Phillip, et al.
Pubblicazione: (2024)
di: Long, Phillip, et al.
Pubblicazione: (2024)
Emotion-Aligned Contrastive Learning Between Images and Music
di: Stewart, Shanti, et al.
Pubblicazione: (2023)
di: Stewart, Shanti, et al.
Pubblicazione: (2023)
Towards Generating Diverse Audio Captions via Adversarial Training
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
di: Li, Sifei, et al.
Pubblicazione: (2025)
di: Li, Sifei, et al.
Pubblicazione: (2025)
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
Multi-Track MusicLDM: Towards Versatile Music Generation with Latent Diffusion Model
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2024)
Efficient Fine-Grained Guidance for Diffusion Model Based Symbolic Music Generation
di: Zhu, Tingyu, et al.
Pubblicazione: (2024)
di: Zhu, Tingyu, et al.
Pubblicazione: (2024)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
di: Bang, Hayeon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
di: Ji, Shulei, et al.
Pubblicazione: (2023) -
Frechet Music Distance: A Metric For Generative Symbolic Music Evaluation
di: Retkowski, Jan, et al.
Pubblicazione: (2024) -
MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models
di: Zhang, Yixiao, et al.
Pubblicazione: (2024) -
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
di: Batlle-Roca, Roser, et al.
Pubblicazione: (2024) -
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
di: Deng, Zihao, et al.
Pubblicazione: (2023)