From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Huan, Liang, Jinhua, Phan, Huy, Wang, Wenwu, Benetos, Emmanouil |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Acoustic Prompt Tuning: Empowering Large Language Models with Audition Capabilities
por: Liang, Jinhua, et al.
Publicado: (2023)
por: Liang, Jinhua, et al.
Publicado: (2023)
Mind the Domain Gap: a Systematic Analysis on Bioacoustic Sound Event Detection
por: Liang, Jinhua, et al.
Publicado: (2024)
por: Liang, Jinhua, et al.
Publicado: (2024)
WavCraft: Audio Editing and Generation with Large Language Models
por: Liang, Jinhua, et al.
Publicado: (2024)
por: Liang, Jinhua, et al.
Publicado: (2024)
LHGNN: Local-Higher Order Graph Neural Networks For Audio Classification and Tagging
por: Singh, Shubhr, et al.
Publicado: (2025)
por: Singh, Shubhr, et al.
Publicado: (2025)
Universal Music Representations? Evaluating Foundation Models on World Music Corpora
por: Papaioannou, Charilaos, et al.
Publicado: (2025)
por: Papaioannou, Charilaos, et al.
Publicado: (2025)
Hierarchical Symbolic Pop Music Generation with Graph Neural Networks
por: Lim, Wen Qing, et al.
Publicado: (2024)
por: Lim, Wen Qing, et al.
Publicado: (2024)
Learning Music Audio Representations With Limited Data
por: Plachouras, Christos, et al.
Publicado: (2025)
por: Plachouras, Christos, et al.
Publicado: (2025)
Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models
por: Postolache, Emilian, et al.
Publicado: (2024)
por: Postolache, Emilian, et al.
Publicado: (2024)
Enhancing Lyrics Transcription on Music Mixtures with Consistency Loss
por: Huang, Jiawen, et al.
Publicado: (2025)
por: Huang, Jiawen, et al.
Publicado: (2025)
LC-Protonets: Multi-Label Few-Shot Learning for World Music Audio Tagging
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
por: Papaioannou, Charilaos, et al.
Publicado: (2024)
From Audio Encoders to Piano Judges: Benchmarking Performance Understanding for Solo Piano
por: Zhang, Huan, et al.
Publicado: (2024)
por: Zhang, Huan, et al.
Publicado: (2024)
Aligning Text-to-Music Evaluation with Human Preferences
por: Huang, Yichen, et al.
Publicado: (2025)
por: Huang, Yichen, et al.
Publicado: (2025)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
por: Huang, Jiawen, et al.
Publicado: (2024)
por: Huang, Jiawen, et al.
Publicado: (2024)
YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation
por: Chang, Sungkyun, et al.
Publicado: (2024)
por: Chang, Sungkyun, et al.
Publicado: (2024)
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
por: Chang, Sungkyun, et al.
Publicado: (2025)
por: Chang, Sungkyun, et al.
Publicado: (2025)
WeaveMuse: An Open Agentic System for Multimodal Music Understanding and Generation
por: Karystinaios, Emmanouil
Publicado: (2025)
por: Karystinaios, Emmanouil
Publicado: (2025)
CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following
por: Ma, Yinghao, et al.
Publicado: (2025)
por: Ma, Yinghao, et al.
Publicado: (2025)
Domain-Invariant Representation Learning of Bird Sounds
por: Moummad, Ilyass, et al.
Publicado: (2024)
por: Moummad, Ilyass, et al.
Publicado: (2024)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
por: Zhou, Ziya, et al.
Publicado: (2024)
por: Zhou, Ziya, et al.
Publicado: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
por: Weck, Benno, et al.
Publicado: (2024)
por: Weck, Benno, et al.
Publicado: (2024)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
por: Hisariya, Tanisha, et al.
Publicado: (2024)
por: Hisariya, Tanisha, et al.
Publicado: (2024)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
por: Deng, Zihao, et al.
Publicado: (2023)
por: Deng, Zihao, et al.
Publicado: (2023)
Language Models for Music Medicine Generation
por: Nikolakakis, Emmanouil, et al.
Publicado: (2024)
por: Nikolakakis, Emmanouil, et al.
Publicado: (2024)
Acoustic identification of individual animals with hierarchical contrastive learning
por: Nolasco, Ines, et al.
Publicado: (2024)
por: Nolasco, Ines, et al.
Publicado: (2024)
SCRAPL: Scattering Transform with Random Paths for Machine Learning
por: Mitcheltree, Christopher, et al.
Publicado: (2026)
por: Mitcheltree, Christopher, et al.
Publicado: (2026)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
por: Liu, Cheng, et al.
Publicado: (2025)
por: Liu, Cheng, et al.
Publicado: (2025)
Musical Source Separation Bake-Off: Comparing Objective Metrics with Human Perception
por: Jaffe, Noah, et al.
Publicado: (2025)
por: Jaffe, Noah, et al.
Publicado: (2025)
SMUG-Explain: A Framework for Symbolic Music Graph Explanations
por: Karystinaios, Emmanouil, et al.
Publicado: (2024)
por: Karystinaios, Emmanouil, et al.
Publicado: (2024)
MusicRL: Aligning Music Generation to Human Preferences
por: Cideron, Geoffrey, et al.
Publicado: (2024)
por: Cideron, Geoffrey, et al.
Publicado: (2024)
Hear: Hierarchically Enhanced Aesthetic Representations For Multidimensional Music Evaluation
por: Liu, Shuyang, et al.
Publicado: (2025)
por: Liu, Shuyang, et al.
Publicado: (2025)
DExter: Learning and Controlling Performance Expression with Diffusion Models
por: Zhang, Huan, et al.
Publicado: (2024)
por: Zhang, Huan, et al.
Publicado: (2024)
SongEval: A Benchmark Dataset for Song Aesthetics Evaluation
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
por: Imamura, Takehiro, et al.
Publicado: (2025)
por: Imamura, Takehiro, et al.
Publicado: (2025)
Classification of Spontaneous and Scripted Speech for Multilingual Audio
por: Elisha, Shahar, et al.
Publicado: (2024)
por: Elisha, Shahar, et al.
Publicado: (2024)
A Data-Driven Analysis of Robust Automatic Piano Transcription
por: Edwards, Drew, et al.
Publicado: (2024)
por: Edwards, Drew, et al.
Publicado: (2024)
Text-Queried Target Sound Event Localization
por: Zhao, Jinzheng, et al.
Publicado: (2024)
por: Zhao, Jinzheng, et al.
Publicado: (2024)
ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization
por: Steinmetz, Christian J., et al.
Publicado: (2024)
por: Steinmetz, Christian J., et al.
Publicado: (2024)
Mustango: Toward Controllable Text-to-Music Generation
por: Melechovsky, Jan, et al.
Publicado: (2023)
por: Melechovsky, Jan, et al.
Publicado: (2023)
DGFM: Full Body Dance Generation Driven by Music Foundation Models
por: Liu, Xinran, et al.
Publicado: (2025)
por: Liu, Xinran, et al.
Publicado: (2025)
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
por: Ma, Guobin, et al.
Publicado: (2026)
por: Ma, Guobin, et al.
Publicado: (2026)
Ejemplares similares
-
Acoustic Prompt Tuning: Empowering Large Language Models with Audition Capabilities
por: Liang, Jinhua, et al.
Publicado: (2023) -
Mind the Domain Gap: a Systematic Analysis on Bioacoustic Sound Event Detection
por: Liang, Jinhua, et al.
Publicado: (2024) -
WavCraft: Audio Editing and Generation with Large Language Models
por: Liang, Jinhua, et al.
Publicado: (2024) -
LHGNN: Local-Higher Order Graph Neural Networks For Audio Classification and Tagging
por: Singh, Shubhr, et al.
Publicado: (2025) -
Universal Music Representations? Evaluating Foundation Models on World Music Corpora
por: Papaioannou, Charilaos, et al.
Publicado: (2025)