Adapting Frechet Audio Distance for Generative Music Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Gui, Azalea, Gamper, Hannes, Braun, Sebastian, Emmanouilidou, Dimitra |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
por: Li, Yuanchao, et al.
Publicado: (2024)
por: Li, Yuanchao, et al.
Publicado: (2024)
SALAD-VAE: Semantic Audio Compression with Language-Audio Distillation
por: Braun, Sebastian, et al.
Publicado: (2025)
por: Braun, Sebastian, et al.
Publicado: (2025)
Multi-label audio classification with a noisy zero-shot teacher
por: Braun, Sebastian, et al.
Publicado: (2024)
por: Braun, Sebastian, et al.
Publicado: (2024)
Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model
por: Vosoughi, Ali, et al.
Publicado: (2025)
por: Vosoughi, Ali, et al.
Publicado: (2025)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
por: Moliner, Eloi, et al.
Publicado: (2024)
por: Moliner, Eloi, et al.
Publicado: (2024)
Sci-Phi: A Large Language Model Spatial Audio Descriptor
por: Jiang, Xilin, et al.
Publicado: (2025)
por: Jiang, Xilin, et al.
Publicado: (2025)
Frechet Music Distance: A Metric For Generative Symbolic Music Evaluation
por: Retkowski, Jan, et al.
Publicado: (2024)
por: Retkowski, Jan, et al.
Publicado: (2024)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
por: Yang, Ruihan, et al.
Publicado: (2023)
por: Yang, Ruihan, et al.
Publicado: (2023)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
por: Tailleur, Modan, et al.
Publicado: (2024)
por: Tailleur, Modan, et al.
Publicado: (2024)
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
por: Jeong, Wonwoo
Publicado: (2026)
por: Jeong, Wonwoo
Publicado: (2026)
Distillation and Pruning for Scalable Self-Supervised Representation-Based Speech Quality Assessment
por: Stahl, Benjamin, et al.
Publicado: (2025)
por: Stahl, Benjamin, et al.
Publicado: (2025)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Towards Blind Data Cleaning: A Case Study in Music Source Separation
por: Gui, Azalea, et al.
Publicado: (2025)
por: Gui, Azalea, et al.
Publicado: (2025)
Towards Evaluating Generative Audio: Insights from Neural Audio Codec Embedding Distances
por: Biswas, Arijit, et al.
Publicado: (2025)
por: Biswas, Arijit, et al.
Publicado: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Evaluating Pretrained General-Purpose Audio Representations for Music Genre Classification
por: Rai, Kashish, et al.
Publicado: (2026)
por: Rai, Kashish, et al.
Publicado: (2026)
Adapting a Text-to-Audio Model for Room Impulse Response Generation
por: Kim, Kirak, et al.
Publicado: (2026)
por: Kim, Kirak, et al.
Publicado: (2026)
Towards Real-Time Generative Speech Restoration with Flow-Matching
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
por: Hsieh, Tsun-An, et al.
Publicado: (2025)
Real-time Speech Restoration using Data Prediction Mean Flows
por: Braun, Sebastian
Publicado: (2026)
por: Braun, Sebastian
Publicado: (2026)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
Audio Conditioning for Music Generation via Discrete Bottleneck Features
por: Rouard, Simon, et al.
Publicado: (2024)
por: Rouard, Simon, et al.
Publicado: (2024)
DAC-JAX: A JAX Implementation of the Descript Audio Codec
por: Braun, David
Publicado: (2024)
por: Braun, David
Publicado: (2024)
ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation
por: Tal, Or, et al.
Publicado: (2024)
por: Tal, Or, et al.
Publicado: (2024)
Assessing Data Replication in Symbolic Music via Adapted Structural Similarity Index Measure
por: Ji, Shulei, et al.
Publicado: (2025)
por: Ji, Shulei, et al.
Publicado: (2025)
Enhancing Neural Audio Fingerprint Robustness to Audio Degradation for Music Identification
por: Araz, R. Oguz, et al.
Publicado: (2025)
por: Araz, R. Oguz, et al.
Publicado: (2025)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
por: Shi, Jiatong, et al.
Publicado: (2024)
por: Shi, Jiatong, et al.
Publicado: (2024)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
por: Liu, Cheng, et al.
Publicado: (2025)
por: Liu, Cheng, et al.
Publicado: (2025)
From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview
por: Li, Yupei, et al.
Publicado: (2024)
por: Li, Yupei, et al.
Publicado: (2024)
Network Modulation Synthesis: New Algorithms for Generating Musical Audio Using Autoencoder Networks
por: Hyrkas, Jeremy
Publicado: (2021)
por: Hyrkas, Jeremy
Publicado: (2021)
Angular Distance Distribution Loss for Audio Classification
por: Almudévar, Antonio, et al.
Publicado: (2024)
por: Almudévar, Antonio, et al.
Publicado: (2024)
Distributed Asynchronous Device Speech Enhancement via Windowed Cross-Attention
por: Yang, Gene-Ping, et al.
Publicado: (2025)
por: Yang, Gene-Ping, et al.
Publicado: (2025)
InfiniteAudio: Infinite-Length Audio Generation with Consistency
por: Jung, Chaeyoung, et al.
Publicado: (2025)
por: Jung, Chaeyoung, et al.
Publicado: (2025)
Music Flamingo: Scaling Music Understanding in Audio Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
por: Collins, Nick
Publicado: (2024)
por: Collins, Nick
Publicado: (2024)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
por: Jeong, Wonwoo
Publicado: (2026)
por: Jeong, Wonwoo
Publicado: (2026)
Speaker Distance Estimation in Enclosures from Single-Channel Audio
por: Neri, Michael, et al.
Publicado: (2024)
por: Neri, Michael, et al.
Publicado: (2024)
Measuring Audio Prompt Adherence with Distribution-based Embedding Distances
por: Grachten, Maarten
Publicado: (2024)
por: Grachten, Maarten
Publicado: (2024)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
por: Wilkins, Julia, et al.
Publicado: (2024)
por: Wilkins, Julia, et al.
Publicado: (2024)
Ejemplares similares
-
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
por: Li, Yuanchao, et al.
Publicado: (2024) -
SALAD-VAE: Semantic Audio Compression with Language-Audio Distillation
por: Braun, Sebastian, et al.
Publicado: (2025) -
Multi-label audio classification with a noisy zero-shot teacher
por: Braun, Sebastian, et al.
Publicado: (2024) -
Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model
por: Vosoughi, Ali, et al.
Publicado: (2025) -
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
por: Moliner, Eloi, et al.
Publicado: (2024)