An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Jeong, Wonwoo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
par: Jeong, Wonwoo
Publié: (2026)
par: Jeong, Wonwoo
Publié: (2026)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
par: Tailleur, Modan, et autres
Publié: (2024)
par: Tailleur, Modan, et autres
Publié: (2024)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
Angular Distance Distribution Loss for Audio Classification
par: Almudévar, Antonio, et autres
Publié: (2024)
par: Almudévar, Antonio, et autres
Publié: (2024)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
par: Yeh, Yen-Tung, et autres
Publié: (2025)
par: Yeh, Yen-Tung, et autres
Publié: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
par: Wang, Xiaopeng, et autres
Publié: (2024)
par: Wang, Xiaopeng, et autres
Publié: (2024)
Speaker Distance Estimation in Enclosures from Single-Channel Audio
par: Neri, Michael, et autres
Publié: (2024)
par: Neri, Michael, et autres
Publié: (2024)
Measuring Audio Prompt Adherence with Distribution-based Embedding Distances
par: Grachten, Maarten
Publié: (2024)
par: Grachten, Maarten
Publié: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
par: Oh, Hyunwoo, et autres
Publié: (2025)
par: Oh, Hyunwoo, et autres
Publié: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Frechet Music Distance: A Metric For Generative Symbolic Music Evaluation
par: Retkowski, Jan, et autres
Publié: (2024)
par: Retkowski, Jan, et autres
Publié: (2024)
Do Foundational Audio Encoders Understand Music Structure?
par: Toyama, Keisuke, et autres
Publié: (2025)
par: Toyama, Keisuke, et autres
Publié: (2025)
Can Audio Reveal Music Performance Difficulty? Insights from the Piano Syllabus Dataset
par: Ramoneda, Pedro, et autres
Publié: (2024)
par: Ramoneda, Pedro, et autres
Publié: (2024)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
par: Zhang, Daning, et autres
Publié: (2025)
par: Zhang, Daning, et autres
Publié: (2025)
Residual Learning for Neural Ambisonics Encoders
par: Deppisch, Thomas, et autres
Publié: (2026)
par: Deppisch, Thomas, et autres
Publié: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
par: Khodzhaev, Zulfidin
Publié: (2024)
par: Khodzhaev, Zulfidin
Publié: (2024)
Analysis of ABC Frontend Audio Systems for the NIST-SRE24
par: Barahona, Sara, et autres
Publié: (2025)
par: Barahona, Sara, et autres
Publié: (2025)
ADD 2023: Towards Audio Deepfake Detection and Analysis in the Wild
par: Yi, Jiangyan, et autres
Publié: (2024)
par: Yi, Jiangyan, et autres
Publié: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake Detection
par: Kheir, Yassine El, et autres
Publié: (2025)
par: Kheir, Yassine El, et autres
Publié: (2025)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
par: Wang, Yucheng, et autres
Publié: (2026)
par: Wang, Yucheng, et autres
Publié: (2026)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
par: Dixit, Satvik, et autres
Publié: (2024)
par: Dixit, Satvik, et autres
Publié: (2024)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
A Comparative Analysis of Poetry Reading Audio: Singing, Narrating, or Somewhere In Between?
par: Choi, Kahyun, et autres
Publié: (2024)
par: Choi, Kahyun, et autres
Publié: (2024)
Comparative Analysis of Finite Difference and Finite Element Method for Audio Waveform Simulation
par: Florin, Juliette
Publié: (2025)
par: Florin, Juliette
Publié: (2025)
Documents similaires
-
Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
par: Jeong, Wonwoo
Publié: (2026) -
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
par: Tailleur, Modan, et autres
Publié: (2024) -
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
par: Li, Yuanchao, et autres
Publié: (2024) -
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025) -
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)