Optimal Transport Audio Distance with Learned Riemannian Ground Metrics
Fuente:
arXiv
Salvato in:
| Autore principale: | Jeong, Wonwoo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
di: Jeong, Wonwoo
Pubblicazione: (2026)
di: Jeong, Wonwoo
Pubblicazione: (2026)
Angular Distance Distribution Loss for Audio Classification
di: Almudévar, Antonio, et al.
Pubblicazione: (2024)
di: Almudévar, Antonio, et al.
Pubblicazione: (2024)
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
di: Tailleur, Modan, et al.
Pubblicazione: (2024)
di: Tailleur, Modan, et al.
Pubblicazione: (2024)
Towards Weakly Supervised Text-to-Audio Grounding
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
Speaker Distance Estimation in Enclosures from Single-Channel Audio
di: Neri, Michael, et al.
Pubblicazione: (2024)
di: Neri, Michael, et al.
Pubblicazione: (2024)
Measuring Audio Prompt Adherence with Distribution-based Embedding Distances
di: Grachten, Maarten
Pubblicazione: (2024)
di: Grachten, Maarten
Pubblicazione: (2024)
The Extended SONICOM HRTF Dataset and Spatial Audio Metrics Toolbox
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
di: Poole, Katarina C., et al.
Pubblicazione: (2025)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
BINAQUAL: A Full-Reference Objective Localization Similarity Metric for Binaural Audio
di: Panah, Davoud Shariat, et al.
Pubblicazione: (2025)
di: Panah, Davoud Shariat, et al.
Pubblicazione: (2025)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
di: Jeong, Jihoon, et al.
Pubblicazione: (2026)
Compositional Audio Representation Learning
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
di: Sridhar, Sripathi, et al.
Pubblicazione: (2024)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
Can Audio Reveal Music Performance Difficulty? Insights from the Piano Syllabus Dataset
di: Ramoneda, Pedro, et al.
Pubblicazione: (2024)
di: Ramoneda, Pedro, et al.
Pubblicazione: (2024)
Channel Adaptation for Speaker Verification Using Optimal Transport with Pseudo Label
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
Deep Learning for Personalized Binaural Audio Reproduction
di: Lu, Xikun, et al.
Pubblicazione: (2025)
di: Lu, Xikun, et al.
Pubblicazione: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Masked Audio Modeling with CLAP and Multi-Objective Learning
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
Continuous Learning of Transformer-based Audio Deepfake Detection
di: Le, Tuan Duy Nguyen, et al.
Pubblicazione: (2024)
di: Le, Tuan Duy Nguyen, et al.
Pubblicazione: (2024)
Data-Balanced Curriculum Learning for Audio Question Answering
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
Class-Incremental Learning for Multi-Label Audio Classification
di: Mulimani, Manjunath, et al.
Pubblicazione: (2024)
di: Mulimani, Manjunath, et al.
Pubblicazione: (2024)
Advancing Continual Learning for Robust Deepfake Audio Classification
di: Dong, Feiyi, et al.
Pubblicazione: (2024)
di: Dong, Feiyi, et al.
Pubblicazione: (2024)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Disentangling Speaker Traits for Deepfake Source Verification via Chebyshev Polynomial and Riemannian Metric Learning
di: Xuan, Xi, et al.
Pubblicazione: (2026)
di: Xuan, Xi, et al.
Pubblicazione: (2026)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Unlocking Large Audio-Language Models for Interactive Language Learning
di: Liu, Hongfu, et al.
Pubblicazione: (2026)
di: Liu, Hongfu, et al.
Pubblicazione: (2026)
Generalized Fake Audio Detection via Deep Stable Learning
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
di: Wang, Zhiyong, et al.
Pubblicazione: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
di: Selvaraj, Nithish Muthuchamy, et al.
Pubblicazione: (2023)
SRC-gAudio: Sampling-Rate-Controlled Audio Generation
di: Li, Chenxing, et al.
Pubblicazione: (2024)
di: Li, Chenxing, et al.
Pubblicazione: (2024)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
ALDAS: Audio-Linguistic Data Augmentation for Spoofed Audio Detection
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
di: Khanjani, Zahra, et al.
Pubblicazione: (2024)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
S-KEY: Self-supervised Learning of Major and Minor Keys from Audio
di: Kong, Yuexuan, et al.
Pubblicazione: (2025)
di: Kong, Yuexuan, et al.
Pubblicazione: (2025)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
di: Wilkins, Julia, et al.
Pubblicazione: (2024)
di: Wilkins, Julia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
di: Jeong, Wonwoo
Pubblicazione: (2026) -
Angular Distance Distribution Loss for Audio Classification
di: Almudévar, Antonio, et al.
Pubblicazione: (2024) -
Correlation of Fréchet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependant
di: Tailleur, Modan, et al.
Pubblicazione: (2024) -
Towards Weakly Supervised Text-to-Audio Grounding
di: Xu, Xuenan, et al.
Pubblicazione: (2024) -
Speaker Distance Estimation in Enclosures from Single-Channel Audio
di: Neri, Michael, et al.
Pubblicazione: (2024)