QASTAnet: A DNN-based Quality Metric for Spatial Audio
Fuente:
arXiv
Guardado en:
| Autores principales: | Llave, Adrien, Granier, Emma, Pallone, Grégory |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
por: Gupta, Kishan, et al.
Publicado: (2022)
por: Gupta, Kishan, et al.
Publicado: (2022)
Learning Spatially-Aware Language and Audio Embeddings
por: Devnani, Bhavika, et al.
Publicado: (2024)
por: Devnani, Bhavika, et al.
Publicado: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
HAAQI-Net: A Non-intrusive Neural Music Audio Quality Assessment Model for Hearing Aids
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2024)
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2024)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
A2SB: Audio-to-Audio Schrodinger Bridges
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Investigating Faithfulness in Large Audio Language Models
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
Vibravox: A Dataset of French Speech Captured with Body-conduction Audio Sensors
por: Hauret, Julien, et al.
Publicado: (2024)
por: Hauret, Julien, et al.
Publicado: (2024)
Audio-based automatic mating success prediction of giant pandas
por: Yan, WeiRan, et al.
Publicado: (2019)
por: Yan, WeiRan, et al.
Publicado: (2019)
Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning
por: Luong, Manh, et al.
Publicado: (2025)
por: Luong, Manh, et al.
Publicado: (2025)
Multilingual Dataset Integration Strategies for Robust Audio Deepfake Detection: A SAFE Challenge System
por: Ali, Hashim, et al.
Publicado: (2025)
por: Ali, Hashim, et al.
Publicado: (2025)
Exploring Meta Information for Audio-based Zero-shot Bird Classification
por: Gebhard, Alexander, et al.
Publicado: (2023)
por: Gebhard, Alexander, et al.
Publicado: (2023)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
por: Primus, Paul, et al.
Publicado: (2025)
por: Primus, Paul, et al.
Publicado: (2025)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
por: Dutta, Soumya, et al.
Publicado: (2024)
por: Dutta, Soumya, et al.
Publicado: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model
por: Shams, Siavash, et al.
Publicado: (2024)
por: Shams, Siavash, et al.
Publicado: (2024)
Similarity Choice and Negative Scaling in Supervised Contrastive Learning for Deepfake Audio Detection
por: Sudan, Jaskirat, et al.
Publicado: (2026)
por: Sudan, Jaskirat, et al.
Publicado: (2026)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
por: Collins, Nick
Publicado: (2024)
por: Collins, Nick
Publicado: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
Diffusion-Based Unsupervised Audio-Visual Speech Separation in Noisy Environments with Noise Prior
por: Yemini, Yochai, et al.
Publicado: (2025)
por: Yemini, Yochai, et al.
Publicado: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)
por: Takeuchi, Daiki, et al.
Publicado: (2025)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
por: Fedorishin, Dennis, et al.
Publicado: (2024)
por: Fedorishin, Dennis, et al.
Publicado: (2024)
Audio Geolocation: A Natural Sounds Benchmark
por: Chasmai, Mustafa, et al.
Publicado: (2025)
por: Chasmai, Mustafa, et al.
Publicado: (2025)
Prompt Amplification and Zero-Shot Late Fusion in Audio-Language Models for Speech Emotion Recognition
por: Kataria, Saurabh, et al.
Publicado: (2026)
por: Kataria, Saurabh, et al.
Publicado: (2026)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
por: Chung, Yoonjin, et al.
Publicado: (2025)
por: Chung, Yoonjin, et al.
Publicado: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
por: Tabassum, Afrina, et al.
Publicado: (2024)
por: Tabassum, Afrina, et al.
Publicado: (2024)
Multi-bit Audio Watermarking
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
Unsupervised Composable Representations for Audio
por: Bindi, Giovanni, et al.
Publicado: (2024)
por: Bindi, Giovanni, et al.
Publicado: (2024)
Diffusion Models for Audio Restoration
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
Instabilities in Convnets for Raw Audio
por: Haider, Daniel, et al.
Publicado: (2023)
por: Haider, Daniel, et al.
Publicado: (2023)
Automatic Contextual Audio Denoising
por: Luong, Diep, et al.
Publicado: (2026)
por: Luong, Diep, et al.
Publicado: (2026)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
por: Gupta, Isha, et al.
Publicado: (2025)
por: Gupta, Isha, et al.
Publicado: (2025)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
por: Sinha, Anshuman, et al.
Publicado: (2024)
por: Sinha, Anshuman, et al.
Publicado: (2024)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
por: Feng, Tiantian, et al.
Publicado: (2024)
por: Feng, Tiantian, et al.
Publicado: (2024)
A Novel Stochastic Transformer-based Approach for Post-Traumatic Stress Disorder Detection using Audio Recording of Clinical Interviews
por: Dia, Mamadou, et al.
Publicado: (2024)
por: Dia, Mamadou, et al.
Publicado: (2024)
Is Audio Spoof Detection Robust to Laundering Attacks?
por: Ali, Hashim, et al.
Publicado: (2024)
por: Ali, Hashim, et al.
Publicado: (2024)
ImmerseDiffusion: A Generative Spatial Audio Latent Diffusion Model
por: Heydari, Mojtaba, et al.
Publicado: (2024)
por: Heydari, Mojtaba, et al.
Publicado: (2024)
JSQA: Speech Quality Assessment with Perceptually-Inspired Contrastive Pretraining Based on JND Audio Pairs
por: Fan, Junyi, et al.
Publicado: (2025)
por: Fan, Junyi, et al.
Publicado: (2025)
Aligning Audio Captions with Human Preferences
por: Hegde, Kartik, et al.
Publicado: (2025)
por: Hegde, Kartik, et al.
Publicado: (2025)
Audio Decoding by Inverse Problem Solving
por: T., Pedro J. Villasana, et al.
Publicado: (2024)
por: T., Pedro J. Villasana, et al.
Publicado: (2024)
Ejemplares similares
-
A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain
por: Gupta, Kishan, et al.
Publicado: (2022) -
Learning Spatially-Aware Language and Audio Embeddings
por: Devnani, Bhavika, et al.
Publicado: (2024) -
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024) -
HAAQI-Net: A Non-intrusive Neural Music Audio Quality Assessment Model for Hearing Aids
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2024) -
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)