Calibration-Reasoning Framework for Descriptive Speech Quality Assessment
Fuente:
arXiv
Guardado en:
| Autores principales: | Kostenok, Elizaveta, Salzmann, Mathieu, Cernak, Milos |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
StreamMark: A Deep Learning-Based Semi-Fragile Audio Watermarking for Proactive Deepfake Detection
por: Liu, Zhentao, et al.
Publicado: (2026)
por: Liu, Zhentao, et al.
Publicado: (2026)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
Low-latency Assistive Audio Enhancement for Neurodivergent People
por: Popescu, Alexander, et al.
Publicado: (2025)
por: Popescu, Alexander, et al.
Publicado: (2025)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
por: Lu, Ke-Han, et al.
Publicado: (2024)
por: Lu, Ke-Han, et al.
Publicado: (2024)
OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
Exploring Pathological Speech Quality Assessment with ASR-Powered Wav2Vec2 in Data-Scarce Context
por: Nguyen, Tuan, et al.
Publicado: (2024)
por: Nguyen, Tuan, et al.
Publicado: (2024)
DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration
por: Serbest, Sanberk, et al.
Publicado: (2025)
por: Serbest, Sanberk, et al.
Publicado: (2025)
P2VA: Converting Persona Descriptions into Voice Attributes for Fair and Controllable Text-to-Speech
por: Lee, Yejin, et al.
Publicado: (2025)
por: Lee, Yejin, et al.
Publicado: (2025)
Non-native Children's Automatic Speech Assessment Challenge (NOCASA)
por: Getman, Yaroslav, et al.
Publicado: (2025)
por: Getman, Yaroslav, et al.
Publicado: (2025)
Which Evaluation for Which Model? A Taxonomy for Speech Model Assessment
por: de Seyssel, Maureen, et al.
Publicado: (2025)
por: de Seyssel, Maureen, et al.
Publicado: (2025)
STAB: Speech Tokenizer Assessment Benchmark
por: Vashishth, Shikhar, et al.
Publicado: (2024)
por: Vashishth, Shikhar, et al.
Publicado: (2024)
Speech Corpus for Korean Children with Autism Spectrum Disorder: Towards Automatic Assessment Systems
por: Lee, Seonwoo, et al.
Publicado: (2024)
por: Lee, Seonwoo, et al.
Publicado: (2024)
Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style
por: Kang, Wonjune, et al.
Publicado: (2025)
por: Kang, Wonjune, et al.
Publicado: (2025)
TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis
por: Wang, Xi, et al.
Publicado: (2026)
por: Wang, Xi, et al.
Publicado: (2026)
Multi-Level Embedding Conformer Framework for Bengali Automatic Speech Recognition
por: Sakib, Md. Nazmus, et al.
Publicado: (2025)
por: Sakib, Md. Nazmus, et al.
Publicado: (2025)
MahaTTS: A Unified Framework for Multilingual Text-to-Speech Synthesis
por: Singh, Jaskaran, et al.
Publicado: (2025)
por: Singh, Jaskaran, et al.
Publicado: (2025)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
por: Wang, Jianjin, et al.
Publicado: (2025)
por: Wang, Jianjin, et al.
Publicado: (2025)
Building Tailored Speech Recognizers for Japanese Speaking Assessment
por: Kubo, Yotaro, et al.
Publicado: (2025)
por: Kubo, Yotaro, et al.
Publicado: (2025)
Zimtohrli: An Efficient Psychoacoustic Audio Similarity Metric
por: Alakuijala, Jyrki, et al.
Publicado: (2025)
por: Alakuijala, Jyrki, et al.
Publicado: (2025)
What Are They Doing? Joint Audio-Speech Co-Reasoning
por: Wang, Yingzhi, et al.
Publicado: (2024)
por: Wang, Yingzhi, et al.
Publicado: (2024)
Streaming Speech-to-Confusion Network Speech Recognition
por: Filimonov, Denis, et al.
Publicado: (2023)
por: Filimonov, Denis, et al.
Publicado: (2023)
MAD Speech: Measures of Acoustic Diversity of Speech
por: Futeral, Matthieu, et al.
Publicado: (2024)
por: Futeral, Matthieu, et al.
Publicado: (2024)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
por: Li, Zhu, et al.
Publicado: (2025)
por: Li, Zhu, et al.
Publicado: (2025)
Textless Speech-to-Speech Translation With Limited Parallel Data
por: Diwan, Anuj, et al.
Publicado: (2023)
por: Diwan, Anuj, et al.
Publicado: (2023)
Closing the Modality Reasoning Gap for Speech Large Language Models
por: Wang, Chaoren, et al.
Publicado: (2026)
por: Wang, Chaoren, et al.
Publicado: (2026)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
por: Farhadipour, Aref, et al.
Publicado: (2023)
por: Farhadipour, Aref, et al.
Publicado: (2023)
Speech Foundation Models and Crowdsourcing for Efficient, High-Quality Data Collection
por: Lee, Beomseok, et al.
Publicado: (2024)
por: Lee, Beomseok, et al.
Publicado: (2024)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
por: Wang, Siyin, et al.
Publicado: (2024)
por: Wang, Siyin, et al.
Publicado: (2024)
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage
por: Wang, Kyra, et al.
Publicado: (2024)
por: Wang, Kyra, et al.
Publicado: (2024)
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
por: Žavoronkov, Aleksei, et al.
Publicado: (2025)
por: Žavoronkov, Aleksei, et al.
Publicado: (2025)
Applications of Artificial Intelligence for Cross-language Intelligibility Assessment of Dysarthric Speech
por: Yeo, Eunjung, et al.
Publicado: (2025)
por: Yeo, Eunjung, et al.
Publicado: (2025)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
por: Zhang, Wenyu, et al.
Publicado: (2025)
por: Zhang, Wenyu, et al.
Publicado: (2025)
TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems
por: Minixhofer, Christoph, et al.
Publicado: (2025)
por: Minixhofer, Christoph, et al.
Publicado: (2025)
NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference
por: Casanova, Edresson, et al.
Publicado: (2025)
por: Casanova, Edresson, et al.
Publicado: (2025)
Differentiable Time-Varying IIR Filtering for Real-Time Speech Denoising
por: Rota, Riccardo, et al.
Publicado: (2026)
por: Rota, Riccardo, et al.
Publicado: (2026)
iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis
por: Kakouros, Sofoklis, et al.
Publicado: (2026)
por: Kakouros, Sofoklis, et al.
Publicado: (2026)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
por: Azad, Asif, et al.
Publicado: (2026)
por: Azad, Asif, et al.
Publicado: (2026)
Ejemplares similares
-
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024) -
StreamMark: A Deep Learning-Based Semi-Fragile Audio Watermarking for Proactive Deepfake Detection
por: Liu, Zhentao, et al.
Publicado: (2026) -
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
por: Wang, Siyin, et al.
Publicado: (2025) -
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
por: Coldenhoff, Jozef, et al.
Publicado: (2024) -
Low-latency Assistive Audio Enhancement for Neurodivergent People
por: Popescu, Alexander, et al.
Publicado: (2025)