MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Wen-Chin, Cooper, Erica, Toda, Tomoki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
di: Cooper, Erica, et al.
Pubblicazione: (2025)
di: Cooper, Erica, et al.
Pubblicazione: (2025)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
di: Hu, Cheng-Hung, et al.
Pubblicazione: (2025)
di: Hu, Cheng-Hung, et al.
Pubblicazione: (2025)
Advancing Speech Quality Assessment Through Scientific Challenges and Open-source Activities
di: Huang, Wen-Chin
Pubblicazione: (2025)
di: Huang, Wen-Chin
Pubblicazione: (2025)
Serenade: A Singing Style Conversion Framework Based On Audio Infilling
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
di: Imamura, Takehiro, et al.
Pubblicazione: (2025)
di: Imamura, Takehiro, et al.
Pubblicazione: (2025)
Electrolaryngeal Speech Intelligibility Enhancement Through Robust Linguistic Encoders
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2023)
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2023)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
di: Murata, Masato, et al.
Pubblicazione: (2025)
di: Murata, Masato, et al.
Pubblicazione: (2025)
Multi-speaker Text-to-speech Training with Speaker Anonymized Data
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
Quality Assessment of Noisy and Enhanced Speech with Limited Data: UWB-NTIS System for VoiceMOS 2024
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
Investigation of perceptual music similarity focusing on each instrumental part
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
di: Hashizume, Yuka, et al.
Pubblicazione: (2024)
di: Hashizume, Yuka, et al.
Pubblicazione: (2024)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
Serial-OE: Anomalous sound detection based on serial method with outlier exposure capable of using small amounts of anomalous data for training
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
di: Ma, Ding, et al.
Pubblicazione: (2026)
di: Ma, Ding, et al.
Pubblicazione: (2026)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
Improved Architecture for High-resolution Piano Transcription to Efficiently Capture Acoustic Characteristics of Music Signals
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
di: Koriyama, Tomoki
Pubblicazione: (2025)
di: Koriyama, Tomoki
Pubblicazione: (2025)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2026)
di: Ren, Wenze, et al.
Pubblicazione: (2026)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2025)
di: Ren, Wenze, et al.
Pubblicazione: (2025)
Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
di: Yoneyama, Reo, et al.
Pubblicazione: (2024)
di: Yoneyama, Reo, et al.
Pubblicazione: (2024)
Learning Separated Representations for Instrument-based Music Similarity
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
di: Ku, Pin-Jui, et al.
Pubblicazione: (2024)
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
di: Ogg, Mattson, et al.
Pubblicazione: (2025)
di: Ogg, Mattson, et al.
Pubblicazione: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
An Attribute Interpolation Method in Speech Synthesis by Model Merging
di: Murata, Masato, et al.
Pubblicazione: (2024)
di: Murata, Masato, et al.
Pubblicazione: (2024)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
SCOREQ: Speech Quality Assessment with Contrastive Regression
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
di: Ragano, Alessandro, et al.
Pubblicazione: (2024)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025) -
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024) -
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026) -
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025) -
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
di: Cooper, Erica, et al.
Pubblicazione: (2025)