SA-SSL-MOS: Self-supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment
Fuente:
arXiv
Salvato in:
| Autori principali: | Cao, Fengyuan, Liang, Xinyu, Cumlin, Fredrik, Ungureanu, Victor, Reddy, Chandan K. A., Schuldt, Christian, Chatterjee, Saikat |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Selection of Layers from Self-supervised Learning Models for Predicting Mean-Opinion-Score of Speech
di: Liang, Xinyu, et al.
Pubblicazione: (2025)
di: Liang, Xinyu, et al.
Pubblicazione: (2025)
Multivariate Probabilistic Assessment of Speech Quality
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025)
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025)
Impairments are Clustered in Latents of Deep Neural Network-based Speech Quality Models
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025)
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025)
Leveraging LLMs for Scalable Non-intrusive Speech Quality Assessment
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025)
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025)
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2025)
di: Ren, Wenze, et al.
Pubblicazione: (2025)
Rho-Perfect: Correlation Ceiling For Subjective Evaluation Datasets
di: Cumlin, Fredrik
Pubblicazione: (2026)
di: Cumlin, Fredrik
Pubblicazione: (2026)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
AttentiveMOS: A Lightweight Attention-Only Model for Speech Quality Prediction
di: Kibria, Imran E, et al.
Pubblicazione: (2024)
di: Kibria, Imran E, et al.
Pubblicazione: (2024)
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2026)
di: Ren, Wenze, et al.
Pubblicazione: (2026)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
Quality Assessment of Noisy and Enhanced Speech with Limited Data: UWB-NTIS System for VoiceMOS 2024
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
Investigating the Reasonable Effectiveness of Speaker Pre-Trained Models and their Synergistic Power for SingMOS Prediction
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
SingMOS-Pro: An Comprehensive Benchmark for Singing Quality Assessment
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
di: Tang, Yuxun, et al.
Pubblicazione: (2025)
The T05 System for The VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech
di: Baba, Kaito, et al.
Pubblicazione: (2024)
di: Baba, Kaito, et al.
Pubblicazione: (2024)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer
di: Nishikawa, Go, et al.
Pubblicazione: (2025)
di: Nishikawa, Go, et al.
Pubblicazione: (2025)
Selecting N-lowest scores for training MOS prediction models
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
di: Kondo, Yuto, et al.
Pubblicazione: (2025)
MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
di: Zhou, Wangjin, et al.
Pubblicazione: (2024)
di: Zhou, Wangjin, et al.
Pubblicazione: (2024)
ASTAR-NTU solution to AudioMOS Challenge 2025 Track1
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
di: Emon, Jakaria Islam, et al.
Pubblicazione: (2025)
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations
di: Yang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2025)
Fusion of Modulation Spectrogram and SSL with Multi-head Attention for Fake Speech Detection
di: N, Rishith Sadashiv T, et al.
Pubblicazione: (2025)
di: N, Rishith Sadashiv T, et al.
Pubblicazione: (2025)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
di: Premananth, Gowtham, et al.
Pubblicazione: (2024)
di: Premananth, Gowtham, et al.
Pubblicazione: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
di: Lin, Jingru, et al.
Pubblicazione: (2024)
di: Lin, Jingru, et al.
Pubblicazione: (2024)
Low-Resource Self-Supervised Learning with SSL-Enhanced TTS
di: Hsu, Po-chun, et al.
Pubblicazione: (2023)
di: Hsu, Po-chun, et al.
Pubblicazione: (2023)
Probing Self-supervised Learning Models with Target Speech Extraction
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
MambaRate: Speech Quality Assessment Across Different Sampling Rates
di: Kakoulidis, Panos, et al.
Pubblicazione: (2025)
di: Kakoulidis, Panos, et al.
Pubblicazione: (2025)
Perceptual Ratings Predict Speech Inversion Articulatory Kinematics in Childhood Speech Sound Disorders
di: Benway, Nina R., et al.
Pubblicazione: (2025)
di: Benway, Nina R., et al.
Pubblicazione: (2025)
Lamer-SSL: Layer-aware Mixture of LoRA Experts for Continual Multilingual Expansion of Self-supervised Models without Forgetting
di: Xu, Jing, et al.
Pubblicazione: (2026)
di: Xu, Jing, et al.
Pubblicazione: (2026)
Causal Self-supervised Pretrained Frontend with Predictive Code for Speech Separation
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
di: Wang, Wupeng, et al.
Pubblicazione: (2025)
Augmenting Open-Vocabulary Dysarthric Speech Assessment with Human Perceptual Supervision
di: Jia, Kaimeng, et al.
Pubblicazione: (2025)
di: Jia, Kaimeng, et al.
Pubblicazione: (2025)
Non-Causal to Causal SSL-Supported Transfer Learning: Towards a High-Performance Low-Latency Speech Vocoder
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Selection of Layers from Self-supervised Learning Models for Predicting Mean-Opinion-Score of Speech
di: Liang, Xinyu, et al.
Pubblicazione: (2025) -
Multivariate Probabilistic Assessment of Speech Quality
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025) -
Impairments are Clustered in Latents of Deep Neural Network-based Speech Quality Models
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025) -
Leveraging LLMs for Scalable Non-intrusive Speech Quality Assessment
di: Cumlin, Fredrik, et al.
Pubblicazione: (2025) -
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2025)