AttentiveMOS: A Lightweight Attention-Only Model for Speech Quality Prediction
Fuente:
arXiv
Salvato in:
| Autori principali: | Kibria, Imran E, Williamson, Donald S. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Pre-training Framework that Encodes Noise Information for Speech Quality Assessment
di: Sultana, Subrina, et al.
Pubblicazione: (2024)
di: Sultana, Subrina, et al.
Pubblicazione: (2024)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2025)
di: Ren, Wenze, et al.
Pubblicazione: (2025)
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2026)
di: Ren, Wenze, et al.
Pubblicazione: (2026)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
CORN: Co-Trained Full- And No-Reference Speech Quality Assessment
di: Manocha, Pranay, et al.
Pubblicazione: (2023)
di: Manocha, Pranay, et al.
Pubblicazione: (2023)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
di: Salaj, Ina, et al.
Pubblicazione: (2025)
di: Salaj, Ina, et al.
Pubblicazione: (2025)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
di: Yan, Haoyin, et al.
Pubblicazione: (2025)
di: Yan, Haoyin, et al.
Pubblicazione: (2025)
JSQA: Speech Quality Assessment with Perceptually-Inspired Contrastive Pretraining Based on JND Audio Pairs
di: Fan, Junyi, et al.
Pubblicazione: (2025)
di: Fan, Junyi, et al.
Pubblicazione: (2025)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
di: Wang, Hankun, et al.
Pubblicazione: (2024)
di: Wang, Hankun, et al.
Pubblicazione: (2024)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
SA-SSL-MOS: Self-supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment
di: Cao, Fengyuan, et al.
Pubblicazione: (2026)
di: Cao, Fengyuan, et al.
Pubblicazione: (2026)
Quality Assessment of Noisy and Enhanced Speech with Limited Data: UWB-NTIS System for VoiceMOS 2024
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2026)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
di: Ojha, Shuubham, et al.
Pubblicazione: (2025)
di: Ojha, Shuubham, et al.
Pubblicazione: (2025)
TASU: Text-Only Alignment for Speech Understanding
di: Peng, Jing, et al.
Pubblicazione: (2025)
di: Peng, Jing, et al.
Pubblicazione: (2025)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
di: Lian, Zhicheng, et al.
Pubblicazione: (2025)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
Towards Frame-level Quality Predictions of Synthetic Speech
di: Kuhlmann, Michael, et al.
Pubblicazione: (2025)
di: Kuhlmann, Michael, et al.
Pubblicazione: (2025)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2024)
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2024)
Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts
di: Kuhlmann, Michael, et al.
Pubblicazione: (2026)
di: Kuhlmann, Michael, et al.
Pubblicazione: (2026)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
Investigating the Reasonable Effectiveness of Speaker Pre-Trained Models and their Synergistic Power for SingMOS Prediction
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
di: Guo, Yinlin, et al.
Pubblicazione: (2024)
di: Guo, Yinlin, et al.
Pubblicazione: (2024)
TripleC Learning and Lightweight Speech Enhancement for Multi-Condition Target Speech Extraction
di: Huang, Ziling
Pubblicazione: (2025)
di: Huang, Ziling
Pubblicazione: (2025)
From the perspective of perceptual speech quality: The robustness of frequency bands to noise
di: Fan, Junyi, et al.
Pubblicazione: (2025)
di: Fan, Junyi, et al.
Pubblicazione: (2025)
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
The T05 System for The VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech
di: Baba, Kaito, et al.
Pubblicazione: (2024)
di: Baba, Kaito, et al.
Pubblicazione: (2024)
DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
di: Lee, Jeongmin, et al.
Pubblicazione: (2025)
di: Lee, Jeongmin, et al.
Pubblicazione: (2025)
VoCodec: An Efficient Lightweight Low-Bitrate Speech Codec
di: Yang, Leyan, et al.
Pubblicazione: (2026)
di: Yang, Leyan, et al.
Pubblicazione: (2026)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
di: Sang, Wendi, et al.
Pubblicazione: (2025)
di: Sang, Wendi, et al.
Pubblicazione: (2025)
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
di: Wan, Genshun, et al.
Pubblicazione: (2026)
di: Wan, Genshun, et al.
Pubblicazione: (2026)
PLDNet: PLD-Guided Lightweight Deep Network Boosted by Efficient Attention for Handheld Dual-Microphone Speech Enhancement
di: Zhou, Nan, et al.
Pubblicazione: (2024)
di: Zhou, Nan, et al.
Pubblicazione: (2024)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
di: Chen, Peikun, et al.
Pubblicazione: (2024)
di: Chen, Peikun, et al.
Pubblicazione: (2024)
Using RLHF to align speech enhancement approaches to mean-opinion quality scores
di: Kumar, Anurag, et al.
Pubblicazione: (2024)
di: Kumar, Anurag, et al.
Pubblicazione: (2024)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
di: Xue, Ke, et al.
Pubblicazione: (2026)
di: Xue, Ke, et al.
Pubblicazione: (2026)
AMDM-SE: Attention-based Multichannel Diffusion Model for Speech Enhancement
di: Opochinsky, Renana, et al.
Pubblicazione: (2026)
di: Opochinsky, Renana, et al.
Pubblicazione: (2026)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
Room Impulse Response Prediction with Neural Networks: From Energy Decay Curves to Perceptual Validation
di: Muhammad, Imran, et al.
Pubblicazione: (2025)
di: Muhammad, Imran, et al.
Pubblicazione: (2025)
Deep Learning-Based Prediction of Energy Decay Curves from Room Geometry and Material Properties
di: Muhammad, Imran, et al.
Pubblicazione: (2025)
di: Muhammad, Imran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Pre-training Framework that Encodes Noise Information for Speech Quality Assessment
di: Sultana, Subrina, et al.
Pubblicazione: (2024) -
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024) -
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2025) -
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
di: Ren, Wenze, et al.
Pubblicazione: (2026) -
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)