AttentiveMOS: A Lightweight Attention-Only Model for Speech Quality Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kibria, Imran E, Williamson, Donald S. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Pre-training Framework that Encodes Noise Information for Speech Quality Assessment
par: Sultana, Subrina, et autres
Publié: (2024)
par: Sultana, Subrina, et autres
Publié: (2024)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
par: Ren, Wenze, et autres
Publié: (2025)
par: Ren, Wenze, et autres
Publié: (2025)
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
par: Ren, Wenze, et autres
Publié: (2026)
par: Ren, Wenze, et autres
Publié: (2026)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
CORN: Co-Trained Full- And No-Reference Speech Quality Assessment
par: Manocha, Pranay, et autres
Publié: (2023)
par: Manocha, Pranay, et autres
Publié: (2023)
Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid Attention
par: Salaj, Ina, et autres
Publié: (2025)
par: Salaj, Ina, et autres
Publié: (2025)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
par: Yan, Haoyin, et autres
Publié: (2025)
par: Yan, Haoyin, et autres
Publié: (2025)
JSQA: Speech Quality Assessment with Perceptually-Inspired Contrastive Pretraining Based on JND Audio Pairs
par: Fan, Junyi, et autres
Publié: (2025)
par: Fan, Junyi, et autres
Publié: (2025)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
SA-SSL-MOS: Self-supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment
par: Cao, Fengyuan, et autres
Publié: (2026)
par: Cao, Fengyuan, et autres
Publié: (2026)
Quality Assessment of Noisy and Enhanced Speech with Limited Data: UWB-NTIS System for VoiceMOS 2024
par: Kunešová, Marie, et autres
Publié: (2025)
par: Kunešová, Marie, et autres
Publié: (2025)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
par: Huang, Wen-Chin, et autres
Publié: (2026)
par: Huang, Wen-Chin, et autres
Publié: (2026)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
par: Ojha, Shuubham, et autres
Publié: (2025)
par: Ojha, Shuubham, et autres
Publié: (2025)
TASU: Text-Only Alignment for Speech Understanding
par: Peng, Jing, et autres
Publié: (2025)
par: Peng, Jing, et autres
Publié: (2025)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
par: Lian, Zhicheng, et autres
Publié: (2025)
par: Lian, Zhicheng, et autres
Publié: (2025)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
par: Shi, Yu-Fei, et autres
Publié: (2024)
par: Shi, Yu-Fei, et autres
Publié: (2024)
Towards Frame-level Quality Predictions of Synthetic Speech
par: Kuhlmann, Michael, et autres
Publié: (2025)
par: Kuhlmann, Michael, et autres
Publié: (2025)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
par: Masuyama, Yoshiki, et autres
Publié: (2024)
par: Masuyama, Yoshiki, et autres
Publié: (2024)
Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts
par: Kuhlmann, Michael, et autres
Publié: (2026)
par: Kuhlmann, Michael, et autres
Publié: (2026)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
par: Cao, Yifei, et autres
Publié: (2025)
par: Cao, Yifei, et autres
Publié: (2025)
Investigating the Reasonable Effectiveness of Speaker Pre-Trained Models and their Synergistic Power for SingMOS Prediction
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
par: Phukan, Orchid Chetia, et autres
Publié: (2025)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
TripleC Learning and Lightweight Speech Enhancement for Multi-Condition Target Speech Extraction
par: Huang, Ziling
Publié: (2025)
par: Huang, Ziling
Publié: (2025)
From the perspective of perceptual speech quality: The robustness of frequency bands to noise
par: Fan, Junyi, et autres
Publié: (2025)
par: Fan, Junyi, et autres
Publié: (2025)
The AudioMOS Challenge 2025
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
The T05 System for The VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech
par: Baba, Kaito, et autres
Publié: (2024)
par: Baba, Kaito, et autres
Publié: (2024)
DroFiT: A Lightweight Band-fused Frequency Attention Toward Real-time UAV Speech Enhancement
par: Lee, Jeongmin, et autres
Publié: (2025)
par: Lee, Jeongmin, et autres
Publié: (2025)
VoCodec: An Efficient Lightweight Low-Bitrate Speech Codec
par: Yang, Leyan, et autres
Publié: (2026)
par: Yang, Leyan, et autres
Publié: (2026)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
par: Sang, Wendi, et autres
Publié: (2025)
par: Sang, Wendi, et autres
Publié: (2025)
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
par: Wan, Genshun, et autres
Publié: (2026)
par: Wan, Genshun, et autres
Publié: (2026)
PLDNet: PLD-Guided Lightweight Deep Network Boosted by Efficient Attention for Handheld Dual-Microphone Speech Enhancement
par: Zhou, Nan, et autres
Publié: (2024)
par: Zhou, Nan, et autres
Publié: (2024)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
par: Chen, Peikun, et autres
Publié: (2024)
par: Chen, Peikun, et autres
Publié: (2024)
Using RLHF to align speech enhancement approaches to mean-opinion quality scores
par: Kumar, Anurag, et autres
Publié: (2024)
par: Kumar, Anurag, et autres
Publié: (2024)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
par: Xue, Ke, et autres
Publié: (2026)
par: Xue, Ke, et autres
Publié: (2026)
AMDM-SE: Attention-based Multichannel Diffusion Model for Speech Enhancement
par: Opochinsky, Renana, et autres
Publié: (2026)
par: Opochinsky, Renana, et autres
Publié: (2026)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
par: Liu, Wenrui, et autres
Publié: (2025)
par: Liu, Wenrui, et autres
Publié: (2025)
Room Impulse Response Prediction with Neural Networks: From Energy Decay Curves to Perceptual Validation
par: Muhammad, Imran, et autres
Publié: (2025)
par: Muhammad, Imran, et autres
Publié: (2025)
Deep Learning-Based Prediction of Energy Decay Curves from Room Geometry and Material Properties
par: Muhammad, Imran, et autres
Publié: (2025)
par: Muhammad, Imran, et autres
Publié: (2025)
Documents similaires
-
A Pre-training Framework that Encodes Noise Information for Speech Quality Assessment
par: Sultana, Subrina, et autres
Publié: (2024) -
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
par: Huang, Wen-Chin, et autres
Publié: (2024) -
HighRateMOS: Sampling-Rate Aware Modeling for Speech Quality Assessment
par: Ren, Wenze, et autres
Publié: (2025) -
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment
par: Ren, Wenze, et autres
Publié: (2026) -
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
par: Huang, Wen-Chin, et autres
Publié: (2024)