DRASP: A Dual-Resolution Attentive Statistics Pooling Framework for Automatic MOS Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Cheng-Yeh, Huang, Kuan-Tang, Wang, Chien-Chun, Lee, Hung-Shin, Wang, Hsin-Min, Chen, Berlin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
par: Wang, Chien-Chun, et autres
Publié: (2025)
par: Wang, Chien-Chun, et autres
Publié: (2025)
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
par: Huang, Kuan-Tang, et autres
Publié: (2026)
par: Huang, Kuan-Tang, et autres
Publié: (2026)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
par: Yang, Cheng-Yeh, et autres
Publié: (2026)
par: Yang, Cheng-Yeh, et autres
Publié: (2026)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
par: Wang, Chien-Chun, et autres
Publié: (2026)
par: Wang, Chien-Chun, et autres
Publié: (2026)
Revealing the Role of Audio Channels in ASR Performance Degradation
par: Huang, Kuan-Tang, et autres
Publié: (2025)
par: Huang, Kuan-Tang, et autres
Publié: (2025)
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
par: Wang, Chien-Chun, et autres
Publié: (2024)
par: Wang, Chien-Chun, et autres
Publié: (2024)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
par: Wang, Chien-Chun, et autres
Publié: (2024)
par: Wang, Chien-Chun, et autres
Publié: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
par: Peng, An-Ci, et autres
Publié: (2026)
par: Peng, An-Ci, et autres
Publié: (2026)
SincQDR-VAD: A Noise-Robust Voice Activity Detection Framework Leveraging Learnable Filters and Ranking-Aware Optimization
par: Wang, Chien-Chun, et autres
Publié: (2025)
par: Wang, Chien-Chun, et autres
Publié: (2025)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
par: Sung, Hung-Yang, et autres
Publié: (2025)
par: Sung, Hung-Yang, et autres
Publié: (2025)
ConSep: a Noise- and Reverberation-Robust Speech Separation Framework by Magnitude Conditioning
par: Ho, Kuan-Hsun, et autres
Publié: (2024)
par: Ho, Kuan-Hsun, et autres
Publié: (2024)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
par: Yan, Bi-Cheng, et autres
Publié: (2024)
par: Yan, Bi-Cheng, et autres
Publié: (2024)
What do neural networks listen to? Exploring the crucial bands in Speech Enhancement using Sinc-convolution
par: Ho, Kuan-Hsun, et autres
Publié: (2024)
par: Ho, Kuan-Hsun, et autres
Publié: (2024)
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
par: Wang, Chung-Chun, et autres
Publié: (2025)
par: Wang, Chung-Chun, et autres
Publié: (2025)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
par: Tang, Yuxun, et autres
Publié: (2024)
par: Tang, Yuxun, et autres
Publié: (2024)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
par: Cheng, Yao-Fei, et autres
Publié: (2024)
par: Cheng, Yao-Fei, et autres
Publié: (2024)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
par: Wang, Shih-heng, et autres
Publié: (2024)
par: Wang, Shih-heng, et autres
Publié: (2024)
DistilMOS: Layer-Wise Self-Distillation For Self-Supervised Learning Model-Based MOS Prediction
par: Yang, Jianing, et autres
Publié: (2026)
par: Yang, Jianing, et autres
Publié: (2026)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
par: Lian, Zhicheng, et autres
Publié: (2025)
par: Lian, Zhicheng, et autres
Publié: (2025)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
par: Horiguchi, Shota, et autres
Publié: (2024)
par: Horiguchi, Shota, et autres
Publié: (2024)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
The AudioMOS Challenge 2025
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction
par: Agrawal, Saurabh, et autres
Publié: (2025)
par: Agrawal, Saurabh, et autres
Publié: (2025)
ASTAR-NTU solution to AudioMOS Challenge 2025 Track1
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2025)
Query-by-Example Keyword Spotting Using Spectral-Temporal Graph Attentive Pooling and Multi-Task Learning
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
par: Yang, Tzu-Ting, et autres
Publié: (2024)
par: Yang, Tzu-Ting, et autres
Publié: (2024)
CA-MHFA: A Context-Aware Multi-Head Factorized Attentive Pooling for SSL-Based Speaker Verification
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
Speech Emotion Recognition Leveraging OpenAI's Whisper Representations and Attentive Pooling Methods
par: Shendabadi, Ali, et autres
Publié: (2026)
par: Shendabadi, Ali, et autres
Publié: (2026)
Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems
par: Lin, Jhen-Ke, et autres
Publié: (2025)
par: Lin, Jhen-Ke, et autres
Publié: (2025)
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
par: Lu, Hao-Chien, et autres
Publié: (2025)
par: Lu, Hao-Chien, et autres
Publié: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
par: Chen, Wei-Chih, et autres
Publié: (2026)
par: Chen, Wei-Chih, et autres
Publié: (2026)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
par: Huang, Wen-Chin, et autres
Publié: (2026)
par: Huang, Wen-Chin, et autres
Publié: (2026)
A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data
par: Chou, Cheng-Kang, et autres
Publié: (2025)
par: Chou, Cheng-Kang, et autres
Publié: (2025)
UrgentMOS: Unified Multi-Metric and Preference Learning for Robust Speech Quality Assessment
par: Wang, Wei, et autres
Publié: (2026)
par: Wang, Wei, et autres
Publié: (2026)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
Documents similaires
-
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
par: Wang, Chien-Chun, et autres
Publié: (2025) -
Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations
par: Huang, Kuan-Tang, et autres
Publié: (2026) -
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
par: Yang, Cheng-Yeh, et autres
Publié: (2026) -
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
par: Wang, Chien-Chun, et autres
Publié: (2026) -
Revealing the Role of Audio Channels in ASR Performance Degradation
par: Huang, Kuan-Tang, et autres
Publié: (2025)