Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Chung-Wen, Chen, Berlin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimizing Speech Multi-View Feature Fusion through Conditional Computation
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
par: Yang, Cheng-Yeh, et autres
Publié: (2026)
par: Yang, Cheng-Yeh, et autres
Publié: (2026)
SimClass: A Classroom Speech Dataset Generated via Game Engine Simulation For Automatic Speech Recognition Research
par: Attia, Ahmed Adel, et autres
Publié: (2025)
par: Attia, Ahmed Adel, et autres
Publié: (2025)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
par: Chao, Fu-An, et autres
Publié: (2025)
par: Chao, Fu-An, et autres
Publié: (2025)
Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages
par: Pillai, Leena G, et autres
Publié: (2024)
par: Pillai, Leena G, et autres
Publié: (2024)
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
par: Wang, Chien-Chun, et autres
Publié: (2024)
par: Wang, Chien-Chun, et autres
Publié: (2024)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
par: Yang, Tzu-Ting, et autres
Publié: (2024)
par: Yang, Tzu-Ting, et autres
Publié: (2024)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
par: Wang, Chien-Chun, et autres
Publié: (2024)
par: Wang, Chien-Chun, et autres
Publié: (2024)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
par: Lau, Hok-Shing, et autres
Publié: (2024)
par: Lau, Hok-Shing, et autres
Publié: (2024)
Swin-BERT: A Feature Fusion System designed for Speech-based Alzheimer's Dementia Detection
par: Pan, Yilin, et autres
Publié: (2024)
par: Pan, Yilin, et autres
Publié: (2024)
An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition
par: Wang, Yi-Cheng, et autres
Publié: (2024)
par: Wang, Yi-Cheng, et autres
Publié: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
par: Peng, An-Ci, et autres
Publié: (2026)
par: Peng, An-Ci, et autres
Publié: (2026)
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
par: Wang, Chung-Chun, et autres
Publié: (2025)
par: Wang, Chung-Chun, et autres
Publié: (2025)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)
par: Choi, Yerin, et autres
Publié: (2024)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
par: Attia, Ahmed Adel, et autres
Publié: (2025)
par: Attia, Ahmed Adel, et autres
Publié: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
par: Wen, Bin, et autres
Publié: (2025)
par: Wen, Bin, et autres
Publié: (2025)
Real-Time Speech Enhancement via a Hybrid ViT: A Dual-Input Acoustic-Image Feature Fusion
par: Bahmei, Behnaz, et autres
Publié: (2025)
par: Bahmei, Behnaz, et autres
Publié: (2025)
Benchmarking Automatic Speech Recognition for Indian Languages in Agricultural Contexts
par: S, Chandrashekar M, et autres
Publié: (2026)
par: S, Chandrashekar M, et autres
Publié: (2026)
An Effective Automated Speaking Assessment Approach to Mitigating Data Scarcity and Imbalanced Distribution
par: Lo, Tien-Hong, et autres
Publié: (2024)
par: Lo, Tien-Hong, et autres
Publié: (2024)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
par: Wang, Siyin, et autres
Publié: (2025)
par: Wang, Siyin, et autres
Publié: (2025)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
par: Ahn, Hyebin, et autres
Publié: (2025)
par: Ahn, Hyebin, et autres
Publié: (2025)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
par: Zhong, Tao, et autres
Publié: (2025)
par: Zhong, Tao, et autres
Publié: (2025)
Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring
par: Sudarshan, Ankitha, et autres
Publié: (2023)
par: Sudarshan, Ankitha, et autres
Publié: (2023)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation
par: Zhao, Qiuming, et autres
Publié: (2025)
par: Zhao, Qiuming, et autres
Publié: (2025)
Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
par: Azad, Asif, et autres
Publié: (2026)
par: Azad, Asif, et autres
Publié: (2026)
Breaking Through the Spike: Spike Window Decoding for Accelerated and Precise Automatic Speech Recognition
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
par: Yao, Wenhan, et autres
Publié: (2025)
par: Yao, Wenhan, et autres
Publié: (2025)
Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment
par: Parikh, Aditya Kamlesh, et autres
Publié: (2026)
par: Parikh, Aditya Kamlesh, et autres
Publié: (2026)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
par: Dai, Yusheng, et autres
Publié: (2023)
par: Dai, Yusheng, et autres
Publié: (2023)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Indonesian-English Code-Switching Speech Synthesizer Utilizing Multilingual STEN-TTS and Bert LID
par: Handoyo, Ahmad Alfani, et autres
Publié: (2024)
par: Handoyo, Ahmad Alfani, et autres
Publié: (2024)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge
par: Borodin, Kirill, et autres
Publié: (2024)
par: Borodin, Kirill, et autres
Publié: (2024)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
par: Luo, Jiachen, et autres
Publié: (2025)
par: Luo, Jiachen, et autres
Publié: (2025)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
par: Wu, Yihan, et autres
Publié: (2024)
par: Wu, Yihan, et autres
Publié: (2024)
Regularizing Learnable Feature Extraction for Automatic Speech Recognition
par: Vieting, Peter, et autres
Publié: (2025)
par: Vieting, Peter, et autres
Publié: (2025)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Documents similaires
-
Optimizing Speech Multi-View Feature Fusion through Conditional Computation
par: Shan, Weiqiao, et autres
Publié: (2025) -
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
par: Yang, Cheng-Yeh, et autres
Publié: (2026) -
SimClass: A Classroom Speech Dataset Generated via Game Engine Simulation For Automatic Speech Recognition Research
par: Attia, Ahmed Adel, et autres
Publié: (2025) -
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
par: Chao, Fu-An, et autres
Publié: (2025) -
Multistage Fine-tuning Strategies for Automatic Speech Recognition in Low-resource Languages
par: Pillai, Leena G, et autres
Publié: (2024)