Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Farhadipour, Aref, Veisi, Hadi |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2025)
par: Farhadipour, Aref, et autres
Publié: (2025)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025)
par: Hirano, Yuta, et autres
Publié: (2025)
Applications of Artificial Intelligence for Cross-language Intelligibility Assessment of Dysarthric Speech
par: Yeo, Eunjung, et autres
Publié: (2025)
par: Yeo, Eunjung, et autres
Publié: (2025)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
par: Lee, Jeehyun, et autres
Publié: (2024)
par: Lee, Jeehyun, et autres
Publié: (2024)
Investigation of Speaker Representation for Target-Speaker Speech Processing
par: Ashihara, Takanori, et autres
Publié: (2024)
par: Ashihara, Takanori, et autres
Publié: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
Enhancing Kurdish Text-to-Speech with Native Corpus Training: A High-Quality WaveGlow Vocoder Approach
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
par: Wang, Peidong, et autres
Publié: (2024)
par: Wang, Peidong, et autres
Publié: (2024)
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
par: Agro, Maha Tufail, et autres
Publié: (2025)
par: Agro, Maha Tufail, et autres
Publié: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
par: Yeo, Eunjung, et autres
Publié: (2026)
par: Yeo, Eunjung, et autres
Publié: (2026)
End-to-End Transformer-based Automatic Speech Recognition for Northern Kurdish: A Pioneering Approach
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2024)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)
par: Sethiya, Nivedita, et autres
Publié: (2023)
DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
par: Raja, Vishnu, et autres
Publié: (2025)
par: Raja, Vishnu, et autres
Publié: (2025)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
par: Higuchi, Yosuke, et autres
Publié: (2023)
par: Higuchi, Yosuke, et autres
Publié: (2023)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization
par: Wang, Yuejiao, et autres
Publié: (2024)
par: Wang, Yuejiao, et autres
Publié: (2024)
A Few-Shot Approach to Dysarthric Speech Intelligibility Level Classification Using Transformers
par: Chowdary, Paleti Nikhil, et autres
Publié: (2023)
par: Chowdary, Paleti Nikhil, et autres
Publié: (2023)
Comparison of End-to-end Speech Assessment Models for the NOCASA 2025 Challenge
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
par: Žavoronkov, Aleksei, et autres
Publié: (2025)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems
par: Zink, Oswald, et autres
Publié: (2024)
par: Zink, Oswald, et autres
Publié: (2024)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
par: Li, Chin-Jou, et autres
Publié: (2025)
par: Li, Chin-Jou, et autres
Publié: (2025)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
par: Moslem, Yasmin
Publié: (2024)
par: Moslem, Yasmin
Publié: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
Speaker-Aware Simulation Improves Conversational Speech Recognition
par: Gedeon, Máté, et autres
Publié: (2026)
par: Gedeon, Máté, et autres
Publié: (2026)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
par: HU, Shujie, et autres
Publié: (2025)
par: HU, Shujie, et autres
Publié: (2025)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
par: Vendrame, Katia, et autres
Publié: (2025)
par: Vendrame, Katia, et autres
Publié: (2025)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
par: Zhong, Tao, et autres
Publié: (2025)
par: Zhong, Tao, et autres
Publié: (2025)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
Documents similaires
-
State-Space Models in Efficient Whispered and Multi-dialect Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2025) -
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024) -
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025) -
Applications of Artificial Intelligence for Cross-language Intelligibility Assessment of Dysarthric Speech
par: Yeo, Eunjung, et autres
Publié: (2025) -
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2024)