Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Özyilmaz, Ömer Tarik, Coler, Matt, Valdenegro-Toro, Matias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating Standard and Dialectal Frisian ASR: Multilingual Fine-tuning and Language Identification for Improved Low-resource Performance
di: Amooie, Reihaneh, et al.
Pubblicazione: (2025)
di: Amooie, Reihaneh, et al.
Pubblicazione: (2025)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024)
Hybrid Deep Learning and Signal Processing for Arabic Dialect Recognition in Low-Resource Settings
di: Al-Shwayyat, Ghazal, et al.
Pubblicazione: (2025)
di: Al-Shwayyat, Ghazal, et al.
Pubblicazione: (2025)
Extending Whisper with prompt tuning to target-speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2023)
di: Ma, Hao, et al.
Pubblicazione: (2023)
Dialectal Coverage And Generalization in Arabic Speech Recognition
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
di: Doan, Khai Duy, et al.
Pubblicazione: (2024)
di: Doan, Khai Duy, et al.
Pubblicazione: (2024)
Quantizing Whisper-small: How design choices affect ASR performance
di: Söhler, Arthur, et al.
Pubblicazione: (2025)
di: Söhler, Arthur, et al.
Pubblicazione: (2025)
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
di: Orhon, Atila, et al.
Pubblicazione: (2025)
di: Orhon, Atila, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
A Functional Trade-off between Prosodic and Semantic Cues in Conveying Sarcasm
di: Li, Zhu, et al.
Pubblicazione: (2024)
di: Li, Zhu, et al.
Pubblicazione: (2024)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
di: Mdhaffar, Salima, et al.
Pubblicazione: (2024)
di: Mdhaffar, Salima, et al.
Pubblicazione: (2024)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
di: Chen, Yushen, et al.
Pubblicazione: (2026)
di: Chen, Yushen, et al.
Pubblicazione: (2026)
Effective Text Adaptation for LLM-based ASR through Soft Prompt Fine-Tuning
di: Ma, Yingyi, et al.
Pubblicazione: (2024)
di: Ma, Yingyi, et al.
Pubblicazione: (2024)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
di: Xu, Tianyi, et al.
Pubblicazione: (2024)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
di: Naouara, Hedi, et al.
Pubblicazione: (2025)
di: Naouara, Hedi, et al.
Pubblicazione: (2025)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
di: Anidjar, Or Haim, et al.
Pubblicazione: (2024)
di: Anidjar, Or Haim, et al.
Pubblicazione: (2024)
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2025)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2025)
Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
di: Shekoufandeh, Golshid, et al.
Pubblicazione: (2025)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
di: Yamauchi, Kazuki, et al.
Pubblicazione: (2024)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning
di: Peng, Yifan, et al.
Pubblicazione: (2025)
di: Peng, Yifan, et al.
Pubblicazione: (2025)
Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech Models via Language-Specific Experts
di: Ferraz, Thomas Palmeira, et al.
Pubblicazione: (2023)
di: Ferraz, Thomas Palmeira, et al.
Pubblicazione: (2023)
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
Efficient Data Selection for Domain Adaptation of ASR Using Pseudo-Labels and Multi-Stage Filtering
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
di: Rangappa, Pradeep, et al.
Pubblicazione: (2025)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
di: Kocour, Martin, et al.
Pubblicazione: (2025)
di: Kocour, Martin, et al.
Pubblicazione: (2025)
PromptASR for contextualized ASR with controllable style
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2025)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
di: Liang, Siyu, et al.
Pubblicazione: (2025)
di: Liang, Siyu, et al.
Pubblicazione: (2025)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
di: Ngo, Huong, et al.
Pubblicazione: (2025)
di: Ngo, Huong, et al.
Pubblicazione: (2025)
Alignment-Free Training for Transducer-based Multi-Talker ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
di: Cheng, Yao-Fei, et al.
Pubblicazione: (2024)
di: Cheng, Yao-Fei, et al.
Pubblicazione: (2024)
Transfer Learning from Whisper for Microscopic Intelligibility Prediction
di: Best, Paul, et al.
Pubblicazione: (2024)
di: Best, Paul, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Evaluating Standard and Dialectal Frisian ASR: Multilingual Fine-tuning and Language Identification for Improved Low-resource Performance
di: Amooie, Reihaneh, et al.
Pubblicazione: (2025) -
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
di: Thorbecke, Iuliia, et al.
Pubblicazione: (2024) -
Hybrid Deep Learning and Signal Processing for Arabic Dialect Recognition in Low-Resource Settings
di: Al-Shwayyat, Ghazal, et al.
Pubblicazione: (2025) -
Extending Whisper with prompt tuning to target-speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2023) -
Dialectal Coverage And Generalization in Arabic Speech Recognition
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)