Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ridoy, Md Sazzadul Islam, Akter, Sumi, Rahman, Md. Aminur |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2026)
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2026)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
par: Anidjar, Or Haim, et autres
Publié: (2024)
par: Anidjar, Or Haim, et autres
Publié: (2024)
Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition
par: Kounadis-Bastian, Dionyssos, et autres
Publié: (2024)
par: Kounadis-Bastian, Dionyssos, et autres
Publié: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
par: Song, Zheshu, et autres
Publié: (2024)
par: Song, Zheshu, et autres
Publié: (2024)
ManWav: The First Manchu ASR Model
par: Seo, Jean, et autres
Publié: (2024)
par: Seo, Jean, et autres
Publié: (2024)
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
Exploring ASR-Based Wav2Vec2 for Automated Speech Disorder Assessment: Insights and Analysis
par: Nguyen, Tuan, et autres
Publié: (2024)
par: Nguyen, Tuan, et autres
Publié: (2024)
Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
par: Bhuiyan, Mohammed Aman, et autres
Publié: (2026)
par: Bhuiyan, Mohammed Aman, et autres
Publié: (2026)
Exploring Pathological Speech Quality Assessment with ASR-Powered Wav2Vec2 in Data-Scarce Context
par: Nguyen, Tuan, et autres
Publié: (2024)
par: Nguyen, Tuan, et autres
Publié: (2024)
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning
par: Abdullah, Abdulhady Abas, et autres
Publié: (2025)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2025)
Extending Whisper with prompt tuning to target-speaker ASR
par: Ma, Hao, et autres
Publié: (2023)
par: Ma, Hao, et autres
Publié: (2023)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
par: Xu, Tianyi, et autres
Publié: (2024)
par: Xu, Tianyi, et autres
Publié: (2024)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Evaluating the Effectiveness of Transformer Layers in Wav2Vec 2.0, XLS-R, and Whisper for Speaker Identification Tasks
par: Stuhlmann, Linus, et autres
Publié: (2025)
par: Stuhlmann, Linus, et autres
Publié: (2025)
Fast Streaming Transducer ASR Prototyping via Knowledge Distillation with Whisper
par: Thorbecke, Iuliia, et autres
Publié: (2024)
par: Thorbecke, Iuliia, et autres
Publié: (2024)
Quantizing Whisper-small: How design choices affect ASR performance
par: Söhler, Arthur, et autres
Publié: (2025)
par: Söhler, Arthur, et autres
Publié: (2025)
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
par: Orhon, Atila, et autres
Publié: (2025)
par: Orhon, Atila, et autres
Publié: (2025)
Empowering Low-Resource Language ASR via Large-Scale Pseudo Labeling
par: Bhogale, Kaushal Santosh, et autres
Publié: (2024)
par: Bhogale, Kaushal Santosh, et autres
Publié: (2024)
Causal Structure Discovery for Error Diagnostics of Children's ASR
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
Quality of Automatic Speech Recognition -- Polish Language case study -- from Wav2Vec to Scribe ElevenLabs
par: Pietroń, Marcin, et autres
Publié: (2026)
par: Pietroń, Marcin, et autres
Publié: (2026)
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages
par: Liang, Siyu, et autres
Publié: (2025)
par: Liang, Siyu, et autres
Publié: (2025)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
par: Li, Chin-Jou, et autres
Publié: (2025)
par: Li, Chin-Jou, et autres
Publié: (2025)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
par: Guo, Pengcheng, et autres
Publié: (2024)
par: Guo, Pengcheng, et autres
Publié: (2024)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
par: Mdhaffar, Salima, et autres
Publié: (2024)
par: Mdhaffar, Salima, et autres
Publié: (2024)
WavMark: Watermarking for Audio Generation
par: Chen, Guangyu, et autres
Publié: (2023)
par: Chen, Guangyu, et autres
Publié: (2023)
IITKGP-ABSP Submission to LRE22: Language Recognition in Low-Resource Settings
par: Dey, Spandan, et autres
Publié: (2025)
par: Dey, Spandan, et autres
Publié: (2025)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
par: Cheng, Yao-Fei, et autres
Publié: (2024)
par: Cheng, Yao-Fei, et autres
Publié: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)
par: Nie, Yuting, et autres
Publié: (2022)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
par: Yong, Zheng-Xin, et autres
Publié: (2025)
par: Yong, Zheng-Xin, et autres
Publié: (2025)
Human-like Linguistic Biases in Neural Speech Models: Phonetic Categorization and Phonotactic Constraints in Wav2Vec2.0
par: Kloots, Marianne de Heer, et autres
Publié: (2024)
par: Kloots, Marianne de Heer, et autres
Publié: (2024)
Simul-Whisper: Attention-Guided Streaming Whisper with Truncation Detection
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
BrainWhisperer: Leveraging Large-Scale ASR Models for Neural Speech Decoding
par: Boccato, Tommaso, et autres
Publié: (2026)
par: Boccato, Tommaso, et autres
Publié: (2026)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
Benchmarking Akan ASR Models Across Domain-Specific Datasets: A Comparative Evaluation of Performance, Scalability, and Adaptability
par: Mensah, Mark Atta, et autres
Publié: (2025)
par: Mensah, Mark Atta, et autres
Publié: (2025)
Locality enhanced dynamic biasing and sampling strategies for contextual ASR
par: Jalal, Md Asif, et autres
Publié: (2024)
par: Jalal, Md Asif, et autres
Publié: (2024)
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
par: Zhang, Li, et autres
Publié: (2024)
par: Zhang, Li, et autres
Publié: (2024)
Over-the-air White-box Attack on the Wav2Vec Speech Recognition Neural Network
par: Alexey, Protopopov
Publié: (2026)
par: Alexey, Protopopov
Publié: (2026)
Documents similaires
-
BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2026) -
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
par: Anidjar, Or Haim, et autres
Publié: (2024) -
Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition
par: Kounadis-Bastian, Dionyssos, et autres
Publié: (2024) -
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
par: Song, Zheshu, et autres
Publié: (2024) -
ManWav: The First Manchu ASR Model
par: Seo, Jean, et autres
Publié: (2024)