Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Ayrapetyan, Alexan, Kostandian, Sofia, Yeroyan, Ara, Yerznkanyan, Mher, Karpov, Nikolay, Tadevosyan, Nune, Lavrukhin, Vitaly, Ginsburg, Boris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unified Semi-Supervised Pipeline for Automatic Speech Recognition
di: Tadevosyan, Nune, et al.
Pubblicazione: (2025)
di: Tadevosyan, Nune, et al.
Pubblicazione: (2025)
Enabling ASR for Low-Resource Languages: A Comprehensive Dataset Creation Approach
di: Yeroyan, Ara, et al.
Pubblicazione: (2024)
di: Yeroyan, Ara, et al.
Pubblicazione: (2024)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
Open Automatic Speech Recognition Models for Classical and Modern Standard Arabic
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree
di: Andrusenko, Andrei, et al.
Pubblicazione: (2025)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2025)
Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator
di: Bataev, Vladimir, et al.
Pubblicazione: (2023)
di: Bataev, Vladimir, et al.
Pubblicazione: (2023)
Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization
di: Andrusenko, Andrei, et al.
Pubblicazione: (2026)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2026)
Granary: Speech Recognition and Translation Dataset in 25 European Languages
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2025)
di: Koluguri, Nithin Rao, et al.
Pubblicazione: (2025)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
Label-Looping: Highly Efficient Decoding for Transducers
di: Bataev, Vladimir, et al.
Pubblicazione: (2024)
di: Bataev, Vladimir, et al.
Pubblicazione: (2024)
Multi-blank Transducers for Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2022)
di: Xu, Hainan, et al.
Pubblicazione: (2022)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
di: Wang, Weiqing, et al.
Pubblicazione: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
EMMeTT: Efficient Multimodal Machine Translation Training
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2024)
di: Xu, Hainan, et al.
Pubblicazione: (2024)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
di: Xie, Xurong, et al.
Pubblicazione: (2022)
di: Xie, Xurong, et al.
Pubblicazione: (2022)
Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
di: Sekoyan, Monica, et al.
Pubblicazione: (2025)
di: Sekoyan, Monica, et al.
Pubblicazione: (2025)
AC-Mix: Self-Supervised Adaptation for Low-Resource Automatic Speech Recognition using Agnostic Contrastive Mixup
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
di: Hu, Ke, et al.
Pubblicazione: (2025)
di: Hu, Ke, et al.
Pubblicazione: (2025)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
di: Hsu, Ming-Hao, et al.
Pubblicazione: (2024)
Weighted Cross-entropy for Low-Resource Languages in Multilingual Speech Recognition
di: Piñeiro-Martín, Andrés, et al.
Pubblicazione: (2024)
di: Piñeiro-Martín, Andrés, et al.
Pubblicazione: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
di: Huang, He, et al.
Pubblicazione: (2024)
di: Huang, He, et al.
Pubblicazione: (2024)
Automatic Speech Recognition for African Low-Resource Languages: Challenges and Future Directions
di: Imam, Sukairaj Hafiz, et al.
Pubblicazione: (2025)
di: Imam, Sukairaj Hafiz, et al.
Pubblicazione: (2025)
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
di: Wang, Jinhan, et al.
Pubblicazione: (2024)
di: Wang, Jinhan, et al.
Pubblicazione: (2024)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
In-Materia Speech Recognition
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
di: Zolfagharinejad, Mohamadreza, et al.
Pubblicazione: (2024)
IITKGP-ABSP Submission to LRE22: Language Recognition in Low-Resource Settings
di: Dey, Spandan, et al.
Pubblicazione: (2025)
di: Dey, Spandan, et al.
Pubblicazione: (2025)
Multimodal Zero-Shot Framework for Deepfake Hate Speech Detection in Low-Resource Languages
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
di: Nasretdinov, Rauf, et al.
Pubblicazione: (2025)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
Speech Emotion Recognition with ASR Integration
di: Li, Yuanchao
Pubblicazione: (2026)
di: Li, Yuanchao
Pubblicazione: (2026)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unified Semi-Supervised Pipeline for Automatic Speech Recognition
di: Tadevosyan, Nune, et al.
Pubblicazione: (2025) -
Enabling ASR for Low-Resource Languages: A Comprehensive Dataset Creation Approach
di: Yeroyan, Ara, et al.
Pubblicazione: (2024) -
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025) -
Open Automatic Speech Recognition Models for Classical and Modern Standard Arabic
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025) -
TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree
di: Andrusenko, Andrei, et al.
Pubblicazione: (2025)