On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures
Fuente:
arXiv
Salvato in:
| Autori principali: | Hilmes, Benedikt, Rossenbach, Nick, Schlüter, and Ralf |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
di: Hilmes, Benedikt, et al.
Pubblicazione: (2025)
di: Hilmes, Benedikt, et al.
Pubblicazione: (2025)
Regularizing Learnable Feature Extraction for Automatic Speech Recognition
di: Vieting, Peter, et al.
Pubblicazione: (2025)
di: Vieting, Peter, et al.
Pubblicazione: (2025)
Unified Learnable 2D Convolutional Feature Extraction for ASR
di: Vieting, Peter, et al.
Pubblicazione: (2025)
di: Vieting, Peter, et al.
Pubblicazione: (2025)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
di: Sasu, David, et al.
Pubblicazione: (2025)
di: Sasu, David, et al.
Pubblicazione: (2025)
Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study
di: Yang, Zijian, et al.
Pubblicazione: (2026)
di: Yang, Zijian, et al.
Pubblicazione: (2026)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2024)
di: Xu, Hainan, et al.
Pubblicazione: (2024)
On the Relation between Internal Language Model and Sequence Discriminative Training for Neural Transducers
di: Yang, Zijian, et al.
Pubblicazione: (2023)
di: Yang, Zijian, et al.
Pubblicazione: (2023)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
di: Ngo, Huong, et al.
Pubblicazione: (2025)
di: Ngo, Huong, et al.
Pubblicazione: (2025)
Task Oriented Dialogue as a Catalyst for Self-Supervised Automatic Speech Recognition
di: Chan, David M., et al.
Pubblicazione: (2024)
di: Chan, David M., et al.
Pubblicazione: (2024)
Clinical BERTScore: An Improved Measure of Automatic Speech Recognition Performance in Clinical Settings
di: Shor, Joel, et al.
Pubblicazione: (2023)
di: Shor, Joel, et al.
Pubblicazione: (2023)
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
di: Su, Hsuan, et al.
Pubblicazione: (2024)
di: Su, Hsuan, et al.
Pubblicazione: (2024)
Combining TF-GridNet and Mixture Encoder for Continuous Speech Separation for Meeting Transcription
di: Vieting, Peter, et al.
Pubblicazione: (2023)
di: Vieting, Peter, et al.
Pubblicazione: (2023)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
Mai Ho'omāuna i ka 'Ai: Language Models Improve Automatic Speech Recognition in Hawaiian
di: Chaparala, Kaavya, et al.
Pubblicazione: (2024)
di: Chaparala, Kaavya, et al.
Pubblicazione: (2024)
Medical Spoken Named Entity Recognition
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
Dynamic Data Pruning for Automatic Speech Recognition
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
Automatic Speech Recognition for Biomedical Data in Bengali Language
di: Kabir, Shariar, et al.
Pubblicazione: (2024)
di: Kabir, Shariar, et al.
Pubblicazione: (2024)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings
di: Ljubešić, Nikola, et al.
Pubblicazione: (2024)
di: Ljubešić, Nikola, et al.
Pubblicazione: (2024)
CIF-T: A Novel CIF-based Transducer Architecture for Automatic Speech Recognition
di: Zhang, Tian-Hao, et al.
Pubblicazione: (2023)
di: Zhang, Tian-Hao, et al.
Pubblicazione: (2023)
Label-Context-Dependent Internal Language Model Estimation for CTC
di: Yang, Zijian, et al.
Pubblicazione: (2025)
di: Yang, Zijian, et al.
Pubblicazione: (2025)
How to Evaluate Automatic Speech Recognition: Comparing Different Performance and Bias Measures
di: Patel, Tanvina, et al.
Pubblicazione: (2025)
di: Patel, Tanvina, et al.
Pubblicazione: (2025)
Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
Automatic Speech Recognition for Hindi
di: Saha, Anish, et al.
Pubblicazione: (2024)
di: Saha, Anish, et al.
Pubblicazione: (2024)
Moonshine: Speech Recognition for Live Transcription and Voice Commands
di: Jeffries, Nat, et al.
Pubblicazione: (2024)
di: Jeffries, Nat, et al.
Pubblicazione: (2024)
Pre-Finetuning for Few-Shot Emotional Speech Recognition
di: Chen, Maximillian, et al.
Pubblicazione: (2023)
di: Chen, Maximillian, et al.
Pubblicazione: (2023)
Examining Test-Time Adaptation for Personalized Child Speech Recognition
di: Shi, Zhonghao, et al.
Pubblicazione: (2024)
di: Shi, Zhonghao, et al.
Pubblicazione: (2024)
Translatotron 3: Speech to Speech Translation with Monolingual Data
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
di: Nachmani, Eliya, et al.
Pubblicazione: (2023)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
di: Sudo, Yui, et al.
Pubblicazione: (2024)
di: Sudo, Yui, et al.
Pubblicazione: (2024)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
di: Naouara, Hedi, et al.
Pubblicazione: (2025)
di: Naouara, Hedi, et al.
Pubblicazione: (2025)
SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition
di: Wang, Pu, et al.
Pubblicazione: (2026)
di: Wang, Pu, et al.
Pubblicazione: (2026)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
Error Analysis in a Modular Meeting Transcription System
di: Vieting, Peter, et al.
Pubblicazione: (2025)
di: Vieting, Peter, et al.
Pubblicazione: (2025)
Keyword-Guided Adaptation of Automatic Speech Recognition
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
Pre-Trained Foundation Model representations to uncover Breathing patterns in Speech
di: Mitra, Vikramjit, et al.
Pubblicazione: (2024)
di: Mitra, Vikramjit, et al.
Pubblicazione: (2024)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024)
di: Shi, Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
di: Rossenbach, Nick, et al.
Pubblicazione: (2024) -
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
di: Hilmes, Benedikt, et al.
Pubblicazione: (2025) -
Regularizing Learnable Feature Extraction for Automatic Speech Recognition
di: Vieting, Peter, et al.
Pubblicazione: (2025) -
Unified Learnable 2D Convolutional Feature Extraction for ASR
di: Vieting, Peter, et al.
Pubblicazione: (2025) -
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
di: Sasu, David, et al.
Pubblicazione: (2025)