Regularizing Learnable Feature Extraction for Automatic Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Vieting, Peter, Kannen, Maximilian, Hilmes, Benedikt, Schlüter, Ralf, Ney, Hermann |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unified Learnable 2D Convolutional Feature Extraction for ASR
di: Vieting, Peter, et al.
Pubblicazione: (2025)
di: Vieting, Peter, et al.
Pubblicazione: (2025)
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures
di: Hilmes, Benedikt, et al.
Pubblicazione: (2024)
di: Hilmes, Benedikt, et al.
Pubblicazione: (2024)
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
di: Hilmes, Benedikt, et al.
Pubblicazione: (2025)
di: Hilmes, Benedikt, et al.
Pubblicazione: (2025)
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023)
Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study
di: Yang, Zijian, et al.
Pubblicazione: (2026)
di: Yang, Zijian, et al.
Pubblicazione: (2026)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
di: Rossenbach, Nick, et al.
Pubblicazione: (2024)
Combining TF-GridNet and Mixture Encoder for Continuous Speech Separation for Meeting Transcription
di: Vieting, Peter, et al.
Pubblicazione: (2023)
di: Vieting, Peter, et al.
Pubblicazione: (2023)
On the Relation between Internal Language Model and Sequence Discriminative Training for Neural Transducers
di: Yang, Zijian, et al.
Pubblicazione: (2023)
di: Yang, Zijian, et al.
Pubblicazione: (2023)
Label-Context-Dependent Internal Language Model Estimation for CTC
di: Yang, Zijian, et al.
Pubblicazione: (2025)
di: Yang, Zijian, et al.
Pubblicazione: (2025)
Error Analysis in a Modular Meeting Transcription System
di: Vieting, Peter, et al.
Pubblicazione: (2025)
di: Vieting, Peter, et al.
Pubblicazione: (2025)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
di: Sasu, David, et al.
Pubblicazione: (2025)
di: Sasu, David, et al.
Pubblicazione: (2025)
The Conformer Encoder May Reverse the Time Dimension
di: Schmitt, Robin, et al.
Pubblicazione: (2024)
di: Schmitt, Robin, et al.
Pubblicazione: (2024)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2024)
di: Xu, Hainan, et al.
Pubblicazione: (2024)
Task Oriented Dialogue as a Catalyst for Self-Supervised Automatic Speech Recognition
di: Chan, David M., et al.
Pubblicazione: (2024)
di: Chan, David M., et al.
Pubblicazione: (2024)
Clinical BERTScore: An Improved Measure of Automatic Speech Recognition Performance in Clinical Settings
di: Shor, Joel, et al.
Pubblicazione: (2023)
di: Shor, Joel, et al.
Pubblicazione: (2023)
The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings
di: Ljubešić, Nikola, et al.
Pubblicazione: (2024)
di: Ljubešić, Nikola, et al.
Pubblicazione: (2024)
Right Label Context in End-to-End Training of Time-Synchronous ASR Models
di: Raissi, Tina, et al.
Pubblicazione: (2025)
di: Raissi, Tina, et al.
Pubblicazione: (2025)
Mai Ho'omāuna i ka 'Ai: Language Models Improve Automatic Speech Recognition in Hawaiian
di: Chaparala, Kaavya, et al.
Pubblicazione: (2024)
di: Chaparala, Kaavya, et al.
Pubblicazione: (2024)
Medical Spoken Named Entity Recognition
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
di: Le-Duc, Khai, et al.
Pubblicazione: (2024)
Speech Robust Bench: A Robustness Benchmark For Speech Recognition
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
di: Shah, Muhammad A., et al.
Pubblicazione: (2024)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2026)
Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
di: Nagpal, Chirag, et al.
Pubblicazione: (2024)
Automatic Speech Recognition for Hindi
di: Saha, Anish, et al.
Pubblicazione: (2024)
di: Saha, Anish, et al.
Pubblicazione: (2024)
Moonshine: Speech Recognition for Live Transcription and Voice Commands
di: Jeffries, Nat, et al.
Pubblicazione: (2024)
di: Jeffries, Nat, et al.
Pubblicazione: (2024)
Pre-Finetuning for Few-Shot Emotional Speech Recognition
di: Chen, Maximillian, et al.
Pubblicazione: (2023)
di: Chen, Maximillian, et al.
Pubblicazione: (2023)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
di: Fujita, Kenichi, et al.
Pubblicazione: (2024)
Benchmarking Automatic Speech Recognition Models for African Languages
di: Nahabwe, Alvin, et al.
Pubblicazione: (2025)
di: Nahabwe, Alvin, et al.
Pubblicazione: (2025)
Examining Test-Time Adaptation for Personalized Child Speech Recognition
di: Shi, Zhonghao, et al.
Pubblicazione: (2024)
di: Shi, Zhonghao, et al.
Pubblicazione: (2024)
Disentangling Textual and Acoustic Features of Neural Speech Representations
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
di: Mohebbi, Hosein, et al.
Pubblicazione: (2024)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
di: Rufai, Amina Mardiyyah, et al.
Pubblicazione: (2020)
Dynamic Data Pruning for Automatic Speech Recognition
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
di: Xiao, Qiao, et al.
Pubblicazione: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
di: Sudo, Yui, et al.
Pubblicazione: (2024)
di: Sudo, Yui, et al.
Pubblicazione: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
di: Ngo, Huong, et al.
Pubblicazione: (2025)
di: Ngo, Huong, et al.
Pubblicazione: (2025)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
di: Puvvada, Krishna C., et al.
Pubblicazione: (2024)
SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition
di: Wang, Pu, et al.
Pubblicazione: (2026)
di: Wang, Pu, et al.
Pubblicazione: (2026)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
di: Su, Hsuan, et al.
Pubblicazione: (2024)
di: Su, Hsuan, et al.
Pubblicazione: (2024)
Keyword-Guided Adaptation of Automatic Speech Recognition
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
di: Shamsian, Aviv, et al.
Pubblicazione: (2024)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024)
di: Shi, Hao, et al.
Pubblicazione: (2024)
Exploring Gender Disparities in Automatic Speech Recognition Technology
di: ElGhazaly, Hend, et al.
Pubblicazione: (2025)
di: ElGhazaly, Hend, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unified Learnable 2D Convolutional Feature Extraction for ASR
di: Vieting, Peter, et al.
Pubblicazione: (2025) -
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures
di: Hilmes, Benedikt, et al.
Pubblicazione: (2024) -
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
di: Hilmes, Benedikt, et al.
Pubblicazione: (2025) -
Chunked Attention-based Encoder-Decoder Model for Streaming Speech Recognition
di: Zeineldeen, Mohammad, et al.
Pubblicazione: (2023) -
Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical Study
di: Yang, Zijian, et al.
Pubblicazione: (2026)