Sequential Editing for Lifelong Training of Speech Recognition Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kulshreshtha, Devang, Dingliwal, Saket, Houston, Brady, Pappas, Nikolaos, Ronanki, Srikanth |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
par: Peri, Raghuveer, et autres
Publié: (2024)
par: Peri, Raghuveer, et autres
Publié: (2024)
SpeechVerse: A Large-scale Generalizable Audio Language Model
par: Das, Nilaksh, et autres
Publié: (2024)
par: Das, Nilaksh, et autres
Publié: (2024)
Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control
par: Blatt, Alexander, et autres
Publié: (2024)
par: Blatt, Alexander, et autres
Publié: (2024)
Speech Editing -- a Summary
par: Kässmann, Tobias, et autres
Publié: (2024)
par: Kässmann, Tobias, et autres
Publié: (2024)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)
par: Wang, Haoyu, et autres
Publié: (2022)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
par: Xu, Tianyi, et autres
Publié: (2025)
par: Xu, Tianyi, et autres
Publié: (2025)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
par: Goncalves, Lucas, et autres
Publié: (2024)
par: Goncalves, Lucas, et autres
Publié: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Customizing Speech Recognition Model with Large Language Model Feedback
par: Ling, Shaoshi, et autres
Publié: (2025)
par: Ling, Shaoshi, et autres
Publié: (2025)
From Statistical Methods to Pre-Trained Models; A Survey on Automatic Speech Recognition for Resource Scarce Urdu Language
par: Sharif, Muhammad, et autres
Publié: (2024)
par: Sharif, Muhammad, et autres
Publié: (2024)
Towards Unsupervised Speech Recognition Without Pronunciation Models
par: Ni, Junrui, et autres
Publié: (2024)
par: Ni, Junrui, et autres
Publié: (2024)
Benchmarking Automatic Speech Recognition Models for African Languages
par: Nahabwe, Alvin, et autres
Publié: (2025)
par: Nahabwe, Alvin, et autres
Publié: (2025)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
par: Adila, Aulia, et autres
Publié: (2024)
par: Adila, Aulia, et autres
Publié: (2024)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
par: Naouara, Hedi, et autres
Publié: (2025)
par: Naouara, Hedi, et autres
Publié: (2025)
Automatic Speech Recognition for Hindi
par: Saha, Anish, et autres
Publié: (2024)
par: Saha, Anish, et autres
Publié: (2024)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
par: Zheng, Zhisheng, et autres
Publié: (2025)
par: Zheng, Zhisheng, et autres
Publié: (2025)
Zero-resource Speech Translation and Recognition with LLMs
par: Mundnich, Karel, et autres
Publié: (2024)
par: Mundnich, Karel, et autres
Publié: (2024)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
OWSM-Biasing: Contextualizing Open Whisper-Style Speech Models for Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models
par: Frieske, Rita, et autres
Publié: (2024)
par: Frieske, Rita, et autres
Publié: (2024)
Vesper: A Compact and Effective Pretrained Model for Speech Emotion Recognition
par: Chen, Weidong, et autres
Publié: (2023)
par: Chen, Weidong, et autres
Publié: (2023)
A Deep Learning Automatic Speech Recognition Model for Shona Language
par: Sirora, Leslie Wellington, et autres
Publié: (2025)
par: Sirora, Leslie Wellington, et autres
Publié: (2025)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
par: Lee, Jeehyun, et autres
Publié: (2024)
par: Lee, Jeehyun, et autres
Publié: (2024)
Swedish Whispers; Leveraging a Massive Speech Corpus for Swedish Speech Recognition
par: Vesterbacka, Leonora, et autres
Publié: (2025)
par: Vesterbacka, Leonora, et autres
Publié: (2025)
Dynamic Data Pruning for Automatic Speech Recognition
par: Xiao, Qiao, et autres
Publié: (2024)
par: Xiao, Qiao, et autres
Publié: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Dialectal Coverage And Generalization in Arabic Speech Recognition
par: Djanibekov, Amirbek, et autres
Publié: (2024)
par: Djanibekov, Amirbek, et autres
Publié: (2024)
Speech Recognition Transformers: Topological-lingualism Perspective
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
par: Tang, Zhiyuan, et autres
Publié: (2024)
par: Tang, Zhiyuan, et autres
Publié: (2024)
On the Contribution of Lexical Features to Speech Emotion Recognition
par: Combei, David
Publié: (2025)
par: Combei, David
Publié: (2025)
Unimodal Aggregation for CTC-based Speech Recognition
par: Fang, Ying, et autres
Publié: (2023)
par: Fang, Ying, et autres
Publié: (2023)
Continual Adaptation for Pacific Indigenous Speech Recognition
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
par: Raja, Vishnu, et autres
Publié: (2025)
par: Raja, Vishnu, et autres
Publié: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
par: Hsu, Ming-Hao, et autres
Publié: (2024)
par: Hsu, Ming-Hao, et autres
Publié: (2024)
Documents similaires
-
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
par: Peri, Raghuveer, et autres
Publié: (2024) -
SpeechVerse: A Large-scale Generalizable Audio Language Model
par: Das, Nilaksh, et autres
Publié: (2024) -
Joint vs Sequential Speaker-Role Detection and Automatic Speech Recognition for Air-traffic Control
par: Blatt, Alexander, et autres
Publié: (2024) -
Speech Editing -- a Summary
par: Kässmann, Tobias, et autres
Publié: (2024) -
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)