Federated Learning of Large ASR Models in the Real World
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Yonghui, Ding, Yuxin, Ryu, Changwan, Zadrazil, Petr, Beaufays, Francoise |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learn and Don't Forget: Adding a New Language to ASR Foundation Models
par: Qian, Mengjie, et autres
Publié: (2024)
par: Qian, Mengjie, et autres
Publié: (2024)
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
par: Fan, Xulin, et autres
Publié: (2026)
par: Fan, Xulin, et autres
Publié: (2026)
Text-only adaptation in LLM-based ASR through text denoising
par: Carofilis, Andrés, et autres
Publié: (2026)
par: Carofilis, Andrés, et autres
Publié: (2026)
Revisiting ASR Error Correction with Specialized Models
par: Gu, Zijin, et autres
Publié: (2024)
par: Gu, Zijin, et autres
Publié: (2024)
Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping
par: Zhang, Kevin, et autres
Publié: (2024)
par: Zhang, Kevin, et autres
Publié: (2024)
Transformer-based Model for ASR N-Best Rescoring and Rewriting
par: Kang, Iwen E., et autres
Publié: (2024)
par: Kang, Iwen E., et autres
Publié: (2024)
XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese
par: Arisaputra, Panji, et autres
Publié: (2024)
par: Arisaputra, Panji, et autres
Publié: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
par: Ngo, Huong, et autres
Publié: (2025)
par: Ngo, Huong, et autres
Publié: (2025)
Beyond Transcription: Mechanistic Interpretability in ASR
par: Glazer, Neta, et autres
Publié: (2025)
par: Glazer, Neta, et autres
Publié: (2025)
Anatomy of Industrial Scale Multilingual ASR
par: Ramirez, Francis McCann, et autres
Publié: (2024)
par: Ramirez, Francis McCann, et autres
Publié: (2024)
SALSA: Speedy ASR-LLM Synchronous Aggregation
par: Mittal, Ashish, et autres
Publié: (2024)
par: Mittal, Ashish, et autres
Publié: (2024)
Unsupervised ASR via Cross-Lingual Pseudo-Labeling
par: Likhomanenko, Tatiana, et autres
Publié: (2023)
par: Likhomanenko, Tatiana, et autres
Publié: (2023)
Cross-utterance ASR Rescoring with Graph-based Label Propagation
par: Tankasala, Srinath, et autres
Publié: (2023)
par: Tankasala, Srinath, et autres
Publié: (2023)
Unified Learnable 2D Convolutional Feature Extraction for ASR
par: Vieting, Peter, et autres
Publié: (2025)
par: Vieting, Peter, et autres
Publié: (2025)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
par: Bai, Junwen, et autres
Publié: (2024)
par: Bai, Junwen, et autres
Publié: (2024)
Conversational Rubert for Detecting Competitive Interruptions in ASR-Transcribed Dialogues
par: Galimzianov, Dmitrii, et autres
Publié: (2024)
par: Galimzianov, Dmitrii, et autres
Publié: (2024)
Contextualization of ASR with LLM using phonetic retrieval-based augmentation
par: Lei, Zhihong, et autres
Publié: (2024)
par: Lei, Zhihong, et autres
Publié: (2024)
Benchmarking Akan ASR Models Across Domain-Specific Datasets: A Comparative Evaluation of Performance, Scalability, and Adaptability
par: Mensah, Mark Atta, et autres
Publié: (2025)
par: Mensah, Mark Atta, et autres
Publié: (2025)
Dysarthria Normalization via Local Lie Group Transformations for Robust ASR
par: Osipov, Mikhail
Publié: (2025)
par: Osipov, Mikhail
Publié: (2025)
Enhanced ASR Robustness to Packet Loss with a Front-End Adaptation Network
par: Dissen, Yehoshua, et autres
Publié: (2024)
par: Dissen, Yehoshua, et autres
Publié: (2024)
A light-weight and efficient punctuation and word casing prediction model for on-device streaming ASR
par: You, Jian, et autres
Publié: (2024)
par: You, Jian, et autres
Publié: (2024)
Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator
par: Bataev, Vladimir, et autres
Publié: (2023)
par: Bataev, Vladimir, et autres
Publié: (2023)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
par: Yang, Tzu-Ting, et autres
Publié: (2024)
par: Yang, Tzu-Ting, et autres
Publié: (2024)
An ASR-Based Tutor for Learning to Read: How to Optimize Feedback to First Graders
par: Bai, Yu, et autres
Publié: (2023)
par: Bai, Yu, et autres
Publié: (2023)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
Evaluating Standard and Dialectal Frisian ASR: Multilingual Fine-tuning and Language Identification for Improved Low-resource Performance
par: Amooie, Reihaneh, et autres
Publié: (2025)
par: Amooie, Reihaneh, et autres
Publié: (2025)
Exploring Pathological Speech Quality Assessment with ASR-Powered Wav2Vec2 in Data-Scarce Context
par: Nguyen, Tuan, et autres
Publié: (2024)
par: Nguyen, Tuan, et autres
Publié: (2024)
ASR Error Correction using Large Language Models
par: Ma, Rao, et autres
Publié: (2024)
par: Ma, Rao, et autres
Publié: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
Dynamic ASR Pathways: An Adaptive Masking Approach Towards Efficient Pruning of A Multilingual ASR Model
par: Xie, Jiamin, et autres
Publié: (2023)
par: Xie, Jiamin, et autres
Publié: (2023)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024)
par: Gündüz, Ahmet, et autres
Publié: (2024)
Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
par: Adedeji, Ayo, et autres
Publié: (2024)
par: Adedeji, Ayo, et autres
Publié: (2024)
Large Language Model Should Understand Pinyin for Chinese ASR Error Correction
par: Li, Yuang, et autres
Publié: (2024)
par: Li, Yuang, et autres
Publié: (2024)
Towards Supervised Performance on Speaker Verification with Self-Supervised Learning by Leveraging Large-Scale ASR Models
par: Miara, Victor, et autres
Publié: (2024)
par: Miara, Victor, et autres
Publié: (2024)
WhisperKit: On-device Real-time ASR with Billion-Scale Transformers
par: Orhon, Atila, et autres
Publié: (2025)
par: Orhon, Atila, et autres
Publié: (2025)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
par: Carofilis, Andres, et autres
Publié: (2025)
par: Carofilis, Andres, et autres
Publié: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Documents similaires
-
Learn and Don't Forget: Adding a New Language to ASR Foundation Models
par: Qian, Mengjie, et autres
Publié: (2024) -
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
par: Fan, Xulin, et autres
Publié: (2026) -
Text-only adaptation in LLM-based ASR through text denoising
par: Carofilis, Andrés, et autres
Publié: (2026) -
Revisiting ASR Error Correction with Specialized Models
par: Gu, Zijin, et autres
Publié: (2024) -
Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping
par: Zhang, Kevin, et autres
Publié: (2024)