Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Brian, Pratap, Vineel, Watanabe, Shinji, Auli, Michael |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
par: Yong, Zheng-Xin, et autres
Publié: (2025)
par: Yong, Zheng-Xin, et autres
Publié: (2025)
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023)
par: Arora, Siddhant, et autres
Publié: (2023)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
par: Wang, Qingzheng, et autres
Publié: (2025)
par: Wang, Qingzheng, et autres
Publié: (2025)
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
par: Shakeel, Muhammad, et autres
Publié: (2025)
par: Shakeel, Muhammad, et autres
Publié: (2025)
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
par: Shakeel, Muhammad, et autres
Publié: (2026)
par: Shakeel, Muhammad, et autres
Publié: (2026)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
Causal Structure Discovery for Error Diagnostics of Children's ASR
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
par: Singh, Vishwanath Pratap, et autres
Publié: (2025)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
Advocating Character Error Rate for Multilingual ASR Evaluation
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
EFFUSE: Efficient Self-Supervised Feature Fusion for E2E ASR in Low Resource and Multilingual Scenarios
par: Srivastava, Tejes, et autres
Publié: (2023)
par: Srivastava, Tejes, et autres
Publié: (2023)
Joint Beam Search Integrating CTC, Attention, and Transducer Decoders
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration
par: Lee, Sangmin, et autres
Publié: (2024)
par: Lee, Sangmin, et autres
Publié: (2024)
Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
par: Huang, W. Ronny, et autres
Publié: (2024)
par: Huang, W. Ronny, et autres
Publié: (2024)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
par: Xu, Tianyi, et autres
Publié: (2024)
par: Xu, Tianyi, et autres
Publié: (2024)
Anatomy of Industrial Scale Multilingual ASR
par: Ramirez, Francis McCann, et autres
Publié: (2024)
par: Ramirez, Francis McCann, et autres
Publié: (2024)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
par: Zheng, Yuang, et autres
Publié: (2026)
par: Zheng, Yuang, et autres
Publié: (2026)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
par: Chen, Guoguo, et autres
Publié: (2021)
par: Chen, Guoguo, et autres
Publié: (2021)
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
BLR-MoE: Boosted Language-Routing Mixture of Experts for Domain-Robust Multilingual E2E ASR
par: Ma, Guodong, et autres
Publié: (2025)
par: Ma, Guodong, et autres
Publié: (2025)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning
par: Peng, Yifan, et autres
Publié: (2025)
par: Peng, Yifan, et autres
Publié: (2025)
The Sound of Healthcare: Improving Medical Transcription ASR Accuracy with Large Language Models
par: Adedeji, Ayo, et autres
Publié: (2024)
par: Adedeji, Ayo, et autres
Publié: (2024)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
CS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset
par: Yan, Brian, et autres
Publié: (2025)
par: Yan, Brian, et autres
Publié: (2025)
Efficient Adaptation of Multilingual Models for Japanese ASR
par: Bajo, Mark, et autres
Publié: (2024)
par: Bajo, Mark, et autres
Publié: (2024)
The Multicultural Medical Assistant: Can LLMs Improve Medical ASR Errors Across Borders?
par: Adedeji, Ayo, et autres
Publié: (2025)
par: Adedeji, Ayo, et autres
Publié: (2025)
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
par: Wang, Zilai, et autres
Publié: (2026)
par: Wang, Zilai, et autres
Publié: (2026)
Are Transformers in Pre-trained LM A Good ASR Encoder? An Empirical Study
par: An, Keyu, et autres
Publié: (2024)
par: An, Keyu, et autres
Publié: (2024)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024)
par: Gündüz, Ahmet, et autres
Publié: (2024)
Boosting CTC-Based ASR Using LLM-Based Intermediate Loss Regularization
par: Altinok, Duygu
Publié: (2025)
par: Altinok, Duygu
Publié: (2025)
Documents similaires
-
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
par: Yong, Zheng-Xin, et autres
Publié: (2025) -
Semi-Autoregressive Streaming ASR With Label Context
par: Arora, Siddhant, et autres
Publié: (2023) -
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
par: Wang, Qingzheng, et autres
Publié: (2025) -
Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder
par: Shakeel, Muhammad, et autres
Publié: (2025) -
Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting
par: Kashiwagi, Yosuke, et autres
Publié: (2024)