Romanization Encoding For Multilingual ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Wen, Jia, Fei, Xu, Hainan, Xi, Yu, Lai, Junjie, Ginsburg, Boris |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
Exploring SSL Discrete Tokens for Multilingual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Configurable Multilingual ASR with Speech Summary Representations
par: Zhu, Harrison, et autres
Publié: (2024)
par: Zhu, Harrison, et autres
Publié: (2024)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
par: Li, Jiahong, et autres
Publié: (2025)
par: Li, Jiahong, et autres
Publié: (2025)
Advocating Character Error Rate for Multilingual ASR Evaluation
par: K, Thennal D, et autres
Publié: (2024)
par: K, Thennal D, et autres
Publié: (2024)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
par: Xu, Tianyi, et autres
Publié: (2024)
par: Xu, Tianyi, et autres
Publié: (2024)
Multi-blank Transducers for Speech Recognition
par: Xu, Hainan, et autres
Publié: (2022)
par: Xu, Hainan, et autres
Publié: (2022)
TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree
par: Andrusenko, Andrei, et autres
Publié: (2025)
par: Andrusenko, Andrei, et autres
Publié: (2025)
Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator
par: Bataev, Vladimir, et autres
Publié: (2023)
par: Bataev, Vladimir, et autres
Publié: (2023)
A Language-Agnostic Hierarchical LoRA-MoE Architecture for CTC-based Multilingual ASR
par: Zheng, Yuang, et autres
Publié: (2026)
par: Zheng, Yuang, et autres
Publié: (2026)
Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
par: Huang, W. Ronny, et autres
Publié: (2024)
par: Huang, W. Ronny, et autres
Publié: (2024)
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
par: Yan, Brian, et autres
Publié: (2024)
par: Yan, Brian, et autres
Publié: (2024)
Qwen3-ASR Technical Report
par: Shi, Xian, et autres
Publié: (2026)
par: Shi, Xian, et autres
Publié: (2026)
Label-Looping: Highly Efficient Decoding for Transducers
par: Bataev, Vladimir, et autres
Publié: (2024)
par: Bataev, Vladimir, et autres
Publié: (2024)
Crossmodal ASR Error Correction with Discrete Speech Units
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration
par: Lee, Sangmin, et autres
Publié: (2024)
par: Lee, Sangmin, et autres
Publié: (2024)
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
Anatomy of Industrial Scale Multilingual ASR
par: Ramirez, Francis McCann, et autres
Publié: (2024)
par: Ramirez, Francis McCann, et autres
Publié: (2024)
BLR-MoE: Boosted Language-Routing Mixture of Experts for Domain-Robust Multilingual E2E ASR
par: Ma, Guodong, et autres
Publié: (2025)
par: Ma, Guodong, et autres
Publié: (2025)
Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
par: Cheng, Yao-Fei, et autres
Publié: (2024)
par: Cheng, Yao-Fei, et autres
Publié: (2024)
Efficient Adaptation of Multilingual Models for Japanese ASR
par: Bajo, Mark, et autres
Publié: (2024)
par: Bajo, Mark, et autres
Publié: (2024)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
par: Chen, Qian, et autres
Publié: (2023)
par: Chen, Qian, et autres
Publié: (2023)
AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
par: Gündüz, Ahmet, et autres
Publié: (2024)
par: Gündüz, Ahmet, et autres
Publié: (2024)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
EMMeTT: Efficient Multimodal Machine Translation Training
par: Żelasko, Piotr, et autres
Publié: (2024)
par: Żelasko, Piotr, et autres
Publié: (2024)
Multilingual Source Tracing of Speech Deepfakes: A First Benchmark
par: Xuan, Xi, et autres
Publié: (2025)
par: Xuan, Xi, et autres
Publié: (2025)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024)
par: Andrusenko, Andrei, et autres
Publié: (2024)
Promptformer: Prompted Conformer Transducer for ASR
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
par: Duarte-Torres, Sergio, et autres
Publié: (2024)
Revisiting Acoustic Features for Robust ASR
par: Shah, Muhammad A., et autres
Publié: (2024)
par: Shah, Muhammad A., et autres
Publié: (2024)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
par: Bai, Junwen, et autres
Publié: (2024)
par: Bai, Junwen, et autres
Publié: (2024)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages
par: Ayrapetyan, Alexan, et autres
Publié: (2025)
par: Ayrapetyan, Alexan, et autres
Publié: (2025)
SSCFormer: Push the Limit of Chunk-wise Conformer for Streaming ASR Using Sequentially Sampled Chunks and Chunked Causal Convolution
par: Wang, Fangyuan, et autres
Publié: (2022)
par: Wang, Fangyuan, et autres
Publié: (2022)
ManWav: The First Manchu ASR Model
par: Seo, Jean, et autres
Publié: (2024)
par: Seo, Jean, et autres
Publié: (2024)
Documents similaires
-
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024) -
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
par: Grigoryan, Lilit, et autres
Publié: (2025) -
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
par: Hu, Ke, et autres
Publié: (2025) -
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024) -
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)