AutoMode-ASR: Learning to Select ASR Systems for Better Quality and Cost
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gündüz, Ahmet, Kim, Yunsu, Yuksel, Kamer Ali, Al-Badrashiny, Mohamed, Ferreira, Thiago Castro, Sawaf, Hassan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Word-Level ASR Quality Estimation for Efficient Corpus Sampling and Post-Editing through Analyzing Attentions of a Reference-Free Metric
par: Javadi, Golara, et autres
Publié: (2024)
par: Javadi, Golara, et autres
Publié: (2024)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025)
par: Song, Zheshu, et autres
Publié: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
Investigating the Effect of Label Topology and Training Criterion on ASR Performance and Alignment Quality
par: Raissi, Tina, et autres
Publié: (2024)
par: Raissi, Tina, et autres
Publié: (2024)
PromptASR for contextualized ASR with controllable style
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
DITTO: Data-efficient and Fair Targeted Subset Selection for ASR Accent Adaptation
par: Kothawade, Suraj, et autres
Publié: (2021)
par: Kothawade, Suraj, et autres
Publié: (2021)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
par: Wu, Minghui, et autres
Publié: (2024)
par: Wu, Minghui, et autres
Publié: (2024)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
persoDA: Personalized Data Augmentation for Personalized ASR
par: Parada, Pablo Peso, et autres
Publié: (2025)
par: Parada, Pablo Peso, et autres
Publié: (2025)
Speaker Adaptation for Quantised End-to-End ASR Models
par: Zhao, Qiuming, et autres
Publié: (2024)
par: Zhao, Qiuming, et autres
Publié: (2024)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2024)
par: Salvi, Davide, et autres
Publié: (2024)
Consistency Based Unsupervised Self-training For ASR Personalisation
par: Zhang, Jisi, et autres
Publié: (2024)
par: Zhang, Jisi, et autres
Publié: (2024)
MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
par: Nguyen, Thai-Binh, et autres
Publié: (2024)
Joint ASR and Speaker Role Tagging with Serialized Output Training
par: Xu, Anfeng, et autres
Publié: (2025)
par: Xu, Anfeng, et autres
Publié: (2025)
Learning When to Trust Which Teacher for Weakly Supervised ASR
par: Agrawal, Aakriti, et autres
Publié: (2023)
par: Agrawal, Aakriti, et autres
Publié: (2023)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
par: He, Xiluo, et autres
Publié: (2025)
par: He, Xiluo, et autres
Publié: (2025)
Technical Report: A Practical Guide to Kaldi ASR Optimization
par: Hong, Mengze, et autres
Publié: (2025)
par: Hong, Mengze, et autres
Publié: (2025)
Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
par: Tabib, H. M. Shadman, et autres
Publié: (2026)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
par: Mujtaba, Dena, et autres
Publié: (2025)
par: Mujtaba, Dena, et autres
Publié: (2025)
Lightweight Target-Speaker-Based Overlap Transcription for Practical Streaming ASR
par: Pražák, Aleš, et autres
Publié: (2025)
par: Pražák, Aleš, et autres
Publié: (2025)
Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR
par: Yang, Yufeng, et autres
Publié: (2024)
par: Yang, Yufeng, et autres
Publié: (2024)
Complexity boosted adaptive training for better low resource ASR performance
par: Lu, Hongxuan, et autres
Publié: (2024)
par: Lu, Hongxuan, et autres
Publié: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025)
par: Wang, Weiqing, et autres
Publié: (2025)
Efficient Rehearsal for Continual Learning in ASR via Singular Value Tuning
par: Eeckt, Steven Vander, et autres
Publié: (2026)
par: Eeckt, Steven Vander, et autres
Publié: (2026)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024)
par: Zhao, Wenbo, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
Speech Diarization and ASR with GMM
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
par: Sharma, Aayush Kumar, et autres
Publié: (2023)
VIBEVOICE-ASR Technical Report
par: Peng, Zhiliang, et autres
Publié: (2026)
par: Peng, Zhiliang, et autres
Publié: (2026)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
par: Xie, Yuan, et autres
Publié: (2026)
par: Xie, Yuan, et autres
Publié: (2026)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
par: Gong, Xun, et autres
Publié: (2025)
par: Gong, Xun, et autres
Publié: (2025)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
par: Carofilis, Andres, et autres
Publié: (2025)
par: Carofilis, Andres, et autres
Publié: (2025)
Documents similaires
-
Word-Level ASR Quality Estimation for Efficient Corpus Sampling and Post-Editing through Analyzing Attentions of a Reference-Free Metric
par: Javadi, Golara, et autres
Publié: (2024) -
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
par: Xue, Hongfei, et autres
Publié: (2025) -
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024) -
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025) -
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)